29 de setembro de 2026
Sentimento em Big Data como Indicador do Comportamento do Mercado Financeiro
Sentimento em Big Data como Indicador do Comportamento do Mercado Financeiro
Amanda Panico Gasperini; Julio Cesar Ruivo Costa
DOI: 10.22167/2675-6528-202602629
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
A relação entre o noticiário financeiro e o comportamento dos ativos foi investigada no contexto brasileiro durante um período de alta volatilidade. O estudo analisou se o sentimento presente em manchetes de notícias, coletadas entre 2020 e 2024, esteve associado às oscilações diárias do IBOVESPA, do S&P 500 e de três ações da B3. Para isso, coletaram-se 675 manchetes pelo serviço RSS do Google News, classificadas por polaridade emocional utilizando um léxico financeiro customizado para o português, desenvolvido após modelos BERT generalistas apresentarem erros sistemáticos. Os escores de sentimento foram cruzados com os retornos de mercado do Yahoo Finance, gerando 394 observações válidas. A correlação de Pearson revelou associação positiva e significativa entre o sentimento e o retorno do IBOVESPA (r = 0,13; p = 0,013) e da PETR4 (r = 0,10; p = 0,041). A análise com defasagem de um a três dias não indicou poder preditivo do sentimento sobre os pregões seguintes, resultado coerente com a Hipótese dos Mercados Semi-Eficientes. Os achados indicaram que manchetes e preços dos ativos se movem de forma conjunta em resposta aos mesmos eventos, e que modelos de linguagem generalistas são insuficientes para capturar o vocabulário específico das notícias financeiras em português. A principal contribuição do trabalho foi a construção do léxico financeiro customizado, evidenciando a necessidade de ferramentas específicas para o idioma e domínio. O sentimento midiático funciona como um termômetro do presente, não como ferramenta preditiva.
Palavras-chave: COVID-19; Finanças comportamentais; IBOVESPA; Processamento de linguagem natural; Sentimento midiático.
1. Introdução
A teoria econômica clássica, formalizada pela Hipótese dos Mercados Eficientes de Fama (1970), postula que os preços dos ativos financeiros refletem todas as informações publicamente disponíveis. Na sua versão semiforte, essa hipótese sugere que a análise de notícias divulgadas não confere vantagem informacional, pois seu conteúdo já estaria incorporado nos preços.
Contudo, eventos como a queda do IBOVESPA em 14,78% em março de 2020, coincidindo com o pico da cobertura jornalística sobre a pandemia, desafiam essa premissa. Modelos baseados exclusivamente em fundamentos econômicos não previram tal movimento. Surge então a questão sobre a existência de uma relação mensurável entre o tom da mídia e o comportamento dos ativos, e em que condições essa relação se manifesta.
Este questionamento se alinha às finanças comportamentais, que documentam como emoções e atalhos cognitivos podem distorcer decisões de investimento (Kahneman, 2012; Shiller, 2014; Mosca, 2009). Paralelamente, o Processamento de Linguagem Natural (PLN) oferece ferramentas para extrair automaticamente informações semânticas de textos jornalísticos em larga escala (Bird, Klein, Loper, 2009). A análise de sentimento baseada em léxico, uma modalidade de mineração de texto não supervisionada, foi a solução empregada neste trabalho para classificar manchetes financeiras.
A integração entre finanças comportamentais e PLN possui precedentes internacionais, como o estudo de Tetlock (2007), que associou o pessimismo em colunas jornalísticas a quedas no mercado americano. No Brasil, Improta (2023) testou a incorporação de sentimento em modelos de previsão de séries temporais financeiras, com resultados inconclusivos que evidenciam a complexidade de combinar dados textuais e financeiros no mercado nacional. A produção acadêmica brasileira que cruza PLN com o mercado financeiro, especialmente em cenários de crise, ainda é limitada.
O período de 2020 a 2024, marcado pela pandemia de COVID-19, representou um contexto de volume excepcional de notícias e volatilidade histórica, oferecendo uma oportunidade única para investigar essa relação com dados reais. Diante deste cenário, este trabalho teve como objetivo verificar se o sentimento de manchetes coletadas entre 2020 e 2024 se associou às oscilações diárias do IBOVESPA e do S&P 500, buscando especificamente organizar uma base de manchetes com datas identificadas, desenvolver um método de classificação adequado ao vocabulário financeiro em português, testar a correlação entre sentimento e retornos, verificar se o sentimento de um dia antecipa o pregão seguinte e comparar o comportamento dessa relação nos diferentes momentos do ciclo pandêmico.
2. Material e Métodos
A pesquisa caracterizou-se como um estudo quantitativo e correlacional, com o objetivo de investigar a associação entre o sentimento expresso em manchetes de notícias financeiras e as oscilações diárias de ativos do mercado. A abordagem metodológica envolveu a coleta de dados textuais e financeiros, o desenvolvimento de um léxico de sentimento customizado para o português e a aplicação de técnicas estatísticas para analisar as relações temporais e contemporâneas entre as variáveis.
A unidade de análise consistiu em manchetes de notícias financeiras e dados de preços de ativos. A coleta de manchetes foi realizada entre janeiro de 2020 e dezembro de 2024, utilizando o serviço RSS do Google News. Treze consultas específicas, com termos relacionados ao mercado financeiro brasileiro, IBOVESPA, S&P 500 e à pandemia de COVID-19, foram empregadas para reunir os títulos. Após a remoção de duplicatas e filtragem por período, obteve-se uma base de 675 manchetes válidas, cada uma com seu título e data de publicação.
Para os dados de mercado, utilizou-se a API pública do Yahoo Finance, por meio da biblioteca yfinance em Python. Foram baixados os preços de fechamento ajustado do IBOVESPA (^BVSP), do S&P 500 (^GSPC), da VALE3.SA, da PETR4.SA e da B3SA3.SA, abrangendo o mesmo período das manchetes. A seleção desses ativos visou representar o índice amplo da bolsa brasileira, setores distintos da economia nacional e o principal índice americano de referência, permitindo capturar a dinâmica do mercado doméstico e um benchmark global.
Antes da classificação do sentimento, as manchetes passaram por um processo de pré-processamento textual em quatro etapas. Primeiramente, removeu-se o nome do veículo jornalístico. Em seguida, eliminaram-se caracteres HTML residuais e URLs. Por fim, normalizaram-se espaços múltiplos. Acentos e caracteres especiais do português foram preservados para não comprometer a identificação de termos financeiros específicos. Manchetes com menos de quatro palavras após a limpeza foram descartadas.
A classificação de sentimento foi uma etapa técnica central. Inicialmente, testaram-se modelos de linguagem pré-treinados baseados na arquitetura BERT (Devlin et al., 2019), especificamente o nlptown/bert-base-multilingual-uncased-sentiment e o Ixyuan/distilbert-base-multilingual-cased-sentiments-student. Contudo, ambos os modelos apresentaram erros sistemáticos ao classificar manchetes financeiras em português, como categorizar “Ibovespa sobe 5% com otimismo sobre vacinas” como negativa ou “Circuit breaker é acionado pela terceira vez” como positiva.
Esses erros decorreram do treinamento dos modelos em domínios generalistas, como avaliações de consumidores e redes sociais, onde o vocabulário financeiro possui significados distintos. O modelo BERTimbau (Souza et al., 2020), embora treinado para português brasileiro, não possuía ajuste fino em um corpus financeiro específico, o que manteria o problema. Diante disso, optou-se pela construção de um léxico financeiro customizado para o contexto brasileiro, seguindo a abordagem de análise de sentimento baseada em dicionário (Tetlock, 2007).
O léxico customizado foi desenvolvido com validação manual de cada termo. O conjunto de termos negativos incluiu palavras como “queda”, “crise”, “colapso”, “circuit breaker”, “recessão”, “despenca”, “prejuízo”, “lockdown”, “inadimplência”, “contração” e “volatilidade”. O conjunto positivo reuniu termos como “alta”, “sobe”, “dispara”, “recorde”, “crescimento”, “recuperação”, “otimismo”, “valorização”, “expansão” e “lucro”.
O escore de sentimento para cada manchete foi calculado como a diferença normalizada entre as contagens de termos positivos e negativos presentes no texto, resultando em valores entre -1 e +1. Manchetes sem termos classificáveis receberam escore zero. O léxico classificou 54,2% das 675 manchetes com polaridade diferente de zero. Essa métrica capturou a direção do sentimento, sem inferir sua intensidade, o que seria inviável sem um corpus financeiro anotado em português para validação confiável.
As bases de dados de sentimento e de mercado foram integradas por data. Os escores de sentimento foram agregados por data como a média de todas as manchetes daquele dia. Essa série foi cruzada com a base de mercado por meio de uma junção interna, mantendo apenas os dias em que havia manchetes e pregão aberto simultaneamente. Esse processo resultou em 394 observações válidas com dados completos para análise.
Os retornos diários dos ativos foram calculados como a variação percentual do preço de fechamento em relação ao dia anterior, multiplicada por 100. Essa transformação visou eliminar a tendência de longo prazo das séries de preços absolutos, que poderia inflar artificialmente os coeficientes de correlação. Todas as análises foram implementadas em Python, utilizando as bibliotecas pandas e scipy, no ambiente Google Colaboratory.
Três categorias de análise estatística foram aplicadas. A primeira testou a correlação de Pearson entre o sentimento médio diário e os retornos percentuais de cada ativo, calculando o coeficiente (r) e o p-valor para teste bilateral com nível de significância de 5%. A segunda categoria investigou defasagens de um, dois e três dias úteis, para verificar o poder preditivo do sentimento sobre os pregões seguintes.
A terceira categoria de análise dividiu a amostra em quatro subperíodos: pandemia aguda (2020), recuperação (2021), normalização (2022-2023) e pós-pandemia (2024). Essa divisão permitiu comparar o comportamento da relação entre sentimento e retornos ao longo das diferentes fases do ciclo pandêmico. Adicionalmente, estimou-se um modelo de regressão linear simples, considerando os retornos dos ativos como variável dependente e o sentimento médio diário como variável independente, para complementar a análise de correlação.
3. Resultados e Discussão
A investigação da relação entre o sentimento expresso em manchetes de notícias financeiras e o comportamento dos ativos de mercado, no período de 2020 a 2024, revelou achados importantes sobre a dinâmica informacional no contexto brasileiro. Os resultados indicaram uma associação positiva e significativa entre o sentimento midiático e os retornos do IBOVESPA e da PETR4, mas sem qualquer poder preditivo sobre os pregões futuros. Este estudo também destacou a necessidade de ferramentas de Processamento de Linguagem Natural (PLN) especializadas para o português financeiro, culminando na construção de um léxico customizado, uma contribuição metodológica central para a área.
A análise da base de dados, composta por 675 manchetes coletadas via RSS do Google News, demonstrou uma distribuição temporal que reflete diretamente os eventos históricos do período. Verificou-se que 26,4% das manchetes foram de 2020 e 26,8% de 2021, concentrando o maior volume de cobertura jornalística durante as fases mais intensas da pandemia de COVID-19. Essa concentração não representa um viés amostral, mas sim um espelho da realidade da época, caracterizada por uma intensa produção de notícias e alta volatilidade nos mercados.
Março de 2020, em particular, destacou-se como o mês com a maior densidade de manchetes negativas em toda a série histórica. Esse pico de pessimismo midiático coincidiu com eventos críticos, como as sucessivas ativações de *circuit breaker* na B3 e a declaração oficial da pandemia pela Organização Mundial da Saúde. Os dados de mercado corroboraram essa observação, com a maior queda diária do IBOVESPA, de 14,78%, registrada em 12 de março de 2020, e do S&P 500, de 11,98%, em 16 de março do mesmo ano, ambas alinhadas ao pico de manchetes negativas.
Em relação à classificação de sentimento, o léxico financeiro customizado desenvolvido para este trabalho conseguiu atribuir polaridade não nula a 54,2% das manchetes. Desse total, 29,7% foram classificadas como negativas e 24,5% como positivas. A distribuição do sentimento ao longo do tempo também seguiu a cronologia da pandemia: os meses de março a junho de 2020 apresentaram a maior densidade de manchetes negativas, enquanto o período de outubro de 2020 a março de 2021, marcado pelos primeiros anúncios de eficácia das vacinas, registrou os maiores escores positivos.
A construção do léxico financeiro customizado foi uma etapa crucial, motivada pela inadequação de modelos de linguagem generalistas, como os baseados na arquitetura BERT, para o vocabulário financeiro em português. Testes iniciais com modelos como *nlptown/bert-base-multilingual-uncased-sentiment* e *lxyuan/distilbert-base-multilingual-cased-sentiments-student* demonstraram erros sistemáticos. Por exemplo, a manchete “Ibovespa sobe 5% com otimismo sobre vacinas” foi classificada como negativa por um modelo, e “Circuit breaker é acionado pela terceira vez” como positiva por outro, evidenciando a falha em capturar o significado contextual de termos específicos do mercado financeiro.
Essa limitação dos modelos generalistas decorre do fato de serem treinados em avaliações de consumidores ou comentários de redes sociais, domínios onde a semântica de termos como “circuit breaker” difere drasticamente do contexto financeiro. A ausência de um *corpus* financeiro anotado em português, conforme identificado no estudo, reforça a relevância da abordagem baseada em léxico, que, embora tecnicamente mais simples, mostrou-se eficaz para o domínio específico. O léxico desenvolvido incluiu termos negativos como “queda”, “crise”, “colapso” e “circuit breaker”, e termos positivos como “alta”, “sobe”, “recorde” e “crescimento”, com escores variando de -1 a +1 para indicar a direção do sentimento.
A análise de correlação contemporânea entre o sentimento médio diário das manchetes e os retornos percentuais dos ativos revelou resultados significativos para o IBOVESPA e a PETR4. O coeficiente de Pearson para o IBOVESPA foi de +0,1255, com um p-valor de 0,013, indicando uma associação positiva e estatisticamente significativa. Para a PETR4, o coeficiente foi de +0,1029, com p-valor de 0,041, também apontando uma correlação positiva e significativa. Os demais ativos analisados, S&P 500, VALE3 e B3SA3, apresentaram coeficientes positivos de magnitude similar, mas sem significância estatística ao nível de 5%.
O sinal positivo dessas correlações sugere que dias com um tom mais favorável nas manchetes tenderam a coincidir com retornos positivos nos ativos, enquanto uma cobertura pessimista acompanhou quedas. É crucial interpretar essa relação como um fenômeno de co-movimento, e não de causalidade direta, conforme destacado por Tetlock (2007). Manchetes e preços dos ativos provavelmente reagem de forma conjunta aos mesmos eventos, com o mercado precificando a informação no pregão do dia e a imprensa publicando o tom correspondente quase em tempo real.
A magnitude relativamente fraca dos coeficientes de correlação era esperada, uma vez que os preços dos ativos são influenciados por uma multiplicidade de fatores, como juros, câmbio, fluxo de capital externo e resultados corporativos. O sentimento das manchetes, nesse cenário, atua como um sinal em um ambiente informacional ruidoso e complexo. A ausência de significância para o S&P 500, um índice de um mercado desenvolvido, é consistente com a hipótese de que mercados com maior profundidade analítica e diversidade de participantes institucionais são menos sensíveis ao clima narrativo da mídia generalista.
A análise com defasagem temporal, que buscou verificar se o sentimento de um dia anteciparia os movimentos do mercado nos dias seguintes, não produziu resultados significativos. Testes com defasagens de um, dois e três dias úteis para o IBOVESPA e o S&P 500 não revelaram poder preditivo do sentimento. Por exemplo, para o IBOVESPA, a correlação com defasagem de um dia foi de +0,0038 (p = 0,9397), e para o S&P 500, de -0,0555 (p = 0,2728), ambos sem significância estatística.
Este achado é coerente com a Hipótese dos Mercados Semi-Eficientes de Fama (1970), que postula que os preços dos ativos já incorporam rapidamente todas as informações publicamente disponíveis, incluindo o conteúdo das notícias. Se o sentimento midiático tivesse poder preditivo, seria possível desenvolver estratégias de investimento simples e lucrativas, o que os dados não sustentam. A janela de oportunidade para reagir à informação das manchetes se fecha no mesmo dia, distinguindo o sentimento midiático de variáveis com poder preditivo genuíno, como indicadores macroeconômicos com efeitos retardados.
A análise por subperíodo, que dividiu a amostra em fases da pandemia (pandemia aguda, recuperação, normalização e pós-pandemia), não encontrou significância estatística em nenhum dos grupos. Essa falta de significância pode ser atribuída à redução do número de observações em cada subperíodo, variando entre 75 e 127 registros, o que diminui o poder estatístico para detectar efeitos de magnitude fraca. Contudo, o padrão dos coeficientes ao longo do tempo oferece *insights* analíticos relevantes.
No período de pandemia aguda (2020), o coeficiente de correlação para o IBOVESPA foi o maior positivo (r = +0,1682), embora não significativo. Este resultado sugere que em momentos de alta incerteza, quando os fundamentos econômicos são difíceis de avaliar, o tom das notícias pode ter um peso maior nas decisões dos investidores. Essa observação alinha-se à descrição de Kahneman (2012) sobre o processamento intuitivo que domina em ambientes caóticos, tornando os agentes mais reativos ao clima emocional das notícias.
Em 2021, durante a fase de recuperação, o coeficiente de correlação para o IBOVESPA foi próximo de zero e levemente negativo (r = -0,0090). Isso pode indicar uma divergência entre o entusiasmo do mercado, impulsionado pelas vacinas e reabertura econômica, e a cobertura midiática, que ainda dedicava atenção às variantes do vírus e incertezas sobre a retomada. Nos subperíodos de normalização (2022-2023) e pós-pandemia (2024), os coeficientes voltaram a ser positivos (r = +0,1495 e r = +0,1229, respectivamente), próximos do limiar de significância, reforçando a ideia de que a relação entre sentimento midiático e mercado não é constante, intensificando-se em períodos de maior incerteza.
Do ponto de vista prático, os achados deste estudo indicam que o sentimento midiático, embora não seja uma ferramenta preditiva, possui valor como um termômetro do presente e uma variável auxiliar de contexto para gestores de investimento. Em momentos de alta incerteza, como os vivenciados durante a pandemia, escores de sentimento fortemente negativos podem sinalizar uma deterioração do apetite ao risco, complementando a leitura de outros indicadores de estresse de mercado. Essa informação pode auxiliar em decisões de gestão de exposição, *hedge* ou no *timing* de rebalanceamento de carteiras.
É fundamental ressaltar que o uso do sentimento midiático deve ser compreendido dentro de suas limitações. Ele não confere vantagem para estratégias de antecipação de movimentos de preço e não deve ser tratado como um sinal isolado de compra ou venda. Seu caráter é diagnóstico e contemporâneo, oferecendo um insumo adicional para a interpretação do ambiente de mercado, mas não um modelo de decisão. A principal contribuição deste trabalho, a construção do léxico financeiro customizado para o português, evidencia a necessidade de ferramentas específicas para o idioma e domínio, superando as deficiências de modelos generalistas e abrindo caminho para futuras pesquisas mais robustas.
4. Conclusão
Este estudo teve como objetivo verificar a associação entre o sentimento expresso em manchetes de notícias financeiras e as oscilações diárias de ativos no mercado brasileiro, abrangendo o período de 2020 a 2024. Verificou-se uma associação positiva e estatisticamente significativa entre o sentimento midiático e os retornos do IBOVESPA e da PETR4. Contudo, a análise com defasagem temporal não indicou poder preditivo do sentimento sobre os pregões seguintes, um achado que se alinha à Hipótese dos Mercados Semi-Eficientes. Os resultados sugerem que as manchetes e os preços dos ativos tendem a se mover de forma conjunta, reagindo aos mesmos eventos de mercado.
A principal contribuição deste trabalho reside na construção de um léxico financeiro customizado para o português brasileiro. Essa ferramenta foi desenvolvida após se constatar a inadequação de modelos de linguagem generalistas, como os baseados na arquitetura BERT, para capturar o vocabulário específico do noticiário financeiro em português, que apresentaram erros sistemáticos na classificação de termos contextuais. A ausência de um corpus financeiro anotado para o idioma nacional foi um achado metodológico relevante, reforçando a necessidade de soluções especializadas e a relevância da curadoria manual de léxico para este domínio. Do ponto de vista prático, os achados indicam que o sentimento midiático, embora não seja uma ferramenta preditiva, oferece valor como um termômetro do presente e uma variável auxiliar de contexto para gestores de investimento. Em períodos de alta incerteza, como os vivenciados durante a pandemia, escores de sentimento fortemente negativos podem sinalizar uma deterioração do apetite ao risco, complementando outros indicadores de estresse de mercado e auxiliando em decisões de gestão de exposição ou rebalanceamento de carteiras. Contudo, é crucial reconhecer as limitações do estudo, como a magnitude fraca dos coeficientes de correlação, esperada em um ambiente com múltiplos fatores influenciadores, e a redução do poder estatístico na análise por subperíodos devido ao menor número de observações. Para estudos futuros, sugere-se replicar a metodologia para o mercado americano, comparando diretamente a magnitude e a significância das correlações do S&P 500 com as do IBOVESPA, o que poderia aprofundar a compreensão sobre a reação de mercados emergentes e desenvolvidos à cobertura midiática.
Referências Bibliográficas
BIRD, S.; KLEIN, E.; LOPER, E. Natural Language Processing with Python: Analyzing Text with the Natural Language Toolkit. Sebastopol: O’Reilly Media, 2009.
DEVLIN, J.; CHANG, M.-W.; LEE, K.; TOUTANOVA, K. BERT: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805, 2019. Disponível em: https://arxiv.org/abs/1810.04805. Acesso em: mar. 2025.
FAMA, E. F. Efficient capital markets: a review of theory and empirical work. The Journal of Finance, v. 25, n. 2, p. 383-417, 1970.
IMPROTA, A. D. S. S. Incorporando análise de sentimentos na predição em séries temporais financeiras por meio de modelos TabNet. 2023. Monografia (MBA em Inteligência Artificial e Big Data) Instituto de Ciências Matemáticas e de Computação, Universidade de São Paulo, São Carlos, 2023. Disponível em: https://bdta.abcd.usp.br/directbitstream/aa074227-cb33-4cff-a6de-099f775784a0/Alexandre%20Improta.pdf. Acesso em: mar. 2025.
KAHNEMAN, D. Rápido e Devagar: Duas Formas de Pensar. Rio de Janeiro: Objetiva, 2012.
MOSCA, A. Finanças Comportamentais. Rio de Janeiro: Elsevier, 2009.
SHILLER, R. J. Exuberância Irracional. 3. ed. São Paulo: Saraiva, 2014.
SOUZA, F.; NOGUEIRA, R.; LOTUFO, R. BERTimbau: Pretrained BERT models for Brazilian Portuguese. In: BRAZILIAN CONFERENCE ON INTELLIGENT SYSTEMS (BRACIS), 9., 2020, Rio Grande. Anais… Rio Grande: BRACIS, 2020. p. 403-417.
TETLOCK, P. C. Giving content to investor sentiment: the role of media in the stock market. The Journal of Finance, v. 62, n. 3, p. 1139-1168, jun. 2007.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

