Artigo

19 de agosto de 2026

Classificação Preditiva de Ações na B3 Via Indicadores Fundamentalistas e Machine Learning

Alexandre dos Santos de Souza; Cassia Renata Pinheiro

DOI: 10.22167/2675-6528-202601592

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

A presente pesquisa investigou a aplicação de modelos de aprendizado de máquina na classificação preditiva de ativos da B3, utilizando indicadores fundamentalistas extraídos da Comissão de Valores Mobiliários (CVM) e da própria B3. O objetivo foi analisar a eficácia dessas técnicas para prever o desempenho futuro de ações no mercado brasileiro. A metodologia envolveu a estruturação de um pipeline de dados robusto, com normalização via Robust Scaler e o uso de retornos logarítmicos para garantir a estabilidade estatística das projeções. Entre os modelos testados, o Random Forest demonstrou maior consistência e desempenho superior, alcançando uma acurácia de 55,97% e identificando a Margem Líquida como o principal indicador de performance. Uma estratégia de investimento que combinou um Motor de Scoring Fundamentalista com aportes constantes apresentou resultados expressivos, obtendo um Índice de Sharpe de 1,15 e superando o benchmark Ibovespa com menor volatilidade anualizada. Concluiu-se que as tecnologias de inteligência artificial são ferramentas de suporte eficazes para a otimização de investimentos, embora o fator humano permaneça essencial na tomada de decisão final, dada a influência do comportamento humano na dinâmica econômica. Palavras-chave: Aprendizado de Máquina; Finanças Quantitativas; Indicadores Financeiros; Random Forest; XGBoost.

1. Introdução

A estabilidade financeira familiar é um pilar fundamental para o bem-estar social e a segurança de longo prazo. A capacidade de gerir as finanças domésticas, incluindo poupança e investimento, transcende a mera acumulação de riqueza, sendo uma ferramenta essencial para a resiliência econômica. A literatura acadêmica estabelece uma correlação direta entre baixos níveis de letramento financeiro e maiores índices de endividamento, o que acentua a vulnerabilidade das famílias frente a cenários econômicos adversos (Lusardi e Mitchell, 2014; BCB, 2021).

No Brasil, o mercado de capitais, apesar de abrigar empresas com décadas de lucros consistentes, ainda exibe uma participação popular significativamente inferior à observada em economias desenvolvidas. Dados da B3 (2024) indicam um crescimento no número de investidores pessoa física em renda variável, passando de 5,2 milhões para 5,4 milhões entre o terceiro trimestre de 2024 e 2025. Contudo, este percentual permanece baixo para um país com mais de 200 milhões de habitantes. Em contraste, mercados maduros, como o norte-americano, registram que mais de 60% da população adulta possui investimentos em ações, direta ou indiretamente (Gallup, 2024). Essa disparidade não apenas revela uma lacuna cultural, mas também uma vasta oportunidade para o desenvolvimento do mercado financeiro nacional.

A análise fundamentalista clássica é reconhecida como um método eficaz para a alocação de recursos financeiros, buscando identificar o valor intrínseco de uma empresa por meio da avaliação de seus dados econômico-financeiros. No entanto, sua aplicação prática apresenta complexidades crescentes, especialmente diante do volume cada vez maior de empresas com capital aberto. O processo de avaliação manual exige profundo conhecimento técnico, o que dificulta a entrada de investidores iniciantes. Além disso, a tomada de decisão humana é frequentemente influenciada por vieses cognitivos e emocionais, conforme abordado por Kahneman (2011), levando a tentativas de prever o “timing do mercado” que, estatisticamente, podem comprometer os retornos de longo prazo.

Diante dessas limitações e da crescente disponibilidade de dados, a aplicação de Machine Learning e Data Science emerge como uma abordagem promissora para aprimorar a qualificação de indicadores fundamentalistas e a previsão de retornos de ações. Essas tecnologias oferecem a capacidade de processar e analisar grandes volumes de dados de maneira eficiente, identificando padrões complexos que seriam inviáveis para a análise humana tradicional. A inteligência artificial, nesse contexto, pode atuar como uma ferramenta de suporte para otimizar as decisões de investimento, mitigando vieses e aumentando a objetividade.

A pesquisa se fundamenta na premissa de que a integração de modelos preditivos de Machine Learning com indicadores fundamentalistas pode revelar relações significativas entre a saúde financeira de uma empresa e o desempenho futuro de suas ações. Indicadores como Valor, Rentabilidade e Crescimento, extraídos de fontes como a Comissão de Valores Mobiliários (CVM) e a B3, são cruciais para a avaliação da performance de ativos. A utilização de algoritmos de aprendizado de máquina permite a construção de modelos quantitativos capazes de aprender com esses dados históricos e fazer classificações preditivas, oferecendo uma perspectiva mais estruturada e menos suscetível a falhas humanas na seleção de investimentos.

A lacuna prática reside na dificuldade de investidores, especialmente os iniciantes, em navegar pela complexidade do mercado de capitais e na ineficiência da análise manual frente à vasta quantidade de informações disponíveis. A lacuna teórica, por sua vez, é preenchida pela investigação de como algoritmos de Machine Learning podem ser otimizados para extrair valor preditivo de indicadores fundamentalistas em um contexto de mercado emergente como o brasileiro. A justificativa para este estudo reside, portanto, na necessidade de desenvolver ferramentas mais eficientes e objetivas para a classificação preditiva de ativos, contribuindo para a democratização do acesso a estratégias de investimento mais sofisticadas e para o desenvolvimento do mercado de capitais nacional.

Nesse sentido, este trabalho justifica-se pela aplicação de Machine Learning e Data Science na qualificação dos indicadores fundamentalistas e na previsão de retornos de ações, e tem como objetivo analisar a aplicação de modelos de Machine Learning na classificação preditiva de ativos da B3, fundamentando-se em indicadores fundamentalistas extraídos da Comissão de Valores Mobiliários (CVM) e da B3.

2. Material e Métodos

O estudo adotou abordagem quantitativa e aplicada, implementando um pipeline de Data Science em Python para otimizar a análise de informações financeiras e gerar previsões baseadas em indicadores fundamentalistas. A metodologia visou avaliar o desempenho e perspectivas futuras de empresas na B3. Desenvolveu-se um modelo quantitativo para processar grandes volumes de dados, identificando padrões que correlacionam indicadores financeiros com a performance futura dos ativos. O procedimento metodológico, ilustrado na Figura 1, organizou-se em etapas de coleta, organização e análise, desde a extração dos dados brutos até a fase de inteligência e backtest.Figura 1. Pipeline metodológico de processamento de dados e engenharia de atributos

Fonte: Dados originais da pesquisa

A Figura 1 detalha as fases de ingestão, filtragem, enriquecimento, integração, consolidação, engenharia de features, modelagem e backtest. Essa representação visual da estrutura metodológica foi essencial para compreender a arquitetura do processo de análise e modelagem preditiva, garantindo a robustez e a integridade de cada etapa.

A unidade de análise consistiu em ativos negociados na B3, focando em empresas de capital aberto no mercado acionário brasileiro. Os dados foram coletados de fontes oficiais, abrangendo período histórico relevante para a construção e validação dos modelos. A população de dados incluiu arquivos históricos de cotações (COTAHIST) da B3 e Demonstrações Financeiras Padronizadas (DFP) e Informações Trimestrais (ITR) da Comissão de Valores Mobiliários (CVM). Para a seleção do universo elegível, aplicaram-se critérios de inclusão: ações com presença em, no mínimo, 100 pregões e volume financeiro mediano diário superior a R$50.000,00, excluindo ativos de baixa liquidez ou micro-caps.

A pesquisa utilizou a linguagem Python para o desenvolvimento do pipeline de Data Science. As fontes de dados primárias foram os arquivos COHIST da B3 e os documentos DFP e ITR da CVM. Para integração e enriquecimento, empregou-se web scraping no site Investidor 10 para obter o CNPJ das empresas e a API do Yahoo Finance para resgatar cotações ajustadas. Os algoritmos de Machine Learning Random Forest e XGBoost foram selecionados para a modelagem preditiva, e o Robust Scaler foi utilizado para a normalização dos dados.

A coleta de dados iniciou-se com a extração dos arquivos COHIST da B3, filtrando cotações diárias de lote padrão (TIPREG = ’01’ e TPMERC = ‘010’). Concomitantemente, extraíram-se os arquivos DFP e ITR da CVM, focando em contas primárias como Ativo Total, Patrimônio Líquido, Receita e Lucro Líquido. Para evitar o look-ahead bias, aplicou-se atraso informacional de 60 dias entre o balanço e a cotação da ação. Os dados brutos foram organizados, com arquivos Fixed-Width da B3 convertidos para Parquet e os da CVM consolidados em CSV, além de ajustes de escala monetária e tipagem temporal.

A integração entre os dados da B3 e da CVM foi realizada utilizando o CNPJ como chave, obtido via web scraping no site Investidor 10, o que também filtrou tickers inativos. As contas contábeis brutas foram combinadas para gerar variáveis preditivas, como Margem Líquida, Retorno sobre o Patrimônio Líquido (ROE) e Nível de Alavancagem. Anomalias matemáticas foram tratadas, convertendo divisões por zero ou valores infinitos em nulos. A variável alvo foi otimizada pelo Logaritmo Natural dos retornos (Log-Returns) para maior estabilidade estatística. As features contínuas foram normalizadas via Robust Scaler, adequado para lidar com a assimetria do mercado e outliers (Malla et al., 2026).

A modelagem preditiva e a seleção de ativos foram estruturadas com abordagem híbrida, combinando inteligência artificial e análise fundamentalista. Os algoritmos Random Forest e XGBoost foram configurados para aprender as relações complexas entre indicadores contábeis e o desempenho futuro das ações. Para evitar o look-ahead bias, o treinamento seguiu ordem cronológica rigorosa, empregando a técnica de Walk-Forward Validation com janela expansiva. Paralelamente, desenvolveu-se um Motor de Scoring Fundamentalista, que atuou como filtro de qualidade e ranqueamento transparente para as empresas.

A validação prática foi realizada por um Backtest, simulando estratégia de Buy & Hold com rebalanceamentos periódicos, utilizando cotações ajustadas da API do Yahoo Finance para refletir o retorno real do acionista. O processo de backtest incluiu validação gráfica e estatística do desempenho da carteira frente ao índice Ibovespa, além da extração de métricas institucionais de risco, como Índice de Sharpe, Volatilidade Anualizada e Maximum Drawdown. A pesquisa utilizou exclusivamente dados públicos e anonimizados, não havendo necessidade de termos de consentimento ou outros cuidados éticos relacionados à privacidade de participantes.

3. Resultados e Discussão

A fase inicial da pesquisa revelou desafios significativos na obtenção e estruturação de dados financeiros. Embora plataformas proprietárias de consolidação de dados, como a Economatica, tenham sido consideradas, a necessidade de garantir a reprodutibilidade do projeto e controlar os custos levou à exploração de repositórios públicos. Contudo, as bases de dados disponíveis em plataformas como o Kaggle mostraram-se frequentemente incompletas, desatualizadas ou carentes da granularidade necessária para a análise proposta. Diante disso, optou-se por desenvolver um pipeline próprio de Extração, Transformação e Carregamento (ETL), processando os dados brutos diretamente das fontes oficiais da Comissão de Valores Mobiliários (CVM) e da B3.

Após a extração e estruturação das séries temporais, a integração das bases de dados da CVM e da B3 apresentou um desafio estrutural devido à ausência de uma chave primária comum. Para superar essa dificuldade, aplicou-se um filtro de liquidez nos ativos e, em seguida, desenvolveu-se um algoritmo de web scraping direcionado ao portal financeiro Investidor 10. Essa abordagem permitiu vincular as duas fontes por meio do CNPJ, consolidando uma base de dados rica em informações contábeis e de mercado. Adicionalmente, foi necessário ajustar as cotações nominais da B3 para refletir eventos corporativos, utilizando o preço de fechamento ajustado via API yfinance, e empregar a técnica de As-Of Merge para integrar balanços trimestrais com cotações diárias, prevenindo o viés de antecipação (look-ahead bias).

A variável alvo do modelo foi estruturada com base em retornos logarítmicos, em vez de retornos percentuais simples. Essa escolha conferiu maior simetria matemática entre altas e baixas, aproximando a distribuição dos dados de uma curva normal e otimizando a convergência dos modelos de Machine Learning, conforme destacado por Malla et al. (2026). Foram aplicados filtros de sanidade para limitar variações trimestrais entre perdas de 95% e ganhos de 500%, resultando em um dataset consolidado e robusto para as etapas subsequentes de modelagem e análise preditiva.

O dataset consolidado, essencial para o treinamento dos modelos, incluiu diversas variáveis contábeis e de mercado. Entre as variáveis mapeadas, destacam-se o identificador único CVM (CD_CVM), a razão social (DENOM_SOCIAL), o lucro líquido (LUCRO LIQUIDO), o patrimônio líquido (PATRIMONIO LIQUIDO), a receita (RECEITA), o setor econômico (SETOR_ATIV), o código de negociação da ação na B3 (TICKER_PREV) e o CNPJ, que serviu como chave de integração. Variáveis de mercado como a data do pregão (DATA_PREGAO), o preço ajustado da ação (PRECO_ADJUSTED), o retorno alvo (TARGET_RETORNO) e o preço futuro (PRECO_FUTURO) também foram incorporadas para enriquecer a base de dados, conforme detalhado na Tabela 1 do TCC original.

Com a base de dados consolidada, a etapa de engenharia de features transformou os dados contábeis absolutos em indicadores financeiros proporcionais, como Retorno sobre o Patrimônio Líquido (ROE), Margem Líquida, Nível de Alavancagem e Giro do Ativo. Esses indicadores foram submetidos a uma normalização transversal agrupada por trimestre, utilizando o Robust Scaler. A escolha do Robust Scaler, em detrimento de métodos tradicionais como o Z-Score, deveu-se à sua capacidade de neutralizar distorções macroeconômicas e minimizar o impacto de outliers, garantindo que o sinal preditivo de empresas saudáveis não fosse ofuscado por anomalias extremas, conforme recomendado por Malla et al. (2026).

A modelagem preditiva e a seleção de ativos foram estruturadas em uma abordagem dupla, combinando inteligência artificial com análise fundamentalista clássica. Os algoritmos Random Forest e XGBoost foram empregados para aprender as complexas relações entre os indicadores contábeis e o desempenho futuro das ações. Para evitar o look-ahead bias, o treinamento seguiu uma rigorosa ordem cronológica por meio da técnica de Walk-Forward Validation com janela expansiva. Paralelamente, um Motor de Scoring Fundamentalista foi desenvolvido para atuar como um filtro de qualidade, ranqueando empresas com base em rentabilidade (Margem Líquida e ROE) e penalizando aquelas com alto risco de endividamento (Nível de Alavancagem).

A avaliação do desempenho geral dos modelos Random Forest e XGBoost revelou uma leve superioridade do primeiro. O Random Forest alcançou uma acurácia de 55,97%, uma precisão de 55,52%, um recall de 62,11% e um F1 Score de 58,63%. Em comparação, o XGBoost obteve uma acurácia de 54,90%, precisão de 54,72%, recall de 59,23% e F1 Score de 56,89%. Esses resultados, apresentados na Tabela 2 do TCC original, indicam que o Random Forest demonstrou um equilíbrio superior entre a assertividade direcional e a capacidade de capturar oportunidades, o que, no mercado financeiro, pode se traduzir em ganhos acumulados mais consistentes no longo prazo.

A análise da evolução da importância das variáveis preditoras ao longo do tempo, para ambos os modelos, forneceu insights cruciais sobre sua estabilidade e sensibilidade. A Figura 2 ilustra que o Random Forest manteve uma estrutura de aprendizado mais consistente, com a Margem Líquida e o Lucro Líquido consolidando-se como os principais preditores ao longo da última década. Essa estabilidade sugere uma menor sensibilidade ao ruído e um risco reduzido de overfitting, o que é fundamental para a robustez do modelo em cenários de mercado dinâmicos.Figura 2. Evolução da Importância das Features para o Random Forest

Fonte: Resultados originais da pesquisa

Em contraste, a Figura 3, que representa a evolução da importância das features para o XGBoost, revelou uma volatilidade extrema. Observaram-se inversões abruptas de dominância entre os indicadores a partir de 2022, o que aponta para uma maior sensibilidade do XGBoost ao ruído e um risco elevado de overfitting aos dados mais recentes. Essa característica pode comprometer a generalização do modelo em períodos de mudança de regime de mercado, tornando-o menos confiável para previsões de longo prazo em comparação com o Random Forest, que exibiu maior consistência em sua capacidade preditiva.Figura 3. Evolução da Importância das Features para o XGBoost

Fonte: Resultados originais da pesquisa

Os gráficos SHAP (Shapley Additive explanations) foram utilizados para aprofundar a compreensão da importância das variáveis, confirmando a Margem Líquida como o principal pilar preditivo para ambos os modelos. A Figura 4, referente ao XGBoost, e a Figura 5, para o Random Forest, evidenciam uma correlação direta e positiva entre margens altas e sinais de valorização. Contudo, o Random Forest demonstrou uma interpretação mais clara e estável das variáveis fundamentais, penalizando empresas com baixo patrimônio e recompensando a eficiência operacional de forma consistente, enquanto o XGBoost operou com uma agressividade superior, porém mais ruidosa e menos transparente em suas atribuições de importância.Figura 4. Gráfico de Importância de Variáveis (SHAP) para o XGBoost

Fonte: Resultados originais da pesquisa

A análise dos valores SHAP para o Random Forest, conforme a Figura 5, reforça a robustez do modelo na identificação de drivers de valor. A capacidade de penalizar empresas com patrimônio líquido reduzido e de recompensar aquelas com alta eficiência operacional indica que o modelo está alinhado com princípios fundamentais de investimento. Essa clareza na interpretação das variáveis é um diferencial importante para a aplicabilidade prática do modelo, pois permite aos investidores compreender melhor as razões por trás das classificações preditivas, aumentando a confiança na ferramenta de suporte à decisão.Figura 5. Gráfico de Importância de Variáveis (SHAP) para o Random Forest

Fonte: Resultados originais da pesquisa

O backtest realizado consolidou a superioridade das abordagens preditivas na geração de alpha a longo prazo. A Figura 6 demonstra que a Carteira Random Forest superou consistentemente o XGBoost e descolou expressivamente do Ibovespa em patrimônio acumulado, corroborando a maior robustez observada nas análises anteriores. No entanto, o painel inferior de drawdowns na mesma figura expõe o risco inerente a essa rentabilidade. Ambos os modelos sofreram quedas severas, frequentemente ultrapassando a barreira dos -30%, especialmente nos períodos de incerteza política em 2015 e no início da pandemia de COVID-19 em 2020, quando a bolsa brasileira se desvalorizou acentuadamente.Figura 6. Evolução Patrimonial: Random Forest vs XGBoost vs Ibovespa e Drawdowns Históricos.

Fonte: Resultados originais da pesquisa

Os resultados do backtest indicam que, embora os algoritmos sejam eficientes em alavancar ganhos durante tendências de alta, eles não oferecem proteção efetiva contra choques sistêmicos e reversões bruscas do mercado. Essa característica classifica a estratégia como de alta volatilidade e risco de cauda, exigindo do investidor maturidade para avaliar se os fundamentos das empresas pontuadas pelo modelo estão alinhados com a realidade. A Tabela 3 do TCC original, que apresenta as métricas institucionais, corrobora essa observação, detalhando o desempenho de ambos os modelos em relação ao Ibovespa.

As métricas institucionais revelaram que, embora ambos os modelos tenham superado o Ibovespa no longo prazo, com ganhos significativos para o Random Forest, os Índices de Sharpe alcançados foram de 0,14 para o Random Forest e 0,09 para o XGBoost. Esses valores, embora positivos e superiores ao Ibovespa (-0,05), estão abaixo do limiar de 1,0 exigido por alocadores institucionais para considerar uma estratégia robusta e comercialmente viável, conforme apontado por Pagliaro (2026). A volatilidade anualizada foi de 24,32% para o Random Forest e 25,04% para o XGBoost, enquanto o Ibovespa registrou 23,73%. O Maximum Drawdown (MDD) foi de -42,16% para o Random Forest e -42,49% para o XGBoost, ambos superiores ao do Ibovespa (-37,03%).

A alta taxa de drawdown, superior a 42% para ambos os modelos, evidencia a dificuldade em prever mudanças drásticas no cenário econômico. Para viabilizar a aplicação prática desses modelos, é fundamental a adoção de técnicas de mitigação de risco, como o redimensionamento das posições para limitar as quedas a níveis institucionais mais controlados, geralmente entre -20% e -30% (Pagliaro, 2026). Essa limitação ressalta que, apesar da capacidade dos algoritmos de identificar padrões, a intervenção humana e a gestão de risco são indispensáveis para a construção de uma estratégia de investimento mais resiliente e adequada a diferentes perfis de investidor.

Partindo da premissa de que bons fundamentos tendem a gerar ganhos futuros, foi implementado um algoritmo de Scoring Fundamentalista. Este algoritmo utiliza os principais preditores identificados pelos modelos de machine learning, como rentabilidade (ROE), solvência (Alavancagem) e eficiência (Margem Líquida). O modelo premia empresas com retorno sobre patrimônio acima da mediana do mercado (RS_ROE > 0) e bonifica aquelas que apresentaram melhora em relação ao trimestre anterior. Da mesma forma, identifica empresas com menor risco financeiro (RS_ALAVANCAGEM_FIN < 0) e valoriza a desalavancagem progressiva, além de avaliar a capacidade de conversão de receita em lucro, pontuando empresas com margens superiores aos seus pares em trajetória de crescimento.

Para validar a aplicabilidade prática do modelo, foi realizada uma simulação de aportes constantes (Dollar Cost Averaging – DCA). Os resultados obtidos, apresentados na Tabela 4 do TCC original, demonstraram a eficácia da estratégia. Com um total aportado de R$ 54.391,60, o patrimônio final alcançado pelo modelo de Machine Learning (ML) foi de R$ 208.262,30, representando um ganho de +282,89%. Em comparação, o patrimônio final do Ibovespa para o mesmo período foi de R$ 141.389,59, com um ganho de +159,95%. Essa simulação evidencia a capacidade do modelo de gerar retornos significativamente superiores ao benchmark.

A Figura 7 ilustra a evolução patrimonial da estratégia de Score Fundamentalista em comparação com o Ibovespa e os drawdowns históricos. O gráfico superior mostra que a carteira da estratégia ML superou consistentemente o Ibovespa ao longo do tempo, indicando uma geração de alpha robusta. O painel inferior, que exibe os drawdowns, revela que, embora os picos de queda sistêmica sejam próximos aos do Ibovespa, a estratégia ML demonstra maior resiliência e velocidade de recuperação pós-crise, com um deslocamento positivo do gráfico após 2020, sugerindo uma capacidade de recuperação mais rápida em momentos de estresse do mercado.

Figura 7. Evolução Patrimonial: Score Fundamentalista vs Ibovespa e Drawdowns Históricos.

Fonte: Resultados originais da pesquisa

A eficácia da estratégia DCA combinada com o Score Fundamentalista é comprovada pela redução da volatilidade anualizada para 19,77%, em contraste com os 24,02% do Ibovespa. Além disso, o Índice de Sharpe anualizado da estratégia alcançou 1,15, superando significativamente o 0,67 do Ibovespa e atingindo o limiar de robustez exigido por alocadores institucionais. O Maximum Drawdown (MDD) da estratégia foi de -45,66%, ligeiramente inferior ao do Ibovespa (-46,82%), indicando uma proteção sistemática contra perdas extremas, conforme detalhado na Tabela 5 do TCC original.

A distribuição de retornos da estratégia DCA + Score Fundamentalista, apresentada na Figura 8, mostra uma curva mais estreita e com assimetria positiva em comparação à base achatada e volátil do Ibovespa. Essa característica sugere que a estratégia não apenas oferece retornos mais consistentes, mas também uma menor probabilidade de perdas extremas, contribuindo para uma maior estabilidade e previsibilidade dos resultados. A maior resiliência e velocidade de recuperação pós-crise, evidenciada pelo deslocamento do gráfico após 2020, reforçam a capacidade da estratégia de mitigar os impactos de eventos adversos e de se recuperar de forma mais eficiente.

Figura 8. Histograma de Retornos

Fonte: Resultados originais da pesquisa

Em síntese, os resultados demonstram que a aplicação de modelos de aprendizado de máquina, especialmente o Random Forest, em conjunto com indicadores fundamentalistas e uma estratégia de aportes constantes, pode otimizar significativamente a classificação preditiva e o desempenho de carteiras de ações na B3. A Margem Líquida emergiu como um indicador crucial, e a estratégia combinada superou o Ibovespa com menor volatilidade e maior Índice de Sharpe, validando o potencial das tecnologias de inteligência artificial como ferramentas de suporte eficazes para a tomada de decisões de investimento, embora a necessidade de gestão de risco e a consideração do fator humano permaneçam essenciais para navegar pela complexidade do mercado financeiro.

4. Conclusão

O presente estudo analisou a aplicação de modelos de aprendizado de máquina na classificação preditiva de ativos da B3, utilizando indicadores fundamentalistas. Verificou-se que a estruturação de um pipeline de dados robusto, com normalização via Robust Scaler e o uso de retornos logarítmicos, otimizou a estabilidade estatística das projeções. Entre os algoritmos testados, o Random Forest demonstrou maior consistência e desempenho superior, alcançando uma acurácia de 55,97% e identificando a Margem Líquida como o principal indicador de performance. A integração de um Motor de Scoring Fundamentalista com uma estratégia de aportes constantes resultou em um Índice de Sharpe de 1,15 e superou o benchmark Ibovespa com menor volatilidade anualizada, evidenciando a capacidade de gerar retornos ajustados ao risco significativamente superiores.

Apesar dos resultados promissores, observou-se que os modelos preditivos apresentaram limitações em períodos de instabilidade sistêmica, como as crises de 2015 e 2020, não mitigando quedas expressivas e revelando uma alta volatilidade e risco de cauda. Essa característica ressalta que, embora as tecnologias de inteligência artificial sejam ferramentas de suporte eficazes para a otimização de investimentos, o fator humano permanece essencial na gestão de risco e na tomada de decisão final. A dinâmica econômica, influenciada por comportamentos e reações humanas, impõe limites à capacidade dos modelos algorítmicos de antecipar variáveis emocionais do mercado. Este estudo, de caráter estritamente acadêmico, contribui para o avanço do conhecimento sobre a aplicação de Machine Learning em finanças quantitativas no contexto brasileiro, sem configurar uma recomendação de investimento.

Referências Bibliográficas

Banco Central do Brasil [BCB]. 2021. Relatório de cidadania financeira 2021. BCB, Brasília, DF, Brasil.

Brasil, Bolsa, Balcão [B3]. 2024. Boletim pessoa física 3º trimestre de 2024. B3, São Paulo, SP, Brasil.

Gallup. 2024. What percentage of Americans owns stock?. Gallup, Washington, DC, EUA.

Kahneman, D. 2011. Thinking, Fast and Slow. Farrar, Straus and Giroux, New York, NY, EUA.

Lusardi, A.; Mitchell, O.S. 2014. The economic importance of financial literacy: theory and evidence. Journal of Economic Literature 52(1): 5-44.

Malla, S.R.; Kayastha, S.; Suwal, R.; Bhandari, H.C.; Adhikari, R. 2026. XGBoost forecasting of NEPSE index log returns with walk forward validation. arXiv, Ithaca, NY, EUA

Pagliaro, A. 2026. Regime-aware LightGBM for stock market forecasting: a validated walk-forward framework with statistical rigor and explainable Al analysis. Electronics 15(1): 1-30.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

26 de agosto de 2026

Gerenciamento de Cronograma de Manutenção no Setor de Extração de Caldo em uma Indústria Sucroalcooleira

A manutenção de entressafra em indústrias sucroalcooleiras representa um projeto de alta complexidade, frequentemente comprometido por limitações na definição do escopo, no sequenciamento de atividades e nas estimativas de duração, afetando a confiabilidade e previsibilidade da execução. Objetivou-se aprimorar o gerenciamento do cronograma de manutenção de entressafra no setor de extração de caldo, por meio da aplicação das práticas do PMBOK 6ª edição, com foco na estruturação do escopo, sequenciamento lógico das atividades, melhoria das estimativas de duração e identificação do caminho crítico. A pesquisa caracterizou-se como um estudo de caso único, de natureza aplicada e abordagem mista, realizado em uma indústria sucroalcooleira. Os métodos incluíram análise documental de cronogramas de entressafra e coleta de dados por meio de questionários com profissionais da área. Inicialmente, diagnosticou-se o cronograma vigente, identificando lacunas. Em seguida, aplicaram-se ferramentas de gerenciamento do cronograma, como a Estrutura Analítica do Projeto (EAP), sequenciamento de atividades, estimativa análoga e bottom-up, e o método do caminho crítico (CPM), permitindo a comparação entre o cenário original e o reestruturado. Os resultados evidenciaram ganhos significativos em previsibilidade, organização das atividades, clareza nas dependências e maior controle sobre prazos e desvios, com a redução de atividades sem predecessoras ou sucessoras de 18,85% para 2,32%. Concluiu-se que a aplicação estruturada das boas práticas de gerenciamento do cronograma aprimorou o planejamento e contribuiu para a disponibilidade operacional na safra subsequente.

Palavras-chave: Caminho crítico; Confiabilidade do planejamento; Estrutura Analítica do Projeto (EAP); Planejamento operacional; Previsibilidade.

26 de agosto de 2026

Fomento à liderança de mulheres por meio da gestão estratégica de partes interessadas

A persistente sub-representação de mulheres em cargos de liderança revelou limitações nas estratégias institucionais de promoção da igualdade de gênero, destacando a necessidade de abordagens mais integradas entre gestão de projetos e negociação estratégica. O estudo objetivou analisar como estratégias de negociação e engajamento de partes interessadas fomentaram o compromisso institucional com políticas que impulsionam a liderança feminina, e propôs uma matriz estratégica orientada por uma perspectiva de gênero. Adotou-se uma abordagem de métodos mistos, de natureza convergente e articulação epistemológica crítica-transformativa, que combinou análise documental, estudos de caso institucionais e uma entrevista semiestruturada com uma líder feminina, seguida de análise temática e triangulação de dados para aumentar a robustez interpretativa. Os resultados indicaram que organizações que institucionalizaram práticas de governança, estabeleceram metas mensuráveis e incorporaram partes interessadas como participantes ativos demonstraram maior capacidade de converter compromissos discursivos em ações estruturadas. Evidenciou-se, ainda, que a integração entre negociação estratégica e gestão de partes interessadas potencializou a sustentabilidade das iniciativas de equidade de gênero. Concluiu-se que a implementação de uma matriz estratégica, denominada Matriz Estratégica de Engajamento de Stakeholders com foco em gênero (MEES-G), configurou-se como uma ferramenta de gestão relevante para fortalecer o compromisso institucional e facilitar transformações organizacionais consistentes, oferecendo orientação eficaz a gestores públicos e privados na implementação de políticas inclusivas.

Palavras-chave: Equidade; Governança; Inclusão organizacional; Representatividade; Transformação organizacional.

26 de agosto de 2026

Transformação do Modelo Comercial em Serviços Linguísticos para Maior Previsibilidade de Receita

A busca por previsibilidade de receita e maior controle sobre o desempenho comercial tem se tornado um desafio relevante na indústria de serviços linguísticos, caracterizada por alta variabilidade de demanda e modelos historicamente baseados em volume de serviços. Neste contexto, o estudo teve como objetivo analisar a reestruturação do modelo comercial de uma empresa do setor, com foco na transição de uma abordagem orientada à receita faturada para um modelo baseado na formalização de contratos e na previsibilidade de receita potencial. A pesquisa foi conduzida por meio de pesquisa-ação entre maio de 2024 e março de 2026, utilizando dados quantitativos provenientes de sistemas internos e dados qualitativos obtidos por observação participante e entrevistas com profissionais-chave. Os resultados quantitativos indicaram que a meta trimestral de contratos foi superada, atingindo 106% no primeiro trimestre de 2026, e os contratos firmados entre o final de 2025 e o primeiro trimestre de 2026 resultaram em uma projeção de receita de US$ 1.230.500, equivalente a aproximadamente 88% da meta anual, evidenciando aumento na previsibilidade da receita potencial. Qualitativamente, os dados apontaram maior clareza na avaliação da performance comercial, maior transparência na identificação dos fatores que impactam a conversão de contratos em receita e melhoria na integração entre as áreas envolvidas. Concluiu-se que a adoção de um modelo baseado em contratos contribui para uma gestão mais eficiente, previsível e orientada à geração sustentável de receita.

Palavras-chave: Contratos comerciais; Gestão comercial; Modelo de vendas; Pesquisa-ação; Serviços linguísticos.

Neurociência E Aprendizagem Na Educação

24 de agosto de 2026

Do Mundo à Mente: o Impacto Intercultural na Neuroplasticidade

Um estudo investigou a associação entre experiências interculturais e mudanças cognitivas autorrelatadas em adultos brasileiros, à luz do conceito de neuroplasticidade. A pesquisa caracterizou-se como exploratória, de abordagem mista, e foi composta por revisão bibliográfica narrativa e levantamento empírico. Este último foi realizado por meio de questionário online aplicado a 33 participantes que vivenciaram experiências em diferentes países. Coletaram-se dados sociodemográficos, características das vivências internacionais e autoavaliações relacionadas a funções executivas, aprendizagem, memória, atenção e comunicação social. Os resultados indicaram predominância de percepções positivas de mudanças cognitivas, especialmente nos domínios da flexibilidade cognitiva, planejamento, tomada de decisão, aprendizagem e competências comunicativas. A maioria dos participantes relatou a manutenção dessas mudanças ao longo do tempo, associando-as principalmente à duração da experiência, à necessidade de adaptação e ao contato intercultural direto. Os achados sugerem que experiências interculturais constituem contextos de estimulação cognitiva complexa, potencialmente associados a processos de reorganização funcional em múltiplos domínios cognitivos na vida adulta.

Palavras-chave: Adaptação cognitiva; Adaptação cultural; Aprendizagem; Flexibilidade cognitiva; Funções executivas.

Neurociência E Aprendizagem Na Educação

24 de agosto de 2026

Estudo Comparativo: o Conhecimento Docente sobre Neuroplasticidade e Práticas Pedagógicas na Rede Direta e Indireta

A primeira infância constitui um período crítico de plasticidade neural, no qual a qualidade das intervenções pedagógicas determina a arquitetura cerebral e o desenvolvimento integral da criança. O presente estudo teve como objetivo comparar o conhecimento docente sobre neuroplasticidade e sua aplicação prática em unidades de educação infantil de administração direta e indireta na cidade de São Paulo. A metodologia consistiu em um estudo de caso descritivo com abordagem mista, no qual foram aplicados questionários de autopercepção com docentes e realizada uma análise documental de projetos políticos pedagógicos, relatórios de desenvolvimento de alunos e diários de bordo. Os resultados indicaram que, embora ambas as redes tenham executado práticas neurocompatíveis, a Rede Direta apresentou maior intencionalidade pedagógica e segurança técnica 20% superior na identificação de marcos do desenvolvimento, fator diretamente associado à maior carga horária de formação continuada. O estudo evidenciou que a formação continuada atuou como um divisor entre a prática intuitiva e a mediação baseada em evidências. Concluiu-se que o acesso ao saber neurocientífico e a equiparação dos tempos de reflexão docente são fundamentais para garantir maior equidade no desenvolvimento infantil e a eficácia das políticas públicas de educação em territórios de vulnerabilidade.

Palavras-chave: Educação Infantil; Formação Docente; Neurociência Aplicada; Primeira Infância; Redes de Ensino.

24 de agosto de 2026

Precificação Baseada em Valor como Estratégia Competitiva Frente ao Modelo Orientado por Custos

A gestão estratégica de preços consolidou-se como fator determinante para a sustentabilidade e competitividade em mercados industriais, onde a transição de modelos baseados em custos para estratégias orientadas ao valor representa um desafio cultural e operacional crítico. Este estudo teve como objetivo comparar as práticas de precificação em duas unidades industriais do setor business-to-business (B2B), analisando como o alinhamento com a estratégia baseada em valor impacta a sustentabilidade do negócio. Para tanto, investigou-se uma unidade operacional e uma unidade que recentemente descontinuou suas atividades, buscando identificar correlações entre a gestão de preços e a viabilidade competitiva. Adotou-se uma abordagem qualitativa com elementos comparativos, a partir de entrevistas semiestruturadas aplicadas a gestores de duas empresas do setor metalmecânico, utilizando questões fechadas em escala Likert e perguntas abertas organizadas em sete dimensões analíticas relacionadas à maturidade em precificação. Os resultados evidenciaram que a empresa em operação apresentou maior estruturação de processos, melhor integração entre áreas, uso mais frequente de indicadores e ambiente cultural mais favorável à sustentação de preços com base no valor entregue ao cliente. Em contraste, a empresa descontinuada demonstrou fragilidades na formalização da precificação, baixa integração interfuncional, limitações na comunicação de valor e forte predominância de uma cultura orientada por custos. O estudo reforçou que a adoção da precificação baseada em valor requer a institucionalização de processos interfuncionais e governança para garantir a perenidade organizacional frente à pressão competitiva.

Palavras-chave: Concorrência; Cultura; Governança; Liderança.

24 de agosto de 2026

Modelo Preditivo de Risco Reputacional Baseado em Textos Jornalísticos

A reputação corporativa é um ativo intangível crítico, cuja volatilidade na era digital torna as organizações suscetíveis a crises por exposições midiáticas negativas. O estudo desenvolveu um modelo preditivo de risco reputacional para identificar se variáveis da cobertura de mídia, como volume, sentimento e léxico, atuam como precursores de danos severos. A metodologia fundamentou-se na coleta de dados via Web Scraping de notícias sobre eventos de risco ocorridos entre 2023 e 2025. O processamento utilizou Processamento de Linguagem Natural (NLP) para análise de sentimento e feature engineering. A modelagem consistiu em uma tarefa de classificação binária supervisionada, com o target de dano grave determinado por proxies quantificáveis, como impactos financeiros e penalidades regulatórias. Foram comparados os algoritmos Regressão Logística, Random Forest e XGBoost, além da implementação de um modelo Ensemble, em ambiente Python, validados pelas métricas AUC-ROC e F1-Score. Os resultados apontaram a superioridade da abordagem conjunta (Ensemble), que alcançou F1-Score de 0.878 e Recall de 85.4%, e a viabilidade de estimar a probabilidade de crises e estabelecer limiares de risco acionáveis. Comprovou-se a eficácia da integração entre NLP e Machine Learning para a mitigação proativa de riscos corporativos, oferecendo uma ferramenta de suporte à decisão para equipes de comunicação corporativa e gestão de riscos.

Palavras-chave: Análise de Sentimentos; Aprendizado de Máquina; Danos à reputação; Modelagem de Dados Históricos; Processamento de Linguagem Natural (PLN).

Compliance E Esg

24 de agosto de 2026

Liderança Feminina Negra no Brasil: como Políticas Corporativas de Diversidade Apoiam Trajetórias de Sucesso

O presente estudo analisou como as políticas corporativas de diversidade e inclusão influenciaram as trajetórias profissionais de mulheres negras que ocupam cargos de liderança no Brasil. O estudo buscou compreender as experiências e percepções dessas profissionais em relação às práticas organizacionais que moldaram seu desenvolvimento e ascensão. A pesquisa adotou uma abordagem qualitativa, descritiva e aplicada, e coletou dados por meio de levantamento de campo, utilizando questionário semiestruturado com 30 mulheres negras em posições de liderança. Os resultados revelaram que a maioria das participantes possuía alta qualificação acadêmica, atuava predominantemente na região Sudeste e ocupava cargos intermediários de liderança, como supervisão e coordenação. Observou-se a coexistência de trajetórias recentes e consolidadas, indicando avanços na inserção de mulheres negras em liderança, mas também a persistência de limites estruturais que dificultaram a progressão para níveis hierárquicos superiores. Esses achados indicaram que, embora as políticas de diversidade e inclusão fossem relevantes, seus efeitos mostraram-se insuficientes quando não articulados a transformações organizacionais mais amplas voltadas à equidade racial e de gênero, sugerindo que o esforço individual emergiu como estratégia central de trajetória em contextos de suporte institucional frágil.

Palavras-chave: Ascensão profissional; Diversidade organizacional; Inclusão; Interseccionalidade; Políticas corporativas.

24 de agosto de 2026

Segmentação Estratégica de Adquirentes Brasileiras por Clusterização Multivariada

O setor de adquirência desempenha um papel central na infraestrutura de pagamentos, e compreender as diferenças estruturais entre as empresas adquirentes, com base em indicadores operacionais e econômicos, mostrou-se crucial para diagnósticos e decisões fundamentados em dados. O estudo teve como objetivo segmentar as adquirentes brasileiras utilizando indicadores trimestrais de porte, capilaridade, mix de canais e métricas econômicas, empregando análise exploratória de dados e o algoritmo de agrupamento K-means para identificar perfis estratégicos distintos. Realizou-se uma pesquisa quantitativa, exploratória e descritiva, utilizando uma base de dados estruturada com informações trimestrais de adquirentes brasileiras ao longo de doze períodos. A definição do número de agrupamentos baseou-se no método do cotovelo (elbow method) e no coeficiente de silhueta, sendo a interpretação reforçada pela visualização via Análise de Componentes Principais (PCA). Os principais resultados revelaram a formação de dois perfis predominantes: um caracterizado por maior escala e capilaridade, com elevado volume de transações e spreads médios mais comprimidos; e outro com maior participação do canal remoto e maior monetização relativa, evidenciada pela taxa MDR e por spreads médios mais elevados. Concluiu-se que o agrupamento reduziu a complexidade multivariada do mercado a perfis interpretáveis, oferecendo uma base objetiva para benchmarking e para a interpretação estratégica do posicionamento das adquirentes, com potencial de aplicação na análise de dados para a tomada de decisões.Palavras-chave: Adquirência; Análise multivariada; K-means; Pagamentos digitais; Perfis estratégicos.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade