Artículo

08 de octubre de 2026

Árvores de classificação e regressão para previsão dos resultados de deputados estaduais em São Paulo

Árvores de Classificação e Regressão para Previsão dos Resultados de Deputados Estaduais em São Paulo

Kaléu Puskas Diedrich Caminha; Thiago Gentil Ramires

DOI: 10.22167/2675-6528-202603097

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

As eleições no Brasil movimentam recursos significativos, e a formação de chapas competitivas é um desafio para os partidos. Avaliou-se a viabilidade de modelos de classificação e regressão baseados em árvores de decisão e florestas aleatórias para identificar candidatos com potencial de eleição e competitividade, e para prever sua votação nominal na disputa para deputado estadual em São Paulo em 2022. A amostra incluiu todos os candidatos a deputado estadual em São Paulo em 2022, utilizando dados eleitorais, demográficos, partidários e econômicos do período entre 2018 e 2022. A seleção de hiperparâmetros foi realizada por busca em grade, seguida de análise de sensibilidade para o ponto de corte, e a pontuação F1 foi a métrica principal. Comparou-se os modelos de árvore de decisão e floresta aleatória usando F1 e AUC-ROC. O modelo de classificação de candidatos competitivos alcançou uma pontuação F1 de 0,70 e 94% de AUC-ROC, demonstrando ser uma ferramenta viável para auxiliar a tomada de decisão de partidos e candidatos. Os modelos de previsão de eleitos e de votos nominais foram considerados insuficientes. Concluiu-se que características de eleições passadas e o conceito de competitividade são preditores relevantes para a previsibilidade eleitoral, e que o uso de árvores de classificação e regressão, especialmente florestas aleatórias, é adequado para a previsibilidade da competitividade de candidatos.

Palavras-chave: Análise de sensibilidade; Competitividade eleitoral; Florestas aleatórias; Scikit-Learn.

1. Introdução

As eleições no Brasil, especialmente para cargos proporcionais, representam um cenário de alta complexidade e significativo investimento financeiro. Em 2022, as eleições ordinárias no país movimentaram R$ 6,4 bilhões em despesas pagas por candidatos e partidos. Do total de 29.262 pedidos de candidaturas para diversos cargos, 16.737 foram para deputado estadual, correspondendo a 57,2% do total de postulantes (TSE, 2025). Este volume de candidaturas e recursos sublinha a importância estratégica da formação de chapas competitivas.

O sistema eleitoral brasileiro para deputados adota a representação proporcional de lista aberta. Nesse modelo, embora os partidos ou federações precisem atingir uma proporção de votos para obter vagas, são os eleitores que, por meio do voto individual, definem quais candidatos ocuparão essas cadeiras (Ames, 2003). Tal característica confere um poder considerável aos candidatos individuais, evidenciado pelo fato de que, em 2022, 89,05% dos votos para deputado estadual foram nominais (TSE, 2025). A descontinuidade das legendas e as sucessivas mudanças de partidos pelos políticos também são traços relevantes do sistema político brasileiro (Rodrigues, 2009).

A partir de 2022, uma nova legislação eleitoral introduziu restrições significativas. Cada partido ou federação passou a ter que apresentar um número de candidatos igual ao total de cadeiras disponíveis mais um (Fisch e Mesquita, 2022). A proibição de coligações nas eleições proporcionais, somada a essas novas regras, impõe desafios adicionais na montagem das chapas. Assim, os atores políticos precisam negociar tanto a inclusão de candidatos quanto o investimento financeiro a ser alocado em cada campanha.

Diante desse cenário de recursos financeiros consideráveis, grande número de candidatos, mobilidade partidária e regras eleitorais complexas, os partidos enfrentam um desafio constante na distribuição de recursos e na composição de chapas eleitorais competitivas. Existe, portanto, uma lacuna prática na disponibilidade de soluções que utilizem inteligência de dados para auxiliar candidatos, partidos e federações na tomada de decisões estratégicas sobre a composição das chapas e a alocação de recursos em campanhas. Variáveis como sexo, profissão, idade, histórico de reeleição, recursos financeiros, padrões de distribuição de votos e condições políticas locais são reconhecidas como fatores que impactam o sucesso eleitoral e a competitividade dos candidatos (Ames, 2023; Gelape et al. 2024; Secchi et al. 2021). A escolha das chapas é uma prerrogativa da organização política partidária no nível estadual, reforçando a relevância do estado como arena política para cargos proporcionais (Ames, 2003; Rodrigues, 2009).

Nesse contexto, modelos de aprendizado de máquina baseados em árvores de decisão e florestas aleatórias apresentam-se como ferramentas promissoras. As árvores de decisão são amplamente utilizadas no apoio à tomada de decisão, oferecendo interpretação lógica e visual dos resultados, além de serem capazes de processar diversas variáveis e serem aplicáveis tanto para classificação quanto para regressão (Kotsiantis, 2013; Smith e Koning, 2021). Sua utilidade para análise econômica municipal já foi demonstrada (Dresch e Fagundes, 2021), indicando sua adequação para o estudo de fenômenos complexos como a previsão eleitoral.

A presente pesquisa justifica-se pela necessidade de ferramentas analíticas que otimizem a estratégia eleitoral em um ambiente complexo e competitivo, contribuindo para a tomada de decisão de partidos e candidatos. Desta forma, o objetivo do estudo é a análise da viabilidade de aplicação de um modelo de aprendizado supervisionado de árvores de classificação, regressão e florestas aleatórias para prever os resultados de uma eleição a partir do potencial de eleição e competitividade de candidatos e do potencial de obtenção de votos na disputa à deputado estadual no estado de São Paulo em 2022.

2. Material e Métodos

A pesquisa foi de natureza exploratória e experimental, visando analisar a viabilidade da aplicação de modelos de aprendizado de máquina para prever resultados eleitorais. O procedimento adotado consistiu na implementação de algoritmos de

Machine Learning

, seguindo o framework CRISP-DM (Schröer et al, 2021; Wirth e Hipp, 2000), um padrão da indústria para projetos de mineração e análise de dados, guiando a investigação.

A unidade de análise compreendeu todos os candidatos a deputado estadual no estado de São Paulo que concorreram nas eleições de 2022 e obtiveram ao menos um voto nominal, totalizando 1922 candidatos. Para a inclusão de dados de eleições anteriores, consideraram-se candidatos válidos aqueles cujo CPF estava presente na lista de 2022 e que haviam recebido ao menos um voto nominal em 2018 ou 2020, excluindo-se concorrentes a vice-prefeito em 2020.

Os dados utilizados foram secundários, levantados em conjuntos de dados públicos disponibilizados pelo Tribunal Superior Eleitoral (TSE) e pelo Instituto Brasileiro de Geografia e Estatística (IBGE). As informações eleitorais, demográficas, partidárias e econômicas abrangeram o período entre 2018 e 2022. A coleta dos dados ocorreu em janeiro de 2026, conforme as fontes originais do estudo.

A metodologia seguiu as seis etapas do framework CRISP-DM. Na fase de entendimento do negócio, definiram-se três variáveis dependentes: a condição de eleito ou não eleito (binária), a condição de competitivo ou não competitivo (binária, definida como obtenção de ao menos 10% do quociente eleitoral), e o total de votos nominais recebidos (numérica). As variáveis independentes, selecionadas com base na literatura e dados públicos, abrangeram temas demográficos, resultados eleitorais anteriores, dados econômicos e partidários.

Na etapa de entendimento e preparação dos dados, realizou-se o levantamento das bases do TSE (Portal de Dados Abertos em formato CSV) e do IBGE (PIB dos Municípios em formato XLSX). A conexão dos dados entre arquivos e anos foi feita por identificadores únicos. Variáveis categóricas ausentes foram padronizadas para “–“, e numéricas ausentes para zero. Variáveis categóricas foram transformadas em

dummy

.

Para a seleção das variáveis descritivas, realizou-se uma análise de significância estatística da associação entre cada variável descritiva e dependente. Para variáveis categóricas e binárias, utilizou-se o qui-quadrado; para numéricas, a correlação ponto-bisserial com teste t. Para a variável dependente numérica, empregou-se a análise de variância (ANOVA) para variáveis categóricas e o teste t sobre o coeficiente de Pearson para variáveis numéricas. Um p-valor de 0,05 determinou a significância.

A modelagem e avaliação dos modelos foram implementadas utilizando o pacote Scikit-Learn, versão 1.8.0, da linguagem de programação Python, versão 3.12. O algoritmo CART foi empregado para as árvores de decisão (Géron, 2025), e a replicabilidade foi assegurada pela semente randômica 42. A amostra foi dividida em conjuntos de treino e teste de forma estratificada: 70% para treino e 30% para teste nos modelos de eleitos; 80% para treino e 20% para teste nos de competitividade.

A seleção de hiperparâmetros e a poda das árvores foram realizadas por busca em grade (GridSearchCV) com validação cruzada de 5 dobras, utilizando a amostra de treino. A pontuação F1, combinando precisão e sensibilidade, foi a métrica principal para a configuração dos modelos de classificação, adequada para classes desbalanceadas (He e Garcia, 2008). Após a seleção dos parâmetros, realizou-se análise de sensibilidade com pontos de corte entre 0,1 e 0,9 para otimizar a pontuação F1.

Modelos de florestas aleatórias foram desenvolvidos de forma comparativa, utilizando os mesmos hiperparâmetros selecionados para as árvores de decisão, com 100 estimadores por modelo e o número de características limitado à raiz quadrada do total. A avaliação comparativa entre os modelos de classificação de eleitos e de floresta aleatória foi realizada na amostra de teste, considerando a pontuação F1 e a área sob a curva ROC (AUC-ROC).

Para o modelo de regressão, que previu o total de votos recebidos, a busca em grade foi utilizada para a escolha dos hiperparâmetros, e a métrica R² foi empregada para avaliar o desempenho. Os hiperparâmetros avaliados foram os mesmos da classificação, exceto pelo balanceamento de classes e pelo critério de separação dos nós, considerando erro quadrático e erro absoluto. A avaliação do modelo ocorreu com a amostra de treino.

3. Resultados e Discussão

A presente seção detalha os achados da pesquisa, interpretando-os à luz do objetivo de analisar a viabilidade de modelos de aprendizado supervisionado para prever resultados eleitorais. Os resultados são apresentados em etapas, começando pela preparação dos dados e testes de significância, seguidos pela avaliação dos modelos de classificação para eleitos e competitivos, e, por fim, os modelos de regressão para previsão de votos. A discussão integra a importância das variáveis e as implicações dos achados para a tomada de decisão estratégica no contexto eleitoral paulista de 2022.

A amostra do estudo compreendeu 1922 candidatos a deputado estadual em São Paulo em 2022 que obtiveram ao menos um voto nominal. Desses, 94 foram eleitos e 213 foram classificados como competitivos, ou seja, alcançaram no mínimo 10% do quociente eleitoral, que foi de 24.083 votos, calculado a partir de 22.637.782 votos válidos para 94 vagas em disputa. A análise revelou que 52% das candidaturas em 2022 possuíam dados de eleições anteriores (2018 ou 2020), enquanto 48% não apresentavam histórico eleitoral prévio, o que se mostrou um desafio para a modelagem.

Preparação dos dados e testes de significância

A etapa de preparação dos dados envolveu a análise de significância estatística das variáveis descritivas em relação às variáveis dependentes. Para a variável dependente binária “eleito ou não”, diversas variáveis categóricas e binárias demonstraram significância estatística. Entre as categóricas, a raça/cor, o grau de instrução, a ocupação, a autodeclaração de disputa à reeleição, o cargo disputado em 2018 e 2020, e o partido do candidato em 2018 e 2022 foram consideradas significantes. Variáveis como gênero, estado civil e partido do candidato em 2020, no entanto, não apresentaram significância estatística e foram, portanto, excluídas do modelo de classificação de eleitos.

Em relação às variáveis descritivas binárias para a previsão de eleitos, a participação em eleições anteriores (2018 e 2020) e o fato de ter sido eleito em 2018 mostraram-se estatisticamente significantes. A mudança de partido entre 2018 e 2022, e entre 2020 e 2022, também apresentou significância. Contudo, a variável indicando se o candidato foi eleito em 2020 não demonstrou relevância estatística para a previsão de eleitos em 2022, o que sugere uma dinâmica eleitoral específica ou a menor influência de resultados de eleições municipais para o cargo estadual.

Para as variáveis descritivas numéricas na previsão de eleitos, os votos nominais recebidos em 2018 e 2020, as receitas de campanha em 2018, 2020 e 2022, e os bens declarados em 2018 e 2022 foram considerados estatisticamente significantes. Por outro lado, a idade do candidato, o aumento percentual de receitas e bens, o PIB do município em 2022 e a receita de campanha em 2020 não apresentaram significância estatística. No total, 21 das 30 variáveis descritivas foram mantidas no modelo de classificação de eleitos, indicando a complexidade dos fatores que influenciam o sucesso eleitoral.

Ao analisar a variável dependente binária “competitividade”, observou-se que todas as variáveis descritivas categóricas e binárias foram estatisticamente significantes. Isso inclui gênero, raça/cor, grau de instrução, estado civil, ocupação, autodeclaração de reeleição, cargo disputado em 2018 e 2020, partido em 2022, e partido padronizado em 2018 e 2020. A abrangência da significância para a competitividade sugere que este conceito é influenciado por um espectro mais amplo de características do candidato e de seu histórico político-eleitoral.

As variáveis binárias como participação em eleições anteriores (2018 e 2020), ter sido eleito em 2018 e 2020, e a mudança de partido entre os períodos também foram significantes para a competitividade. No entanto, entre as variáveis numéricas, a idade do candidato na data da posse, o aumento percentual da receita e dos bens, e o PIB do município em 2022 não se mostraram significantes. A idade, apesar de não significante, foi mantida no modelo de competitividade devido à sua importância em etapas preliminares da pesquisa, indicando que, embora não diretamente correlacionada, pode ter um papel nas árvores de decisão.

Para a variável dependente numérica “total de votos recebidos em 2022”, a análise de significância revelou que todas as variáveis descritivas categóricas e binárias foram estatisticamente significantes. Isso inclui características demográficas, histórico de participação e eleição, e filiação partidária. As variáveis numéricas, como votos nominais em 2018 e 2020, receitas de campanha em 2018, 2020 e 2022, e bens declarados em 2018 e 2022, também foram significantes. A variação percentual do PIB do município entre 2019 e 2022 também se mostrou relevante.

Contudo, algumas variáveis numéricas não apresentaram significância estatística para a previsão do total de votos, sendo elas o aumento percentual das receitas e bens do candidato, o PIB do município em 2022 e o valor da receita de campanha de 2020. Essas variáveis foram, portanto, omitidas do modelo de regressão. A idade do candidato, embora significante, teve uma correlação de Pearson de 0,04644, indicando uma influência limitada, mas ainda presente, na quantidade de votos recebidos.

Resultados dos modelos de classificação de eleitos

O modelo de classificação de eleitos, utilizando uma árvore de decisão, foi configurado com o critério de entropia para divisão dos nós, profundidade máxima de cinco níveis, mínimo de dez amostras por nó terminal e mínimo de duas amostras para divisão dos nós, sem balanceamento de pesos. Este modelo alcançou um AUC-ROC de 98,44% na amostra de treinamento. A análise de sensibilidade indicou que o ponto de corte de 0,3 proporcionou o melhor equilíbrio entre precisão e sensibilidade, resultando em uma pontuação F1 de 0,6992.

Em comparação, o modelo de floresta aleatória para classificação de eleitos, treinado com os mesmos hiperparâmetros e 100 estimadores, obteve um AUC-ROC de 97,82% na amostra de treinamento. A análise de sensibilidade para este modelo também apontou o ponto de corte de 0,3 como o mais eficaz, com uma pontuação F1 de 0,6777. Ambos os modelos demonstraram alta capacidade preditiva na amostra de treinamento, com valores de AUC-ROC superiores a 97%.

Na avaliação comparativa dos modelos na base de teste, a árvore de classificação unitária apresentou uma precisão de 0,8571 e sensibilidade de 0,6429, resultando em um F1 de 0,7347 e AUC-ROC de 0,9679. O modelo de floresta aleatória, por sua vez, obteve precisão de 0,6207, sensibilidade de 0,6429, F1 de 0,6316 e AUC-ROC de 0,9718. Embora a floresta aleatória tenha apresentado um AUC-ROC ligeiramente superior, a árvore de classificação unitária demonstrou melhor precisão e pontuação F1, o que pode ser atribuído à construção de árvores com subconjuntos aleatórios de características na floresta aleatória, que podem incluir variáveis com menor poder preditivo.

Apesar dos bons resultados em métricas como F1 e AUC-ROC, a capacidade do modelo de classificação de eleitos para prever a situação de eleito não se mostrou robusta. A prevalência da reeleição, que representou 60% dos eleitos na eleição estudada, limitou a capacidade dos modelos de identificar padrões de elegibilidade para novos candidatos ou aqueles sem histórico. O F1 de 0,7347, embora expressivo, é muito próximo do que seria obtido se o modelo simplesmente considerasse a busca pela reeleição como o principal preditor de eleição, indicando uma fragilidade na generalização para cenários mais amplos.

Resultados dos modelos de classificação de candidatos competitivos

Para a classificação de candidatos competitivos, o modelo de árvore de decisão foi configurado com o critério de entropia, profundidade máxima de nove níveis, mínimo de uma amostra por nó terminal e mínimo de onze amostras para divisão dos nós, sem balanceamento de classes. Este modelo alcançou um AUC-ROC de 99,47% na amostra de treinamento. A análise de sensibilidade indicou que o ponto de corte de 0,4 resultou em uma sensibilidade superior a 90% e precisão acima de 80%, enquanto o ponto de corte de 0,3 proporcionou o melhor equilíbrio entre precisão e sensibilidade, com um F1 de 0,8663.

O modelo de floresta aleatória para classificação de candidatos competitivos, treinado com os mesmos parâmetros e 100 estimadores, obteve um AUC-ROC de 98,95% na amostra de treinamento. A análise de sensibilidade para este modelo indicou o ponto de corte de 0,3 como o mais eficaz, alcançando uma pontuação F1 de 0,8649. Ambos os modelos demonstraram excelente desempenho na amostra de treinamento, com AUC-ROC muito próximos de 99%, sugerindo uma alta capacidade de identificar candidatos competitivos.

Na avaliação comparativa dos modelos na base de teste, o modelo de floresta aleatória superou a árvore de classificação unitária. A floresta aleatória obteve um AUC-ROC de 0,9473 e um F1 de 0,7073, com precisão de 0,7436 e sensibilidade de 0,6744. Em contraste, a árvore de classificação unitária apresentou um AUC-ROC de 0,8430 e um F1 de 0,6522, com precisão de 0,6122 e sensibilidade de 0,6977. A superioridade da floresta aleatória, com mais de dez pontos percentuais de AUC-ROC e maior F1, a torna a ferramenta mais viável para identificar candidatos com chances reais no cenário político.

A capacidade do modelo de floresta aleatória para classificação de competitividade foi notável ao identificar nove dos dezesseis candidatos eleitos em 2022 que não possuíam histórico eleitoral em 2018 e 2020 como competitivos. Isso demonstra a utilidade do modelo para destacar potenciais novos talentos ou candidatos com trajetórias políticas menos convencionais. Um exemplo é o caso de Helinho Zanata, que, apesar de não ter dados de eleições anteriores no período analisado, foi um prefeito eleito em 2012 e 2016 em diferentes cidades, e o modelo de floresta aleatória o classificaria corretamente como competitivo se o ponto de corte fosse ajustado para 0,2.

Resultados dos modelos de regressão para previsão da quantidade de votos

O modelo de regressão baseado em árvore de decisão para prever a quantidade de votos nominais foi configurado com o critério de erro quadrático, profundidade máxima de sete níveis, mínimo de quinze amostras por nó terminal e mínimo de duas amostras para divisão dos nós. Ao ser aplicado à amostra de teste, o modelo obteve um coeficiente de determinação (R²) de 0,5162. Este valor indica que as variáveis descritivas utilizadas explicam 51,62% da variação total dos votos recebidos por um candidato em 2022.

O modelo de floresta aleatória para regressão, utilizando os mesmos parâmetros e 100 estimadores, demonstrou um desempenho superior, alcançando um R² de 0,5590 na amostra de teste. Isso significa que as variáveis descritivas em conjunto foram capazes de explicar 55,90% da quantidade de votos recebidos. Embora a capacidade de explicação de mais de 50% seja relevante, o resultado ainda sugere que há espaço para a inclusão de novas características que possam aprimorar a descrição do comportamento do total de votos, como métricas de redes sociais ou indicadores de força política e financeira.

Explicabilidade

A análise de importância das variáveis para o modelo final de classificação de eleitos revelou que a receita do candidato em 2022 (VR_RECEITA_2022) foi a característica dominante, contribuindo com 67,4% da importância. Os votos nominais recebidos em 2018 (2018_QT_VOTOS_NOMINAIS) e 2020 (2020_QT_VOTOS_NOMINAIS) também foram significativos, com 15,2% e 6,4% de importância, respectivamente. A receita de 2020 (VR_RECEITA_2020) e os bens do candidato em 2022 (VR_BEM_CANDIDATO_2022) tiveram importâncias menores, de 5,0% e 3,0%, respectivamente, enquanto o partido do candidato em 2022 (SG_PARTIDO_PSDB) contribuiu com 1,8%.

Para o modelo de classificação de candidatos competitivos, utilizando floresta aleatória, foram identificadas 172 variáveis, sendo 18 delas com mais de 1% de importância. A receita do candidato em 2022 (VR_RECEITA_2022) manteve-se como a mais importante, com 23,4%. Os votos nominais de 2018 (2018_QT_VOTOS_NOMINAIS) e a autodeclaração de reeleição (ST_REELEICAO) também foram cruciais, com 10,3% e 6,0% de importância, respectivamente. Variáveis como ter sido eleito em 2018 (2018_ELEITO) e a receita de 2018 (VR_RECEITA_2018) também se destacaram, com 5,8% cada. A maior quantidade de características com impacto no modelo de competitividade ajudou a mitigar a dificuldade de classificar candidatos sem dados de eleições anteriores.

No modelo de regressão para previsão da quantidade de votos, as variáveis mais importantes foram os votos nominais de 2018 (2018_QT_VOTOS_NOMINAIS) com 25,84%, seguidos pela receita de 2022 (VR_RECEITA_2022) com 20,46%, e o fato de ter sido eleito em 2018 (2018_ELEITO) com 16,85%. A receita de 2018 (VR_RECEITA_2018) e a autodeclaração de reeleição (ST_REELEICAO) também foram relevantes, com 11,26% e 9,07% de importância, respectivamente. A ocupação do candidato (DS_OCUPACAO_DEPUTADO), os votos nominais de 2020 (2020_QT_VOTOS_NOMINAIS), os bens do candidato em 2022 (VR_BEM_CANDIDATO_2022), os bens em 2018 (VR_BEM_CANDIDATO_2018) e a idade do candidato (NR_IDADE_DATA_POSSE) completaram as dez principais variáveis, demonstrando a forte influência do histórico eleitoral e financeiro.

Observou-se uma redundância em variáveis que definem a reeleição, como a ocupação de deputado, a autodeclaração de reeleição e o status de eleito em 2018, que apareceram em quatro das variáveis listadas. Isso reforça a importância do histórico eleitoral para a previsão. As variáveis demográficas, como raça, gênero e estado civil, tiveram baixa presença nos modelos finais, indicando que, embora possam ser significantes em testes univariados, sua contribuição preditiva é menor quando combinadas com outras características mais fortes. A idade do candidato, embora com baixa importância, foi a única variável demográfica que se manteve relevante em alguns modelos.

Em síntese, os modelos de aprendizado supervisionado, especialmente as florestas aleatórias, demonstraram viabilidade para prever a competitividade de candidatos a deputado estadual em São Paulo, com o modelo de floresta aleatória para competitividade alcançando um F1 de 0,7073 e um AUC-ROC de 0,9473 na amostra de teste. Este resultado promissor oferece uma ferramenta valiosa para partidos e candidatos na tomada de decisões estratégicas. Contudo, os modelos para prever a eleição e a quantidade de votos nominais, embora com R² de até 0,5590, ainda necessitam de aprimoramento e inclusão de novas características para maior robustez e explicabilidade, especialmente para candidatos sem histórico eleitoral prévio.

4. Conclusão

O presente estudo analisou a viabilidade de aplicação de modelos de aprendizado supervisionado, especificamente árvores de classificação, regressão e florestas aleatórias, para prever resultados eleitorais na disputa para deputado estadual em São Paulo em 2022, considerando o potencial de eleição, competitividade e obtenção de votos dos candidatos. Verificou-se que o modelo de floresta aleatória para classificação de candidatos competitivos demonstrou alta capacidade preditiva, alcançando uma pontuação F1 de 0,7073 e um AUC-ROC de 0,9473 na amostra de teste. Este resultado indica que características de eleições passadas, como votos nominais e participação, juntamente com recursos financeiros, são preditores relevantes para a competitividade eleitoral. A principal contribuição prática deste estudo reside na oferta de uma ferramenta viável para auxiliar partidos e candidatos na tomada de decisões estratégicas, permitindo a identificação de postulantes com chances reais de sucesso, inclusive aqueles sem histórico eleitoral prévio, como observado na correta classificação de nove dos dezesseis eleitos sem dados anteriores.

Contudo, os modelos desenvolvidos para prever a eleição de candidatos e a quantidade de votos nominais foram considerados insuficientes para uma robusta generalização, especialmente devido à alta prevalência da reeleição e à dificuldade em identificar padrões para novos candidatos. O R² de até 0,5590 nos modelos de regressão, embora relevante, sugere a necessidade de aprimoramento. Como limitação, a ausência de dados de eleições anteriores para quase metade da amostra representou um desafio. Para estudos futuros, recomenda-se a inclusão de novas características, como métricas de redes sociais e indicadores de força política e financeira, para aprimorar a previsão de votos. Sugere-se também a avaliação de técnicas para prever o total de votos de chapas eleitorais completas e a comparação dos modelos propostos com abordagens estatísticas tradicionais, além da aplicação em outros contextos eleitorais brasileiros.

Referências Bibliográficas

Ames, B. 2003. Os entraves da democracia no Brasil. Editora FGV, Rio de Janeiro, RJ, Brasil.

Dresch, L.O.; Fagundes, M.B.B. 2021. Perfil econômico dos municípios do estado de Mato Grosso do Sul e sua influência no desenvolvimento municipal. Informe GEPEC 25(2), 42–61.

Fisch, A.; Mesquita, L. 2022. Reformas eleitorais no Brasil contemporâneo: mudanças no sistema proporcional e de financiamento eleitoral. Estudos Avançados, 36(106), 33-53.

Gelape, L.; Luz, J.; Thomé, D. 2024. Padrões espaciais de votação nas eleições para a Câmara Municipal de São Paulo: um estudo a partir das eleições de 2020. Estudos Avançados, 38(111), 301-323.

Géron, A. 2025. Mãos à obra: aprendizado de máquina com Scikit-Learn, Keras & TensorFlow. 3ed. Alta Books, Rio de Janeiro, RJ, Brasil.

He, H.; Garcia, E. A. 2009. Learning from Imbalanced Data. IEEE Transactions on Knowledge and Data Engineering, 21(9), 1263-1284

Kotsiantis, S.B. 2013. Decision trees: a recent overview. Artificial Intelligence Review, 39(4), 261-283.

Rodrigues, L.M. 2009. Partidos, ideologia e composição social: um estudo das bancadas partidárias na câmara dos deputados. Centro Edelstein, Rio de Janeiro, RJ, Brasil. Disponível em: <https://books.scielo.org/id/9yf86>. Acesso em: 19 out. 2025.

Schröer, C.; Kruse, F.; Gómez, J.M. 2021. A systematic literature review on applying CRISP-DM process model. Procedia computer science, 181(2021), 526-534.

Secchi, L.; Wink Junior, M.V.; Moraes, C.J. 2021. Crowdfunding e desempenho eleitoral no Brasil: análise estatística das eleições para deputado federal em 2018. Revista de Administração Pública 55(5), 1191-1214.

Smith, C.; Koning, M. 2017. Decision trees and random forests: a visual introduction for beginners: a simple guide to machine learning with decision trees. Blue Windmill Media.

Tribunal Superior Eleitoral [TSE]. 2025. Estatísticas Eleitorais. Disponível em: <https://sig.tse.jus.br/ords/dwapr/seai/r/sig-eleicao>. Acesso em: 20 out. 2025.

Wirth, R.; Hipp, J. 2000. CRISP-DM: Towards a standard process model for data mining. In Proceedings of the 4th international conference on the practical applications of knowledge discovery and data mining Vol. 1, 29-39.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

También te puede interesar

08 de octubre de 2026

Disrupções analíticas para a governança da pesca artesanal na Amazônia: Novas abordagens para dados limitados de desembarque

Técnicas de machine learning foram propostas para a governança da pesca artesanal na Amazônia, buscando superar limitações de dados de desembarque. O estudo objetivou constituir grupos de manejo, avaliar tendências temporais e propor modelos de predição para dados de desembarque pesqueiro, a fim de apoiar a tomada de decisão e o ordenamento. Os dados de desembarque, coletados entre 2010 e 2022 nos rios Baixo Amazonas e Baixo Araguaia-Tocantins, foram integralizados em uma matriz de análise. Adotou-se a família taxonômica como unidade de estoque funcional para agrupar os dados. Foram empregadas técnicas multivariadas de agrupamento (clusterização hierárquica e K-means), análise e simulação de séries temporais (modelo ARIMA Forecast otimizado) e técnicas multivariadas confirmatórias (modelos de regressão em painel longitudinal). A análise de agrupamento segmentou grupos de estoques funcionais por faixas de quilos de peixe (Alvos Mistos, Alvos Baixo Araguaia-Tocantins, Alvos Baixo Amazonas). A investigação de padrões temporais revelou que o atraso de 12 meses foi a melhor alternativa, indicando que as pescarias de um ano afetam as do ano seguinte. Os modelos ARIMA-Forecast otimizados foram bem ajustados, mas não detectaram tendência de declínio ou aumento no comportamento temporal, sugerindo estratégias de adaptação da pesca artesanal. O modelo em painel indicou um quadro estratégico de priorização de estoques funcionais para monitoramento e ordenamento. As abordagens analíticas disruptivas e inovadoras desenvolvidas modernizaram os protocolos de governança da pesca artesanal na Amazônia, fornecendo um painel de indicações estratégicas para o manejo, especialmente nas regiões do Baixo Amazonas e Baixo Araguaia-Tocantins.

Palavras-chave: Amazônia; Desembarque pesqueiro; Estoques funcionais; Governança; Manejo.

08 de octubre de 2026

Transformação de Dados Transacionais em Inteligência de Negócio: Framework de “Data Wrangling” e “Dashboards”

A evolução das capacidades de captura e processamento de dados tornou imperativa a transformação de informações para tomada de decisão ágil e bem-informada. O estudo focou na aplicação de conhecimentos da ciência de dados para capturar, processar e manipular dados transacionais de um comércio britânico, visando facilitar a compreensão e a tomada de decisões sobre consumidores, produtos e vendas. Utilizou-se uma abordagem qualitativa do tipo pesquisa-ação, empregando dados transacionais de um varejo digital do Reino Unido. Os dados foram tratados em Python, aplicando técnicas de data wrangling, modelagem dimensional em esquema estrela e métodos estatísticos como Tuckey Fences (IQR) para normalização de preços. A segmentação de consumidores foi realizada por meio do algoritmo K-Means, considerando frequência e valor monetário. Os dados processados foram então carregados e visualizados em dashboards interativos no Power BI. Os resultados revelaram a identificação de diferentes perfis de consumidores, destacando a importância de clientes de alto valor e a oportunidade de crescimento em mercados específicos. Observaram-se tendências de vendas sazonais e anomalias em dados de produtos, evidenciando a necessidade de governança de dados. Concluiu-se que o framework desenvolvido permite transformar dados brutos em diagnósticos estratégicos, promovendo a maturidade digital e a tomada de decisão baseada em dados.

Palavras-chave: Clustering; Dashboards; Data Wrangling; Power BI.

08 de octubre de 2026

Precificação dinâmica de estúdios por temporada com algoritmos “multi-armed bandits”

As plataformas digitais de hospedagem transformaram o mercado de aluguel por temporada na última década, tornando a precificação um determinante crucial do desempenho econômico dos imóveis. Investigou-se como algoritmos da classe “Multi-Armed Bandits” (MAB) podem otimizar essa decisão de preço, comparando-se as estratégias ε-Greedy, Upper Confidence Bound (UCB) e Thompson Sampling (TS). A base analítica reuniu 2.284 observações de 571 estúdios no Rio de Janeiro, coletadas entre junho de 2024 e março de 2025. A qualidade percebida dos imóveis foi sintetizada por Análise de Componentes Principais (PCA), e a demanda modelada por regressão linear ordinária (OLS) com sete variáveis significativas. O modelo explicou 10% da variação na ocupação. Simulações foram realizadas em 1.000 rodadas e 50 repetições estocásticas em cenários estacionário e dinâmico multi-estação. No cenário estacionário, o UCB maximizou a receita acumulada, seguido por ε-Greedy e TS. No cenário dinâmico multi-estação, o UCB manteve a receita absoluta mais alta, mas o TS apresentou queda relativa menor entre cenários, indicando maior adaptabilidade à volatilidade sazonal. Concluiu-se que, em mercados oscilantes, a adaptabilidade bayesiana do TS compensou seu custo de exploração, tornando-o mais robusto a mudanças de contexto.

Palavras-chave: Aprendizado por reforço; Decisão sequencial sob incerteza; Hospedagem de curta duração; Otimização de receita; Sazonalidade turística.

08 de octubre de 2026

Otimização do processo de gaseificação de biomassa para produção de hidrogênio usando redes neurais agregadas

A matriz mundial de produção de hidrogênio ainda é dependente em 98% de fontes fósseis, gerando um passivo ambiental de aproximadamente 9 kg de CO2 para cada kg de H2 produzido. No cenário brasileiro, a gaseificação do bagaço de cana-de-açúcar surge como uma alternativa de baixo carbono, porém a complexidade e a não-linearidade das reações termoquímicas dificultam o controle e a maximização do rendimento por métodos convencionais. O estudo objetivou identificar parâmetros operacionais ótimos para a gaseificação de biomassa, visando maximizar a fração molar de hidrogênio, por meio de uma abordagem computacional integrada que combinou simulação termodinâmica e técnicas de inteligência artificial. Para tal, o processo de gaseificação foi simulado no software Aspen Plus e, após validação com dados da literatura, gerou uma base de dados de 1.000 cenários por amostragem via hipercubo latino. Esses dados alimentaram um metamodelo de redes neurais agregadas por bootstrap (BANN) com 57 neurônios, seguido da aplicação do algoritmo de otimização por enxame de partículas (PSO) para a busca do ótimo global. O metamodelo alcançou um coeficiente de determinação R² de 0,9902 no conjunto de teste, indicando elevada capacidade preditiva. A otimização revelou que a fração molar de hidrogênio pode atingir 67,54% após enriquecido por meio da reação de deslocamento do gás de água (WGS) sob condições de 857,12 °C e razão de equivalência (ER) de 0,10. A integração BANN-PSO reduziu o custo computacional da otimização em aproximadamente 5.400 vezes em relação à simulação direta no Aspen Plus, identificando condições operacionais que maximizam a fração molar de hidrogênio para 67,54% na entrada da PSA. Ao integrar modelagem termodinâmica, aprendizado de máquina, otimização metaheurística e técnicas de interpretabilidade, o estudo contribuiu para o avanço metodológico na análise e intensificação de processos de produção de hidrogênio a partir de biomassa, oferecendo uma estrutura computacional reprodutível e aplicável a sistemas energéticos complexos no contexto da transição energética.

Palavras-chave: Aprendizado de máquina; Bagaço de cana; Gás de síntese; Meta-heurística; Sustentabilidade.

08 de octubre de 2026

Ferramentas de gestão do tempo em uma instituição bancária na cidade de São Paulo

A gestão do tempo constitui-se como um diferencial competitivo estratégico, especialmente no setor bancário, ambiente caracterizado por alta pressão e constante transformação tecnológica. O estudo teve como objetivo analisar as percepções dos colaboradores de uma instituição bancária na cidade de São Paulo acerca da eficácia e aplicabilidade das ferramentas de gestão do tempo em suas rotinas profissionais. Para isso, adotou-se uma metodologia de pesquisa descritiva, de abordagem quantitativa, operacionalizada por meio de um levantamento (survey) que envolveu 37 colaboradores, os quais responderam a um questionário estruturado de 14 questões. Os resultados revelaram que, embora 45,9% dos respondentes planejassem a maior parte de suas atividades, a técnica predominante utilizada foi a de listas de tarefas simples (64,9%), com baixa adesão a métodos mais estruturados. Os maiores obstáculos identificados para a gestão eficaz do tempo foram as interrupções não planejadas (43,2%) e o excesso de reuniões improdutivas. Um dado crítico apontou que a gestão ineficiente do tempo impactou diretamente a saúde mental e o estresse de 48,6% da amostra. Concluiu-se que a eficácia da gestão do tempo no ambiente bancário depende não apenas da adoção de ferramentas individuais, mas também de uma mudança na cultura organizacional que privilegie o trabalho focado e a redução da fragmentação das atividades. Recomendaram-se a implementação de práticas como o Time Blocking e a adoção de protocolos de reuniões mais objetivos para mitigar a sobrecarga e promover o bem-estar sustentável.

Palavras-chave: Bem-estar ocupacional; Cultura organizacional; Eficiência operacional; Metodologias ágeis; Produtividade.

Neurociencia Y Aprendizaje En La Educación

08 de octubre de 2026

Consequências do Uso de IA Generativa na Capacidade Cognitiva e Saúde Mental de Profissionais Brasileiros

A integração de ferramentas de inteligência artificial generativa (GenAI) no trabalho acelerou-se nos últimos anos, levantando questões sobre seus efeitos nos processos cognitivos e no bem-estar emocional dos profissionais. O estudo objetivou mensurar o impacto do uso de GenAI sobre capacidades cognitivas autorreferidas e indicadores de saúde mental de profissionais brasileiros, comparando os achados com evidências empíricas internacionais. Adotou-se uma abordagem mista, com delineamento transversal e não experimental, aplicando um questionário digital estruturado a 108 profissionais adultos brasileiros, recrutados via LinkedIn e WhatsApp. O instrumento avaliou memória de trabalho, atenção sustentada e alternada, controle inibitório, flexibilidade cognitiva, tecnoestresse, saúde mental e senso de propósito profissional, além de percepções qualitativas. Os resultados revelaram que 92,6% dos respondentes utilizaram GenAI regularmente, com impacto percebido majoritariamente positivo no desempenho, mas acompanhado por dependência declarada em 52,8% da amostra. A atenção sustentada mostrou-se a dimensão cognitiva mais fragilizada, e os indicadores de equilíbrio emocional e desconexão digital concentraram os resultados mais críticos. A análise comparativa identificou uma relação entre maior frequência de uso, maior dependência e menores escores cognitivos, com declínio progressivo da atenção focada ao longo do tempo de uso. Concluiu-se que o uso intensivo de GenAI coexiste com fragilidades cognitivas e emocionais mensuráveis, cujos efeitos tendem a se acumular, reforçando a necessidade de práticas conscientes que preservem a autonomia intelectual dos profissionais.

Palavras-chave: Cognição; Dependência tecnológica; Inteligência artificial; Saúde mental.

Neurociencia Y Aprendizaje En La Educación

08 de octubre de 2026

A contribuição da neuroaprendizagem na elaboração de objetos educacionais multimídia para a recomposição de aprendizagens

A defasagem de aprendizagem na educação brasileira, agravada pela pandemia de Covid-19 e evidenciada por resultados insatisfatórios do SAEB, tornou a recomposição de aprendizagens uma prioridade nacional. O presente trabalho analisou como a produção audiovisual, integrante de um programa de recomposição de aprendizagens em Língua Portuguesa e Matemática, desenvolvido para estudantes do 9º ano do Ensino Fundamental de uma rede estadual, incorporou fundamentos da neurociência da aprendizagem em sua estrutura metodológica. A pesquisa caracterizou-se como estudo de caso qualitativo e aplicado, e analisou 20 roteiros pedagógicos e as respectivas videoaulas produzidas e aplicadas em 2024. A partir do referencial teórico, construíram-se sete dimensões de análise: ludicidade e interatividade, funcionamento cerebral e aprendizagem, emoção e cognição, singularidade do estudante, contexto sociocultural, mediação pedagógica consistente e aprendizagem ativa. Os resultados indicaram que elementos da neuroaprendizagem foram incorporados de forma estrutural à metodologia do programa. Identificou-se que a personalização da aprendizagem não reside exclusivamente no objeto audiovisual, mas na cadeia sistêmica que o envolve, incluindo diagnóstico, produção, mediação presencial e monitoramento. A integração entre neurociência, conteúdos dedicados à superação de lacunas e linguagem audiovisual demonstrou ser uma estratégia metodologicamente consistente e com potencial relevante para ampliar a eficácia de programas de recomposição de aprendizagens.

Palavras-chave: Defasagem; Eduentretenimento; Mediação pedagógica; Plasticidade cerebral; Videoaula.

Gestión Escolar

08 de octubre de 2026

Lei do Novo Ensino Médio: monitoramento e avaliação da qualidade após a reforma

A qualidade do Ensino Médio no Brasil tem sido objeto de debates diante das mudanças iniciadas pela Lei nº 13.415/2017 e reestruturadas pela Lei nº 14.945/2024. Analisou-se a evolução de indicadores associados à qualidade do Ensino Médio entre 2017 e 2024, considerando aprendizagem, fluxo, permanência e equidade, e discutiram-se as implicações dos mecanismos federais de monitoramento para a gestão escolar. Realizou-se estudo exploratório e descritivo, de abordagem quantitativa e natureza documental, com dados secundários do Inep sistematizados pela plataforma QEdu e documentos oficiais do Ministério da Educação. Examinaram-se taxas de aprovação, reprovação e abandono, distorção idade-série, aprendizagem adequada no Saeb e desigualdades por rede de ensino, nível socioeconômico e unidade federativa. Os resultados mostraram melhora do fluxo e redução da distorção idade-série, mas permanência de baixos níveis de aprendizagem e desigualdades expressivas. A análise documental indicou maior estruturação da governança e do monitoramento da política, ainda sem avaliação consolidada de seus efeitos sobre a aprendizagem. Para a gestão escolar, os achados orientaram o acompanhamento da transição para a 1ª série, a identificação de riscos de abandono, a recomposição das aprendizagens e a priorização de grupos mais vulneráveis. Concluiu-se que a qualidade exige a leitura articulada de indicadores e decisões contextualizadas, sem atribuir exclusivamente ao Novo Ensino Médio relações causais que o desenho desta pesquisa não permite estabelecer.

Palavras-chave: Aprendizagem; Equidade educacional; Gestão escolar; Permanência escolar; Política educacional.

08 de octubre de 2026

Modelagem de emissão de CO2: Clusterização a partir de variáveis socioeconômicas e energéticas.

Um estudo aplicou técnicas de clusterização, com foco no algoritmo K-means, para agrupar os 20 membros do G20, incluindo a União Europeia, com base em sete variáveis socioeconômicas, energéticas e ambientais referentes ao ano de 2025. As variáveis consideradas foram Produto Interno Bruto (PIB), população, emissões de CO2 per capita, emissões de CO2 da construção civil, Índice de Desenvolvimento Humano (IDH), índice de Gini e participação de fontes renováveis na matriz energética. A relevância do setor da construção civil para as emissões globais e seu potencial de redução justificaram sua inclusão. O número ótimo de agrupamentos foi determinado pela combinação do método do cotovelo e do Índice de Silhouette, resultando em quatro clusters distintos. A Análise de Componentes Principais (PCA) foi empregada para visualizar os agrupamentos, e as duas primeiras componentes explicaram 69,86% da variabilidade dos dados. O Cluster 0, composto por China e Índia, caracterizou-se por elevada população e altas emissões da construção civil. O Cluster 1, com 12 países, apresentou alto desenvolvimento humano e elevadas emissões per capita. O Cluster 2, formado por Brasil, Indonésia, México e África do Sul, exibiu o menor PIB médio, maior desigualdade e baixas emissões per capita. O Cluster 3, que incluiu Estados Unidos e União Europeia, concentrou o maior PIB médio e as maiores emissões per capita. Os resultados evidenciaram a heterogeneidade entre os países do G20 e reforçaram a necessidade de políticas climáticas diferenciadas, adaptadas às características de cada grupo.

Palavras-chave: Cluster; CO2; Emissão; K-means; Países.