08 de octubre de 2026
Árvores de classificação e regressão para previsão dos resultados de deputados estaduais em São Paulo
Árvores de Classificação e Regressão para Previsão dos Resultados de Deputados Estaduais em São Paulo
Kaléu Puskas Diedrich Caminha; Thiago Gentil Ramires
DOI: 10.22167/2675-6528-202603097
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
As eleições no Brasil movimentam recursos significativos, e a formação de chapas competitivas é um desafio para os partidos. Avaliou-se a viabilidade de modelos de classificação e regressão baseados em árvores de decisão e florestas aleatórias para identificar candidatos com potencial de eleição e competitividade, e para prever sua votação nominal na disputa para deputado estadual em São Paulo em 2022. A amostra incluiu todos os candidatos a deputado estadual em São Paulo em 2022, utilizando dados eleitorais, demográficos, partidários e econômicos do período entre 2018 e 2022. A seleção de hiperparâmetros foi realizada por busca em grade, seguida de análise de sensibilidade para o ponto de corte, e a pontuação F1 foi a métrica principal. Comparou-se os modelos de árvore de decisão e floresta aleatória usando F1 e AUC-ROC. O modelo de classificação de candidatos competitivos alcançou uma pontuação F1 de 0,70 e 94% de AUC-ROC, demonstrando ser uma ferramenta viável para auxiliar a tomada de decisão de partidos e candidatos. Os modelos de previsão de eleitos e de votos nominais foram considerados insuficientes. Concluiu-se que características de eleições passadas e o conceito de competitividade são preditores relevantes para a previsibilidade eleitoral, e que o uso de árvores de classificação e regressão, especialmente florestas aleatórias, é adequado para a previsibilidade da competitividade de candidatos.
Palavras-chave: Análise de sensibilidade; Competitividade eleitoral; Florestas aleatórias; Scikit-Learn.
1. Introdução
As eleições no Brasil, especialmente para cargos proporcionais, representam um cenário de alta complexidade e significativo investimento financeiro. Em 2022, as eleições ordinárias no país movimentaram R$ 6,4 bilhões em despesas pagas por candidatos e partidos. Do total de 29.262 pedidos de candidaturas para diversos cargos, 16.737 foram para deputado estadual, correspondendo a 57,2% do total de postulantes (TSE, 2025). Este volume de candidaturas e recursos sublinha a importância estratégica da formação de chapas competitivas.
O sistema eleitoral brasileiro para deputados adota a representação proporcional de lista aberta. Nesse modelo, embora os partidos ou federações precisem atingir uma proporção de votos para obter vagas, são os eleitores que, por meio do voto individual, definem quais candidatos ocuparão essas cadeiras (Ames, 2003). Tal característica confere um poder considerável aos candidatos individuais, evidenciado pelo fato de que, em 2022, 89,05% dos votos para deputado estadual foram nominais (TSE, 2025). A descontinuidade das legendas e as sucessivas mudanças de partidos pelos políticos também são traços relevantes do sistema político brasileiro (Rodrigues, 2009).
A partir de 2022, uma nova legislação eleitoral introduziu restrições significativas. Cada partido ou federação passou a ter que apresentar um número de candidatos igual ao total de cadeiras disponíveis mais um (Fisch e Mesquita, 2022). A proibição de coligações nas eleições proporcionais, somada a essas novas regras, impõe desafios adicionais na montagem das chapas. Assim, os atores políticos precisam negociar tanto a inclusão de candidatos quanto o investimento financeiro a ser alocado em cada campanha.
Diante desse cenário de recursos financeiros consideráveis, grande número de candidatos, mobilidade partidária e regras eleitorais complexas, os partidos enfrentam um desafio constante na distribuição de recursos e na composição de chapas eleitorais competitivas. Existe, portanto, uma lacuna prática na disponibilidade de soluções que utilizem inteligência de dados para auxiliar candidatos, partidos e federações na tomada de decisões estratégicas sobre a composição das chapas e a alocação de recursos em campanhas. Variáveis como sexo, profissão, idade, histórico de reeleição, recursos financeiros, padrões de distribuição de votos e condições políticas locais são reconhecidas como fatores que impactam o sucesso eleitoral e a competitividade dos candidatos (Ames, 2023; Gelape et al. 2024; Secchi et al. 2021). A escolha das chapas é uma prerrogativa da organização política partidária no nível estadual, reforçando a relevância do estado como arena política para cargos proporcionais (Ames, 2003; Rodrigues, 2009).
Nesse contexto, modelos de aprendizado de máquina baseados em árvores de decisão e florestas aleatórias apresentam-se como ferramentas promissoras. As árvores de decisão são amplamente utilizadas no apoio à tomada de decisão, oferecendo interpretação lógica e visual dos resultados, além de serem capazes de processar diversas variáveis e serem aplicáveis tanto para classificação quanto para regressão (Kotsiantis, 2013; Smith e Koning, 2021). Sua utilidade para análise econômica municipal já foi demonstrada (Dresch e Fagundes, 2021), indicando sua adequação para o estudo de fenômenos complexos como a previsão eleitoral.
A presente pesquisa justifica-se pela necessidade de ferramentas analíticas que otimizem a estratégia eleitoral em um ambiente complexo e competitivo, contribuindo para a tomada de decisão de partidos e candidatos. Desta forma, o objetivo do estudo é a análise da viabilidade de aplicação de um modelo de aprendizado supervisionado de árvores de classificação, regressão e florestas aleatórias para prever os resultados de uma eleição a partir do potencial de eleição e competitividade de candidatos e do potencial de obtenção de votos na disputa à deputado estadual no estado de São Paulo em 2022.
2. Material e Métodos
A pesquisa foi de natureza exploratória e experimental, visando analisar a viabilidade da aplicação de modelos de aprendizado de máquina para prever resultados eleitorais. O procedimento adotado consistiu na implementação de algoritmos de
Machine Learning
, seguindo o framework CRISP-DM (Schröer et al, 2021; Wirth e Hipp, 2000), um padrão da indústria para projetos de mineração e análise de dados, guiando a investigação.
A unidade de análise compreendeu todos os candidatos a deputado estadual no estado de São Paulo que concorreram nas eleições de 2022 e obtiveram ao menos um voto nominal, totalizando 1922 candidatos. Para a inclusão de dados de eleições anteriores, consideraram-se candidatos válidos aqueles cujo CPF estava presente na lista de 2022 e que haviam recebido ao menos um voto nominal em 2018 ou 2020, excluindo-se concorrentes a vice-prefeito em 2020.
Os dados utilizados foram secundários, levantados em conjuntos de dados públicos disponibilizados pelo Tribunal Superior Eleitoral (TSE) e pelo Instituto Brasileiro de Geografia e Estatística (IBGE). As informações eleitorais, demográficas, partidárias e econômicas abrangeram o período entre 2018 e 2022. A coleta dos dados ocorreu em janeiro de 2026, conforme as fontes originais do estudo.
A metodologia seguiu as seis etapas do framework CRISP-DM. Na fase de entendimento do negócio, definiram-se três variáveis dependentes: a condição de eleito ou não eleito (binária), a condição de competitivo ou não competitivo (binária, definida como obtenção de ao menos 10% do quociente eleitoral), e o total de votos nominais recebidos (numérica). As variáveis independentes, selecionadas com base na literatura e dados públicos, abrangeram temas demográficos, resultados eleitorais anteriores, dados econômicos e partidários.
Na etapa de entendimento e preparação dos dados, realizou-se o levantamento das bases do TSE (Portal de Dados Abertos em formato CSV) e do IBGE (PIB dos Municípios em formato XLSX). A conexão dos dados entre arquivos e anos foi feita por identificadores únicos. Variáveis categóricas ausentes foram padronizadas para “–“, e numéricas ausentes para zero. Variáveis categóricas foram transformadas em
dummy
.
Para a seleção das variáveis descritivas, realizou-se uma análise de significância estatística da associação entre cada variável descritiva e dependente. Para variáveis categóricas e binárias, utilizou-se o qui-quadrado; para numéricas, a correlação ponto-bisserial com teste t. Para a variável dependente numérica, empregou-se a análise de variância (ANOVA) para variáveis categóricas e o teste t sobre o coeficiente de Pearson para variáveis numéricas. Um p-valor de 0,05 determinou a significância.
A modelagem e avaliação dos modelos foram implementadas utilizando o pacote Scikit-Learn, versão 1.8.0, da linguagem de programação Python, versão 3.12. O algoritmo CART foi empregado para as árvores de decisão (Géron, 2025), e a replicabilidade foi assegurada pela semente randômica 42. A amostra foi dividida em conjuntos de treino e teste de forma estratificada: 70% para treino e 30% para teste nos modelos de eleitos; 80% para treino e 20% para teste nos de competitividade.
A seleção de hiperparâmetros e a poda das árvores foram realizadas por busca em grade (GridSearchCV) com validação cruzada de 5 dobras, utilizando a amostra de treino. A pontuação F1, combinando precisão e sensibilidade, foi a métrica principal para a configuração dos modelos de classificação, adequada para classes desbalanceadas (He e Garcia, 2008). Após a seleção dos parâmetros, realizou-se análise de sensibilidade com pontos de corte entre 0,1 e 0,9 para otimizar a pontuação F1.
Modelos de florestas aleatórias foram desenvolvidos de forma comparativa, utilizando os mesmos hiperparâmetros selecionados para as árvores de decisão, com 100 estimadores por modelo e o número de características limitado à raiz quadrada do total. A avaliação comparativa entre os modelos de classificação de eleitos e de floresta aleatória foi realizada na amostra de teste, considerando a pontuação F1 e a área sob a curva ROC (AUC-ROC).
Para o modelo de regressão, que previu o total de votos recebidos, a busca em grade foi utilizada para a escolha dos hiperparâmetros, e a métrica R² foi empregada para avaliar o desempenho. Os hiperparâmetros avaliados foram os mesmos da classificação, exceto pelo balanceamento de classes e pelo critério de separação dos nós, considerando erro quadrático e erro absoluto. A avaliação do modelo ocorreu com a amostra de treino.
3. Resultados e Discussão
A presente seção detalha os achados da pesquisa, interpretando-os à luz do objetivo de analisar a viabilidade de modelos de aprendizado supervisionado para prever resultados eleitorais. Os resultados são apresentados em etapas, começando pela preparação dos dados e testes de significância, seguidos pela avaliação dos modelos de classificação para eleitos e competitivos, e, por fim, os modelos de regressão para previsão de votos. A discussão integra a importância das variáveis e as implicações dos achados para a tomada de decisão estratégica no contexto eleitoral paulista de 2022.
A amostra do estudo compreendeu 1922 candidatos a deputado estadual em São Paulo em 2022 que obtiveram ao menos um voto nominal. Desses, 94 foram eleitos e 213 foram classificados como competitivos, ou seja, alcançaram no mínimo 10% do quociente eleitoral, que foi de 24.083 votos, calculado a partir de 22.637.782 votos válidos para 94 vagas em disputa. A análise revelou que 52% das candidaturas em 2022 possuíam dados de eleições anteriores (2018 ou 2020), enquanto 48% não apresentavam histórico eleitoral prévio, o que se mostrou um desafio para a modelagem.
Preparação dos dados e testes de significância
A etapa de preparação dos dados envolveu a análise de significância estatística das variáveis descritivas em relação às variáveis dependentes. Para a variável dependente binária “eleito ou não”, diversas variáveis categóricas e binárias demonstraram significância estatística. Entre as categóricas, a raça/cor, o grau de instrução, a ocupação, a autodeclaração de disputa à reeleição, o cargo disputado em 2018 e 2020, e o partido do candidato em 2018 e 2022 foram consideradas significantes. Variáveis como gênero, estado civil e partido do candidato em 2020, no entanto, não apresentaram significância estatística e foram, portanto, excluídas do modelo de classificação de eleitos.
Em relação às variáveis descritivas binárias para a previsão de eleitos, a participação em eleições anteriores (2018 e 2020) e o fato de ter sido eleito em 2018 mostraram-se estatisticamente significantes. A mudança de partido entre 2018 e 2022, e entre 2020 e 2022, também apresentou significância. Contudo, a variável indicando se o candidato foi eleito em 2020 não demonstrou relevância estatística para a previsão de eleitos em 2022, o que sugere uma dinâmica eleitoral específica ou a menor influência de resultados de eleições municipais para o cargo estadual.
Para as variáveis descritivas numéricas na previsão de eleitos, os votos nominais recebidos em 2018 e 2020, as receitas de campanha em 2018, 2020 e 2022, e os bens declarados em 2018 e 2022 foram considerados estatisticamente significantes. Por outro lado, a idade do candidato, o aumento percentual de receitas e bens, o PIB do município em 2022 e a receita de campanha em 2020 não apresentaram significância estatística. No total, 21 das 30 variáveis descritivas foram mantidas no modelo de classificação de eleitos, indicando a complexidade dos fatores que influenciam o sucesso eleitoral.
Ao analisar a variável dependente binária “competitividade”, observou-se que todas as variáveis descritivas categóricas e binárias foram estatisticamente significantes. Isso inclui gênero, raça/cor, grau de instrução, estado civil, ocupação, autodeclaração de reeleição, cargo disputado em 2018 e 2020, partido em 2022, e partido padronizado em 2018 e 2020. A abrangência da significância para a competitividade sugere que este conceito é influenciado por um espectro mais amplo de características do candidato e de seu histórico político-eleitoral.
As variáveis binárias como participação em eleições anteriores (2018 e 2020), ter sido eleito em 2018 e 2020, e a mudança de partido entre os períodos também foram significantes para a competitividade. No entanto, entre as variáveis numéricas, a idade do candidato na data da posse, o aumento percentual da receita e dos bens, e o PIB do município em 2022 não se mostraram significantes. A idade, apesar de não significante, foi mantida no modelo de competitividade devido à sua importância em etapas preliminares da pesquisa, indicando que, embora não diretamente correlacionada, pode ter um papel nas árvores de decisão.
Para a variável dependente numérica “total de votos recebidos em 2022”, a análise de significância revelou que todas as variáveis descritivas categóricas e binárias foram estatisticamente significantes. Isso inclui características demográficas, histórico de participação e eleição, e filiação partidária. As variáveis numéricas, como votos nominais em 2018 e 2020, receitas de campanha em 2018, 2020 e 2022, e bens declarados em 2018 e 2022, também foram significantes. A variação percentual do PIB do município entre 2019 e 2022 também se mostrou relevante.
Contudo, algumas variáveis numéricas não apresentaram significância estatística para a previsão do total de votos, sendo elas o aumento percentual das receitas e bens do candidato, o PIB do município em 2022 e o valor da receita de campanha de 2020. Essas variáveis foram, portanto, omitidas do modelo de regressão. A idade do candidato, embora significante, teve uma correlação de Pearson de 0,04644, indicando uma influência limitada, mas ainda presente, na quantidade de votos recebidos.
Resultados dos modelos de classificação de eleitos
O modelo de classificação de eleitos, utilizando uma árvore de decisão, foi configurado com o critério de entropia para divisão dos nós, profundidade máxima de cinco níveis, mínimo de dez amostras por nó terminal e mínimo de duas amostras para divisão dos nós, sem balanceamento de pesos. Este modelo alcançou um AUC-ROC de 98,44% na amostra de treinamento. A análise de sensibilidade indicou que o ponto de corte de 0,3 proporcionou o melhor equilíbrio entre precisão e sensibilidade, resultando em uma pontuação F1 de 0,6992.
Em comparação, o modelo de floresta aleatória para classificação de eleitos, treinado com os mesmos hiperparâmetros e 100 estimadores, obteve um AUC-ROC de 97,82% na amostra de treinamento. A análise de sensibilidade para este modelo também apontou o ponto de corte de 0,3 como o mais eficaz, com uma pontuação F1 de 0,6777. Ambos os modelos demonstraram alta capacidade preditiva na amostra de treinamento, com valores de AUC-ROC superiores a 97%.
Na avaliação comparativa dos modelos na base de teste, a árvore de classificação unitária apresentou uma precisão de 0,8571 e sensibilidade de 0,6429, resultando em um F1 de 0,7347 e AUC-ROC de 0,9679. O modelo de floresta aleatória, por sua vez, obteve precisão de 0,6207, sensibilidade de 0,6429, F1 de 0,6316 e AUC-ROC de 0,9718. Embora a floresta aleatória tenha apresentado um AUC-ROC ligeiramente superior, a árvore de classificação unitária demonstrou melhor precisão e pontuação F1, o que pode ser atribuído à construção de árvores com subconjuntos aleatórios de características na floresta aleatória, que podem incluir variáveis com menor poder preditivo.
Apesar dos bons resultados em métricas como F1 e AUC-ROC, a capacidade do modelo de classificação de eleitos para prever a situação de eleito não se mostrou robusta. A prevalência da reeleição, que representou 60% dos eleitos na eleição estudada, limitou a capacidade dos modelos de identificar padrões de elegibilidade para novos candidatos ou aqueles sem histórico. O F1 de 0,7347, embora expressivo, é muito próximo do que seria obtido se o modelo simplesmente considerasse a busca pela reeleição como o principal preditor de eleição, indicando uma fragilidade na generalização para cenários mais amplos.
Resultados dos modelos de classificação de candidatos competitivos
Para a classificação de candidatos competitivos, o modelo de árvore de decisão foi configurado com o critério de entropia, profundidade máxima de nove níveis, mínimo de uma amostra por nó terminal e mínimo de onze amostras para divisão dos nós, sem balanceamento de classes. Este modelo alcançou um AUC-ROC de 99,47% na amostra de treinamento. A análise de sensibilidade indicou que o ponto de corte de 0,4 resultou em uma sensibilidade superior a 90% e precisão acima de 80%, enquanto o ponto de corte de 0,3 proporcionou o melhor equilíbrio entre precisão e sensibilidade, com um F1 de 0,8663.
O modelo de floresta aleatória para classificação de candidatos competitivos, treinado com os mesmos parâmetros e 100 estimadores, obteve um AUC-ROC de 98,95% na amostra de treinamento. A análise de sensibilidade para este modelo indicou o ponto de corte de 0,3 como o mais eficaz, alcançando uma pontuação F1 de 0,8649. Ambos os modelos demonstraram excelente desempenho na amostra de treinamento, com AUC-ROC muito próximos de 99%, sugerindo uma alta capacidade de identificar candidatos competitivos.
Na avaliação comparativa dos modelos na base de teste, o modelo de floresta aleatória superou a árvore de classificação unitária. A floresta aleatória obteve um AUC-ROC de 0,9473 e um F1 de 0,7073, com precisão de 0,7436 e sensibilidade de 0,6744. Em contraste, a árvore de classificação unitária apresentou um AUC-ROC de 0,8430 e um F1 de 0,6522, com precisão de 0,6122 e sensibilidade de 0,6977. A superioridade da floresta aleatória, com mais de dez pontos percentuais de AUC-ROC e maior F1, a torna a ferramenta mais viável para identificar candidatos com chances reais no cenário político.
A capacidade do modelo de floresta aleatória para classificação de competitividade foi notável ao identificar nove dos dezesseis candidatos eleitos em 2022 que não possuíam histórico eleitoral em 2018 e 2020 como competitivos. Isso demonstra a utilidade do modelo para destacar potenciais novos talentos ou candidatos com trajetórias políticas menos convencionais. Um exemplo é o caso de Helinho Zanata, que, apesar de não ter dados de eleições anteriores no período analisado, foi um prefeito eleito em 2012 e 2016 em diferentes cidades, e o modelo de floresta aleatória o classificaria corretamente como competitivo se o ponto de corte fosse ajustado para 0,2.
Resultados dos modelos de regressão para previsão da quantidade de votos
O modelo de regressão baseado em árvore de decisão para prever a quantidade de votos nominais foi configurado com o critério de erro quadrático, profundidade máxima de sete níveis, mínimo de quinze amostras por nó terminal e mínimo de duas amostras para divisão dos nós. Ao ser aplicado à amostra de teste, o modelo obteve um coeficiente de determinação (R²) de 0,5162. Este valor indica que as variáveis descritivas utilizadas explicam 51,62% da variação total dos votos recebidos por um candidato em 2022.
O modelo de floresta aleatória para regressão, utilizando os mesmos parâmetros e 100 estimadores, demonstrou um desempenho superior, alcançando um R² de 0,5590 na amostra de teste. Isso significa que as variáveis descritivas em conjunto foram capazes de explicar 55,90% da quantidade de votos recebidos. Embora a capacidade de explicação de mais de 50% seja relevante, o resultado ainda sugere que há espaço para a inclusão de novas características que possam aprimorar a descrição do comportamento do total de votos, como métricas de redes sociais ou indicadores de força política e financeira.
Explicabilidade
A análise de importância das variáveis para o modelo final de classificação de eleitos revelou que a receita do candidato em 2022 (VR_RECEITA_2022) foi a característica dominante, contribuindo com 67,4% da importância. Os votos nominais recebidos em 2018 (2018_QT_VOTOS_NOMINAIS) e 2020 (2020_QT_VOTOS_NOMINAIS) também foram significativos, com 15,2% e 6,4% de importância, respectivamente. A receita de 2020 (VR_RECEITA_2020) e os bens do candidato em 2022 (VR_BEM_CANDIDATO_2022) tiveram importâncias menores, de 5,0% e 3,0%, respectivamente, enquanto o partido do candidato em 2022 (SG_PARTIDO_PSDB) contribuiu com 1,8%.
Para o modelo de classificação de candidatos competitivos, utilizando floresta aleatória, foram identificadas 172 variáveis, sendo 18 delas com mais de 1% de importância. A receita do candidato em 2022 (VR_RECEITA_2022) manteve-se como a mais importante, com 23,4%. Os votos nominais de 2018 (2018_QT_VOTOS_NOMINAIS) e a autodeclaração de reeleição (ST_REELEICAO) também foram cruciais, com 10,3% e 6,0% de importância, respectivamente. Variáveis como ter sido eleito em 2018 (2018_ELEITO) e a receita de 2018 (VR_RECEITA_2018) também se destacaram, com 5,8% cada. A maior quantidade de características com impacto no modelo de competitividade ajudou a mitigar a dificuldade de classificar candidatos sem dados de eleições anteriores.
No modelo de regressão para previsão da quantidade de votos, as variáveis mais importantes foram os votos nominais de 2018 (2018_QT_VOTOS_NOMINAIS) com 25,84%, seguidos pela receita de 2022 (VR_RECEITA_2022) com 20,46%, e o fato de ter sido eleito em 2018 (2018_ELEITO) com 16,85%. A receita de 2018 (VR_RECEITA_2018) e a autodeclaração de reeleição (ST_REELEICAO) também foram relevantes, com 11,26% e 9,07% de importância, respectivamente. A ocupação do candidato (DS_OCUPACAO_DEPUTADO), os votos nominais de 2020 (2020_QT_VOTOS_NOMINAIS), os bens do candidato em 2022 (VR_BEM_CANDIDATO_2022), os bens em 2018 (VR_BEM_CANDIDATO_2018) e a idade do candidato (NR_IDADE_DATA_POSSE) completaram as dez principais variáveis, demonstrando a forte influência do histórico eleitoral e financeiro.
Observou-se uma redundância em variáveis que definem a reeleição, como a ocupação de deputado, a autodeclaração de reeleição e o status de eleito em 2018, que apareceram em quatro das variáveis listadas. Isso reforça a importância do histórico eleitoral para a previsão. As variáveis demográficas, como raça, gênero e estado civil, tiveram baixa presença nos modelos finais, indicando que, embora possam ser significantes em testes univariados, sua contribuição preditiva é menor quando combinadas com outras características mais fortes. A idade do candidato, embora com baixa importância, foi a única variável demográfica que se manteve relevante em alguns modelos.
Em síntese, os modelos de aprendizado supervisionado, especialmente as florestas aleatórias, demonstraram viabilidade para prever a competitividade de candidatos a deputado estadual em São Paulo, com o modelo de floresta aleatória para competitividade alcançando um F1 de 0,7073 e um AUC-ROC de 0,9473 na amostra de teste. Este resultado promissor oferece uma ferramenta valiosa para partidos e candidatos na tomada de decisões estratégicas. Contudo, os modelos para prever a eleição e a quantidade de votos nominais, embora com R² de até 0,5590, ainda necessitam de aprimoramento e inclusão de novas características para maior robustez e explicabilidade, especialmente para candidatos sem histórico eleitoral prévio.
4. Conclusão
O presente estudo analisou a viabilidade de aplicação de modelos de aprendizado supervisionado, especificamente árvores de classificação, regressão e florestas aleatórias, para prever resultados eleitorais na disputa para deputado estadual em São Paulo em 2022, considerando o potencial de eleição, competitividade e obtenção de votos dos candidatos. Verificou-se que o modelo de floresta aleatória para classificação de candidatos competitivos demonstrou alta capacidade preditiva, alcançando uma pontuação F1 de 0,7073 e um AUC-ROC de 0,9473 na amostra de teste. Este resultado indica que características de eleições passadas, como votos nominais e participação, juntamente com recursos financeiros, são preditores relevantes para a competitividade eleitoral. A principal contribuição prática deste estudo reside na oferta de uma ferramenta viável para auxiliar partidos e candidatos na tomada de decisões estratégicas, permitindo a identificação de postulantes com chances reais de sucesso, inclusive aqueles sem histórico eleitoral prévio, como observado na correta classificação de nove dos dezesseis eleitos sem dados anteriores.
Contudo, os modelos desenvolvidos para prever a eleição de candidatos e a quantidade de votos nominais foram considerados insuficientes para uma robusta generalização, especialmente devido à alta prevalência da reeleição e à dificuldade em identificar padrões para novos candidatos. O R² de até 0,5590 nos modelos de regressão, embora relevante, sugere a necessidade de aprimoramento. Como limitação, a ausência de dados de eleições anteriores para quase metade da amostra representou um desafio. Para estudos futuros, recomenda-se a inclusão de novas características, como métricas de redes sociais e indicadores de força política e financeira, para aprimorar a previsão de votos. Sugere-se também a avaliação de técnicas para prever o total de votos de chapas eleitorais completas e a comparação dos modelos propostos com abordagens estatísticas tradicionais, além da aplicação em outros contextos eleitorais brasileiros.
Referências Bibliográficas
Ames, B. 2003. Os entraves da democracia no Brasil. Editora FGV, Rio de Janeiro, RJ, Brasil.
Dresch, L.O.; Fagundes, M.B.B. 2021. Perfil econômico dos municípios do estado de Mato Grosso do Sul e sua influência no desenvolvimento municipal. Informe GEPEC 25(2), 42–61.
Fisch, A.; Mesquita, L. 2022. Reformas eleitorais no Brasil contemporâneo: mudanças no sistema proporcional e de financiamento eleitoral. Estudos Avançados, 36(106), 33-53.
Gelape, L.; Luz, J.; Thomé, D. 2024. Padrões espaciais de votação nas eleições para a Câmara Municipal de São Paulo: um estudo a partir das eleições de 2020. Estudos Avançados, 38(111), 301-323.
Géron, A. 2025. Mãos à obra: aprendizado de máquina com Scikit-Learn, Keras & TensorFlow. 3ed. Alta Books, Rio de Janeiro, RJ, Brasil.
He, H.; Garcia, E. A. 2009. Learning from Imbalanced Data. IEEE Transactions on Knowledge and Data Engineering, 21(9), 1263-1284
Kotsiantis, S.B. 2013. Decision trees: a recent overview. Artificial Intelligence Review, 39(4), 261-283.
Rodrigues, L.M. 2009. Partidos, ideologia e composição social: um estudo das bancadas partidárias na câmara dos deputados. Centro Edelstein, Rio de Janeiro, RJ, Brasil. Disponível em: <https://books.scielo.org/id/9yf86>. Acesso em: 19 out. 2025.
Schröer, C.; Kruse, F.; Gómez, J.M. 2021. A systematic literature review on applying CRISP-DM process model. Procedia computer science, 181(2021), 526-534.
Secchi, L.; Wink Junior, M.V.; Moraes, C.J. 2021. Crowdfunding e desempenho eleitoral no Brasil: análise estatística das eleições para deputado federal em 2018. Revista de Administração Pública 55(5), 1191-1214.
Smith, C.; Koning, M. 2017. Decision trees and random forests: a visual introduction for beginners: a simple guide to machine learning with decision trees. Blue Windmill Media.
Tribunal Superior Eleitoral [TSE]. 2025. Estatísticas Eleitorais. Disponível em: <https://sig.tse.jus.br/ords/dwapr/seai/r/sig-eleicao>. Acesso em: 20 out. 2025.
Wirth, R.; Hipp, J. 2000. CRISP-DM: Towards a standard process model for data mining. In Proceedings of the 4th international conference on the practical applications of knowledge discovery and data mining Vol. 1, 29-39.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy