Artigo

10 de setembro de 2026

Previsão de Taxa de Evasão Escolar por Cidades: Comparação de Modelos de Aprendizado Supervisionado

Felipe Fonseca Rocha; Miriam Martin

DOI: 10.22167/2675-6528-202602214

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

A evasão escolar representa um desafio multifacetado, com impactos individuais, políticos e sociais. Um estudo buscou desenvolver um modelo preditivo da taxa de evasão escolar por cidades brasileiras, empregando técnicas de aprendizado de máquina. Coletaram-se dados públicos educacionais do Instituto Nacional de Estudos e Pesquisas Anísio Teixeira (INEP) e do Instituto Brasileiro de Geografia e Estatística (IBGE) referentes ao período de 2011 a 2020, totalizando 2.370.968 registros por escola e taxas de evasão agregadas por município para Ensino Fundamental e Médio. Modelos supervisionados de regressão, como Regressão Linear, Árvores de Decisão, Random Forest e Redes Neurais, foram aplicados, e a precisão das estimativas foi avaliada por meio das métricas erro quadrático médio (MSE) e R². O modelo Random Forest apresentou o melhor desempenho. Para o Ensino Fundamental, obteve-se um MSE de 0.002 e um R² entre 0,320 e 0,530. No Ensino Médio, a performance foi inferior, com MSE variando entre 0.022 e 0.018 e um R² entre 0,10 e 0,25. Concluiu-se que a presença de quadras de esporte e outras benfeitorias na infraestrutura das escolas são fatores de alta correlação com a taxa de evasão.

Palavras-chave: Bases públicas; Desempenho educacional; Infraestrutura escolar; Random Forest; Regressão.

1. Introdução

A educação é um direito fundamental, conforme estabelecido na Constituição Federal (Constituição da República Federativa do Brasil de 1988, 1988). Contudo, a garantia desse direito não se limita ao acesso, mas também à permanência dos estudantes nas instituições de ensino. Nesse contexto, a evasão e o abandono escolar representam desafios significativos, com impactos profundos na vida dos alunos, no desempenho das escolas e no desenvolvimento da sociedade como um todo (Ramos e Gonçalves Junior, 2024).

É crucial diferenciar o abandono da evasão escolar. O abandono ocorre quando o estudante interrompe os estudos em um ano letivo, mas retorna no ano seguinte. A evasão escolar, por sua vez, caracteriza-se pela interrupção dos estudos sem que haja retorno nos anos subsequentes para a conclusão (Santos et al., 2019). Este trabalho foca especificamente na evasão escolar, um fenômeno complexo e multifacetado.

A evasão escolar é frequentemente o desfecho de um processo que envolve diversas questões sociais e estruturais. Entre os fatores que contribuem para esse cenário estão a desigualdade social, a discriminação racial, a distância da escola em relação ao domicílio, a desestruturação familiar e as deficiências do próprio sistema escolar, como a infraestrutura inadequada, a ausência de professores e a baixa qualidade do ensino (Branco et al., 2020; Ramos e Gonçalves Junior, 2024). No Brasil, em 2024, estima-se que 8,7 milhões de jovens entre 14 e 29 anos não haviam concluído o Ensino Médio devido ao abandono ou evasão, sendo que 72,5% desses jovens eram pretos ou pardos. A necessidade de trabalhar e a falta de interesse nos estudos são apontadas como as principais causas por esses jovens (IBGE, 2024).

Os impactos da evasão escolar transcendem o ambiente educacional, gerando desdobramentos individuais, políticos e sociais. No âmbito individual, resulta em baixa qualificação para o mercado de trabalho. Politicamente, representa a perda de investimentos em instituições de ensino e do tempo dedicado pelos profissionais. Socialmente, contribui para o aumento da desigualdade, criminalidade e violência (Oliveira et al., 2024; Rosa et al., 2023).

Embora diversos estudos quantitativos e qualitativos busquem identificar os fatores preditivos da evasão, muitos se concentram em características relacionadas ao estudante (Ramos e Gonçalves Junior, 2024; Silva Júnior e Silva, 2024). A interrupção educacional e as lacunas pedagógicas, somadas aos problemas sociais e às expectativas econômicas das famílias, são elementos que contribuem para os altos índices de evasão, exigindo uma abordagem que envolva múltiplos atores (Branco et al., 2020). Nesse contexto, o aprendizado de máquina (ML) emerge como uma ferramenta promissora para monitorar e prever a evasão escolar (Figueiredo e Salles, 2017; Teodoro e Kappel, 2020).

O aprendizado de máquina, um ramo da inteligência artificial, consiste no estudo e desenvolvimento de algoritmos que aprendem a partir de dados (Mitchell, 2006). Sua aplicação é particularmente eficaz no manuseio de grandes bases de dados, onde as técnicas estatísticas convencionais podem ser limitadas (Jordan e Mitchell, 2015). Esses modelos permitem a identificação precoce de estudantes em risco de evasão ou de características institucionais que favorecem o evento.

A utilização de modelos preditivos pode, portanto, auxiliar na adoção de medidas preventivas e no desenvolvimento de políticas públicas que promovam a permanência escolar. Contudo, a seleção do modelo mais adequado apresenta desafios, pois exige um equilíbrio entre a acurácia preditiva e a interpretabilidade dos resultados (Figueiredo e Salles, 2017). A relevância deste estudo reside na necessidade de prover ferramentas analíticas que auxiliem gestores educacionais na tomada de decisão.

Assim, este estudo teve como objetivo prever a evasão escolar por cidade brasileira através da aplicação de técnicas de aprendizado de máquina e identificar os determinantes da estrutura das escolas na evasão escolar, garantindo que os modelos utilizados não apenas apresentassem alta acurácia, como também fornecessem explicações compreensíveis sobre os fatores determinantes da evasão escolar.

2. Material e Métodos

Este estudo quantitativo e preditivo analisou a taxa de evasão escolar por cidade brasileira entre 2011 e 2020. Foram utilizados dados secundários públicos da taxa de evasão escolar e do censo das escolas, disponibilizados pelo Instituto Nacional de Estudos e Pesquisas Anísio Teixeira (INEP). A amostra incluiu todas as escolas públicas participantes do Censo Escolar da Educação Básica no período, excluindo escolas privadas e aquelas com dados faltantes sobre evasão.

Para prever a taxa de evasão escolar e identificar fatores influenciadores, foram aplicados e comparados modelos de aprendizado de máquina (ML) supervisionado: Regressão Linear, Árvores de Decisão, “Random Forest” e Redes Neurais. A comparação focou na acurácia, interpretabilidade e desempenho preditivo dos modelos.

A Regressão Linear (Montgomery et al., 2012; Wooldridge, 2020) foi utilizada como modelo basal para predição quantitativa, estimando coeficientes que minimizam a soma dos quadrados dos resíduos (MQO) (Hastie et al., 2009; James et al., 2013). Foi calculada pela fórmula (1):

y = β0 + β1×1+…+ẞpxp + є (1)

Onde Y é a variável dependente; x1, x2,…,xp são variáveis independentes; β0, β1,…, βρ são os parâmetros ou coeficientes; e є é o componente de erro aleatório.

As Árvores de Decisão (Hastie et al., 2009) são métodos não paramétricos que segmentam dados recursivamente, otimizando a pureza dos nós com métricas como o Erro Quadrático Médio (MSE) para regressão. Oferecem alta interpretabilidade e utilizam “pruning” para mitigar o “overfitting” (Tukey et al., 1984).

O “Random Forest” (Breiman, 2001) baseia-se no “bagging” (“Bootstrap Aggregating”), construindo múltiplas árvores de decisão independentes a partir de subconjuntos aleatórios de dados e atributos. O resultado é obtido pela média (regressão), reduzindo a variância e aumentando a robustez (Breiman, 1996).

As Redes Neurais (Haykin, 2009; Haykin, 2011) são sistemas de processamento paralelo que ajustam pesos sinápticos via retropropagação. Sua vantagem reside na capacidade de mapear funções não-lineares complexas (Cybenko, 1989) e alta generalização (LeCun et al., 2015; Goodfellow et al., 2016).

Os dados foram coletados nas bases públicas de microdados do Censo Escolar da Educação Básica (INEP, 2025a) e no diretório do INEP (Inep, 2025) para as taxas de evasão. As variáveis incluíram identificadores geográficos (município, região, UF), características de infraestrutura escolar (água, alimentação, banda larga, biblioteca, computador, cozinha, quadra de esportes, sala de leitura, energia, esgoto, internet, laboratórios, destinação do lixo), turnos de ensino (diurno, noturno), tipos de educação (indígena, EJA Fundamental e Médio), ano do censo, número de docentes e matrículas por nível de ensino (fundamental e médio, integral), número de turmas, sigla da UF, dependência administrativa e convênio com o poder público. As taxas de evasão escolar foram coletadas por ano e por série para o Ensino Fundamental (1º ao 9º ano) e Ensino Médio (1º ao 3º ano).

A preparação dos dados envolveu a padronização da codificação de arquivos .CSV (ISO-8859-1 para UTF-8), organização por ano e carregamento sequencial para lidar com o volume de mais de 3 milhões de registros. Os dados foram padronizados em codificação, estrutura de colunas e formatos de data. Foi realizada filtragem de colunas relevantes (infraestrutura, administração, localização) e conversão de colunas de data para “datetime”. Registros com valores nulos em variáveis geográficas-chave foram excluídos. Variáveis categóricas foram tratadas com codificação numérica e “one-hot encoding” (variáveis “dummy”) para adequação aos modelos de ML, transformando categorias em colunas binárias (1 para presença, 0 para ausência). A base foi agregada por município e ano para criar indicadores de benfeitorias e taxa de docentes por aluno. Dados de transição de matrícula foram pré-processados para derivar variáveis “proxy” de evasão e integrados ao conjunto principal. Valores nulos e ausentes para a taxa de evasão foram removidos, e colunas não correspondentes à evasão para os anos escolares considerados foram excluídas. A taxa total de evasão por etapa escolar (fundamental e médio) foi utilizada para predição. Variáveis do censo não comuns ao período 2011-2020 foram excluídas. Todas as variáveis foram padronizadas para uma escala entre 0 e 1. Variáveis numéricas foram convertidas em taxas de docentes por alunos ou por turma para mitigar efeitos de escala. O tratamento de multicolinearidade foi realizado via Fator de Inflação da Variância (VIF) usando a biblioteca “Statsmodels” (Dormann et al., 2013), calculado pela fórmula (2):

VIF = 1 / (1 – Ri^2) (2)

Onde Ri^2 representa o coeficiente de variação não ajustado para a regressão da i-ésima variável independente sobre as demais.

A validação preditiva dos modelos utilizou particionamento em treinamento e teste. Para “Random Forest”, Árvores de Decisão e Redes Neurais, aplicou-se o método “holdout” (80% treinamento, 20% teste) para equilibrar viés e variância e prevenir “overfitting” (Hastie et al., 2009). Para a Regressão Linear, o modelo foi aplicado à totalidade do período amostral, focando na significância estatística dos coeficientes e na explicação da variância dos dados (Montgomery et al., 2012; Shmueli, 2011). A divisão 80/20 foi aleatória para preservar a distribuição das classes. Para robustez, os modelos de ML foram submetidos à validação cruzada “k-fold” (k=5) (Kohavi, 1995; Stone, 2018), onde o conjunto de treinamento foi dividido em 5 subconjuntos. Em cada iteração, 4 subconjuntos ajustaram os parâmetros e 1 foi reservado para teste. A performance agregada foi a média aritmética dos resultados das k iterações (Hastie et al., 2009), calculada pela fórmula (3):

CV(x) = (1/k) * sum(MSE_i) (3)

Onde k é o número de dobras (k=5) e MSEi é o erro quadrado médio.

Os quatro modelos de ML (Regressão Linear, Árvores de Decisão, “Random Forest” e Redes Neurais) foram implementados e comparados, buscando equilibrar capacidade preditiva e interpretabilidade, avaliadas por métricas de erro (MSE) e valores SHAP. A Tabela 1 detalha as características desses modelos:

Tabela 1. Característica dos modelos de ML aplicados para análise e predição da evasão escolar

VariávelDescrição da Variável
CO_MUNICIPIOCódigo do Município
CO_REGIAOCódigo da região geográfica
CO_UFCódigo da UF
IN_AGUA_INEXISTENTEAbastecimento de água – Não há abastecimento de água
IN_AGUA_REDE_PUBLICAAbastecimento de água – Rede pública
IN_ALIMENTACAOAlimentação escolar para os alunos – PNAE/FNDE
IN_BANDA_LARGAInternet Banda Larga
IN_BIBLIOTECADependências físicas existentes e utilizadas na escola – Biblioteca
IN_BIBLIOTECA_SALA_LEITURADependências físicas existentes e utilizadas na escola – Biblioteca e/ou Sala de leitura
IN_COMPUTADOREquipamentos existentes na escola para uso técnico e administrativo – Computador
IN_COZINHADependências físicas existentes e utilizadas na escola – Cozinha
IN_DIURNOTurno – Diurno – Horário de início da turma de escolarização entre 05h e 16h
IN_EDUCACAO_INDIGENAEducação Escolar Indígena
IN_EJA_FUNDEducação de Jovens e Adultos (EJA) – Ensino Fundamental (Possui uma ou mais matrículas)
IN_EJA_MEDEducação de Jovens e Adultos (EJA) – Ensino Médio (Possui uma ou mais matrículas)
IN_ENERGIA_INEXISTENTEAbastecimento de energia elétrica – Não há energia elétrica
IN_ENERGIA_REDE_PUBLICAAbastecimento de energia elétrica – Rede pública
IN_ESGOTO_INEXISTENTEEsgoto sanitário – Não há esgotamento sanitário
IN_ESGOTO_REDE_PUBLICAEsgoto sanitário – Rede pública
IN_INTERNETAcesso à Internet
IN_LABORATORIO_CIENCIASDependências físicas existentes e utilizadas na escola – Laboratório de ciências
IN_LABORATORIO_INFORMATICADependências físicas existentes e utilizadas na escola – Laboratório de informática
IN_LIXO_SERVICO_COLETADestinação do lixo – Serviço de coleta
IN_NOTURNOTurno – Noturno – Turno de início da turma de escolarização entre 17h e 04h
IN_QUADRA_ESPORTESDependências físicas existentes e utilizadas na escola – Quadra de esportes coberta ou descoberta
IN_SALA_LEITURADependências físicas existentes e utilizadas na escola – Sala de Leitura
NO_REGIAONome da região geográfica
NO_UFNome da Unidade da Federação
NU_ANO_CENSOAno do Censo
QT_DOC_FUNDNúmero de Docentes do Ensino Fundamental
QT_DOC_MEDNúmero de Docentes do Ensino Médio
QT_MAT_FUNDNúmero de Matrículas no Ensino Fundamental
QT_MAT_FUND_INTNúmero de Matrículas no Ensino Fundamental – Tempo Integral
QT_MAT_MEDNúmero de Matrículas no Ensino Médio
QT_MAT_MED_INTNúmero de Matrículas no Ensino Médio – Tempo Integral
QT_TUR_FUNDNúmero de Turmas de Ensino Fundamental
QT_TUR_MEDNúmero de Turmas de Ensino Médio
SG_UFSigla da Unidade da Federação
TP_CONVENIO_PODER_PUBLICODependência do convênio com o poder público
TP_DEPENDENCIADependência Administrativa
TP_LOCALIZACAOLocalização

Fonte: elaborado pelos autores

A interpretabilidade foi medida por “Shapley Additive Explanations” (SHAP) e “Feature Importance”, implementadas em “Python” com as bibliotecas “Scikit-learn”, “TensorFlow/Keras” e “Pandas”. O método SHAP atribui um valor de importância a cada variável, superando as limitações de métricas convencionais (RMSE, R²) ao capturar interações não lineares e fornecer interpretabilidade local (Lundberg e Lee, 2017; Shmueli, 2011). A modelagem envolveu a calibração dos algoritmos com configurações padrão e busca de hiperparâmetros ótimos. Para “Random Forest”, utilizou-se “RandomizedSearchCV” (20 iterações), explorando estimadores (100-300), profundidade máxima e critérios de divisão de nós para reduzir variância e erro. As Redes Neurais foram configuradas com 2 a 3 camadas ocultas (até 256 neurônios), otimizador Adam e “early stopping” (20% dos dados para validação) para prevenir sobreajuste. A Árvore de Decisão foi submetida a “Grid Search” para controlar profundidade e requisitos mínimos de amostras por folha. A Regressão Linear foi expandida com técnicas de regularização “Ridge, Lasso e Elastic Net”, ajustando parâmetros alpha (0.1 a 10.0) e razão L1 para penalizar coeficientes e realizar seleção de atributos.

3. Resultados e Discussão

Análise descritiva dos dados

A análise exploratória dos 55.690 registros da taxa de evasão escolar em cidades brasileiras, no período de 2011 a 2020, revelou a distribuição das taxas de evasão ao longo do currículo escolar. Observou-se que as maiores taxas de evasão concentram-se nos 9º ano do Ensino Fundamental, e nos 1º e 2º anos do Ensino Médio, conforme ilustrado na Figura 1. A Tabela 2 evidencia a presença de outliers, indicando que algumas cidades apresentaram índices de evasão significativamente superiores à média nacional em anos específicos.

Figura 1. Distribuição da taxa de evasão por série (2011-2020)

Fonte: Resultados originais da pesquisa

Tabela 2. Mínimo e máximo da taxa de evasão por Série escolar (2011-202)

CaracterísticasRegressão LinearÁrvore de Decisão“Random Forest”Redes Neurais
InterpretabilidadeAltoAltoMédioBaixo
ComplexidadeBaixoMédioAltoMuito Alto
Risco de “Overfitting”BaixoAltoBaixoMédio
Adequação Não-LinearNãoSimSim
Custo ComputacionalBaixoMédioAltoMuito Alto

Fonte: Resultados originais da pesquisa.

A transformação dos 2.370.968 registros do censo escolar para agregação por município permitiu identificar disparidades nas variáveis, conforme sumarizado na Tabela 3. As variáveis categóricas de infraestrutura foram processadas via one-hot encoding, e as quantitativas (docentes, turmas) normalizadas em taxas por matrículas, para refletir a densidade de recursos em relação ao volume de alunos por localidade.

Tabela 3. Sumário das variáveis após limpeza e remoção VIF (dados padronizados)

Série2011 Média (%)2011 Max (%)2012 Média (%)2012 Max (%)2013 Média (%)2013 Max (%)2014 Média (%)2014 Max (%)2015 Média (%)2015 Max (%)2016 Média (%)2016 Max (%)2017 Média (%)2017 Max (%)2018 Média (%)2018 Max (%)2019 Média (%)2019 Max (%)2020 Média (%)2020 Max (%)
F10.9332.60.8430.60.7843.30.826.20.7622.50.6828.90.6616.10.6431.10.7124.80.8542
F21.1335.4134.40.8728.70.8615.70.8429.10.719.30.7123.90.65220.6719.10.8241.7
F31.3633.51.1639.51.0630.91.0617.10.9831.20.8716.20.8519.10.828.90.7614.80.8737.3
F41.5937.71.4740.41.3130.81.2922.71.2518.21.0519.41.0725.70.9734.90.9316.80.8944.8
F52.6452.92.3750.52.1830.52.1829.12.0121.91.83481.7324.31.6530.61.5655.21.9455.8
F64.5855.94.3634.24.0627.23.9549.63.5533.13.2247.33.225.63.2272.431.62.1829.1
F74.8439.24.7157.14.6130.54.4825.24.0339.73.61223.64253.86252.7219.12.4634.9
F85.949.35.5431.25.1837.35.1843.84.535.74.3625.74.1224.84.4344.93.1630.32.8450
F98.3868.68.3155.87.7952.98.1966.67.1757.66.753.36.852.17.1445.25.15476.8470.5
M114.0448.513.86013.6345.51341.811.9957.111.9255.611.3461.813.67568.8947.78.2978.9
M211.9572.411.7992.911.5258.812.1752.310.1185.710.6510010.2966.711.5758.88.0981.27.6497.7
M36.8557.76.6181.46.0939.76.0558.35.4741.95.27425.4657.66.08503.98412.9175.4

Fonte: Resultados originais da pesquisa.

A análise de correlação de Pearson, apresentada na Figura 2, revelou que diversas variáveis de infraestrutura escolar, como a presença de quadras, banda larga, laboratório de informática e a inexistência de fornecimento de energia e esgoto, apresentaram alta correlação com a taxa de evasão.

Figura 2. Matriz de correlação das variáveis analisadas após VIF

Fonte: Resultados originais da pesquisa

A modelagem preditiva foi iniciada com a regressão linear, que avaliou de forma simplificada a influência da infraestrutura e dos recursos humanos na evasão escolar. Contudo, este modelo demonstrou baixa capacidade de predição, com um R² inferior a 20%, valor considerado baixo (Cohen, J. 1988).

Implementação dos modelos

Este estudo implementou e comparou quatro modelos de Machine Learning: Regressão Linear, Árvores de Decisão, Random Forest e Redes Neurais. A Tabela 4 apresenta uma comparação técnica entre esses algoritmos, destacando características como interpretabilidade, complexidade, risco de overfitting, adequação não-linear e custo computacional. O modelo Random Forest se destacou por equilibrar a capacidade de mapear padrões não lineares da evasão escolar com um risco controlado de sobreajuste, resultando em métricas de erro inferiores aos demais métodos testados.

Tabela 4. Característica dos modelos de ML aplicados para análise e predição da evasão escolar

VariávelDescrição da Variável
CO_MUNICIPIOCódigo do Município
NU_ANO_CENSOAno do Censo
TX_EV_FUNTaxa de evasão do Ensino Fundamental
TX_EV_MEDTaxa de evasão do Ensino Médio
TX_EV_FUN_1Taxa de evasão do 1 ano do Ensino Fundamental
TX_EV_FUN_2Taxa de evasão do 2 ano do Ensino Fundamental
TX_EV_FUN_3Taxa de evasão do 3 ano do Ensino Fundamental
TX_EV_FUN_4Taxa de evasão do 4 ano do Ensino Fundamental
TX_EV_FUN_5Taxa de evasão do 5 ano do Ensino Fundamental
TX_EV_FUN_6Taxa de evasão do 6 ano do Ensino Fundamental
TX_EV_FUN_7Taxa de evasão do 7 ano do Ensino Fundamental
TX_EV_FUN_8Taxa de evasão do 8 ano do Ensino Fundamental
TX_EV_FUN_9Taxa de evasão do 9 ano do Ensino Fundamental
TX_EV_MED_1Taxa de evasão do 1 ano do Ensino Médio
TX_EV_MED_2Taxa de evasão do 2 ano do Ensino Médio
TX_EV_MED_3Taxa de evasão do 3 ano do Ensino Médio

Fonte: elaborado pelos autores

A Tabela 5 apresenta as métricas de desempenho dos modelos após o filtro VIF e padronização. Para o Ensino Fundamental, o erro quadrático médio (MSE) foi de aproximadamente 0,002 para todos os modelos, e o coeficiente de determinação (R²) variou entre 0,320 e 0,530, considerado substancial (Cohen, J. 1988). Isso indica que entre 32% e 53% da variabilidade dos dados pode ser explicada pelas variáveis independentes. Para o Ensino Médio, o MSE variou de 0,022 a 0,018, e o R² entre 0,10 e 0,25, considerado fraco e moderado (Cohen, J. 1988), sugerindo menor poder de explicação.

Tabela 5. Resultados dos Modelos: Resumo Estatístico após Filtro VIF e Padronização

VariáveisMédiaDesvio PadrãoMínimoMáximo
TX_EV_FUN0.030.020.000.33
TX_EV_MED0.100.050.000.66
IN_AGUA_INEXISTENTE0.020.080.000.92
IN_BANDA_LARGA0.430.300.001.00
IN_BIBLIOTECA0.290.240.001.00
IN_COZINHA0.770.210.021.00
IN_EDUCACAO_INDIGENA0.010.060.000.98
IN_ENERGIA_INEXISTENTE0.020.070.000.94
IN_ESGOTO_INEXISTENTE0.030.090.000.92
IN_LABORATORIO_CIENCIAS0.080.100.001.00
IN_LABORATORIO_INFORMATICA0.360.230.001.00
IN_QUADRA_ESPORTES0.280.220.001.00
IN_SALA_LEITURA0.150.180.001.00
IN_ESTADUAL0.210.140.001.00
IN_RURAL0.470.310.001.00
TX_DOC_MAT_FUND0.070.020.030.24
TX_DOC_MAT_MED0.090.040.001.00
TX_DOC_TUR_MAT_FUND0.000.000.000.02
TX_DOC_TUR_MAT_MED0.010.010.001.00

Fonte: Resultados originais da pesquisa

Os resultados para o Ensino Fundamental indicaram desempenho superior e maior estabilidade, com o modelo Random Forest apresentando o maior R² (0,5349), explicando mais de 53% da variância dos dados, além de menores erros absolutos (MAE = 0,0086) e quadráticos (RMSE = 0,0123). A validação cruzada confirmou a consistência do modelo, com um baixo desvio padrão (Std = 0,00019) no Random Forest, indicando que o modelo não é sensível a variações na amostragem de treino.

Para o Ensino Médio, os modelos selecionados não se mostraram tão eficientes, com desempenho inferior em comparação ao Ensino Fundamental. O Random Forest, embora o melhor, obteve um R² de apenas 0,2576. Isso sugere que a evasão no Ensino Médio pode ter uma natureza mais estocástica ou depender de variáveis externas não capturadas no conjunto de dados atual, como fatores socioeconômicos e a idade do aluno (Salata, 2019).

A análise comparativa do RMSE revelou uma diferença acentuada entre as etapas de ensino, com um erro de 0,0123 para o Ensino Fundamental e 0,0430 para o Ensino Médio. Essa diferença, de quase quatro vezes na magnitude do erro residual, indica que a capacidade preditiva do modelo é superior no Ensino Fundamental. A evasão no Ensino Médio parece ser um fenômeno de maior variabilidade e complexidade, possivelmente influenciado por fatores exógenos não integralmente capturados pelos dados de infraestrutura escolar (Shirasu, 2014; Machado et al., 2024). O modelo para o Ensino Fundamental pode fornecer mais subsídios para decisões de investimento em políticas públicas preventivas, enquanto o erro elevado no Ensino Médio sugere a necessidade de variáveis adicionais ou abordagens mais segmentadas.

A regressão linear apresentou o desempenho mais baixo (R² = 0,1015), indicando que a relação entre as variáveis é possivelmente não linear, o que se alinha com a complexidade do fenômeno e a influência de fatores não considerados no modelo, dificultando o ajuste por modelos lineares.

Interpretabilidade por SHAP

Os gráficos de SHAP Bee Swarm (Figuras 3 e 4) foram utilizados para interpretar a contribuição das variáveis. Pontos vermelhos (valores altos) à esquerda indicam fatores protetivos que reduzem a taxa de evasão, enquanto pontos vermelhos à direita indicam fatores de risco que aumentam a taxa de evasão.

Figura 3. Figura Resumo “SHAP”: Contribuições por “feature Random forest” – Ensino Fundamental

Fonte: Resultados originais da pesquisa

Figura 4. Resumo “SHAP”: Contribuições por “feature Random forest” – Ensino Médio

Fonte: Resultados originais da pesquisa

A análise via SHAP demonstrou que, embora a Regressão Linear aponte corretamente a direção das correlações (por exemplo, banda larga reduz evasão), ela subestima a heterogeneidade do sistema educacional. Os modelos de Redes Neurais e Random Forest se distinguiram por capturar a magnitude variável desses impactos (Figuras 3 e 4). A análise gráfica revelou que a ausência de infraestrutura básica, como energia e esgoto, não gera um prejuízo linear, mas sim exponencial em contextos de alta vulnerabilidade, atuando como fator excludente. Ao ponderar a infraestrutura física (IN_QUADRA_ESPORTES) e indicadores de gestão de turma (TX_DOC), o Random Forest ofereceu um diagnóstico mais holístico, justificando sua escolha como modelo de referência para políticas públicas.

A análise SHAP revelou as alavancas de combate à evasão. No Ensino Fundamental, a infraestrutura básica (energia, quadra) tem grande importância correlacionada, indicando nível de investimento e desenvolvimento socioeconômico da cidade. No Ensino Médio, fatores associados à qualidade pedagógica (TX_DOC) e tecnológica (IN_LABORATORIO_INFORMATICA) apresentaram maior contribuição. Isso sugere que investir nessas instalações e em recursos humanos pode contribuir para a diminuição da evasão, embora não resolva o problema por completo. É importante notar que esta análise estabeleceu correlações, e não causalidades.

A avaliação de SHAP permitiu entender a contribuição de infraestruturas escolares na redução da evasão. Por exemplo, a ausência de quadra de esportes aumentou a previsão de evasão em cerca de 1 ponto percentual. Essa análise pode auxiliar gestores municipais a identificar escolas com fatores que contribuem para a evasão e a direcionar investimentos para a retenção de alunos.

Em síntese, este estudo demonstrou que o modelo Random Forest apresentou o melhor desempenho na previsão da taxa de evasão escolar, especialmente para o Ensino Fundamental. Os resultados indicaram que a evasão no Ensino Fundamental está fortemente correlacionada com a infraestrutura escolar, enquanto no Ensino Médio, a complexidade do fenômeno e a influência de fatores socioeconômicos e etários são mais proeminentes. A interpretabilidade via SHAP destacou a importância de infraestruturas básicas e recursos pedagógicos como preditores da evasão, oferecendo subsídios para o desenvolvimento de políticas públicas direcionadas à permanência dos alunos.

4. Conclusão

Este estudo teve como objetivo prever a evasão escolar por cidade brasileira por meio de técnicas de aprendizado de máquina e identificar os determinantes da estrutura das escolas nesse fenômeno. Verificou-se que o modelo Random Forest apresentou o melhor desempenho preditivo, especialmente para o Ensino Fundamental, com um erro quadrático médio de aproximadamente 0,002 e um coeficiente de determinação (R²) entre 0,320 e 0,530. Para o Ensino Médio, a performance foi inferior, com R² variando entre 0,10 e 0,25, o que sugeriu uma maior complexidade do fenômeno nessa etapa. A análise de interpretabilidade via SHAP revelou que a presença de infraestrutura básica, como quadras de esporte, e a qualidade pedagógica, como a taxa de docentes, são fatores altamente correlacionados com a redução da evasão. A ausência de infraestrutura essencial, como energia e esgoto, demonstrou um impacto exponencial na elevação da taxa de evasão, atuando como um fator excludente em contextos de alta vulnerabilidade.

A principal contribuição deste trabalho reside na oferta de uma ferramenta analítica robusta, o modelo Random Forest, que pode auxiliar gestores educacionais na tomada de decisões estratégicas para direcionar investimentos em políticas públicas preventivas. Contudo, o estudo apresentou limitações, especialmente na predição da evasão no Ensino Médio, onde fatores socioeconômicos e a idade do aluno, não integralmente capturados pelos dados de infraestrutura escolar, parecem exercer maior influência. Para estudos futuros, recomenda-se a integração de bases de dados socioeconômicas, como as do IBGE e CadÚnico, visando aprimorar o poder preditivo para o Ensino Médio. Sugere-se também a evolução da metodologia para abordagens de inferência causal, explorando a dimensão temporal dos dados para verificar se intervenções específicas em infraestrutura precedem efetivamente a redução das taxas de evasão, o que pode refinar as diretrizes para a alocação eficiente de recursos públicos na educação brasileira.

Referências Bibliográficas

Branco, E.P.; Adriano, G.; Branco, A.B. de G.; & Iwasse, L.F.A. 2020. EVASÃO ESCOLAR: DESAFIOS PARA PERMANÊNCIA DOS ESTUDANTES NA EDUCAÇÃO BÁSICA. Revista Contemporânea de Educação 15(34): 133-155.

Constituição da República Federativa do Brasil de 1988. 1988. Disponível em: . Acesso em: 1 set. 2025.

IBGE. 2024. PNAD Contínua: Educação 2024: informativo. Disponível em: .

Oliveira, M.Z. de; Moreira, T. da C.; Machado, W. de L.; & Machado, J.S. 2024. Identificação de Fatores de Risco para Evasão Escolar em Ensino Fundamental e Médio. Avaliação Psicológica 2

Ramos, A.C.; & Gonçalves Junior, O. 2024. Abandono e evasão escolar sob a ótica dos sujeitos envolvidos. Educação e Pesquisa 50: e268037.

Santos, M.C.S.; Delatorre, L.R.; Ceccato, M. das G.B.; & Bonolo, P. de F. 2019. Programa Bolsa Família e indicadores educacionais em crianças, adolescentes e escolas no Brasil: revisão sistemática. Ciência & Saúde Coletiva 24: 2233-2247.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

10 de setembro de 2026

Desempenho de Modelos de Machine Learning na Seleção de Ações da Bolsa de Valores Brasileira

O mercado acionário brasileiro, caracterizado por elevada volatilidade e restrições de liquidez, impõe desafios à aplicação de modelos de aprendizado de máquina na previsão de retornos e na construção de estratégias de investimento. O estudo comparou o desempenho preditivo e econômico de modelos de aprendizado de máquina e métodos estatísticos tradicionais na estimação de retornos futuros e na formação de carteiras baseadas em ranking de ativos. Utilizaram-se dados históricos de ações da B3, com variáveis técnicas e financeiras derivadas de preços e volume. Avaliaram-se modelos lineares (Regressão Linear, Ridge, LASSO, Elastic Net), de ensemble (Random Forest, XGBoost, LightGBM) e uma rede neural (Multilayer Perceptron). A avaliação preditiva ocorreu por métricas de erro em conjunto de teste, e a econômica por backtest de estratégias long-only, com custos operacionais baseados no turnover para análise de retornos brutos e líquidos. Os resultados revelaram baixa capacidade preditiva em todos os modelos, com R² negativos e erros elevados. Embora diferenças marginais nas previsões tenham gerado variações no desempenho econômico, estas foram de baixa magnitude e instáveis. O modelo LightGBM obteve o melhor desempenho econômico, mas com ganhos limitados em relação ao benchmark após a inclusão de custos operacionais. Não se observou evidência consistente de geração de retorno ajustado ao risco superior.

Palavras-chave: aprendizado de máquina; backtest; mercado acionário; previsão de retornos; seleção de ativos.

10 de setembro de 2026

Precificação Hedônica de Imóveis na Grande Florianópolis: Uso e Comparação de Modelos de “Machine Learning”

O mercado imobiliário da Grande Florianópolis tem experimentado valorização acelerada, impulsionada pelo crescimento populacional e pela demanda turística e de investimento. Este estudo analisou os determinantes do valor de imóveis residenciais e comparou o desempenho preditivo de modelos de aprendizado de máquina, especificamente Random Forest e Gradient Boosting (XGBoost), com uma regressão por Mínimos Quadrados Ordinários (MQO). Os dados foram coletados via web scraping de dois portais imobiliários em março de 2026, abrangendo os municípios de Florianópolis, São José, Palhoça e Biguaçu, resultando em 8.056 observações válidas após limpeza. Avaliou-se o desempenho dos modelos por meio das métricas R², RMSE e MAPE. O XGBoost apresentou o melhor desempenho preditivo geral (R² = 0,742, RMSE = R$ 927.113), enquanto o Random Forest obteve o menor erro relativo (MAPE = 25,69%). Os principais determinantes do preço identificados foram a área construída, a região de localização e o número de banheiros. Uma análise complementar por segmento de mercado revelou que o MQO dependeu dos valores extremos para sustentar seu ajuste, enquanto os modelos ensemble mantiveram desempenho estável. Concluiu-se que os métodos de aprendizado de máquina são mais robustos para precificação hedônica em mercados imobiliários heterogêneos, especialmente na presença de imóveis atípicos.

Palavras-chave: Ensemble; Imobiliário; Regressão; Residencial; Web Scraping.

Neurociência E Aprendizagem Na Educação

10 de setembro de 2026

A Produção de Memes como Estratégia de Formação Literária e Multiletramentos no Ensino Fundamental Ii

A leitura de obras literárias clássicas apresenta desafios no contexto escolar contemporâneo, devido ao distanciamento entre a linguagem dos textos e o repertório dos estudantes. Investigou-se como a utilização de memes contribuiu para a construção de sentidos na leitura da obra Senhora, de José de Alencar, no Ensino Fundamental II. A pesquisa adotou uma abordagem qualitativa, com caráter de pesquisa participante, e foi desenvolvida com duas turmas de 9º ano de uma escola privada em Volta Redonda, Rio de Janeiro. Os dados foram coletados por meio de questionários e das produções dos estudantes, e analisados à luz da análise de conteúdo. Os resultados indicaram que a utilização de memes favoreceu a aproximação dos alunos com o texto literário, reduziu a resistência inicial e ampliou o engajamento com a leitura. Observou-se, também, o avanço progressivo na compreensão da narrativa, evidenciado pela capacidade de interpretar fatos, analisar personagens, identificar relações implícitas e elaborar posicionamentos críticos. As produções revelaram a articulação entre o conteúdo da obra e o repertório sociocultural dos estudantes, indicando a construção de aprendizagens com significado. Concluiu-se que a integração entre literatura e cultura digital potencializou a mediação pedagógica, contribuindo para a formação de leitores mais ativos e interpretativamente autônomos.

Palavras-chave: aprendizagem significativa; cultura digital; leitura literária; multiletramentos; neurociência.

Gestão Tributária

10 de setembro de 2026

Definição de Insumos para Fins de Aproveitamento de Créditos de Pis e Cofins

O estudo analisou a interpretação e a aplicação da definição de insumos para fins de creditamento do Programa de Integração Social (PIS) e da Contribuição para o Financiamento da Seguridade Social (COFINS) no regime não cumulativo, à luz do entendimento firmado pelo Superior Tribunal de Justiça (STJ) no julgamento do Recurso Especial n.º 1.221.170 (Tema 779). Objetivou-se examinar os limites jurídicos da utilização desses créditos, considerando os critérios de essencialidade ou relevância estabelecidos pela jurisprudência do STJ. Realizou-se pesquisa documental e jurisprudencial, com análise de acórdãos representativos do Conselho Administrativo de Recursos Fiscais (CARF) e do STJ, abrangendo períodos anteriores e posteriores ao Tema 779. Complementarmente, conduziu-se pesquisa bibliográfica e estudos de dois casos concretos do CARF, com abordagem qualitativa, para verificar a aplicação prática dos critérios. Constatou-se que o STJ afastou a aplicação automática da definição de insumo do IPI, consolidando os critérios de essencialidade e relevância. Entretanto, a análise dos julgados do CARF evidenciou que, embora houvesse reconhecimento formal do precedente do STJ, sua incidência foi modulada conforme a natureza da atividade empresarial, mostrando-se mais restritiva para empresas de revenda. Os casos concretos ilustraram que creditamentos de fretes foram tratados de forma distinta, dependendo da vinculação do gasto à produção ou à revenda. Concluiu-se que a definição de insumos permanece um ponto sensível do sistema tributário, e a correta utilização dos créditos demanda análise casuística rigorosa, pautada na observância dos precedentes judiciais e dos limites normativos vigentes, para evitar glosas e penalidades.

Palavras-chave: COFINS; Creditamento; Insumos; PIS.

Gestão Tributária

10 de setembro de 2026

Fiscalização Delegada do Itr: Desestímulo aos Convênios, Reflexos na Arrecadação e Desinteresse Processual da União

O Imposto Territorial Rural (ITR), de competência da União, pode ter sua fiscalização e cobrança delegadas aos Municípios e ao Distrito Federal. Este trabalho examinou a adesão municipal a esses convênios e o impacto na arrecadação, analisou se os entraves processuais para os Municípios remeterem demandas aos órgãos federais desestimulavam a celebração de acordos, e avaliou o interesse processual da União em litígios de ITR sob delegação, à luz da Teoria Eclética da Ação, bem como a efetividade da diretriz constitucional de desestímulo a propriedades improdutivas. A pesquisa utilizou um estudo de caso, com base em dados e relatórios oficiais da Receita Federal do Brasil e referencial doutrinário jurídico. Os resultados indicaram baixa adesão municipal aos convênios, com quase 75% dos municípios sem acordo. A arrecadação do ITR, mesmo integralmente repassada, não justificou os investimentos municipais, e a manutenção da atuação processual pela União desestimulou a continuidade dos ajustes. Verificou-se que a União carecia de interesse processual nessas demandas, dada a ínfima representatividade do ITR na arrecadação federal e a ausência de proveito econômico-financeiro, o que impediu o cumprimento efetivo da diretriz constitucional de desestímulo à improdutividade rural. Concluiu-se que são necessárias modificações legislativas para que o ITR alcance seus objetivos de arrecadação e função social.

Palavras-chave: Arrecadação; Eficiência; Fiscalização; ITR; Municípios.

10 de setembro de 2026

Governança de Dados e Risco Financeiro no Setor Florestal: Evidências Empíricas em Perspectiva Brasil-finlândia

A fragmentação informacional no setor florestal brasileiro constituiu o ponto de partida desta pesquisa, que investigou como a governança de dados impactou a capacidade analítica, o risco financeiro e a competitividade da gestão florestal, por meio de um estudo comparativo entre Brasil e Finlândia. Submeteram-se 332 documentos, incluindo 307 informativos CEPEA/Esalq/USP (2001–2025) e 25 relatórios setoriais (Bracelpa, ABRAF, Ibá, 2003–2025), a um pipeline de extração automatizado baseado em OCR, mineração de texto e expressões regulares, obtendo-se 13.059 registros estruturados. Realizou-se análise de sensibilidade do Valor Presente Líquido (VPL) e análise de sentimento léxica. Apenas 12,1% dos registros de custo continham Custo Operacional Efetivo preenchido, e nenhum apresentou margem líquida calculável. A incerteza nos dados de entrada oscilou o VPL de um projeto florestal em mais de R$ 20.000/ha, evidenciando a distorção da decisão orientada por dados quando a sofisticação algorítmica não substituiu a qualidade dos dados de origem. A análise de sentimento léxica confirmou a transição dos relatórios setoriais brasileiros de formato estatístico para promocional. Em contraste, o modelo finlandês demonstrou a viabilidade de uma governança integrada, com o inventário florestal consolidado como pilar de inteligência industrial. Os resultados indicaram que o fortalecimento da governança de dados constituiu pré-requisito para a transição do setor para um sistema de planejamento sustentado por evidências.

Palavras-chave: competitividade; fragmentação informacional; inteligência artificial; soberania digital; tomada de decisão.

10 de setembro de 2026

Modelagem Multinível na Estimativa da Produtividade da Cana-de-açúcar (Saccharum Spp.) em Unidades Produtoras na Região Sudeste de Mato Grosso do Sul

A estimativa da produtividade é essencial para o planejamento agrícola, mas a estrutura de agrupamento dos dados agronômicos frequentemente viola o pressuposto de independência dos modelos clássicos de regressão. Avaliou-se a acurácia de modelos multiníveis com classificação cruzada na predição do rendimento agrícola da cana-de-açúcar na região sudeste de Mato Grosso do Sul, abrangendo as safras de 2019/2020 a 2023/2024. O estudo analisou 29.674 observações, organizadas sobre 10.336 talhões e 30 variedades. Integraram-se preditores biofísicos e agrometeorológicos, aplicando-se a estratégia “Step-Up” para a construção da estrutura multinível e a decomposição da variância. Os resultados evidenciaram que a abordagem particionou adequadamente a variância espacial, genética e temporal, quantificando com êxito a interação genótipo-ambiente. O ajuste final com inclinações aleatórias (M7) explicou 81,1% da variância total e alcançou uma Raiz do Erro Quadrático Médio (RMSE) de 10,24 t ha⁻¹. A diferença de 9,8% aferida entre o Pseudo-R² marginal e o condicional demonstrou o relevante ganho explicativo gerado pela classificação cruzada. O desempenho preditivo equiparou-se à exatidão reportada por algoritmos de Machine Learning, mantendo o rigor paramétrico e a interpretabilidade dos preditores agronômicos. Concluiu-se que a modelagem multinível consistiu em uma ferramenta analítica robusta e transparente para a estimativa de produtividade e o planejamento do setor sucroenergético.

Palavras-chave: Agrometeorologia; Cana-de-açúcar; Classificação cruzada; Modelagem multinível; Rendimento agrícola.

Gestão Escolar

10 de setembro de 2026

Escuta e Participação Docente: Caminhos para a Gestão Democrática em uma Escola Privada.

A escuta e a participação docente são elementos cruciais para a gestão democrática em instituições de ensino. O estudo analisou a escuta e a participação docente como componentes da gestão democrática em uma escola privada, considerando os desafios, limites e possibilidades desse modelo em um contexto influenciado pela lógica empresarial. A pesquisa adotou uma abordagem qualitativa e quantitativa. Aplicou-se um questionário a 21 professores de uma escola privada em São José dos Campos-SP, com questões fechadas e abertas. Realizou-se também análise documental do Projeto Político Pedagógico e de atas de reuniões pedagógicas para identificar percepções sobre participação, escuta, valorização profissional e processos decisórios. Os resultados indicaram que os docentes demonstraram clareza conceitual sobre a gestão democrática participativa e reconheceram sua importância para a qualidade pedagógica e o fortalecimento da profissão. Contudo, os dados revelaram limites concretos à sua efetivação, como a centralização das decisões, a influência da lógica mercadológica, a fragilidade dos canais institucionais de escuta e o receio de exposição. Concluiu-se que a escuta e a participação docente configuraram-se como desafios políticos, culturais e organizacionais na escola privada, exigindo intencionalidade da gestão, formação para práticas democráticas e compromisso coletivo entre gestores e professores, reafirmando a escola como espaço de diálogo, construção coletiva e defesa da educação como bem comum.

Palavras-chave: Cultura organizacional; Gestão participativa; Lógica mercadológica; Processos decisórios; Valorização docente.

Neurociência E Aprendizagem Na Educação

10 de setembro de 2026

Percepção Parental sobre a Influência de Narrativas Literárias Morais no Comportamento Infantil

A formação moral na infância representa um desafio contemporâneo, dada a saturação de estímulos digitais e a necessidade de resiliência socioemocional. Nesse contexto, a literatura infantil assume um papel crucial na modulação das intuições morais básicas durante a intensa plasticidade cerebral. O estudo investigou a percepção de pais e responsáveis sobre o impacto da leitura de narrativas com fundo moral no desenvolvimento ético e comportamental de crianças entre 4 e 12 anos. Fundamentada em perspectivas da neurociência cognitiva, a pesquisa analisou como a literatura atua como um sofisticado simulador social na construção do senso moral infantil. A metodologia consistiu na aplicação de um questionário estruturado eletrônico, respondido por 197 participantes de diferentes perfis socioculturais, em uma abordagem quanti-qualitativa. Os resultados indicaram que a frequência predominante de leitura nas famílias ocorreu de uma a duas vezes por semana, revelando elevada intencionalidade pedagógica, com a lição moral como critério decisivo na escolha das obras. Observou-se, ainda, que a mediação ativa estimulou significativamente a empatia, a formulação espontânea de perguntas críticas sobre dilemas éticos e a transposição de virtudes para o cotidiano. Concluiu-se que as narrativas literárias morais constituem ferramentas eficazes para a regulação emocional e para o fortalecimento de redes neurais vinculadas à valoração social, servindo a prática literária mediada como andaime essencial para a internalização de normas sociais de forma lúdica e reflexiva.

Palavras-chave: Comportamento; Desenvolvimento moral; Empatia; Literatura infantil; Neurociência.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade