29 de setembro de 2026
Predição do engajamento estudantil em ensino a distância com random forest
Predição do Engajamento Estudantil em Ensino a Distância com Random Forest
Beatriz Deiró Martinez; Luana Candaten
DOI: 10.22167/2675-6528-202602708
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
O crescimento dos cursos de ensino a distância (EAD), intensificado no cenário pós-COVID-19, ampliou o acesso à educação, mas também revelou desafios significativos relacionados ao engajamento e à permanência dos estudantes. Estudos recentes indicaram que baixos níveis de engajamento em ambientes virtuais de aprendizagem estiveram associados à evasão e ao baixo desempenho acadêmico. Diante desse contexto, o estudo objetivou identificar padrões de comportamento estudantil que possibilitassem a detecção precoce do desengajamento. Para isso, utilizou-se uma abordagem baseada em mineração de dados e aprendizado supervisionado, a partir de dados gerados por ambientes virtuais de aprendizagem, incluindo logs de acesso, participação em fóruns, envio de atividades e tempo de estudo. Desenvolveu-se um modelo preditivo empregando o algoritmo Random Forest, selecionado por sua capacidade de lidar com dados heterogêneos e ruidosos. Os resultados indicaram que a abordagem foi eficaz na identificação de padrões relevantes de comportamento estudantil. Concluiu-se que o modelo proposto apresentou potencial para apoiar intervenções pedagógicas e subsidiar a tomada de decisão em instituições de ensino, contribuindo para a melhoria da retenção e do sucesso acadêmico.
Palavras-chave: Aprendizagem online; Comportamento do aluno; Evasão acadêmica; Mineração educacional; Modelos preditivos.
1. Introdução
Nos últimos anos, o surgimento de instituições com cursos focados no ensino a distância (EAD) ganhou impulso, evidenciando um crescimento exponencial em escala global (SOUZA; LIMA, 2022). Essa modalidade de ensino tornou-se essencial para ampliar o acesso à educação, especialmente no cenário pós-COVID-19. Entre os fatores que impulsionaram essa expansão, destacam-se a flexibilidade de horários e a possibilidade de um aprendizado autônomo, consolidando o EAD como uma alternativa viável para milhares de estudantes (MORAES, 2021).
Contudo, esse crescimento trouxe consigo diversos desafios relacionados ao engajamento e à permanência dos alunos, fatores que se associam diretamente à qualidade do aprendizado e às taxas de evasão (CARVALHO et al., 2020). Diversos estudos indicam que o baixo engajamento em ambientes virtuais de aprendizagem é uma das principais causas de abandono e baixo desempenho acadêmico.
Nesse contexto, o nível de engajamento é compreendido como o grau de envolvimento emocional, cognitivo e comportamental de um estudante com suas atividades acadêmicas (FREDRICKS; BLUMENFELD; PARIS, 2004). Tal envolvimento é um fator crucial para o sucesso no processo de aprendizagem. Assim, compreender a conduta dos alunos e antecipar sinais de desengajamento torna-se fundamental para que as instituições de ensino possam intervir de forma proativa.
Com a modernização das tecnologias relacionadas à Ciência de Dados, e especificamente à Mineração de Dados, torna-se possível extrair conhecimento a partir de grandes volumes de dados gerados por plataformas de ensino. Exemplos incluem logs de acesso, participação em fóruns, envio de atividades e a intensidade de interações na plataforma (ROMERO; VENTURA, 2020). Essas informações permitem a construção de modelos preditivos capazes de identificar padrões de comportamento e classificar o nível de engajamento dos estudantes.
Entre as múltiplas abordagens do aprendizado de máquina, o algoritmo Random Forest se destaca por sua robustez e capacidade de lidar com variáveis heterogêneas e ruídos nos dados (BREIMAN, 2001). Esse algoritmo de classificação supervisionada combina múltiplas árvores de decisão para gerar previsões mais precisas e estáveis, sendo amplamente utilizado em áreas como finanças, saúde e educação (ZHANG et al., 2019).
Considerando esse contexto, este trabalho tem como objetivo principal analisar o engajamento de estudantes em ambientes de ensino a distância através da utilização de técnicas de mineração de dados e o algoritmo Random Forest, a fim de identificar padrões de comportamento que possam auxiliar na prevenção da evasão e na melhoria das estratégias pedagógicas. Portanto, a importância desse trabalho está na conexão entre tecnologia e educação, evidenciando o potencial da análise de dados para compreender tais fenômenos complexos, como o engajamento estudantil e, assim, propor soluções inovadoras para os desafios atuais da educação digital.
2. Material e Métodos
A pesquisa foi conduzida com uma abordagem quantitativa e aplicada, caracterizando-se como descritiva e explicativa. O objetivo foi identificar e detalhar padrões de comportamento de estudantes em ambientes de ensino a distância, bem como analisar as relações entre variáveis demográficas, socioeconômicas, acadêmicas e o nível de engajamento. O estudo buscou compreender a interconexão de fatores que influenciam a participação em plataformas virtuais de aprendizagem.
Os dados utilizados foram secundários e de acesso público, provenientes do repositório Open University Learning Analytics Dataset (OULAD). Este conjunto continha informações anonimizadas sobre estudantes matriculados em cursos EAD, abrangendo variáveis demográficas, socioeconômicas, acadêmicas e de interação em Ambientes Virtuais de Aprendizagem (AVA). A confidencialidade dos dados foi assegurada, pois nenhuma informação de identificação direta dos participantes foi empregada.
A coleta dos dados ocorreu por meio do download de arquivos estruturados em formato CSV, que foram importados para um ambiente de análise em Python. O estudo foi desenvolvido em ambiente computacional utilizando a linguagem Python (versão 3.x). Para manipulação e organização dos dados, empregaram-se as bibliotecas pandas e numpy. A modelagem e análise estatística foram realizadas com scikit-learn. As bibliotecas matplotlib e seaborn foram utilizadas para visualização, e imbalanced-learn para a técnica SMOTE. O ambiente de desenvolvimento foi o Google Colab, com controle de versão via GitHub.
Antes da aplicação dos modelos, os dados passaram por um processo de pré-processamento e integração. A base original do OULAD registrava 32.593 estudantes. As etapas iniciais incluíram limpeza de dados, tratamento de valores ausentes e remoção de registros duplicados. Após a integração das tabelas demográficas com os registros comportamentais, a base final consolidada para a modelagem totalizou 29.741 registros.
Dessa amostra, 26.074 estudantes possuíam históricos completos de cliques computáveis para a análise de engajamento. As etapas de preparação incluíram a transformação de variáveis categóricas por Label Encoding e a normalização ou padronização das variáveis numéricas. O conjunto de dados foi dividido em 70% para treinamento (20.818 registros) e 30% para teste (8.923 registros). Para balancear as classes de engajamento, aplicou-se a técnica SMOTE (Synthetic Minority Over-sampling Technique).
A variável de engajamento dos estudantes foi operacionalizada a partir da base de interações do ambiente virtual (studentVle). Calculou-se a intensidade total de cliques por aluno, representada pelo somatório da variável sum_click. Essa métrica quantificou o volume e a intensidade das interações com a interface da plataforma. A base consolidada final reuniu 14 variáveis, incluindo atributos demográficos, socioeconômicos, acadêmicos e comportamentais.
Para lidar com a dispersão e assimetria dos dados comportamentais, adotou-se a segmentação dos estudantes em três perfis de engajamento, baseada nos quartis da distribuição. O baixo engajamento foi definido para estudantes com até 824 interações. O médio engajamento incluiu aqueles com interações entre 825 e 2.018. Estudantes com volumes superiores a 2.018 interações foram classificados como alto engajamento.
Para a modelagem preditiva, utilizou-se o algoritmo Random Forest (Breiman, 2001), um método de aprendizado de máquina supervisionado baseado em múltiplas árvores de decisão. O treinamento do modelo ocorreu com o subset de 70% dos dados. O ajuste de hiperparâmetros foi realizado com GridSearchCV, testando variações no número de árvores (n_estimators = 100) e na profundidade máxima das ramificações (max_depth). A validação cruzada com 5 divisões (k-fold = 5) foi aplicada para aumentar a confiabilidade e mitigar o sobreajuste.
A avaliação do desempenho do classificador foi realizada por meio das métricas de acurácia, precisão, recall e F1-score, além da análise da matriz de confusão. Adicionalmente, mapeou-se a importância relativa das variáveis (feature importance) para identificar os fatores com maior impacto na predição do engajamento. A interpretação dos resultados foi apoiada por visualizações gráficas.
3. Resultados e Discussão
Os resultados apresentados nesta seção correspondem às análises realizadas, contemplando as etapas de exploração dos dados, caracterização do perfil discente, desenvolvimento do modelo preditivo e interpretação dos padrões identificados. Os achados obtidos fornecem evidências relevantes sobre o comportamento dos estudantes em ambientes de ensino a distância e sobre a capacidade de modelos de aprendizado supervisionado em capturar tais padrões. A discussão foi conduzida à luz da literatura, permitindo contextualizar os resultados no cenário da educação a distância e da mineração de dados educacionais, conforme o objetivo de identificar padrões de comportamento estudantil que possibilitassem a detecção precoce do desengajamento.
A pesquisa utilizou um conjunto de dados expressivo, proveniente do Open University Learning Analytics Dataset (OULAD), que se mostrou uma fonte rica de informações. O volume de dados incluía mais de 10 milhões de registros de interações na plataforma, evidenciando a complexidade e a profundidade do ambiente de aprendizagem digital. Foram extraídas cinco tabelas principais, que totalizaram 22 registros de cursos, 6.364 recursos do ambiente virtual, 173.912 registros de avaliações acadêmicas, 32.593 registros brutos de estudantes e 10.655.280 logs de cliques na plataforma, fornecendo uma base robusta para a análise comportamental.
Na análise exploratória inicial da base de estudantes, observou-se a distribuição do desfecho acadêmico final, revelando quatro categorias distintas. Verificou-se que 12.361 estudantes foram aprovados, 10.156 evadiram, 7.052 foram reprovados e 3.024 obtiveram distinção. A elevada taxa de abandono, com 10.156 estudantes classificados como “Withdrawn”, reforça a importância de compreender os fatores associados ao engajamento, uma vez que baixos níveis de participação estão diretamente relacionados ao desligamento precoce do estudante (CARVALHO et al., 2020). Esse volume expressivo de evadidos valida a adequação dos dados para o problema investigado, destacando a urgência de identificar padrões preditivos.
A partir dos registros históricos contidos na base de interações da plataforma, calculou-se o volume total de cliques por aluno, denominado `sum_click`, para 26.074 estudantes com históricos de interação computáveis. Os dados revelaram uma média de 1.518,95 cliques por estudante, com um desvio-padrão de 1.935,99, evidenciando uma elevadíssima dispersão nas interações. A mediana fixou-se em 824 cliques, enquanto os valores mínimo e máximo corresponderam a 1 e 28.615 cliques, respectivamente. Essa ampla variação sublinha a heterogeneidade do comportamento dos estudantes na plataforma, justificando a necessidade de uma segmentação mais detalhada.
A análise dos quartis da distribuição de cliques indicou que 25% dos estudantes apresentaram até 298 interações, 50% (mediana) acumulou até 824 interações e 75% atingiu até 2.018 interações. Essa distribuição apresentou forte assimetria à direita, caracterizada por uma imensa concentração de alunos com baixos níveis de cliques e uma cauda longa contendo usuários altamente ativos. Essa heterogeneidade comportamental justificou a segmentação dos estudantes através de pontos de corte estatísticos baseados nos quartis, categorizando-os em baixo, médio e alto engajamento para a modelagem preditiva.
A distribuição final das classes de engajamento resultou em 13.039 estudantes com baixo engajamento, 6.520 com médio engajamento e 6.515 com alto engajamento. Observou-se uma predominância significativa da categoria de baixo engajamento, que representou aproximadamente metade da amostra total. Esse achado sugere que grande parte dos discentes interage de forma limitada com o ambiente virtual, o que potencialmente reflete os comportamentos associados à evasão identificados na literatura. A identificação dessa predominância é crucial para direcionar intervenções pedagógicas e estratégias de retenção, conforme o objetivo do estudo.
Para a modelagem, a base de dados foi consolidada, integrando atributos demográficos, socioeconômicos, acadêmicos e comportamentais. Esse conjunto final totalizou 29.741 registros e 14 variáveis, incluindo gênero, região, faixa etária, faixa socioeconômica (imd_band), créditos cursados, tentativas anteriores, resultado final e tempo de acesso. Essa integração foi fundamental para viabilizar a aplicação do modelo de aprendizado supervisionado, garantindo que diferentes dimensões do comportamento do estudante fossem consideradas simultaneamente, proporcionando uma análise mais abrangente dos fatores associados ao engajamento.
O algoritmo Random Forest foi aplicado com 100 árvores de decisão, utilizando 70% dos dados para treinamento (20.818 registros) e 30% para teste (8.923 registros). O modelo obteve uma acurácia de 54,26%, precisão de 52,67%, recall de 54,26% e F1-score de 53,31%. Por se tratar de um problema de classificação tripla, esses resultados mostraram-se estatisticamente superiores ao desempenho de um cenário puramente aleatório, estimado em 33,3%, indicando a presença de um sinal preditivo nos dados e a capacidade do modelo de capturar padrões relevantes.
Contudo, a avaliação detalhada da matriz de confusão revelou que o algoritmo enfrentou desafios na distinção entre classes adjacentes. Esse fenômeno é uma consequência direta da estratégia de modelagem adotada, que discretizou uma distribuição originalmente contínua de cliques em limites rígidos estabelecidos pelos quartis (824 e 2.018 interações). Essa abordagem criou fronteiras artificiais, onde estudantes posicionados nas franjas dessas linhas divisórias, como um aluno com 820 cliques e outro com 830 cliques, exibem comportamentos e perfis demográficos praticamente idênticos. Isso gerou sobreposição nas regras de decisão do modelo, justificando os erros de classificação concentrados entre níveis intermediários de engajamento.
A extração da importância das variáveis (feature importance) gerada pelo Random Forest determinou que o engajamento na aprendizagem digital não é determinado apenas por fatores internos do ambiente virtual, mas sofre forte influência de componentes contextuais e externos. A distribuição do impacto das variáveis apresentou uma configuração clara, com a variável “Região” sendo a de maior relevância na árvore de decisão, com um valor de 0,2579. Este achado indica que o contexto geográfico do estudante desempenha um papel significativo na predição do engajamento, superando outras variáveis comportamentais e demográficas.
Em seguida, a “Faixa socioeconômica – imd_band” (0,2335) emergiu como o segundo fator de maior peso preditivo, seguida pelo “Resultado final acadêmico” (0,1707), “Créditos cursados” (0,1357) e “Escolaridade prévia” (0,0718). A liderança das variáveis de localização geográfica e de vulnerabilidade socioeconômica expõe que desigualdades estruturais externas ao ambiente escolar impactam diretamente as condições de acesso, infraestrutura tecnológica e tempo disponível para o estudo autônomo, alinhando-se aos achados de Moraes (2021). Isso reforça a ideia de que o engajamento é um fenômeno multifacetado, influenciado por fatores que transcendem a interação direta com a plataforma.
O peso atribuído ao resultado final acadêmico expõe uma relação bidirecional complexa: a falta de engajamento inicial pode gerar lacunas de aprendizado que culminam em reprovações ou abandono, ao mesmo tempo em que o acúmulo de notas baixas desmotiva o estudante, reduzindo drasticamente seu volume de cliques e interações subsequentes na plataforma. Por outro lado, variáveis puramente demográficas como gênero, idade e presença de deficiência registraram os menores impactos na capacidade preditiva do modelo. Esses resultados sugerem que, embora o comportamento na plataforma seja importante, os fatores socioeconômicos e geográficos são determinantes para o engajamento e, consequentemente, para o sucesso acadêmico.
Em síntese, o estudo demonstrou que a aplicação de técnicas de mineração de dados e o algoritmo Random Forest são eficazes na identificação de padrões de comportamento estudantil em ambientes de ensino a distância. A predominância de estudantes com baixo engajamento e a influência significativa de variáveis contextuais e socioeconômicas, como região e faixa socioeconômica, sobre o engajamento, fornecem informações valiosas. Esses achados indicam que o modelo proposto tem potencial para apoiar intervenções pedagógicas e subsidiar a tomada de decisão em instituições de ensino, contribuindo para a melhoria da retenção e do sucesso acadêmico, ao permitir a detecção precoce de sinais de desengajamento.
4. Conclusão
O presente estudo objetivou analisar o engajamento de estudantes em ambientes de ensino a distância por meio da aplicação de técnicas de mineração de dados e do algoritmo Random Forest, buscando identificar padrões de comportamento que pudessem auxiliar na prevenção da evasão e na melhoria das estratégias pedagógicas. Verificou-se uma grande variabilidade no engajamento estudantil, com predominância de baixos níveis de interação na plataforma virtual, onde aproximadamente metade da amostra concentrou-se abaixo de 824 cliques. Esse achado reforça a associação entre baixos volumes de interações e a evasão ou baixo desempenho acadêmico em cursos EAD. O modelo preditivo desenvolvido, empregando o algoritmo Random Forest, apresentou uma acurácia de 54,26% para a classificação tripla do engajamento, desempenho estatisticamente superior a um cenário aleatório, indicando sua capacidade de capturar sinais preditivos relevantes. A análise da importância das variáveis revelou que fatores contextuais, como a região geográfica e a faixa socioeconômica, exerceram maior influência sobre o engajamento do que o comportamento isolado na plataforma ou variáveis puramente demográficas. Esses resultados demonstram que o engajamento discente é um fenômeno complexo, influenciado por desigualdades estruturais externas ao ambiente escolar. A principal contribuição do estudo reside no potencial de subsidiar ferramentas de apoio à tomada de decisão em instituições de ensino, possibilitando a identificação precoce de estudantes em risco de desengajamento e, consequentemente, a melhoria da retenção e do sucesso acadêmico.
Como limitações do estudo, destaca-se o uso de dados secundários, o que restringiu o controle sobre o preenchimento inicial das informações e impediu a inclusão de aspectos emocionais e cognitivos do engajamento. Para estudos futuros, recomenda-se o aprimoramento do modelo por meio do ajuste fino de hiperparâmetros, o teste de algoritmos concorrentes como XGBoost ou Support Vector Machines, e a inclusão de novas variáveis acadêmicas longitudinais. Conclui-se que a Ciência de Dados Educacionais apresenta grande potencial para transformar registros brutos de interações digitais em conhecimento estratégico, contribuindo para o desenvolvimento de políticas institucionais mais eficazes de acompanhamento, retenção e inclusão no ensino a distância.
Referências Bibliográficas
BREIMAN, L. 2001. Random forests. Machine Learning 45: 5-32.
CARVALHO, A. et al. 2020. Engajamento e evasão em ambientes virtuais de aprendizagem: desafios e perspectivas. Revista Brasileira de Educação a Distância 27(2): 45–62.
FREDRICKS, J. A.; BLUMENFELD, P. C.; PARIS, A. H. 2004. School engagement: potential of the concept, state of the evidence. Review of Educational Research 74(1): 59–109.
MORAES, R. 2021. Ensino a distância: desafios e oportunidades no contexto educacional contemporâneo. Revista Educação & Tecnologia 15(3): 112–128.
ROMERO, C.; VENTURA, S. 2020. Educational data mining and learning analytics: an updated survey. Wiley Interdisciplinary Reviews: Data Mining and Knowledge Discovery 10(3): e1355.
SOUZA, M.; LIMA, R. 2022. Crescimento do ensino a distância no Brasil e no mundo: impactos e tendências. Revista Científica Educação Digital 8(1): 23–40.
ZHANG, Z. H. et al. 2019. Application of random forest in educational data mining. IEEE Access 7: 145678-145689.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

