Resumen Ejecutivo

Educación

10 de diciembre de 2025

Selección de modelo de lenguaje para la evaluación de ensayos del Enem

Heitor Dutra de Assumpção; Adriana Camargo de Brito

Resumen elaborado por la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege orientada a la síntesis y redacción.

Este estudio verifica la viabilidad del uso de Modelos de Lenguaje (LLMs) como evaluadores automáticos, bajo el paradigma “LLM-as-a-Judge”, para la corrección de redacciones del Examen Nacional de Enseñanza Media (ENEM). La investigación compara sistemáticamente la calidad de la evaluación, la consistencia, la latencia y el costo computacional de cinco modelos distintos, sometidos a un protocolo reproducible. Se empleó un prompt único y estable, diseñado para instruir a los modelos a aplicar estrictamente la rúbrica oficial del examen, desglosada en las cinco competencias (C1 a C5). La evaluación se realizó sobre un corpus público de redacciones con nota máxima (1.000 puntos) en las ediciones de 2022 a 2024 del ENEM, utilizando un sistema automatizado para la recolección estandarizada de métricas de desempeño y validaciones de la conformidad de las salidas.

La corrección de ensayos en evaluaciones a gran escala como el ENEM representa un gran desafío logístico y financiero. En Brasil, el procedimiento tradicional, que involucra pares de correctores humanos y auditorías, acarrea altos costos operativos y prolonga el tiempo para la divulgación de los resultados. Estimaciones apuntan a costos directos de millones de reales asociados a la corrección humana (Oliveira Júnior, 2025), impulsando la búsqueda de soluciones tecnológicas. El desafío es desarrollar sistemas que preserven la adherencia a la compleja rúbrica oficial e introduzcan ganancias de escala, celeridad, rastreabilidad y auditabilidad en cada juicio.

La literatura sobre Evaluación Automática de Redacciones (AAR), o Automated Essay Scoring (AES), tiene una larga trayectoria. Los orígenes se remontan al Project Essay Grade (PEG), que utilizaba predictores superficiales como la longitud de las palabras para estimar una calificación (Page, 1966). Sistemas más sofisticados, como el e-rater, incorporaron indicadores lingüísticos más ricos y demostraron alta concordancia con evaluadores humanos (Attali; Burstein, 2006). A pesar de los avances, el área de AES enfrenta críticas sobre la falta de transparencia, los potenciales efectos pedagógicos negativos y el riesgo de que los sistemas sean susceptibles a estrategias de gaming por parte de los estudiantes (Dikli, 2006; Perelman, 2014).

En el ENEM, la corrección se basa en cinco competencias detalladas, lo que exige una evaluación multifacética. Una limitación práctica para la investigación de AAR en Brasil es la política de datos del Instituto Nacional de Estudios e Investigaciones Educativas Anísio Teixeira (INEP), que divulga públicamente solo los ensayos con una puntuación máxima de 1.000 puntos. Esta restricción impide la aplicación de enfoques de aprendizaje supervisado tradicionales, que requieren un conjunto de datos diverso. Ante esto, el presente estudio adopta un diseño metodológico que prioriza la transparencia del protocolo, la comparabilidad directa entre modelos y la implementación de controles automáticos rigurosos para la validación del formato y la aritmética de las salidas.

El enfoque “LLM-as-a-Judge” es una alternativa alineada con estudios recientes que exploran la capacidad de los LLM para realizar juicios complejos basados en instrucciones explícitas (Liu et al., 2023; Zheng et al., 2023). La estrategia consiste en instruir a los LLM, a través de un prompt detallado, para que apliquen la rúbrica del ENEM y devuelvan la evaluación en un formato JSON controlado, que contenga puntuaciones discretas para cada competencia y la suma final. Esta formulación permite una comparación directa y justa entre los modelos bajo criterios idénticos. El sistema propuesto materializa este enfoque en un pipeline automatizado en Python, que gestiona la lectura de los textos, el montaje de los prompts con el tema de cada año, la ejecución de múltiples repeticiones por redacción para robustez estadística y la recopilación estandarizada de métricas.

El pipeline experimental se implementó en Python, automatizando el flujo de trabajo. El sistema lee cada redacción, inserta el tema correcto en el prompt y somete el texto a cada uno de los cinco LLMs. Para evaluar la estabilidad, cada redacción se procesó cinco veces por cada LLM, con una temperatura de inferencia de 0.0 para maximizar el determinismo. En cada ejecución, el sistema registró métricas detalladas, incluyendo tokens de entrada, de salida y totales, así como los tiempos de respuesta y procesamiento. El análisis de los datos combina estadísticas descriptivas con indicadores como la tasa de error de suma y el recuento de aciertos. La elección de los modelos abarcó una diversidad de arquitecturas, incluyendo modelos densos como Llama 3.3, modelos de Mixture of Experts (MoE) como Llama 4, y un sistema compuesto como Groq/Compound. Diferencias arquitectónicas, como los mecanismos de atención (VASWANI et al., 2017; SHAZEER, 2019; AINSLIE et al., 2023) y el tipo de post-entrenamiento (OUYANG et al., 2022), impactan el equilibrio entre precisión, latencia y costo.

La disponibilidad limitada de corpus públicos para AES en portugués brasileño es un obstáculo histórico. Iniciativas como Essay-BR representaron un avance al ofrecer redacciones anotadas (Marinho et al., 2021; Marinho et al., 2022), pero el origen de los textos, de simuladores, puede introducir sesgos. Esfuerzos recientes se han centrado en mejorar la curación y documentación de los datos (Silveira et al., 2024), pero la carencia de muestras amplias y representativas persiste. La metodología de este trabajo sortea parcialmente esta limitación al centrarse en un protocolo que no depende de ajuste fino, sino de la capacidad de los modelos para seguir instrucciones complejas.

Las métricas de evaluación se seleccionaron para una visión multidimensional del desempeño. Además de estadísticas descriptivas para puntuaciones, tokens y latencia, se realizó un análisis de la conformidad de la salida, verificando la validez del formato JSON y la corrección de la suma aritmética. La capacidad de cada modelo para acertar la puntuación de referencia (1000 puntos) se cuantificó, así como la proporción de puntuaciones en rangos cercanos (por encima de 900 y 800). Para la latencia, se utilizó la Función de Distribución Acumulada Empírica (FDAE), una herramienta visual para comparar la distribución de los tiempos de respuesta entre los modelos. Este análisis permite identificar no solo el modelo más preciso, sino también comprender los trade-offs operativos para una implementación a gran escala.

Los resultados de la validación de la salida revelaron diferencias operacionales significativas. La coherencia entre la nota final y la suma de las competencias fue la primera métrica. El modelo Llama 4 presentó un rendimiento inferior, con una tasa de error de suma de aproximadamente 45,6%, indicando una falla sistemática en seguir una instrucción básica del prompt. En contraste, el Llama 3.3 demostró consistencia perfecta, con 0% de errores de suma. Los demás modelos presentaron tasas de error insignificantes o nulas. Para garantizar la integridad de los análisis, la “nota agregada” fue recalculada para todas las ejecuciones como la suma de las cinco competencias, sustituyendo la “nota final” del LLM cuando había discrepancia.

En el rendimiento agregado, Llama 3.3 emergió como el ganador. Acertó la puntuación de referencia de 1000 puntos en el 85% de las ejecuciones, un resultado superior al de sus competidores, y exhibió la media y mediana más altas de puntuaciones agregadas, con la menor desviación estándar, lo que indica una alta consistencia. El sistema Groq (Orquestado) quedó en segundo lugar en calidad. GPT OSS mostró un rendimiento intermedio, con mayor variabilidad. Llama 4, además de los problemas operacionales, obtuvo puntuaciones inferiores, mientras que Gemma 2 presentó el rendimiento más débil, sin ninguna evaluación alcanzando los rangos de 800, 900 o 1000 puntos. El rendimiento superior de Llama 3.3 puede atribuirse a su arquitectura densa y a su gran número de parámetros.

El análisis por competencia individual mostró que, para casi todos los modelos, la Competencia II (Comprensión de la propuesta y género) recibió las notas medias más altas, sugiriendo que esta tarea es más accesible para los LLMs. La excepción fue Gemma 2, que atribuyó su mayor nota media a la Competencia I (Dominio de la norma culta). Los modelos Llama 3.3 y Groq (Orquestado) demostraron coherencia en sus evaluaciones entre las competencias. La interpretación de estos resultados está limitada por la naturaleza del corpus, que reduce la discriminabilidad. El análisis por año/tema indicó que el tema de 2023 (“Desafíos para el enfrentamiento de la invisibilidad del trabajo de cuidado realizado por la mujer en Brasil”) pareció presentar una dificultad ligeramente mayor, pero el ranking de desempeño entre los LLMs permaneció consistente.

Las métricas de costo computacional y latencia proporcionaron insights cruciales. El análisis de tokens mostró que el sistema Groq (Orquestado) fue el que más utilizó tokens, debido a su extenso prompt. Los modelos de la familia Llama y el Gemma 2 fueron más eficientes. Esta diferencia se correlacionó con la latencia. El Groq (Orquestado) y el GPT OSS fueron los más lentos, con tiempos de respuesta de hasta 30 segundos y 5 segundos, respectivamente. El grupo de los más rápidos, compuesto por Gemma 2, Llama 4 y Llama 3.3, presentó latencias consistentemente por debajo de 0,5 segundos. Dentro de este grupo, el Gemma 2 fue el más rápido, seguido por el Llama 4 y el Llama 3.3. El análisis evidencia un claro trade-off entre calidad, costo y velocidad. El Llama 3.3, modelo de mejor acurácia, no fue el más rápido, pero operó en un rango de latencia bajo, haciéndolo viable para aplicaciones a gran escala.

El estudio tiene limitaciones importantes. La principal es la restricción del corpus a ensayos de puntuación 1000, lo que impide la evaluación del comportamiento de los modelos en puntuaciones inferiores y puede sobreestimar la precisión. Futuros trabajos deben buscar acceso a corpus más diversificados. Los errores operacionales, como la alta tasa de error de suma del Llama 4, resaltan la necesidad de implementar capas de validación y posprocesamiento. La variación de costo y latencia entre arquitecturas (denso vs. MoE vs. orquestado) es un factor crítico para la escalabilidad. Las cuestiones sobre generalización, sesgos y contaminación por datos públicos exigen investigación continua.

En resumen, entre los modelos evaluados, Llama 3.3 demostró el mejor rendimiento general, combinando alta precisión, consistencia operativa (0% de error de suma) y baja desviación estándar. El sistema Groq (Orquestado) se posicionó como una alternativa de alta calidad, pero con una penalización en el consumo de tokens y la latencia. GPT OSS presentó resultados intermedios con mayor variabilidad, mientras que Llama 4 resultó operativamente defectuoso y Gemma 2, aunque más rápido, fue el menos preciso. Las recomendaciones para una implementación institucional son: se debe priorizar Llama 3.3 cuando la calidad y la consistencia sean críticas; Gemma 2 puede ser una opción cuando la latencia mínima sea el requisito principal; y el sistema Groq (Orquestado) solo se justifica si sus capacidades de orquestación compensan el alto costo computacional.

El estudio proporciona un marco para la selección de LLMs en tareas de evaluación automática, basando la decisión en el equilibrio entre calidad, velocidad y coste. La investigación valida el enfoque “LLM-as-a-Judge” como una metodología prometedora, pero destaca la necesidad de protocolos rigurosos, validaciones continuas y una comprensión de las limitaciones de cada modelo. Se concluye que el objetivo se alcanzó: se demostró la viabilidad del uso de LLMs como evaluadores, con el modelo Llama 3.3 presentando el mejor equilibrio entre precisión, consistencia y coste computacional para la tarea de corrección de redacciones del ENEM.

Referencias:
AINSLIE, Joshua; LEE-THORP, James; DE JONG, Michiel; ZEMLYANSKIY, Yury; LEBRÓN, Federico; SANGHAI, Sumit. GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints. In: Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP), 2023.
ATTALI, Y.; BURSTEIN, J. 2006. Automated essay scoring with e-rater® v.2. The Journal of Technology, Learning, and Assessment, 4(3): 1–29.
DIKLI, S. 2006. An overview of automated scoring of essays. The Journal of Technology, Learning, and Assessment, 5(1): 1–36.
GOOGLE. Gemma 2-9B-IT — Model Card. 2025. Disponible en: https://console. groq. com/docs/model/gemma2-9b-it y https://huggingface. co/google/gemma-2-9b-it. Acceso en: 26 sep. 2025.
GROQ. Compound Systems — Visión general. 2025. Disponible en: https://console. groq. com/docs/compound y https://console. groq. com/docs/compound/systems. Acceso en: 26 sep. 2025.
HOLTZMAN, A.; BUYS, J.; DU, L.; FORBES, M.; CHOI, Y. 2020. The curious case of neural text degeneration. In: International Conference on Learning Representations (ICLR), 2020, Addis Abeba, Etiopía. Disponible en: https://openreview. net/forum? id=rygGQyrFvH. Acceso en: 9 jun. 2025.
INSTITUTO NACIONAL DE ESTUDIOS E INVESTIGACIONES EDUCATIVAS ANÍSIO TEIXEIRA [INEP]. 2024. La redacción del Enem 2024: cartilla del participante. Disponible en: https://download. inep. gov. br/publicacoes/institucionais/avaliacoeseexamesdaeducacaobasica/aredacaonoenem2024cartilhadoparticipante. pdf. Acceso en: 5 jul. 2025.
LIU, Y.; et al. 2023. G-Eval: NLG evaluation using GPT-4 with better human alignment. In: Conference on Empirical Methods in Natural Language Processing (EMNLP), 2023, Singapur. Anales… p. 2511–2522. Association for Computational Linguistics.
MARINHO, J. C.; ANCHIÊTA, R. T.; MOURA, R. S. 2021. Essay-BR: a Brazilian corpus of essays. Disponible en: https://arxiv. org/abs/2105.09081. Acceso en: 1 jul. 2025.
MARINHO, J. C.; ANCHIÊTA, R. T.; MOURA, R. S. 2022. Essay-BR: a Brazilian corpus to automatic essay scoring task. Journal of Information and Data Management, 13(1): 65–76.
META. Llama-3.3-70B — Model Card. 2024. Disponible en: https://www. llama. com/docs/model-cards-and-prompt-formats/llama3_3/ y https://huggingface. co/meta-llama/Llama-3.3-70B-Instruct. Acceso en: 26 sep. 2025.
META. Llama-4-Scout-17B-16E — Model Card. 2025. Disponible en: https://huggingface. co/meta-llama/Llama-4-Scout-17B-16E y https://build. nvidia. com/meta/llama-4-scout-17b-16e-instruct/modelcard. Acceso en: 26 sep. 2025.
NATIONAL COUNCIL OF TEACHERS OF ENGLISH [NCTE]. 2013. Machine Scoring Fails the Test: NCTE Position Statement on Machine Scoring. Disponible en: https://cdn. ncte. org/nctefiles/press/machinescoring-2013. pdf. Acceso en: 1 jul. 2025.
OPENAI. gpt-oss-120b & gpt-oss-20b — Model Card. 2025. Disponible en: https://openai. com/index/gpt-oss-model-card/. Acceso en: 14 de ago. 2025
OUYANG, Long et al. Training language models to follow instructions with human feedback. In: Advances in Neural Information Processing Systems (NeurIPS), 2022.
PAGE, E. B. 1966. The imminence of grading essays by computer. Phi Delta Kappan, 47(5): 238–243.
PERELMAN, L. 2014. When “the state of the art” is counting words. Assessing Writing, 21: 104–111.
PONTES, A.; PRISCILLA, R.; LOPES, A. Capítulo 24 Corrección automática de redacción. [s. l: s. n.]. Disponible en: <https://brasileiraspln. com/livro-pln/2a-edicao/parte-aplicacoes/cap-aes/cap-aes. pdf>. Acceso en: 27 sep. 2025.
SHAZEER, Noam. Fast Transformer Decoding: One Write-Head is All You Need. 2019.
SILVEIRA, I. C.; BARBOSA, A.; MAUÁ, D. D. 2024. A new benchmark for automatic essay scoring in Portuguese. In: International Conference on Computational Processing of Portuguese (PROPOR), 16., 2024, Santiago de Compostela, España. Anales… p. 228–237. Association for Computational Linguistics.
VASWANI, Ashish et al. Attention Is All You Need. In: Advances in Neural Information Processing Systems (NeurIPS), 2017.

Resumen ejecutivo del Trabajo de Conclusión de Curso de Especialización en Data Science y Analytics del MBA USP/Esalq

Más información sobre el curso; haga clic aquí:

Quién editó este artículo

Más recientes

También te puede interesar