Resumen Ejecutivo

Tecnología

10 de diciembre de 2025

Comparativa de rendimiento entre Machine Learning e IA Generativa en la detección de emociones

Escritor: Carlos Eduardo Frantz Manchini — Tutor: Thiago Gentil Ramires

Resumen elaborado por la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege orientada a la síntesis y redacción.

Este trabajo comparó modelos tradicionales de machine learning con la solución de Inteligencia Artificial Generativa Hume AI en la tarea de inferir emociones de la base de audios RAVDESS. La investigación buscó determinar qué enfoque ofrece mayor precisión y equilibrio en la clasificación de un espectro diversificado de estados emocionales, contrastando la metodología clásica, basada en ingeniería de atributos acústicos, con el enfoque de punta a punta de modelos generativos pre-entrenados. El análisis tiene como objetivo proporcionar subsidios para la selección de tecnologías en aplicaciones prácticas, como salud mental e interacción humano-computadora, donde la exactitud en la detección de matices emocionales es fundamental.

Los avances en Data Science e Inteligencia Artificial (IA) permiten procesar e interpretar datos no estructurados, como textos, imágenes y audio. Según Gartner (2020), aproximadamente el 80% de los nuevos datos corporativos son de esta naturaleza, lo que convierte la extracción de información en un diferencial competitivo. Este procesamiento a gran escala ha sido posible gracias a técnicas de Machine Learning y Deep Learning, que identifican patrones complejos inaccesibles a métodos convencionales (Goodfellow et al., 2016). El auge de la Inteligencia Artificial Generativa (GenAI), con sus modelos de lenguaje de gran escala (LLMs), ha acelerado esta transformación.

Las innovaciones impulsadas por la GenAI generan impactos en diversas áreas. En la salud, los modelos generativos ayudan en el diagnóstico de enfermedades como el cáncer, con aciertos superiores al 99%, en contraste con el 80% de los métodos tradicionales (Sheakh et al., 2024), y aceleran el desarrollo de nuevos tratamientos (Topol, 2019). En la seguridad, la IA mejora el reconocimiento facial, la detección de fraudes y el monitoreo inteligente, previniendo crímenes y protegiendo activos (Li et al., 2020). En la educación, la GenAI permite la creación de asistentes virtuales y plataformas de enseñanza adaptativa que personalizan el contenido al ritmo de cada alumno (Luckin et al., 2016).

En el procesamiento de audio, la IA es la base de los asistentes de voz y los sistemas de traducción automática (Tan et al., 2021). En este contexto, el reconocimiento automático de emociones en audio (Speech Emotion Recognition – SER) es un área de investigación compleja. El desafío radica en la naturaleza sutil de las emociones, manifestadas en patrones acústicos. Según Akçay y Oğuz (2020), el SER modela variaciones en la entonación (pitch), el ritmo, la intensidad y el timbre, que transportan información sobre el estado afectivo del hablante. Se están explorando modelos de GenAI basados en redes neuronales profundas para procesar señales de audio de manera más holística (Purwins et al., 2019).

La motivación de este estudio es la necesidad de evaluar críticamente el rendimiento de los modelos generativos en comparación con métodos consolidados. Aunque los modelos de aprendizaje profundo, que fundamentan la GenAI, a menudo superan a las técnicas convencionales en el reconocimiento de patrones (Khare et al., 2024), la interpretabilidad y la dependencia de grandes volúmenes de datos son desafíos (Latif et al., 2020). Este estudio investiga las ventajas de cada enfoque, considerando la precisión, la robustez, la eficiencia computacional y la generalización, para guiar futuras implementaciones. Las aplicaciones del SER son vastas, desde interfaces conversacionales hasta herramientas de salud mental, donde los cambios en la prosodia vocal pueden ser biomarcadores para la detección de estrés, ansiedad y depresión (Cummins et al., 2015).

La investigación es un estudio experimental de naturaleza aplicada, con evaluación cuantitativa y comparativa de dos enfoques para el reconocimiento de emociones en audio. El primero, tradicional, utiliza ingeniería de atributos y algoritmos de Machine Learning supervisado. El segundo emplea una solución de IA Generativa que procesa los datos de punta a punta. La metodología fue diseñada para una comparación rigurosa, con variables controladas y métricas estandarizadas. Los experimentos se implementaron en Python, con bibliotecas especializadas para manipulación de datos, extracción de características, modelado y evaluación.

El conjunto de datos utilizado fue el Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS), una base reconocida en la comunidad de SER (Livingstone y Russo, 2018). El corpus contiene 1440 archivos de audio de 24 actores profesionales (12 hombres, 12 mujeres) expresando ocho emociones: ira, calma, asco, miedo, felicidad, neutral, tristeza y sorpresa. El RAVDESS fue elegido por su estructura balanceada, alta calidad y etiquetado claro. Se consideró el uso del corpus CORAA (Alvim et al., 2022), en portugués brasileño, pero la ausencia de etiquetas emocionales detalladas imposibilitó su uso. Se realizó un preprocesamiento en los audios, incluyendo reducción de ruido y normalización de volumen, para uniformizar las señales y mejorar la detección de patrones, según lo recomendado por Cowie et al. (2001).

En el enfoque tradicional, se siguió un pipeline de extracción de características acústicas, como se describe en Akçay y Oğuz (2020). Se extrajeron características como Coeficientes Cepstrales de Frecuencia Mel (MFCCs), Chroma Features, Tasa de Cruce por Cero (ZCR), energía RMS y características de frecuencia fundamental (pitch). Con este conjunto de 81 características, se entrenaron tres algoritmos de aprendizaje supervisado: Random Forest, Support Vector Machines (SVM) y XGBoost, siguiendo las prácticas de Schuller et al. (2011). La evaluación utilizó validación cruzada estratificada y métricas como precisión, exactitud, F1-score y matriz de confusión.

Para el enfoque generativo, se descartó la estrategia de transcribir el audio con Whisper (OpenAI, 2022) y analizar el texto con un LLM, ya que descuidaría los matices prosódicos. En su lugar, se adoptó la API Expression Measurement – Prosody de Hume AI (2025), una solución que utiliza modelos de deep learning para inferir emociones directamente del audio, eliminando la extracción manual de características. La implementación consistió en el envío de los 1440 audios del RAVDESS a la API a través de llamadas HTTP, con el posterior procesamiento de las puntuaciones devueltas para determinar la emoción predominante. Las bibliotecas Librosa y pydub se utilizaron para la manipulación de audio, Scikit-learn para el cálculo de métricas y Matplotlib y Seaborn para visualizaciones.

El análisis exploratorio de los datos buscó comprender el comportamiento de las características acústicas. La visualización de los espectrogramas Log-Mel reveló patrones distintos entre emociones de alta y baja valencia. Audios de “ira” exhibieron energía concentrada en frecuencias más altas, mientras que audios de “tristeza” presentaron un contorno de pitch más plano y menor intensidad. Estas observaciones validaron que las características prosódicas contenían información relevante para la clasificación, justificando la ingeniería de atributos. El análisis cuantitativo de las 81 features extraídas formó la base para la selección de variables.

La selección de características fue un paso crucial para construir un modelo más parsimonioso y menos propenso al sobreajuste. El análisis de correlación de Pearson reveló alta multicolinealidad. Las 12 características Chroma fueron sustituidas por tres componentes principales (PCA) que preservaron el 88% de la variabilidad. Para mitigar la redundancia, se empleó un método de selección basado en la importancia de las características calculada por XGBoost. La comparación entre el modelo completo (81 características) y uno reducido (23 características) mostró la eficacia del enfoque: el modelo completo alcanzó un F1-Macro de 0.648, mientras que el reducido obtuvo 0.635, una caída de rendimiento de solo el 2% con una reducción del 71.6% en el número de variables. El modelo compacto fue adoptado para las etapas siguientes.

El modelado con los clasificadores supervisados se realizó en una división estratificada de los datos (70% para entrenamiento, 30% para prueba). El modelo Support Vector Machines (SVM) presentó el mejor rendimiento general, con una precisión del 61,8% y un F1-Macro de 0.58 en la base de prueba. Los modelos basados en árboles, Random Forest y XGBoost, mostraron signos de sobreajuste (overfitting), con una caída de rendimiento en los datos de prueba. La superioridad del SVM se atribuyó a su mayor estabilidad y capacidad de generalización en un espacio de características de alta dimensionalidad. La métrica F1-Macro fue importante por ser robusta para problemas multiclase con desbalanceo.

El análisis de la matriz de confusión del SVM reveló sus patrones de acierto y error. El modelo fue eficaz en reconocer emociones con características acústicas distintas, como “calma” y “sorpresa”. Sin embargo, ocurrieron confusiones sistemáticas entre emociones con propiedades sonoras similares. Las clases “neutro”, “calmo” y “triste”, caracterizadas por baja intensidad y variaciones de pitch menos pronunciadas, presentaron una superposición significativa. De manera similar, emociones de alta intensidad como “miedo” y “asco” también fueron ocasionalmente confundidas, indicando que la distinción de matices sutiles sigue siendo un desafío.

En la pipeline generativa, la evaluación de la API Hume AI reveló un desafío de incompatibilidad de taxonomías emocionales. Mientras que RAVDESS utiliza ocho categorías discretas, Hume AI devuelve puntuaciones para un conjunto diferente de etiquetas, como “boredom” y “amusement”. Para permitir una comparación directa, fue necesario un mapeo ontológico, aproximando semánticamente las etiquetas de Hume a las clases de RAVDESS (ej: “boredom” mapeado a “neutro”, “amusement” a “felicidad”). Esta armonización fue crucial para una evaluación cuantitativa justa.

Incluso después del mapeo, el rendimiento de Hume AI fue significativamente inferior al de los modelos supervisados, con una precisión global de solo el 29% y un F1-Macro de 0.26. La matriz de confusión de Hume AI mostró un patrón específico: el modelo identificó bien la emoción “ira”, con un F1-score de 0.65 para esta clase. Sin embargo, para emociones más sutiles, el rendimiento fue extremadamente bajo, con F1-scores cercanos a cero para “miedo” y “asco”. El modelo tendió a confundir la mayoría de las emociones con categorías neutras o tranquilas, lo que indica una limitación para capturar la diversidad del espectro emocional.

La comparación directa de los resultados consolida la superioridad del enfoque tradicional. Los modelos supervisados, liderados por SVM, alcanzaron en promedio un 55% de precisión y un 0.53 de F1-Macro, con un reconocimiento más equilibrado entre las ocho clases. En contraste, la API Hume, con un 29% de precisión y un 0.26 de F1-Macro, demostró ser inadecuada para una clasificación detallada. Mientras que los modelos tradicionales acertaron entre la mitad y dos tercios de las predicciones, la solución generativa clasificó correctamente poco más de una de cada cinco muestras. Esto refuerza que, a pesar del mayor esfuerzo en preprocesamiento y ajuste, los clasificadores supervisados ofrecen una consistencia que las soluciones “listas para usar” aún no igualan.

Considerando los aspectos prácticos, la pipeline tradicional, aunque más compleja de implementar, ofrece control total, interpretabilidad y no incurre en costos operativos por predicción. La API Hume ofrece simplicidad, pero su naturaleza de “caja negra” limita la interpretabilidad e introduce un costo financiero. El procesamiento de los 1440 audios en este estudio tuvo un costo de aproximadamente US$ 3,60, un factor a considerar a gran escala. El trade-off es que la conveniencia de la GenAI viene al costo de un rendimiento reducido y de un costo operativo continuo, mientras que el enfoque clásico exige mayor inversión inicial en desarrollo para alcanzar resultados más robustos.

Este trabajo confirmó la superioridad de los modelos supervisados para el reconocimiento de emociones en audio. El clasificador Support Vector Machine (SVM) destacó con una precisión del 61,8% en la base de prueba, demostrando una generalización robusta y un equilibrio en la clasificación. En contrapartida, la solución generativa de Hume AI, aunque simple de operar, tuvo un rendimiento inferior, con un 29% de precisión. La API mostró aptitud para identificar emociones de alta intensidad como la ira, pero falló en distinguir matices entre categorías más sutiles como el miedo y el asco, confundiéndolas con estados neutros. Las conclusiones apuntan a un trade-off entre conveniencia y precisión. Las soluciones generativas “listas para usar” pueden servir para prototipado o en aplicaciones enfocadas en emociones intensas. Sin embargo, para escenarios que exigen alta precisión y un espectro emocional detallado, los modelos supervisados, ajustados para la tarea, permanecen más adecuados. Como perspectivas futuras, se sugiere la exploración de enfoques híbridos, el fine-tuning de modelos generativos y la aplicación en bases de datos más heterogéneas, incluyendo audios en portugués brasileño. Se concluye que el objetivo fue alcanzado: se demostró que los modelos supervisados, como el SVM, permanecen más precisos y robustos para la clasificación de un espectro emocional amplio en audio en comparación con la solución de IA Generativa evaluada.

Referencias:
Akçay, M. B.; Oğuz, K. 2020. Reconocimiento de emociones en el habla: modelos emocionales, bases de datos, características, métodos de preprocesamiento, modalidades de apoyo y clasificadores. Speech Communication 116: 56-76.
Alvim, G.; Magalhães, L. L. C.; Bigal, R. L. M.; Medeiros, H. F. G.; Souza, S. R. M.; Silva, C. F. M.; Oliveira, E. P. L.; Pardo, S. R. C. 2022. CORAA: un gran corpus de habla espontánea y preparada validado manualmente para el reconocimiento del habla en portugués brasileño. En: International Conference on Language Resources and Evaluation, 2022, Marsella, Francia. Anais… p. 5908-5915.
Cowie, R.; Douglas-Cowie, E.; Tsapatsoulis, N.; Votsis, G.; Kollias, S.; Fellenz, W.; Taylor, J. G. 2001. Reconocimiento de emociones en la interacción humano-computadora. IEEE Signal Processing Magazine 18(1): 32-80.
Cummins, N.; Scherer, S.; Krajewski, J.; Schnieder, S.; Epps, J.; Quatieri, T. F. 2015. Una revisión de la evaluación del riesgo de depresión y suicidio mediante el análisis del habla. Speech Communication 71: 10-49.
Gartner [GARTNER]. 2020. Guía de mercado para análisis de texto. Disponible en: <https://www. gartner. com/en/documents/3989657>. Accedido el: 24 mar. 2025.
Goodfellow, I.; Bengio, Y.; Courville, A. 2016. Deep Learning. The MIT Press, Cambridge, MA, EE. UU..
Hume AI. 2025. Medición de la expresión – Prosodia. Disponible en: <https://dev. hume. ai/docs/expression-measurement>. Accedido el: 25 sep. 2025.
Khare, S. K.; Blanes-Vidal, V.; Nadimi, E. S.; Acharya, U. R. 2024. Reconocimiento de emociones e inteligencia artificial: una revisión sistemática (2014–2023) y recomendaciones de investigación. Information Fusion 102: 102019.
Latif, S.; Rana, R.; Qadir, J.; Epps, J.; Schuller, B. W. 2020. Aprendizaje de representación profunda en el procesamiento del habla: desafíos, avances recientes y tendencias futuras. Computer Speech & Language 68: 101-178.
Li, Y.; Schuckert, M.; Law, R.; Wang, J. 2020. El impacto de la inteligencia artificial en la seguridad y la privacidad en las ciudades inteligentes. Journal of Urban Technology 27(2): 65-85.
Livingstone, S. R.; Russo, F. A. 2018. La base de datos de voz y canto de emociones audiovisuales de Ryerson (RAVDESS). PLoS ONE 13(5): e0196391.
Luckin, R.; Holmes, W. 2016. Intelligence Unleashed: An Argument for AI in Education. Pearson, Londres, Reino Unido.
OpenAI. 2022. Whisper: reconocimiento robusto del habla mediante entrenamiento de audio a gran escala. Disponible en: <https://github. com/openai/whisper>. Accedido el: 29 mar. 2025.
Poria, S.; Majumder, N.; Mihalcea, R.; Hovy, E. 2019. Reconocimiento de emociones en la conversación: desafíos de investigación, conjuntos de datos y avances recientes. IEEE Access 7: 100943-100953.
Purwins, H.; Li, B.; Virtanen, T.; Schlüter, J.; Chang, S. Y.; Sainath, T. 2019. Aprendizaje profundo para el procesamiento de señales de audio. IEEE Journal of Selected Topics in Signal Processing 13(2): 206-219.
Schuller, B.; Batliner, A.; Steidl, S.; Seppi, D. 2011. Reconocimiento de emociones y afecto realistas en el habla: estado del arte y lecciones aprendidas del primer desafío. Speech Communication 53(9-10): 1062-1087.
Sheakh, M. A.; Azam, S.; Tahosin, M. S.; Karim, A.; Montaha, S.; Fahim, K. U.; De Boer, F. 2024. ECgMLP: un novedoso modelo MLP con compuerta para el diagnóstico mejorado de cáncer de endometrio. Computer Methods and Programs in Biomedicine Update 5: 100181.
Tan, X.; Qin, T.; Soong, F.; Liu, T.-Y. 2021. Una encuesta sobre síntesis de voz neuronal. Disponible en: <https://arxiv. org/abs/2106.15561>. Accedido el: 27 sep. 2025.
Topol, E. 2019. Deep Medicine: How Artificial Intelligence Can Make Healthcare Human Again. Basic Books, Nueva York, NY, EE. UU..


Resumen ejecutivo del Trabajo de Conclusión de Curso de Especialización en Data Science y Analytics de la MBA USP/Esalq

Más información sobre el curso; haga clic aquí:

Quién editó este artículo

Más recientes

También te puede interesar