Ingeniería De Software
07 de octubre de 2026
Aplicación de Inteligencia Artificial para Análisis de Sentimiento en Mensajes de Texto
Aplicación de Inteligencia Artificial para Análisis de Sentimiento en Mensajes de Texto
Isabel Priscila Chaves da Silva Rebello; Marcos Jardel Henriques
DOI: 10.22167/2675-6528-202603004
Artículo derivado de Trabajo de Fin de Curso (TCC), con contenido basado en el trabajo original del estudiante y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, una solución de inteligencia artificial desarrollada por el Instituto Pecege para la síntesis y organización textual.
Resumen
El análisis de sentimientos en mensajes de texto de clientes de comercio electrónico es crucial para la toma de decisiones empresariales. Este estudio implementó modelos de inteligencia artificial con el objetivo de comparar su desempeño en la evaluación de estos mensajes. La metodología consistió en la aplicación de un conjunto de datos de 4664 registros en cuatro experimentos distintos: GPT 3.5 Turbo con Zero-shot, GPT 3.5 Turbo con Few-shot, BERT Multilingual Sentiment y BERTimbau con Fine tuning. Los resultados obtenidos indicaron que el modelo especializado con Fine tuning presentó las mejores métricas de evaluación, una matriz de confusión más consistente y el menor tiempo de procesamiento. En contraste, el modelo BERT Multilingual Sentiment demostró dificultades en la interpretación de textos en idioma portugués. Los experimentos con GPT 3.5 Turbo, particularmente el enfoque Few-shot, se revelaron prometedores, configurándose como una alternativa viable en escenarios donde el Fine tuning no puede ser aplicado. Se concluyó que la estrategia de Fine tuning en modelos pre-entrenados, como el BERTimbau, ofrece ventajas significativas en precisión y eficiencia para el análisis de sentimientos a gran escala.
Palabras clave: Análisis de Sentimientos; Fine Tuning; Inteligencia Artificial; LLM; Procesamiento de Lenguaje Natural.
1. Introducción
El análisis de sentimientos (AS), también conocido como análisis de opinión o minería de opinión, se ha convertido en un concepto de gran importancia para empresas, gobiernos y organizaciones. Comprender cómo los clientes y usuarios perciben los productos y servicios es fundamental para la toma de decisiones estratégicas (SÁNCHEZ-RADA E IGLESIAS, 2019).
A pesar de su relevancia, recopilar y analizar la retroalimentación del consumidor presenta desafíos significativos. El contenido generado por los clientes a menudo consiste en datos no estructurados, como mensajes de texto libre, que pueden abordar diversos temas y contener expresiones coloquiales, errores ortográficos y lenguaje informal. Esta naturaleza de los datos dificulta el proceso de AS y el tratamiento eficaz de la información (TAN, 2023).
En el contexto del comercio electrónico, el análisis de sentimientos es una herramienta poderosa y con un vasto potencial. Las empresas que buscan mantener la competitividad en el mercado necesitan refinar y analizar los comentarios de los consumidores. El AS permite obtener información valiosa sobre las opiniones de los clientes, ayudando a detectar puntos de mejora, perfeccionar productos y servicios, y realizar ajustes estratégicos para satisfacer las exigencias del mercado (Soares, 2023). Además, permite a los clientes tomar decisiones de compra más informadas. Con el gran volumen de datos no estructurados generados diariamente, una herramienta capaz de extraer información a gran escala es esencial para una comprensión ágil de la percepción de los consumidores, generando ventajas estratégicas y operativas.
El análisis de sentimientos es un segmento del Procesamiento del Lenguaje Natural (NLP) que tiene como objetivo identificar y categorizar automáticamente sentimientos y emociones expresados en textos (TAN, 2023). Históricamente, métodos tradicionales como Bag-of-Words y TF-IDF clasificaban textos por la frecuencia de palabras, pero ignoraban el contexto y la semántica, limitando su eficacia. La evolución llevó al desarrollo de modelos como Word2Vec y GloVe, que capturan el significado semántico, aunque todavía enfrentan desafíos con palabras desconocidas y la necesidad de grandes conjuntos de datos (KOKAB ET AL, 2022). Más recientemente, han surgido enfoques basados en aprendizaje por transferencia, como BERT, y Large Language Models (LLMs), como GPT 3.5 Turbo, demostrando alta capacidad de generalización y precisión en tareas de AS, incluso con estrategias de zero-shot y few-shot (Souza et al., 2022).
Ante la complejidad y diversidad de modelos de inteligencia artificial disponibles para el análisis de sentimientos, y considerando la importancia del feedback del cliente para el e-commerce brasileño, resulta crucial investigar qué enfoque ofrece el mejor rendimiento para mensajes de texto en portugués. La comparación entre modelos de lenguaje grandes (LLMs) con enfoques zero-shot y few-shot y modelos pre-entrenados con fine tuning, como BERTimbau, es fundamental para identificar la solución más eficaz en términos de precisión y eficiencia de procesamiento para este dominio específico.
En este contexto, el presente trabajo busca comparar el rendimiento de diferentes modelos de Inteligencia Artificial en el análisis de sentimientos en mensajes de texto de clientes de un e-commerce.
2. Material y Métodos
Con el fin de alcanzar los objetivos propuestos, este estudio se llevó a cabo mediante un enfoque comparativo y experimental. Se realizó una revisión bibliográfica para identificar modelos prometedores de inteligencia artificial, seguida de la definición y aplicación de estos modelos a un conjunto de datos de mensajes de texto de clientes. Posteriormente, se procedió a la comparación de los modelos a través de una evaluación experimental y al análisis de los resultados obtenidos.
La unidad de análisis consistió en un conjunto de 4664 mensajes de texto reales, recopilados de reseñas de clientes de un e-commerce. Estos mensajes contenían comentarios sobre vendedores, productos y servicios de entrega, representando datos no estructurados generados por consumidores (WANKHADE ET AL, 2022). La naturaleza de estos datos permitió observar el desempeño de los modelos ante expresiones coloquiales, errores ortográficos y lenguaje informal.
El preprocesamiento de los datos fue un paso fundamental para estructurar los textos. Este proceso incluyó la eliminación de caracteres especiales, como símbolos (excepto números) y URLs, y la tokenización, que segmentó el texto en unidades más pequeñas (PALOMINO, 2022; TAN ET AL, 2023). Adicionalmente, los mensajes con valoraciones numéricas de 0 a 10 fueron tratados para delimitar estos valores, ayudando en la asimilación del modelo.
Después del preprocesamiento, los 4664 mensajes de texto fueron etiquetados manualmente en tres categorías de sentimiento: positivo, negativo y neutro. El etiquetado fue realizado por un único evaluador, priorizando mensajes con contenido textual explícito. En casos de ambigüedad, la clase negativa fue adoptada como criterio de desempate. Las reglas de etiquetado establecieron como positivo notas superiores a siete o elogios, como negativo notas inferiores a seis con críticas directas, y como neutro notas entre seis y siete o mensajes no relacionados con los servicios.
Para el análisis de sentimientos, se emplearon tres modelos de inteligencia artificial distintos, evaluados en cuatro configuraciones experimentales. Los modelos incluyeron el GPT 3.5 Turbo, el nlptown/bert-base-multilingual-uncased-sentiment (una adaptación del BERT para análisis de sentimientos multilingüe), y el neuralmind/bert-base-portuguese-cased, conocido como BERTimbau, entrenado específicamente para el portugués brasileño (Souza et al., 2022).
La implementación de GPT 3.5 Turbo se realizó en dos configuraciones. En el enfoque zero-shot, el modelo clasificó el sentimiento (positivo, negativo o neutro) basándose únicamente en la descripción de la tarea proporcionada en el prompt, sin ejemplos previos. En la configuración few-shot, se proporcionó un conjunto de ejemplos al modelo para guiar su comportamiento, utilizando el contexto para mejorar la calidad de las inferencias.
El modelo BERT Multilingual Sentiment se utilizó en su formato pre-entrenado. Por otro lado, el modelo BERTimbau se aplicó con la técnica de fine-tuning, que implicó el entrenamiento del modelo con el conjunto de datos etiquetado. Para este proceso, el conjunto de datos se dividió en particiones de entrenamiento y prueba, con el 70% y el 20% de los datos, respectivamente, no utilizándose la partición de validación para la evaluación directa del modelo.
Los hiperparámetros empleados en el fine-tuning de BERTimbau incluyeron el modelo base neuralmind/bert-base-portuguese-cased (BERTimbau Base), tres épocas de entrenamiento, una tasa de aprendizaje de 2×10-5 y un tamaño de lote (batch size) de ocho para entrenamiento y evaluación. Se definió una longitud máxima de 512 tokens, y el optimizador AdamW, junto con la función de pérdida de entropía cruzada, se utilizaron según los estándares de la biblioteca Transformers (Hugging Face).
La evaluación del rendimiento de los modelos se realizó mediante un conjunto de métricas estadísticas ampliamente reconocidas en la literatura de clasificación. Las métricas calculadas incluyeron Precisión, Coeficiente Kappa, Precisión Macro, Recall Macro, F1 Macro, Precisión Ponderada, Recall Ponderada y F1 Ponderado. Adicionalmente, se empleó la matriz de confusión como herramienta gráfica para visualizar la cantidad de clasificaciones correctas en cada clase de sentimiento.
3. Resultados y Discusión
El análisis comparativo del rendimiento de diferentes modelos de inteligencia artificial en la evaluación de sentimientos en mensajes de texto de clientes de comercio electrónico reveló variaciones significativas en las métricas de evaluación, la consistencia de la clasificación y la eficiencia del procesamiento. Los experimentos se llevaron a cabo con cuatro enfoques distintos: GPT 3.5 Turbo con Zero-shot, GPT 3.5 Turbo con Few-shot, BERT Multilingual Sentiment y BERTimbau con Fine tuning. Los resultados obtenidos permitieron identificar la estrategia más eficaz para el contexto específico de mensajes en portugués, según el objetivo central de este estudio.
Inicialmente, se observó que el modelo BERTimbau con Fine tuning demostró el desempeño más robusto en todas las métricas estadísticas evaluadas. Este modelo alcanzó una precisión de 0,9154, un coeficiente Kappa de 0,8701, precisión Macro de 0,9076, revocación Macro de 0,9114 y F1 Macro de 0,9085. Las métricas ponderadas también siguieron esta tendencia, con precisión ponderada de 0,9162, revocación ponderada de 0,9154 y F1 ponderado de 0,9149. Estos valores consistentemente elevados indican una capacidad superior de clasificación y una comprensión profunda de los matices contextuales y semánticos de la lengua portuguesa, lo cual es crucial para el análisis de sentimientos en datos de e-commerce.
En contraste, el modelo BERT Multilingual Sentiment presentó el peor rendimiento entre todos los enfoques probados. Sus métricas fueron notablemente bajas, con una precisión de 0,5491, un coeficiente Kappa de 0,3311, una precisión Macro de 0,5548, una revocación Macro de 0,5675 y un F1 Macro de 0,5126. Las métricas ponderadas también fueron inferiores, con una precisión ponderada de 0,5785, una revocación ponderada de 0,5491 y un F1 ponderado de 0,522. Este resultado sugiere que, a pesar de ser un modelo diseñado para análisis de sentimiento y con soporte para múltiples idiomas, no logró capturar de manera eficiente las particularidades semánticas del portugués brasileño, corroborando observaciones de Souza et al. (2022) sobre las limitaciones de los modelos multilingües para idiomas específicos.
Los enfoques con GPT 3.5 Turbo ocuparon una franja intermedia de rendimiento. El modelo GPT 3.5 Turbo Zero-shot obtuvo una precisión de 0,7562, Kappa de 0,625, precisión Macro de 0,7477, revocación Macro de 0,7556 y F1 Macro de 0,7512. Las métricas ponderadas fueron similares, con precisión ponderada de 0,7551, revocación ponderada de 0,7562 y F1 ponderado de 0,7553. Aunque demuestra la alta capacidad de un Large Language Model (LLM) para realizar clasificaciones con información mínima, la ausencia de ejemplos específicos para la tarea resultó en un rendimiento inferior en comparación con enfoques más adaptados.
La aplicación de la estrategia Few-shot al GPT 3.5 Turbo resultó en una mejora notable en relación con el enfoque Zero-shot. Este modelo alcanzó una precisión de 0,8218, Kappa de 0,7311, precisión Macro de 0,8153, revocación Macro de 0,8303 y F1 Macro de 0,8108. Las métricas ponderadas también fueron superiores, con precisión ponderada de 0,8431, revocación ponderada de 0,8218 y F1 ponderado de 0,8224. La inclusión de ejemplos en el prompt proporcionó un contexto más claro para el modelo, mejorando la calidad de las inferencias y evidenciando el potencial de los LLMs cuando se orientan con datos específicos, incluso sin un fine tuning completo, según lo señalado por Fatouros (2023).
Además de las métricas de rendimiento, la capacidad de procesamiento de los modelos fue un factor crítico en la evaluación. Los modelos basados en BERT, tanto el Multilingual Sentiment como el BERTimbau con Fine Tuning, demostraron una eficiencia significativamente mayor. El BERT Multilingual Sentiment procesó los datos en 2 minutos y 11 segundos, mientras que el BERTimbau con Fine Tuning, que utilizó 934 registros para la prueba, completó la tarea en solo 25 segundos. Esto se traduce en un tiempo promedio por registro de aproximadamente 0,028 segundos para el BERT Multilingual y 0,027 segundos para el BERTimbau, lo que indica una alta velocidad de procesamiento para ambos.
Por otro lado, los experimentos con GPT 3.5 Turbo presentaron tiempos de procesamiento considerablemente más largos. El enfoque Zero-shot tardó 150 minutos y 1 segundo en procesar 4557 registros, resultando en un tiempo promedio de 1,975 segundos por registro. El enfoque Few-shot tuvo un rendimiento similar, con 150 minutos y 41 segundos para 4601 registros, totalizando 1,965 segundos por registro. Esta diferencia de tiempo, aproximadamente 73 veces mayor para los LLMs por registro, destaca una ventaja operativa significativa de los modelos específicos en escenarios de gran escala, donde la agilidad en el procesamiento es esencial para la comprensión en tiempo real de la percepción de los consumidores.
Otro aspecto relevante en la evaluación de los modelos GPT 3.5 Turbo fue la ocurrencia de errores de solicitud. El enfoque Zero-shot registró 2,30% de errores, mientras que el Few-shot presentó 1,35% de errores. Estos errores indican que, a pesar de las buenas métricas, parte de los datos puede no ser clasificada, resultando en pérdida de información. La menor tasa de error en el enfoque Few-shot puede atribuirse al tamaño del prompt, que, por contener ejemplos, exige más de la API y del modelo, pero también ofrece una dirección más robusta, minimizando fallos de solicitud en comparación con el enfoque Zero-shot, que depende exclusivamente del conocimiento preexistente del modelo.
Matriz de Confusión
El análisis de las matrices de confusión proporcionó una visión detallada de los tipos de errores de clasificación cometidos por cada modelo. Para el modelo BERT Multilingual Sentiment, la matriz reveló un número elevado de clasificaciones incorrectas. Aunque acertó la mayoría de las instancias negativas (1022), el modelo se equivocó sustancialmente en las clases positivas y neutras. Por ejemplo, clasificó 740 mensajes neutros como negativos y 552 mensajes positivos como negativos. Esta tendencia a clasificar oraciones como negativas sugiere un sesgo del modelo cuando se aplica a datos en portugués, lo que refuerza la dificultad para manejar las especificidades lingüísticas del idioma.
La matriz de confusión del modelo BERTimbau con Fine Tuning, a su vez, demostró una alta capacidad de clasificación en todas las clases. Con un número reducido de errores, el modelo acertó 217 clasificaciones negativas, 251 neutras y 387 positivas. Los errores fueron mínimos, con solo 13 negativas clasificadas como neutras, 2 como positivas; 34 neutras como negativas, 16 como positivas; y 1 positiva como negativa, 13 como neutra. Esta consistencia en la matriz de confusión evidencia la eficacia del fine tuning en un modelo monolingüe para el portugués, permitiendo una adaptación precisa a las características del conjunto de datos.
Para el modelo GPT 3.5 Turbo Zero-shot, la matriz de confusión indicó que, a pesar de un número razonable de aciertos, el modelo presentó una tendencia al error entre las clases intermedias y las más extremas. Se observó que 240 mensajes neutros fueron clasificados como negativos y 31 positivos también fueron clasificados como negativos. Además, 338 mensajes positivos fueron clasificados como neutros. Esta confusión sugiere que el modelo, sin ejemplos específicos, tiene dificultad en diferenciar matices de sentimiento, clasificando positivos o negativos como neutros, o viceversa, lo que puede llevar a interpretaciones ambiguas en contextos complejos de e-commerce.
La matriz de confusión del GPT 3.5 Turbo con estrategia Few-shot mostró una mejora significativa en los aciertos en comparación con el enfoque Zero-shot. El modelo clasificó correctamente 1098 mensajes negativos, 980 neutros y 1703 positivos. Sin embargo, todavía se notó cierta confusión al clasificar neutros como negativos (456) y positivos como neutros (231). Esta confusión, aunque menor, indica que, incluso con ejemplos, el modelo puede tener desafíos en contextos donde las fronteras entre los sentimientos son más sutiles. La posibilidad de corregir estos errores mediante el análisis de sentencias problemáticas y el suministro de nuevos ejemplos es una ventaja de esta estrategia, permitiendo una mejora continua del modelo.
En resumen, los resultados de la investigación demuestran que la estrategia de Fine tuning en modelos preentrenados, como BERTimbau, ofrece la mayor precisión y consistencia en el análisis de sentimientos en mensajes de texto de clientes de comercio electrónico en portugués, además de un tiempo de procesamiento significativamente menor. Los enfoques con GPT 3.5 Turbo, especialmente el Few-shot, se mostraron prometedores y representan una alternativa viable en escenarios donde el fine tuning no es aplicable, a pesar de presentar mayor tiempo de procesamiento y cierta confusión en la clasificación. El modelo BERT Multilingual Sentiment, por su parte, resultó inadecuado para el idioma portugués, evidenciando la importancia de la especificidad lingüística para la eficacia del análisis de sentimientos.
4. Conclusión
El presente estudio buscó comparar el rendimiento de diferentes modelos de inteligencia artificial en el análisis de sentimientos en mensajes de texto de clientes de un e-commerce. Se verificó que el modelo BERTimbau con Fine tuning demostró el rendimiento más robusto, alcanzando las mejores métricas estadísticas de evaluación y una matriz de confusión consistente, además de presentar el menor tiempo de procesamiento. En contraste, el modelo BERT Multilingual Sentiment reveló dificultades significativas en la interpretación de textos en idioma portugués, resultando en las métricas más bajas entre los enfoques probados. Las implementaciones con GPT 3.5 Turbo, tanto en la modalidad Zero-shot como Few-shot, se situaron en una franja intermedia de rendimiento. La estrategia Few-shot, en particular, evidenció una mejora notable en relación con la Zero-shot, configurándose como una alternativa prometedora en escenarios donde el Fine tuning no puede ser aplicado. Sin embargo, se observó que los modelos basados en BERT procesaron los datos de forma significativamente más rápida, cerca de 73 veces más ágil por registro, en comparación con los enfoques de LLMs, que también registraron errores de solicitud, indicando potencial pérdida de datos.
A pesar de los resultados prometedores, se identificó que el uso de Large Language Models como GPT 3.5 Turbo puede implicar costos asociados a las solicitudes y la ocurrencia de errores que resultan en pérdida de datos, aspectos que requieren consideración en aplicaciones a gran escala. Se sugiere, para futuros estudios, el seguimiento detallado de los costos operativos de las solicitudes a GPT 3.5 Turbo para un análisis de viabilidad económica más profundo. También se recomienda la investigación de estrategias para mejorar el rendimiento de los modelos mediante el análisis de patrones de error en mensajes clasificados incorrectamente y el uso de ejemplos anonimizados, así como la exploración de cuestiones relacionadas con la Ley General de Protección de Datos Personales (LGPD) en el tratamiento de datos de clientes. La principal contribución de este estudio reside en la demostración de que la estrategia de Fine tuning en modelos pre-entrenados, como BERTimbau, ofrece ventajas significativas en precisión y eficiencia para el análisis de sentimientos en portugués, proporcionando una herramienta valiosa para empresas de e-commerce en el monitoreo ágil de la percepción de los consumidores y en la mejora continua de productos y servicios.
Referencias Bibliográficas
FATOUROS, Georgios; SOLDATOS, John; KOUROUMALI, Kalliopi; MAKRIDIS, Georgios; KYRIAZIS, Dimosthenis. (2023). Transforming sentiment analysis in the financial domain with ChatGPT. Machine Learning with Applications, v. 14, 100508.
KOKAB, Sayyida Tabinda; ASGHAR, Sohail; NAZ, Shehneela. (2022). Transformer-based deep learning models for the sentiment analysis of social media data. Array, v. 14, p. 100157.
PALOMINO, Marco A.; AIDER, Farida. (2022). Evaluating the Effectiveness of Text Pre-Processing in Sentiment Analysis. Applied Sciences, v. 12, n. 17, p. 8875.
SOARES, William Destefani. (2023). Avaliação de produtos baseada em análise de sentimentos aplicada a postagens textuais em redes sociais. 114 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) – Instituto Federal do Espírito Santo, Campus Cachoeiro de Itapemirim.
SOUZA, F. C.; NOGUEIRA, R. F.; LOTUFO, R. A. (2022). BERT models for Brazilian Portuguese: pretraining, evaluation and tokenization analysis. In: Proceedings of the 9th Brazilian Conference on Intelligent Systems (BRACIS).
SÁNCHEZ-RADA, J. F.; IGLESIAS, C. A. (2019). Social context in sentiment analysis: formal definition, overview of current trends and framework for comparison. Information Fusion, v. 52, p. 344-356.
TAN, Kian Long; LEE, Chin Poo; LIM, Kian Ming. (2023). A Survey of Sentiment Analysis: Approaches, Datasets, and Future Research. Applied Sciences, v. 13, n. 7, p. 4550.
WANKHADE, Mayur; RAO, Annavarapu Chandra Sekhara; KULKARNI, Chaitanya. (2022). A survey on sentiment analysis methods, applications, and challenges. Artificial Intelligence Review, v. 55, p. 5731-5780.
Artículo originado del Trabajo de Conclusión de Curso de la Especialización en Ingeniería de Software del MBA USP/Esalq
Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy