Artículo

Ingeniería De Software

07 de octubre de 2026

Aplicación de Inteligencia Artificial para Análisis de Sentimiento en Mensajes de Texto

Aplicación de Inteligencia Artificial para Análisis de Sentimiento en Mensajes de Texto

Isabel Priscila Chaves da Silva Rebello; Marcos Jardel Henriques

DOI: 10.22167/2675-6528-202603004

Artículo derivado de Trabajo de Fin de Curso (TCC), con contenido basado en el trabajo original del estudiante y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, una solución de inteligencia artificial desarrollada por el Instituto Pecege para la síntesis y organización textual.

Resumen

El análisis de sentimientos en mensajes de texto de clientes de comercio electrónico es crucial para la toma de decisiones empresariales. Este estudio implementó modelos de inteligencia artificial con el objetivo de comparar su desempeño en la evaluación de estos mensajes. La metodología consistió en la aplicación de un conjunto de datos de 4664 registros en cuatro experimentos distintos: GPT 3.5 Turbo con Zero-shot, GPT 3.5 Turbo con Few-shot, BERT Multilingual Sentiment y BERTimbau con Fine tuning. Los resultados obtenidos indicaron que el modelo especializado con Fine tuning presentó las mejores métricas de evaluación, una matriz de confusión más consistente y el menor tiempo de procesamiento. En contraste, el modelo BERT Multilingual Sentiment demostró dificultades en la interpretación de textos en idioma portugués. Los experimentos con GPT 3.5 Turbo, particularmente el enfoque Few-shot, se revelaron prometedores, configurándose como una alternativa viable en escenarios donde el Fine tuning no puede ser aplicado. Se concluyó que la estrategia de Fine tuning en modelos pre-entrenados, como el BERTimbau, ofrece ventajas significativas en precisión y eficiencia para el análisis de sentimientos a gran escala.

Palabras clave: Análisis de Sentimientos; Fine Tuning; Inteligencia Artificial; LLM; Procesamiento de Lenguaje Natural.

1. Introducción

El análisis de sentimientos (AS), también conocido como análisis de opinión o minería de opinión, se ha convertido en un concepto de gran importancia para empresas, gobiernos y organizaciones. Comprender cómo los clientes y usuarios perciben los productos y servicios es fundamental para la toma de decisiones estratégicas (SÁNCHEZ-RADA E IGLESIAS, 2019).

A pesar de su relevancia, recopilar y analizar la retroalimentación del consumidor presenta desafíos significativos. El contenido generado por los clientes a menudo consiste en datos no estructurados, como mensajes de texto libre, que pueden abordar diversos temas y contener expresiones coloquiales, errores ortográficos y lenguaje informal. Esta naturaleza de los datos dificulta el proceso de AS y el tratamiento eficaz de la información (TAN, 2023).

En el contexto del comercio electrónico, el análisis de sentimientos es una herramienta poderosa y con un vasto potencial. Las empresas que buscan mantener la competitividad en el mercado necesitan refinar y analizar los comentarios de los consumidores. El AS permite obtener información valiosa sobre las opiniones de los clientes, ayudando a detectar puntos de mejora, perfeccionar productos y servicios, y realizar ajustes estratégicos para satisfacer las exigencias del mercado (Soares, 2023). Además, permite a los clientes tomar decisiones de compra más informadas. Con el gran volumen de datos no estructurados generados diariamente, una herramienta capaz de extraer información a gran escala es esencial para una comprensión ágil de la percepción de los consumidores, generando ventajas estratégicas y operativas.

El análisis de sentimientos es un segmento del Procesamiento del Lenguaje Natural (NLP) que tiene como objetivo identificar y categorizar automáticamente sentimientos y emociones expresados en textos (TAN, 2023). Históricamente, métodos tradicionales como Bag-of-Words y TF-IDF clasificaban textos por la frecuencia de palabras, pero ignoraban el contexto y la semántica, limitando su eficacia. La evolución llevó al desarrollo de modelos como Word2Vec y GloVe, que capturan el significado semántico, aunque todavía enfrentan desafíos con palabras desconocidas y la necesidad de grandes conjuntos de datos (KOKAB ET AL, 2022). Más recientemente, han surgido enfoques basados en aprendizaje por transferencia, como BERT, y Large Language Models (LLMs), como GPT 3.5 Turbo, demostrando alta capacidad de generalización y precisión en tareas de AS, incluso con estrategias de zero-shot y few-shot (Souza et al., 2022).

Ante la complejidad y diversidad de modelos de inteligencia artificial disponibles para el análisis de sentimientos, y considerando la importancia del feedback del cliente para el e-commerce brasileño, resulta crucial investigar qué enfoque ofrece el mejor rendimiento para mensajes de texto en portugués. La comparación entre modelos de lenguaje grandes (LLMs) con enfoques zero-shot y few-shot y modelos pre-entrenados con fine tuning, como BERTimbau, es fundamental para identificar la solución más eficaz en términos de precisión y eficiencia de procesamiento para este dominio específico.

En este contexto, el presente trabajo busca comparar el rendimiento de diferentes modelos de Inteligencia Artificial en el análisis de sentimientos en mensajes de texto de clientes de un e-commerce.

2. Material y Métodos

Con el fin de alcanzar los objetivos propuestos, este estudio se llevó a cabo mediante un enfoque comparativo y experimental. Se realizó una revisión bibliográfica para identificar modelos prometedores de inteligencia artificial, seguida de la definición y aplicación de estos modelos a un conjunto de datos de mensajes de texto de clientes. Posteriormente, se procedió a la comparación de los modelos a través de una evaluación experimental y al análisis de los resultados obtenidos.

La unidad de análisis consistió en un conjunto de 4664 mensajes de texto reales, recopilados de reseñas de clientes de un e-commerce. Estos mensajes contenían comentarios sobre vendedores, productos y servicios de entrega, representando datos no estructurados generados por consumidores (WANKHADE ET AL, 2022). La naturaleza de estos datos permitió observar el desempeño de los modelos ante expresiones coloquiales, errores ortográficos y lenguaje informal.

El preprocesamiento de los datos fue un paso fundamental para estructurar los textos. Este proceso incluyó la eliminación de caracteres especiales, como símbolos (excepto números) y URLs, y la tokenización, que segmentó el texto en unidades más pequeñas (PALOMINO, 2022; TAN ET AL, 2023). Adicionalmente, los mensajes con valoraciones numéricas de 0 a 10 fueron tratados para delimitar estos valores, ayudando en la asimilación del modelo.

Después del preprocesamiento, los 4664 mensajes de texto fueron etiquetados manualmente en tres categorías de sentimiento: positivo, negativo y neutro. El etiquetado fue realizado por un único evaluador, priorizando mensajes con contenido textual explícito. En casos de ambigüedad, la clase negativa fue adoptada como criterio de desempate. Las reglas de etiquetado establecieron como positivo notas superiores a siete o elogios, como negativo notas inferiores a seis con críticas directas, y como neutro notas entre seis y siete o mensajes no relacionados con los servicios.

Para el análisis de sentimientos, se emplearon tres modelos de inteligencia artificial distintos, evaluados en cuatro configuraciones experimentales. Los modelos incluyeron el GPT 3.5 Turbo, el nlptown/bert-base-multilingual-uncased-sentiment (una adaptación del BERT para análisis de sentimientos multilingüe), y el neuralmind/bert-base-portuguese-cased, conocido como BERTimbau, entrenado específicamente para el portugués brasileño (Souza et al., 2022).

La implementación de GPT 3.5 Turbo se realizó en dos configuraciones. En el enfoque zero-shot, el modelo clasificó el sentimiento (positivo, negativo o neutro) basándose únicamente en la descripción de la tarea proporcionada en el prompt, sin ejemplos previos. En la configuración few-shot, se proporcionó un conjunto de ejemplos al modelo para guiar su comportamiento, utilizando el contexto para mejorar la calidad de las inferencias.

El modelo BERT Multilingual Sentiment se utilizó en su formato pre-entrenado. Por otro lado, el modelo BERTimbau se aplicó con la técnica de fine-tuning, que implicó el entrenamiento del modelo con el conjunto de datos etiquetado. Para este proceso, el conjunto de datos se dividió en particiones de entrenamiento y prueba, con el 70% y el 20% de los datos, respectivamente, no utilizándose la partición de validación para la evaluación directa del modelo.

Los hiperparámetros empleados en el fine-tuning de BERTimbau incluyeron el modelo base neuralmind/bert-base-portuguese-cased (BERTimbau Base), tres épocas de entrenamiento, una tasa de aprendizaje de 2×10-5 y un tamaño de lote (batch size) de ocho para entrenamiento y evaluación. Se definió una longitud máxima de 512 tokens, y el optimizador AdamW, junto con la función de pérdida de entropía cruzada, se utilizaron según los estándares de la biblioteca Transformers (Hugging Face).

La evaluación del rendimiento de los modelos se realizó mediante un conjunto de métricas estadísticas ampliamente reconocidas en la literatura de clasificación. Las métricas calculadas incluyeron Precisión, Coeficiente Kappa, Precisión Macro, Recall Macro, F1 Macro, Precisión Ponderada, Recall Ponderada y F1 Ponderado. Adicionalmente, se empleó la matriz de confusión como herramienta gráfica para visualizar la cantidad de clasificaciones correctas en cada clase de sentimiento.

3. Resultados y Discusión

El análisis comparativo del rendimiento de diferentes modelos de inteligencia artificial en la evaluación de sentimientos en mensajes de texto de clientes de comercio electrónico reveló variaciones significativas en las métricas de evaluación, la consistencia de la clasificación y la eficiencia del procesamiento. Los experimentos se llevaron a cabo con cuatro enfoques distintos: GPT 3.5 Turbo con Zero-shot, GPT 3.5 Turbo con Few-shot, BERT Multilingual Sentiment y BERTimbau con Fine tuning. Los resultados obtenidos permitieron identificar la estrategia más eficaz para el contexto específico de mensajes en portugués, según el objetivo central de este estudio.

Inicialmente, se observó que el modelo BERTimbau con Fine tuning demostró el desempeño más robusto en todas las métricas estadísticas evaluadas. Este modelo alcanzó una precisión de 0,9154, un coeficiente Kappa de 0,8701, precisión Macro de 0,9076, revocación Macro de 0,9114 y F1 Macro de 0,9085. Las métricas ponderadas también siguieron esta tendencia, con precisión ponderada de 0,9162, revocación ponderada de 0,9154 y F1 ponderado de 0,9149. Estos valores consistentemente elevados indican una capacidad superior de clasificación y una comprensión profunda de los matices contextuales y semánticos de la lengua portuguesa, lo cual es crucial para el análisis de sentimientos en datos de e-commerce.

En contraste, el modelo BERT Multilingual Sentiment presentó el peor rendimiento entre todos los enfoques probados. Sus métricas fueron notablemente bajas, con una precisión de 0,5491, un coeficiente Kappa de 0,3311, una precisión Macro de 0,5548, una revocación Macro de 0,5675 y un F1 Macro de 0,5126. Las métricas ponderadas también fueron inferiores, con una precisión ponderada de 0,5785, una revocación ponderada de 0,5491 y un F1 ponderado de 0,522. Este resultado sugiere que, a pesar de ser un modelo diseñado para análisis de sentimiento y con soporte para múltiples idiomas, no logró capturar de manera eficiente las particularidades semánticas del portugués brasileño, corroborando observaciones de Souza et al. (2022) sobre las limitaciones de los modelos multilingües para idiomas específicos.

Los enfoques con GPT 3.5 Turbo ocuparon una franja intermedia de rendimiento. El modelo GPT 3.5 Turbo Zero-shot obtuvo una precisión de 0,7562, Kappa de 0,625, precisión Macro de 0,7477, revocación Macro de 0,7556 y F1 Macro de 0,7512. Las métricas ponderadas fueron similares, con precisión ponderada de 0,7551, revocación ponderada de 0,7562 y F1 ponderado de 0,7553. Aunque demuestra la alta capacidad de un Large Language Model (LLM) para realizar clasificaciones con información mínima, la ausencia de ejemplos específicos para la tarea resultó en un rendimiento inferior en comparación con enfoques más adaptados.

La aplicación de la estrategia Few-shot al GPT 3.5 Turbo resultó en una mejora notable en relación con el enfoque Zero-shot. Este modelo alcanzó una precisión de 0,8218, Kappa de 0,7311, precisión Macro de 0,8153, revocación Macro de 0,8303 y F1 Macro de 0,8108. Las métricas ponderadas también fueron superiores, con precisión ponderada de 0,8431, revocación ponderada de 0,8218 y F1 ponderado de 0,8224. La inclusión de ejemplos en el prompt proporcionó un contexto más claro para el modelo, mejorando la calidad de las inferencias y evidenciando el potencial de los LLMs cuando se orientan con datos específicos, incluso sin un fine tuning completo, según lo señalado por Fatouros (2023).

Además de las métricas de rendimiento, la capacidad de procesamiento de los modelos fue un factor crítico en la evaluación. Los modelos basados en BERT, tanto el Multilingual Sentiment como el BERTimbau con Fine Tuning, demostraron una eficiencia significativamente mayor. El BERT Multilingual Sentiment procesó los datos en 2 minutos y 11 segundos, mientras que el BERTimbau con Fine Tuning, que utilizó 934 registros para la prueba, completó la tarea en solo 25 segundos. Esto se traduce en un tiempo promedio por registro de aproximadamente 0,028 segundos para el BERT Multilingual y 0,027 segundos para el BERTimbau, lo que indica una alta velocidad de procesamiento para ambos.

Por otro lado, los experimentos con GPT 3.5 Turbo presentaron tiempos de procesamiento considerablemente más largos. El enfoque Zero-shot tardó 150 minutos y 1 segundo en procesar 4557 registros, resultando en un tiempo promedio de 1,975 segundos por registro. El enfoque Few-shot tuvo un rendimiento similar, con 150 minutos y 41 segundos para 4601 registros, totalizando 1,965 segundos por registro. Esta diferencia de tiempo, aproximadamente 73 veces mayor para los LLMs por registro, destaca una ventaja operativa significativa de los modelos específicos en escenarios de gran escala, donde la agilidad en el procesamiento es esencial para la comprensión en tiempo real de la percepción de los consumidores.

Otro aspecto relevante en la evaluación de los modelos GPT 3.5 Turbo fue la ocurrencia de errores de solicitud. El enfoque Zero-shot registró 2,30% de errores, mientras que el Few-shot presentó 1,35% de errores. Estos errores indican que, a pesar de las buenas métricas, parte de los datos puede no ser clasificada, resultando en pérdida de información. La menor tasa de error en el enfoque Few-shot puede atribuirse al tamaño del prompt, que, por contener ejemplos, exige más de la API y del modelo, pero también ofrece una dirección más robusta, minimizando fallos de solicitud en comparación con el enfoque Zero-shot, que depende exclusivamente del conocimiento preexistente del modelo.

Matriz de Confusión

El análisis de las matrices de confusión proporcionó una visión detallada de los tipos de errores de clasificación cometidos por cada modelo. Para el modelo BERT Multilingual Sentiment, la matriz reveló un número elevado de clasificaciones incorrectas. Aunque acertó la mayoría de las instancias negativas (1022), el modelo se equivocó sustancialmente en las clases positivas y neutras. Por ejemplo, clasificó 740 mensajes neutros como negativos y 552 mensajes positivos como negativos. Esta tendencia a clasificar oraciones como negativas sugiere un sesgo del modelo cuando se aplica a datos en portugués, lo que refuerza la dificultad para manejar las especificidades lingüísticas del idioma.

La matriz de confusión del modelo BERTimbau con Fine Tuning, a su vez, demostró una alta capacidad de clasificación en todas las clases. Con un número reducido de errores, el modelo acertó 217 clasificaciones negativas, 251 neutras y 387 positivas. Los errores fueron mínimos, con solo 13 negativas clasificadas como neutras, 2 como positivas; 34 neutras como negativas, 16 como positivas; y 1 positiva como negativa, 13 como neutra. Esta consistencia en la matriz de confusión evidencia la eficacia del fine tuning en un modelo monolingüe para el portugués, permitiendo una adaptación precisa a las características del conjunto de datos.

Para el modelo GPT 3.5 Turbo Zero-shot, la matriz de confusión indicó que, a pesar de un número razonable de aciertos, el modelo presentó una tendencia al error entre las clases intermedias y las más extremas. Se observó que 240 mensajes neutros fueron clasificados como negativos y 31 positivos también fueron clasificados como negativos. Además, 338 mensajes positivos fueron clasificados como neutros. Esta confusión sugiere que el modelo, sin ejemplos específicos, tiene dificultad en diferenciar matices de sentimiento, clasificando positivos o negativos como neutros, o viceversa, lo que puede llevar a interpretaciones ambiguas en contextos complejos de e-commerce.

La matriz de confusión del GPT 3.5 Turbo con estrategia Few-shot mostró una mejora significativa en los aciertos en comparación con el enfoque Zero-shot. El modelo clasificó correctamente 1098 mensajes negativos, 980 neutros y 1703 positivos. Sin embargo, todavía se notó cierta confusión al clasificar neutros como negativos (456) y positivos como neutros (231). Esta confusión, aunque menor, indica que, incluso con ejemplos, el modelo puede tener desafíos en contextos donde las fronteras entre los sentimientos son más sutiles. La posibilidad de corregir estos errores mediante el análisis de sentencias problemáticas y el suministro de nuevos ejemplos es una ventaja de esta estrategia, permitiendo una mejora continua del modelo.

En resumen, los resultados de la investigación demuestran que la estrategia de Fine tuning en modelos preentrenados, como BERTimbau, ofrece la mayor precisión y consistencia en el análisis de sentimientos en mensajes de texto de clientes de comercio electrónico en portugués, además de un tiempo de procesamiento significativamente menor. Los enfoques con GPT 3.5 Turbo, especialmente el Few-shot, se mostraron prometedores y representan una alternativa viable en escenarios donde el fine tuning no es aplicable, a pesar de presentar mayor tiempo de procesamiento y cierta confusión en la clasificación. El modelo BERT Multilingual Sentiment, por su parte, resultó inadecuado para el idioma portugués, evidenciando la importancia de la especificidad lingüística para la eficacia del análisis de sentimientos.

4. Conclusión

El presente estudio buscó comparar el rendimiento de diferentes modelos de inteligencia artificial en el análisis de sentimientos en mensajes de texto de clientes de un e-commerce. Se verificó que el modelo BERTimbau con Fine tuning demostró el rendimiento más robusto, alcanzando las mejores métricas estadísticas de evaluación y una matriz de confusión consistente, además de presentar el menor tiempo de procesamiento. En contraste, el modelo BERT Multilingual Sentiment reveló dificultades significativas en la interpretación de textos en idioma portugués, resultando en las métricas más bajas entre los enfoques probados. Las implementaciones con GPT 3.5 Turbo, tanto en la modalidad Zero-shot como Few-shot, se situaron en una franja intermedia de rendimiento. La estrategia Few-shot, en particular, evidenció una mejora notable en relación con la Zero-shot, configurándose como una alternativa prometedora en escenarios donde el Fine tuning no puede ser aplicado. Sin embargo, se observó que los modelos basados en BERT procesaron los datos de forma significativamente más rápida, cerca de 73 veces más ágil por registro, en comparación con los enfoques de LLMs, que también registraron errores de solicitud, indicando potencial pérdida de datos.

A pesar de los resultados prometedores, se identificó que el uso de Large Language Models como GPT 3.5 Turbo puede implicar costos asociados a las solicitudes y la ocurrencia de errores que resultan en pérdida de datos, aspectos que requieren consideración en aplicaciones a gran escala. Se sugiere, para futuros estudios, el seguimiento detallado de los costos operativos de las solicitudes a GPT 3.5 Turbo para un análisis de viabilidad económica más profundo. También se recomienda la investigación de estrategias para mejorar el rendimiento de los modelos mediante el análisis de patrones de error en mensajes clasificados incorrectamente y el uso de ejemplos anonimizados, así como la exploración de cuestiones relacionadas con la Ley General de Protección de Datos Personales (LGPD) en el tratamiento de datos de clientes. La principal contribución de este estudio reside en la demostración de que la estrategia de Fine tuning en modelos pre-entrenados, como BERTimbau, ofrece ventajas significativas en precisión y eficiencia para el análisis de sentimientos en portugués, proporcionando una herramienta valiosa para empresas de e-commerce en el monitoreo ágil de la percepción de los consumidores y en la mejora continua de productos y servicios.

Referencias Bibliográficas

FATOUROS, Georgios; SOLDATOS, John; KOUROUMALI, Kalliopi; MAKRIDIS, Georgios; KYRIAZIS, Dimosthenis. (2023). Transforming sentiment analysis in the financial domain with ChatGPT. Machine Learning with Applications, v. 14, 100508.

KOKAB, Sayyida Tabinda; ASGHAR, Sohail; NAZ, Shehneela. (2022). Transformer-based deep learning models for the sentiment analysis of social media data. Array, v. 14, p. 100157.

PALOMINO, Marco A.; AIDER, Farida. (2022). Evaluating the Effectiveness of Text Pre-Processing in Sentiment Analysis. Applied Sciences, v. 12, n. 17, p. 8875.

SOARES, William Destefani. (2023). Avaliação de produtos baseada em análise de sentimentos aplicada a postagens textuais em redes sociais. 114 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) – Instituto Federal do Espírito Santo, Campus Cachoeiro de Itapemirim.

SOUZA, F. C.; NOGUEIRA, R. F.; LOTUFO, R. A. (2022). BERT models for Brazilian Portuguese: pretraining, evaluation and tokenization analysis. In: Proceedings of the 9th Brazilian Conference on Intelligent Systems (BRACIS).

SÁNCHEZ-RADA, J. F.; IGLESIAS, C. A. (2019). Social context in sentiment analysis: formal definition, overview of current trends and framework for comparison. Information Fusion, v. 52, p. 344-356.

TAN, Kian Long; LEE, Chin Poo; LIM, Kian Ming. (2023). A Survey of Sentiment Analysis: Approaches, Datasets, and Future Research. Applied Sciences, v. 13, n. 7, p. 4550.

WANKHADE, Mayur; RAO, Annavarapu Chandra Sekhara; KULKARNI, Chaitanya. (2022). A survey on sentiment analysis methods, applications, and challenges. Artificial Intelligence Review, v. 55, p. 5731-5780.

Artículo originado del Trabajo de Conclusión de Curso de la Especialización en Ingeniería de Software del MBA USP/Esalq

Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy

También te puede interesar

Ingeniería De Software

09 de octubre de 2026

O papel da densidade de texto instrutivo na eficiência de uma aplicação web.

O desenvolvimento de aplicações web se conecta à experiência do usuário, e este trabalho investigou como o uso excessivo de textos instrutivos pode retardar a conclusão de tarefas e impactar a eficiência da aplicação. O objetivo foi identificar o impacto da densidade textual do conteúdo instrutivo na eficiência de uma aplicação web, utilizando como principal referência a terceira lei de usabilidade de Krug. A pesquisa, de caráter exploratório e delineamento experimental quantitativo, empregou um teste A/B em uma aplicação web responsiva, onde a única variável controlada foi a densidade textual (alta vs. baixa, definida pela contagem de palavras). Participaram 25 usuários, e os dados foram coletados via Datadog RUM, mensurando tempo de conclusão, erros de submissão e taxa de conversão. Os resultados revelaram que a variante com densidade textual reduzida (variante B) apresentou uma taxa de conversão superior (58,3% contra 33,3% da variante A) e um tempo médio de conclusão significativamente menor (1:38 minutos contra 4:58 minutos da variante A), representando um aumento de 67,12% na eficiência. O teste t de Welch (p=0,042) confirmou que a redução da densidade textual impactou a eficiência. Concluiu-se que a redução da densidade textual afeta a eficiência e a taxa de conversão, reforçando a importância de conteúdo objetivo e conciso. Contudo, a baixa densidade textual, por si só, não garantiu o pleno entendimento, sendo essencial a comunicação clara e objetiva das instruções, validando a relevância do UX Writing.

Palavras-chave: Eficiência; Experiência de usuário; Teste A/B; Texto Instrutivo; Usabilidade.

Ingeniería De Software

09 de octubre de 2026

Implementación de sistemas de analítica en entornos de automatización en la industria de procesos

La digitalización de plantas de proceso depende de la recolección y el almacenamiento estructurados de datos, sin los cuales no hay visibilidad de la operación. Se llama analítica industrial a la cadena que recorre estos datos desde la adquisición de la señal en el instrumento de campo, pasando por el almacenamiento ordenado en el tiempo, hasta la disponibilización para análisis y para otros sistemas. Los softwares industriales propietarios cubren hoy esta cadena, y los costos de licenciamiento y mantenimiento restringen su adopción. El estudio tuvo por objetivo arquitectar, implementar y validar un sistema de esta naturaleza, empleando técnicas corrientes de desarrollo de software y componentes sin costo de licenciamiento. El sistema, denominado Sistema de Adquisición y Tratamiento de Información de Proceso (SATIP), se estructuró en tres capas independientes, teniendo como fuente de datos un simulador de reactor farmacéutico que ejecutó una receta de ocho etapas y generó series temporales con variación estocástica. El simulador se escribió en Go, lenguaje adoptado por generar binarios autocontenidos, adecuados a la ejecución en equipos de borde. El almacenamiento utilizó TimescaleDB y la disponibilización se realizó por medio de una interfaz REST con un panel web. El sistema procesó cerca de 414 mil registros por ejecución, con tendencia multivariante, registro de alarmes y correlación temporal entre instrumentos. La arquitectura se mostró reproducible y sin costo de licenciamiento, y la identificación de la degradación exigió solo las lecturas ya almacenadas por el sistema.

Palabras clave: Arquitectura de software; Digitalización; Integración IT/OT; Mantenimiento predictivo; Series temporales.

Ingeniería De Software

09 de octubre de 2026

Uso de la voz junto con grandes modelos de lenguaje como herramienta para la accesibilidad digital

El habla es una base esencial para la interacción humana y, para las personas con discapacidad, puede representar la principal forma de comunicación con el entorno externo. Dada la creciente influencia tecnológica, la identificación de comandos de voz ha surgido como una estrategia prometedora para la interacción hombre-máquina. El trabajo exploró cómo la voz, junto con los Grandes Modelos de Lenguaje (LLMs), puede ser utilizada de manera eficiente, natural y precisa. Para ello, se emplearon diversos patrones de diseño y el lenguaje Python, buscando una mayor extensibilidad. Se utilizó Gemini como proveedor de LLM, enviando el audio directamente y aprovechando su capacidad de llamada de función para interactuar con el dispositivo. Se desarrolló un sistema capaz de comprender la intención del usuario y convertirla en acciones, cuyo diferencial fue la capacidad de visión computacional basada en capturas de pantalla y un sistema de malla para la orientación del LLM. Las pruebas revelaron una tasa de comprensión de la intención del usuario del 91,81% y una tasa de éxito en la ejecución del 75,45% con el modelo “Flash-3” (top p 0,5 y top k 5). El sistema propuesto validó la premisa de que la integración de LLMs a interfaces de voz aumenta la autonomía de usuarios con discapacidad motora, cumpliendo el propósito de ser una Tecnología Asistiva moderna y eficaz. Sin embargo, se plantearon cuestiones sobre los costos de la IA y la seguridad de los datos del usuario, indicando la necesidad de mejora.

Palabras clave: Llamada de función; Interacción hombre-máquina; Reconocimiento de voz; Visión computacional.

Ingeniería De Software

09 de octubre de 2026

ReasonGuard: Una Plataforma de Auditoría de Razonamiento para Modelos de Lenguaje Basada en Descomposición Estructurada de Pensamiento

Se presentó ReasonGuard, una plataforma de auditoría de razonamiento de Inteligencia Artificial, desarrollada como middleware de observabilidad entre aplicaciones cliente y modelos de lenguaje a gran escala (LLMs). El trabajo tuvo como objetivo ofrecer transparencia y trazabilidad a los procesos de toma de decisiones basados en IA, abordando la brecha en la operacionalización de técnicas de razonamiento estructurado para fines de auditoría. El sistema interceptó, analizó y documentó interacciones con LLMs a través de cinco módulos fundamentados en los paradigmas Chain-of-Thought (CoT), Tree-of-Thought (ToT) y Graph-of-Thought (GoT). Estos módulos capturaron rastros de razonamiento, detectaron fallas lógicas estructurales, evaluaron la consistencia de las respuestas y generaron informes de auditoría dirigidos a diferentes perfiles de stakeholders. La plataforma se implementó con FastAPI (Python) en el backend, React con TypeScript en el frontend y PostgreSQL como base de datos relacional, siguiendo una arquitectura modularizada con aislamiento multitenancy por usuario. Los resultados demostraron la viabilidad técnica del enfoque propuesto, con los cinco módulos operativos e integrados. Se concluyó que ReasonGuard contribuye a la gobernanza de IA al instrumentalizar paradigmas de razonamiento estructurado como herramientas de observabilidad y auditoría, llenando una laguna en la literatura.

Palabras clave: Auditoría de IA; Chain-of-Thought; Gobernanza de IA; Modelos de Lenguaje a Gran Escala; Transparencia Algorítmica.

Ingeniería De Software

09 de octubre de 2026

EngTT: software para transporte de carga terrestre basado en costos operativos y parámetros ANTT

El transporte por carretera representa la principal modalidad logística de Brasil, con la composición de los costos de flete regulada por la Agencia Nacional de Transportes Terrestres (ANTT). Ante la ausencia de una metodología estructurada para el cálculo de fletes y la dependencia de hojas de cálculo aisladas en el sector, se desarrolló el software EngTT. El objetivo fue crear una herramienta de apoyo a la decisión que integrara variables operativas, calculase el costo total por ruta y comparase los resultados con el piso mínimo de la ANTT, identificando escenarios de no conformidad y compresión de margen antes de la fijación de precios. La metodología adoptada fue aplicada, cuantitativa y experimental, con construcción incremental orientada al concepto de Producto Mínimo Viable (MVP). El sistema se estructuró en tres modos de uso – Montar Ruta Visual, Batch por hoja de cálculo y Scrape de rutas – compartiendo un motor de cálculo desacoplado y parámetros centralizados. Los resultados obtenidos demostraron que el software cumplió el objetivo propuesto, evidenciando variaciones de margen y conformidad regulatoria entre las rutas analizadas. Se observó que rutas de mayor extensión, como Ribeirão Preto × Guarujá, presentaron incremento de costo debido a la necesidad de pernoctaciones adicionales del conductor, mientras que rutas más cortas, como Cajamar × Guarujá, mostraron mayor adherencia al piso regulatorio de la ANTT. Se concluyó que la solución desarrollada es aplicable al sector de transporte por carretera de cargas como herramienta eficaz de fijación de precios y gestión operativa.

Palabras clave: ANTT; Carga contenerizada; Ingeniería de software; Flete por carretera; Python.

Ingeniería De Software

08 de octubre de 2026

Pipeline de datos para el monitoreo de acciones considerando la metodología fundamentalista

El panorama financiero brasileño enfrenta desafíos como el endeudamiento familiar, la baja alfabetización financiera y la descentralización de información para el análisis de inversiones. Ante esto, el objetivo de la investigación consistió en desarrollar un pipeline de datos financieros, fundamentado en buenas prácticas de Ingeniería de Datos, para estructurar, procesar y disponibilizar información relevante que apoyara la toma de decisiones de inversores individuales en el análisis de acciones. Se implementó una arquitectura medallón, utilizando MinIO S3 para almacenamiento en capas bronce, silver y gold, con Delta Lake para gobernanza de datos. Se empleó Apache Spark para procesamiento distribuido, Prometheus para monitoreo y Power BI para visualización analítica. Los datos fueron mayoritariamente demostraciones financieras de la Comisión de Valores Mobiliarios (CVM). Se construyó una cartera teórica de inversiones con base en los principios de Benjamin Graham (2017), aplicando filtros de selección y validación de datos. Los resultados indicaron un retorno positivo del 32,88% para la cartera teórica, superando el índice Ibovespa (4,25%) en el período de 2021 a 2024, aunque inferior a la tasa Selic (46,96%). Cualitativamente, el pipeline procesó conjuntos de datos voluminosos, con reducciones significativas de redundancias, como 99,27% en la tabla BPA y 94,29% en la DRE, tras la aplicación de filtros. Se evidenciaron ganancias en organización, trazabilidad y calidad de los datos, posibilitando análisis financieros estructurados y más robustos.

Palabras clave: Arquitectura Medallón; Ingeniería de Datos; Inversiones; Pipeline de Datos.

Ingeniería De Software

08 de octubre de 2026

Desempeño y Costo Total de Propiedad de Bases de Datos en la Nube e Infraestructura Local

El presente estudio analizó el rendimiento de operaciones de bases de datos en infraestructuras de nube y locales, correlacionando el comportamiento técnico con la proyección del Costo Total de Propiedad. La investigación se caracterizó como un estudio cuantitativo y experimental, en el cual un sistema de pruebas sometió instancias aisladas de bases de datos a cargas progresivas de ejecución, midiendo el impacto de la latencia de red y del consumo computacional. Para el análisis financiero, se elaboró un modelo de inversiones y gastos operativos diluidos en un ciclo de treinta y seis meses. Los resultados técnicos revelaron que la acumulación de la latencia de internet causó una severa degradación del tiempo en las ejecuciones en la nube, a pesar de que la infraestructura remota operaba con alta ociosidad de procesamiento, registrando casi el 98% de inactividad de la CPU. En contrapartida, el entorno local obtuvo un rendimiento superior amparado por la comunicación de red casi instantánea. En el aspecto financiero, la consolidación de los costos demostró un empate empírico entre el modelo de adquisición física y el de suscripción de servicio en un horizonte de tres años, pero el entorno local se mostró más ventajoso en un ciclo de sesenta meses. Se concluyó que la degradación en la nube no provino de la capacidad computacional, sino de la interacción entre la latencia de ruta y el patrón de comunicación unitario de la aplicación. La adopción de la nube exige una optimización profunda de la arquitectura del sistema para minimizar la dependencia de comunicación constante con el servidor remoto. Sin esta modernización, la infraestructura local se consolidó como la estrategia más viable, garantizando alto rendimiento, previsibilidad presupuestaria y soberanía de los datos.

Palabras clave: Gastos operativos (OPEX); Escalabilidad transaccional; Latencia de red; Sistemas legados.

Ingeniería De Software

08 de octubre de 2026

Integración asíncrona Slack-Jira vía “middleware” de colas: comparación de soluciones de “cloud computing”

La latencia y la interoperabilidad entre sistemas corporativos distribuidos constituyeron el problema investigado, motivado por los costos y fragilidades de las integraciones manuales entre plataformas de colaboración y gestión de proyectos. Se desarrolló y validó un “middleware” de integración asíncrona entre Slack y Jira, con el objetivo de reducir el tiempo de respuesta percibido por el usuario y garantizar la estabilidad del sistema bajo carga. La metodología consistió en la construcción de una arquitectura de software orientada a eventos en Python, utilizando los patrones “producer-consumer” y “adapter” para aislar la interfaz del usuario del procesamiento de “backend”. La solución evolucionó hacia una arquitectura agnóstica de nube, basada en funciones “serverless”, y fue sometida a pruebas de estrés en entornos local, de red real y de producción en dos nubes. La arquitectura redujo el tiempo de espera del usuario de una estimación síncrona de 2.000 milisegundos a un promedio local de 8,96 milisegundos. Bajo carga de 50 peticiones simultáneas, ambos proveedores de nube se mostraron viables: Amazon Web Services registró menor latencia promedio en la capa de recepción (951,35 ms) y el doble de rendimiento, mientras que Microsoft Azure ejecutó el procesamiento en segundo plano con una mediana de 113 ms. La aplicación de “optimistic UI” aseguró fluidez de uso, y la nivelación de carga por colas dispensó el sobredimensionamiento de infraestructura. El “middleware” se consolidó como un modelo de referencia corporativa escalable, resiliente y protegido contra el aprisionamiento tecnológico.

Palabras clave: Arquitectura orientada a eventos; Desacoplamiento temporal; Eficiencia operacional; Gestión de servicios de tecnología de la información; Interoperabilidad de sistemas.

Ingeniería De Software

05 de octubre de 2026

Uso de IA generativa para selección de base de datos: Un framework orientado a requisitos para la generación de Architecture Decision Records (ADRs)

El crecimiento de aplicaciones intensivas en datos y la adopción de la arquitectura de microservicios han ampliado la necesidad de persistencia políglota, imponiendo una alta carga cognitiva a los arquitectos de software en la elección y justificación de tecnologías de bases de datos. Este trabajo tuvo como objetivo proponer y desarrollar un framework basado en agentes de Inteligencia Artificial (IA) para guiar la selección tecnológica y generar Architecture Decision Records (ADRs) fundamentadas. Se empleó una metodología experimental y aplicada para construir una base de conocimiento técnico. La técnica de Retrieval-Augmented Generation (RAG), junto con las bibliotecas LangChain y LangGraph, se utilizó para orquestar agentes y anclar las respuestas de un Large Language Model (LLM). El framework extrajo requisitos en lenguaje natural, los enriqueció con RAG y los envió al LLM, que generó ADRs para auxiliar en la evaluación de trade-offs teóricos. Los resultados demostraron que el agente con RAG redujo respuestas genéricas, aumentando el fundamento teórico y la trazabilidad. El enfoque RAG demostró su eficacia frente a prompts convencionales (zero-shot), favoreciendo la generación de ADRs con menor nivel de alucinación y alto nivel de trazabilidad teórica. Se concluyó que la herramienta automatizada cumplió la función de mapeo de requisitos, resultando en documentos técnicos empíricamente fundamentados y auxiliando la gobernanza y toma de decisiones en arquitectura de software.

Palabras clave: Bases de datos; Inteligencia Artificial; LangGraph; LLM; RAG.