Artículo

11 de agosto de 2026

Herramienta CLI para la automatización de traducción de archivos de localización de aplicaciones web

Matheus Alvarez Crivellari; Eduardo Fernando Mendes

DOI: 10.22167/2675-6528-202601208

Artículo elaborado por la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege orientada a la síntesis y redacción.

Resumen

La internacionalización de aplicaciones web exige procesos de traducción eficientes y consistentes, especialmente en la preservación de estructuras sintácticas y terminología específica. Sin embargo, la traducción manual de archivos de localización conlleva un alto costo operativo, y las herramientas automáticas convencionales carecen de un control terminológico refinado y garantías de integridad estructural. Ante este escenario, se objetivó desarrollar y validar una herramienta de línea de comandos (CLI) para automatizar la traducción de archivos de internacionalización en aplicaciones web front-end. Para ello, se utilizaron modelos de inteligencia artificial generativa, aliados a la técnica de Retrieval-Augmented Generation (RAG) y al uso de glosarios almacenados en bases de datos vectoriales. La investigación se caracterizó como exploratoria, con un enfoque cualitativo y un diseño de estudio de caso, conducida en un entorno corporativo. La metodología comprendió una revisión bibliográfica, el desarrollo de la herramienta en la plataforma Node.js y su evaluación mediante métricas como tiempo de respuesta, tasa de preservación estructural y consistencia terminológica. Los resultados demostraron la viabilidad técnica y operativa de la solución propuesta, que contribuyó a la automatización del proceso de traducción y al área de Ingeniería de Software, ofreciendo un enfoque escalable, reproducible y aplicable a diferentes contextos tecnológicos.

Palabras clave: Base de datos vectorial; Inteligencia artificial; Internacionalización; Generación aumentada por recuperación [RAG].

1. Introducción

El escenario digital globalizado impulsa la necesidad de que las aplicaciones de software superen barreras geográficas y lingüísticas. Esta demanda resalta la importancia de la internacionalización y la localización de software, prácticas que permiten a las empresas expandir su alcance y conquistar nuevos mercados (Ribeiro, 2005). La internacionalización, frecuentemente identificada como i18n, asegura que los usuarios finales puedan interactuar con las aplicaciones en sus idiomas nativos. Complementariamente, la localización, o l10n, adapta el contenido de forma cultural y lingüísticamente aceptable para cada región específica, abarcando desde la traducción de textos hasta el formato de números, fechas y ajustes en el diseño de la interfaz de usuario, según se detalla en la Guía técnica de inicio rápido (Unicode, 2025). La adopción de estas prácticas es crucial para la competitividad y la relevancia de los productos digitales en el mercado actual.

A pesar de la relevancia estratégica, el proceso de traducción de archivos de internacionalización en aplicaciones de software, especialmente las web front-end, enfrenta desafíos considerables. La traducción manual, por ejemplo, se asocia frecuentemente a un alto costo operativo y a un tiempo de ejecución prolongado. En entornos de desarrollo ágil, donde las aplicaciones se actualizan con frecuencia, el mantenimiento de traducciones para múltiples idiomas de forma manual genera un esfuerzo operativo insostenible. Además, la dependencia de traductores humanos puede introducir inconsistencias terminológicas, sobre todo en proyectos de gran escala con equipos distribuidos o a lo largo de ciclos de desarrollo extensos.

Las herramientas de traducción automática convencionales, conocidas como machine translation (MT), surgen como una alternativa para mitigar estos problemas. Sin embargo, poseen limitaciones inherentes, como la dificultad para manejar palabras ambiguas, la desambiguación contextual y el conocimiento de dominio específico, que incluye términos técnicos y nombres propios (Naveen y Trojovský, 2024). Ejemplos como Google Translate, aunque útiles para traducciones generales, generalmente no ofrecen un control terminológico refinado. Esto puede resultar en la traducción inconsistente de términos técnicos, nombres de productos o marcas a lo largo de una aplicación, comprometiendo la claridad y la experiencia del usuario.

Adicionalmente, los archivos de internacionalización no contienen solo textos en lenguaje natural, sino también elementos estructurales críticos, como marcadores de posición (placeholders) y marcado HTML. La preservación de la integridad de estos componentes es esencial para el funcionamiento correcto de la aplicación. Las herramientas automáticas tradicionales frecuentemente fallan en garantizar esta preservación, lo que puede llevar a errores funcionales. Ante estas complejidades, enfoques recientes han explorado el uso de arquitecturas híbridas basadas en agentes de inteligencia artificial y técnicas de Retrieval-Augmented Generation (RAG) para lidiar con este tipo de contexto (Chen et al., 2024). La inteligencia artificial (IA), que engloba la capacidad de las máquinas de ejecutar acciones asociadas a la inteligencia humana (Copeland, 2026), y los Large Language Models (LLM) en particular, ofrecen nuevas perspectivas para la traducción automatizada (McDonough, 2026).

A pesar del avance de las tecnologías de IA, un análisis exploratorio de repositorios como el Node.js Package Manager (NPM) revela que la mayoría de los paquetes existentes para la traducción automática de archivos de internacionalización carecen de garantías robustas de consistencia terminológica y preservación estructural. Esta brecha evidencia la necesidad de una solución que integre de forma eficaz la automatización de la traducción con mecanismos que aseguren la calidad y la integridad del contenido. La técnica de Retrieval-Augmented Generation (RAG) mejora la salida de modelos de lenguaje al consultar una base de conocimiento externa y confiable, como glosarios, mejorando la precisión y la calidad de las traducciones (AWS, 2026). Así, la presente investigación se justifica por la creciente demanda de aplicaciones web multilingües y por la necesidad de optimizar el proceso de traducción, conciliando eficiencia operativa con alta calidad lingüística.

El desarrollo de una herramienta que aborde estas cuestiones representa una contribución significativa al área de Ingeniería de Software, ofreciendo un enfoque escalable, reproducible y aplicable a diversos contextos tecnológicos, beneficiando a equipos que trabajan en el desarrollo de aplicaciones multilingües. Ante este escenario y la problemática identificada, el objetivo de este estudio fue desarrollar una interfaz de línea de comandos (CLI) capaz de automatizar el proceso de traducción de archivos de internacionalización en aplicaciones web front-end, utilizando modelos de inteligencia artificial y la técnica de Retrieval-Augmented Generation (RAG), y comparar los resultados de la traducción con métodos convencionales de machine translation, evaluando aspectos como la preservación estructural, la consistencia terminológica y la optimización de recursos computacionales.

2. Material y Métodos

Este trabajo se realizó como una investigación de carácter exploratorio, destinada a la investigación del uso de modelos de inteligencia artificial y Retrieval-Augmented Generation (RAG) en el proceso de traducción de archivos de internacionalización de aplicaciones web front-end.

Se adoptó un enfoque cualitativo, centrado en el análisis del uso de inteligencia artificial en la traducción de archivos de internacionalización, buscando comprender cómo la solución propuesta aumenta la consistencia terminológica, preserva la integridad estructural de los archivos y reduce la necesidad de intervención humana. El diseño de la investigación se configuró como un estudio de caso, que permitió evaluar la aplicación práctica de la herramienta propuesta en un contexto real de desarrollo web.

El estudio se llevó a cabo en una empresa de tamaño mediano, activa en el sector de la educación superior a distancia, ubicada en Piracicaba, São Paulo. La institución atiende anualmente a unos 15.000 alumnos distribuidos por Brasil y por países de América, Europa, África y Asia. No se recopilaron, trataron ni analizaron datos personales, centrándose exclusivamente en el desarrollo y la evaluación técnica de una herramienta de software.

La investigación comenzó con una revisión bibliográfica exhaustiva de libros, tesis, disertaciones y artículos científicos. El objetivo fue comprender el uso de modelos de inteligencia artificial en el proceso de traducción automática, la aplicación de RAG para mejorar los resultados, la construcción de herramientas de línea de comandos (CLI), la publicación de paquetes en el registro Node.js Package Manager (NPM) y patrones de diseño de software. Estos conocimientos fundamentaron el desarrollo de la herramienta.

La herramienta de línea de comandos se construyó sobre la plataforma Node.js, utilizando el lenguaje TypeScript. Esta elección se debió al amplio uso en frameworks modernos de desarrollo web front-end, como React y Angular, y a los beneficios de la tipificación estática de TypeScript, que proporciona mayor seguridad, detección temprana de errores y escalabilidad a la aplicación (TypeScript, 2026).

La arquitectura de la solución se estructuró en capas distintas, con responsabilidades bien delimitadas, siguiendo buenas prácticas de desarrollo de software y organización de código. Las capas incluyeron interfaz (CLI), aplicación (orquestación), dominio (reglas de negocio, como traducción e indexación de glosario), infraestructura (comunicación con proveedores externos) y transversal (contratos y utilitarios).

En la capa de dominio, se implementó el patrón Façade para unificar diferentes tareas en una interfaz de alto nivel simplificada (Gamma et al., 1994). La capa de infraestructura empleó los patrones Adapter y Strategy, que permitieron el uso intercambiable de diferentes proveedores de Large Language Models (LLM), modelos de embedding y bases de datos vectoriales. Los principios de Inyección de Dependencia se aplicaron para promover el desacoplamiento entre las capas.

Se definió un glosario en formato .csv, que contiene tríos de términos en portugués, inglés y español. Este formato fue elegido por ser ampliamente compatible con bibliotecas TypeScript y herramientas de manipulación tabular. La CLI implementó un comando “glossary-index” responsable de indexar los términos del glosario, mapeándolos en representaciones vectoriales de alta dimensionalidad y almacenándolos en una base de datos vectorial.

La transformación de los términos del glosario en representaciones vectoriales, conocida como embedding, se realizó utilizando el modelo open source all-MiniLM-L6-v2, que mapea frases y párrafos a un espacio vectorial denso de 384 dimensiones y es proporcionado por la plataforma Huggingface. Como base de datos vectorial, se utilizó el proyecto open source LanceDB, instalado localmente como dependencia Node.js.

La CLI también implementó un comando “translate” para realizar la traducción de archivos JSON del idioma de origen a los idiomas de destino. Este comando cargó el archivo de origen en memoria, lo recorrió recursivamente extrayendo los segmentos textuales susceptibles de traducción (sentencias) y los separó en lotes de diez unidades para su posterior envío al modelo de inteligencia artificial.

Cada oración del lote se transformó en un vector, utilizando nuevamente el modelo all-MiniLM-L6-v2. A continuación, se realizó una consulta de similitud vectorial en LanceDB, empleando la métrica de distancia euclidiana para recuperar los cinco términos similares más cercanos, que se utilizaron como contexto adicional en el prompt enviado al modelo de inteligencia artificial.

El prompt se construyó dinámicamente en tiempo de ejecución, combinando instrucciones de traducción predefinidas, términos relevantes del glosario recuperados vía RAG y el propio conjunto de sentencias a ser traducido. El prompt definió explícitamente las reglas de traducción, el uso del glosario cuando aplicable y el formato de salida esperado. Los modelos de inteligencia artificial utilizados fueron los disponibles por las plataformas OpenAI (gpt-40-mini) y Google (gemini-2.5-flash-lite y gemini-2.5-pro).

La respuesta del modelo de inteligencia artificial se recibió en formato JSON estructurado, con los valores traducidos al idioma de destino. El JSON recibido fue interpretado y las traducciones se insertaron en sus respectivas posiciones en el archivo JSON del documento de destino. Si ya existían traducciones para las respectivas oraciones en el archivo de destino, se mantuvieron las existentes, preservando intervenciones humanas previas.

Para la evaluación de la herramienta desarrollada, se definieron las siguientes métricas de desempeño: tiempo medio de respuesta, tasa de preservación estructural, consistencia terminológica, y escalabilidad y aplicabilidad. El tiempo medio de respuesta se midió en segundos por archivo traducido, obtenido a partir de logs generados automáticamente durante el uso de la herramienta.

La tasa de preservación estructural se verificó mediante la comparación automática entre archivos originales y traducidos, midiendo la ocurrencia de errores en elementos estructurales como marcadores de posición y marcado HTML. El algoritmo cargó los JSON de origen y destino, los recorrió recursivamente y extrajo los segmentos textuales y las secuencias de elementos estructurales, comparándolos para identificar inconsistencias de tamaño o divergencias posicionales.

La consistencia terminológica se evaluó verificando si los términos definidos en un glosario y presentes en el idioma de origen aparecían traducidos en el idioma de destino exactamente según sus equivalencias establecidas. El algoritmo procesó el glosario para identificar y contabilizar todas las ocurrencias de los términos en el idioma de origen, eliminando solapamientos para evitar recuentos duplicados, y asoció cada ocurrencia validada al segmento correspondiente en el idioma de destino.

La métrica de consistencia terminológica se calculó mediante la razón entre el número de ocurrencias traducidas correctamente y el total identificado en el idioma de origen. La escalabilidad y aplicabilidad se observaron a partir de pruebas controladas en diferentes contextos tecnológicos, alterando el proveedor del modelo de inteligencia artificial y verificando la facilidad de integración de nuevos proveedores de LLM, bases de datos y mecanismos de embedding.

Los datos recopilados se organizaron y analizaron de forma descriptiva y comparativa, buscando identificar patrones de desempeño e implicaciones prácticas para el desarrollo de soluciones de traducción automatizada en Ingeniería de Software. No hubo identificación de personas físicas, y la investigación no se caracterizó como involucrando seres humanos, según la definición de la Resolución CNS n° 466/2012, dispensando la sumisión al Comité de Ética en Investigación.

3. Resultados y Discusión

Los resultados obtenidos a partir de la aplicación de la metodología propuesta revelaron la viabilidad técnica y operativa de la herramienta de línea de comandos (CLI) desarrollada para la automatización de la traducción de archivos de internacionalización en aplicaciones web front-end. El análisis se centró en la evaluación de métricas como el tiempo de respuesta de los modelos de inteligencia artificial, la consistencia terminológica y la preservación estructural de los archivos. Todas las pruebas se llevaron a cabo utilizando un archivo de idioma de origen en portugués de Brasil, que contenía 1.439 oraciones, las cuales fueron enviadas a los modelos de inteligencia artificial en lotes de diez oraciones, totalizando 144 lotes por idioma. Estos hallazgos son cruciales para verificar la eficacia de la solución y orientar futuras mejoras, contribuyendo al área de Ingeniería de Software.

Como base de comparación, el mismo archivo de idioma de origen fue traducido por un enfoque de traducción automática (MT) convencional, empleando la biblioteca `i18n-auto-translation` con Google Translate como proveedor. Esta biblioteca, sin embargo, no ofrecía soporte para el uso de glosarios. Los resultados de la traducción convencional indicaron una duración total de 96.000 segundos para el inglés de Estados Unidos y 113.000 segundos para el español de España. En términos de calidad, la tasa de preservación estructural fue del 56,19% para el inglés y del 55,52% para el español, mientras que la consistencia terminológica fue del 10,19% para el inglés y solo del 0,49% para el español. Estos datos establecieron un punto de referencia de rendimiento para la evaluación de la solución basada en inteligencia artificial y RAG.

Tiempo medio de respuesta

La métrica de tiempo medio de respuesta representa el período total, en segundos, necesario para el envío de los datos al servidor y el retorno a la aplicación, incluyendo el procesamiento de las traducciones. El rendimiento varió significativamente entre los modelos de Large Language Models (LLM) evaluados. El modelo Google gemini-2.5-flash-lite demostró ser el más rápido, con un tiempo medio de 1,323 segundos por lote para el inglés de Estados Unidos y 1,680 segundos por lote para el español de España, resultando en tiempos totales de 190,497 y 241,974 segundos, respectivamente. En contraste, el Google gemini-2.5-pro presentó el rendimiento más lento, con promedios de 11,977 segundos por lote para el inglés y 14,440 segundos por lote para el español, totalizando 1724,710 y 2079,318 segundos. El modelo OpenAI gpt-4o-mini registró tiempos intermedios de 3,158 segundos por lote para el inglés y 3,306 segundos por lote para el español, con totales de 454,778 y 476,020 segundos. Se observó que la traducción al inglés fue consistentemente más rápida que al español en todos los escenarios. Sin embargo, todos los modelos de LLM presentaron tiempos de respuesta superiores a los del enfoque de MT convencional, que fue de 96,000 segundos para el inglés y 113,000 segundos para el español.

Tasa de preservación estructural

La tasa de preservación estructural evaluó la capacidad de la solución para mantener la integridad de elementos estructurales críticos en archivos JSON, como marcadores de posición y marcado HTML. El algoritmo desarrollado para esta métrica cargó los archivos JSON de origen y destino, recorriéndolos recursivamente para extraer y emparejar segmentos de texto. Para cada par válido, se compararon las secuencias de elementos estructurales, ignorando el contenido textual, y cualquier discrepancia en tamaño o posición se consideró un fallo. Los resultados demostraron que los modelos Google gemini-2.5-flash-lite (tanto para inglés como para español), Google gemini-2.5-pro (para inglés y español) y OpenAI gpt-4o-mini (para inglés) alcanzaron una tasa de preservación estructural del 100,00%, sin fallos en 110 oraciones con estructuras. El modelo OpenAI gpt-4o-mini para español obtuvo un 99,76%, con solo un fallo en la preservación estructural. Este rendimiento representa una mejora superior al 43% en comparación con la MT convencional, que registró tasas del 56,19% y 55,52% para inglés y español, respectivamente, lo que indica un avance significativo en la garantía de la integridad de los archivos.

Consistencia terminológica

La consistencia terminológica se evaluó verificando si los términos definidos en un glosario, presentes en el idioma de origen, se traducían al idioma de destino exactamente según sus equivalencias establecidas. El glosario utilizado consistía en 249 tríos de términos en portugués, inglés y español. El algoritmo procesó los archivos JSON, identificó y contabilizó 298 ocurrencias de los términos del glosario en el idioma de origen, eliminando solapamientos para evitar recuentos duplicados. Luego, verificó las ocurrencias correctas de las traducciones en el idioma de destino. La métrica se calculó como la razón entre el número de ocurrencias correctamente traducidas y el total identificado en el idioma de origen. Para el inglés de Estados Unidos, los modelos presentaron alta consistencia: Google gemini-2.5-flash-lite alcanzó el 88,93% (265 de 298 ocurrencias correctas), Google gemini-2.5-pro alcanzó el 89,60% (267 correctas) y OpenAI gpt-4o-mini obtuvo el 91,61% (273 correctas). Para el español de España, los resultados fueron Google gemini-2.5-flash-lite con un 70,13% (209 correctas), Google gemini-2.5-pro con un 80,87% (241 correctas) y OpenAI gpt-4o-mini con un 80,87% (241 correctas). En todos los escenarios, la consistencia para el inglés fue superior a la del español. La comparación con la MT convencional, que obtuvo un 10,19% para el inglés y un 0,49% para el español, demuestra una mejora sustancial en la consistencia terminológica con el enfoque propuesto. Aunque las tasas de consistencia terminológica superiores al 80% son elevadas, aún reflejan limitaciones conocidas de la traducción automática y de enfoques basados en Retrieval-Augmented Generation (RAG). Los métodos tradicionales frecuentemente presentan dificultades en la traducción de términos dependientes del contexto y del dominio específico, resultando en inconsistencias terminológicas (Naveen y Trojovský, 2024). Estudios recientes con LLMs y técnicas de RAG indican que el uso de contexto recuperado y recursos auxiliares, como glosarios, reduce estas inconsistencias, pero no las elimina completamente (Chen et al., 2024). Así, los resultados obtenidos están alineados con la literatura, que señala la inconsistencia terminológica como uno de los principales desafíos del área, reforzando la relevancia de la combinación entre RAG y glosarios estructurados para la mejora de la consistencia (Chen et al., 2025).

Escalabilidad y aplicabilidad

La solución se estructuró con el objetivo de facilitar la evolución de la base de código, permitiendo la incorporación ágil de nuevos proveedores de LLM, bases de datos relacionales y mecanismos de embedding. Esta arquitectura se diseñó con bajo acoplamiento y una mínima necesidad de refactorizaciones, lo cual es fundamental para el mantenimiento y la evolución del sistema en entornos de desarrollo dinámicos. La característica de escalabilidad y aplicabilidad se verificó mediante la rápida implementación de clases concretas que interactúan con proveedores de LLM de Google y OpenAI. Esto fue posible simplemente extendiendo las interfaces definidas e implementando la comunicación utilizando las bibliotecas específicas de cada proveedor, lo que demuestra la flexibilidad de la herramienta para adaptarse a diferentes contextos tecnológicos y proveedores de inteligencia artificial.

Discusión general de los resultados

El análisis de los resultados reveló que la herramienta desarrollada, integrando modelos de inteligencia artificial y la técnica RAG, ofrece una solución robusta para la automatización de la traducción de archivos de internacionalización. Aunque los modelos de LLM presentaron tiempos de respuesta superiores a los de la MT convencional, la calidad de las traducciones en términos de preservación estructural y consistencia terminológica mejoró significativamente. La tasa de preservación estructural alcanzó casi el 100% en todos los escenarios con los modelos de IA, un aumento superior al 43% en relación con la MT convencional, lo cual es crucial para evitar fallos funcionales en las aplicaciones. La consistencia terminológica, que superó el 80% en la mayoría de los casos, también representó una mejora expresiva en comparación con los resultados de la MT convencional, que fueron inferiores al 11%. Estos hallazgos demuestran que el enfoque propuesto es eficaz para conciliar la automatización con la garantía de calidad lingüística y estructural, abordando las lagunas identificadas en herramientas de traducción automática tradicionales.

La arquitectura en capas, basada en patrones de diseño como Fachada, Adaptador y Estrategia, y principios de Inyección de Dependencia, fue fundamental para garantizar la flexibilidad y escalabilidad de la solución. Esta estructura permite que la herramienta se adapte a diferentes proveedores de inteligencia artificial y tecnologías de bases de datos vectoriales, facilitando su mantenimiento y evolución. La capacidad de integrar glosarios a través de bases de datos vectoriales y la técnica RAG fue decisiva para elevar la consistencia terminológica, uno de los principales desafíos de la traducción automatizada. Aunque la inconsistencia terminológica no se ha eliminado por completo, la reducción significativa observada valida el enfoque híbrido propuesto. La elección del modelo de inteligencia artificial impacta directamente el tiempo de respuesta, permitiendo un equilibrio entre calidad y rendimiento según las necesidades del proyecto. En general, los resultados confirman la viabilidad y el potencial de la herramienta para optimizar el proceso de internacionalización en aplicaciones web, ofreciendo un enfoque escalable y reproducible para equipos de desarrollo.

4. Conclusión

El presente estudio buscó desarrollar una interfaz de línea de comandos (CLI) para automatizar la traducción de archivos de internacionalización en aplicaciones web front-end, empleando modelos de inteligencia artificial generativa, la técnica de Retrieval-Augmented Generation (RAG) y glosarios en bases de datos vectoriales, comparando su desempeño con métodos de machine translation (MT) convencionales. Se verificó la viabilidad técnica y operativa de la solución propuesta, que demostró avances significativos en la calidad de las traducciones. En términos de preservación estructural, los modelos de inteligencia artificial alcanzaron tasas cercanas al 100%, superando en más del 43% el desempeño de la MT convencional y garantizando la integridad de elementos críticos como marcadores de posición y marcaciones HTML. Adicionalmente, se observó una consistencia terminológica superior al 80% en la mayoría de los escenarios con el enfoque de IA y RAG, lo que representó una mejora sustancial en comparación con la MT convencional, que registró índices inferiores al 11%. Este enfoque híbrido contribuyó al área de Ingeniería de Software al ofrecer una solución escalable y reproducible para la automatización del proceso de traducción, conciliando eficiencia con alta calidad lingüística y estructural.

A pesar de los avances, se observó que los modelos de Large Language Models (LLM) presentaron tiempos de respuesta superiores a los de la MT convencional, lo que indica un compromiso entre velocidad y calidad que puede ajustarse según las necesidades del proyecto. Las tasas de consistencia terminológica, aunque elevadas, aún reflejan las limitaciones inherentes a la traducción automática y a los enfoques basados en RAG para términos altamente dependientes del contexto y del dominio específico, como se señala en la literatura. Sin embargo, la arquitectura de la herramienta, basada en patrones de diseño y principios de bajo acoplamiento, demostró alta escalabilidad y aplicabilidad, permitiendo la fácil integración de nuevos proveedores de LLM y tecnologías de bases de datos vectoriales. Se sugiere que estudios futuros exploren la optimización de los tiempos de respuesta de los modelos de IA y mejoren los mecanismos de RAG para contextos terminológicos aún más complejos, con el objetivo de eliminar inconsistencias residuales y expandir la aplicabilidad de la herramienta a escenarios de mayor escala.

Referencias Bibliográficas

Amazon Web Services [AWS]. n. d. O que é RAG (geração aumentada via recuperação)?. Disponível em: <https://aws.amazon.com/what-is/retrieval-augmented-generation>. Acesso em: 26 janeiro 2026.

Chen, H. et al. 2025. mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data. Disponível em <https://aclanthology.org/2025.findings-acl.433>. Acesso em: 26 janeiro 2026.

Chen, X. et al. 2024. CRAT: A Multi-Agent Framework for Causality-Enhanced Reflective and Retrieval-Augmented Translation with Large Language Models. Disponível em <https://arxiv.org/abs/2410.21067>. Acesso em: 27 outubro 2025.

Copeland, B. J. 2026. Enciclopédia Britannica. Disponível em: <https://www.britannica.com/technology/artificial-intelligence>. Acesso em: 26 janeiro 2026.

Gamma, E. et al. (2000). Padrões de Projeto. Soluções reutilizáveis de software orientado a objetos. 1ed. Bookman, Porto Alegre, RS, Brasil.

McDonough, M. 2026. Enciclopédia Britannica. Disponível em: <https://www.britannica.com/topic/large-language-model>. Acesso em: 26 janeiro 2026.

Naveen, P.; Trojovský, P. 2024. Overview and challenges of machine translation for contextually appropriate translations. iScience. Disponível em: <https://www.sciencedirect.com/science/article/pii/S2589004224021035>. Acesso em: 27 outubro 2025.

Ribeiro, G. C. B. 2005. Tradução e localização de software e outros produtos: audiovisual ou multimídia?. Cadernos de tradução. vol2. no16: 231-250. PUC-Rio, RJ, RJ.

TypeScript. n. d. What is TypeScript?. Disponível em: <https://www.typescriptlang.org/>. Acesso em: 18 abril 2026.

Unicode Consortium [UNICODE]. n.d. Technical Quick Start Guide. Disponível em: <https://home.unicode.org/technical-quick-start-guide/>. Acesso em: 30 setembro 2025.

Artículo originado del Trabajo de Conclusión de Curso de la Especialización en Ingeniería de Software del MBA USP/Esalq

Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy

También te puede interesar

02 de octubre de 2026

Determinantes de la ubicación de supermercados en São Paulo

Un estudio investigó los factores determinantes de la ubicación de supermercados en el estado de São Paulo, con el objetivo de investigar los factores que explican la presencia y expansión de estos establecimientos, considerando dimensiones socioeconómicas, demográficas y de mercado. Se utilizaron datos de los Censos Demográficos de 2010 y 2022 del IBGE y información del Cadastro Nacional de Pessoas Jurídicas de la Receita Federal do Brasil para construir una base de datos georreferenciada. Se aplicó un modelo de clasificación Random Forest, ajustado por grid search con validación cruzada, priorizando la métrica recall-macro debido al desbalanceo de la variable dependiente, que representó la presencia o ausencia de supermercados en un buffer de 50 metros. Los resultados indicaron que la ubicación de supermercados está fuertemente asociada a características demográficas, de ingresos y de población en el entorno. El análisis de importancia de las variables evidenció que factores sociodemográficos, como alfabetización de ancianos, ingresos familiares y la presencia de otros establecimientos de alimentación, ejercieron una influencia significativa, especialmente en el entorno inmediato. Los hallazgos reforzaron la hipótesis de que la distribución espacial de supermercados no es aleatoria, siendo condicionada por características socioeconómicas y por la estructura comercial del territorio, ofreciendo subsidios para decisiones empresariales y planificación urbana.

Palabras clave: Análisis espacial; Aprendizaje automático; Expansión; Ubicación comercial; Supermercados.

Neurociencia Y Aprendizaje En La Educación

02 de octubre de 2026

Educación Antirracista: Prácticas Educativas Inclusivas y Desarrollo Social

La educación antirracista, comprendida como eje estructurante de la educación inclusiva y del desarrollo social, fue investigada en el contexto brasileño. El estudio tuvo como objetivo identificar y analizar, con base en documentos legales y en la percepción de profesores, las prácticas educativas capaces de promover el antirracismo en la escuela y en la sociedad, y cómo la implementación de las Leyes nº 10.639/03 y nº 11.645/08 contribuyó a la justicia social. Se adoptó un enfoque cualitativo y documental, con análisis de legislación educacional, directrices curriculares, informes institucionales y literatura académica. Complementariamente, se aplicó un cuestionario semiestructurado a 295 profesores de Educación Básica. Los datos fueron evaluados cuantitativa y cualitativamente, por medio de análisis de contenido temático, y validados con estudios bibliográficos. Los resultados revelaron una paradoja: a pesar de un marco legal robusto, la implementación de las políticas antirracistas se mostró frágil y puntual, con carencia de formación docente, materiales didácticos adecuados y monitoreo. Se constató la persistencia de desigualdades educacionales significativas entre estudiantes blancos y negros, y la mayoría de los profesores reconoció la ocurrencia de racismo en las escuelas, pero sin protocolos institucionales claros. El análisis neurocientífico demostró que el racismo impacta negativamente el desarrollo cognitivo y emocional de los estudiantes. Se concluyó que la educación antirracista es central para una educación de calidad, exigiendo compromiso político, inversión pública y articulación intersectorial. La integración de la Neurociencia en la formación docente y la producción de materiales cualificados son cruciales para fortalecer el papel de la escuela en la construcción de una sociedad más justa e inclusiva.

Palabras clave: Desarrollo Social; Educación Antirracista; Justicia Social; Ley 10.639/03; Prácticas Educativas Inclusivas.

Neurociencia Y Aprendizaje En La Educación

02 de octubre de 2026

Caminos de la Inclusión: Percepciones de Padres y Profesores sobre la Escolarización de Estudiantes con Doble Excepcionalidad en el Contexto Brasileño

La Doble Excepcionalidad, caracterizada por la coexistencia de Altas Habilidades/Superdotación y trastornos del neurodesarrollo, representa un fenómeno complejo que desafía los modelos tradicionales de identificación y escolarización. El estudio tuvo como objetivo comprender las percepciones de padres o tutores, profesores y otros profesionales de la educación sobre la escolarización de estudiantes con Doble Excepcionalidad en el contexto brasileño, investigando desafíos, estrategias pedagógicas y posibilidades de inclusión basadas en la equidad. La investigación adoptó un enfoque cualitativo, exploratorio y descriptivo, y recopiló datos a través de un cuestionario en línea, voluntario y anónimo, respondido por 25 participantes. Los datos discursivos fueron analizados mediante análisis de contenido temático. Los resultados indicaron que el conocimiento sobre el tema se construye frecuentemente a partir de experiencias personales y profesionales, revelando lagunas en la formación sistematizada. Se identificaron dificultades en la identificación de estos estudiantes, en la formación docente y en la implementación de planes educativos individualizados, flexibilización pedagógica y enriquecimiento curricular. Se relataron repercusiones socioemocionales, como frustración y baja autoestima. Sin embargo, algunas escuelas demostraron prácticas inclusivas fundamentadas en la equidad, articulando necesidades específicas y potencialidades. Aunque los resultados no permiten generalizaciones, evidenciaron la necesidad de fortalecer la formación profesional y la articulación entre escuela, familia y servicios especializados. Se concluyó que la inclusión de estudiantes con Doble Excepcionalidad requiere prácticas que reconozcan simultáneamente sus dificultades y potencialidades, garantizando condiciones equitativas de participación, aprendizaje y desarrollo.

Palabras clave: Desarrollo humano; Formación docente; Inclusión escolar; Neurodivergencia; Prácticas pedagógicas.

02 de octubre de 2026

Modelado predictivo para la gestión de inventarios: aumento de la productividad y la eficiencia en un centro de distribución de alimentos

La gestión eficiente de las operaciones logísticas en centros de distribución es fundamental para la competitividad, especialmente en actividades intensivas en mano de obra, que impactan los costos operativos y el nivel de servicio. El estudio tuvo como objetivo desarrollar y evaluar diferentes modelos de pronóstico de demanda para optimizar la gestión de inventario y recursos en un centro de distribución de alimentos. Para ello, se utilizaron datos históricos de movimiento de un sistema WMS, aplicando modelos de regresión lineal, suavización exponencial de Holt-Winters y el algoritmo LightGBM. Los resultados indicaron que los modelos tradicionales presentaron limitaciones en la captura de la dinámica de la demanda, con un rendimiento inferior al LightGBM. El algoritmo de aprendizaje automático demostró un rendimiento superior, especialmente después de la incorporación de mayor granularidad de los datos y variables temporales, lo que permitió una mayor adherencia a la dinámica de la demanda. La aplicación del modelo resultó en una reducción del 36,38% en el desplazamiento para el pallet picking y del 31,98% para el case picking, totalizando una reducción global del 33,64%. Se concluyó que la utilización de modelos predictivos contribuyó a la mejora de la eficiencia operativa, permitiendo una mejor asignación de recursos y organización de los artículos en el proceso de separación de pedidos.

Palabras clave: Aprendizaje automático; Clasificación ABC; Eficiencia operativa; Logística; Pronóstico de demanda.

02 de octubre de 2026

Transformación de Datos en Estrategia: Investigación Aplicada para la Optimización de Operaciones en Ecoturismo

La creciente demanda en el turismo ecológico en Minas Gerais impulsó la búsqueda de inteligencia de negocios para transformar datos de clientes en información estratégica. El estudio objetivó estructurar un pipeline de ciencia de datos para recolectar, segmentar y clasificar la base de clientes de una operación de ecoturismo, con el fin de optimizar acciones de marketing y anticipar movimientos de mercado. Se realizó una investigación exploratoria, de naturaleza cuali-cuantitativa, por medio de un estudio de caso. Se utilizaron 2.777 registros transaccionales de una empresa de ecoturismo, referentes a enero de 2024 a diciembre de 2025. El proceso metodológico involucró recolección automatizada de datos (API Google Sheets), tratamiento y enriquecimiento (ETL), validación y creación de atributos RFM (Recencia, Frecuencia y Valor Monetario). Se aplicó reducción de dimensionalidad vía PCA y agrupamiento K-Means, con el número de clusters definido por el método del Codo y Silhouette Score. Se validaron los resultados con DBSCAN y K-Medoids. Los resultados revelaron la identificación de tres segmentos comportamentales de clientes: “Fiel”, “Bajo Valor” y “Potencial”. El segmento “Fiel” representó el mayor valor económico acumulado, mientras que el “Potencial” se destacó por el alto ticket promedio y potencial de conversión en recurrencia. La integración de las técnicas de análisis de datos demostró ser un método robusto y replicable para generar inteligencia en el ecoturismo. Se concluyó que el pipeline de ciencia de datos estructurado viabilizó la segmentación comportamental de la base de clientes, la validación estadística de los grupos y la creación de un sistema predictivo para nuevos compradores, proporcionando subsidios para decisiones estratégicas basadas en datos y futuros análisis.

Palabras clave: Clusterización; Inteligencia de negocios; Machine Learning; Segmentación de clientes; Toma de decisiones.

02 de octubre de 2026

Clasificación de clientes morosos mediante técnicas supervisadas de aprendizaje automático

El riesgo de incumplimiento en operaciones de crédito demandó enfoques analíticos para anticipar pérdidas. Este estudio evaluó comparativamente el desempeño de modelos supervisados de aprendizaje automático en la clasificación de clientes incumplidos en operaciones de tarjeta de crédito. Se utilizó la base pública “Default of Credit Card Clients”, de la Universidad de California Irvine, con 30.000 observaciones y desbalanceo de clases. Se emplearon los algoritmos Regresión Logística, Random Forest y Extreme Gradient Boosting. El desbalanceo se trató mediante la asignación de pesos a las clases, y la optimización de los modelos se realizó con el método RandomizedSearchCV, priorizando la sensibilidad. Los resultados de la validación cruzada indicaron que el modelo Extreme Gradient Boosting presentó mayor capacidad de identificación de la clase incumplida y mejor desempeño discriminatorio, seguido por Random Forest y Regresión Logística, con una sensibilidad de 0,8250 y un AUC-ROC de 0,7844 para el XGBoost. El análisis de interpretabilidad, realizado por la técnica Shapley Additive Explanations (SHAP), evidenció la predominancia de variables asociadas al comportamiento de pago, especialmente el historial de retrasos. Se concluyó que los modelos basados en árboles, particularmente técnicas de boosting, se mostraron más adecuados para capturar patrones complejos en los datos, configurándose como alternativas consistentes para la gestión de riesgo de crédito.

Palabras clave: Aprendizaje Automático; Tarjeta de Crédito; Clasificación; Extreme Gradient Boosting; Riesgo de Crédito.

02 de octubre de 2026

Análisis de Sentimientos sobre Bancos Brasileños en Twitter/X: Comparación entre Instituciones Tradicionales y Digitales

Un estudio analizó la percepción pública sobre instituciones financieras brasileñas en la plataforma Twitter/X, resaltando la importancia del monitoreo de sentimientos en redes sociales para la comprensión de la reputación y la experiencia del cliente en el sector bancario. El objetivo consistió en comparar la percepción de los usuarios sobre la imagen y la reputación de bancos tradicionales y digitales, a partir de los patrones de sentimiento identificados en las manifestaciones analizadas, buscando identificar diferencias estructurales entre estos grupos. La metodología se basó en el análisis de 1.096 tweets recopilados entre noviembre de 2022 y junio de 2023. Se utilizaron dos enfoques complementarios de análisis de sentimientos, la suma y la media de las etiquetas, para captar el sentimiento mayoritario y los matices de la percepción. Adicionalmente, se desarrollaron el Modelo de Perfil de Mercado, con indicadores de reputación emocional, riesgo reputacional, neutralidad y polarización, y el Modelo de Clusterización Bancaria, que permitió agrupar las instituciones conforme a patrones de percepción. Los resultados indicaron predominancia de sentimientos neutros y negativos, mayor volumen de interacciones en los bancos digitales y diferencias estructurales en la intensidad emocional de las percepciones, con mayor estabilidad en los bancos digitales y mayor polarización en los tradicionales. Se concluyó que la combinación de técnicas analíticas y estadísticas contribuyó a una comprensión profunda de la imagen institucional en el entorno digital, evidenciando la importancia de estrategias de gestión de la reputación basadas en datos.

Palabras clave: Bancos digitales; Bancos tradicionales; Modelado de datos; Opinion mining; Redes Sociales.

02 de octubre de 2026

Optimización de la planificación presupuestaria anual mediante metodologías de gestión de proyectos

El Plan Presupuestario Anual (POA) es un proceso crucial para traducir la estrategia organizacional en metas operativas y financieras, pero frecuentemente enfrenta presiones de plazos, dependencias interdepartamentales y la repetición de gastos habituales. El estudio objetivó analizar cómo la aplicación combinada de prácticas de gestión de proyectos y del Presupuesto Base Cero (PBC) puede optimizar el POA. Para ello, se desarrolló un estudio de caso en la operación brasileña de una compañía abierta del sector de bebidas, utilizando investigación documental de su informe de resultados de 2023 y un cuestionario anónimo aplicado a 47 encuestados. El análisis documental indicó crecimiento de la receta neta, expansión del margen bruto y del EBITDA ajustado, y avance contenido de los gastos de ventas, generales y administrativos, sugiriendo disciplina de costos y apalancamiento operativo. El relevamiento complementario reveló alta percepción de efecto cascada en el cronograma, fuerte apoyo a la definición de responsables por paquetes de costos y preferencia por justificación técnica de los gastos, además de demanda por flexibilidad controlada tras la definición de la línea base. Se concluyó que la estructuración del POA como proyecto, asociada al rigor del PBC, aumentó la previsibilidad del proceso, reforzó la responsabilidad sobre los gastos y amplió la coherencia entre la ejecución presupuestaria y el desempeño económico-financiero.

Palabras clave: Control de Costos; Eficiencia Operativa; Presupuesto Base Cero; PMBOK; Sector de Bebidas.

02 de octubre de 2026

Innovación en modelos de negocio tradicionales y su impacto en el entorno laboral

El estudio analizó cómo la innovación aplicada en modelos de negocio tradicionales impacta el ambiente de trabajo. Con este objetivo, se realizó una investigación de campo que involucró a 225 profesionales de diferentes sectores y niveles jerárquicos. La recolección de datos se llevó a cabo a través de un cuestionario estructurado, que investigó el perfil, las percepciones y los comportamientos de los participantes en relación con la innovación. Los resultados obtenidos indicaron que los colaboradores de empresas consideradas innovadoras percibieron niveles elevados de innovación, demostraron mayor compromiso, motivación para proponer mejoras y una mejor comprensión de los cambios implementados. En contraste, los profesionales de empresas tradicionales presentaron una percepción de innovación más baja, mayor neutralidad frente a las transformaciones y niveles más elevados de estrés e inseguridad en el ambiente laboral. Se observó, además, que el liderazgo, la comunicación clara, el apoyo y la capacitación adecuada fueron identificados como factores esenciales para facilitar la adaptación a los cambios y aumentar la receptividad de los colaboradores. Se concluyó que la tipología organizacional, asociada a la cultura y a las prácticas de gestión, influye directamente en la forma en que se vive la innovación internamente y sus efectos en el ambiente de trabajo.

Palabras clave: Compromiso; Empresas tradicionales; Gestión del cambio.