Artículo

Ingeniería De Software

09 de octubre de 2026

Uso de la voz junto con grandes modelos de lenguaje como herramienta para la accesibilidad digital

Uso de la Voz junto con Grandes Modelos de Lenguaje como Herramienta para la Accesibilidad Digital

Luiz Gustavo Fernandes Salvador; Ariel da Silva Dias

DOI: 10.22167/2675-6528-202603214

Artículo derivado del Trabajo de Conclusión de Curso (TCC), con contenido basado en el trabajo original del alumno y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege para síntesis y organización textual.

Resumen

El habla es una base esencial para la interacción humana, y para las personas con discapacidad, puede representar la principal forma de comunicación con el entorno externo. Ante la creciente influencia tecnológica, la identificación de comandos de voz ha surgido como una estrategia prometedora para la interacción hombre-máquina. El trabajo exploró cómo la voz, junto con Grandes Modelos de Lenguaje (LLMs), puede ser utilizada de forma eficiente, natural y precisa. Para ello, se emplearon diversos patrones de diseño y el lenguaje Python, buscando una mayor extensibilidad. Se utilizó Gemini como proveedor de LLM, enviando el audio directamente y aprovechando su capacidad de llamada de función para interactuar con el dispositivo. Se desarrolló un sistema capaz de comprender la intención del usuario y convertirla en acciones, cuyo diferencial fue la capacidad de visión computacional basada en capturas de pantalla y un sistema de malla para la orientación del LLM. Las pruebas revelaron una tasa de comprensión de la intención del usuario del 91,81% y una tasa de éxito en la ejecución del 75,45% con el modelo “Flash-3” (top p 0,5 y top k 5). El sistema propuesto validó la premisa de que la integración de LLMs a interfaces de voz aumenta la autonomía de usuarios con discapacidad motora, cumpliendo el propósito de ser una Tecnología Asistiva moderna y eficaz. Sin embargo, se plantearon cuestiones sobre los costos de la IA y la seguridad de los datos del usuario, indicando la necesidad de mejora.

Palabras clave: Llamada de función; Interacción humano-máquina; Reconocimiento de voz; Visión por computadora.

1. Introducción

La comunicación constituye una de las bases fundamentales para la evolución de la especie humana, permitiendo no solo el intercambio de información esencial para la supervivencia, sino también el desarrollo de relaciones sociales y la facilitación de la cooperación (Smith, 2010). Entre las formas más expresivas de comunicación, el habla destaca por su capacidad de transmitir no solo un mensaje, sino también la emoción del locutor (Loan et al., 2022). Al extrapolar la relación hombre-hombre, que impulsó a la sociedad humana a su etapa evolutiva actual, es posible reconocer que la tecnología posibilita la exploración de la voz como una vía para la interacción hombre-máquina (Seaborn et al., 2021).

El avance tecnológico de las últimas décadas es notable, impactando directamente la vida cotidiana, los hábitos y las relaciones sociales. Este impacto se evidencia en el aumento significativo del tiempo promedio dedicado al uso de computadores y smartphones, en comparación con hobbies y actividades offline (Vilhelmson et al., 2017). Muchas de estas interacciones online están ligadas a la socialización y al entretenimiento, con plataformas como YouTube, Instagram y Snapchat figurando entre las más populares, especialmente entre los jóvenes (Dienlin y Johannes, 2020). Adicionalmente, la educación remota experimentó un crecimiento expresivo, particularmente durante y después de la pandemia de COVID-19, con la Enseñanza a Distancia (EaD) pasando del 18,4% de las inscripciones en 2011 al 62,8% una década después (INEP, 2022). Tales transformaciones resaltan la necesidad de desarrollar interfaces más intuitivas e integradoras (Hott y Fraz, 2019), convirtiendo la identificación de comandos de voz en una estrategia prometedora para una interacción hombre-máquina más natural y eficiente (Norda et al., 2024).

En Brasil, aproximadamente 45 millones de habitantes tienen alguna discapacidad, de los cuales el 28,8% enfrentan dificultades motoras (Biblioteca Virtual en Salud Ministerio de Salud, s.f.). Los individuos en estas condiciones pueden tener limitaciones en el acceso a la tecnología, lo que puede dificultar el acceso a información e impactar la vida académica y profesional (Muhammad et al., 2015). En respuesta a estas cuestiones, diversas empresas buscan desarrollar dispositivos o softwares que visan aumentar la compatibilidad de personas con discapacidad en ciertas tareas, conocidas como Tecnologías de Asistencia (Freitas et al., 2022). Sin embargo, en algunos casos, como pacientes con atrofia espinal, tecnologías que solo amplían las capacidades motoras pueden no ser suficientes, exigiendo nuevas estrategias para la inclusión tecnológica de estas personas (Lunn y Wang, 2008).

El intento de utilizar la voz como entrada de datos no es reciente, con ejemplos que se remontan a 1990, como el PlainTalk de Apple (Kumar, 2020). Sin embargo, persisten desafíos como la necesidad de cadencia, lenguaje y terminología específicos, lo que disminuye la naturalidad y dificulta el aprendizaje de estas tecnologías (Rogers et al., 2022). En este contexto, se sugiere la utilización de Large Language Models (LLMs) como intermediarios para transmitir las intenciones del usuario al sistema, lo que reduciría la necesidad de familiaridad con el software y permitiría una interacción más natural entre el hombre y la máquina (Mahmood et al., 2025).

Los Grandes Modelos de Lenguaje, o Large Language Models (LLMs), son modelos de inteligencia artificial (IA) dedicados a la interpretación del lenguaje natural. Sus capacidades abarcan desde el mantenimiento de conversaciones y el análisis de datos hasta la interacción con otros sistemas (Chang et al., 2018). Aunque han ganado protagonismo recientemente, la investigación sobre modelos estadísticos que describen y predicen respuestas en lenguaje natural se remonta a 1950, con Shannon (1948) investigando la capacidad de los modelos Word n-gram para predecir o comprimir el lenguaje (Minaee et al., 2024). Con el advenimiento de internet y la vasta disponibilidad de datos, se ha vuelto viable entrenar estos modelos intensivamente, resultando en mayor versatilidad, precisión e integración eficaz con otros sistemas (Kaddour et al., 2023).

Considerando los factores presentados, se hace necesario el desarrollo de un software capaz de reconocer comandos de voz y utilizar LLMs como herramientas para la interfaz hombre-máquina, posibilitando el uso de aplicaciones por personas con movilidad limitada y promoviendo una mayor integración y accesibilidad en el entorno digital. Así, esta investigación exploró cómo esta tecnología puede ser utilizada de forma eficiente, natural y precisa.

2. Material y Métodos

La investigación se caracterizó como un estudio de desarrollo de software, con un enfoque metodológico centrado en la ingeniería de sistemas y la evaluación de su eficiencia. El objetivo fue crear un sistema de interacción hombre-máquina por voz, utilizando Grandes Modelos de Lenguaje (LLMs) para promover la accesibilidad digital a personas con movilidad reducida. El desarrollo se realizó en el lenguaje Python, elegido por su versatilidad y amplia disponibilidad de bibliotecas (Udrake, 2023; Dhruv et al., 2021).

La arquitectura del software empleó diversos patrones de diseño para garantizar modularidad y extensibilidad. El “Registry Factory” se utilizó para instanciar y retornar clases registradas (Koh, 2020), mientras que el “Strategy” definió comportamientos de clases (Refactoring Guru, n.d.; Peace, 2024). Adicionalmente, un contenedor “Singleton” gestionó el intercambio de variables (Stencel y Wegrzynowicz, 2008), el “Decorator” definió comportamientos comunes (Peng, Zhang y Hu, 2021), el “Command Pattern” permitió la ejecución de funciones por clases con interfaz común (Nuzzi, 2019), y el “Adapter” garantizó la compatibilidad de datos entre LLMs (Nuzzi, 2019).

El sistema se dividió en módulos funcionales. El módulo `config` gestionó las configuraciones del proyecto, persistiendo información en archivos `.ini` a través de `configparser` de Python. Las configuraciones incluyeron el tipo de entrada, definido como “Audio”, el proveedor de LLM, especificado como “Gemini”, y el modelo de LLM, “Gemini-flash-latest”. La interfaz gráfica de usuario (GUI) se desarrolló con `PyQt6` (Willman, 2020), presentando un fondo, icono y campos de texto para interacción, ejecutada en un “Thread” separado.

El módulo `genai` fue responsable de la comunicación con la Inteligencia Artificial, utilizando `google.genai` para adaptar configuraciones, convertir prompts, enviar datos y ejecutar herramientas. Google Gemini fue seleccionado como proveedor de LLM debido a su capacidad para manejar diversos tipos de datos, documentación detallada y costo optimizado por “token” (Salvator, 2025). La funcionalidad de “function calling” de la LLM fue esencial, permitiendo que la IA interpretara la intención del usuario y ejecutara fragmentos de código para interactuar con el dispositivo (Qu et al., 2025; Wang et al., 2026).

Se desarrolló un modelo Pydantic para configurar las LLMs de forma interoperable, abarcando parámetros como clave de API, modelo, instrucciones del sistema, herramientas disponibles, mantenimiento del historial, nivel de pensamiento, modo verboso, número máximo de tokens, `top_p`, `top_k`, temperatura y semilla. Además, se configuraron las definiciones de seguridad de la LLM, que incluyeron categorías como acoso, discurso de odio, contenido sexualmente explícito y peligroso, con un valor predeterminado de “Medio y superior”.

La recolección de datos de entrada fue realizada por el módulo `input_source`, configurado para grabación de audio vía biblioteca `SpeechRecognition` (Amos, n.d.). El proceso involucró la calibración del micrófono para el ruido ambiente y la grabación continua hasta cinco segundos de silencio del usuario, momento en el cual el archivo de audio era guardado. El módulo `input_type` convirtió archivos de audio e imagen a formatos compatibles con la LLM. Las herramientas (`tool`) fueron desarrolladas para ejecutar funciones en el dispositivo, incluyendo acciones sin interacción directa con la pantalla, como preguntar al usuario, presionar teclas y escribir texto.

Para interacciones con la pantalla, se implementó un sistema de visión por computadora, ya que el LLM no proporcionaba coordenadas exactas. Se crearon dos herramientas: “capturar pantalla”, que realizó una captura de la pantalla actual del dispositivo, como se ilustra en la

, y dibujó una malla numerada de 0,0 en la esquina superior izquierda a 14,14 en la esquina inferior derecha, como se presenta en

; y “subdividir captura”, que seleccionó una porción de la malla anterior, la escaló y redibujó una cuadrícula de 15 por 15 [FIGURA 3 y FIGURA 4]. Este método permitió a la IA identificar la ubicación de objetos por celdas de la cuadrícula, posibilitando la interacción del ratón con diversos sistemas.

El flujo de ejecución del algoritmo comenzó con la obtención de la entrada del usuario a través de `input_source` (audio), procesada por `genai` y convertida en un `input_type` para la LLM. La LLM, entonces, procesó los datos y determinó qué herramientas (`tool`) serían llamadas. Este ciclo se repitió hasta la solicitud de interrupción del sistema, como se ilustra en

.

La calidad del software se aseguró mediante pruebas unitarias, que evaluaron componentes y funciones individuales del código. El módulo `Pytest` (Pytest, n.d.) se utilizó para la ejecución de estas pruebas, contribuyendo a la detección temprana de errores y a la reducción del retrabajo (Eisty et al., 2025; Pressman, 2011; Sommerville, 2013). La eficiencia del algoritmo se midió mediante un enfoque basado en tareas, definiendo objetivos reales para los usuarios (ABNT, 2002), como el envío de mensajes en redes sociales, la apertura de vídeos en línea y la redacción de párrafos en software de edición de texto. La elección de estas tareas se basó en actividades populares entre jóvenes en entornos virtuales (Dienlin y Johannes, 2020) y en la relevancia para la integración de alumnos con discapacidad en la enseñanza a distancia.

3. Resultados y Discusión

La implementación de la interfaz gráfica de usuario (GUI) resultó en un entorno de interacción simplificado y objetivo, caracterizado por un fondo transparente. El diseño inicial de la interfaz fue concebido para ser intuitivo, presentando un ícono central, un texto de cuestionario, un texto secundario para detalles y un texto principal para describir la acción en curso. Esta estructura tiene como objetivo proporcionar al usuario una experiencia clara y directa sobre el estado y las acciones del sistema, facilitando la comprensión y el uso, especialmente para personas con movilidad limitada, según el objetivo central del proyecto.

El sistema desarrollado opera a través de un flujo continuo que comienza con la obtención de un comando de voz del usuario, capturado por un módulo de entrada de audio. Este audio se procesa y convierte en un formato comprensible para el Gran Modelo de Lenguaje (LLM) seleccionado, en este caso, Google Gemini. El LLM interpreta la intención del usuario y determina qué herramientas, o “tools”, deben activarse en el dispositivo. Este ciclo de entrada, procesamiento y ejecución de herramientas se repite hasta que el usuario decida finalizar la interacción, garantizando una comunicación fluida y adaptable.

Para permitir la interacción de la inteligencia artificial con la pantalla del ordenador, superando la limitación de los LLMs para devolver coordenadas exactas, se desarrollaron herramientas específicas. La primera, denominada “capturar pantalla”, realiza una captura de la pantalla actual del dispositivo y superpone una malla enumerada, comenzando en el índice 0,0 en la esquina superior izquierda y progresando hasta 14,14 en la esquina inferior derecha. La segunda herramienta, “subdividir captura”, permite seleccionar una porción de esta malla, escalarla y redibujar una nueva cuadrícula de 15 por 15. Este enfoque capacita a la IA para identificar la ubicación de objetos en la pantalla a través de porciones, en lugar de coordenadas precisas, posibilitando el movimiento del ratón al centro de una porción específica y, así, la interacción con diversos sistemas.

Las pruebas de funcionalidad del sistema se realizaron basándose en tareas reales que los usuarios debían intentar lograr, siguiendo la metodología de pruebas unitarias para garantizar la calidad del software. Las tareas incluyeron enviar un mensaje en una red social, abrir un video en línea y redactar un párrafo en un software de edición de texto. La elección de estas tareas reflejó actividades populares entre jóvenes en entornos virtuales, según Dienlin y Johannes (2020), y la propuesta de integrar a estudiantes con discapacidad en la educación a distancia, con el objetivo de validar la eficacia del sistema en escenarios de uso práctico.

Los resultados de las pruebas indicaron que, si bien la mayoría de los intentos tuvieron éxito, hubo momentos en los que la inteligencia artificial necesitó asistencia para completar las tareas, requiriendo información adicional sobre los pasos a seguir. También se observó que la disminución de los parámetros “top p” a 0,5 y “top k” a 5 resultó en una mayor precisión en las respuestas del sistema. Esta optimización de los parámetros es crucial para refinar la capacidad del LLM de tomar decisiones más asertivas y reducir la necesidad de intervención humana.

La elección del modelo “Flash-3” de Gemini para las pruebas estuvo motivada por limitaciones de uso y el alto costo asociado al modelo “Pro-3”. Además, la calidad de la captura de pantalla se redujo a la mitad de la original, sin que esto comprometiera la eficacia de las acciones de la IA. Esta decisión estratégica permitió la realización de un número significativo de pruebas (110 en total) con un costo total de R$ 65,37, proporcionando datos robustos sobre el desempeño del sistema en condiciones controladas y económicamente viables.

El análisis detallado de las pruebas, utilizando el modelo “Flash-3” con `top k 5` y `top p 0.5`, reveló un rendimiento notable en diversas subetapas. Para la tarea de “Enviar mensaje en red social”, la subetapa “Abrir red” obtuvo nueve aciertos y un error, mientras que “Abrir contacto” registró siete aciertos, tres errores y dos alucinaciones con error. La subetapa “Enviar mensaje” alcanzó nueve aciertos y un error. En la tarea de “Abrir video ‘online'”, la subetapa “Abrir navegador” tuvo seis aciertos, cuatro errores y cuatro alucinaciones con error, y dos alucinaciones sin error, indicando desafíos en la navegación inicial.

Continuando el análisis de los resultados para el modelo “Flash-3” con `top k 5` y `top p 0.5`, la subetapa “Abrir red de vídeos” en la tarea de “Abrir vídeo ‘online'” obtuvo diez aciertos y dos alucinaciones sin error. “Buscar vídeo” y “Abrir vídeo” registraron siete aciertos y tres errores cada uno, con tres alucinaciones con error para “Buscar vídeo” y una para “Abrir vídeo”. Para la tarea de “Redactar párrafo en ‘software’ de edición”, las subetapas “Abrir ‘software'” y “Abrir nuevo documento” tuvieron ocho aciertos y dos errores cada una, con una alucinación con error en ambos casos. La subetapa “Escribir texto” alcanzó siete aciertos y tres errores, mientras que “Guardar documento” presentó cinco aciertos y cinco errores, con cuatro alucinaciones con error y una sin error, evidenciando la complejidad de la interacción con el guardado de archivos.

En contraste, las pruebas realizadas con el modelo “Flash-3” configurado con `top k 15` y `top p 0.85` presentaron variaciones en el desempeño. En la tarea de “Enviar mensaje en red social”, la subetapa “Abrir red” obtuvo seis aciertos y cuatro errores, con tres alucinaciones con error y cuatro sin error. “Abrir contacto” mantuvo diez aciertos, sin errores ni alucinaciones. La subetapa “Enviar mensaje” registró ocho aciertos y dos errores, con dos alucinaciones con error. Estos datos sugieren que la alteración de los parámetros de la LLM influye directamente en la capacidad de acierto y la ocurrencia de alucinaciones, impactando la robustez de la interacción.

Continuando con la evaluación del modelo “Flash-3” con `top k 15` y `top p 0.85`, la tarea de “Abrir video ‘online'” mostró que la subetapa “Abrir navegador” obtuvo siete aciertos y tres errores, con dos alucinaciones con error. “Abrir red de videos” registró seis aciertos y cuatro errores, con tres alucinaciones con error y una sin error. “Buscar video” también tuvo seis aciertos y cuatro errores, con tres alucinaciones con error y dos sin error. La subetapa “Abrir video” presentó solo tres aciertos y siete errores, con cinco alucinaciones con error, indicando un rendimiento inferior para estos parámetros en escenarios de navegación y búsqueda de videos.

En la tarea de “Redactar párrafo en ‘software’ de edición” con el modelo “Flash-3” (`top k 15` y `top p 0.85`), la subetapa “Abrir ‘software'” obtuvo ocho aciertos y dos errores, con cuatro alucinaciones sin error. “Abrir nuevo documento” registró nueve aciertos y un error, con una alucinación con error y dos sin error. “Escribir texto” alcanzó nueve aciertos y un error, con una alucinación con error y una sin error. Por último, “Guardar documento” tuvo seis aciertos y cuatro errores, con cuatro alucinaciones con error, reforzando la dificultad persistente en la etapa de guardado, independientemente de los parámetros específicos de la LLM.

La tasa de comprensión de la intención del usuario se calculó sumando los aciertos y las alucinaciones erróneas, dividiendo por el número total de pruebas. Para el modelo “Flash-3” con `top p 0.5` y `top k 5`, la tasa de comprensión de la intención del usuario alcanzó el 91,81%, con una tasa de éxito en la ejecución del 75,45%. Ya con los parámetros `top p 0.85` y `top k 15`, la tasa de comprensión fue ligeramente mayor, 92,72%, pero la tasa de éxito en la ejecución fue menor, 70,90%. Estos resultados demuestran la sensibilidad del rendimiento del sistema a los parámetros de la LLM, indicando que una mayor comprensión de la intención no siempre se traduce en un mayor éxito en la ejecución de las acciones.

La inclusión de inteligencias artificiales generativas en interfaces de voz, según la solución propuesta, otorga mayor autonomía al usuario, eliminando la necesidad de memorizar palabras clave específicas para activar el sistema, un avance en relación con enfoques anteriores (Avuçlu et al., 2023). El sistema demostró ser independiente de la calidad del hardware y de la posición del usuario, requiriendo solo conexión a internet, lo que lo convierte en una solución flexible y accesible (Taher et al., 2021). Además, el trabajo elimina la etapa de entrenamiento previo de la inteligencia artificial, promoviendo una interacción más directa y accesible, a diferencia de investigaciones que demandan esta fase (Mulfari et al., 2021).

Sin embargo, se plantearon algunas consideraciones importantes. La seguridad de los datos del usuario es un punto crítico, ya que la información se transmite a una LLM corporativa, lo que puede permitir su uso para el entrenamiento de la IA, a diferencia de las soluciones que emplean modelos locales y no exponen los datos del usuario (Livero y Santos, 2024). La alta tasa de alucinaciones en la ejecución de las tareas, en contraste con los datos de Mullfari et al. (2021), se atribuyó principalmente a la interacción a través del control directo del ratón, que es más susceptible a errores. Adicionalmente, el alto costo de uso del sistema y la latencia en el procesamiento de la LLM representan desafíos que deben ser ponderados para futuras mejoras.

En resumen, el trabajo validó la premisa de que la integración de Grandes Modelos de Lenguaje a interfaces de voz representa una herramienta eficaz para aumentar la autonomía de usuarios con discapacidad motora, cumpliendo el propósito de ser una Tecnología Asistiva moderna y funcional. La arquitectura modular y las herramientas específicas, como la lógica de cuadrícula para la interacción con la pantalla, fueron cruciales para superar las limitaciones de las LLMs al lidiar con coordenadas exactas. A pesar de los desafíos relacionados con el costo, el tiempo de procesamiento y la seguridad de los datos, los resultados demuestran una alta tasa de comprensión de la intención del usuario y un éxito considerable en la ejecución de tareas, indicando el potencial de la solución y la necesidad de optimizaciones continuas.

4. Conclusión

La presente investigación exploró el uso de la voz junto con Grandes Modelos de Lenguaje (LLMs) como una herramienta eficiente, natural y precisa para la interacción hombre-máquina, con el objetivo de la accesibilidad digital para personas con movilidad limitada. Se verificó el desarrollo de un sistema con una interfaz gráfica simplificada y un flujo continuo de interacción, donde los comandos de voz fueron procesados por LLMs para activar herramientas en el dispositivo. Para superar la limitación de los LLMs en el manejo de coordenadas exactas, se implementó un sistema de visión por computadora basado en capturas de pantalla y una malla enumerada, permitiendo a la inteligencia artificial identificar e interactuar con objetos en la pantalla a través de taludes. Las pruebas de funcionalidad, realizadas con tareas reales, indicaron una tasa de comprensión de la intención del usuario del 91,81% y una tasa de éxito en la ejecución del 75,45% con el modelo “Flash-3” (top p 0,5 y top k 5). Este enfoque validó la premisa de que la integración de LLMs a interfaces de voz aumenta significativamente la autonomía de usuarios con discapacidad motora, estableciéndose como una Tecnología Asistiva moderna y eficaz.

Sin embargo, se identificaron algunas limitaciones importantes que merecen atención en estudios futuros. La seguridad de los datos del usuario, transmitidos a una LLM corporativa, planteó preocupaciones sobre el uso de esta información para el entrenamiento de la IA. También se observó una alta tasa de alucinaciones en la ejecución de las tareas, atribuida principalmente a la interacción a través del control directo del ratón, que resultó ser susceptible a errores. Adicionalmente, el elevado coste de uso del sistema y la latencia en el procesamiento de la LLM representan desafíos a considerar. Por lo tanto, se sugieren mejoras futuras que incluyan la exploración de modelos locales para una mayor privacidad de los datos, la integración de nuevas herramientas para mitigar las alucinaciones y optimizaciones continuas para reducir costes y tiempo de procesamiento, con el objetivo de mejorar la robustez y la viabilidad de la solución.

Referencias Bibliográficas

Dienlin, T.; Johannes, N. 2020. The impact of digital technology use on adolescent well-being. Dialogues in Clinical Neuroscience 22(2): 135-142.

Instituto Nacional de Estudos e Pesquisas Educacionais Anísio Teixeira [INEP]. 2

Seaborn, K.; Miyake, N.P.; Pennefather, P.; Otake-Matsuura, M. 2021. Voice in Human-Agent Interaction: A Survey. ACM Computing Surveys 54: 1-43.

Smith, E.A. 2010. Communication and collective action: language and the evolution of human cooperation. Evolution and human behavior 31(4): 231-245.

Van Loan T.; Le, T.D.T.; Xuan, T.L.; Castelli, E. 2022. Emotional speech recognition using deep neural networks. Sensors 22(4): 1414.

Vilhelmson, B.; Elldér, E.; Thulin, E. 2018. What did we do when the Internet wasn’t around? Variation in free-time activities among three young-adult cohorts from 1990/1991, 2000/2001, and 2010/2011. New Media & Society 20(8): 2898-2916.

Artículo originario del Trabajo de Conclusión de Curso de la Especialización en Ingeniería de Software del MBA USP/Esalq

Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy

También te puede interesar

Ingeniería De Software

09 de octubre de 2026

O papel da densidade de texto instrutivo na eficiência de uma aplicação web.

O desenvolvimento de aplicações web se conecta à experiência do usuário, e este trabalho investigou como o uso excessivo de textos instrutivos pode retardar a conclusão de tarefas e impactar a eficiência da aplicação. O objetivo foi identificar o impacto da densidade textual do conteúdo instrutivo na eficiência de uma aplicação web, utilizando como principal referência a terceira lei de usabilidade de Krug. A pesquisa, de caráter exploratório e delineamento experimental quantitativo, empregou um teste A/B em uma aplicação web responsiva, onde a única variável controlada foi a densidade textual (alta vs. baixa, definida pela contagem de palavras). Participaram 25 usuários, e os dados foram coletados via Datadog RUM, mensurando tempo de conclusão, erros de submissão e taxa de conversão. Os resultados revelaram que a variante com densidade textual reduzida (variante B) apresentou uma taxa de conversão superior (58,3% contra 33,3% da variante A) e um tempo médio de conclusão significativamente menor (1:38 minutos contra 4:58 minutos da variante A), representando um aumento de 67,12% na eficiência. O teste t de Welch (p=0,042) confirmou que a redução da densidade textual impactou a eficiência. Concluiu-se que a redução da densidade textual afeta a eficiência e a taxa de conversão, reforçando a importância de conteúdo objetivo e conciso. Contudo, a baixa densidade textual, por si só, não garantiu o pleno entendimento, sendo essencial a comunicação clara e objetiva das instruções, validando a relevância do UX Writing.

Palavras-chave: Eficiência; Experiência de usuário; Teste A/B; Texto Instrutivo; Usabilidade.

Ingeniería De Software

09 de octubre de 2026

Implementación de sistemas de analítica en entornos de automatización en la industria de procesos

La digitalización de plantas de proceso depende de la recolección y el almacenamiento estructurados de datos, sin los cuales no hay visibilidad de la operación. Se llama analítica industrial a la cadena que recorre estos datos desde la adquisición de la señal en el instrumento de campo, pasando por el almacenamiento ordenado en el tiempo, hasta la disponibilización para análisis y para otros sistemas. Los softwares industriales propietarios cubren hoy esta cadena, y los costos de licenciamiento y mantenimiento restringen su adopción. El estudio tuvo por objetivo arquitectar, implementar y validar un sistema de esta naturaleza, empleando técnicas corrientes de desarrollo de software y componentes sin costo de licenciamiento. El sistema, denominado Sistema de Adquisición y Tratamiento de Información de Proceso (SATIP), se estructuró en tres capas independientes, teniendo como fuente de datos un simulador de reactor farmacéutico que ejecutó una receta de ocho etapas y generó series temporales con variación estocástica. El simulador se escribió en Go, lenguaje adoptado por generar binarios autocontenidos, adecuados a la ejecución en equipos de borde. El almacenamiento utilizó TimescaleDB y la disponibilización se realizó por medio de una interfaz REST con un panel web. El sistema procesó cerca de 414 mil registros por ejecución, con tendencia multivariante, registro de alarmes y correlación temporal entre instrumentos. La arquitectura se mostró reproducible y sin costo de licenciamiento, y la identificación de la degradación exigió solo las lecturas ya almacenadas por el sistema.

Palabras clave: Arquitectura de software; Digitalización; Integración IT/OT; Mantenimiento predictivo; Series temporales.

Ingeniería De Software

09 de octubre de 2026

ReasonGuard: Una Plataforma de Auditoría de Razonamiento para Modelos de Lenguaje Basada en Descomposición Estructurada de Pensamiento

Se presentó ReasonGuard, una plataforma de auditoría de razonamiento de Inteligencia Artificial, desarrollada como middleware de observabilidad entre aplicaciones cliente y modelos de lenguaje a gran escala (LLMs). El trabajo tuvo como objetivo ofrecer transparencia y trazabilidad a los procesos de toma de decisiones basados en IA, abordando la brecha en la operacionalización de técnicas de razonamiento estructurado para fines de auditoría. El sistema interceptó, analizó y documentó interacciones con LLMs a través de cinco módulos fundamentados en los paradigmas Chain-of-Thought (CoT), Tree-of-Thought (ToT) y Graph-of-Thought (GoT). Estos módulos capturaron rastros de razonamiento, detectaron fallas lógicas estructurales, evaluaron la consistencia de las respuestas y generaron informes de auditoría dirigidos a diferentes perfiles de stakeholders. La plataforma se implementó con FastAPI (Python) en el backend, React con TypeScript en el frontend y PostgreSQL como base de datos relacional, siguiendo una arquitectura modularizada con aislamiento multitenancy por usuario. Los resultados demostraron la viabilidad técnica del enfoque propuesto, con los cinco módulos operativos e integrados. Se concluyó que ReasonGuard contribuye a la gobernanza de IA al instrumentalizar paradigmas de razonamiento estructurado como herramientas de observabilidad y auditoría, llenando una laguna en la literatura.

Palabras clave: Auditoría de IA; Chain-of-Thought; Gobernanza de IA; Modelos de Lenguaje a Gran Escala; Transparencia Algorítmica.

Ingeniería De Software

09 de octubre de 2026

EngTT: software para transporte de carga terrestre basado en costos operativos y parámetros ANTT

El transporte por carretera representa la principal modalidad logística de Brasil, con la composición de los costos de flete regulada por la Agencia Nacional de Transportes Terrestres (ANTT). Ante la ausencia de una metodología estructurada para el cálculo de fletes y la dependencia de hojas de cálculo aisladas en el sector, se desarrolló el software EngTT. El objetivo fue crear una herramienta de apoyo a la decisión que integrara variables operativas, calculase el costo total por ruta y comparase los resultados con el piso mínimo de la ANTT, identificando escenarios de no conformidad y compresión de margen antes de la fijación de precios. La metodología adoptada fue aplicada, cuantitativa y experimental, con construcción incremental orientada al concepto de Producto Mínimo Viable (MVP). El sistema se estructuró en tres modos de uso – Montar Ruta Visual, Batch por hoja de cálculo y Scrape de rutas – compartiendo un motor de cálculo desacoplado y parámetros centralizados. Los resultados obtenidos demostraron que el software cumplió el objetivo propuesto, evidenciando variaciones de margen y conformidad regulatoria entre las rutas analizadas. Se observó que rutas de mayor extensión, como Ribeirão Preto × Guarujá, presentaron incremento de costo debido a la necesidad de pernoctaciones adicionales del conductor, mientras que rutas más cortas, como Cajamar × Guarujá, mostraron mayor adherencia al piso regulatorio de la ANTT. Se concluyó que la solución desarrollada es aplicable al sector de transporte por carretera de cargas como herramienta eficaz de fijación de precios y gestión operativa.

Palabras clave: ANTT; Carga contenerizada; Ingeniería de software; Flete por carretera; Python.

Ingeniería De Software

08 de octubre de 2026

Pipeline de datos para el monitoreo de acciones considerando la metodología fundamentalista

El panorama financiero brasileño enfrenta desafíos como el endeudamiento familiar, la baja alfabetización financiera y la descentralización de información para el análisis de inversiones. Ante esto, el objetivo de la investigación consistió en desarrollar un pipeline de datos financieros, fundamentado en buenas prácticas de Ingeniería de Datos, para estructurar, procesar y disponibilizar información relevante que apoyara la toma de decisiones de inversores individuales en el análisis de acciones. Se implementó una arquitectura medallón, utilizando MinIO S3 para almacenamiento en capas bronce, silver y gold, con Delta Lake para gobernanza de datos. Se empleó Apache Spark para procesamiento distribuido, Prometheus para monitoreo y Power BI para visualización analítica. Los datos fueron mayoritariamente demostraciones financieras de la Comisión de Valores Mobiliarios (CVM). Se construyó una cartera teórica de inversiones con base en los principios de Benjamin Graham (2017), aplicando filtros de selección y validación de datos. Los resultados indicaron un retorno positivo del 32,88% para la cartera teórica, superando el índice Ibovespa (4,25%) en el período de 2021 a 2024, aunque inferior a la tasa Selic (46,96%). Cualitativamente, el pipeline procesó conjuntos de datos voluminosos, con reducciones significativas de redundancias, como 99,27% en la tabla BPA y 94,29% en la DRE, tras la aplicación de filtros. Se evidenciaron ganancias en organización, trazabilidad y calidad de los datos, posibilitando análisis financieros estructurados y más robustos.

Palabras clave: Arquitectura Medallón; Ingeniería de Datos; Inversiones; Pipeline de Datos.

Ingeniería De Software

08 de octubre de 2026

Desempeño y Costo Total de Propiedad de Bases de Datos en la Nube e Infraestructura Local

El presente estudio analizó el rendimiento de operaciones de bases de datos en infraestructuras de nube y locales, correlacionando el comportamiento técnico con la proyección del Costo Total de Propiedad. La investigación se caracterizó como un estudio cuantitativo y experimental, en el cual un sistema de pruebas sometió instancias aisladas de bases de datos a cargas progresivas de ejecución, midiendo el impacto de la latencia de red y del consumo computacional. Para el análisis financiero, se elaboró un modelo de inversiones y gastos operativos diluidos en un ciclo de treinta y seis meses. Los resultados técnicos revelaron que la acumulación de la latencia de internet causó una severa degradación del tiempo en las ejecuciones en la nube, a pesar de que la infraestructura remota operaba con alta ociosidad de procesamiento, registrando casi el 98% de inactividad de la CPU. En contrapartida, el entorno local obtuvo un rendimiento superior amparado por la comunicación de red casi instantánea. En el aspecto financiero, la consolidación de los costos demostró un empate empírico entre el modelo de adquisición física y el de suscripción de servicio en un horizonte de tres años, pero el entorno local se mostró más ventajoso en un ciclo de sesenta meses. Se concluyó que la degradación en la nube no provino de la capacidad computacional, sino de la interacción entre la latencia de ruta y el patrón de comunicación unitario de la aplicación. La adopción de la nube exige una optimización profunda de la arquitectura del sistema para minimizar la dependencia de comunicación constante con el servidor remoto. Sin esta modernización, la infraestructura local se consolidó como la estrategia más viable, garantizando alto rendimiento, previsibilidad presupuestaria y soberanía de los datos.

Palabras clave: Gastos operativos (OPEX); Escalabilidad transaccional; Latencia de red; Sistemas legados.

Ingeniería De Software

08 de octubre de 2026

Integración asíncrona Slack-Jira vía “middleware” de colas: comparación de soluciones de “cloud computing”

La latencia y la interoperabilidad entre sistemas corporativos distribuidos constituyeron el problema investigado, motivado por los costos y fragilidades de las integraciones manuales entre plataformas de colaboración y gestión de proyectos. Se desarrolló y validó un “middleware” de integración asíncrona entre Slack y Jira, con el objetivo de reducir el tiempo de respuesta percibido por el usuario y garantizar la estabilidad del sistema bajo carga. La metodología consistió en la construcción de una arquitectura de software orientada a eventos en Python, utilizando los patrones “producer-consumer” y “adapter” para aislar la interfaz del usuario del procesamiento de “backend”. La solución evolucionó hacia una arquitectura agnóstica de nube, basada en funciones “serverless”, y fue sometida a pruebas de estrés en entornos local, de red real y de producción en dos nubes. La arquitectura redujo el tiempo de espera del usuario de una estimación síncrona de 2.000 milisegundos a un promedio local de 8,96 milisegundos. Bajo carga de 50 peticiones simultáneas, ambos proveedores de nube se mostraron viables: Amazon Web Services registró menor latencia promedio en la capa de recepción (951,35 ms) y el doble de rendimiento, mientras que Microsoft Azure ejecutó el procesamiento en segundo plano con una mediana de 113 ms. La aplicación de “optimistic UI” aseguró fluidez de uso, y la nivelación de carga por colas dispensó el sobredimensionamiento de infraestructura. El “middleware” se consolidó como un modelo de referencia corporativa escalable, resiliente y protegido contra el aprisionamiento tecnológico.

Palabras clave: Arquitectura orientada a eventos; Desacoplamiento temporal; Eficiencia operacional; Gestión de servicios de tecnología de la información; Interoperabilidad de sistemas.

Ingeniería De Software

07 de octubre de 2026

Aplicación de Inteligencia Artificial para Análisis de Sentimiento en Mensajes de Texto

El análisis de sentimientos en mensajes de texto de clientes de comercio electrónico es crucial para la toma de decisiones empresariales. Este estudio implementó modelos de inteligencia artificial con el objetivo de comparar su rendimiento en la evaluación de estos mensajes. La metodología consistió en la aplicación de un conjunto de datos de 4664 registros en cuatro experimentos distintos: GPT 3.5 Turbo con Zero-shot, GPT 3.5 Turbo con Few-shot, BERT Multilingual Sentiment y BERTimbau con Fine tuning. Los resultados obtenidos indicaron que el modelo especializado con Fine tuning presentó las mejores métricas de evaluación, una matriz de confusión más consistente y el menor tiempo de procesamiento. En contraste, el modelo BERT Multilingual Sentiment demostró dificultades en la interpretación de textos en idioma portugués. Los experimentos con GPT 3.5 Turbo, particularmente el enfoque Few-shot, se revelaron prometedores, configurándose como una alternativa viable en escenarios donde el Fine tuning no puede ser aplicado. Se concluyó que la estrategia de Fine tuning en modelos pre-entrenados, como el BERTimbau, ofrece ventajas significativas en precisión y eficiencia para el análisis de sentimientos a gran escala.

Palabras clave: Análisis de Sentimientos; Fine Tuning; Inteligencia Artificial; LLM; Procesamiento de Lenguaje Natural.

Ingeniería De Software

05 de octubre de 2026

Uso de IA generativa para selección de base de datos: Un framework orientado a requisitos para la generación de Architecture Decision Records (ADRs)

El crecimiento de aplicaciones intensivas en datos y la adopción de la arquitectura de microservicios han ampliado la necesidad de persistencia políglota, imponiendo una alta carga cognitiva a los arquitectos de software en la elección y justificación de tecnologías de bases de datos. Este trabajo tuvo como objetivo proponer y desarrollar un framework basado en agentes de Inteligencia Artificial (IA) para guiar la selección tecnológica y generar Architecture Decision Records (ADRs) fundamentadas. Se empleó una metodología experimental y aplicada para construir una base de conocimiento técnico. La técnica de Retrieval-Augmented Generation (RAG), junto con las bibliotecas LangChain y LangGraph, se utilizó para orquestar agentes y anclar las respuestas de un Large Language Model (LLM). El framework extrajo requisitos en lenguaje natural, los enriqueció con RAG y los envió al LLM, que generó ADRs para auxiliar en la evaluación de trade-offs teóricos. Los resultados demostraron que el agente con RAG redujo respuestas genéricas, aumentando el fundamento teórico y la trazabilidad. El enfoque RAG demostró su eficacia frente a prompts convencionales (zero-shot), favoreciendo la generación de ADRs con menor nivel de alucinación y alto nivel de trazabilidad teórica. Se concluyó que la herramienta automatizada cumplió la función de mapeo de requisitos, resultando en documentos técnicos empíricamente fundamentados y auxiliando la gobernanza y toma de decisiones en arquitectura de software.

Palabras clave: Bases de datos; Inteligencia Artificial; LangGraph; LLM; RAG.