Artículo

Ingeniería De Software

08 de octubre de 2026

Pipeline de datos para el monitoreo de acciones considerando la metodología fundamentalista

Pipeline de Datos para el Monitoreo de Acciones Considerando la Metodología Fundamentalista

Leonardo Gomes Maciel; Arthur Pinheiro de Araújo Costa

DOI: 10.22167/2675-6528-202603142

Artículo derivado de Trabajo de Fin de Curso (TCC), con contenido basado en el trabajo original del estudiante y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, una solución de inteligencia artificial desarrollada por el Instituto Pecege para la síntesis y organización textual.

Resumen

El panorama financiero brasileño enfrenta desafíos como el endeudamiento familiar, la baja alfabetización financiera y la descentralización de información para el análisis de inversiones. Ante esto, el objetivo de la investigación consistió en desarrollar un pipeline de datos financieros, fundamentado en buenas prácticas de Ingeniería de Datos, para estructurar, procesar y disponibilizar información relevante que apoyara la toma de decisiones de inversores individuales en el análisis de acciones. Se implementó una arquitectura medallón, utilizando MinIO S3 para almacenamiento en capas bronce, silver y gold, con Delta Lake para gobernanza de datos. Se empleó Apache Spark para procesamiento distribuido, Prometheus para monitoreo y Power BI para visualización analítica. Los datos fueron mayoritariamente demostraciones financieras de la Comisión de Valores Mobiliarios (CVM). Se construyó una cartera teórica de inversiones con base en los principios de Benjamin Graham (2017), aplicando filtros de selección y validación de datos. Los resultados indicaron un retorno positivo del 32,88% para la cartera teórica, superando el índice Ibovespa (4,25%) en el período de 2021 a 2024, aunque inferior a la tasa Selic (46,96%). Cualitativamente, el pipeline procesó conjuntos de datos voluminosos, con reducciones significativas de redundancias, como 99,27% en la tabla BPA y 94,29% en la DRE, tras la aplicación de filtros. Se evidenciaron ganancias en organización, trazabilidad y calidad de los datos, posibilitando análisis financieros estructurados y más robustos.

Palabras clave: Arquitectura Medallón; Ingeniería de Datos; Inversiones; Pipeline de Datos.

1. Introducción

El panorama económico brasileño actual está marcado por desafíos significativos, como el aumento del endeudamiento de las familias y la persistente falta de alfabetización financiera. En septiembre de 2025, Brasil registró 78,2 millones de personas en situación de incumplimiento, un crecimiento del 5,6% en relación con el año anterior (Serasa, 2025). Este problema no es reciente y ya ha sido abordado en estudios anteriores que destacan la necesidad de la educación financiera para la calidad de vida de los individuos (Campos, Teixeira y Coutinho, 2015). Organizaciones como la Organización para la Cooperación y el Desarrollo Económico (OCDE) han promovido programas de alfabetización y capacidad financiera, con el objetivo de desarrollar habilidades esenciales para la toma de decisiones fundamentadas (Hoffman; Moro, 2012). Las recomendaciones de la OCDE abarcan temas como planificación financiera personal, seguros, ahorro, inversiones y endeudamiento (Campos; Teixeira; Coutinho, 2015).

En este contexto, la inversión financiera emerge como un tema de gran relevancia. El análisis fundamentalista, tal como presentado por Benjamin Graham (1949) en su obra “El Inversor Inteligente”, propone un método para evaluar empresas basándose en su valor intrínseco, ayudando en la selección de activos sólidos con potencial de crecimiento. Un inversor que adopta el enfoque fundamentalista busca minimizar riesgos al centrarse en activos consolidados en el mercado financiero, considerando el historial y el escenario de la empresa (Freitas, 2020).

A pesar de la importancia de las inversiones, el mercado de capitales presenta complejidades. La Bolsa de Valores de Brasil (B3) cotiza más de 400 acciones, entre ordinarias, preferenciales y units (InfoMoney, 2025). Sin embargo, la información fundamental necesaria para un análisis en profundidad a menudo está descentralizada, lo que exige tiempo y esfuerzo considerables por parte de los inversores (Montóia, 2021). Para superar esta dificultad y garantizar que la información se distribuya de manera eficiente, la implementación de un pipeline de datos se vuelve esencial. Este concepto abarca las etapas desde la extracción de datos brutos de diversas fuentes hasta la carga en su destino (Densmore, 2021), con la elección de las tecnologías variando según el contexto y la madurez del ingeniero de datos.

Ante la necesidad de conocimientos técnicos que abarcan tanto el área de finanzas como la de tecnología, y para mitigar la problemática de la descentralización de la información y apoyar la toma de decisiones de inversores individuales, el objetivo general de este trabajo es desarrollar un pipeline de datos automatizado para el análisis fundamentalista de acciones brasileñas, aplicando la metodología de Benjamin Graham (2019).

2. Material y Métodos

La investigación realizada se caracterizó como una investigación-acción, con un enfoque cuali-cuantitativo, centrada en el desarrollo de un pipeline de datos aplicado al mercado financiero. El objetivo central fue estructurar, procesar y poner a disposición información para apoyar la toma de decisiones de inversores individuales en el análisis fundamentalista de acciones brasileñas. El estudio se limitó a la evaluación del mercado de capitales, sin profundizar en análisis macroeconómicos o microeconómicos sectoriales, según la metodología de Benjamin Graham (2019).

En el ámbito de las inversiones, se adoptó el análisis fundamentalista, que busca evaluar empresas basándose en su valor intrínseco. Para la selección de activos, se aplicaron criterios específicos, como la ausencia de pérdidas en el período analizado, un producto entre Precio/Beneficio (P/B) y Precio/Valor Patrimonial por Acción (P/VPA) inferior a 22,5, la distribución de dividendos y una liquidez corriente no inferior a 1 (Silva, 2020; Assaf, 2018). Estos criterios buscaron identificar empresas sólidas y con potencial de crecimiento, alineadas al perfil de un inversor defensivo.

La metodología de ingeniería de datos implicó la construcción de un pipeline de datos, siguiendo las buenas prácticas del área y la arquitectura medallón (Strengholt, 2025). Esta arquitectura organiza los datos en tres capas distintas: bronce, plata y oro, con el objetivo de mejorar la estructura, calidad y validación de la información a lo largo del proceso. La implementación se realizó utilizando el lenguaje Python 3.11 (Luna, 2025), con el uso de contenedores Docker para garantizar la portabilidad y reproducibilidad del entorno.

La etapa de ingesta de datos, correspondiente a la capa bronce, se centró en la recopilación de información bruta de diversas fuentes. Los datos se extrajeron del sitio web Fundamentus, mediante web scraping, y de la Comisión de Valores Mobiliarios (CVM), a través de descargas de archivos ZIP, abarcando el período de 2020 a 2024. Se utilizó el módulo “ingest.py”, con la superclase “MultiSourceIngestion” y las clases “FundamentusIngestion” y “CVMIngestion”, para gestionar la recopilación y el almacenamiento inicial en MinIO S3.

Los documentos de la CVM incluyeron Formularios de Registro (FCA), Formularios de Estados Financieros Estandarizados (DFP) – que contienen Balance General Activo (BPA), Balance General Pasivo (BPP), Estado de Flujo de Efectivo (DFC-MD y DFC-MI), Estado de Cambios en el Patrimonio Neto (DMPL), Estado de Resultados Integrales (DRA), Estado de Resultados (DRE) y Estado de Valor Agregado (DVA) – y Formularios de Referencia (FRE). Los datos se almacenaron en formato bruto, con codificación original (iso-8859-1) y metadatos en JSON, organizados jerárquicamente por fuente, tipo de archivo, identificadores y fecha de extracción.

En la capa silver, los datos brutos se sometieron a procesos de tratamiento y normalización para garantizar calidad y consistencia. Se utilizó PySpark para el procesamiento distribuido, conectando Python a Spark. Las actividades incluyeron la eliminación de datos duplicados, tratamiento de información nula, estandarización de nomenclatura y formato, y detección de anomalías. Para la validación de la calidad de los datos, se implementó el módulo “run_metrics.py” con la clase “SilverQualityValidator”, que ejecutó verificaciones de integridad y precisión.

Los tratamientos específicos aplicados en la capa silver involucraron la conversión de escala monetaria, normalización de CNPJ, filtrado inteligente para mantener solo cuentas consolidadas relevantes para el análisis fundamentalista, tratamiento de codificación, deduplicación de registros, conversión de tipos de datos (strings a DoubleType y DateType), recorte de espacios y eliminación de líneas vacías. Estas etapas fueron cruciales para refinar los datos y prepararlos para análisis más robustos, eliminando inconsistencias y redundancias.

La capa gold se dedicó al modelado y la puesta a disposición de los datos para el consumo final. Se adoptó el modelado dimensional “Star Schema” (Strengholt, 2025), que organiza los datos en tablas de hechos y dimensiones. Las dimensiones incluyeron tiempo, empresa y tipo de acción, mientras que las tablas de hechos contemplaron balance, capital social, cotización, dividendos y estado de resultados. Para la visualización analítica de la información tratada, se utilizó Power BI Desktop (Ehrenmueller-Jensen, 2024).

Las principales herramientas y bibliotecas de Python empleadas en el desarrollo del pipeline incluyeron MinIO S3 para almacenamiento de objetos, Apache Spark para procesamiento distribuido, Prometheus (Jani, 2024) para monitoreo y observabilidad, y Delta Lake para gobernanza de datos, garantizando transacciones ACID, versionamiento y evolución de esquemas. Otras bibliotecas de Python, como `requests`, `python-dateutil`, `lxml`, `pandas` y `python-dotenv`, fueron utilizadas para extracción, manipulación y gestión de datos.

La construcción de la cartera teórica de inversiones siguió un proceso de filtrado riguroso. Se inició con un universo de 323 empresas, de las cuales 91 estaban listadas en el índice Ibovespa en 2021. Tras la aplicación de los filtros de Benjamin Graham, 47 acciones fueron consideradas elegibles. De estas, se seleccionaron 5 acciones, priorizando la diversificación sectorial. Los datos de cotizaciones medias trimestrales se obtuvieron de la tabla FATO_COTACAO en la capa gold, y los dividendos de la plataforma Status Invest.

Para el cálculo del retorno porcentual de la cartera teórica, se consideró la cotización promedio del primer trimestre de 2021 y la cotización del último día hábil de 2024. Los proventos se contabilizaron con base en el último año del análisis (2024) y se redistribuyeron proporcionalmente a los demás años para uniformizar el tratamiento de los flujos de rendimiento. La fórmula utilizada para el cálculo del retorno porcentual fue: (Precio Promedio de la Acción en el año de análisis – Precio de la Acción en el último año analizado + (cantidad de años analizadas * Proventos del último año analizado)) / Precio de la Acción en el último año analizado.

3. Resultados y Discusión

La presente sección detalla los resultados obtenidos con el desarrollo y la aplicación de un pipeline de datos financieros, concebido para estructurar, procesar y disponibilizar información crucial para el análisis fundamentalista de acciones brasileñas. El estudio demostró la eficacia de la arquitectura implementada tanto en la organización y calidad de los datos como en el soporte a la toma de decisiones de inversores individuales, conforme a la metodología de Benjamin Graham (2019). Los hallazgos cuantitativos y cualitativos evidencian ganancias significativas en trazabilidad, consistencia y capacidad analítica, superando desafíos inherentes a la descentralización de información en el mercado de capitales.

La arquitectura del pipeline se concibió siguiendo el patrón medallón, que organiza los datos en capas distintas: bronce, plata y oro, dentro de un entorno de data lakehouse. Este enfoque tiene como objetivo mejorar progresivamente la estructura, calidad y validación de la información desde su forma bruta hasta la etapa de refinamiento para el consumo analítico (STRENGHOLT, 2025). La implementación utilizó contenedores Docker para asegurar portabilidad y reproducibilidad, integrando herramientas esenciales del ciclo de vida de la ingeniería de datos, como Python para la ingesta, MinIO para el almacenamiento de objetos, Apache Spark para el procesamiento distribuido y Prometheus para la observabilidad.

La etapa de ingesta de datos, correspondiente a la capa bronce, se centró en la recopilación de información de dos fuentes principales: el sitio web Fundamentus y la Comisión de Valores Mobiliarios (CVM). Los datos de Fundamentus, obtenidos a través de web scraping, y los de la CVM, mediante descargas de archivos ZIP, se almacenaron en su forma bruta (“as-is”) en MinIO S3, preservando la codificación original y acompañados de metadatos detallados. Estos metadatos, organizados en un diccionario, incluían la fuente, tipo de activo, fecha y hora de extracción, detalles técnicos de la solicitud HTTP, formato y tamaño del archivo, y la versión del ingestor, garantizando la trazabilidad y auditoría (STRENGHOLT, 2025).

La organización de los directorios en la capa bronce se estructuró jerárquicamente, considerando la fuente de ingesta, el tipo de archivo, identificadores por acción o año del documento, y la fecha y hora de la extracción. Este enfoque permitió una gestión eficiente de los datos brutos y la posibilidad de reprocesamientos puntuales. Sin embargo, se observó que el acceso al historial de balances financieros del sitio Fundamentus se volvió inviable debido a la implementación de un sistema de captcha, lo que imposibilitó su uso continuo en el script de ingesta.

En contraste, la CVM demostró ser una fuente robusta y viable, disponibilizando datos consolidados de balances financieros segmentados por año y permitiendo automatizaciones. Los documentos almacenados en la capa bronce del MinIO incluyeron Información Catastral (CNPJ, fecha de registro), Formularios Catastrales (FCA) con códigos de negociación, y Formularios de Demostraciones Financieras Estandarizadas (DFP). Estos últimos abarcan Balance Patrimonial Activo (BPA), Balance Patrimonial Pasivo (BPP), Demostraciones de Flujo de Caja (DFC-MD y DFC-MI), Demostración de las Variaciones del Patrimonio Neto (DMPL), Demostración del Resultado Integral (DRA), Demostración del Resultado (DRE) y Demostración del Valor Agregado (DVA), además del Formulario de Referencia (FRE) con información exhaustiva sobre el emisor.

El tratamiento de los datos y el procesamiento distribuido ocurrieron en la capa silver, donde la clase `CVMSilverProcessor` utilizó PySpark para transformar los datos brutos. Este paso fue fundamental para resolver inconsistencias y redundancias presentes en los datos de la CVM. Muchas demostraciones financieras, por ejemplo, presentaban resultados duplicados para el año de referencia y el año anterior, lo que generaba información redundante y cálculos inconsistentes. La exclusión de esta información duplicada en la capa silver resultó en ahorro de espacio y mayor consistencia de los datos para análisis futuros.

La eficiencia del script de tratamiento de datos en la capa silver se cuantificó mediante métricas de calidad. En la tabla DRE, de las 32644 líneas originales en la capa bronze, se mantuvieron 1864 líneas en la capa silver, lo que representa una reducción del 94,29%. Para la tabla BPA, de 60741 líneas, se preservaron 444, lo que indica una reducción del 99,27%. De manera similar, en la tabla BPP, de 104017 líneas, se mantuvieron 910, lo que resultó en una reducción del 99,13%. Estos resultados demuestran la capacidad del pipeline para eliminar redundancias y datos irrelevantes, optimizando el volumen de información para el análisis.

Otros conjuntos de datos también presentaron reducciones significativas: el volumen de valores mobiliarios tuvo una reducción del 51,62% (de 4636 a 2243 líneas), y el capital social, del 65,70% (de 3606 a 1237 líneas). En contrapartida, el conjunto de datos de distribución de dividendos mantuvo su volumen integral (1503 líneas), sugiriendo una consistencia intrínseca desde el origen. El análisis comparativo entre las capas bronce y silver, por lo tanto, no solo evidencia la reducción de volumen, sino también la garantía de la confiabilidad de las informaciones presentadas para las etapas subsecuentes de análisis.

En la capa gold, para la carga y disponibilidad de los datos al usuario final, se adoptó el modelado dimensional conocido como “Star Schema”. Este patrón es ampliamente utilizado en Business Intelligence para facilitar la visualización analítica y el desarrollo de dashboards, como el implementado en Power BI. Los datos se organizaron en tablas de dimensión, como `DIM_TEMPO` para control temporal, `DIM_EMPRESA` para categorización de las acciones y `DIM_TIPO_ACAO` para los códigos del mercado financiero. Las tablas de hechos, a su vez, incluyeron `FATO_BALANÇO` (activos y pasivos circulantes, patrimonio neto), `FATO_CAPITAL_SOCIAL` (cantidad de acciones ordinarias y preferenciales), `FATO_COTACAO` (valores monetarios de compra de acciones) y `FATO_DIVIDENDOS` y `FATO_DRE` para cálculos de lucro neto y proventos.

La construcción de la cartera teórica de inversiones siguió la metodología de Benjamin Graham (2019), enfocándose en un inversor defensivo. Inicialmente, de las 323 empresas negociadas en 2021, según datos de la CVM, 91 estaban listadas en el Ibovespa del mismo año. La aplicación de los filtros de Graham, que incluían criterios como P/L x P/VP inferior a 22,5, liquidez corriente no inferior a 1, ausencia de pérdidas y distribución de dividendos, resultó en 47 acciones elegibles. Para diversificar la cartera y mitigar riesgos, se seleccionaron cinco acciones: ELETROBRAS (AXIA3), PORTO SEGURO AS (PSSA3), MARFRIG (MBRF3), SIMPAR S.A (SIMH3) y BRASILAGRO (AGRO3).

El retorno porcentual de la cartera teórica se calculó considerando la cotización promedio de las acciones en el primer trimestre de 2021 y en el último día hábil de 2024, además de los proventos distribuidos en el último año del análisis (2024), redistribuidos proporcionalmente para estandarización metodológica. La fórmula utilizada fue: Retorno (%) = (Precio Promedio de la Acción en el año de análisis – Precio de la Acción en el último año analizado + (cantidad de años analizadas * sumatoria de proventos del último año analizado)) / Precio de la Acción en el último año analizado. Este cálculo permitió una evaluación consistente del desempeño de la cartera a lo largo del período.

Los resultados financieros de la cartera teórica, en el período de enero de 2021 a diciembre de 2024, indicaron un retorno positivo del 32,88%. En comparación, el índice Ibovespa registró un retorno del 4,25% en el mismo período, mientras que la tasa Selic acumulada alcanzó el 46,96%. La cartera teórica, por lo tanto, superó significativamente al Ibovespa, demostrando la eficacia de la metodología de Graham en la selección de activos con potencial de valorización. Sin embargo, el retorno de la cartera quedó por debajo de la tasa Selic, que presentó un desempeño superior en el período analizado.

La volatilidad del mercado en el período de 2021 a 2024, influenciada por eventos como la pandemia de COVID-19, puede explicar la diferencia en relación con la Selic. La tasa Selic, que varió de 1,90% en 2021 a 12,15% en 2024, refleja un escenario atípico de intereses altos, convirtiéndose en una opción de inversión más rentable en comparación con la cartera de acciones. Es importante resaltar que los indicadores fundamentalistas, aunque útiles, no garantizan retornos futuros y deben ser complementados por un análisis macro y microeconómico más amplio, además de una diversificación adecuada del portafolio, evitando la asignación del 100% de los recursos en acciones (GRAHAM, 2019).

En resumen, el pipeline de datos desarrollado cumplió plenamente los objetivos propuestos, consolidando información de diversas empresas y segmentándola según la arquitectura medallion. Esto permitió el análisis tanto de datos brutos como de datos tratados, facilitando la identificación de inconsistencias y mejorando la calidad de la información. La cartera teórica, construida con base en la metodología de Benjamin Graham, demostró un retorno superior al Ibovespa, validando el enfoque fundamentalista como una herramienta valiosa para inversores individuales, a pesar de haber sido superada por la tasa Selic en un período de mercado atípico.

4. Conclusión

El presente estudio tuvo como objetivo desarrollar un pipeline de datos financieros automatizado para el análisis fundamentalista de acciones brasileñas, aplicando la metodología de Benjamin Graham. Se verificó la implementación exitosa de una arquitectura medallón, que utilizó MinIO S3 para almacenamiento en capas bronce, silver y gold, Apache Spark para procesamiento distribuido, Prometheus para monitoreo y Power BI para visualización analítica. Los datos, mayoritariamente demostraciones financieras de la CVM, fueron procesados con ganancias significativas en organización, trazabilidad y calidad, evidenciadas por reducciones de redundancias del 99,27% en la tabla BPA y 94,29% en la DRE. La cartera teórica de inversiones, construida con base en los principios de Graham, presentó un retorno positivo del 32,88% en el período de 2021 a 2024, superando el índice Ibovespa (4,25%) y demostrando la viabilidad del enfoque fundamentalista para inversores individuales.

A pesar de los resultados prometedores, el estudio enfrentó limitaciones, como la inviabilidad de acceso a datos históricos del sitio Fundamentus debido a sistemas de captcha, lo que restringió las fuentes de ingesta. Adicionalmente, aunque la cartera teórica superó al Ibovespa, su retorno fue inferior a la tasa Selic (46,96%) en el período analizado, un escenario influenciado por altas tasas de interés y volatilidad atípica del mercado, reforzando que los indicadores fundamentalistas deben complementarse con análisis macroeconómicos y diversificación. Para estudios futuros, se sugiere la implementación de un orquestador para la programación automatizada y la incorporación de Grafana para la visualización de métricas, con el objetivo de mejorar la observabilidad. Se recomienda también la expansión de la aplicación del pipeline a otros mercados de capitales, como acciones internacionales, fondos inmobiliarios y criptoactivos, y la integración con fuentes de datos adicionales, como B3.

Referencias Bibliográficas

ASSAF NETO, Alexandre. Mercado financeiro. 14. ed. São Paulo: Atlas, 2018. ISBN-978-85-97-01805-9.

CAMPOS, Celso Ribeiro; TEIXEIRA, James; COUTINHO, Cileda de Queiroz e Silva. Reflexões sobre a educação financeira e suas interfaces com a educação matemática e a educação crítica. Educação Matemática em Pesquisa, São Paulo, v. 17, n. 3, p. 556–577, 2015. III Fórum de Discussão: Parâmetros Balizadores da Pesquisa em Educação Matemática no Brasil.

DENSMORE, James. Data pipelines pocket reference: moving and processing data for analytics. 1. ed. Sebastopol: O’Reilly Media, 2021.

EHRENMUELLER-JENSEN, Markus. Data Modeling with Microsoft Power BI. Sebastopol: O’Reilly Media, 2024.

FREITAS, Lucas Catunda de. Uma análise fundamentalista do setor bancário: um estudo de caso com uma seleção de indicadores. 2020. Trabalho de Conclusão de Curso (Graduação em Finanças) Universidade Federal do Ceará, Faculdade de Economia, Administração, Atuária e Contabilidade, Fortaleza, 2020.

GRAHAM, Benjamin. O investidor inteligente. São Paulo: HarperCollins, 2019.

Hoffman; Moro, 2012 [Referência completa não encontrada no documento original]

INFOMONEY. Ações B3: cotação de hoje. Disponível em: https://www.infomoney.com.br/cotacoes/b3/acao/. Acesso em: 17 set. 2025.

JANI, Yash. Unified Monitoring for Microservices: Implementing Prometheus and Grafana for Scalable Solutions. Journal of Artificial Intelligence, Machine Learning and Data Science, v. 2, n. 1, 2024. ISSN 2583-9888. DOI: https://doi.org/10.51219/JAIMLD/yash-jani/206.Disponível em: https://urfpublishers.com/journal/artificial-intelligence. Acesso em: 5 fev. 2026.

LUNA, Pedro Henrique Santiago de. Pipeline de dados para análise epidemiológica de casos sobre transtornos mentais relacionados ao trabalho no Brasil. Trabalho de Conclusão de Curso (Bacharelado em Sistemas de Informação) – Universidade Federal de Pernambuco, Recife, 2025.

Montóia, 2021 [Referência completa não encontrada no documento original]

Serasa, 2025 [Referência completa não encontrada no documento original]

SILVA JÚNIOR, João Fernandes da. Aplicação das estratégias de Benjamin Graham no mercado acionário brasileiro. 2020. Trabalho de Conclusão de Curso (Graduação em Ciências Contábeis) Faculdade de Ciências Contábeis, Universidade Federal de Uberlândia, Uberlândia, 2020.

STRENGHOLT, Piethein. Building medallion architectures. Sebastopol, CA: O’Reilly Media, 2025.

Artículo originado del Trabajo de Conclusión de Curso de la Especialización en Ingeniería de Software del MBA USP/Esalq

Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy

También te puede interesar

Ingeniería De Software

09 de octubre de 2026

O papel da densidade de texto instrutivo na eficiência de uma aplicação web.

O desenvolvimento de aplicações web se conecta à experiência do usuário, e este trabalho investigou como o uso excessivo de textos instrutivos pode retardar a conclusão de tarefas e impactar a eficiência da aplicação. O objetivo foi identificar o impacto da densidade textual do conteúdo instrutivo na eficiência de uma aplicação web, utilizando como principal referência a terceira lei de usabilidade de Krug. A pesquisa, de caráter exploratório e delineamento experimental quantitativo, empregou um teste A/B em uma aplicação web responsiva, onde a única variável controlada foi a densidade textual (alta vs. baixa, definida pela contagem de palavras). Participaram 25 usuários, e os dados foram coletados via Datadog RUM, mensurando tempo de conclusão, erros de submissão e taxa de conversão. Os resultados revelaram que a variante com densidade textual reduzida (variante B) apresentou uma taxa de conversão superior (58,3% contra 33,3% da variante A) e um tempo médio de conclusão significativamente menor (1:38 minutos contra 4:58 minutos da variante A), representando um aumento de 67,12% na eficiência. O teste t de Welch (p=0,042) confirmou que a redução da densidade textual impactou a eficiência. Concluiu-se que a redução da densidade textual afeta a eficiência e a taxa de conversão, reforçando a importância de conteúdo objetivo e conciso. Contudo, a baixa densidade textual, por si só, não garantiu o pleno entendimento, sendo essencial a comunicação clara e objetiva das instruções, validando a relevância do UX Writing.

Palavras-chave: Eficiência; Experiência de usuário; Teste A/B; Texto Instrutivo; Usabilidade.

Ingeniería De Software

09 de octubre de 2026

Implementación de sistemas de analítica en entornos de automatización en la industria de procesos

La digitalización de plantas de proceso depende de la recolección y el almacenamiento estructurados de datos, sin los cuales no hay visibilidad de la operación. Se llama analítica industrial a la cadena que recorre estos datos desde la adquisición de la señal en el instrumento de campo, pasando por el almacenamiento ordenado en el tiempo, hasta la disponibilización para análisis y para otros sistemas. Los softwares industriales propietarios cubren hoy esta cadena, y los costos de licenciamiento y mantenimiento restringen su adopción. El estudio tuvo por objetivo arquitectar, implementar y validar un sistema de esta naturaleza, empleando técnicas corrientes de desarrollo de software y componentes sin costo de licenciamiento. El sistema, denominado Sistema de Adquisición y Tratamiento de Información de Proceso (SATIP), se estructuró en tres capas independientes, teniendo como fuente de datos un simulador de reactor farmacéutico que ejecutó una receta de ocho etapas y generó series temporales con variación estocástica. El simulador se escribió en Go, lenguaje adoptado por generar binarios autocontenidos, adecuados a la ejecución en equipos de borde. El almacenamiento utilizó TimescaleDB y la disponibilización se realizó por medio de una interfaz REST con un panel web. El sistema procesó cerca de 414 mil registros por ejecución, con tendencia multivariante, registro de alarmes y correlación temporal entre instrumentos. La arquitectura se mostró reproducible y sin costo de licenciamiento, y la identificación de la degradación exigió solo las lecturas ya almacenadas por el sistema.

Palabras clave: Arquitectura de software; Digitalización; Integración IT/OT; Mantenimiento predictivo; Series temporales.

Ingeniería De Software

09 de octubre de 2026

Uso de la voz junto con grandes modelos de lenguaje como herramienta para la accesibilidad digital

El habla es una base esencial para la interacción humana y, para las personas con discapacidad, puede representar la principal forma de comunicación con el entorno externo. Dada la creciente influencia tecnológica, la identificación de comandos de voz ha surgido como una estrategia prometedora para la interacción hombre-máquina. El trabajo exploró cómo la voz, junto con los Grandes Modelos de Lenguaje (LLMs), puede ser utilizada de manera eficiente, natural y precisa. Para ello, se emplearon diversos patrones de diseño y el lenguaje Python, buscando una mayor extensibilidad. Se utilizó Gemini como proveedor de LLM, enviando el audio directamente y aprovechando su capacidad de llamada de función para interactuar con el dispositivo. Se desarrolló un sistema capaz de comprender la intención del usuario y convertirla en acciones, cuyo diferencial fue la capacidad de visión computacional basada en capturas de pantalla y un sistema de malla para la orientación del LLM. Las pruebas revelaron una tasa de comprensión de la intención del usuario del 91,81% y una tasa de éxito en la ejecución del 75,45% con el modelo “Flash-3” (top p 0,5 y top k 5). El sistema propuesto validó la premisa de que la integración de LLMs a interfaces de voz aumenta la autonomía de usuarios con discapacidad motora, cumpliendo el propósito de ser una Tecnología Asistiva moderna y eficaz. Sin embargo, se plantearon cuestiones sobre los costos de la IA y la seguridad de los datos del usuario, indicando la necesidad de mejora.

Palabras clave: Llamada de función; Interacción hombre-máquina; Reconocimiento de voz; Visión computacional.

Ingeniería De Software

09 de octubre de 2026

ReasonGuard: Una Plataforma de Auditoría de Razonamiento para Modelos de Lenguaje Basada en Descomposición Estructurada de Pensamiento

Se presentó ReasonGuard, una plataforma de auditoría de razonamiento de Inteligencia Artificial, desarrollada como middleware de observabilidad entre aplicaciones cliente y modelos de lenguaje a gran escala (LLMs). El trabajo tuvo como objetivo ofrecer transparencia y trazabilidad a los procesos de toma de decisiones basados en IA, abordando la brecha en la operacionalización de técnicas de razonamiento estructurado para fines de auditoría. El sistema interceptó, analizó y documentó interacciones con LLMs a través de cinco módulos fundamentados en los paradigmas Chain-of-Thought (CoT), Tree-of-Thought (ToT) y Graph-of-Thought (GoT). Estos módulos capturaron rastros de razonamiento, detectaron fallas lógicas estructurales, evaluaron la consistencia de las respuestas y generaron informes de auditoría dirigidos a diferentes perfiles de stakeholders. La plataforma se implementó con FastAPI (Python) en el backend, React con TypeScript en el frontend y PostgreSQL como base de datos relacional, siguiendo una arquitectura modularizada con aislamiento multitenancy por usuario. Los resultados demostraron la viabilidad técnica del enfoque propuesto, con los cinco módulos operativos e integrados. Se concluyó que ReasonGuard contribuye a la gobernanza de IA al instrumentalizar paradigmas de razonamiento estructurado como herramientas de observabilidad y auditoría, llenando una laguna en la literatura.

Palabras clave: Auditoría de IA; Chain-of-Thought; Gobernanza de IA; Modelos de Lenguaje a Gran Escala; Transparencia Algorítmica.

Ingeniería De Software

09 de octubre de 2026

EngTT: software para transporte de carga terrestre basado en costos operativos y parámetros ANTT

El transporte por carretera representa la principal modalidad logística de Brasil, con la composición de los costos de flete regulada por la Agencia Nacional de Transportes Terrestres (ANTT). Ante la ausencia de una metodología estructurada para el cálculo de fletes y la dependencia de hojas de cálculo aisladas en el sector, se desarrolló el software EngTT. El objetivo fue crear una herramienta de apoyo a la decisión que integrara variables operativas, calculase el costo total por ruta y comparase los resultados con el piso mínimo de la ANTT, identificando escenarios de no conformidad y compresión de margen antes de la fijación de precios. La metodología adoptada fue aplicada, cuantitativa y experimental, con construcción incremental orientada al concepto de Producto Mínimo Viable (MVP). El sistema se estructuró en tres modos de uso – Montar Ruta Visual, Batch por hoja de cálculo y Scrape de rutas – compartiendo un motor de cálculo desacoplado y parámetros centralizados. Los resultados obtenidos demostraron que el software cumplió el objetivo propuesto, evidenciando variaciones de margen y conformidad regulatoria entre las rutas analizadas. Se observó que rutas de mayor extensión, como Ribeirão Preto × Guarujá, presentaron incremento de costo debido a la necesidad de pernoctaciones adicionales del conductor, mientras que rutas más cortas, como Cajamar × Guarujá, mostraron mayor adherencia al piso regulatorio de la ANTT. Se concluyó que la solución desarrollada es aplicable al sector de transporte por carretera de cargas como herramienta eficaz de fijación de precios y gestión operativa.

Palabras clave: ANTT; Carga contenerizada; Ingeniería de software; Flete por carretera; Python.

Ingeniería De Software

08 de octubre de 2026

Desempeño y Costo Total de Propiedad de Bases de Datos en la Nube e Infraestructura Local

El presente estudio analizó el rendimiento de operaciones de bases de datos en infraestructuras de nube y locales, correlacionando el comportamiento técnico con la proyección del Costo Total de Propiedad. La investigación se caracterizó como un estudio cuantitativo y experimental, en el cual un sistema de pruebas sometió instancias aisladas de bases de datos a cargas progresivas de ejecución, midiendo el impacto de la latencia de red y del consumo computacional. Para el análisis financiero, se elaboró un modelo de inversiones y gastos operativos diluidos en un ciclo de treinta y seis meses. Los resultados técnicos revelaron que la acumulación de la latencia de internet causó una severa degradación del tiempo en las ejecuciones en la nube, a pesar de que la infraestructura remota operaba con alta ociosidad de procesamiento, registrando casi el 98% de inactividad de la CPU. En contrapartida, el entorno local obtuvo un rendimiento superior amparado por la comunicación de red casi instantánea. En el aspecto financiero, la consolidación de los costos demostró un empate empírico entre el modelo de adquisición física y el de suscripción de servicio en un horizonte de tres años, pero el entorno local se mostró más ventajoso en un ciclo de sesenta meses. Se concluyó que la degradación en la nube no provino de la capacidad computacional, sino de la interacción entre la latencia de ruta y el patrón de comunicación unitario de la aplicación. La adopción de la nube exige una optimización profunda de la arquitectura del sistema para minimizar la dependencia de comunicación constante con el servidor remoto. Sin esta modernización, la infraestructura local se consolidó como la estrategia más viable, garantizando alto rendimiento, previsibilidad presupuestaria y soberanía de los datos.

Palabras clave: Gastos operativos (OPEX); Escalabilidad transaccional; Latencia de red; Sistemas legados.

Ingeniería De Software

08 de octubre de 2026

Integración asíncrona Slack-Jira vía “middleware” de colas: comparación de soluciones de “cloud computing”

La latencia y la interoperabilidad entre sistemas corporativos distribuidos constituyeron el problema investigado, motivado por los costos y fragilidades de las integraciones manuales entre plataformas de colaboración y gestión de proyectos. Se desarrolló y validó un “middleware” de integración asíncrona entre Slack y Jira, con el objetivo de reducir el tiempo de respuesta percibido por el usuario y garantizar la estabilidad del sistema bajo carga. La metodología consistió en la construcción de una arquitectura de software orientada a eventos en Python, utilizando los patrones “producer-consumer” y “adapter” para aislar la interfaz del usuario del procesamiento de “backend”. La solución evolucionó hacia una arquitectura agnóstica de nube, basada en funciones “serverless”, y fue sometida a pruebas de estrés en entornos local, de red real y de producción en dos nubes. La arquitectura redujo el tiempo de espera del usuario de una estimación síncrona de 2.000 milisegundos a un promedio local de 8,96 milisegundos. Bajo carga de 50 peticiones simultáneas, ambos proveedores de nube se mostraron viables: Amazon Web Services registró menor latencia promedio en la capa de recepción (951,35 ms) y el doble de rendimiento, mientras que Microsoft Azure ejecutó el procesamiento en segundo plano con una mediana de 113 ms. La aplicación de “optimistic UI” aseguró fluidez de uso, y la nivelación de carga por colas dispensó el sobredimensionamiento de infraestructura. El “middleware” se consolidó como un modelo de referencia corporativa escalable, resiliente y protegido contra el aprisionamiento tecnológico.

Palabras clave: Arquitectura orientada a eventos; Desacoplamiento temporal; Eficiencia operacional; Gestión de servicios de tecnología de la información; Interoperabilidad de sistemas.

Ingeniería De Software

07 de octubre de 2026

Aplicación de Inteligencia Artificial para Análisis de Sentimiento en Mensajes de Texto

El análisis de sentimientos en mensajes de texto de clientes de comercio electrónico es crucial para la toma de decisiones empresariales. Este estudio implementó modelos de inteligencia artificial con el objetivo de comparar su rendimiento en la evaluación de estos mensajes. La metodología consistió en la aplicación de un conjunto de datos de 4664 registros en cuatro experimentos distintos: GPT 3.5 Turbo con Zero-shot, GPT 3.5 Turbo con Few-shot, BERT Multilingual Sentiment y BERTimbau con Fine tuning. Los resultados obtenidos indicaron que el modelo especializado con Fine tuning presentó las mejores métricas de evaluación, una matriz de confusión más consistente y el menor tiempo de procesamiento. En contraste, el modelo BERT Multilingual Sentiment demostró dificultades en la interpretación de textos en idioma portugués. Los experimentos con GPT 3.5 Turbo, particularmente el enfoque Few-shot, se revelaron prometedores, configurándose como una alternativa viable en escenarios donde el Fine tuning no puede ser aplicado. Se concluyó que la estrategia de Fine tuning en modelos pre-entrenados, como el BERTimbau, ofrece ventajas significativas en precisión y eficiencia para el análisis de sentimientos a gran escala.

Palabras clave: Análisis de Sentimientos; Fine Tuning; Inteligencia Artificial; LLM; Procesamiento de Lenguaje Natural.

Ingeniería De Software

05 de octubre de 2026

Uso de IA generativa para selección de base de datos: Un framework orientado a requisitos para la generación de Architecture Decision Records (ADRs)

El crecimiento de aplicaciones intensivas en datos y la adopción de la arquitectura de microservicios han ampliado la necesidad de persistencia políglota, imponiendo una alta carga cognitiva a los arquitectos de software en la elección y justificación de tecnologías de bases de datos. Este trabajo tuvo como objetivo proponer y desarrollar un framework basado en agentes de Inteligencia Artificial (IA) para guiar la selección tecnológica y generar Architecture Decision Records (ADRs) fundamentadas. Se empleó una metodología experimental y aplicada para construir una base de conocimiento técnico. La técnica de Retrieval-Augmented Generation (RAG), junto con las bibliotecas LangChain y LangGraph, se utilizó para orquestar agentes y anclar las respuestas de un Large Language Model (LLM). El framework extrajo requisitos en lenguaje natural, los enriqueció con RAG y los envió al LLM, que generó ADRs para auxiliar en la evaluación de trade-offs teóricos. Los resultados demostraron que el agente con RAG redujo respuestas genéricas, aumentando el fundamento teórico y la trazabilidad. El enfoque RAG demostró su eficacia frente a prompts convencionales (zero-shot), favoreciendo la generación de ADRs con menor nivel de alucinación y alto nivel de trazabilidad teórica. Se concluyó que la herramienta automatizada cumplió la función de mapeo de requisitos, resultando en documentos técnicos empíricamente fundamentados y auxiliando la gobernanza y toma de decisiones en arquitectura de software.

Palabras clave: Bases de datos; Inteligencia Artificial; LangGraph; LLM; RAG.