Ingeniería De Software
08 de octubre de 2026
Pipeline de datos para el monitoreo de acciones considerando la metodología fundamentalista
Pipeline de Datos para el Monitoreo de Acciones Considerando la Metodología Fundamentalista
Leonardo Gomes Maciel; Arthur Pinheiro de Araújo Costa
DOI: 10.22167/2675-6528-202603142
Artículo derivado de Trabajo de Fin de Curso (TCC), con contenido basado en el trabajo original del estudiante y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, una solución de inteligencia artificial desarrollada por el Instituto Pecege para la síntesis y organización textual.
Resumen
El panorama financiero brasileño enfrenta desafíos como el endeudamiento familiar, la baja alfabetización financiera y la descentralización de información para el análisis de inversiones. Ante esto, el objetivo de la investigación consistió en desarrollar un pipeline de datos financieros, fundamentado en buenas prácticas de Ingeniería de Datos, para estructurar, procesar y disponibilizar información relevante que apoyara la toma de decisiones de inversores individuales en el análisis de acciones. Se implementó una arquitectura medallón, utilizando MinIO S3 para almacenamiento en capas bronce, silver y gold, con Delta Lake para gobernanza de datos. Se empleó Apache Spark para procesamiento distribuido, Prometheus para monitoreo y Power BI para visualización analítica. Los datos fueron mayoritariamente demostraciones financieras de la Comisión de Valores Mobiliarios (CVM). Se construyó una cartera teórica de inversiones con base en los principios de Benjamin Graham (2017), aplicando filtros de selección y validación de datos. Los resultados indicaron un retorno positivo del 32,88% para la cartera teórica, superando el índice Ibovespa (4,25%) en el período de 2021 a 2024, aunque inferior a la tasa Selic (46,96%). Cualitativamente, el pipeline procesó conjuntos de datos voluminosos, con reducciones significativas de redundancias, como 99,27% en la tabla BPA y 94,29% en la DRE, tras la aplicación de filtros. Se evidenciaron ganancias en organización, trazabilidad y calidad de los datos, posibilitando análisis financieros estructurados y más robustos.
Palabras clave: Arquitectura Medallón; Ingeniería de Datos; Inversiones; Pipeline de Datos.
1. Introducción
El panorama económico brasileño actual está marcado por desafíos significativos, como el aumento del endeudamiento de las familias y la persistente falta de alfabetización financiera. En septiembre de 2025, Brasil registró 78,2 millones de personas en situación de incumplimiento, un crecimiento del 5,6% en relación con el año anterior (Serasa, 2025). Este problema no es reciente y ya ha sido abordado en estudios anteriores que destacan la necesidad de la educación financiera para la calidad de vida de los individuos (Campos, Teixeira y Coutinho, 2015). Organizaciones como la Organización para la Cooperación y el Desarrollo Económico (OCDE) han promovido programas de alfabetización y capacidad financiera, con el objetivo de desarrollar habilidades esenciales para la toma de decisiones fundamentadas (Hoffman; Moro, 2012). Las recomendaciones de la OCDE abarcan temas como planificación financiera personal, seguros, ahorro, inversiones y endeudamiento (Campos; Teixeira; Coutinho, 2015).
En este contexto, la inversión financiera emerge como un tema de gran relevancia. El análisis fundamentalista, tal como presentado por Benjamin Graham (1949) en su obra “El Inversor Inteligente”, propone un método para evaluar empresas basándose en su valor intrínseco, ayudando en la selección de activos sólidos con potencial de crecimiento. Un inversor que adopta el enfoque fundamentalista busca minimizar riesgos al centrarse en activos consolidados en el mercado financiero, considerando el historial y el escenario de la empresa (Freitas, 2020).
A pesar de la importancia de las inversiones, el mercado de capitales presenta complejidades. La Bolsa de Valores de Brasil (B3) cotiza más de 400 acciones, entre ordinarias, preferenciales y units (InfoMoney, 2025). Sin embargo, la información fundamental necesaria para un análisis en profundidad a menudo está descentralizada, lo que exige tiempo y esfuerzo considerables por parte de los inversores (Montóia, 2021). Para superar esta dificultad y garantizar que la información se distribuya de manera eficiente, la implementación de un pipeline de datos se vuelve esencial. Este concepto abarca las etapas desde la extracción de datos brutos de diversas fuentes hasta la carga en su destino (Densmore, 2021), con la elección de las tecnologías variando según el contexto y la madurez del ingeniero de datos.
Ante la necesidad de conocimientos técnicos que abarcan tanto el área de finanzas como la de tecnología, y para mitigar la problemática de la descentralización de la información y apoyar la toma de decisiones de inversores individuales, el objetivo general de este trabajo es desarrollar un pipeline de datos automatizado para el análisis fundamentalista de acciones brasileñas, aplicando la metodología de Benjamin Graham (2019).
2. Material y Métodos
La investigación realizada se caracterizó como una investigación-acción, con un enfoque cuali-cuantitativo, centrada en el desarrollo de un pipeline de datos aplicado al mercado financiero. El objetivo central fue estructurar, procesar y poner a disposición información para apoyar la toma de decisiones de inversores individuales en el análisis fundamentalista de acciones brasileñas. El estudio se limitó a la evaluación del mercado de capitales, sin profundizar en análisis macroeconómicos o microeconómicos sectoriales, según la metodología de Benjamin Graham (2019).
En el ámbito de las inversiones, se adoptó el análisis fundamentalista, que busca evaluar empresas basándose en su valor intrínseco. Para la selección de activos, se aplicaron criterios específicos, como la ausencia de pérdidas en el período analizado, un producto entre Precio/Beneficio (P/B) y Precio/Valor Patrimonial por Acción (P/VPA) inferior a 22,5, la distribución de dividendos y una liquidez corriente no inferior a 1 (Silva, 2020; Assaf, 2018). Estos criterios buscaron identificar empresas sólidas y con potencial de crecimiento, alineadas al perfil de un inversor defensivo.
La metodología de ingeniería de datos implicó la construcción de un pipeline de datos, siguiendo las buenas prácticas del área y la arquitectura medallón (Strengholt, 2025). Esta arquitectura organiza los datos en tres capas distintas: bronce, plata y oro, con el objetivo de mejorar la estructura, calidad y validación de la información a lo largo del proceso. La implementación se realizó utilizando el lenguaje Python 3.11 (Luna, 2025), con el uso de contenedores Docker para garantizar la portabilidad y reproducibilidad del entorno.
La etapa de ingesta de datos, correspondiente a la capa bronce, se centró en la recopilación de información bruta de diversas fuentes. Los datos se extrajeron del sitio web Fundamentus, mediante web scraping, y de la Comisión de Valores Mobiliarios (CVM), a través de descargas de archivos ZIP, abarcando el período de 2020 a 2024. Se utilizó el módulo “ingest.py”, con la superclase “MultiSourceIngestion” y las clases “FundamentusIngestion” y “CVMIngestion”, para gestionar la recopilación y el almacenamiento inicial en MinIO S3.
Los documentos de la CVM incluyeron Formularios de Registro (FCA), Formularios de Estados Financieros Estandarizados (DFP) – que contienen Balance General Activo (BPA), Balance General Pasivo (BPP), Estado de Flujo de Efectivo (DFC-MD y DFC-MI), Estado de Cambios en el Patrimonio Neto (DMPL), Estado de Resultados Integrales (DRA), Estado de Resultados (DRE) y Estado de Valor Agregado (DVA) – y Formularios de Referencia (FRE). Los datos se almacenaron en formato bruto, con codificación original (iso-8859-1) y metadatos en JSON, organizados jerárquicamente por fuente, tipo de archivo, identificadores y fecha de extracción.
En la capa silver, los datos brutos se sometieron a procesos de tratamiento y normalización para garantizar calidad y consistencia. Se utilizó PySpark para el procesamiento distribuido, conectando Python a Spark. Las actividades incluyeron la eliminación de datos duplicados, tratamiento de información nula, estandarización de nomenclatura y formato, y detección de anomalías. Para la validación de la calidad de los datos, se implementó el módulo “run_metrics.py” con la clase “SilverQualityValidator”, que ejecutó verificaciones de integridad y precisión.
Los tratamientos específicos aplicados en la capa silver involucraron la conversión de escala monetaria, normalización de CNPJ, filtrado inteligente para mantener solo cuentas consolidadas relevantes para el análisis fundamentalista, tratamiento de codificación, deduplicación de registros, conversión de tipos de datos (strings a DoubleType y DateType), recorte de espacios y eliminación de líneas vacías. Estas etapas fueron cruciales para refinar los datos y prepararlos para análisis más robustos, eliminando inconsistencias y redundancias.
La capa gold se dedicó al modelado y la puesta a disposición de los datos para el consumo final. Se adoptó el modelado dimensional “Star Schema” (Strengholt, 2025), que organiza los datos en tablas de hechos y dimensiones. Las dimensiones incluyeron tiempo, empresa y tipo de acción, mientras que las tablas de hechos contemplaron balance, capital social, cotización, dividendos y estado de resultados. Para la visualización analítica de la información tratada, se utilizó Power BI Desktop (Ehrenmueller-Jensen, 2024).
Las principales herramientas y bibliotecas de Python empleadas en el desarrollo del pipeline incluyeron MinIO S3 para almacenamiento de objetos, Apache Spark para procesamiento distribuido, Prometheus (Jani, 2024) para monitoreo y observabilidad, y Delta Lake para gobernanza de datos, garantizando transacciones ACID, versionamiento y evolución de esquemas. Otras bibliotecas de Python, como `requests`, `python-dateutil`, `lxml`, `pandas` y `python-dotenv`, fueron utilizadas para extracción, manipulación y gestión de datos.
La construcción de la cartera teórica de inversiones siguió un proceso de filtrado riguroso. Se inició con un universo de 323 empresas, de las cuales 91 estaban listadas en el índice Ibovespa en 2021. Tras la aplicación de los filtros de Benjamin Graham, 47 acciones fueron consideradas elegibles. De estas, se seleccionaron 5 acciones, priorizando la diversificación sectorial. Los datos de cotizaciones medias trimestrales se obtuvieron de la tabla FATO_COTACAO en la capa gold, y los dividendos de la plataforma Status Invest.
Para el cálculo del retorno porcentual de la cartera teórica, se consideró la cotización promedio del primer trimestre de 2021 y la cotización del último día hábil de 2024. Los proventos se contabilizaron con base en el último año del análisis (2024) y se redistribuyeron proporcionalmente a los demás años para uniformizar el tratamiento de los flujos de rendimiento. La fórmula utilizada para el cálculo del retorno porcentual fue: (Precio Promedio de la Acción en el año de análisis – Precio de la Acción en el último año analizado + (cantidad de años analizadas * Proventos del último año analizado)) / Precio de la Acción en el último año analizado.
3. Resultados y Discusión
La presente sección detalla los resultados obtenidos con el desarrollo y la aplicación de un pipeline de datos financieros, concebido para estructurar, procesar y disponibilizar información crucial para el análisis fundamentalista de acciones brasileñas. El estudio demostró la eficacia de la arquitectura implementada tanto en la organización y calidad de los datos como en el soporte a la toma de decisiones de inversores individuales, conforme a la metodología de Benjamin Graham (2019). Los hallazgos cuantitativos y cualitativos evidencian ganancias significativas en trazabilidad, consistencia y capacidad analítica, superando desafíos inherentes a la descentralización de información en el mercado de capitales.
La arquitectura del pipeline se concibió siguiendo el patrón medallón, que organiza los datos en capas distintas: bronce, plata y oro, dentro de un entorno de data lakehouse. Este enfoque tiene como objetivo mejorar progresivamente la estructura, calidad y validación de la información desde su forma bruta hasta la etapa de refinamiento para el consumo analítico (STRENGHOLT, 2025). La implementación utilizó contenedores Docker para asegurar portabilidad y reproducibilidad, integrando herramientas esenciales del ciclo de vida de la ingeniería de datos, como Python para la ingesta, MinIO para el almacenamiento de objetos, Apache Spark para el procesamiento distribuido y Prometheus para la observabilidad.
La etapa de ingesta de datos, correspondiente a la capa bronce, se centró en la recopilación de información de dos fuentes principales: el sitio web Fundamentus y la Comisión de Valores Mobiliarios (CVM). Los datos de Fundamentus, obtenidos a través de web scraping, y los de la CVM, mediante descargas de archivos ZIP, se almacenaron en su forma bruta (“as-is”) en MinIO S3, preservando la codificación original y acompañados de metadatos detallados. Estos metadatos, organizados en un diccionario, incluían la fuente, tipo de activo, fecha y hora de extracción, detalles técnicos de la solicitud HTTP, formato y tamaño del archivo, y la versión del ingestor, garantizando la trazabilidad y auditoría (STRENGHOLT, 2025).
La organización de los directorios en la capa bronce se estructuró jerárquicamente, considerando la fuente de ingesta, el tipo de archivo, identificadores por acción o año del documento, y la fecha y hora de la extracción. Este enfoque permitió una gestión eficiente de los datos brutos y la posibilidad de reprocesamientos puntuales. Sin embargo, se observó que el acceso al historial de balances financieros del sitio Fundamentus se volvió inviable debido a la implementación de un sistema de captcha, lo que imposibilitó su uso continuo en el script de ingesta.
En contraste, la CVM demostró ser una fuente robusta y viable, disponibilizando datos consolidados de balances financieros segmentados por año y permitiendo automatizaciones. Los documentos almacenados en la capa bronce del MinIO incluyeron Información Catastral (CNPJ, fecha de registro), Formularios Catastrales (FCA) con códigos de negociación, y Formularios de Demostraciones Financieras Estandarizadas (DFP). Estos últimos abarcan Balance Patrimonial Activo (BPA), Balance Patrimonial Pasivo (BPP), Demostraciones de Flujo de Caja (DFC-MD y DFC-MI), Demostración de las Variaciones del Patrimonio Neto (DMPL), Demostración del Resultado Integral (DRA), Demostración del Resultado (DRE) y Demostración del Valor Agregado (DVA), además del Formulario de Referencia (FRE) con información exhaustiva sobre el emisor.
El tratamiento de los datos y el procesamiento distribuido ocurrieron en la capa silver, donde la clase `CVMSilverProcessor` utilizó PySpark para transformar los datos brutos. Este paso fue fundamental para resolver inconsistencias y redundancias presentes en los datos de la CVM. Muchas demostraciones financieras, por ejemplo, presentaban resultados duplicados para el año de referencia y el año anterior, lo que generaba información redundante y cálculos inconsistentes. La exclusión de esta información duplicada en la capa silver resultó en ahorro de espacio y mayor consistencia de los datos para análisis futuros.
La eficiencia del script de tratamiento de datos en la capa silver se cuantificó mediante métricas de calidad. En la tabla DRE, de las 32644 líneas originales en la capa bronze, se mantuvieron 1864 líneas en la capa silver, lo que representa una reducción del 94,29%. Para la tabla BPA, de 60741 líneas, se preservaron 444, lo que indica una reducción del 99,27%. De manera similar, en la tabla BPP, de 104017 líneas, se mantuvieron 910, lo que resultó en una reducción del 99,13%. Estos resultados demuestran la capacidad del pipeline para eliminar redundancias y datos irrelevantes, optimizando el volumen de información para el análisis.
Otros conjuntos de datos también presentaron reducciones significativas: el volumen de valores mobiliarios tuvo una reducción del 51,62% (de 4636 a 2243 líneas), y el capital social, del 65,70% (de 3606 a 1237 líneas). En contrapartida, el conjunto de datos de distribución de dividendos mantuvo su volumen integral (1503 líneas), sugiriendo una consistencia intrínseca desde el origen. El análisis comparativo entre las capas bronce y silver, por lo tanto, no solo evidencia la reducción de volumen, sino también la garantía de la confiabilidad de las informaciones presentadas para las etapas subsecuentes de análisis.
En la capa gold, para la carga y disponibilidad de los datos al usuario final, se adoptó el modelado dimensional conocido como “Star Schema”. Este patrón es ampliamente utilizado en Business Intelligence para facilitar la visualización analítica y el desarrollo de dashboards, como el implementado en Power BI. Los datos se organizaron en tablas de dimensión, como `DIM_TEMPO` para control temporal, `DIM_EMPRESA` para categorización de las acciones y `DIM_TIPO_ACAO` para los códigos del mercado financiero. Las tablas de hechos, a su vez, incluyeron `FATO_BALANÇO` (activos y pasivos circulantes, patrimonio neto), `FATO_CAPITAL_SOCIAL` (cantidad de acciones ordinarias y preferenciales), `FATO_COTACAO` (valores monetarios de compra de acciones) y `FATO_DIVIDENDOS` y `FATO_DRE` para cálculos de lucro neto y proventos.
La construcción de la cartera teórica de inversiones siguió la metodología de Benjamin Graham (2019), enfocándose en un inversor defensivo. Inicialmente, de las 323 empresas negociadas en 2021, según datos de la CVM, 91 estaban listadas en el Ibovespa del mismo año. La aplicación de los filtros de Graham, que incluían criterios como P/L x P/VP inferior a 22,5, liquidez corriente no inferior a 1, ausencia de pérdidas y distribución de dividendos, resultó en 47 acciones elegibles. Para diversificar la cartera y mitigar riesgos, se seleccionaron cinco acciones: ELETROBRAS (AXIA3), PORTO SEGURO AS (PSSA3), MARFRIG (MBRF3), SIMPAR S.A (SIMH3) y BRASILAGRO (AGRO3).
El retorno porcentual de la cartera teórica se calculó considerando la cotización promedio de las acciones en el primer trimestre de 2021 y en el último día hábil de 2024, además de los proventos distribuidos en el último año del análisis (2024), redistribuidos proporcionalmente para estandarización metodológica. La fórmula utilizada fue: Retorno (%) = (Precio Promedio de la Acción en el año de análisis – Precio de la Acción en el último año analizado + (cantidad de años analizadas * sumatoria de proventos del último año analizado)) / Precio de la Acción en el último año analizado. Este cálculo permitió una evaluación consistente del desempeño de la cartera a lo largo del período.
Los resultados financieros de la cartera teórica, en el período de enero de 2021 a diciembre de 2024, indicaron un retorno positivo del 32,88%. En comparación, el índice Ibovespa registró un retorno del 4,25% en el mismo período, mientras que la tasa Selic acumulada alcanzó el 46,96%. La cartera teórica, por lo tanto, superó significativamente al Ibovespa, demostrando la eficacia de la metodología de Graham en la selección de activos con potencial de valorización. Sin embargo, el retorno de la cartera quedó por debajo de la tasa Selic, que presentó un desempeño superior en el período analizado.
La volatilidad del mercado en el período de 2021 a 2024, influenciada por eventos como la pandemia de COVID-19, puede explicar la diferencia en relación con la Selic. La tasa Selic, que varió de 1,90% en 2021 a 12,15% en 2024, refleja un escenario atípico de intereses altos, convirtiéndose en una opción de inversión más rentable en comparación con la cartera de acciones. Es importante resaltar que los indicadores fundamentalistas, aunque útiles, no garantizan retornos futuros y deben ser complementados por un análisis macro y microeconómico más amplio, además de una diversificación adecuada del portafolio, evitando la asignación del 100% de los recursos en acciones (GRAHAM, 2019).
En resumen, el pipeline de datos desarrollado cumplió plenamente los objetivos propuestos, consolidando información de diversas empresas y segmentándola según la arquitectura medallion. Esto permitió el análisis tanto de datos brutos como de datos tratados, facilitando la identificación de inconsistencias y mejorando la calidad de la información. La cartera teórica, construida con base en la metodología de Benjamin Graham, demostró un retorno superior al Ibovespa, validando el enfoque fundamentalista como una herramienta valiosa para inversores individuales, a pesar de haber sido superada por la tasa Selic en un período de mercado atípico.
4. Conclusión
El presente estudio tuvo como objetivo desarrollar un pipeline de datos financieros automatizado para el análisis fundamentalista de acciones brasileñas, aplicando la metodología de Benjamin Graham. Se verificó la implementación exitosa de una arquitectura medallón, que utilizó MinIO S3 para almacenamiento en capas bronce, silver y gold, Apache Spark para procesamiento distribuido, Prometheus para monitoreo y Power BI para visualización analítica. Los datos, mayoritariamente demostraciones financieras de la CVM, fueron procesados con ganancias significativas en organización, trazabilidad y calidad, evidenciadas por reducciones de redundancias del 99,27% en la tabla BPA y 94,29% en la DRE. La cartera teórica de inversiones, construida con base en los principios de Graham, presentó un retorno positivo del 32,88% en el período de 2021 a 2024, superando el índice Ibovespa (4,25%) y demostrando la viabilidad del enfoque fundamentalista para inversores individuales.
A pesar de los resultados prometedores, el estudio enfrentó limitaciones, como la inviabilidad de acceso a datos históricos del sitio Fundamentus debido a sistemas de captcha, lo que restringió las fuentes de ingesta. Adicionalmente, aunque la cartera teórica superó al Ibovespa, su retorno fue inferior a la tasa Selic (46,96%) en el período analizado, un escenario influenciado por altas tasas de interés y volatilidad atípica del mercado, reforzando que los indicadores fundamentalistas deben complementarse con análisis macroeconómicos y diversificación. Para estudios futuros, se sugiere la implementación de un orquestador para la programación automatizada y la incorporación de Grafana para la visualización de métricas, con el objetivo de mejorar la observabilidad. Se recomienda también la expansión de la aplicación del pipeline a otros mercados de capitales, como acciones internacionales, fondos inmobiliarios y criptoactivos, y la integración con fuentes de datos adicionales, como B3.
Referencias Bibliográficas
ASSAF NETO, Alexandre. Mercado financeiro. 14. ed. São Paulo: Atlas, 2018. ISBN-978-85-97-01805-9.
CAMPOS, Celso Ribeiro; TEIXEIRA, James; COUTINHO, Cileda de Queiroz e Silva. Reflexões sobre a educação financeira e suas interfaces com a educação matemática e a educação crítica. Educação Matemática em Pesquisa, São Paulo, v. 17, n. 3, p. 556–577, 2015. III Fórum de Discussão: Parâmetros Balizadores da Pesquisa em Educação Matemática no Brasil.
DENSMORE, James. Data pipelines pocket reference: moving and processing data for analytics. 1. ed. Sebastopol: O’Reilly Media, 2021.
EHRENMUELLER-JENSEN, Markus. Data Modeling with Microsoft Power BI. Sebastopol: O’Reilly Media, 2024.
FREITAS, Lucas Catunda de. Uma análise fundamentalista do setor bancário: um estudo de caso com uma seleção de indicadores. 2020. Trabalho de Conclusão de Curso (Graduação em Finanças) Universidade Federal do Ceará, Faculdade de Economia, Administração, Atuária e Contabilidade, Fortaleza, 2020.
GRAHAM, Benjamin. O investidor inteligente. São Paulo: HarperCollins, 2019.
Hoffman; Moro, 2012 [Referência completa não encontrada no documento original]
INFOMONEY. Ações B3: cotação de hoje. Disponível em: https://www.infomoney.com.br/cotacoes/b3/acao/. Acesso em: 17 set. 2025.
JANI, Yash. Unified Monitoring for Microservices: Implementing Prometheus and Grafana for Scalable Solutions. Journal of Artificial Intelligence, Machine Learning and Data Science, v. 2, n. 1, 2024. ISSN 2583-9888. DOI: https://doi.org/10.51219/JAIMLD/yash-jani/206.Disponível em: https://urfpublishers.com/journal/artificial-intelligence. Acesso em: 5 fev. 2026.
LUNA, Pedro Henrique Santiago de. Pipeline de dados para análise epidemiológica de casos sobre transtornos mentais relacionados ao trabalho no Brasil. Trabalho de Conclusão de Curso (Bacharelado em Sistemas de Informação) – Universidade Federal de Pernambuco, Recife, 2025.
Montóia, 2021 [Referência completa não encontrada no documento original]
Serasa, 2025 [Referência completa não encontrada no documento original]
SILVA JÚNIOR, João Fernandes da. Aplicação das estratégias de Benjamin Graham no mercado acionário brasileiro. 2020. Trabalho de Conclusão de Curso (Graduação em Ciências Contábeis) Faculdade de Ciências Contábeis, Universidade Federal de Uberlândia, Uberlândia, 2020.
STRENGHOLT, Piethein. Building medallion architectures. Sebastopol, CA: O’Reilly Media, 2025.
Artículo originado del Trabajo de Conclusión de Curso de la Especialización en Ingeniería de Software del MBA USP/Esalq
Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy