Resumen Ejecutivo

26 de febrero de 2026

Modelado Predictivo de Incumplimiento con Algoritmos Supervisados de Machine Learning

João Gabriel de Medeiros Luz Pedro; Carlos Nabil Ghobril

Resumen elaborado por la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege orientada a la síntesis y redacción.

El objetivo de esta investigación fue analizar y tratar un conjunto de datos del Banco Central de Brasil (Bacen) para implementar, entrenar y validar modelos de Machine Learning, utilizando los algoritmos supervisados CatBoost, Random Forest y XGBoost, con el fin de medir la capacidad predictiva en la identificación de incumplimiento. La complejidad del escenario económico brasileño, con el aumento del endeudamiento familiar, exige que las instituciones financieras posean herramientas precisas para la gestión del riesgo de crédito. La capacidad de anticipar el comportamiento de pago de los consumidores es un pilar para la sostenibilidad del sector, y la aplicación de técnicas de ciencia de datos surge como solución para mejorar la precisión de los análisis.

El panorama del endeudamiento en Brasil justifica la urgencia de estudios en el área. Datos de la Encuesta de Endeudamiento e Incumplimiento del Consumidor (PEIC) de abril de 2024 muestran que el 78,5% de las familias brasileñas poseían deudas, y el 12,1% admitieron no tener condiciones de honrar sus compromisos (CNC, 2024). Una encuesta de la CNDL y del SPC Brasil registró 68,62 millones de brasileños en mora, lo que corresponde al 41,51% de la población adulta (Poder360, 2024). Estas cifras señalan un riesgo sistémico que puede afectar la estabilidad de las instituciones financieras. Una práctica que contribuye al endeudamiento es la extensión de los plazos de pago, que compromete la renta futura y aumenta la probabilidad de incumplimiento en escenarios de inestabilidad (CNC, 2024). Ante esto, el análisis de crédito tradicional, basado en reglas estáticas, es insuficiente. La necesidad de mejorar los mecanismos de análisis de riesgo es imperativa para mitigar pérdidas.

La presente investigación propone un enfoque basado en aprendizaje automático para la predicción de incumplimiento. La utilización de algoritmos supervisados permite la construcción de modelos que aprenden patrones a partir de datos históricos, identificando relaciones no lineales que serían difíciles de detectar por métodos estadísticos convencionales (Kotsiantis, 2007). Uno de los desafíos técnicos enfrentados fue la presencia de un gran número de variables categóricas, como ‘ocupación’, ‘modalidad’ de crédito y ‘uf’, que son cruciales para la caracterización del perfil del cliente, pero exigen tratamientos específicos para ser utilizadas por algoritmos como Random Forest y XGBoost. La elección de técnicas de preprocesamiento y la selección de características fueron etapas fundamentales para garantizar la generación de modelos predictivos robustos.

El alcance del trabajo abarcó un ciclo completo de un proyecto de ciencia de datos: extracción y tratamiento de los datos, análisis exploratorio, entrenamiento, evaluación y comparación de múltiples modelos de Machine Learning. La validación de los resultados se realizó mediante métricas como precisión, F1-Score y el área bajo la curva ROC (AUC-ROC), garantizando una evaluación objetiva del rendimiento de cada algoritmo. El estudio buscó identificar el modelo más eficaz para el escenario propuesto, proporcionando una base para la implementación de sistemas de apoyo a la decisión en instituciones financieras.

La metodología se inició con la recopilación de datos históricos de crédito del Sistema de Información de Crédito (SCR) del Bacen (Banco Central de Brasil, 2024). El conjunto de datos inicial comprendía 12 archivos CSV, correspondientes a los meses de 2024. Para la manipulación y procesamiento, se utilizó el framework Apache Spark, que permitió la unificación y limpieza de los archivos, incluyendo la eliminación de filas mal formateadas y la especificación del separador de columnas y codificación (UTF-8). La etapa de preprocesamiento es fundamental, ya que la eficacia de los algoritmos depende de la calidad de los datos de entrada (Fávero & Belfiore, 2024). Tras la limpieza, se realizó la estandarización de los formatos numéricos, sustituyendo comas por puntos como separador decimal y eliminando los separadores de miles. El conjunto de datos consolidado se almacenó en el formato Apache Parquet, optimizado para operaciones de lectura. La infraestructura tecnológica incluyó el lenguaje Python en el IDE Spyder y bibliotecas como Pandas, Matplotlib, Seaborn, y los frameworks CatBoost, Random Forest y XGBoost.

El análisis exploratorio de datos (EDA) se realizó para comprender la estructura del conjunto de datos, compuesto por 13 variables categóricas y 12 numéricas. La variable objetivo, vencidopor encimade15días, se transformó en una variable binaria (0 para cumplidor, 1 para incumplidor), encuadrando el problema como clasificación binaria. Se realizó un análisis de correlación para el conjunto de datos completo y para un subconjunto enfocado en clientes Persona Física (PF), ya que los clientes Persona Jurídica (PJ) tienen perfiles distintos. El análisis reveló que la proporción de incumplimiento era mayor en el grupo de PF. Las visualizaciones gráficas exploraron la relación entre el incumplimiento y variables como UF, indexador y modalidad de crédito, confirmando la relevancia de estas características.

La selección de los algoritmos se basó en su eficacia en problemas de clasificación. El Random Forest fue elegido por su robustez contra el overfitting, obtenida por la agregación de árboles de decisión (Breiman, 2001). El XGBoost fue seleccionado por su alto rendimiento y velocidad, siendo una implementación optimizada del gradient boosting (Chen & Guestrin, 2016; Friedman, 2001). El CatBoost fue incluido por su capacidad nativa de manejar variables categóricas, simplificando el preprocesamiento (Prokhorenkova et al., 2018). La evaluación del rendimiento utilizó Precisión, Exactitud, Sensibilidad y F1-Score. Adicionalmente, la curva ROC y el cálculo del AUC-ROC se utilizaron para evaluar la capacidad discriminatoria de los modelos (Fawcett, 2006). Para garantizar la robustez, se empleó la validación cruzada k-fold, que mitiga el riesgo de que el rendimiento dependa de una división específica entre entrenamiento y prueba (Fávero & Belfiore, 2024).

Los resultados obtenidos revelaron desempeños distintos. El CatBoost Classifier demostró un rendimiento superior, exigiendo un ajuste mínimo de hiperparámetros y un preprocesamiento simplificado. Su principal ventaja fue el manejo nativo de variables categóricas. La matriz de confusión inicial mostró una alta tasa de aciertos, y la curva AUC-ROC presentó valores cercanos a 1.0 para entrenamiento y prueba, con una AUC de 0.99, señalando una excelente capacidad de discriminación y ausencia de overfitting. El análisis de importancia de las variables indicó que la característica carteraincumplidaarrastada poseía la mayor significancia. Sin embargo, su alta correlación con la variable objetivo podría llevar a una fuga de datos conceptual. Para investigar este efecto, se realizó un segundo entrenamiento del CatBoost eliminando esta variable. Los resultados mostraron una leve caída en el rendimiento, pero el gráfico de importancia de las variables se volvió más distribuido, con otras características como activo_problematico y modalidad ganando relevancia. La validación cruzada k-fold confirmó la estabilidad y robustez de los resultados en ambas versiones del modelo.

El Random Forest Classifier presentó resultados satisfactorios, pero inferiores a los del CatBoost. La implementación requirió un preprocesamiento más intensivo, con eliminación de variables con alta multicolinealidad y la transformación de variables categóricas mediante one-hot encoding. Este proceso aumentó la dimensionalidad del dataset, resultando en un mayor tiempo de entrenamiento. La matriz de confusión y la curva AUC-ROC del Random Forest indicaron un buen poder predictivo, pero con valores de AUC ligeramente inferiores a los del CatBoost. El XGBoost Classifier, utilizando el mismo preprocesamiento del Random Forest, demostró un rendimiento notable, superando al Random Forest en todas las métricas y acercándose al CatBoost. Su ventaja más evidente fue la velocidad de procesamiento, significativamente más rápida que el Random Forest. La curva AUC-ROC del XGBoost también presentó valores excelentes, y la robustez del modelo fue confirmada por la validación cruzada.

En análisis comparativo, CatBoost se destacó como el algoritmo de mejor rendimiento general. Su ventaja reside en la combinación de alta precisión con la simplicidad en el preprocesamiento de variables categóricas. XGBoost emergió como una alternativa fuerte, con un rendimiento casi tan bueno como el de CatBoost y una velocidad superior a la de Random Forest. Random Forest, aunque robusto, se mostró menos adecuado para este escenario, debido a su sensibilidad al preprocesamiento de categóricas y al mayor costo computacional. La discusión de los resultados evidencia que la elección del algoritmo debe adaptarse a las características de los datos y a los requisitos del problema.

La superioridad de los algoritmos basados en boosting de gradiente (XGBoost y CatBoost) sobre el método de bagging (Random Forest) sugiere que la construcción secuencial de árboles; cada nuevo árbol corrige los errores del anterior, fue más eficaz para capturar los patrones de incumplimiento. El rendimiento de CatBoost refuerza la importancia de algoritmos con mecanismos optimizados para características categóricas, un desafío común en conjuntos de datos financieros. La necesidad de aplicar one-hot encoding para Random Forest y XGBoost aumentó la complejidad computacional y pudo haber diluido el poder informativo de algunas variables. La importancia de las variables revelada por los modelos ofrece perspectivas para la gestión de riesgos. Características como carteraincumplidaarrastada y activo_problematico fueron los predictores más fuertes, pero la capacidad de los modelos para extraer poder de otras variables, como modalidad de crédito e indexador, demuestra el potencial del Machine Learning. La identificación de que ciertas modalidades de crédito están más asociadas al incumplimiento puede permitir que las instituciones financieras ajusten sus políticas de forma más granular.

La robustez de los modelos, confirmada por la validación cruzada, es crucial para su aplicabilidad en el mundo real. La consistencia del rendimiento de CatBoost y XGBoost a través de las diferentes divisiones de la validación indica que los modelos aprendieron patrones generalizables, no solo ruido del conjunto de entrenamiento. Esto confiere mayor confiabilidad a los resultados y seguridad para su implementación en sistemas de producción. La investigación, por lo tanto, valida un proceso metodológico riguroso que puede ser replicado por instituciones financieras para desarrollar sus propias soluciones de modelado predictivo.

Este trabajo demostró la viabilidad y eficacia de aplicar modelos de Machine Learning para la predicción de incumplimiento con datos del Banco Central de Brasil. El proceso abarcó desde el tratamiento riguroso de los datos hasta la implementación y comparación de tres algoritmos supervisados. El análisis exploratorio fue fundamental para dirigir tratamientos específicos, como el enfoque en clientes persona física. La comparación entre los modelos reveló que, para el conjunto de datos analizado, el algoritmo CatBoost obtuvo los mejores resultados globales. Su capacidad para manejar nativamente variables categóricas simplificó el preprocesamiento y resultó en un modelo con excelente precisión y confiabilidad. El XGBoost también presentó un desempeño excepcional, posicionándose como una alternativa competitiva. El Random Forest, a pesar de generar resultados aceptables, fue el menos performático y el más costoso en tiempo de procesamiento. Se concluye que el objetivo fue alcanzado: se demostró que los algoritmos de boosting, especialmente el CatBoost, junto con un preprocesamiento de datos adecuado, ofrecen una solución robusta y precisa para la predicción de incumplimiento, pudiendo mejorar las estrategias de riesgo de crédito en instituciones financieras.

Referencias:
Banco Central do Brasil (BACEN). 2024. Disponible en: <https://dadosabertos. bcb. gov. br/dataset/scrdata>. Acceso en: 03 abr. 2025.
Breiman, L. (2001). Random Forests. Machine Learning, 45(1), 5–32. doi: 10.1023/A:1010933404324.
Chen, T.; Guestrin, C. 2016. XGBoost: A scalable tree boosting system. 1. ed. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 785-794.
(CNC) Confederação Nacional do Comércio de Bens, Serviços e Turismo. 2024. Pesquisa de Endividamento e Inadimplência do Consumidor (Peic) – abril de 2024. Disponible en: <https://portaldocomercio. org. br/publicacoes
posts/pesquisa-de-endividamento-e-inadimplencia-do-consumidor-peic-abril-de-2024/:>. Acceso en: 03 abr. 2025.
Fávero, L. P.; Belfiore, P. 2024. Manual de Análise de Dados: estatística e Machine Learning com EXCEL®, SPSS®, STATA®, R® e Python®. 2ed. LTC, Rio de Janeiro, RJ, Brasil.
Fawcett, T. (2006). An Introduction to ROC Analysis. Pattern Recognition Letters, 27(8), 861–874. doi: 10.1016/j. patrec.2005.10.010.
Friedman, J. H. (2001). Greedy Function Approximation: A Gradient Boosting Machine. Annals of Statistics, 29(5), 1189–1232. doi: 10.1214/aos/1013203451.
Kotsiantis, S. B. (2007). Supervised Machine Learning: A Review of Classification Techniques. Informatica, 31(3), 249–268.
Poder360. 2024. Inadimplência no Brasil atinge 41,51% da população adulta em novembro. Disponible en:<https://www. poder360. com. br/poder-economia/inadimplencia-no-brasil-atinge-4151-da-populacao-adulta-em-novembro/>. Acceso en: 17 jun. 2025.
Prokhorenkova, L.; Gusev, G.; Vorobev, A.; Dorogush, A. V.; Gulin, A. 2018. CatBoost: unbiased boosting with categorical features. 1. ed. Advances in Neural Information Processing Systems (NeurIPS)., 31.

Resumen ejecutivo del Trabajo de Conclusión de Curso de Especialización en Data Science y Analytics del MBA USP/Esalq

Más información sobre el curso; haga clic aquí:

Quién editó este artículo

Más recientes

También te puede interesar

05 de octubre de 2026

Predição da inadimplência de parcelamentos de dívidas tributárias

O parcelamento de débitos tributários constitui um instrumento relevante de recuperação fiscal, permitindo que contribuintes regularizem suas obrigações de forma parcelada, ao mesmo tempo em que expõe a administração tributária ao risco de cancelamento por inadimplência. O objetivo foi desenvolver e avaliar modelos de machine learning para a predição de cancelamento de parcelamentos de ICMS, visando subsidiar estratégias proativas de cobrança. Utilizou-se uma base de dados de parcelamentos históricos da Secretaria da Economia do Estado de Goiás. Foram treinados e comparados os algoritmos Árvore de Decisão, Random Forest e XGBoost, com otimização de hiperparâmetros via GridSearchCV e avaliação por matrizes de confusão e curvas ROC. O XGBoost apresentou desempenho superior, com AUC de 0,869 no modelo que incluiu a variável Quantidade de Parcelas e 0,778 sem ela, evidenciando a centralidade dessa feature. Aplicado à carteira ativa de R$ 2,752 bilhões, o modelo identificou que 92,9% do valor total apresentou risco de cancelamento igual ou superior a 50%, com R$ 1,488 bilhão concentrado em parcelamentos de risco extremo, resultado consistente com o comportamento histórico de cancelamentos nas fases iniciais dos acordos. Os resultados demonstraram que a adoção de modelos preditivos na gestão de parcelamentos tributários possibilita a transição de uma postura reativa para uma abordagem preventiva, com potencial de ampliar substantivamente a recuperação fiscal.

Palavras-chave: Administração tributária; Aprendizado de máquina; Classificação binária; Recuperação fiscal; XGBoost.

05 de octubre de 2026

Sistema interativo para geração e comparação de modelos preditivos de concessões mensais de crédito rural

A capacidade de prever o volume futuro de concessões de crédito rural é essencial para a alocação eficiente de recursos e definição de metas de desembolso. O trabalho teve como objetivo desenvolver uma plataforma interativa web para gerar, analisar e comparar modelos preditivos de séries temporais de concessões de crédito rural, abrangendo o período de março de 2011 a janeiro de 2026. Confrontaram-se técnicas de econometria (ARIMA, SARIMA, SARIMAX) e regressão linear com métodos de machine learning (Random Forest, XGBoost). A metodologia incluiu a coleta de dados mensais de concessões de crédito rural, variáveis macroeconômicas e indicadores de commodities agrícolas, seguida de análise exploratória e desenvolvimento da plataforma em arquitetura cliente-servidor com Python e tecnologias web. A aplicação da plataforma à previsão de crédito rural em três cenários (total, pessoa física e pessoa jurídica), avaliada por validação cruzada temporal, revelou que nenhuma técnica se mostrou universalmente superior. Os modelos de regressão linear com defasagem sazonal apresentaram os resultados mais consistentes ao longo de todos os folds, mantendo desempenho estável mesmo em períodos de mudança de patamar, nos quais os algoritmos de árvore de decisão registraram forte degradação. O cenário de pessoa jurídica apresentou baixa previsibilidade em todos os modelos. Os resultados demonstraram que a plataforma cumpriu seu objetivo, revelando que a complexidade algorítmica não garante superioridade preditiva e que a escolha do modelo deve ser guiada pelas características da série e pelo contexto de aplicação.

Palavras-chave: Agronegócio; Forecasting; Machine learning; Modelagem preditiva; Séries temporais.

05 de octubre de 2026

Festivais de música como plataforma de engajamento de marcas com consumidores da geração Z

Festivais de música consolidaram-se como ecossistemas complexos de experiência, nos quais a convergência entre entretenimento físico e narrativas digitais redefine as estratégias de posicionamento de marca. No cenário pós-pandemia, o setor de eventos apresentou uma retomada expressiva, estabelecendo-se como plataforma estratégica para o engajamento com a Geração Z, público que prioriza a autenticidade e a vivência de experiências compartilhadas em detrimento de formatos de publicidade tradicional. O estudo objetivou analisar de que forma as ativações de marca nesses ambientes impactaram o engajamento dos consumidores nascidos entre 1995 e 2010. A metodologia caracterizou-se por uma pesquisa quantitativa e descritiva, realizada por meio da aplicação de um questionário estruturado que obteve a participação de 163 respondentes. Os resultados demonstraram que as estratégias de marketing de experiência, especialmente as que integraram atributos estéticos e potencial de compartilhamento digital, apresentaram as maiores médias de percepção positiva. Verificou-se que a confiança na marca foi fortalecida após interações físicas bem-sucedidas, revelando uma simbiose entre o ambiente emocional do evento e a jornada digital do jovem. Em contraste, a percepção de autenticidade mediada por influenciadores digitais obteve o menor índice de concordância. Concluiu-se que o engajamento da Geração Z foi potencializado por estratégias híbridas que permitiram ao consumidor assumir o papel de protagonista na construção da narrativa da marca, priorizando a autenticidade da vivência direta.

Palavras-chave: Comportamento do consumidor; Consumo cultural; Estratégias transmídia; Influenciadores digitais; Marketing de experiência.

Cumplimiento Y Esg

05 de octubre de 2026

Compliance para mitigar e prevenir furtos em canteiros de obras: Programa de integridade aplicado à construção civil

Furtos em canteiros de obras representam um desafio significativo para a construção civil, gerando impactos financeiros, operacionais e reputacionais. Nesse contexto, programas de integridade e compliance surgiram como ferramentas de gestão para fortalecer a governança e mitigar riscos. O estudo objetivou propor um programa de conformidade aplicado à construção civil, focado na prevenção e mitigação de furtos em canteiros de obras. Adotou-se uma abordagem qualitativa, com apoio quantitativo, desenvolvida em duas etapas. Primeiramente, realizou-se uma pesquisa de campo entre fevereiro e março de 2026, aplicando um questionário eletrônico a profissionais do setor. Em seguida, elaborou-se um estudo de caso fictício, baseado em experiências profissionais do autor, integrando os resultados da pesquisa a práticas de gestão de riscos e governança. Os resultados evidenciaram a importância da implementação de programas de compliance no setor e indicaram que a combinação de mecanismos de controle, processos estruturados, capacitação de equipes, canais de denúncia, monitoramento contínuo e fortalecimento da cultura ética pode reduzir vulnerabilidades. Concluiu-se que a adoção de práticas de integridade amplia a capacidade preventiva das organizações e aprimora a governança e a gestão de riscos no setor.

Palavras-chave: Compliance; Construção civil; Furtos; Gestão de riscos; Governança corporativa.

05 de octubre de 2026

Painel multi-sinal para otimização da priorização de vulnerabilidades em segurança cibernética

A crescente proliferação de vulnerabilidades cibernéticas tornou inadequada a priorização baseada exclusivamente em métricas estáticas de severidade. Desenvolveu-se e avaliou-se um painel analítico multi-sinal para otimizar a priorização de vulnerabilidades cibernéticas, integrando Common Vulnerability Scoring System (CVSS), Exploit Prediction Scoring System (EPSS), critérios derivados do Stakeholder-Specific Vulnerability Categorization (SSVC) e o catálogo Known Exploited Vulnerabilities (KEV) como variável-alvo supervisionada. Consolidaram-se 137.854 registros de vulnerabilidades do NVD (2022–2025), com 607 KEVs confirmados (0,44%), caracterizando um problema de classificação com classe fortemente desbalanceada. Treinou-se um modelo Random Forest supervisionado com dez variáveis não-circulares e avaliou-se por métricas adequadas ao desbalanceamento. O modelo alcançou AUC-ROC de 0,9869 e AUC-PR de 0,4959, superando o EPSS isolado em ambas as métricas (AUC-ROC=0,9383 e AUC-PR=0,3231). A análise de discrepâncias com a abordagem determinística do SSVC revelou que 83,4% das vulnerabilidades foram sobrepriorizadas. Dos 4.584 CVEs classificados como P0, 4.029 representaram vulnerabilidades de alto risco iminente não confirmadas como exploradas, sinalizadas pelo modelo. Concluiu-se que a abordagem multi-sinal vai além da consulta ao catálogo KEV, identificando vulnerabilidades com alto potencial de exploração futura e orientando a priorização proativa de remediação.

Palavras-chave: Exploit prediction; Gestão de riscos; Gestão de vulnerabilidades; Known Exploited Vulnerabilities (KEV); Random Forest.

Neurociencia Y Aprendizaje En La Educación

05 de octubre de 2026

Meditação: uma ferramenta que colabora com o professor em sala de aula

O estudo objetivou levantar as práticas meditativas, seus benefícios, limitações e possibilidades de aplicação no contexto escolar, com foco científico e em publicações existentes, visando ampliar estratégias de promoção da saúde mental e bem-estar de estudantes e professores. Realizou-se uma pesquisa exploratória e descritiva, de abordagem qualitativa, fundamentada em revisão bibliográfica de artigos científicos, livros e documentos publicados nos últimos dez anos, e em relatos de experiência da pesquisadora. A metodologia incluiu a definição científica de meditação e a análise de estudos sobre meditação e atenção plena em ambientes escolares, incorporando contribuições da neurociência, mas evitando reducionismos biológicos da aprendizagem. Como resultado principal, elaborou-se uma Cartilha de Práticas Meditativas para Professores, concebida como material de apoio pedagógico complementar. Os achados indicaram que a meditação pode contribuir para a redução de sintomas de estresse, ansiedade e depressão, além de favorecer a atenção, autorreflexão, empatia e convivência. Concluiu-se que a cartilha oferece orientações simples e adaptáveis para a sala de aula, sendo uma ferramenta complementar que não substitui intervenções pedagógicas ou políticas públicas. A sustentabilidade dessas práticas requer articulação com o projeto pedagógico, apoio institucional e formação docente, integrando neurociência, pedagogia e experiência prática para uma educação mais atenta às dimensões cognitivas, emocionais, sociais e existenciais dos alunos.

Palavras-chave: Ambiente escolar; Atenção plena; Meditação; Neurociência; Saúde mental.