26 de febrero de 2026
Modelado Predictivo de Incumplimiento con Algoritmos Supervisados de Machine Learning
João Gabriel de Medeiros Luz Pedro; Carlos Nabil Ghobril
Resumen elaborado por la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege orientada a la síntesis y redacción.
El objetivo de esta investigación fue analizar y tratar un conjunto de datos del Banco Central de Brasil (Bacen) para implementar, entrenar y validar modelos de Machine Learning, utilizando los algoritmos supervisados CatBoost, Random Forest y XGBoost, con el fin de medir la capacidad predictiva en la identificación de incumplimiento. La complejidad del escenario económico brasileño, con el aumento del endeudamiento familiar, exige que las instituciones financieras posean herramientas precisas para la gestión del riesgo de crédito. La capacidad de anticipar el comportamiento de pago de los consumidores es un pilar para la sostenibilidad del sector, y la aplicación de técnicas de ciencia de datos surge como solución para mejorar la precisión de los análisis.
El panorama del endeudamiento en Brasil justifica la urgencia de estudios en el área. Datos de la Encuesta de Endeudamiento e Incumplimiento del Consumidor (PEIC) de abril de 2024 muestran que el 78,5% de las familias brasileñas poseían deudas, y el 12,1% admitieron no tener condiciones de honrar sus compromisos (CNC, 2024). Una encuesta de la CNDL y del SPC Brasil registró 68,62 millones de brasileños en mora, lo que corresponde al 41,51% de la población adulta (Poder360, 2024). Estas cifras señalan un riesgo sistémico que puede afectar la estabilidad de las instituciones financieras. Una práctica que contribuye al endeudamiento es la extensión de los plazos de pago, que compromete la renta futura y aumenta la probabilidad de incumplimiento en escenarios de inestabilidad (CNC, 2024). Ante esto, el análisis de crédito tradicional, basado en reglas estáticas, es insuficiente. La necesidad de mejorar los mecanismos de análisis de riesgo es imperativa para mitigar pérdidas.
La presente investigación propone un enfoque basado en aprendizaje automático para la predicción de incumplimiento. La utilización de algoritmos supervisados permite la construcción de modelos que aprenden patrones a partir de datos históricos, identificando relaciones no lineales que serían difíciles de detectar por métodos estadísticos convencionales (Kotsiantis, 2007). Uno de los desafíos técnicos enfrentados fue la presencia de un gran número de variables categóricas, como ‘ocupación’, ‘modalidad’ de crédito y ‘uf’, que son cruciales para la caracterización del perfil del cliente, pero exigen tratamientos específicos para ser utilizadas por algoritmos como Random Forest y XGBoost. La elección de técnicas de preprocesamiento y la selección de características fueron etapas fundamentales para garantizar la generación de modelos predictivos robustos.
El alcance del trabajo abarcó un ciclo completo de un proyecto de ciencia de datos: extracción y tratamiento de los datos, análisis exploratorio, entrenamiento, evaluación y comparación de múltiples modelos de Machine Learning. La validación de los resultados se realizó mediante métricas como precisión, F1-Score y el área bajo la curva ROC (AUC-ROC), garantizando una evaluación objetiva del rendimiento de cada algoritmo. El estudio buscó identificar el modelo más eficaz para el escenario propuesto, proporcionando una base para la implementación de sistemas de apoyo a la decisión en instituciones financieras.
La metodología se inició con la recopilación de datos históricos de crédito del Sistema de Información de Crédito (SCR) del Bacen (Banco Central de Brasil, 2024). El conjunto de datos inicial comprendía 12 archivos CSV, correspondientes a los meses de 2024. Para la manipulación y procesamiento, se utilizó el framework Apache Spark, que permitió la unificación y limpieza de los archivos, incluyendo la eliminación de filas mal formateadas y la especificación del separador de columnas y codificación (UTF-8). La etapa de preprocesamiento es fundamental, ya que la eficacia de los algoritmos depende de la calidad de los datos de entrada (Fávero & Belfiore, 2024). Tras la limpieza, se realizó la estandarización de los formatos numéricos, sustituyendo comas por puntos como separador decimal y eliminando los separadores de miles. El conjunto de datos consolidado se almacenó en el formato Apache Parquet, optimizado para operaciones de lectura. La infraestructura tecnológica incluyó el lenguaje Python en el IDE Spyder y bibliotecas como Pandas, Matplotlib, Seaborn, y los frameworks CatBoost, Random Forest y XGBoost.
El análisis exploratorio de datos (EDA) se realizó para comprender la estructura del conjunto de datos, compuesto por 13 variables categóricas y 12 numéricas. La variable objetivo, vencidopor encimade15días, se transformó en una variable binaria (0 para cumplidor, 1 para incumplidor), encuadrando el problema como clasificación binaria. Se realizó un análisis de correlación para el conjunto de datos completo y para un subconjunto enfocado en clientes Persona Física (PF), ya que los clientes Persona Jurídica (PJ) tienen perfiles distintos. El análisis reveló que la proporción de incumplimiento era mayor en el grupo de PF. Las visualizaciones gráficas exploraron la relación entre el incumplimiento y variables como UF, indexador y modalidad de crédito, confirmando la relevancia de estas características.
La selección de los algoritmos se basó en su eficacia en problemas de clasificación. El Random Forest fue elegido por su robustez contra el overfitting, obtenida por la agregación de árboles de decisión (Breiman, 2001). El XGBoost fue seleccionado por su alto rendimiento y velocidad, siendo una implementación optimizada del gradient boosting (Chen & Guestrin, 2016; Friedman, 2001). El CatBoost fue incluido por su capacidad nativa de manejar variables categóricas, simplificando el preprocesamiento (Prokhorenkova et al., 2018). La evaluación del rendimiento utilizó Precisión, Exactitud, Sensibilidad y F1-Score. Adicionalmente, la curva ROC y el cálculo del AUC-ROC se utilizaron para evaluar la capacidad discriminatoria de los modelos (Fawcett, 2006). Para garantizar la robustez, se empleó la validación cruzada k-fold, que mitiga el riesgo de que el rendimiento dependa de una división específica entre entrenamiento y prueba (Fávero & Belfiore, 2024).
Los resultados obtenidos revelaron desempeños distintos. El CatBoost Classifier demostró un rendimiento superior, exigiendo un ajuste mínimo de hiperparámetros y un preprocesamiento simplificado. Su principal ventaja fue el manejo nativo de variables categóricas. La matriz de confusión inicial mostró una alta tasa de aciertos, y la curva AUC-ROC presentó valores cercanos a 1.0 para entrenamiento y prueba, con una AUC de 0.99, señalando una excelente capacidad de discriminación y ausencia de overfitting. El análisis de importancia de las variables indicó que la característica carteraincumplidaarrastada poseía la mayor significancia. Sin embargo, su alta correlación con la variable objetivo podría llevar a una fuga de datos conceptual. Para investigar este efecto, se realizó un segundo entrenamiento del CatBoost eliminando esta variable. Los resultados mostraron una leve caída en el rendimiento, pero el gráfico de importancia de las variables se volvió más distribuido, con otras características como activo_problematico y modalidad ganando relevancia. La validación cruzada k-fold confirmó la estabilidad y robustez de los resultados en ambas versiones del modelo.
El Random Forest Classifier presentó resultados satisfactorios, pero inferiores a los del CatBoost. La implementación requirió un preprocesamiento más intensivo, con eliminación de variables con alta multicolinealidad y la transformación de variables categóricas mediante one-hot encoding. Este proceso aumentó la dimensionalidad del dataset, resultando en un mayor tiempo de entrenamiento. La matriz de confusión y la curva AUC-ROC del Random Forest indicaron un buen poder predictivo, pero con valores de AUC ligeramente inferiores a los del CatBoost. El XGBoost Classifier, utilizando el mismo preprocesamiento del Random Forest, demostró un rendimiento notable, superando al Random Forest en todas las métricas y acercándose al CatBoost. Su ventaja más evidente fue la velocidad de procesamiento, significativamente más rápida que el Random Forest. La curva AUC-ROC del XGBoost también presentó valores excelentes, y la robustez del modelo fue confirmada por la validación cruzada.
En análisis comparativo, CatBoost se destacó como el algoritmo de mejor rendimiento general. Su ventaja reside en la combinación de alta precisión con la simplicidad en el preprocesamiento de variables categóricas. XGBoost emergió como una alternativa fuerte, con un rendimiento casi tan bueno como el de CatBoost y una velocidad superior a la de Random Forest. Random Forest, aunque robusto, se mostró menos adecuado para este escenario, debido a su sensibilidad al preprocesamiento de categóricas y al mayor costo computacional. La discusión de los resultados evidencia que la elección del algoritmo debe adaptarse a las características de los datos y a los requisitos del problema.
La superioridad de los algoritmos basados en boosting de gradiente (XGBoost y CatBoost) sobre el método de bagging (Random Forest) sugiere que la construcción secuencial de árboles; cada nuevo árbol corrige los errores del anterior, fue más eficaz para capturar los patrones de incumplimiento. El rendimiento de CatBoost refuerza la importancia de algoritmos con mecanismos optimizados para características categóricas, un desafío común en conjuntos de datos financieros. La necesidad de aplicar one-hot encoding para Random Forest y XGBoost aumentó la complejidad computacional y pudo haber diluido el poder informativo de algunas variables. La importancia de las variables revelada por los modelos ofrece perspectivas para la gestión de riesgos. Características como carteraincumplidaarrastada y activo_problematico fueron los predictores más fuertes, pero la capacidad de los modelos para extraer poder de otras variables, como modalidad de crédito e indexador, demuestra el potencial del Machine Learning. La identificación de que ciertas modalidades de crédito están más asociadas al incumplimiento puede permitir que las instituciones financieras ajusten sus políticas de forma más granular.
La robustez de los modelos, confirmada por la validación cruzada, es crucial para su aplicabilidad en el mundo real. La consistencia del rendimiento de CatBoost y XGBoost a través de las diferentes divisiones de la validación indica que los modelos aprendieron patrones generalizables, no solo ruido del conjunto de entrenamiento. Esto confiere mayor confiabilidad a los resultados y seguridad para su implementación en sistemas de producción. La investigación, por lo tanto, valida un proceso metodológico riguroso que puede ser replicado por instituciones financieras para desarrollar sus propias soluciones de modelado predictivo.
Este trabajo demostró la viabilidad y eficacia de aplicar modelos de Machine Learning para la predicción de incumplimiento con datos del Banco Central de Brasil. El proceso abarcó desde el tratamiento riguroso de los datos hasta la implementación y comparación de tres algoritmos supervisados. El análisis exploratorio fue fundamental para dirigir tratamientos específicos, como el enfoque en clientes persona física. La comparación entre los modelos reveló que, para el conjunto de datos analizado, el algoritmo CatBoost obtuvo los mejores resultados globales. Su capacidad para manejar nativamente variables categóricas simplificó el preprocesamiento y resultó en un modelo con excelente precisión y confiabilidad. El XGBoost también presentó un desempeño excepcional, posicionándose como una alternativa competitiva. El Random Forest, a pesar de generar resultados aceptables, fue el menos performático y el más costoso en tiempo de procesamiento. Se concluye que el objetivo fue alcanzado: se demostró que los algoritmos de boosting, especialmente el CatBoost, junto con un preprocesamiento de datos adecuado, ofrecen una solución robusta y precisa para la predicción de incumplimiento, pudiendo mejorar las estrategias de riesgo de crédito en instituciones financieras.
Referencias:
Banco Central do Brasil (BACEN). 2024. Disponible en: <https://dadosabertos. bcb. gov. br/dataset/scrdata>. Acceso en: 03 abr. 2025.
Breiman, L. (2001). Random Forests. Machine Learning, 45(1), 5–32. doi: 10.1023/A:1010933404324.
Chen, T.; Guestrin, C. 2016. XGBoost: A scalable tree boosting system. 1. ed. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 785-794.
(CNC) Confederação Nacional do Comércio de Bens, Serviços e Turismo. 2024. Pesquisa de Endividamento e Inadimplência do Consumidor (Peic) – abril de 2024. Disponible en: <https://portaldocomercio. org. br/publicacoesposts/pesquisa-de-endividamento-e-inadimplencia-do-consumidor-peic-abril-de-2024/:>. Acceso en: 03 abr. 2025.
Fávero, L. P.; Belfiore, P. 2024. Manual de Análise de Dados: estatística e Machine Learning com EXCEL®, SPSS®, STATA®, R® e Python®. 2ed. LTC, Rio de Janeiro, RJ, Brasil.
Fawcett, T. (2006). An Introduction to ROC Analysis. Pattern Recognition Letters, 27(8), 861–874. doi: 10.1016/j. patrec.2005.10.010.
Friedman, J. H. (2001). Greedy Function Approximation: A Gradient Boosting Machine. Annals of Statistics, 29(5), 1189–1232. doi: 10.1214/aos/1013203451.
Kotsiantis, S. B. (2007). Supervised Machine Learning: A Review of Classification Techniques. Informatica, 31(3), 249–268.
Poder360. 2024. Inadimplência no Brasil atinge 41,51% da população adulta em novembro. Disponible en:<https://www. poder360. com. br/poder-economia/inadimplencia-no-brasil-atinge-4151-da-populacao-adulta-em-novembro/>. Acceso en: 17 jun. 2025.
Prokhorenkova, L.; Gusev, G.; Vorobev, A.; Dorogush, A. V.; Gulin, A. 2018. CatBoost: unbiased boosting with categorical features. 1. ed. Advances in Neural Information Processing Systems (NeurIPS)., 31.
Resumen ejecutivo del Trabajo de Conclusión de Curso de Especialización en Data Science y Analytics del MBA USP/Esalq
Más información sobre el curso; haga clic aquí: