16 de enero de 2026
Análisis comparativo de técnicas de Machine Learning para predicción de incumplimiento
Autor/a: Luciane Berger da Silva — Director/a: Daniel Alvarez Firmino
Resumen elaborado por la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege orientada a la síntesis y redacción.
Este estudio analiza y compara el rendimiento de algoritmos de machine learning en la predicción de morosidad en crédito. La investigación compara modelos lineales (regresión logística) y basados en árboles (árbol de decisión, random forest), investigando el efecto de estrategias de preprocesamiento, como imputación de valores ausentes y balanceo de clases. El objetivo es identificar los modelos más adecuados, considerando métricas de rendimiento y aplicabilidad práctica para instituciones financieras, especialmente en escenarios de datos desbalanceados, característicos de riesgo de crédito.
La concesión de crédito es fundamental para la economía, pero implica el riesgo de incumplimiento, el no cumplimiento de las obligaciones contractuales por parte del prestatario (Baesens et al., 2016). La gestión eficaz de este riesgo es crucial para la sostenibilidad de las instituciones financieras. Las herramientas de análisis predictivo son indispensables para identificar patrones de riesgo basados en datos históricos, permitiendo medidas preventivas como el ajuste de límites o la denegación de operaciones de alto riesgo (Lessmann et al., 2015; Pinto et al., 2024).
La literatura sobre riesgo de crédito transita de modelos estadísticos tradicionales a algoritmos de machine learning. Métodos basados en árboles, como random forest, demuestran mejor desempeño al capturar interacciones no lineales (Aniceto et al., 2020). Sin embargo, la Regresión Logística mantiene su prominencia en el sector financiero debido a su interpretabilidad y aceptación regulatoria (Bücker et al., 2020). El desafío es conciliar el poder predictivo de modelos avanzados con la necesidad de transparencia, motivando investigaciones en enfoques híbridos (Dumitrescu et al., 2022).
A pesar de los avances, persisten lagunas en la aplicación de estas técnicas. Muchos estudios no exploran el impacto del tratamiento de datos desbalanceados, una característica común en bases de incumplimiento, donde la clase cumplidora es mayoritaria. El desbalanceamiento puede inducir a los algoritmos a un sesgo en favor de la clase mayoritaria, resultando en modelos con alta precisión general, pero baja capacidad de identificar los casos de incumplimiento. Este trabajo contribuye a la literatura al ofrecer un análisis comparativo sistemático que evalúa diferentes algoritmos e investiga cómo las estrategias de preprocesamiento, especialmente las de balanceo de clases, influyen en el rendimiento predictivo. Al analizar los resultados bajo múltiples métricas, el estudio busca proporcionar ideas prácticas para instituciones financieras sobre cómo seleccionar y configurar modelos que se alineen a sus objetivos, ya sea maximizando el rendimiento o minimizando pérdidas por falsos negativos.
La metodología es una investigación cuantitativa aplicada, que utiliza técnicas de machine learning supervisado para comparar enfoques predictivos en la identificación de clientes con riesgo de incumplimiento. Se utilizó la base de datos pública “Give me Some Credit” (Freshcorn, 2011), con 150.000 registros anonimizados y variables conductuales. Aunque el origen norteamericano de la base limita la generalización al contexto brasileño, su volumen y uso en estudios académicos la convierten en un entorno robusto para validar técnicas de modelado en escenarios de datos desbalanceados.
El preprocesamiento de los datos comenzó con el análisis de valores ausentes, presentes en las variables de ingresos (19,82%) y cantidad de dependientes (2,62%). Una prueba de chi-cuadrado indicó que la ausencia no era aleatoria. Se evaluaron cuatro estrategias de tratamiento: exclusión de los registros; imputación por la mediana; imputación mediante K-Vecinos Más Cercanos (KNN); e imputación interactiva (MICE). Cada enfoque generó una versión de la base de datos para el análisis comparativo del impacto del tratamiento de datos ausentes en el rendimiento de los modelos.
El desequilibrio de la variable objetivo, con solo el 7% de morosos, fue otro desafío. Para mitigar el riesgo de sesgo a favor de la clase mayoritaria, se probaron tres estrategias de balanceo: ninguna (línea base); submuestreo (undersampling), que reduce la clase mayoritaria; y sobremuestreo de minoría sintética (SMOTE), que genera observaciones sintéticas de la clase minoritaria (He y Garcia, 2009). La comparación evaluó el impacto de cada una en métricas sensibles al desequilibrio, como sensibilidad y F1-score.
La base de datos se dividió en 70% para entrenamiento y 30% para prueba, de forma estratificada. Se implementaron tres algoritmos de clasificación (Kotsiantis, 2007): regresión logística (interpretabilidad), árbol de decisión (patrones no lineales) (Grus, 2021) y random forest (robustez y generalización) (Breiman, 2001). Los hiperparámetros se optimizaron con RandomizedSearchCV, GridSearchCV y validación cruzada de 5 pliegues. El rendimiento se evaluó en el conjunto de prueba con un conjunto completo de métricas: Área Bajo la Curva ROC (AUC-ROC), Área Bajo la Curva Precisión-Sensibilidad (AUC-PR), índice de Gini, exactitud, precisión, sensibilidad, F1-score, Coeficiente de Correlación de Matthews (MCC) y Brier score, garantizando un análisis multidimensional.
Los resultados de la regresión logística mostraron que la regularización L2 (Ridge) fue la mejor configuración, lo cual se espera en escenarios con multicolinealidad (Hastie et al., 2009). El mantenimiento de todas las variables se justificó por la búsqueda de un rendimiento predictivo global (Fávero y Belfiore, 2017). La estrategia de exclusión de registros ausentes, sin balanceo o con undersampling, produjo los mejores resultados globales, con AUC-ROC de 0,803 y sensibilidad de 0,627. Las técnicas de imputación (mediana, KNN, MICE) tuvieron un impacto marginal. El uso de SMOTE elevó la sensibilidad a 0,670, pero perjudicó la precisión y la exactitud. Sin embargo, la combinación de MICE con SMOTE alcanzó el mejor Brier score (0,168), indicando una calibración superior. Esto evidencia un trade-off: la exclusión de datos favorece el rendimiento general, mientras que MICE y SMOTE pueden ser preferibles cuando la reducción de falsos negativos y la calibración son prioritarias.
El modelo de árbol de decisión, sin balanceo, exhibió alta precisión (0,933) pero sensibilidad nula, fallando en identificar morosos, un fenómeno documentado (Breiman et al., 1984). El uso de SMOTE promovió ganancias, elevando la sensibilidad a aproximadamente 0,30. La combinación de imputación por la mediana con SMOTE presentó el mejor equilibrio, con AUC-ROC de 0,836 y Brier score de 0,057. Por su parte, el undersampling maximizó la sensibilidad (cercana a 0,77), pero con una caída expresiva en la precisión y empeoramiento en la calibración, reforzando el trade-off entre detectar morosos y mantener la robustez general (Thomas et al., 2017).
El bosque aleatorio fue el algoritmo más robusto, con un AUC-ROC consistente alrededor de 0,86. Para el rendimiento global, la combinación de imputación por mediana sin balanceo destacó, con un AUC-ROC de 0,861, un AUC-PR de 0,384 y una puntuación de Brier de 0,126. Para minimizar los falsos negativos, la imputación por mediana con submuestreo fue la más eficaz, alcanzando la mayor sensibilidad del estudio (0,795) y el mejor AUC-ROC (0,864), aunque con pérdidas en precisión. En contraste, las estrategias con SMOTE maximizaron la precisión, pero redujeron la sensibilidad.
La comparación final, utilizando AUC-PR como criterio principal debido al desbalanceo, confirmó la superioridad del random forest para el rendimiento global. Este modelo presentó el mejor equilibrio, con la mayor AUC-PR (0,384), sensibilidad de 0,418 y el menor Brier score (0,126), indicando una excelente discriminación y calibración. La regresión logística superó al árbol de decisión en sensibilidad, pero con pérdidas en otras métricas, corroborando estudios que señalan a los ensembles como más estables (Isidoros y Arcozzi, 2024). En el análisis enfocado en la minimización de falsos negativos (sensibilidad), los modelos basados en árboles fueron superiores. El random forest lideró con una sensibilidad de 0,795, seguido por el árbol de decisión con 0,779. Ambos incurrieron en costos de precisión y calibración, ejemplificando el trade-off en la gestión de riesgos: reducir falsos negativos mitiga pérdidas de capital, mientras que el aumento de falsos positivos puede llevar a la pérdida de oportunidades de negocio.
La relevancia de las variables y el rendimiento de los modelos deben contextualizarse. La significancia de las variables tradicionales puede disminuir en escenarios de shock económico (Gambacorta et al., 2024), y el rendimiento puede mejorarse con datos alternativos, como información psicométrica, especialmente para poblaciones con historial crediticio limitado (Djeundje et al., 2021). La elección de un modelo no debe basarse únicamente en métricas estadísticas. Los modelos con alta precisión no siempre minimizan los costos regulatorios y de capital asociados a los errores (Xia et al., 2022). La decisión final debe integrar el análisis estadístico con los objetivos estratégicos de la institución, considerando los costos financieros de cada tipo de error. Este estudio proporciona un marco para este análisis, demostrando cómo diferentes combinaciones de algoritmos y preprocesamiento se alinean con diferentes apetitos de riesgo.
El trabajo demostró que no existe un modelo universalmente superior para la predicción de incumplimiento, sino compensaciones entre rendimiento, interpretabilidad e impacto operativo. La regresión logística demostró ser un benchmark competitivo y transparente. Los árboles de decisión, sensibles al desequilibrio, mejoraron con técnicas de remuestreo. El random forest fue el modelo más equilibrado y robusto, con los mejores rendimientos globales en discriminación (AUC-ROC ≈ 0,86) y calibración. El análisis evidenció el papel crítico del preprocesamiento: el undersampling fue más eficaz para aumentar la sensibilidad, mientras que el SMOTE, en algunos escenarios, favoreció la precisión, resaltando la necesidad de alinear la metodología a los objetivos estratégicos.
Las limitaciones del estudio incluyen el uso de una única base de datos norteamericana y la no exploración de algoritmos como gradient boosting o redes neuronales. Investigaciones futuras pueden expandir el análisis a bases de datos brasileñas, incorporar otros modelos e integrar métricas de costo de error para cuantificar el impacto financiero. Se concluye que el objetivo fue alcanzado: se demostró que la elección del algoritmo de machine learning y de las estrategias de preprocesamiento de datos para la predicción de incumplimiento depende fundamentalmente de los objetivos estratégicos de la institución financiera, evidenciando un claro trade-off entre rendimiento predictivo global y la minimización de pérdidas por falsos negativos.
Referencias:
Aniceto, G. F.; Barboza, F. L. C.; Kimura, H. 2020. Análisis de riesgo crediticio utilizando clasificadores de aprendizaje automático. Brazilian Review of Finance 18(4): 1–28.
Baesens, B.; Roesch, D.; Scheule, H. 2016. Credit risk analytics: measurement techniques, applications and examples in SAS. John Wiley & Sons, Hoboken, NJ, EUA.
Breiman, L. 1984. Classification and regression trees. Chapman & Hall/CRC, Boca Raton, FL, EUA.
Breiman, L. 2001. Random forests. Machine Learning 45(1): 5–32.
Bücker, M.; Szepannek, G.; Gosiewska, A.; Biecek, P. 2020. Transparency, auditability and explainability of machine learning models in credit scoring. Journal of the Operational Research Society 71(8): 1281–1290.
Carvalho, J. R. 2015. Análisis de riesgo crediticio: fundamentos, metodologías y aplicaciones. Atlas, São Paulo, SP, Brasil.
Djeundje, V . B.; Crook, J.; Calabrese, R.; Hamid, M. 2021. Enhancing credit scoring with alternative data. Expert Systems with Applications 167: 113766.
Dumitrescu, E.; Hué, S.; Hurlin, C.; Tokpavi, S. 2022. Machine learning for credit scoring: improving logistic regression with non-linear decision-tree effects. European Journal of Operational Research 297(3): 1178–1192.
Fávero, L. P.; Belfiore, P. P. 2017. Manual de análisis de datos: estadística y modelado multivariante con Excel®, SPSS® y Stata®. Elsevier, Rio de Janeiro, RJ, Brasil.
Fávero, L. P.; Belfiore, P. P. 2024. Análisis de datos: técnicas multivariantes exploratorias y confirmatorias. Elsevier, Rio de Janeiro, RJ, Brasil.
Freshcorn, B. 2011. Give Me Some Credit: 2011 Competition Data. Disponible en: https://www.kaggle.com/datasets/brycecf/give-me-some-credit-dataset.
Gambacorta, L.; Huang, Y.; Qiu, H.; Wang, J. 2024. How do machine learning and non-traditional data affect credit scoring? New evidence from a Chinese fintech firm. Journal of Financial Stability 73: 101284.
Grus, J. 2021. Data science do zero: noções fundamentais com Python. 2ed. Alta Books, Rio de Janeiro, RJ, Brasil.
Hastie, T.; Tibshirani, R.; Friedman, J. 2009. The elements of statistical learning: data mining, inference, and prediction. 2ed. Springer, New York, NY, EUA.
He, H.; Garcia, E. A. 2009. Learning from imbalanced data. IEEE Transactions on Knowledge and Data Engineering 21(9): 1263–1284.
Hosmer, D. W.; Lemeshow, S.; Sturdivant, R. X. 2013. Applied logistic regression. 3ed. John Wiley & Sons, Hoboken, NJ, EUA.
ISIDOROS, I.; ARCOZZI, N. 2024. Improved convergence rates for some kernel random forest algorithms. Mathematics in Engineering 6(2): 1-22.
Kotsiantis, S. B. 2007. Supervised machine learning: a review of classification techniques. Informatica 31(3): 249–268.
Lessmann, S.; Baesens, B.; Seow, H. V.; Thomas, L. C. 2015. Benchmarking state-of-the-art classification algorithms for credit scoring: an update of research. European Journal of Operational Research 247(1): 124–136.
Pinto, R. S.; Ywata, A.; Tessmann, R. H.; Lima, F. 2024. Are machine learning models more effective than logistic regressions in predicting bank credit risk? An assessment of the Brazilian financial markets. International Journal of Monetary Economics and Finance 17(1): 1–22.
Thomas, L. C.; Crook, J. N.; Edelman, D. B. 2017. Credit scoring and its applications. 2ed. SIAM, Philadelphia, PA, EUA.
Xia, Y.; Zhang, C.; Li, Y.; Chen, W. 2022. A comparative study of credit scoring models. Knowledge-Based Systems 235: 107629.
Zou, H.; Hastie, T. 2005. Regularization and variable selection via the elastic net. Journal of the Royal Statistical Society: Series B (Statistical Methodology) 67(2): 301–320.
Resumen ejecutivo del Trabajo de Conclusión de Curso de Especialización en Data Science y Analytics del MBA USP/Esalq
Más información sobre el curso; haga clic aquí: