02 de octubre de 2026
Clasificación de clientes morosos mediante técnicas supervisadas de aprendizaje automático
Clasificación de Clientes Morosos por Medio de Técnicas Supervisadas de Aprendizaje Automático
Felipe Ricardo Huergo Cagol; Ugo Henrique Pereira da Silva
DOI: 10.22167/2675-6528-202602895
Artículo derivado de Trabajo de Fin de Curso (TCC), con contenido basado en el trabajo original del estudiante y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, una solución de inteligencia artificial desarrollada por el Instituto Pecege para la síntesis y organización textual.
Resumen
El riesgo de incumplimiento en operaciones de crédito demandó enfoques analíticos para anticipar pérdidas. Este estudio evaluó comparativamente el desempeño de modelos supervisados de aprendizaje automático en la clasificación de clientes incumplidos en operaciones de tarjeta de crédito. Se utilizó la base pública “Default of Credit Card Clients”, de la Universidad de California Irvine, con 30.000 observaciones y desbalanceo de clases. Se emplearon los algoritmos Regresión Logística, Random Forest y Extreme Gradient Boosting. El desbalanceo se trató mediante la asignación de pesos a las clases, y la optimización de los modelos se realizó con el método RandomizedSearchCV, priorizando la sensibilidad. Los resultados de la validación cruzada indicaron que el modelo Extreme Gradient Boosting presentó mayor capacidad de identificación de la clase incumplida y mejor desempeño discriminatorio, seguido por Random Forest y Regresión Logística, con una sensibilidad de 0,8250 y un AUC-ROC de 0,7844 para el XGBoost. El análisis de interpretabilidad, realizado por la técnica Shapley Additive Explanations (SHAP), evidenció la predominancia de variables asociadas al comportamiento de pago, especialmente el historial de retrasos. Se concluyó que los modelos basados en árboles, particularmente las técnicas de boosting, resultaron más adecuados para capturar patrones complejos en los datos, configurándose como alternativas consistentes para la gestión de riesgo de crédito.
Palabras clave: Aprendizaje Automático; Tarjeta de Crédito; Clasificación; Extreme Gradient Boosting; Riesgo de Crédito.
1. Introducción
La concesión de límite de crédito en operaciones con tarjeta de crédito representa una decisión estratégica que impacta directamente el riesgo financiero de las instituciones. A diferencia de otras modalidades de crédito, las operaciones con tarjeta no poseen garantías reales ni mecanismos automáticos de retención de pago, como se observa en el crédito de nómina. En consecuencia, las opciones para la recuperación de valores impagados son más restringidas, limitándose frecuentemente a la inclusión del cliente en registros de protección al crédito.
Este segmento de mercado se caracteriza por una alta competencia y por fuentes de ingresos limitadas, provenientes principalmente de las tarifas cobradas por el uso de la tarjeta y de los intereses de la financiación rotatoria en casos de incumplimiento. Tal escenario genera un trade-off inherente entre el rigor en la concesión de crédito y la necesidad de expandir la escala de mercado. Ante esto, se acentúa la relevancia de los enfoques cuantitativos en el soporte a la toma de decisiones en la gestión de riesgo de crédito, buscando equilibrar el control del incumplimiento con el retorno financiero deseado por la entidad.
Históricamente, la gestión del riesgo crediticio se ha basado en métodos estadísticos tradicionales, como la Regresión Logística. La elección de estos modelos se justifica por su interpretabilidad y bajo costo computacional, además de estar alineada con los requisitos de constitución de provisiones para créditos de liquidación dudosa (PCLD) y las directrices del Comité de Basilea (BCB, 2021; BCBS, 2004; Hand y Henley, 1997). Sin embargo, el avance de la capacidad computacional ha impulsado la adopción de algoritmos de aprendizaje automático en la minería de datos crediticios, elevando la precisión de las predicciones. Estudios recientes demuestran la eficacia de estos modelos en la predicción de incumplimiento, destacando técnicas basadas en gradiente boosting (Aarfi et al., 2024; Bentéjac et al., 2021).
A pesar de los avances, la literatura señala limitaciones metodológicas derivadas del desbalanceo natural de las carteras de crédito. En estos contextos, la priorización de la precisión global puede resultar en evaluaciones engañosas, ya que los algoritmos tienden a negligir la clase minoritaria de malos pagadores (Brown y Mues, 2012). Para mitigar este problema, se emplean comúnmente enfoques como la creación de datos sintéticos, por medio de la técnica Synthetic Minority Over-sampling Technique (SMOTE) (Chawla et al., 2002). Sin embargo, estudios alertan que la generación artificial de muestras puede introducir limitaciones relacionadas con la representatividad de los datos, impactando la capacidad de generalización del modelo (Marqués et al., 2012).
Adicionalmente, es crucial profundizar el análisis sobre el impacto financiero de los errores de predicción. En escenarios reales, el costo de un falso negativo, que ocurre al conceder crédito a un mal pagador, es superior al costo de un falso positivo, que corresponde a negar crédito a un buen pagador (Islam et al., 2018; Ling y Sheng, 2011). Esto se debe a que las pérdidas financieras generadas por un cliente moroso exigen la constitución de PCLD, afectando el resultado bancario y el Capital Regulatorio. Ante la necesidad de alinear los modelos predictivos al apetito por el riesgo de las instituciones financieras y de considerar el costo distinto de cada tipo de error, este trabajo busca analizar el trade-off entre precisión y sensibilidad en la concesión de límite de tarjeta de crédito, así como evaluar si los modelos de ensemble superan los enfoques tradicionales en el tratamiento del desbalanceo de los datos.
De esta forma, este estudio tiene como objetivo investigar analíticamente el rendimiento predictivo y la mecánica de decisión de tres técnicas de aprendizaje supervisado, la Regresión Logística, el Random Forest y el Extreme Gradient Boosting (XGBoost), aplicando metodologías sensibles al costo sobre un conjunto de datos público de la Universidad de California (UCI). Se busca evaluar cómo diferentes algoritmos se comportan ante el desbalanceo estructural de las clases y de qué forma el ajuste del umbral de decisión puede mitigar pérdidas. De forma complementaria, se busca identificar los factores asociados a la morosidad a través del uso de la técnica Shapley Additive Explanations (SHAP), la cual permite mensurar la contribución de cada variable a las predicciones del modelo, así como la dirección y la magnitud de su impacto en el resultado final.
2. Material y Métodos
Este estudio se caracterizó como una investigación exploratoria y cuantitativa, con un diseño experimental, utilizando datos secundarios públicos. Tuvo como objetivo investigar analíticamente el rendimiento predictivo y la mecánica de decisión de tres técnicas de aprendizaje supervisado, la Regresión Logística, el Random Forest y el Extreme Gradient Boosting (XGBoost), aplicando metodologías sensibles al costo. Se buscó evaluar el comportamiento de los algoritmos ante el desbalance estructural de las clases y el impacto del ajuste del umbral de decisión en la mitigación de pérdidas, además de identificar los factores asociados a la morosidad a través de la técnica Shapley Additive Explanations (SHAP).
La recopilación de datos se realizó mediante la importación de la base pública “Default of Credit Card Clients”, proporcionada por la Universidad de California Irvine (UCI). Este conjunto de datos, referente a operaciones de tarjetas de crédito de una institución financiera de Taiwán, fue recopilado en el año 2005. La elección de datos públicos se debió a restricciones de confidencialidad y directrices de la Ley General de Protección de Datos Personales (LGPD), evitando el uso de datos corporativos propietarios.
El conjunto de datos utilizado comprendió 30.000 instancias, caracterizadas por un desequilibrio entre las clases de pagadores y no pagadores. La base estuvo compuesta por 23 variables explicativas y una variable respuesta. Las variables explicativas incluyeron cuatro atributos demográficos y 19 atributos numéricos, mientras que la variable respuesta era binaria, indicando pago o impago en el mes subsiguiente.
Las variables demográficas consideradas fueron sexo, nivel educativo, estado civil y edad. Las variables cuantitativas abarcaron el valor del crédito concedido, el estado de pago de los últimos seis meses (abril a septiembre de 2005), los valores de las facturas en dicho período y los respectivos pagos realizados. La estructura temporal de los datos permitió observar el comportamiento de pago de los clientes a lo largo del tiempo, lo que fue relevante para inferir la probabilidad de incumplimiento.
Basándose en las variables originales, se construyeron cuatro nuevas métricas para capturar diferentes dimensiones del comportamiento financiero de los clientes. Estas fueron: la tasa media de utilización del límite de crédito (AVG_UTILIZATION_RATE), el índice medio de pago de las facturas (AVG_PAY_TO_BILL), la variación de la deuda (DEBT_TREND) y el índice de frecuencia de retraso (DELAY_COUNT). La ingeniería de atributos sobre series temporales de tarjetas de crédito es una práctica que amplía la capacidad explicativa de los modelos (Bahnsen et al., 2016; Lessmann et al., 2015).
La etapa de preprocesamiento de los datos fue fundamental, dada la presencia de variables categóricas y la heterogeneidad de escala entre los atributos numéricos. Para las variables categóricas, se aplicó la técnica de *one-hot encoding*, que las codificó en formato de vectores binarios. Esta transformación se aplicó a las variables de sexo, nivel educativo y estado civil, evitando interpretaciones erróneas de orden entre categorías (James et al., 2021).
Para las variables numéricas, se utilizó el método de estandarización para media cero y varianza unitaria. Esta metodología garantizó que todas las variables fueran tratadas de forma equitativa, considerando la gran disparidad de escala entre ellas, como el valor del crédito concedido en relación con los demás datos numéricos (Hastie et al., 2009). La estandarización se ajustó solo con base en el conjunto de entrenamiento, y los conjuntos de validación y prueba se transformaron con los mismos parámetros.
La base de datos se particionó en conjuntos de entrenamiento (80%) y de prueba (20%), preservando la distribución original de las clases mediante muestreo estratificado. Adicionalmente, el conjunto de entrenamiento se subdividió en subconjuntos de entrenamiento interno y validación interna. El entrenamiento interno se empleó en el ajuste de los modelos, y la validación interna se utilizó para analizar el impacto del umbral de decisión sobre las métricas de rendimiento.
Los modelos fueron evaluados mediante validación cruzada estratificada de cinco pliegues, aplicada sobre el conjunto de entrenamiento interno. En cada iteración, el modelo fue entrenado en parte de los datos y validado en el subconjunto restante, garantizando el uso de todas las observaciones. Los desempeños reportados correspondieron al promedio de los resultados obtenidos en las cinco iteraciones, acompañado del desvío estándar, lo que permitió evaluar la estabilidad de los desempeños (Hastie et al., 2009).
La selección de los algoritmos se basó en el propósito de confrontar diferentes enfoques de aprendizaje automático. La Regresión Logística fue adoptada como modelo de referencia, dada su consolidación e interpretabilidad en el sector bancario (Baesens et al., 2003). El Random Forest (Breiman, 2001) fue seleccionado como representante de la estrategia de *bagging*, reconocido por su capacidad de reducción de varianza. El XGBoost fue elegido basándose en la literatura reciente (Xu, 2024), que demuestra la superioridad de los algoritmos de *boosting* en la evaluación de riesgo de crédito (Chen y Guestrin, 2016).
La optimización de los modelos buscó identificar combinaciones de hiperparámetros que maximizaran el rendimiento predictivo. Para ello, se empleó el método RandomizedSearchCV, que realiza el muestreo aleatorio de combinaciones de hiperparámetros a partir de distribuciones e intervalos de búsqueda previamente definidos para cada algoritmo (Bergstra y Bengio, 2012). Se evaluaron cien combinaciones para cada modelo, priorizando la métrica de sensibilidad, dada la importancia de la identificación de clientes morosos.
Para la Regresión Logística, se evaluaron valores del parámetro de regularización C y métodos de optimización *liblinear* y *lbfgs*. Para el Random Forest, se consideraron intervalos para el número de árboles, profundidad máxima, número mínimo de muestras para división y por hoja, y estrategias de selección de variables. Para el XGBoost, se definieron valores para el número de estimadores, tasa de aprendizaje, profundidad y peso mínimo de las observaciones por nodo, además de parámetros de regularización y muestreo (XGBoost Developers, 2024).
El tratamiento del desbalanceo de clases se realizó mediante la asignación de pesos diferenciados a las clases en la función objetivo, sin alterar la base de datos original (Ling y Sheng, 2011). Para XGBoost, se utilizó el hiperparámetro *scale_pos_weight*, definido como la razón entre el número de observaciones de la clase mayoritaria (solventes) y de la clase minoritaria (insolventes), ajustando la contribución de los ejemplos de la clase positiva durante la minimización de la función de pérdida (Chen y Guestrin, 2016).
Las métricas empleadas para la evaluación del rendimiento de los modelos fueron Precisión, Exactitud, Sensibilidad, Puntuación F1 y AUC-ROC. En escenarios de clasificación binaria con bases de datos desequilibradas, la precisión por sí sola puede no ser la medida más adecuada, complementándose con métricas derivadas de la matriz de confusión para analizar los diferentes tipos de errores de clasificación (James et al., 2021). La métrica AUC-ROC cuantificó el poder de discriminación del modelo entre las clases deudoras y no deudoras (Fawcett, 2006).
La técnica Shapley Additive Explanations (SHAP) se utilizó para interpretar la contribución individual de las variables explicativas en la predicción del incumplimiento de los clientes (Lundberg y Lee, 2017). El SHAP permitió descomponer la salida del modelo en contribuciones atribuidas a cada variable, midiendo el impacto marginal de cada una y considerando sus interacciones con otros factores. Esto amplió la transparencia del modelo y ayudó en la identificación de los determinantes del riesgo crediticio.
El umbral de decisión consistió en el parámetro de corte adoptado para calibrar el modelo de acuerdo con el apetito por el riesgo de la institución financiera. Se probaron diferentes umbrales en el modelo con mejor desempeño para verificar el *trade-off* entre sensibilidad y precisión (Fawcett, 2006; James et al., 2021). Este umbral representó el punto de corte a partir del cual las probabilidades estimadas por el modelo definieron la clasificación de los clientes como morosos.
Para el desarrollo de este trabajo, se utilizó la herramienta de inteligencia artificial Google Gemini como soporte en etapas como revisión gramatical, mejora de la claridad textual, apoyo en la identificación de referencias bibliográficas, verificación de aspectos formales de formato y ayuda puntual en la estructuración de fragmentos de código y aclaración de conceptos técnicos (Bigaton et al., 2025). El código desarrollado se puso a disposición pública para garantizar la reproducibilidad del estudio.
3. Resultados y Discusión
La evaluación del rendimiento predictivo de los modelos de aprendizaje automático, Regresión Logística, Random Forest y Extreme Gradient Boosting (XGBoost), se realizó mediante validación cruzada estratificada, considerando métricas como Precisión, Exactitud, Sensibilidad, Puntuación F1 y AUC-ROC. Los resultados obtenidos, tanto antes como después de la optimización de hiperparámetros, revelaron diferencias significativas entre los algoritmos, especialmente en la capacidad de identificar la clase minoritaria de clientes morosos. La optimización buscó refinar el rendimiento de los modelos, ajustándolos a las características específicas del conjunto de datos y priorizando la sensibilidad, métrica crucial en contextos de riesgo crediticio, donde el costo de un falso negativo es elevado (Islam et al., 2018).
Rendimiento predictivo de los modelos evaluados
Para la Regresión Logística, se observó que la optimización de hiperparámetros resultó en variaciones discretas en las métricas de rendimiento. Antes de la optimización, el modelo presentó una sensibilidad de 0,5917 y un F1-Score de 0,5318, con un AUC-ROC de 0,7600. Después del proceso de ajuste, la sensibilidad aumentó ligeramente a 0,6023 y el F1-Score a 0,5337, mientras que el AUC-ROC registró una pequeña reducción a 0,7477. Este comportamiento sugirió que, en el contexto del experimento, el modelo operó cerca de su límite de capacidad predictiva, indicando que la ampliación del espacio de búsqueda de hiperparámetros no generó ganancias sustanciales, como se esperaba para modelos lineales (James et al., 2021).
El modelo Random Forest demostró cambios más expresivos después de la optimización. La sensibilidad, que inicialmente era de 0,3537, aumentó significativamente a 0,6456, y el F1-Score pasó de 0,4594 a 0,5268. Sin embargo, esta mejora en la identificación de morosos fue acompañada por una reducción en la precisión y la exactitud. El AUC-ROC, por su parte, tuvo un leve incremento de 0,7691 a 0,7735. Esta migración en el equilibrio entre falsos positivos y falsos negativos indicó una priorización de la clase morosa, un comportamiento deseable en escenarios donde la minimización de falsos negativos es prioritaria, incluso a costa de un aumento en los errores sobre la clase solvente (Brown y Mues, 2012).
El Extreme Gradient Boosting (XGBoost) también presentó un incremento relevante en la sensibilidad tras la optimización, pasando de 0,6341 a 0,8250. Al igual que en el Random Forest, esta mejora fue acompañada por reducciones en la precisión y la exactitud, reflejando la priorización de la identificación de clientes morosos, alineada al criterio de optimización adoptado. El AUC-ROC del XGBoost, que era de 0,7837 antes de la optimización, tuvo un pequeño aumento a 0,7844. Los resultados generales indicaron que las mayores ganancias de rendimiento, especialmente en términos de sensibilidad, ocurrieron en los modelos basados en árboles, lo cual era esperado, dado que la sensibilidad fue la métrica priorizada en la optimización (Chen y Guestrin, 2016).
La evaluación de la variabilidad de las métricas a lo largo de los pliegues de la validación cruzada indicó estabilidad en los modelos, con desviaciones estándar reducidas en relación con las medias, lo que sugiere la consistencia de los resultados. En términos de capacidad discriminatoria, los modelos basados en árboles superaron a la Regresión Logística. El modelo XGBoost optimizado alcanzó un AUC-ROC de 0,7805, seguido por el Random Forest optimizado con 0,7618, mientras que la Regresión Logística optimizada presentó un AUC-ROC de 0,7308. Estos hallazgos demostraron la mayor capacidad de los modelos de ensemble para distinguir las clases a lo largo de diferentes umbrales de decisión (Hastie et al., 2009).
El análisis del impacto del umbral de decisión en el rendimiento del modelo XGBoost optimizado reveló un compromiso entre sensibilidad, precisión y especificidad. La reducción del umbral de decisión resultó en un aumento de la sensibilidad, ampliando la capacidad de identificar clientes morosos, pero a costa de una reducción en la precisión y especificidad. Por ejemplo, al fijar el umbral en 0,10, la sensibilidad alcanzó 0,9981, con una precisión de 0,2230 y una especificidad de 0,0120, priorizando la captura máxima de morosos. En contraste, un umbral de 0,90 redujo la sensibilidad a 0,2957, pero aumentó la precisión a 0,6916 y la especificidad a 0,9625, reflejando una postura más expansiva en la concesión de crédito (Fawcett, 2006).
La matriz de confusión del modelo XGBoost optimizado, utilizando un umbral de decisión de 0,50, reveló que 2.420 clientes solventes fueron clasificados correctamente, y 1.107 clientes morosos también fueron identificados correctamente. Sin embargo, se observó la ocurrencia de 2.253 falsos positivos, donde clientes solventes fueron erróneamente clasificados como morosos, y 220 falsos negativos, donde morosos fueron clasificados como solventes. La sensibilidad en el conjunto de prueba fue de aproximadamente 83,6%, un valor consistente con la validación cruzada (82,5%), indicando buena capacidad de generalización del modelo. El elevado número de falsos positivos, no obstante, sugiere una postura conservadora del modelo, priorizando la mitigación del riesgo de morosidad en detrimento de la ampliación de la base de clientes aprobados, lo que implica un coste de oportunidad para la institución (James et al., 2021).
Importancia de las variables en la explicación del incumplimiento (SHAP) y relación con el análisis exploratorio y variables derivadas
El análisis de interpretabilidad, realizado a través de la técnica Shapley Additive Explanations (SHAP), permitió identificar los factores de mayor relevancia en la predicción del incumplimiento. Los resultados evidenciaron que variables asociadas al comportamiento de pago, como el historial de retrasos y el estado de pago reciente, ejercieron la mayor contribución marginal a la probabilidad prevista de incumplimiento. En contraste, las hipótesis exploratorias relacionadas con las variables demográficas, como sexo, nivel educativo y estado civil, no se confirmaron en el contexto del modelo estimado, ya que estos atributos presentaron baja contribución predictiva, indicando que los patrones observados en el análisis exploratorio no se sostuvieron consistentemente en el modelo (Lundberg y Lee, 2017).
Específicamente, la frecuencia de retrasos y el estado del pago en septiembre de 2005 fueron las variables con mayor impacto en la clasificación de clientes morosos. La tasa media de utilización del límite de crédito y el valor del crédito concedido también destacaron como factores importantes. El análisis SHAP reveló una asociación negativa entre el límite de crédito concedido y la morosidad, sugiriendo que límites más altos están asociados a una menor probabilidad de impago. Por otro lado, se observó una asociación positiva entre el grado de utilización del límite y el riesgo de morosidad, donde una mayor utilización del crédito tiende a aumentar la probabilidad de morosidad (Lessmann et al., 2015).
La interdependencia entre las variables fue un hallazgo relevante, con los gráficos de dependencia SHAP indicando efectos conjuntos. Clientes con una alta tasa de utilización del límite de crédito y, simultáneamente, menores valores de crédito concedido, presentaron una contribución positiva más acentuada al riesgo de incumplimiento. En contrapartida, para clientes con límites de crédito más elevados, el impacto de la tasa de utilización se mostró más moderado, sugiriendo un posible efecto de amortiguación del riesgo. Esta interacción compleja subraya que el incumplimiento no está determinado por factores aislados, sino por una combinación de múltiples dimensiones del comportamiento financiero del cliente (Lundberg y Lee, 2017).
Adicionalmente, el análisis conjunto de las variables de frecuencia de retrasos y estado de pago en septiembre de 2005 sugirió que la combinación entre un historial de retrasos y un comportamiento reciente de pago desfavorable potenció el riesgo de incumplimiento. La recenticidad del retraso actuó como un factor amplificador del historial de pago, indicando que la proximidad temporal de un evento de no pago tiene un peso mayor en la predicción del riesgo. Estos resultados refuerzan la relevancia de las variables comportamentales en la determinación del riesgo de crédito, demostrando que el incumplimiento está intrínsecamente ligado a la dinámica del comportamiento financiero del cliente a lo largo del tiempo (Bahnsen et al., 2016).
Comparativa de los Resultados obtenidos en esta investigación con publicaciones científicas sobre esta temática
Los resultados obtenidos en este estudio demostraron consistencia con evidencias empíricas reportadas en la literatura, especialmente en trabajos que utilizaron conjuntos de datos similares. Se observó que modelos basados en árboles y técnicas de ensemble, como Random Forest y XGBoost, tienden a presentar mejor capacidad discriminatoria en comparación con enfoques lineales, como la Regresión Logística, en la clasificación de riesgo de crédito (Yeh y Lien, 2009). Este patrón fue consistentemente identificado en estudios posteriores que destacaron la eficacia de métodos de boosting en la modelización de relaciones no lineales y en la predicción de impago (Chen y Guestrin, 2016; Lessmann et al., 2015).
Sin embargo, la comparación directa de estos resultados con otros estudios debe interpretarse con cautela debido a diferencias metodológicas. En primer lugar, el procedimiento de validación adoptado en este estudio, que combinó evaluación repetida en múltiples particiones con validación final en un conjunto independiente, proporcionó estimaciones más robustas del rendimiento fuera de la muestra. En contraste, algunos estudios anteriores emplearon particiones únicas de entrenamiento y prueba, lo que puede introducir una mayor sensibilidad a las particularidades de la muestra. En segundo lugar, la optimización de hiperparámetros mediante RandomizedSearchCV permitió una exploración eficiente de regiones relevantes del espacio de búsqueda, siendo particularmente adecuada para algoritmos complejos como Random Forest y XGBoost (Bergstra y Bengio, 2012).
Finalmente, el tratamiento del desbalanceo de clases mediante enfoques sensibles al costo, que asignan pesos diferenciados a las clases en la función de pérdida, difirió de estudios que utilizaron técnicas de remuestreo, como SMOTE (Chawla et al., 2002). Ambas estrategias se discuten en la literatura sobre clasificación desbalanceada y están asociadas a diferentes compromisos entre sesgo y varianza, así como a distintos impactos en la identificación de la clase minoritaria, especialmente en términos de sensibilidad y tasa de falsos negativos (Ling y Sheng, 2011; Brown y Mues, 2012). Estas diferencias metodológicas ayudan a contextualizar eventuales variaciones en los resultados reportados, indicando que comparaciones directas basadas exclusivamente en métricas agregadas deben interpretarse con cautela.
A pesar de la consistencia observada y las contribuciones analíticas, el presente estudio presentó algunas limitaciones que deben ser consideradas. En primer lugar, el conjunto de datos utilizado se refiere a información de 2005, lo que puede no reflejar integralmente el comportamiento actual de crédito, dada la evolución del mercado financiero y de los patrones de consumo. Adicionalmente, no se realizó validación externa en bases independientes, lo que restringe la capacidad de generalización de los resultados a otros contextos o instituciones. Por último, no se evaluaron otras técnicas de tratamiento de desbalanceo de clases, como la sobremuestreo o submuestreo, lo que podría ofrecer perspectivas adicionales sobre el desempeño de los modelos (Marqués et al., 2012).
Ante estas limitaciones, estudios futuros pueden explorar la aplicación de los modelos en bases de datos más recientes, que reflejen el escenario económico y de comportamiento actual. La incorporación de validación externa, mediante la aplicación de los modelos en bases independientes de diferentes contextos, instituciones o períodos, también es una vía prometedora para ampliar la robustez y la capacidad de generalización de los resultados. Adicionalmente, la comparación sistemática de diferentes estrategias de tratamiento de desbalanceo, incluyendo enfoques de remuestreo, podría enriquecer la comprensión sobre la adherencia de los modelos a contextos reales de concesión de crédito, contribuyendo a mejorar la gestión de riesgo.
En resumen, la investigación demostró que los modelos basados en ensemble, notablemente Extreme Gradient Boosting, superaron a la Regresión Logística en la clasificación de clientes morosos, especialmente después de la optimización de hiperparámetros que priorizó la sensibilidad. El análisis de interpretabilidad SHAP reveló que el comportamiento de pago y la utilización del crédito son los predictores más relevantes, mientras que las variables demográficas tuvieron menor impacto. El estudio también evidenció el trade-off entre sensibilidad y precisión en la elección del umbral de decisión, resaltando la importancia de alinear la estrategia de modelado al apetito por el riesgo de la institución. Estos hallazgos refuerzan el potencial de las técnicas de aprendizaje automático para mejorar la gestión del riesgo de crédito, siempre que se apliquen con decisiones metodológicas adecuadas.
4. Conclusión
Este estudio investigó analíticamente el rendimiento predictivo y la mecánica de decisión de algoritmos de aprendizaje supervisado, Regresión Logística, Random Forest y Extreme Gradient Boosting (XGBoost), en la clasificación de clientes morosos en operaciones de tarjeta de crédito, considerando el desbalanceo de clases y el ajuste del umbral de decisión. Se verificó que el modelo Extreme Gradient Boosting presentó el mejor rendimiento discriminatorio y mayor capacidad de identificación de la clase morosa, con una sensibilidad de 0,8250 y un AUC-ROC de 0,7844, superando al Random Forest y a la Regresión Logística. La optimización de hiperparámetros, que priorizó la sensibilidad, fue crucial para estas ganancias en los modelos basados en árboles. El análisis de interpretabilidad, por medio de la técnica Shapley Additive Explanations (SHAP), evidenció que variables asociadas al comportamiento de pago, como el historial de retrasos y el estado de pago reciente, fueron los predictores más relevantes de la morosidad, mientras que atributos demográficos tuvieron menor impacto. Se observó una asociación negativa entre el límite de crédito concedido y la morosidad, y positiva entre la utilización del límite y el riesgo de no pago. La principal contribución reside en la demostración empírica de la eficacia de modelos de ensemble, combinados con estrategias sensibles al costo y ajuste del umbral de decisión, para mejorar la gestión de riesgo de crédito en escenarios de datos desbalanceados.
Sin embargo, el estudio presentó limitaciones, como la utilización de datos de 2005, que pueden no reflejar el comportamiento crediticio actual, y la ausencia de validación externa en bases independientes, lo que restringe la generalización de los resultados. Adicionalmente, no se evaluaron comparativamente otras técnicas de tratamiento de desbalanceo de clases, como la sobremuestreo o submuestreo. Para estudios futuros, se sugiere la aplicación de los modelos en bases de datos más recientes y la incorporación de validación externa en diferentes contextos o instituciones. Se recomienda, además, la comparación sistemática de diversas estrategias de tratamiento de desbalanceo, incluyendo enfoques de remuestreo, con el fin de enriquecer la comprensión sobre la adherencia de los modelos a contextos reales de concesión de crédito y ampliar la robustez y la capacidad de generalización de las soluciones propuestas.
Referencias Bibliográficas
Aarfi, S.A.; Ahmed, N.; Syed, K.A. 2024. Predicting credit card default using machine learning: an empirical analysis. American Journal of Intelligent Systems. Disponível em: <https://www.researchgate.net/publication/386019597_Predicting_Credit_Card_Default_Using_Machine_Learning_An_Empirical_Analysis>. Acesso em: 18 out. 2025.
Baesens, B.; van Gestel, T.; Viaene, S.; Stepanova, M.; Suykens, J.; Vanthienen, J. 2003. Benchmarking state-of-the-art classification algorithms for credit scoring. Journal of the Operational Research Society 54(6): 627-635.
Bahnsen, A.C.; Aouada, D.; Stojanovic, A.; Ottersten, B. 2016. Feature engineering strategies for credit card fraud detection / risk analysis. Expert Systems with Applications 51: 134-142.
Banco Central do Brasil [BCB]. 2021. Resolução CMN nº 4.966, de 25 de novembro de 2021. Diário Oficial da União, Brasília, 26 nov. 2021. Seção 1, p. 110.
Basel Committee on Banking Supervision [BCBS]. 2004. International Convergence of Capital Measurement and Capital Standards: A revised framework. Disponível em: <https://www.bis.org/publ/bcbs107.htm>. Acesso em: 14 mar. 2026.
Bentéjac, C.; Csörgo, A.; Martínez-Muñoz, G. 2021. A comparative analysis of gradient boosting algorithms. Artificial Intelligence Review. Disponível em: <https://link.springer.com/article/10.1007/s10462-020-09896-5>. Acesso em: 18 out. 2025.
Bergstra, J.; Bengio, Y. 2012. Random search for hyper-parameter optimization. Journal of Machine Learning Research 13: 281-305.
Bigaton, A.; Velázquez, D.R.T.; Santos, G.D.; Belém, M.J.X.; Beltran, M.P. 2025. Manual de Boas Práticas: Uso da inteligência artificial para o desenvolvimento de trabalhos de conclusão de curso. Pecege, Piracicaba, SP, Brasil.
Breiman, L. 2001. Random forests. Machine Learning 45(1): 5-32.
Brown, I.; Mues, C. 2012. An experimental comparison of classification algorithms for imbalanced credit scoring data sets. Expert Systems with Applications 39(3): 3446-3453.
Chawla, N.V.; Bowyer, K.W.; Hall, L.O.; Kegelmeyer, W.P. 2002. SMOTE: Synthetic minority over-sampling technique. Journal of Artificial Intelligence Research 16: 321-357.
Chen, T.; Guestrin, C. 2016. XGBoost: a scalable tree boosting system. In.: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 2016. Anais… p. 785-794. Disponível em: <https://arxiv.org/pdf/1603.02754.pdf>. Acesso em: 13 dez. 2025.
Fawcett, T. 2006. An introduction to ROC analysis. Pattern Recognition Letters 27(8): 861-874. Disponível em: https://doi.org/10.1016/j.patrec.2005.10.010. Acesso em: 17 jan. 2026.
Hand, D.J.; Henley, W.E. 1997. Statistical classification methods in consumer credit scoring: a review. Journal of the Royal Statistical Society: Series A 160(3): 523-541.
Hastie, T.; Tibshirani, R.; Friedman, J. 2009. The Elements of Statistical Learning: Data mining, inference, and prediction. 2ed. Springer, New York, NY, USA.
Islam, S.R.; Eberle, W.; Ghafoor, S.K. 2018. Credit Default Mining Using Combined Machine Learning and Heuristic Approach. Tennessee Technological University, Cookeville, TN, USA.
James, G.; Witten, D.; Hastie, T.; Tibshirani, R. 2021. An Introduction to Statistical Learning: With applications in R. 2ed. Springer, New York, NY, USA.
Lessmann, S.; Baesens, B.; Seow, H.V.; Thomas, L.C. 2015. Benchmarking state-of-the-art classification algorithms for credit scoring. European Journal of Operational Research 247(1): 124-136.
Ling, C.X.; Sheng, V.S. 2011. Cost-sensitive learning and the class imbalance problem. In.: Sammut, C.; Webb, G.I. (Ed.). Encyclopedia of Machine Learning. Springer, Boston, MA, USA. p. 231-235.
Lundberg, S.M.; Lee, S.I. 2017. A unified approach to interpreting model predictions. In.: Advances in Neural Information Processing Systems, 30., 2017. Anais… p. 4765-4774. Disponível em: <https://arxiv.org/abs/1705.07874>. Acesso em: 28 dez. 2025.
Marqués, A.I.; García, V.; Sánchez, J.S. 2012. On the use of data sampling techniques to cope with imbalanced credit scoring data sets. Journal of the Operational Research Society 63(8): 1099-1111.
XGBoost Developers. 2024. XGBoost Documentation: Parameters. Disponível em: <https://xgboost.readthedocs.io/en/stable/parameter.html>. Acesso em: 21 jan. 2026.
Xu, T. 2024. Comparative analysis of machine learning algorithms for consumer credit risk assessment. Transactions on Computer Science and Intelligent Systems Research 4: 60-67. Disponível em: <https://doi.org/10.62051/r1m3pg16>. Acesso em: 16 nov. 2025.
Yeh, I.C.; Lien, C.H. 2009. The comparisons of data mining techniques for the predictive accuracy of probability of default of credit card clients. Expert Systems with Applications 36(2): 2473-2480.
Artículo originario del Trabajo de Conclusión de Curso de la Especialización en Data Science y Analytics del MBA USP/Esalq
Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy