02 de outubro de 2026
Classificação de clientes inadimplentes por meio de técnicas supervisionadas de aprendizado de máquina
Classificação de Clientes Inadimplentes por Meio de Técnicas Supervisionadas de Aprendizado de Máquina
Felipe Ricardo Huergo Cagol; Ugo Henrique Pereira da Silva
DOI: 10.22167/2675-6528-202602895
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
O risco de inadimplência em operações de crédito demandou abordagens analíticas para antecipar perdas. Este estudo avaliou comparativamente o desempenho de modelos supervisionados de aprendizado de máquina na classificação de clientes inadimplentes em operações de cartão de crédito. Utilizou-se a base pública “Default of Credit Card Clients”, da Universidade da Califórnia Irvine, com 30.000 observações e desbalanceamento de classes. Foram empregados os algoritmos Regressão Logística, Random Forest e Extreme Gradient Boosting. O desbalanceamento foi tratado por meio da atribuição de pesos às classes, e a otimização dos modelos ocorreu com o método RandomizedSearchCV, priorizando a sensibilidade. Os resultados da validação cruzada indicaram que o modelo Extreme Gradient Boosting apresentou maior capacidade de identificação da classe inadimplente e melhor desempenho discriminatório, seguido pelo Random Forest e pela Regressão Logística, com sensibilidade de 0,8250 e AUC-ROC de 0,7844 para o XGBoost. A análise de interpretabilidade, conduzida pela técnica Shapley Additive Explanations (SHAP), evidenciou a predominância de variáveis associadas ao comportamento de pagamento, especialmente o histórico de atrasos. Concluiu-se que modelos baseados em árvores, particularmente técnicas de boosting, mostraram-se mais adequados para capturar padrões complexos nos dados, configurando-se como alternativas consistentes para a gestão de risco de crédito.
Palavras-chave: Aprendizado de Máquina; Cartão de Crédito; Classificação; Extreme Gradient Boosting; Risco de Crédito.
1. Introdução
A concessão de limite de crédito em operações com cartão de crédito representa uma decisão estratégica que impacta diretamente o risco financeiro das instituições. Diferentemente de outras modalidades de crédito, as operações com cartão não possuem garantias reais ou mecanismos automáticos de retenção de pagamento, como observado no crédito consignado. Consequentemente, as opções para recuperação de valores inadimplidos são mais restritas, frequentemente limitando-se à inclusão do cliente em cadastros de proteção ao crédito.
Este segmento de mercado é caracterizado por elevada concorrência e por fontes de receita limitadas, provenientes principalmente das taxas cobradas pelo uso do cartão e dos juros do rotativo em casos de inadimplemento. Tal cenário gera um trade-off inerente entre o rigor na concessão de crédito e a necessidade de expandir a escala de mercado. Diante disso, a relevância de abordagens quantitativas no suporte à tomada de decisão na gestão de risco de crédito é acentuada, visando equilibrar o controle da inadimplência com o retorno financeiro desejado pela entidade.
Historicamente, a gestão de risco de crédito tem se apoiado em métodos estatísticos tradicionais, como a Regressão Logística. A escolha desses modelos se justifica pela sua interpretabilidade e pelo baixo custo computacional, sendo também alinhada às exigências de constituição de provisão para créditos de liquidação duvidosa (PCLD) e às diretrizes do Comitê de Basileia (BCB, 2021; BCBS, 2004; Hand e Henley, 1997). Contudo, o avanço da capacidade computacional impulsionou a adoção de algoritmos de aprendizado de máquina na mineração de dados de crédito, elevando a precisão das previsões. Estudos recentes demonstram a eficácia desses modelos na predição de inadimplemento, com destaque para técnicas baseadas em gradiente boosting (Aarfi et al., 2024; Bentéjac et al., 2021).
Apesar dos avanços, a literatura aponta limitações metodológicas decorrentes do desbalanceamento natural das carteiras de crédito. Nesses contextos, a priorização da acurácia global pode resultar em avaliações enganosas, pois os algoritmos tendem a negligenciar a classe minoritária de maus pagadores (Brown e Mues, 2012). Para mitigar esse problema, abordagens como a criação de dados sintéticos, por meio da técnica Synthetic Minority Over-sampling Technique (SMOTE), são comumente empregadas (Chawla et al., 2002). No entanto, estudos alertam que a geração artificial de amostras pode introduzir limitações relacionadas à representatividade dos dados, impactando a capacidade de generalização do modelo (Marqués et al., 2012).
Adicionalmente, é crucial aprofundar a análise sobre o impacto financeiro dos erros de predição. Em cenários reais, o custo de um falso negativo, que ocorre ao conceder crédito a um mau pagador, é superior ao custo de um falso positivo, que corresponde a negar crédito a um bom pagador (Islam et al., 2018; Ling e Sheng, 2011). Isso porque as perdas financeiras geradas por um cliente inadimplente exigem a constituição de PCLD, afetando o resultado bancário e o Capital Regulatório. Diante da necessidade de alinhar os modelos preditivos ao apetite a risco das instituições financeiras e de considerar o custo distinto de cada tipo de erro, este trabalho busca analisar o trade-off entre precisão e sensibilidade na concessão de limite de cartão de crédito, bem como avaliar se modelos de ensemble superam abordagens tradicionais no tratamento do desbalanceamento dos dados.
Dessa forma, este estudo tem por objetivo investigar analiticamente o desempenho preditivo e a mecânica de decisão de três técnicas de aprendizado supervisionado, a Regressão Logística, o Random Forest e o Extreme Gradient Boosting (XGBoost), aplicando metodologias sensíveis ao custo sobre um conjunto de dados público da Universidade da Califórnia (UCI). Busca-se avaliar como diferentes algoritmos se comportam diante do desbalanceamento estrutural das classes e de que forma o ajuste do limiar de decisão pode mitigar perdas. De forma complementar, busca-se identificar os fatores associados à inadimplência através do uso da técnica Shapley Additive Explanations (SHAP), a qual permite mensurar a contribuição de cada variável para as predições do modelo, bem como a direção e a magnitude de seu impacto no resultado final.
2. Material e Métodos
Este estudo caracterizou-se como uma pesquisa exploratória e quantitativa, com delineamento experimental, empregando dados secundários públicos. Teve como objetivo investigar analiticamente o desempenho preditivo e a mecânica de decisão de três técnicas de aprendizado supervisionado, a Regressão Logística, o Random Forest e o Extreme Gradient Boosting (XGBoost), aplicando metodologias sensíveis ao custo. Buscou-se avaliar o comportamento dos algoritmos diante do desbalanceamento estrutural das classes e o impacto do ajuste do limiar de decisão na mitigação de perdas, além de identificar os fatores associados à inadimplência por meio da técnica Shapley Additive Explanations (SHAP).
A coleta de dados foi realizada por meio da importação da base pública “Default of Credit Card Clients”, disponibilizada pela Universidade da Califórnia Irvine (UCI). Este conjunto de dados, referente a operações de cartão de crédito de uma instituição financeira de Taiwan, foi coletado no ano de 2005. A escolha por dados públicos ocorreu devido a restrições de confidencialidade e diretrizes da Lei Geral de Proteção de Dados Pessoais (LGPD), evitando o uso de dados proprietários corporativos.
O conjunto de dados utilizado compreendeu 30.000 instâncias, caracterizadas por um desbalanceamento entre as classes de adimplentes e inadimplentes. A base foi composta por 23 variáveis explicativas e uma variável resposta. As variáveis explicativas incluíram quatro atributos demográficos e 19 atributos numéricos, enquanto a variável resposta era binária, indicando adimplência ou inadimplência no mês subsequente.
As variáveis demográficas consideradas foram sexo, grau de instrução, estado civil e idade. As variáveis quantitativas abrangeram o valor do crédito concedido, o status de pagamento dos últimos seis meses (abril a setembro de 2005), os valores das faturas nesse período e os respectivos pagamentos realizados. A estrutura temporal dos dados permitiu observar o comportamento de pagamento dos clientes ao longo do tempo, o que foi relevante para inferir a probabilidade de inadimplemento.
Com base nas variáveis originais, foram construídas quatro novas métricas para capturar diferentes dimensões do comportamento financeiro dos clientes. Foram elas: a taxa média de utilização do limite de crédito (AVG_UTILIZATION_RATE), o índice médio de pagamento das faturas (AVG_PAY_TO_BILL), a variação da dívida (DEBT_TREND) e o índice de frequência de atraso (DELAY_COUNT). A engenharia de atributos sobre séries temporais de cartão de crédito é uma prática que amplia a capacidade explicativa dos modelos (Bahnsen et al., 2016; Lessmann et al., 2015).
A etapa de pré-processamento dos dados foi fundamental, dada a presença de variáveis categóricas e a heterogeneidade de escala entre os atributos numéricos. Para as variáveis categóricas, aplicou-se a técnica de *one-hot encoding*, que as codificou em formato de vetores binários. Essa transformação foi aplicada às variáveis de sexo, grau de instrução e estado civil, evitando interpretações equivocadas de ordem entre categorias (James et al., 2021).
Para as variáveis numéricas, utilizou-se o método de padronização para média zero e variância unitária. Essa metodologia garantiu que todas as variáveis fossem tratadas de forma equitativa, considerando a grande disparidade de escala entre elas, como o valor do crédito concedido em relação aos demais dados numéricos (Hastie et al., 2009). A padronização foi ajustada apenas com base no conjunto de treino, e os conjuntos de validação e teste foram transformados com os mesmos parâmetros.
A base de dados foi particionada em conjuntos de treino (80%) e teste (20%), preservando a distribuição original das classes por meio de amostragem estratificada. Adicionalmente, o conjunto de treino foi subdividido em subconjuntos de treino interno e validação interna. O treino interno foi empregado no ajuste dos modelos, e a validação interna foi utilizada para analisar o impacto do limiar de decisão sobre as métricas de desempenho.
Os modelos foram avaliados por meio de validação cruzada estratificada com cinco dobras, aplicada sobre o conjunto de treino interno. Em cada iteração, o modelo foi treinado em parte dos dados e validado no subconjunto restante, garantindo o uso de todas as observações. Os desempenhos reportados corresponderam à média dos resultados obtidos nas cinco iterações, acompanhada do desvio padrão, o que permitiu avaliar a estabilidade dos desempenhos (Hastie et al., 2009).
A seleção dos algoritmos fundamentou-se no propósito de confrontar diferentes abordagens de aprendizado de máquina. A Regressão Logística foi adotada como modelo de referência, dada sua consolidação e interpretabilidade no setor bancário (Baesens et al., 2003). O Random Forest (Breiman, 2001) foi selecionado como representante da estratégia de *bagging*, reconhecido por sua capacidade de redução de variância. O XGBoost foi escolhido com base na literatura recente (Xu, 2024), que demonstra a superioridade de algoritmos de *boosting* na avaliação de risco de crédito (Chen e Guestrin, 2016).
A otimização dos modelos buscou identificar combinações de hiperparâmetros que maximizassem o desempenho preditivo. Para isso, empregou-se o método RandomizedSearchCV, que realiza a amostragem aleatória de combinações de hiperparâmetros a partir de distribuições e intervalos de busca previamente definidos para cada algoritmo (Bergstra e Bengio, 2012). Foram avaliadas cem combinações para cada modelo, priorizando a métrica de sensibilidade, dada a importância da identificação de clientes inadimplentes.
Para a Regressão Logística, foram avaliados valores do parâmetro de regularização C e métodos de otimização *liblinear* e *lbfgs*. Para o Random Forest, consideraram-se intervalos para o número de árvores, profundidade máxima, número mínimo de amostras para divisão e por folha, e estratégias de seleção de variáveis. Para o XGBoost, definiram-se valores para o número de estimadores, taxa de aprendizado, profundidade e peso mínimo das observações por nó, além de parâmetros de regularização e amostragem (XGBoost Developers, 2024).
O tratamento do desbalanceamento de classes foi realizado por meio da atribuição de pesos diferenciados às classes na função objetivo, sem alterar a base de dados original (Ling e Sheng, 2011). Para o XGBoost, utilizou-se o hiperparâmetro *scale_pos_weight*, definido como a razão entre o número de observações da classe majoritária (adimplentes) e da classe minoritária (inadimplentes), ajustando a contribuição dos exemplos da classe positiva durante a minimização da função de perda (Chen e Guestrin, 2016).
As métricas empregadas para a avaliação da performance dos modelos foram Acurácia, Precisão, Sensibilidade, F1-Score e AUC-ROC. Em cenários de classificação binária com bases de dados desbalanceadas, a acurácia isoladamente pode não ser a medida mais adequada, sendo complementada por métricas derivadas da matriz de confusão para analisar os diferentes tipos de erro de classificação (James et al., 2021). A métrica AUC-ROC quantificou o poder de discriminação do modelo entre as classes adimplentes e inadimplentes (Fawcett, 2006).
A técnica Shapley Additive Explanations (SHAP) foi utilizada para interpretar a contribuição individual das variáveis explicativas na predição da inadimplência dos clientes (Lundberg e Lee, 2017). O SHAP permitiu decompor a saída do modelo em contribuições atribuídas a cada variável, mensurando o impacto marginal de cada uma e considerando suas interações com outros fatores. Isso ampliou a transparência do modelo e auxiliou na identificação dos determinantes do risco de crédito.
O limiar de decisão consistiu no parâmetro de corte adotado para calibrar o modelo de acordo com o apetite a riscos da instituição financeira. Foram testados diferentes limiares no modelo com melhor desempenho para verificar o *trade-off* entre sensibilidade e precisão (Fawcett, 2006; James et al., 2021). Esse limiar representou o ponto de corte a partir do qual as probabilidades estimadas pelo modelo definiram a classificação dos clientes como inadimplentes.
Para o desenvolvimento deste trabalho, utilizou-se a ferramenta de inteligência artificial Google Gemini como suporte em etapas como revisão gramatical, aprimoramento da clareza textual, apoio na identificação de referências bibliográficas, verificação de aspectos formais de formatação e auxílio pontual na estruturação de trechos de código e esclarecimento de conceitos técnicos (Bigaton et al., 2025). O código desenvolvido foi disponibilizado publicamente para garantir a reprodutibilidade do estudo.
3. Resultados e Discussão
A avaliação do desempenho preditivo dos modelos de aprendizado de máquina, Regressão Logística, Random Forest e Extreme Gradient Boosting (XGBoost), foi realizada por meio de validação cruzada estratificada, considerando métricas como Acurácia, Precisão, Sensibilidade, F1-Score e AUC-ROC. Os resultados obtidos, tanto antes quanto após a otimização de hiperparâmetros, revelaram diferenças significativas entre os algoritmos, especialmente na capacidade de identificar a classe minoritária de clientes inadimplentes. A otimização buscou refinar a performance dos modelos, ajustando-os às características específicas do conjunto de dados e priorizando a sensibilidade, métrica crucial em contextos de risco de crédito, onde o custo de um falso negativo é elevado (Islam et al., 2018).
Desempenho preditivo dos modelos avaliados
Para a Regressão Logística, observou-se que a otimização de hiperparâmetros resultou em variações discretas nas métricas de desempenho. Antes da otimização, o modelo apresentou uma sensibilidade de 0,5917 e um F1-Score de 0,5318, com um AUC-ROC de 0,7600. Após o processo de ajuste, a sensibilidade aumentou ligeiramente para 0,6023 e o F1-Score para 0,5337, enquanto o AUC-ROC registrou uma pequena redução para 0,7477. Esse comportamento sugeriu que, no contexto do experimento, o modelo operou próximo ao seu limite de capacidade preditiva, indicando que a ampliação do espaço de busca de hiperparâmetros não gerou ganhos substanciais, conforme esperado para modelos lineares (James et al., 2021).
O modelo Random Forest demonstrou alterações mais expressivas após a otimização. A sensibilidade, que inicialmente era de 0,3537, aumentou significativamente para 0,6456, e o F1-Score passou de 0,4594 para 0,5268. Contudo, essa melhoria na identificação de inadimplentes foi acompanhada por uma redução na precisão e na acurácia. O AUC-ROC, por sua vez, teve um leve incremento de 0,7691 para 0,7735. Essa migração no equilíbrio entre falsos positivos e falsos negativos indicou uma priorização da classe inadimplente, um comportamento desejável em cenários onde a minimização de falsos negativos é prioritária, mesmo que ao custo de um aumento nos erros sobre a classe adimplente (Brown e Mues, 2012).
O Extreme Gradient Boosting (XGBoost) também apresentou um incremento relevante na sensibilidade após a otimização, passando de 0,6341 para 0,8250. Assim como no Random Forest, essa melhoria foi acompanhada por reduções na precisão e na acurácia, refletindo a priorização da identificação de clientes inadimplentes, alinhada ao critério de otimização adotado. O AUC-ROC do XGBoost, que era de 0,7837 antes da otimização, teve um pequeno aumento para 0,7844. Os resultados gerais indicaram que os maiores ganhos de desempenho, especialmente em termos de sensibilidade, ocorreram nos modelos baseados em árvores, o que era esperado, dado que a sensibilidade foi a métrica priorizada na otimização (Chen e Guestrin, 2016).
A avaliação da variabilidade das métricas ao longo das dobras da validação cruzada indicou estabilidade nos modelos, com desvios padrão reduzidos em relação às médias, sugerindo a consistência dos resultados. Em termos de capacidade discriminatória, os modelos baseados em árvores superaram a Regressão Logística. O modelo XGBoost otimizado alcançou um AUC-ROC de 0,7805, seguido pelo Random Forest otimizado com 0,7618, enquanto a Regressão Logística otimizada apresentou um AUC-ROC de 0,7308. Esses achados demonstraram a maior capacidade dos modelos de ensemble em distinguir as classes ao longo de diferentes limiares de decisão (Hastie et al., 2009).
A análise do impacto do limiar de decisão no desempenho do modelo XGBoost otimizado revelou um trade-off entre sensibilidade, precisão e especificidade. A redução do limiar de decisão resultou em um aumento da sensibilidade, ampliando a capacidade de identificar clientes inadimplentes, mas ao custo de uma redução na precisão e especificidade. Por exemplo, ao fixar o limiar em 0,10, a sensibilidade atingiu 0,9981, com precisão de 0,2230 e especificidade de 0,0120, priorizando a captura máxima de inadimplentes. Em contraste, um limiar de 0,90 reduziu a sensibilidade para 0,2957, mas aumentou a precisão para 0,6916 e a especificidade para 0,9625, refletindo uma postura mais expansiva na concessão de crédito (Fawcett, 2006).
A matriz de confusão do modelo XGBoost otimizado, utilizando um limiar de decisão de 0,50, revelou que 2.420 clientes adimplentes foram corretamente classificados, e 1.107 clientes inadimplentes também foram identificados corretamente. Contudo, observou-se a ocorrência de 2.253 falsos positivos, onde clientes adimplentes foram erroneamente classificados como inadimplentes, e 220 falsos negativos, onde inadimplentes foram classificados como adimplentes. A sensibilidade no conjunto de teste foi de aproximadamente 83,6%, um valor consistente com a validação cruzada (82,5%), indicando boa capacidade de generalização do modelo. O elevado número de falsos positivos, no entanto, sugere uma postura conservadora do modelo, priorizando a mitigação do risco de inadimplência em detrimento da ampliação da base de clientes aprovados, o que implica um custo de oportunidade para a instituição (James et al., 2021).
Importância das variáveis na explicação da inadimplência (SHAP) e relação com a análise exploratória e variáveis derivadas
A análise de interpretabilidade, realizada por meio da técnica Shapley Additive Explanations (SHAP), permitiu identificar os fatores de maior relevância na predição da inadimplência. Os resultados evidenciaram que variáveis associadas ao comportamento de pagamento, como o histórico de atrasos e o status de pagamento recente, exerceram a maior contribuição marginal para a probabilidade prevista de inadimplência. Em contraste, as hipóteses exploratórias relacionadas às variáveis demográficas, como sexo, escolaridade e estado civil, não se confirmaram no contexto do modelo estimado, uma vez que esses atributos apresentaram baixa contribuição preditiva, indicando que os padrões observados na análise exploratória não se sustentaram consistentemente no modelo (Lundberg e Lee, 2017).
Especificamente, a frequência de atrasos e o status do pagamento em setembro de 2005 foram as variáveis com maior impacto na classificação de clientes inadimplentes. A taxa média de utilização do limite de crédito e o valor do crédito concedido também se destacaram como fatores importantes. A análise SHAP revelou uma associação negativa entre o limite de crédito concedido e a inadimplência, sugerindo que limites mais elevados estão associados a uma menor probabilidade de não pagamento. Por outro lado, observou-se uma associação positiva entre o grau de utilização do limite e o risco de inadimplência, onde uma maior utilização do crédito tende a aumentar a probabilidade de inadimplência (Lessmann et al., 2015).
A interdependência entre as variáveis foi um achado relevante, com os gráficos de dependência SHAP indicando efeitos conjuntos. Clientes com elevada taxa de utilização do limite de crédito e, simultaneamente, menores valores de crédito concedido, apresentaram uma contribuição positiva mais acentuada para o risco de inadimplência. Em contrapartida, para clientes com limites de crédito mais elevados, o impacto da taxa de utilização mostrou-se mais moderado, sugerindo um possível efeito de amortecimento do risco. Essa interação complexa sublinha que a inadimplência não é determinada por fatores isolados, mas sim por uma combinação de múltiplas dimensões do comportamento financeiro do cliente (Lundberg e Lee, 2017).
Adicionalmente, a análise conjunta das variáveis de frequência de atrasos e status do pagamento em setembro de 2005 sugeriu que a combinação entre um histórico de atrasos e um comportamento recente de pagamento desfavorável potencializou o risco de inadimplência. A recência do atraso atuou como um fator amplificador do histórico de pagamento, indicando que a proximidade temporal de um evento de não pagamento tem um peso maior na predição do risco. Esses resultados reforçam a relevância das variáveis comportamentais na determinação do risco de crédito, demonstrando que a inadimplência está intrinsecamente ligada à dinâmica do comportamento financeiro do cliente ao longo do tempo (Bahnsen et al., 2016).
Comparativo dos Resultados obtidos nesta pesquisa com publicações científicas sobre essa temática
Os resultados obtidos neste estudo demonstraram consistência com evidências empíricas reportadas na literatura, especialmente em trabalhos que utilizaram conjuntos de dados semelhantes. Observou-se que modelos baseados em árvores e técnicas de ensemble, como Random Forest e XGBoost, tendem a apresentar melhor capacidade discriminatória em comparação com abordagens lineares, como a Regressão Logística, na classificação de risco de crédito (Yeh e Lien, 2009). Esse padrão foi consistentemente identificado em estudos posteriores que destacaram a eficácia de métodos de boosting na modelagem de relações não lineares e na previsão de inadimplência (Chen e Guestrin, 2016; Lessmann et al., 2015).
Contudo, a comparação direta desses resultados com outros estudos deve ser interpretada com cautela devido a diferenças metodológicas. Em primeiro lugar, o procedimento de validação adotado neste estudo, que combinou avaliação repetida em múltiplas partições com validação final em um conjunto independente, proporcionou estimativas mais robustas do desempenho fora da amostra. Em contraste, alguns estudos anteriores empregaram partições únicas de treino e teste, o que pode introduzir maior sensibilidade às particularidades da amostra. Em segundo lugar, a otimização de hiperparâmetros por meio do RandomizedSearchCV permitiu uma exploração eficiente de regiões relevantes do espaço de busca, sendo particularmente adequada para algoritmos complexos como Random Forest e XGBoost (Bergstra e Bengio, 2012).
Por fim, o tratamento do desbalanceamento de classes por meio de abordagens sensíveis ao custo, que atribuem pesos diferenciados às classes na função de perda, diferiu de estudos que utilizaram técnicas de reamostragem, como o SMOTE (Chawla et al., 2002). Ambas as estratégias são discutidas na literatura sobre classificação desbalanceada e estão associadas a diferentes trade-offs entre viés e variância, bem como a distintos impactos na identificação da classe minoritária, especialmente em termos de sensibilidade e taxa de falsos negativos (Ling e Sheng, 2011; Brown e Mues, 2012). Essas diferenças metodológicas ajudam a contextualizar eventuais variações nos resultados reportados, indicando que comparações diretas baseadas exclusivamente em métricas agregadas devem ser interpretadas com cautela.
Apesar da consistência observada e das contribuições analíticas, o presente estudo apresentou algumas limitações que devem ser consideradas. Primeiramente, o conjunto de dados utilizado refere-se a informações de 2005, o que pode não refletir integralmente o comportamento atual de crédito, dada a evolução do mercado financeiro e dos padrões de consumo. Adicionalmente, não foi realizada validação externa em bases independentes, o que restringe a capacidade de generalização dos resultados para outros contextos ou instituições. Por fim, não foram avaliadas outras técnicas de tratamento de desbalanceamento de classes, como a sobreamostragem ou subamostragem, o que poderia oferecer perspectivas adicionais sobre o desempenho dos modelos (Marqués et al., 2012).
Diante dessas limitações, estudos futuros podem explorar a aplicação dos modelos em bases de dados mais recentes, que reflitam o cenário econômico e comportamental atual. A incorporação de validação externa, por meio da aplicação dos modelos em bases independentes de diferentes contextos, instituições ou períodos, também é uma avenida promissora para ampliar a robustez e a capacidade de generalização dos resultados. Adicionalmente, a comparação sistemática de diferentes estratégias de tratamento de desbalanceamento, incluindo abordagens de reamostragem, poderia enriquecer a compreensão sobre a aderência dos modelos a contextos reais de concessão de crédito, contribuindo para aprimorar a gestão de risco.
Em síntese, a pesquisa demonstrou que os modelos baseados em ensemble, notadamente o Extreme Gradient Boosting, superaram a Regressão Logística na classificação de clientes inadimplentes, especialmente após a otimização de hiperparâmetros que priorizou a sensibilidade. A análise de interpretabilidade SHAP revelou que o comportamento de pagamento e a utilização do crédito são os preditores mais relevantes, enquanto as variáveis demográficas tiveram menor impacto. O estudo também evidenciou o trade-off entre sensibilidade e precisão na escolha do limiar de decisão, ressaltando a importância de alinhar a estratégia de modelagem ao apetite a risco da instituição. Esses achados reforçam o potencial das técnicas de aprendizado de máquina para aprimorar a gestão de risco de crédito, desde que aplicadas com decisões metodológicas adequadas.
4. Conclusão
Este estudo investigou analiticamente o desempenho preditivo e a mecânica de decisão de algoritmos de aprendizado supervisionado, Regressão Logística, Random Forest e Extreme Gradient Boosting (XGBoost), na classificação de clientes inadimplentes em operações de cartão de crédito, considerando o desbalanceamento de classes e o ajuste do limiar de decisão. Verificou-se que o modelo Extreme Gradient Boosting apresentou o melhor desempenho discriminatório e maior capacidade de identificação da classe inadimplente, com sensibilidade de 0,8250 e AUC-ROC de 0,7844, superando o Random Forest e a Regressão Logística. A otimização de hiperparâmetros, que priorizou a sensibilidade, foi crucial para esses ganhos nos modelos baseados em árvores. A análise de interpretabilidade, por meio da técnica Shapley Additive Explanations (SHAP), evidenciou que variáveis associadas ao comportamento de pagamento, como o histórico de atrasos e o status de pagamento recente, foram os preditores mais relevantes da inadimplência, enquanto atributos demográficos tiveram menor impacto. Observou-se uma associação negativa entre o limite de crédito concedido e a inadimplência, e positiva entre a utilização do limite e o risco de não pagamento. A principal contribuição reside na demonstração empírica da eficácia de modelos de ensemble, combinados com estratégias sensíveis ao custo e ajuste do limiar de decisão, para aprimorar a gestão de risco de crédito em cenários de dados desbalanceados.
Contudo, o estudo apresentou limitações, como a utilização de dados de 2005, que podem não refletir o comportamento de crédito atual, e a ausência de validação externa em bases independentes, o que restringe a generalização dos resultados. Adicionalmente, não se avaliou comparativamente outras técnicas de tratamento de desbalanceamento de classes, como a sobreamostragem ou subamostragem. Para estudos futuros, sugere-se a aplicação dos modelos em bases de dados mais recentes e a incorporação de validação externa em diferentes contextos ou instituições. Recomenda-se, ainda, a comparação sistemática de diversas estratégias de tratamento de desbalanceamento, incluindo abordagens de reamostragem, a fim de enriquecer a compreensão sobre a aderência dos modelos a contextos reais de concessão de crédito e ampliar a robustez e a capacidade de generalização das soluções propostas.
Referências Bibliográficas
Aarfi, S.A.; Ahmed, N.; Syed, K.A. 2024. Predicting credit card default using machine learning: an empirical analysis. American Journal of Intelligent Systems. Disponível em: <https://www.researchgate.net/publication/386019597_Predicting_Credit_Card_Default_Using_Machine_Learning_An_Empirical_Analysis>. Acesso em: 18 out. 2025.
Baesens, B.; van Gestel, T.; Viaene, S.; Stepanova, M.; Suykens, J.; Vanthienen, J. 2003. Benchmarking state-of-the-art classification algorithms for credit scoring. Journal of the Operational Research Society 54(6): 627-635.
Bahnsen, A.C.; Aouada, D.; Stojanovic, A.; Ottersten, B. 2016. Feature engineering strategies for credit card fraud detection / risk analysis. Expert Systems with Applications 51: 134-142.
Banco Central do Brasil [BCB]. 2021. Resolução CMN nº 4.966, de 25 de novembro de 2021. Diário Oficial da União, Brasília, 26 nov. 2021. Seção 1, p. 110.
Basel Committee on Banking Supervision [BCBS]. 2004. International Convergence of Capital Measurement and Capital Standards: A revised framework. Disponível em: <https://www.bis.org/publ/bcbs107.htm>. Acesso em: 14 mar. 2026.
Bentéjac, C.; Csörgo, A.; Martínez-Muñoz, G. 2021. A comparative analysis of gradient boosting algorithms. Artificial Intelligence Review. Disponível em: <https://link.springer.com/article/10.1007/s10462-020-09896-5>. Acesso em: 18 out. 2025.
Bergstra, J.; Bengio, Y. 2012. Random search for hyper-parameter optimization. Journal of Machine Learning Research 13: 281-305.
Bigaton, A.; Velázquez, D.R.T.; Santos, G.D.; Belém, M.J.X.; Beltran, M.P. 2025. Manual de Boas Práticas: Uso da inteligência artificial para o desenvolvimento de trabalhos de conclusão de curso. Pecege, Piracicaba, SP, Brasil.
Breiman, L. 2001. Random forests. Machine Learning 45(1): 5-32.
Brown, I.; Mues, C. 2012. An experimental comparison of classification algorithms for imbalanced credit scoring data sets. Expert Systems with Applications 39(3): 3446-3453.
Chawla, N.V.; Bowyer, K.W.; Hall, L.O.; Kegelmeyer, W.P. 2002. SMOTE: Synthetic minority over-sampling technique. Journal of Artificial Intelligence Research 16: 321-357.
Chen, T.; Guestrin, C. 2016. XGBoost: a scalable tree boosting system. In.: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 2016. Anais… p. 785-794. Disponível em: <https://arxiv.org/pdf/1603.02754.pdf>. Acesso em: 13 dez. 2025.
Fawcett, T. 2006. An introduction to ROC analysis. Pattern Recognition Letters 27(8): 861-874. Disponível em: https://doi.org/10.1016/j.patrec.2005.10.010. Acesso em: 17 jan. 2026.
Hand, D.J.; Henley, W.E. 1997. Statistical classification methods in consumer credit scoring: a review. Journal of the Royal Statistical Society: Series A 160(3): 523-541.
Hastie, T.; Tibshirani, R.; Friedman, J. 2009. The Elements of Statistical Learning: Data mining, inference, and prediction. 2ed. Springer, New York, NY, USA.
Islam, S.R.; Eberle, W.; Ghafoor, S.K. 2018. Credit Default Mining Using Combined Machine Learning and Heuristic Approach. Tennessee Technological University, Cookeville, TN, USA.
James, G.; Witten, D.; Hastie, T.; Tibshirani, R. 2021. An Introduction to Statistical Learning: With applications in R. 2ed. Springer, New York, NY, USA.
Lessmann, S.; Baesens, B.; Seow, H.V.; Thomas, L.C. 2015. Benchmarking state-of-the-art classification algorithms for credit scoring. European Journal of Operational Research 247(1): 124-136.
Ling, C.X.; Sheng, V.S. 2011. Cost-sensitive learning and the class imbalance problem. In.: Sammut, C.; Webb, G.I. (Ed.). Encyclopedia of Machine Learning. Springer, Boston, MA, USA. p. 231-235.
Lundberg, S.M.; Lee, S.I. 2017. A unified approach to interpreting model predictions. In.: Advances in Neural Information Processing Systems, 30., 2017. Anais… p. 4765-4774. Disponível em: <https://arxiv.org/abs/1705.07874>. Acesso em: 28 dez. 2025.
Marqués, A.I.; García, V.; Sánchez, J.S. 2012. On the use of data sampling techniques to cope with imbalanced credit scoring data sets. Journal of the Operational Research Society 63(8): 1099-1111.
XGBoost Developers. 2024. XGBoost Documentation: Parameters. Disponível em: <https://xgboost.readthedocs.io/en/stable/parameter.html>. Acesso em: 21 jan. 2026.
Xu, T. 2024. Comparative analysis of machine learning algorithms for consumer credit risk assessment. Transactions on Computer Science and Intelligent Systems Research 4: 60-67. Disponível em: <https://doi.org/10.62051/r1m3pg16>. Acesso em: 16 nov. 2025.
Yeh, I.C.; Lien, C.H. 2009. The comparisons of data mining techniques for the predictive accuracy of probability of default of credit card clients. Expert Systems with Applications 36(2): 2473-2480.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

