Executive Summary

February 26, 2026

Predictive Modeling of Default with Supervised Machine Learning Algorithms

João Gabriel de Medeiros Luz Pedro; Carlos Nabil Ghobril

Summary prepared by the ResumeAI tool, an artificial intelligence solution developed by Instituto Pecege focused on synthesis and writing.

The objective of this research was to analyze and process a dataset from the Central Bank of Brazil (Bacen) to implement, train, and validate Machine Learning models, using the supervised algorithms CatBoost, Random Forest, and XGBoost, in order to measure predictive capacity in identifying default. The complexity of the Brazilian economic scenario, with the increase in family indebtedness, requires financial institutions to have precise tools for credit risk management. The ability to anticipate consumer payment behavior is a pillar for the sector’s sustainability, and the application of data science techniques emerges as a solution to improve the accuracy of analyses.

The landscape of indebtedness in Brazil justifies the urgency of studies in the area. Data from the Survey of Indebtedness and Consumer Default (PEIC) of April 2024 show that 78.5% of Brazilian families had debts, and 12.1% admitted they could not honor their commitments (CNC, 2024). A survey by CNDL and SPC Brasil registered 68.62 million Brazilians in default, corresponding to 41.51% of the adult population (Poder360, 2024). These numbers signal a systemic risk that can affect the stability of financial institutions. A practice that contributes to indebtedness is the extension of payment terms, which compromises future income and increases the probability of default in scenarios of instability (CNC, 2024). Therefore, traditional credit analysis, based on static rules, is insufficient. The need to improve risk analysis mechanisms is imperative to mitigate losses.

This research proposes a machine learning-based approach for default prediction. The use of supervised algorithms allows for the construction of models that learn patterns from historical data, identifying non-linear relationships that would be difficult to detect by conventional statistical methods (Kotsiantis, 2007). One of the technical challenges faced was the presence of a large number of categorical variables, such as ‘occupation’, credit ‘modality’, and ‘uf’, which are crucial for characterizing the customer profile but require specific treatments to be used by algorithms like Random Forest and XGBoost. The choice of preprocessing techniques and feature selection were fundamental steps to ensure the generation of robust predictive models.

The scope of the work covered a complete cycle of a data science project: data extraction and processing, exploratory analysis, training, evaluation, and comparison of multiple Machine Learning models. The validation of the results was carried out through metrics such as accuracy, F1-Score, and the area under the ROC curve (AUC-ROC), ensuring an objective evaluation of each algorithm’s performance. The study sought to identify the most effective model for the proposed scenario, providing a basis for the implementation of decision support systems in financial institutions.

The methodology began with the collection of historical credit data from the Credit Information System (SCR) of Bacen (Central Bank of Brazil, 2024). The initial dataset comprised 12 CSV files, corresponding to the months of 2024. For manipulation and processing, the Apache Spark framework was used, which allowed for the unification and cleaning of the files, including the removal of malformed rows and the specification of the column separator and encoding (UTF-8). The preprocessing step is fundamental, as the effectiveness of algorithms depends on the quality of the input data (Fávero & Belfiore, 2024). After cleaning, numerical formats were standardized, replacing commas with periods as decimal separators and removing thousands separators. The consolidated dataset was stored in the Apache Parquet format, optimized for read operations. The technological infrastructure included the Python language in the Spyder IDE and libraries such as Pandas, Matplotlib, Seaborn, and the frameworks CatBoost, Random Forest, and XGBoost.

Exploratory Data Analysis (EDA) was conducted to understand the dataset structure, composed of 13 categorical and 12 numerical variables. The target variable, overdueaboveof15days, was transformed into a binary variable (0 for compliant, 1 for non-compliant), framing the problem as binary classification. Correlation analysis was performed on the complete dataset and on a subset focused on Individual Customers (PF), as Corporate Customers (PJ) have distinct profiles. The analysis revealed that the proportion of non-compliance was higher in the PF group. Graphical visualizations explored the relationship between non-compliance and variables such as State (UF), indexer, and credit modality, confirming the relevance of these features.

The selection of algorithms was based on their effectiveness in classification problems. Random Forest was chosen for its robustness against overfitting, achieved by aggregating decision trees (Breiman, 2001). XGBoost was selected for its high performance and speed, being an optimized implementation of gradient boosting (Chen & Guestrin, 2016; Friedman, 2001). CatBoost was included for its native ability to handle categorical variables, simplifying preprocessing (Prokhorenkova et al., 2018). Performance evaluation used Accuracy, Precision, Recall, and F1-Score. Additionally, the ROC curve and AUC-ROC calculation were used to assess the discriminative capacity of the models (Fawcett, 2006). To ensure robustness, k-fold cross-validation was employed, which mitigates the risk of performance being dependent on a specific train-test split (Fávero & Belfiore, 2024).

The obtained results revealed distinct performances. The CatBoost Classifier demonstrated superior performance, requiring minimal hyperparameter tuning and simplified preprocessing. Its main advantage was natively handling categorical variables. The initial confusion matrix showed a high accuracy rate, and the AUC-ROC curve presented values close to 1.0 for training and testing, with an AUC of 0.99, signaling excellent discrimination capability and absence of overfitting. The variable importance analysis indicated that the feature carterainadimplidaarrastada had the highest significance. However, its high correlation with the target variable could lead to conceptual data leakage. To investigate this effect, a second CatBoost training was performed removing this variable. The results showed a slight drop in performance, but the variable importance plot became more distributed, with other features like ativo_problematico and modalidade gaining relevance. K-fold cross-validation confirmed the stability and robustness of the results in both versions of the model.

The Random Forest Classifier presented satisfactory results, although inferior to CatBoost. The implementation required more intensive preprocessing, with the removal of variables with high multicollinearity and the transformation of categorical variables via one-hot encoding. This process increased the dataset’s dimensionality, resulting in a longer training time. The confusion matrix and the AUC-ROC curve of Random Forest indicated good predictive power, but with AUC values slightly lower than CatBoost’s. The XGBoost Classifier, using the same preprocessing as Random Forest, demonstrated remarkable performance, outperforming Random Forest in all metrics and approaching CatBoost. Its most evident advantage was processing speed, significantly faster than Random Forest. The XGBoost AUC-ROC curve also showed excellent values, and the model’s robustness was confirmed by cross-validation.

In comparative analysis, CatBoost stood out as the algorithm with the best overall performance. Its advantage lies in the combination of high accuracy with simplicity in the preprocessing of categorical variables. XGBoost emerged as a strong alternative, with performance almost as good as CatBoost’s and superior speed to Random Forest. Random Forest, although robust, proved less suitable for this scenario, due to its sensitivity to the preprocessing of categorical variables and higher computational cost. The discussion of the results shows that the choice of algorithm should adapt to the characteristics of the data and the problem requirements.

The superiority of gradient boosting-based algorithms (XGBoost and CatBoost) over the bagging method (Random Forest) suggests that the sequential construction of trees; each new tree corrects the errors of the previous one, was more effective in capturing default patterns. CatBoost’s performance reinforces the importance of algorithms with optimized mechanisms for categorical features, a common challenge in financial datasets. The need to apply one-hot encoding for Random Forest and XGBoost increased computational complexity and may have diluted the informative power of some variables. The importance of variables revealed by the models offers insights for risk management. Features such as overduedelinquent portfolio and problematic_asset were the strongest predictors, but the models’ ability to extract power from other variables, such as credit modality and indexer, demonstrates the potential of Machine Learning. The identification that certain credit modalities are more associated with default may allow financial institutions to adjust their policies more granularly.

The robustness of the models, confirmed by cross-validation, is crucial for their applicability in the real world. The consistency of CatBoost and XGBoost performance across the different validation folds indicates that the models have learned generalizable patterns, not just noise from the training set. This provides greater reliability to the results and confidence for their implementation in production systems. The research, therefore, validates a rigorous methodological process that can be replicated by financial institutions to develop their own predictive modeling solutions.

This work demonstrated the feasibility and effectiveness of applying Machine Learning models for default prediction using data from the Central Bank of Brazil. The process ranged from rigorous data treatment to the implementation and comparison of three supervised algorithms. Exploratory analysis was fundamental in guiding specific treatments, such as focusing on individual clients. The comparison between models revealed that, for the analyzed dataset, the CatBoost algorithm achieved the best overall results. Its ability to natively handle categorical variables simplified preprocessing and resulted in a model with excellent accuracy and reliability. XGBoost also showed exceptional performance, positioning itself as a competitive alternative. Random Forest, despite generating acceptable results, was the least performant and the most costly in processing time. It is concluded that the objective was achieved: it was demonstrated that boosting algorithms, especially CatBoost, combined with adequate data preprocessing, offer a robust and precise solution for default prediction, potentially enhancing credit risk strategies in financial institutions.

References:
Banco Central do Brasil (BACEN). 2024. Available at: <https://dadosabertos. bcb. gov. br/dataset/scrdata>. Accessed on: 03 Apr. 2025.
Breiman, L. (2001). Random Forests. Machine Learning, 45(1), 5–32. doi: 10.1023/A:1010933404324.
Chen, T.; Guestrin, C. 2016. XGBoost: A scalable tree boosting system. 1st ed. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 785-794.
(CNC) Confederação Nacional do Comércio de Bens, Serviços e Turismo. 2024. Consumer Indebtedness and Default Survey (Peic) – April 2024. Available at: <https://portaldocomercio. org. br/publicacoes
posts/pesquisa-de-endividamento-e-inadimplencia-do-consumidor-peic-abril-de-2024/:>. Accessed on: 03 Apr. 2025.
Fávero, L. P.; Belfiore, P. 2024. Manual de Análise de Dados: estatística e Machine Learning com EXCEL®, SPSS®, STATA®, R® e Python®. 2nd ed. LTC, Rio de Janeiro, RJ, Brazil.
Fawcett, T. (2006). An Introduction to ROC Analysis. Pattern Recognition Letters, 27(8), 861–874. doi: 10.1016/j. patrec.2005.10.010.
Friedman, J. H. (2001). Greedy Function Approximation: A Gradient Boosting Machine. Annals of Statistics, 29(5), 1189–1232. doi: 10.1214/aos/1013203451.
Kotsiantis, S. B. (2007). Supervised Machine Learning: A Review of Classification Techniques. Informatica, 31(3), 249–268.
Poder360. 2024. Indebtedness in Brazil reaches 41.51% of the adult population in November. Available at:<https://www. poder360. com. br/poder-economia/inadimplencia-no-brasil-atinge-4151-da-populacao-adulta-em-novembro/>. Accessed on: 17 Jun. 2025.
Prokhorenkova, L.; Gusev, G.; Vorobev, A.; Dorogush, A. V.; Gulin, A. 2018. CatBoost: unbiased boosting with categorical features. 1st ed. Advances in Neural Information Processing Systems (NeurIPS)., 31.

Executive summary from the Final Course Work of the Specialization in Data Science and Analytics of the MBA USP/Esalq

Learn more about the course; click here:

Who edited this article

Most recent

You may also like

October 05, 2026

Predição da inadimplência de parcelamentos de dívidas tributárias

O parcelamento de débitos tributários constitui um instrumento relevante de recuperação fiscal, permitindo que contribuintes regularizem suas obrigações de forma parcelada, ao mesmo tempo em que expõe a administração tributária ao risco de cancelamento por inadimplência. O objetivo foi desenvolver e avaliar modelos de machine learning para a predição de cancelamento de parcelamentos de ICMS, visando subsidiar estratégias proativas de cobrança. Utilizou-se uma base de dados de parcelamentos históricos da Secretaria da Economia do Estado de Goiás. Foram treinados e comparados os algoritmos Árvore de Decisão, Random Forest e XGBoost, com otimização de hiperparâmetros via GridSearchCV e avaliação por matrizes de confusão e curvas ROC. O XGBoost apresentou desempenho superior, com AUC de 0,869 no modelo que incluiu a variável Quantidade de Parcelas e 0,778 sem ela, evidenciando a centralidade dessa feature. Aplicado à carteira ativa de R$ 2,752 bilhões, o modelo identificou que 92,9% do valor total apresentou risco de cancelamento igual ou superior a 50%, com R$ 1,488 bilhão concentrado em parcelamentos de risco extremo, resultado consistente com o comportamento histórico de cancelamentos nas fases iniciais dos acordos. Os resultados demonstraram que a adoção de modelos preditivos na gestão de parcelamentos tributários possibilita a transição de uma postura reativa para uma abordagem preventiva, com potencial de ampliar substantivamente a recuperação fiscal.

Palavras-chave: Administração tributária; Aprendizado de máquina; Classificação binária; Recuperação fiscal; XGBoost.

October 05, 2026

Sistema interativo para geração e comparação de modelos preditivos de concessões mensais de crédito rural

A capacidade de prever o volume futuro de concessões de crédito rural é essencial para a alocação eficiente de recursos e definição de metas de desembolso. O trabalho teve como objetivo desenvolver uma plataforma interativa web para gerar, analisar e comparar modelos preditivos de séries temporais de concessões de crédito rural, abrangendo o período de março de 2011 a janeiro de 2026. Confrontaram-se técnicas de econometria (ARIMA, SARIMA, SARIMAX) e regressão linear com métodos de machine learning (Random Forest, XGBoost). A metodologia incluiu a coleta de dados mensais de concessões de crédito rural, variáveis macroeconômicas e indicadores de commodities agrícolas, seguida de análise exploratória e desenvolvimento da plataforma em arquitetura cliente-servidor com Python e tecnologias web. A aplicação da plataforma à previsão de crédito rural em três cenários (total, pessoa física e pessoa jurídica), avaliada por validação cruzada temporal, revelou que nenhuma técnica se mostrou universalmente superior. Os modelos de regressão linear com defasagem sazonal apresentaram os resultados mais consistentes ao longo de todos os folds, mantendo desempenho estável mesmo em períodos de mudança de patamar, nos quais os algoritmos de árvore de decisão registraram forte degradação. O cenário de pessoa jurídica apresentou baixa previsibilidade em todos os modelos. Os resultados demonstraram que a plataforma cumpriu seu objetivo, revelando que a complexidade algorítmica não garante superioridade preditiva e que a escolha do modelo deve ser guiada pelas características da série e pelo contexto de aplicação.

Palavras-chave: Agronegócio; Forecasting; Machine learning; Modelagem preditiva; Séries temporais.

October 05, 2026

Festivais de música como plataforma de engajamento de marcas com consumidores da geração Z

Festivais de música consolidaram-se como ecossistemas complexos de experiência, nos quais a convergência entre entretenimento físico e narrativas digitais redefine as estratégias de posicionamento de marca. No cenário pós-pandemia, o setor de eventos apresentou uma retomada expressiva, estabelecendo-se como plataforma estratégica para o engajamento com a Geração Z, público que prioriza a autenticidade e a vivência de experiências compartilhadas em detrimento de formatos de publicidade tradicional. O estudo objetivou analisar de que forma as ativações de marca nesses ambientes impactaram o engajamento dos consumidores nascidos entre 1995 e 2010. A metodologia caracterizou-se por uma pesquisa quantitativa e descritiva, realizada por meio da aplicação de um questionário estruturado que obteve a participação de 163 respondentes. Os resultados demonstraram que as estratégias de marketing de experiência, especialmente as que integraram atributos estéticos e potencial de compartilhamento digital, apresentaram as maiores médias de percepção positiva. Verificou-se que a confiança na marca foi fortalecida após interações físicas bem-sucedidas, revelando uma simbiose entre o ambiente emocional do evento e a jornada digital do jovem. Em contraste, a percepção de autenticidade mediada por influenciadores digitais obteve o menor índice de concordância. Concluiu-se que o engajamento da Geração Z foi potencializado por estratégias híbridas que permitiram ao consumidor assumir o papel de protagonista na construção da narrativa da marca, priorizando a autenticidade da vivência direta.

Palavras-chave: Comportamento do consumidor; Consumo cultural; Estratégias transmídia; Influenciadores digitais; Marketing de experiência.

Compliance And Esg

October 05, 2026

Compliance para mitigar e prevenir furtos em canteiros de obras: Programa de integridade aplicado à construção civil

Furtos em canteiros de obras representam um desafio significativo para a construção civil, gerando impactos financeiros, operacionais e reputacionais. Nesse contexto, programas de integridade e compliance surgiram como ferramentas de gestão para fortalecer a governança e mitigar riscos. O estudo objetivou propor um programa de conformidade aplicado à construção civil, focado na prevenção e mitigação de furtos em canteiros de obras. Adotou-se uma abordagem qualitativa, com apoio quantitativo, desenvolvida em duas etapas. Primeiramente, realizou-se uma pesquisa de campo entre fevereiro e março de 2026, aplicando um questionário eletrônico a profissionais do setor. Em seguida, elaborou-se um estudo de caso fictício, baseado em experiências profissionais do autor, integrando os resultados da pesquisa a práticas de gestão de riscos e governança. Os resultados evidenciaram a importância da implementação de programas de compliance no setor e indicaram que a combinação de mecanismos de controle, processos estruturados, capacitação de equipes, canais de denúncia, monitoramento contínuo e fortalecimento da cultura ética pode reduzir vulnerabilidades. Concluiu-se que a adoção de práticas de integridade amplia a capacidade preventiva das organizações e aprimora a governança e a gestão de riscos no setor.

Palavras-chave: Compliance; Construção civil; Furtos; Gestão de riscos; Governança corporativa.

October 05, 2026

Painel multi-sinal para otimização da priorização de vulnerabilidades em segurança cibernética

A crescente proliferação de vulnerabilidades cibernéticas tornou inadequada a priorização baseada exclusivamente em métricas estáticas de severidade. Desenvolveu-se e avaliou-se um painel analítico multi-sinal para otimizar a priorização de vulnerabilidades cibernéticas, integrando Common Vulnerability Scoring System (CVSS), Exploit Prediction Scoring System (EPSS), critérios derivados do Stakeholder-Specific Vulnerability Categorization (SSVC) e o catálogo Known Exploited Vulnerabilities (KEV) como variável-alvo supervisionada. Consolidaram-se 137.854 registros de vulnerabilidades do NVD (2022–2025), com 607 KEVs confirmados (0,44%), caracterizando um problema de classificação com classe fortemente desbalanceada. Treinou-se um modelo Random Forest supervisionado com dez variáveis não-circulares e avaliou-se por métricas adequadas ao desbalanceamento. O modelo alcançou AUC-ROC de 0,9869 e AUC-PR de 0,4959, superando o EPSS isolado em ambas as métricas (AUC-ROC=0,9383 e AUC-PR=0,3231). A análise de discrepâncias com a abordagem determinística do SSVC revelou que 83,4% das vulnerabilidades foram sobrepriorizadas. Dos 4.584 CVEs classificados como P0, 4.029 representaram vulnerabilidades de alto risco iminente não confirmadas como exploradas, sinalizadas pelo modelo. Concluiu-se que a abordagem multi-sinal vai além da consulta ao catálogo KEV, identificando vulnerabilidades com alto potencial de exploração futura e orientando a priorização proativa de remediação.

Palavras-chave: Exploit prediction; Gestão de riscos; Gestão de vulnerabilidades; Known Exploited Vulnerabilities (KEV); Random Forest.

Neuroscience And Learning In Education

October 05, 2026

Meditação: uma ferramenta que colabora com o professor em sala de aula

O estudo objetivou levantar as práticas meditativas, seus benefícios, limitações e possibilidades de aplicação no contexto escolar, com foco científico e em publicações existentes, visando ampliar estratégias de promoção da saúde mental e bem-estar de estudantes e professores. Realizou-se uma pesquisa exploratória e descritiva, de abordagem qualitativa, fundamentada em revisão bibliográfica de artigos científicos, livros e documentos publicados nos últimos dez anos, e em relatos de experiência da pesquisadora. A metodologia incluiu a definição científica de meditação e a análise de estudos sobre meditação e atenção plena em ambientes escolares, incorporando contribuições da neurociência, mas evitando reducionismos biológicos da aprendizagem. Como resultado principal, elaborou-se uma Cartilha de Práticas Meditativas para Professores, concebida como material de apoio pedagógico complementar. Os achados indicaram que a meditação pode contribuir para a redução de sintomas de estresse, ansiedade e depressão, além de favorecer a atenção, autorreflexão, empatia e convivência. Concluiu-se que a cartilha oferece orientações simples e adaptáveis para a sala de aula, sendo uma ferramenta complementar que não substitui intervenções pedagógicas ou políticas públicas. A sustentabilidade dessas práticas requer articulação com o projeto pedagógico, apoio institucional e formação docente, integrando neurociência, pedagogia e experiência prática para uma educação mais atenta às dimensões cognitivas, emocionais, sociais e existenciais dos alunos.

Palavras-chave: Ambiente escolar; Atenção plena; Meditação; Neurociência; Saúde mental.