October 05, 2026
Sistema interativo para geração e comparação de modelos preditivos de concessões mensais de crédito rural
Sistema Interativo para Geração e Comparação de Modelos Preditivos de Concessões Mensais de Crédito Rural
Henrique Martins Ferreira; Gabrielle Maria Romeiro Lombardi
DOI: 10.22167/2675-6528-202602995
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
A capacidade de prever o volume futuro de concessões de crédito rural é essencial para a alocação eficiente de recursos e definição de metas de desembolso. O trabalho teve como objetivo desenvolver uma plataforma interativa web para gerar, analisar e comparar modelos preditivos de séries temporais de concessões de crédito rural, abrangendo o período de março de 2011 a janeiro de 2026. Confrontaram-se técnicas de econometria (ARIMA, SARIMA, SARIMAX) e regressão linear com métodos de machine learning (Random Forest, XGBoost). A metodologia incluiu a coleta de dados mensais de concessões de crédito rural, variáveis macroeconômicas e indicadores de commodities agrícolas, seguida de análise exploratória e desenvolvimento da plataforma em arquitetura cliente-servidor com Python e tecnologias web. A aplicação da plataforma à previsão de crédito rural em três cenários (total, pessoa física e pessoa jurídica), avaliada por validação cruzada temporal, revelou que nenhuma técnica se mostrou universalmente superior. Os modelos de regressão linear com defasagem sazonal apresentaram os resultados mais consistentes ao longo de todos os folds, mantendo desempenho estável mesmo em períodos de mudança de patamar, nos quais os algoritmos de árvore de decisão registraram forte degradação. O cenário de pessoa jurídica apresentou baixa previsibilidade em todos os modelos. Os resultados demonstraram que a plataforma cumpriu seu objetivo, revelando que a complexidade algorítmica não garante superioridade preditiva e que a escolha do modelo deve ser guiada pelas características da série e pelo contexto de aplicação.
Palavras-chave: Agronegócio; Forecasting; Machine learning; Modelagem preditiva; Séries temporais.
1. Introdução
A agropecuária brasileira desempenha um papel crucial na economia nacional, representando em 2024 cerca de 6,5% do Produto Interno Bruto (PIB) nas atividades primárias (IBGE, 2025) e aproximadamente 23% ao incluir a agroindústria e serviços correlatos (CNA, 2025). Este setor é vital para a geração de empregos e receitas de exportação, sustentando cadeias produtivas rurais (Cepea, 2025).
Nesse cenário, o Plano Safra se destaca como o principal programa do governo brasileiro para o financiamento e desenvolvimento do setor agropecuário. Ele consiste em um conjunto anual de políticas, diretrizes e recursos financeiros destinados a apoiar as atividades agrícolas e pecuárias, visando fomentar o agronegócio por meio da disponibilização de crédito rural para custeio, investimento e comercialização. Isso busca ampliar o acesso ao crédito com condições diferenciadas, garantindo maior segurança e sustentabilidade na produção (Governo Federal, 2025). Os recursos são disponibilizados por instituições financeiras públicas e privadas (Serasa Experian, 2024), promovendo um setor mais competitivo e eficiente (Governo Federal, 2025).
O crédito rural, em particular, colabora para o aumento da capacidade de compra de insumos e capital, além de diminuir os riscos na comercialização, reforçando sua função como mecanismo para reduzir as incertezas do mercado (Borges, 2021). Ademais, ele é fundamental tanto para elevar a produtividade agrícola quanto para promover o uso sustentável da terra (CPI, 2020).
Dada a magnitude e complexidade do mercado de crédito rural, a capacidade de estimar o volume de concessões futuras é fundamental. Previsões precisas são cruciais para a alocação eficiente de recursos financeiros, para a definição de metas de desembolso por parte das instituições financeiras e para o reforço do planejamento estratégico governamental e institucional. Torna-se, assim, imperativo o desenvolvimento de metodologias capazes de realizar essas previsões.
Nesse sentido, técnicas de machine learning têm se destacado como recurso valioso para organizações que buscam inovações na análise de dados, impulsionando o conhecimento e a capacidade preditiva de negócios (Hurwitz e Kirsch, 2018). Contudo, construir previsões robustas em economia e finanças não é tarefa trivial. Modelos precisam ser complexos para incorporar variáveis relevantes, mas seletivos para excluir informações de pouca contribuição. Os métodos de aprendizado de máquina representam uma alternativa promissora aos modelos estatísticos tradicionais, pois permitem capturar padrões não lineares e interações complexas ocultas nos dados, sendo cada vez mais empregados em previsões macroeconômicas e financeiras (Cerulli e Drago, 2021; BACEN, 2022).
Entretanto, a superioridade dos métodos de machine learning sobre abordagens estatísticas tradicionais não é consensual na literatura. Makridakis, Spiliotis e Assimakopoulos (2018), ao analisarem a competição M4, constataram que métodos estatísticos frequentemente superaram algoritmos de machine learning, especialmente em séries com histórico limitado. Os mesmos autores (Makridakis, Spiliotis e Assimakopoulos, 2020) argumentam que o desempenho relativo entre as abordagens depende das características específicas de cada série, como extensão do histórico, intensidade da sazonalidade e razão sinal-ruído, sem garantia de superioridade universal de nenhuma técnica.
Ainda assim, as metodologias econométricas clássicas mantêm sua relevância. Modelos autorregressivos, como ARIMA e SARIMA, destacam-se pela robustez na modelagem de séries temporais financeiras, capturando dependências temporais, sazonalidades e tendências. São amplamente empregados na previsão de variáveis econômicas, como inflação e taxas de juros, consolidando-se como ferramentas de referência para projeções de curto e médio prazo (Box et al., 2016; Morettin e Toloi, 2006). A análise comparativa entre métodos tradicionais e modernos é, portanto, relevante, especialmente em um setor estratégico como o crédito rural, onde previsões precisas podem gerar impactos significativos para instituições financeiras e políticas públicas.
Nesse contexto, evidencia-se a importância de mecanismos que favoreçam a reprodutibilidade dos modelos preditivos e assegurem transparência nos parâmetros e métricas de desempenho. O desenvolvimento de uma plataforma interativa com essas características pode ampliar o acesso às técnicas de previsão e promover o uso efetivo de métodos científicos no apoio à tomada de decisões estratégicas no crédito rural. Diante do exposto, o objetivo deste trabalho é desenvolver uma plataforma interativa capaz de possibilitar geração e comparação de modelos preditivos e, por meio dessa plataforma, aplicar métodos de previsão para o volume de crédito rural concedido no Sistema Financeiro Nacional, buscando comparar o desempenho de técnicas tradicionais de séries temporais, como o uso de modelos autorregressivos, e regressão linear com métodos de machine learning.
2. Material e Métodos
A presente pesquisa caracterizou-se como um estudo de natureza aplicada, com abordagem quantitativa, focado no desenvolvimento e aplicação de modelos preditivos para séries temporais. O objetivo central foi desenvolver uma plataforma interativa para a geração e comparação de modelos, e, por meio dela, aplicar métodos de previsão para o volume de crédito rural concedido no Sistema Financeiro Nacional, comparando técnicas tradicionais de séries temporais e regressão linear com métodos de machine learning.
A variável de interesse principal foi o volume de crédito rural concedido pelas instituições financeiras no Brasil. Para a modelagem, consideraram-se três cenários: concessões para pessoas físicas (série 20701 do SGS), para pessoas jurídicas (série 20689 do SGS) e concessões totais (série cred_rrl_ccdd), esta última resultante da soma das duas anteriores. Os dados foram coletados mensalmente, abrangendo o período de março de 2011 a janeiro de 2026.
Além das variáveis de interesse, utilizaram-se dados de variáveis econômicas e indicadores de commodities agrícolas como fatores exógenos. As fontes de dados incluíram o Sistema Gerenciador de Séries Temporais (SGS) do Banco Central do Brasil, o Centro de Estudos Avançados em Economia Aplicada (CEPEA/ESALQ) e o Ministério da Agricultura e Pecuária. A coleta foi realizada via API, download de tabelas e pesquisa em cartilhas do Plano Safra.
Para garantir a consistência temporal do conjunto de dados, realizou-se um truncamento das séries históricas. Todas as séries foram ajustadas para cobrir o período comum de março de 2011 a janeiro de 2026, totalizando 179 observações. Este intervalo foi definido pela disponibilidade das variáveis de crédito rural. Observações com valores ausentes foram removidas por padrão, embora a plataforma permitisse a aplicação de técnicas alternativas de imputação via programação Python.
Adicionalmente, aplicou-se um deslocamento temporal (shift de -1) às variáveis de saldo de carteira de crédito, criando defasagens para utilizá-las como preditores do volume de concessão do mês corrente. Simulações do comportamento do recurso disponível do Plano Safra foram realizadas, assumindo trajetórias de decaimento linear e exponencial, além de manter uma variável de recurso constante para teste como fator exógeno, considerando o ciclo anual do Plano Safra de julho a junho.
Para a caracterização das séries temporais de concessões mensais de crédito rural, realizaram-se análises exploratórias. Incluíram-se análises de correlação de Pearson, decomposição clássica aditiva da série em componentes de tendência, sazonalidade e resíduos, e análise das funções de autocorrelação (ACF) e autocorrelação parcial (PACF). O teste de Dickey-Fuller Aumentado (ADF) foi aplicado para verificar a estacionariedade das séries, e o Variance Inflation Factor (VIF) foi calculado para diagnosticar multicolinearidade.
A seleção de variáveis e parâmetros seguiu critérios específicos para cada tipo de modelo. Para ARIMA e SARIMA, a especificação baseou-se na análise das funções ACF/PACF e no teste ADF, complementada pelo método `auto_arima` da biblioteca `pmdarima`. No caso do SARIMAX, priorizaram-se variáveis exógenas com correlação de Pearson superior a 0,50 e justificativa econômica. Para os modelos de machine learning, como Random Forest e XGBoost, adotou-se estratégia exploratória, aproveitando mecanismos internos de seleção de features por importância relativa.
Para viabilizar a aplicação, análise e comparação sistemática dos modelos preditivos, desenvolveu-se uma plataforma web interativa denominada Power Regressor. A arquitetura foi cliente-servidor, com o frontend responsável pela interface do usuário e o backend executando os modelos preditivos e processando os dados. A comunicação entre as camadas ocorreu via protocolo HTTP com requisições REST e respostas em formato JSON. O frontend foi desenvolvido com HTML5, CSS3 e JavaScript, e o backend em Python utilizando Flask.
Para a modelagem preditiva, integraram-se bibliotecas Python como Scikit-learn, Statsmodels (para ARIMA, SARIMA e SARIMAX), Skforecast, XGBoost e LightGBM. Pandas e NumPy foram utilizados para manipulação de dados, e Plotly para geração de gráficos interativos. A plataforma foi projetada para permitir o desenvolvimento de modelos sem a necessidade obrigatória de conhecimento em linguagens de programação, embora possibilitasse o uso opcional de código Python para modelos personalizados.
Os modelos foram avaliados em três cenários de crédito rural (total, pessoa física e pessoa jurídica) utilizando validação cruzada temporal com múltiplas divisões sequenciais treino-teste (folds). A construção dos folds considerou percentuais da série histórica total (40%, 60%, 80% e 100%), com divisão treino-teste sem embaralhamento para respeitar a ordem cronológica. O horizonte de previsão adotado foi de um passo à frente (one-step-ahead). As métricas de avaliação empregadas foram o R² Score, o RMSE e o MAPE.
3. Resultados e Discussão
A pesquisa teve como objetivo principal desenvolver uma plataforma interativa para a geração, análise e comparação de modelos preditivos de séries temporais de concessões de crédito rural, e aplicar essa plataforma para comparar o desempenho de diferentes técnicas de previsão. Os resultados obtidos, detalhados a seguir, abrangem a análise exploratória dos dados, o desenvolvimento da plataforma e a avaliação do desempenho dos modelos nos cenários de crédito rural total, para pessoa física e para pessoa jurídica, conforme os procedimentos metodológicos estabelecidos.
Inicialmente, uma visão geral das análises realizadas até a obtenção dos resultados dos modelos preditivos incluiu a correlação de Pearson entre as variáveis do dataset, a análise do fator de inflação da variância (VIF), a decomposição clássica aditiva da série em componentes de tendência, sazonalidade e resíduos, o teste de Dickey-Fuller Aumentado (ADF) para verificar a estacionariedade, e a análise das funções de autocorrelação (ACF) e autocorrelação parcial (PACF). Os modelos preditivos aplicados foram Regressão Linear, SARIMA, SARIMAX, Random Forest e XGBoost, com horizonte de previsão de um mês à frente e avaliação por validação cruzada temporal, utilizando as métricas R² Score, RMSE e MAPE.
Análise Exploratória
A plotagem das séries temporais de concessões mensais de crédito rural permitiu uma visualização detalhada do comportamento dos dados. O volume total de crédito rural concedido demonstrou um crescimento expressivo, partindo de aproximadamente sete bilhões de reais mensais em 2011 e atingindo valores próximos a trinta e cinco bilhões de reais, com picos de até cerca de sessenta bilhões de reais a partir de 2023. Essa tendência de alta reflete a expansão contínua do agronegócio brasileiro e a crescente demanda por financiamento no setor.
As concessões para pessoas jurídicas exibiram maior volatilidade, com um pico excepcional de aproximadamente dezoito bilhões de reais em agosto de 2023, um valor significativamente superior aos patamares históricos. Em contraste, as concessões para pessoas físicas apresentaram um comportamento mais estável e pulverizado, indicando uma distribuição mais homogênea das operações. Em todas as séries, foi notório um padrão sazonal bem definido, diretamente relacionado ao calendário do Plano Safra e ao ciclo agrícola.
Os meses de junho, julho e agosto consistentemente registraram os maiores volumes de concessões, coincidindo com o início do ano-safra e o período de plantio. Por outro lado, janeiro e fevereiro apresentaram os menores volumes, o que se alinha com o período de colheita e uma menor demanda por financiamento de custeio. Essa sazonalidade pronunciada é um fator crucial para a modelagem preditiva, exigindo a incorporação de componentes sazonais nos modelos para capturar adequadamente essa periodicidade.
A análise da matriz de correlação de Pearson revelou relações lineares de magnitudes variadas entre as variáveis econômicas e financeiras e as concessões de crédito rural. As variáveis relacionadas ao Plano Safra, como o recurso total disponibilizado, apresentaram as correlações mais fortes, alcançando um coeficiente de Pearson de 0,74 com as concessões totais. Mesmo considerando trajetórias de decaimento exponencial dos recursos ao longo do ano safra, a correlação manteve-se elevada, em torno de 0,65, confirmando a disponibilidade orçamentária como um dos principais determinantes do volume de crédito concedido.
A variável temporal, representada pelo ano, mostrou uma correlação moderada de 0,70, o que reflete a tendência de crescimento estrutural no volume de crédito rural ao longo do período analisado. Os indicadores de preços de commodities agrícolas, como boi gordo (r = 0,66), soja (r = 0,69), café (r = 0,60) e milho (r = 0,57), apresentaram correlações positivas e moderadamente fortes. Isso sugere que períodos de preços mais elevados no mercado de commodities estimulam a demanda por financiamento, impulsionados pelo aumento da rentabilidade esperada para os produtores.
As variáveis de taxa de câmbio, tanto de compra quanto de venda do dólar, apresentaram correlações moderadas positivas, em torno de 0,65. Esse achado indica que a valorização cambial, ao tornar as exportações agrícolas mais rentáveis, incentiva investimentos no setor e, consequentemente, eleva a demanda por crédito rural. Em contrapartida, as taxas de inadimplência para pessoas físicas e jurídicas mostraram correlações negativas fracas com as concessões de crédito rural.
Embora a magnitude dessas correlações negativas seja baixa, o sinal é coerente com a expectativa de que um aumento na inadimplência possa levar as instituições financeiras a adotar uma postura mais cautelosa na concessão de novos financiamentos, impactando negativamente o volume total concedido. Essa relação, mesmo que fraca, destaca a importância da gestão de risco no contexto do crédito rural e sua influência nas decisões de desembolso.
A análise das correlações entre as próprias variáveis preditivas revelou uma elevada redundância em diversos grupos de variáveis. As quatro variáveis de câmbio (dólar compra e venda, médio e de fechamento) apresentaram correlações próximas a 1,00 entre si, indicando que carregam informações muito semelhantes. Da mesma forma, as variáveis de taxa de juros (juros para pessoa física e jurídica) e as versões linear e exponencial dos recursos do Plano Safra também exibiram correlações superiores a 0,95.
Os preços de commodities agrícolas também formaram um grupo coeso, com correlações variando entre 0,81 e 0,95. Esse padrão de alta correlação entre preditores indica que, embora individualmente possam estar relacionadas com a variável-alvo, muitas variáveis carregam informação sobreposta. Essa multicolinearidade exige um diagnóstico formal antes da modelagem para evitar problemas de instabilidade nos coeficientes e interpretação dos modelos.
Para quantificar essa redundância, foi calculado o Variance Inflation Factor (VIF). No cenário baseline, com trinta e três variáveis, vinte e sete apresentaram VIF superior a dez, sendo que variáveis como as cotações do dólar e os recursos do Plano Safra registraram valores tendendo ao infinito, um indicativo de colinearidade perfeita. A partir da remoção sistemática de duplicatas e da manutenção de apenas um representante por grupo temático, foi possível reduzir progressivamente a multicolinearidade, como observado nos diversos cenários abordados.
A decomposição sazonal aditiva das três séries de concessões de crédito rural permitiu aprofundar a compreensão de sua estrutura temporal. A análise dos componentes de tendência revelou comportamentos distintos: as concessões para pessoas físicas mostraram uma tendência ascendente gradual, com aceleração notável a partir de 2020. Já as concessões para pessoas jurídicas exibiram uma tendência mais irregular, com crescimento mais pronunciado apenas nos últimos anos da série, refletindo a maior volatilidade desse segmento.
O componente de sazonalidade confirmou a existência de um padrão cíclico de doze meses em todas as três séries, evidenciando que as concessões de crédito rural seguem um comportamento anual recorrente. Esse padrão sazonal está diretamente associado ao ciclo agrícola brasileiro e ao calendário do Plano Safra, que tradicionalmente se inicia em julho. A regularidade e a amplitude significativa do componente sazonal justificam a utilização de modelos que incorporem explicitamente essa estrutura temporal, como SARIMA e SARIMAX.
Para verificar formalmente a estacionariedade das séries temporais e determinar os parâmetros de diferenciação necessários para os modelos ARIMA e SARIMA, aplicou-se o teste de Dickey-Fuller Aumentado (ADF). Os resultados confirmaram que nenhuma das três séries originais é estacionária (p-valores superiores a 0,05), o que era esperado devido aos componentes de tendência e sazonalidade identificados. Essa não estacionariedade impede a aplicação direta de modelos autorregressivos clássicos, justificando a necessidade de diferenciação.
Para as séries de crédito rural total e pessoas jurídicas, todas as três formas de diferenciação (simples, sazonal e dupla) resultaram em séries estacionárias, com p-valores inferiores a 0,001, sugerindo flexibilidade na escolha das especificações dos modelos SARIMA. Por outro lado, a série de pessoas físicas apresentou um comportamento distinto: embora a diferenciação simples tenha sido suficiente para alcançar estacionariedade, a diferenciação sazonal isolada não foi efetiva (p-valor de 0,326), indicando que a componente de tendência é mais dominante que a sazonalidade.
A diferenciação dupla [diff(1).diff(12)] resultou em forte estacionariedade para a série de pessoas físicas, com um valor ADF de -7,279, demonstrando a necessidade de tratamento simultâneo de tendência e sazonalidade para essa série. Comparando as magnitudes das estatísticas ADF, a série de pessoas jurídicas apresentou o valor mais extremo na diferenciação simples (ADF = -10,076), enquanto a série total mostrou sensibilidades semelhantes para a diferenciação simples (ADF = -7,380) e para a diferenciação sazonal (ADF = -7,278). A série de pessoas físicas exigiu diferenciação dupla para alcançar estacionariedade forte, confirmando seu padrão temporal distinto com predominância da tendência sobre a sazonalidade.
A análise das funções de autocorrelação (ACF) das séries originais revelou padrões característicos de séries não estacionárias com componentes sazonais. As três séries apresentaram decaimento lento e senoidal das autocorrelações, confirmando a presença de tendência e a estrutura sazonal de período de doze meses. As autocorrelações exibiram picos locais em torno dos lags múltiplos de doze (lags 12, 24, 36), confirmando a periodicidade anual das concessões de crédito rural. A amplitude das oscilações foi ligeiramente mais acentuada nas séries total e de pessoas físicas em comparação à série de pessoas jurídicas, sugerindo um componente sazonal mais pronunciado nesses segmentos.
A análise da função de autocorrelação parcial (PACF) das séries originais mostrou um comportamento distinto da ACF. Para todas as três séries, observou-se um corte abrupto após os primeiros lags, com a maioria das autocorrelações parciais tornando-se não significativas após o lag um ou dois. A combinação dos padrões observados na ACF (decaimento lento senoidal) e na PACF (corte rápido) é consistente com a caracterização de processos autorregressivos integrados com sazonalidade, reforçando a adequação de modelos SARIMA para estas séries.
Com base nessas análises, foram propostas especificações de modelos SARIMA como candidatas adequadas. Para a série total, considerou-se SARIMA(1,1,0)(1,1,0)12 ou SARIMA(2,1,1)(1,1,1)12, priorizando termos autorregressivos devido ao comportamento da PACF. Para a série de pessoas físicas, SARIMA(1,1,1)(1,1,1)12 foi sugerida, considerando o decaimento da ACF e o corte da PACF. Para a série de pessoas jurídicas, SARIMA(1,1,1)(1,1,0)12 foi indicada, dado o padrão similar, mas com componente sazonal ligeiramente menos pronunciado. A seleção final dos parâmetros p, d, q, P, D, Q seria refinada através da comparação das métricas R², RMSE, MAE e MAPE, e com a utilização do método auto_arima da biblioteca pmdarima.
Desenvolvimento da plataforma interativa
Para viabilizar a aplicação, análise e comparação sistemática dos modelos preditivos de forma reprodutível e acessível, foi desenvolvida uma plataforma web interativa denominada Power Regressor. A plataforma foi estruturada em arquitetura cliente-servidor, onde o frontend é responsável pela interface do usuário e gerenciamento de estado local, e o backend executa os modelos preditivos e processa os dados. A comunicação entre as camadas ocorre via protocolo HTTP através de requisições REST, com respostas em formato JSON, garantindo uma experiência de usuário fluida.
O backend foi implementado em Python utilizando Flask para gerenciamento de rotas HTTP e sessões de usuário. Para a modelagem preditiva, foram integradas bibliotecas como Scikit-learn (para modelos de machine learning e métricas de avaliação), Statsmodels (para modelos ARIMA, SARIMA e SARIMAX), Skforecast (para forecasters recursivos), XGBoost e LightGBM (para gradient boosting), e Prophet (para séries temporais com sazonalidade). Para manipulação e visualização de dados, foram utilizadas as bibliotecas Pandas, NumPy e Plotly, respectivamente.
O frontend foi desenvolvido com HTML5, CSS3 e JavaScript puro, sem dependências de frameworks externos. A biblioteca CodeMirror foi integrada para permitir a edição de código Python diretamente na interface, com realce de sintaxe. O fluxo de trabalho na plataforma Power Regressor inicia-se com o upload do arquivo da base de dados, seguido pela seleção da variável-alvo e das features preditoras através de menus interativos. O usuário configura os parâmetros do modelo desejado, como tipo de algoritmo, proporção treino-teste e hiperparâmetros específicos, e inicia o treinamento com um clique.
Após o treinamento, a plataforma retorna as métricas de desempenho, gráficos de predição e o código Python completo que foi executado. Este código pode ser copiado para reprodução independente ou editado para ajustes finos, permitindo uma transição suave entre o uso guiado e a programação avançada. A plataforma favorece a experimentação rápida, permitindo que o usuário teste múltiplas configurações de forma iterativa: diferentes algoritmos sobre os mesmos dados, variações nos conjuntos de features, ajustes de hiperparâmetros ou estratégias alternativas de divisão temporal.
Cada modelo treinado permanece acessível através de seu card individual, com métricas e visualizações preservadas, eliminando a necessidade de reexecutar análises anteriores. A comparação visual lado a lado dos gráficos de predição e das tabelas de métricas facilita a identificação do modelo com melhor desempenho preditivo e maior adequação ao problema específico. A plataforma expõe explicitamente toda a lógica de modelagem através do código Python gerado automaticamente, o que é fundamental para fins educacionais e para validação científica, permitindo que as análises sejam auditadas e aprimoradas.
Para validar o correto funcionamento da plataforma, os resultados gerados pelo Power Regressor foram confrontados com os resultados obtidos pela execução dos mesmos scripts Python em ambiente local (Jupyter Notebook), utilizando as mesmas versões das bibliotecas. Em todos os modelos testados, as métricas de desempenho (R², RMSE, MAPE) e os valores preditos foram idênticos, confirmando que a geração dinâmica de código e a execução via servidor produzem resultados reprodutíveis e consistentes com a execução direta em Python. Essa validação reforça a confiabilidade da plataforma como ferramenta de pesquisa e ensino.
Desempenho dos modelos preditivos no cenário total
Para o crédito rural total, foram avaliados modelos de regressão linear (com features de defasagem, sazonalidade e variáveis exógenas), SARIMA, SARIMAX (considerando o Plano Safra como variável exógena), Random Forest e XGBoost. No fold de 100%, que utilizou toda a série histórica para treinamento, os modelos apresentaram um coeficiente de determinação (R²) no teste entre 0,18 e 0,67. O modelo Random Forest obteve o maior R² (0,67) e o menor erro percentual absoluto médio (MAPE) de 12,7%, seguido de perto pelo XGBoost, com R² de 0,66 e MAPE de 13,6%.
A regressão linear e o SARIMAX apresentaram desempenho equivalente, ambos com R² de 0,63, enquanto o SARIMA(1,1,1)(1,0,2)12 ficou ligeiramente abaixo, com R² de 0,59. A configuração SARIMA(2,1,1)(1,1,1)12, que utilizou dupla diferenciação sazonal, apresentou o pior resultado, com R² de 0,18, indicando uma sobrediferenciação prejudicial à capacidade preditiva do modelo. A inclusão de variáveis exógenas do Plano Safra no SARIMAX não trouxe um ganho expressivo em relação ao SARIMA puro para o cenário total.
Esse resultado sugere que, quando combinada com a estrutura autorregressiva, a informação do Plano Safra já está parcialmente capturada pela sazonalidade intrínseca da série. Nos modelos de machine learning, a variável `lag12` (valor do mesmo mês do ano anterior) foi consistentemente a feature de maior importância, seguida pela variável `lag1` (defasagem de um mês). Isso ressalta a relevância dos padrões sazonais e de curto prazo para a previsão do crédito rural total.
Para avaliar a robustez dos modelos ao longo do tempo, foi analisada a evolução do R² no teste em cada fold da validação cruzada temporal. A validação cruzada revelou instabilidade em todos os modelos no fold de 80%, cujo conjunto de teste coincidiu com o período de forte aceleração das concessões entre 2023 e 2024, incluindo picos excepcionais que superaram cinquenta e sete bilhões de reais mensais. Nesse fold, os modelos Random Forest e XGBoost apresentaram R² negativos, indicando que suas previsões foram piores que a média simples dos dados de teste.
Essa evidência demonstra que esses modelos, treinados com dados de patamares inferiores, não conseguiram extrapolar para os valores atipicamente elevados. Em contrapartida, os modelos lineares mostraram-se mais resilientes nesse fold, mantendo um R² de 0,72. Essa resiliência pode ser atribuída à estrutura linear com `lag12` e variáveis de tendência, que permitem alguma extrapolação proporcional. No fold de 100%, com mais dados de treino abrangendo o período atípico, todos os modelos recuperaram o desempenho, indicando a importância de um histórico de dados completo para o treinamento de modelos de machine learning em séries com mudanças de patamar.
Desempenho dos modelos preditivos no cenário de pessoa física
O cenário de pessoa física apresentou os melhores resultados de previsão entre os três cenários analisados, refletindo um comportamento mais estável e previsível dessa série. No fold de 100%, o modelo XGBoost obteve o melhor desempenho, com um R² de 0,71 e um MAPE de 14,7%. Foi seguido pelo SARIMA(1,1,1)(1,0,2)12, que alcançou um R² de 0,60 e um MAPE de 17,9%, e pelo SARIMAX, com R² de 0,57 e MAPE de 17,2%.
O modelo de regressão linear, com toda a série, apresentou um R² de 0,54, inferior ao XGBoost e ao SARIMA puro. Isso indica que, em situações de mudança de regime na série, como o aumento do patamar de concessões a partir de 2020, a inclusão de dados antigos pode prejudicar a generalização do modelo linear. A configuração SARIMA com diferenciação sazonal dupla apresentou um desempenho muito inferior, com R² de 0,06, confirmando que a sobrediferenciação é prejudicial também para a série de pessoa física.
O SARIMAX, mesmo com a inclusão de variáveis do Plano Safra, não superou o SARIMA puro no fold de 100%, contrariando a expectativa de que as variáveis exógenas melhorariam a previsão. Esse resultado pode ser explicado pela colinearidade entre os recursos do Plano Safra e a sazonalidade já capturada pelo componente sazonal do SARIMA. A instabilidade no fold de 80% se repetiu nos cenários de pessoa física, com todos os modelos, exceto o Linear, apresentando R² negativo.
O XGBoost demonstrou sensibilidade especialmente alta a essa mudança de patamar, registrando um R² de -0,56 no fold de 80%, mas se recuperou plenamente no fold de 100%, alcançando um R² de 0,71. Esse padrão reforça que algoritmos de árvore, por sua construção, não extrapolam além dos valores observados no treino, tornando-se vulneráveis quando o conjunto de teste contém valores superiores ao range de treinamento. Isso sublinha a limitação desses modelos em cenários de forte crescimento ou mudança de regime.
Desempenho dos modelos preditivos no cenário de pessoa jurídica
O cenário de pessoa jurídica representou o maior desafio preditivo da pesquisa. A série de concessões para pessoa jurídica caracteriza-se por alta volatilidade, picos excepcionais, como o de agosto de 2023, que superou dezessete bilhões de reais, e uma baixa razão sinal-ruído. Essas características tornam a previsão intrinsecamente mais difícil. No fold de 100%, todos os modelos apresentaram um R² no teste abaixo de 0,20, com um MAPE variando entre 29,8% e 33,4%, indicando um desempenho modesto.
O melhor resultado foi obtido pelo SARIMAX com a variável do Plano Safra de investimento, com um R² de 0,17 e um MAPE de 29,8%, seguido pelo SARIMA puro, com R² de 0,11. Os modelos de machine learning apresentaram os piores resultados neste cenário: o Random Forest obteve um R² de 0,07, apesar de um R² de treino de 0,87, o que indica um sobreajuste severo. O XGBoost registrou um R² de 0,01, demonstrando uma falha significativa na generalização.
O contraste entre o R² de treino elevado do Random Forest (0,87) e seu R² de teste muito baixo (0,07) é um indicativo claro de sobreajuste. Apesar do uso de um limite de profundidade máxima de sete para as árvores, o modelo memorizou padrões do treino que não se generalizaram para dados não vistos. O XGBoost, com profundidade máxima de dois e regularização, apresentou um overfitting menor, com R² de treino de 0,61, mas igualmente falhou na generalização para o conjunto de teste.
A validação cruzada temporal confirmou a dificuldade persistente de previsão para o cenário de pessoa jurídica. O melhor resultado individual foi observado no fold de 80%, onde o modelo linear alcançou um R² de 0,48, mas esse desempenho não se sustentou no fold de 100%. A maioria dos modelos apresentou R² negativo nos folds de 40% e 60%, indicando que, com pouco histórico de treino, nenhuma técnica conseguiu capturar a dinâmica volátil da série de pessoa jurídica.
Essa dificuldade possivelmente decorre da concentração de operações em poucos tomadores de grande porte, cujas decisões de financiamento respondem a fatores idiossincráticos que não são adequadamente representados pelas variáveis macroeconômicas disponíveis no dataset. A principal limitação encontrada neste trabalho, portanto, refere-se à disponibilidade de variáveis preditoras para o cenário de pessoa jurídica, que se mostraram insuficientes para capturar a dinâmica das concessões de crédito rural para esse segmento.
Em síntese, a plataforma interativa Power Regressor foi desenvolvida com sucesso, cumprindo o objetivo de gerar, analisar e comparar modelos preditivos de crédito rural. A aplicação da plataforma revelou que nenhuma técnica se mostrou universalmente superior, com modelos de regressão linear apresentando maior consistência em cenários de mudança de patamar, enquanto algoritmos de árvore de decisão demonstraram forte degradação. O cenário de pessoa jurídica, contudo, apresentou baixa previsibilidade em todos os modelos, indicando que a complexidade algorítmica não garante superioridade preditiva e que a escolha do modelo deve ser guiada pelas características da série e pelo contexto de aplicação.
4. Conclusão
O presente trabalho teve como objetivo desenvolver uma plataforma interativa para a geração e comparação de modelos preditivos de séries temporais de concessões de crédito rural no Brasil, confrontando técnicas econométricas e de machine learning. Verificou-se que a plataforma Power Regressor foi desenvolvida com sucesso, cumprindo sua função de viabilizar a análise e a reprodutibilidade de modelos preditivos sem a necessidade obrigatória de programação. A aplicação da plataforma aos cenários de crédito rural total, para pessoa física e para pessoa jurídica revelou que nenhuma técnica se mostrou universalmente superior. Observou-se que, para o crédito rural total e para pessoa física, os modelos de regressão linear apresentaram maior consistência e resiliência em períodos de mudança de patamar, mantendo desempenho estável. Em contraste, os algoritmos de árvore de decisão, como Random Forest e XGBoost, embora com bom desempenho em períodos estáveis, registraram forte degradação e R² negativos em momentos de picos excepcionais, indicando dificuldade de extrapolação para valores não observados no treinamento. A inclusão de variáveis exógenas no SARIMAX não trouxe ganhos significativos em relação ao SARIMA puro, sugerindo que a sazonalidade intrínseca da série já capturava parte dessa informação.
O cenário de concessões para pessoa jurídica representou o maior desafio preditivo, com todos os modelos apresentando desempenho modesto e baixa previsibilidade. Essa limitação decorreu, principalmente, da insuficiência de variáveis macroeconômicas disponíveis para capturar a dinâmica volátil desse segmento, que parece ser influenciada por fatores idiossincráticos de poucos tomadores de grande porte. O tamanho limitado da série histórica também restringiu a capacidade dos modelos de machine learning de aprender padrões complexos, contribuindo para o sobreajuste observado. Como próximos passos, sugere-se investigar a viabilidade de incorporar variáveis desagregadas por tomador e indicadores de expectativa do agronegócio para aprimorar a previsibilidade no cenário de pessoa jurídica, além de explorar técnicas de combinação de modelos (ensembling). Os resultados reforçam que a complexidade algorítmica não garante superioridade preditiva, e a escolha do modelo deve ser guiada pelas características específicas da série e pelo contexto de aplicação.
Referências Bibliográficas
Bacen. 2022. Machine learning em previsões macroeconômicas. Blog do Banco Central, Brasília, DF, Brasil. Disponível em: https://www.bcb.gov.br/noticiablogbc/10/noticia. Acesso em 24 set. 2025
Borges, L. 2021. Crédito rural e crescimento da produção agropecuária no Brasil. Revista de Economia e Sociologia Rural, v. 59, n. 2, Brasília, DF, Brasil.
Box, G. E. P.; Jenkins, G. M.; Reinsel, G. C.; Ljung, G. M. 2016. Time Series Analysis: Forecasting and Control. 5. ed. Hoboken: John Wiley & Sons, Hoboken, NJ, EUA.
Cepea; CNA. 2025. Mercado de Trabalho no Agronegócio – 1º trimestre de 2025. Piracicaba, SP, Brasil. Disponível em: https://www.cepea.org.br/br/releases/mercado-de-trabalho-cepea-agronegocio-brasileiro-emprega-28-5-mi-de-pessoas-no-1-tri-novo-recorde.aspx Acesso em: 24 set. 2025.
Cerulli, G.; Drago, C. 2021. Machine Learning for Macroeconomic Forecasting. Journal of Economic Surveys, v. 35, n. 4, p. 1234–1259, Londres, Reino Unido.
CNA. 2025. PIB do agronegócio registra crescimento de 6,49% no primeiro trimestre de 2025. Brasília, DF, Brasil. Disponível em: https://cnabrasil.org.br/publicacoes/pib-do-agronegocio-registra-crescimento-de-6-49-no-primeiro-trimestre-de-2025 Acesso em: 23 set. 2025.
CPI/PUC-Rio. 2020. O papel do crédito rural na produtividade e sustentabilidade agrícola no Brasil. PUC-Rio, Rio de Janeiro, RJ, Brasil.
Governo Federal. 2025. Governo Federal lança Plano Safra 2025/2026 com R$ 516,2 bilhões para impulsionar o agro brasileiro. Brasília, DF, Brasil. Disponível em: https://www.gov.br/agricultura/pt-br/assuntos/noticias/governo-federal-lanca-plano-safra-2025-2026-com-r-516-2-bilhoes-para-impulsionar-o-agro-brasileiro Acesso em: 22 set. 2025.
Hurwitz, J.; Kirsch, D. 2018 Machine Learning for Dummies®, IBM Limited Edition. Hoboken: John Wiley & Sons, Hoboken, NJ, EUA. E-book. Disponível em: https://ia801609.us.archive.org/11/items/introduction-to-machine-learning/Introduction%20to%20Machine%20Learning.pdf Acesso em: 24 set. 2025.
IBGE. 2025. Apresentação – PIB – 1º trimestre de 2025. Instituto Brasileiro de Geografia e Estatística, Rio de Janeiro, RJ, Brasil. Disponível em: https://agenciadenoticias.ibge.gov.br/media/com_mediaibge/arquivos/a7fdee2f3567a414e64d6a58f6ebfdff.pdf Acesso em: 23 set. 2025.
Makridakis, S.; Spiliotis, E.; Assimakopoulos, V. 2018. Statistical and Machine Learning forecasting methods: Concerns and ways forward. PLoS ONE, v. 13, n. 3, San Francisco, CA, EUA. Disponível em: https://doi.org/10.1371/journal.pone.0194889 Acesso em: 22 abr. 2026.
Makridakis, S.; Spiliotis, E.; Assimakopoulos, V. 2020. The M4 Competition: 100,000 time series and 61 forecasting methods. International Journal of Forecasting, v. 36, n. 1, p. 54–74, Amsterdã, Países Baixos. Disponível em: https://doi.org/10.1016/j.ijforecast.2019.04.014 Acesso em: 22 abr. 2026.
Morettin, P. A.; Toloi, C. M. A. 2006. Análise de Séries Temporais. 2. ed. São Paulo: Edgard Blücher, São Paulo, SP, Brasil.
Serasa Experian. 2024. O que é e como funciona o Plano Safra e a importância para quem fornece crédito rural. Serasa Experian , São Paulo, SP, Brasil. Disponível em: https://www.serasaexperian.com.br/conteudos/o-que-e-e-como-funciona-o-plano-safra-e-a-importanci Acesso em: 22 set. 2025.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy