Artigo

05 de outubro de 2026

Predição da inadimplência de parcelamentos de dívidas tributárias

Predição da Inadimplência de Parcelamentos de Dívidas Tributárias

Humberto Pinheiro de Oliveira; Lauro Marques Vicari

DOI: 10.22167/2675-6528-202602996

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

O parcelamento de débitos tributários constitui um instrumento relevante de recuperação fiscal, permitindo que contribuintes regularizem suas obrigações de forma parcelada, ao mesmo tempo em que expõe a administração tributária ao risco de cancelamento por inadimplência. O objetivo foi desenvolver e avaliar modelos de machine learning para a predição de cancelamento de parcelamentos de ICMS, visando subsidiar estratégias proativas de cobrança. Utilizou-se uma base de dados de parcelamentos históricos da Secretaria da Economia do Estado de Goiás. Foram treinados e comparados os algoritmos Árvore de Decisão, Random Forest e XGBoost, com otimização de hiperparâmetros via GridSearchCV e avaliação por matrizes de confusão e curvas ROC. O XGBoost apresentou desempenho superior, com AUC de 0,869 no modelo que incluiu a variável Quantidade de Parcelas e 0,778 sem ela, evidenciando a centralidade dessa feature. Aplicado à carteira ativa de R$ 2,752 bilhões, o modelo identificou que 92,9% do valor total apresentou risco de cancelamento igual ou superior a 50%, com R$ 1,488 bilhão concentrado em parcelamentos de risco extremo, resultado consistente com o comportamento histórico de cancelamentos nas fases iniciais dos acordos. Os resultados demonstraram que a adoção de modelos preditivos na gestão de parcelamentos tributários possibilita a transição de uma postura reativa para uma abordagem preventiva, com potencial de ampliar substantivamente a recuperação fiscal.

Palavras-chave: Administração tributária; Aprendizado de máquina; Classificação binária; Recuperação fiscal; XGBoost.

1. Introdução

A inadimplência tributária representa um persistente desafio para as esferas governamentais, abrangendo Municípios, Estados e União. A ausência ou a inconsistência de ações de cobrança administrativa nos estágios iniciais da dívida contribui para baixos índices de recuperação, impactando diretamente a arrecadação espontânea e a capacidade de implementação de políticas públicas de ajuste fiscal. A dimensão desse problema é corroborada por dados recentes, que indicam que os estados brasileiros acumulam um montante de R$ 1,17 trilhão em débitos inscritos em dívida ativa, valor equivalente a dezesseis meses de arrecadação tributária, conforme levantamento da Federação Nacional do Fisco Estadual e Distrital (Fenafisco, 2025). Essa situação demonstra a conversão da falta de pagamento de tributos correntes em passivos de difícil recuperação, com a dívida ativa superando, em diversas unidades da federação, a própria capacidade anual de arrecadação, o que restringe o espaço fiscal para investimentos essenciais.

No contexto do Estado de Goiás, a Secretaria da Economia tem implementado diversas medidas para incentivar o cumprimento das obrigações tributárias. Entre essas iniciativas, destacam-se o sistema de auto regularização tributária, alterações legislativas que excluem a aplicação de multas punitivas e a exclusão de multas de dívidas já consolidadas que ultrapassam o valor da obrigação principal. Atualmente, está em desenvolvimento um sistema de conformidade fiscal, visando favorecer a regularidade fiscal do contribuinte por meio de vantagens para aqueles que mantêm suas obrigações em dia. Contudo, apesar dessas ações, persistem procedimentos que se opõem aos objetivos de adimplência, como a exigência de que o pagamento do crédito tributário vencido seja efetuado exclusivamente em moeda corrente ou cheque, sem aceitar tecnologias de pagamento mais recentes como Pix, débito em conta ou cartão de crédito. Adicionalmente, a obrigatoriedade de efetuar um parcelamento para cada tipo de tributo e fase da dívida dificulta o processo para contribuintes com múltiplos débitos.

A soma de débitos de terceiros junto à Secretaria da Economia do Estado de Goiás atingiu R$ 69,27 bilhões até o final de agosto de 2025. Desse total, apenas 5,48% (equivalente a R$ 3,8 bilhões) estavam parcelados. Análises internas da dívida não negociada revelam que 8,51% dos parcelamentos foram cancelados por não cumprimento dos termos do acordo. Este elevado índice de valores negociados, mas não quitados, aponta para a ausência de uma metodologia eficaz capaz de prever a inadimplência em parcelamentos de dívidas tributárias. Tal lacuna gera insegurança na gestão estratégica e operacional, comprometendo a arrecadação e o planejamento fiscal. A predição da inadimplência, portanto, é crucial para aprimorar a gestão fiscal e promover uma recuperação mais eficiente dos créditos.

A inadimplência tributária não é um fenômeno aleatório, mas é influenciada por um conjunto de fatores observáveis de natureza socioeconômica, comportamental e tributária. No plano socioeconômico, variáveis como o segmento econômico, o faturamento do contribuinte e o regime de tributação podem afetar a capacidade de pagamento e o cumprimento das obrigações fiscais. Empresas de menor porte ou inseridas em setores mais voláteis tendem a apresentar maior probabilidade de inadimplência (Paes, 2014; Alves et al., 2023). No aspecto comportamental, o histórico de regularidade fiscal, incluindo o número de parcelamentos anteriores, atrasos e reparcelamentos, serve como um forte indicador da propensão à inadimplência, alinhado à literatura de risco de crédito (Santos, 2022). Fatores tributários, como o valor total do parcelamento, o tipo de tributo e a quantidade de parcelas, também exercem influência sobre a manutenção do acordo, com evidências de que parcelamentos de maior valor e duração apresentam taxas mais elevadas de cancelamento (Brandão Filho et al., 2023). A complexidade dessas interações justifica a aplicação de algoritmos de machine learning para identificar padrões preditivos.

Diante da complexidade dos fatores que influenciam a inadimplência e da necessidade de uma gestão fiscal mais proativa, justifica-se a busca por ferramentas que permitam antecipar o risco de cancelamento de parcelamentos. A implementação de modelos preditivos de machine learning pode transformar a abordagem reativa atual em uma estratégia preventiva, otimizando a alocação de recursos e ampliando a recuperação fiscal. Assim, o objetivo deste trabalho é implementar algoritmos de machine learning para prever a probabilidade de cancelamento do parcelamento tributário no contexto da Secretaria da Economia do Estado de Goiás, visando subsidiar políticas mais eficazes de cobrança e recuperação de crédito.

2. Material e Métodos

A presente pesquisa caracterizou-se como um estudo aplicado, de natureza quantitativa, com o propósito de desenvolver e avaliar modelos preditivos de machine learning. O objetivo central foi prever a probabilidade de cancelamento de parcelamentos tributários, especificamente do Imposto sobre Operações Relativas à Circulação de Mercadorias e sobre Prestações de Serviços de Transporte Interestadual e Intermunicipal e de Comunicação (ICMS) no âmbito da Secretaria da Economia do Estado de Goiás.

A unidade de análise consistiu em parcelamentos de ICMS, com dados coletados de bases corporativas da Secretaria da Economia do Estado de Goiás, incluindo sistemas de Auto de Infração, Parcelamento de créditos, arrecadação, dívida ativa, cadastro de contribuintes e “BI Business Objects”. O período de coleta e análise dos dados estendeu-se de 2018 a agosto de 2025.

O conjunto de dados final, ou “dataset”, compreendeu 58.490 observações, cada uma representando um parcelamento. Foram selecionadas 18 variáveis explicativas e uma variável alvo binária, que indicava se o parcelamento foi cancelado ou quitado. As variáveis foram categorizadas em dimensões socioeconômicas, comportamentais e tributárias, relevantes para o fenômeno da inadimplência.

Para a preparação dos dados, variáveis categóricas como “Tipo de Pessoa”, “Método de Elaboração do Parcelamento” e “Segmento Econômico” foram transformadas em variáveis “dummy”. Esse pré-processamento foi essencial para adequar os dados ao formato de entrada dos algoritmos de machine learning utilizados no estudo.

A estratégia metodológica empregou três algoritmos de classificação binária: Árvore de Decisão, Random Forest e XGBoost. Esses modelos foram escolhidos por sua eficácia em problemas de predição de risco de crédito e pela capacidade de capturar interações complexas entre as variáveis que influenciam a inadimplência tributária.

Os dados foram divididos em subconjuntos de treino e teste. O conjunto de treino foi utilizado para a estimação dos parâmetros dos modelos e para a otimização de hiperparâmetros. O conjunto de teste, por sua vez, foi reservado para a avaliação final do desempenho dos modelos em dados não vistos, garantindo a validação da capacidade de generalização.

A otimização dos hiperparâmetros foi realizada por meio de validação cruzada estratificada do tipo k-fold, com k igual a cinco. Nesse procedimento, o conjunto de treino foi particionado em cinco subconjuntos, mantendo a proporção original das classes. Em cada iteração, quatro partes foram usadas para ajuste e uma para validação, com o desempenho de cada combinação de hiperparâmetros sendo a média das métricas obtidas nas cinco partições (Stone, 1974).

O critério de seleção do modelo final para cada algoritmo foi a maximização do “recall” da classe “cancelado” (refit=’recall_cancelado’). Essa escolha metodológica priorizou a identificação dos parcelamentos com maior propensão ao cancelamento, minimizando os falsos negativos, o que é crucial em contextos de gestão de dívida tributária.

Os algoritmos de Árvore de Decisão, Random Forest e XGBoost foram configurados com parâmetros iniciais e otimizados via GridSearchCV. Para o Random Forest e XGBoost, aplicaram-se técnicas como “bootstrap” e subamostragens de observações e “features”, com semente aleatória fixada em 42 para reprodutibilidade. A otimização explorou diferentes combinações de parâmetros relevantes para refinar o desempenho preditivo e a capacidade de generalização.

Para a avaliação da qualidade dos modelos, empregaram-se métricas derivadas da Matriz de Confusão, como acurácia, precisão, sensibilidade (recall) e especificidade. Adicionalmente, utilizou-se a Curva Receiver Operating Characteristic (ROC) e a Área Sob a Curva (AUC-ROC), que quantificam a capacidade discriminativa do modelo em diferentes limiares de decisão (Fawcett, 2006; Hanley; Mcneil, 1982).

Em todas as etapas de coleta, processamento e análise dos dados, garantiu-se a observância ao sigilo fiscal. O material suplementar do trabalho, incluindo o código-fonte das análises, foi disponibilizado em repositório público sem qualquer dado que permitisse a identificação de contribuintes, conforme DOI: 10.5281/zenodo.2193946.

3. Resultados e Discussão

A análise exploratória dos dados revelou padrões significativos associados ao cancelamento de parcelamentos de ICMS, fornecendo subsídios empíricos cruciais para a etapa de modelagem preditiva. O conjunto de dados, composto por 18 variáveis e 58.490 observações, sendo 62,46% de parcelamentos cancelados e 37,54% quitados, permitiu uma compreensão detalhada das características dos contribuintes e dos acordos. As variáveis foram classificadas em categóricas nominais, métricas discretas e contínuas, e agrupadas em dimensões socioeconômicas, comportamentais e tributárias, conforme sua relevância para o fenômeno da inadimplência.

Análise descritiva da variável valor da dívida parcelada

A distribuição da variável “Valor da Dívida Parcelada” demonstrou forte assimetria à direita, com a maioria das observações concentrada em valores mais baixos, mas com a presença de parcelamentos significativamente elevados. A mediana da dívida parcelada foi de R$ 15.835,42, enquanto a média atingiu R$ 170.173,84, indicando a influência de valores extremos na elevação da média. O desvio padrão de R$ 4.680.585,48 e a grande diferença entre o percentil 99 (R$ 2.060.441,81) e o valor máximo (R$ 832.140.797,41) confirmaram a existência de casos excepcionalmente altos, que distorcem a percepção da distribuição central dos dados.

Ao segmentar a análise pela situação do parcelamento, observou-se que os parcelamentos cancelados (classe 1) apresentaram valores sistematicamente superiores aos quitados (classe 0) em grande parte da distribuição. A mediana da dívida para os parcelamentos cancelados foi de R$ 23.087,72, um valor substancialmente maior que os R$ 8.238,57 observados nos quitados. Essa tendência se manteve nos percentis superiores, com parcelamentos cancelados atingindo R$ 87.418,18 no percentil 75 e R$ 599.591,82 no percentil 95, em contraste com R$ 31.906,86 e R$ 290.417,52 para os quitados, respectivamente. Contudo, a presença de valores extremos muito elevados entre os parcelamentos quitados, como o máximo de R$ 832.140.797,41, superou o máximo dos cancelados (R$ 110.963.357,92), explicando a maior variabilidade interna nesse grupo.

Quantidade de parcelas e cancelamento do parcelamento

A variável “Quantidade de Parcelas” revelou diferenças substanciais entre parcelamentos quitados e cancelados, com os cancelados apresentando, em média e ao longo dos percentis, um número maior de parcelas. A correlação positiva moderada (r = 0,48) entre a quantidade de parcelas e o cancelamento sugere que planos de pagamento mais longos estão associados a uma maior incidência de inadimplência. A mediana do número de parcelas para o conjunto total de observações foi de 21, com uma média de 31,45 e desvio padrão de 27,95, indicando alta dispersão nos termos dos acordos.

A distinção entre os grupos foi ainda mais evidente: a mediana da quantidade de parcelas para os cancelados foi de 41, enquanto para os quitados foi de 9, reforçando a tendência de que parcelamentos com prazos mais longos têm maior probabilidade de serem cancelados. Essa diferença persistiu nos percentis superiores, com 60 parcelas para os cancelados no percentil 75, contra 18 para os quitados, e 96 parcelas para os cancelados no percentil 95, contra 60 para os quitados. Esses achados indicam que a extensão do prazo de pagamento é um fator crítico no comportamento de inadimplência dos contribuintes.

Para aprofundar a análise, os parcelamentos foram agrupados em faixas de quantidade de parcelas: até 12, de 13 a 24, de 25 a 36 e acima de 36 parcelas. Observou-se uma redução progressiva na taxa de quitação à medida que o número de parcelas aumentava, o que se traduz em um crescimento monotônico da taxa de cancelamento. Parcelamentos com até 12 parcelas registraram uma taxa de cancelamento de 32,6%, enquanto aqueles com 13 a 24 parcelas tiveram 62,5%. Para parcelamentos com 25 a 36 parcelas, a taxa subiu para 71,3%, e para os que tinham acima de 36 parcelas, alcançou 90,8%. Esse padrão reforça a centralidade da quantidade de parcelas como preditora e oferece subsídios para o desenho de programas de parcelamento mais eficientes.

Além da quantidade de parcelas, a matriz de correlação revelou que o método de elaboração do parcelamento e variáveis comportamentais relacionadas ao histórico de inadimplência também apresentavam associação relevante com o cancelamento. A forte correlação entre variáveis que representam o comportamento do contribuinte ao longo do tempo sugere a existência de perfis recorrentes de inadimplência. Esses resultados indicam que o cancelamento não é determinado por um único fator, mas por uma combinação complexa de características estruturais e comportamentais, validando a aplicação de modelos de aprendizado de máquina para capturar essas interações.

Implicações para a modelagem preditiva

As análises exploratórias indicaram que as relações entre as variáveis explicativas e a inadimplência são complexas, o que justificou a escolha de algoritmos baseados em árvores de decisão, como Árvore de Decisão, Random Forest e XGBoost, amplamente empregados em problemas de classificação binária no contexto fiscal e financeiro (Breiman e Friedman, 2001). A variável “Quantidade de Parcelas” demonstrou uma importância preditiva substancialmente elevada, sugerindo sua dominância sobre a variável-alvo. Diante disso, optou-se por estimar dois conjuntos de modelos: um incluindo a “Quantidade de Parcelas” e outro excluindo-a. Essa estratégia permitiu avaliar a estabilidade e consistência dos resultados, verificar o poder preditivo do modelo na ausência dessa variável e, principalmente, obter uma leitura mais precisa do papel explicativo dos demais preditores, o que é fundamental para a formulação de políticas de gestão de risco pela administração tributária.

Modelos com a variável Quantidade de Parcelas

Árvore de Decisão

A árvore de decisão, estimada com a variável “Quantidade de Parcelas”, evidenciou o papel dominante dessa característica, respondendo por 87,37% da importância total das variáveis preditoras. As regras geradas pela árvore foram claras e interpretáveis: contribuintes com até cinco parcelas tenderam a ser classificados como quitados (classe 0), enquanto aqueles com mais de 20 parcelas foram quase universalmente classificados como cancelados (classe 1), independentemente de outras variáveis. Para o intervalo de seis a 20 parcelas, a classificação foi modulada pelo valor da dívida parcelada e pelo regime tributário, indicando uma maior heterogeneidade comportamental.

A otimização dos hiperparâmetros via GridSearchCV (max_depth=4, min_samples_leaf=50) não alterou a estrutura das regras nem as métricas de desempenho em relação ao modelo “baseline”, sugerindo que a configuração inicial já havia atingido um patamar estável. A comparação das métricas entre as bases de treino e teste revelou uma notável convergência, com acurácia de 75,7% no treino e 75,8% no teste, sensibilidade de 87,2% em ambos, especificidade de 56,4% no treino e 57,2% no teste, precisão de 77,1% no treino e 76,9% no teste, e AUC de 0,8317 no treino e 0,8353 no teste. As pequenas diferenças, inferiores a um ponto percentual em todas as medidas, indicaram ausência de “overfitting”, confirmando a capacidade de generalização do modelo.

Random Forest

O modelo Random Forest, incluindo a variável “Quantidade de Parcelas”, apresentou desempenho superior ao da árvore de decisão. No “baseline”, a acurácia na base de teste foi de 77,1%, com sensibilidade de 86,6%, especificidade de 61,5% e precisão de 78,6%. Após a otimização com GridSearchCV (max_depth=6, max_features=’sqrt’, min_samples_leaf=10, n_estimators=300), houve um ganho relevante na especificidade, que passou para 62,0%, com AUC de 0,849 e acurácia geral de 77,2%. Esse resultado confirmou que o método de ensemble agrega capacidade de predição.

Na análise de importância das variáveis, a “Quantidade de Parcelas” manteve sua posição de destaque (57,2%), mas com menor dominância em comparação à árvore isolada. Isso permitiu que outras variáveis, como “Dívida X Faturamento” (9,7%), “Método de Elaboração do Parcelamento via Pedido” (8,4%) e “Valor da Dívida Parcelada” (8,4%), exercessem contribuição mais expressiva. As pequenas diferenças entre as métricas de treino e teste, em todas as medidas avaliadas, indicaram ausência de “overfitting”, com acurácia de 76,9% no treino e 77,2% no teste, sensibilidade de 86,7% no treino e 86,4% no teste, especificidade de 60,4% no treino e 62,0% no teste, precisão de 78,6% no treino e 78,8% no teste, e AUC de 0,8462 no treino e 0,8492 no teste.

XGBoost

O modelo XGBoost, com a variável “Quantidade de Parcelas”, demonstrou o melhor desempenho geral neste grupo. No “baseline”, registrou acurácia de 78,6%, sensibilidade de 86,2%, especificidade de 66,1% e precisão de 80,6%, com AUC de 0,869. Após a otimização (max_depth=6, learning_rate=0.03, n_estimators=200, subsample=1.0, colsample_bytree=0.8), as métricas permaneceram estáveis, com AUC de 0,869, sugerindo que o modelo “baseline” já operava próximo ao seu ponto ótimo para essa configuração de dados. A importância das variáveis no XGBoost mostrou uma distribuição mais equilibrada: a “Quantidade de Parcelas” respondeu por 32,7%, seguida pelo “Método de Elaboração do Parcelamento via Pedido” (19,0%) e “Dívida X Faturamento” (5,4%), indicando que este modelo foi capaz de capturar mais nuances preditivas das demais variáveis em comparação aos anteriores.

A análise comparativa dos três modelos com a variável “Quantidade de Parcelas” evidenciou uma progressão consistente de desempenho, com o XGBoost consolidando-se como a melhor alternativa preditiva. Nas matrizes de confusão, o XGBoost apresentou o menor número de falsos positivos (2.293) e o maior número de verdadeiros negativos (4.373), indicando maior especificidade na identificação de parcelamentos quitados. Embora as taxas de recall para a classe cancelada fossem similares entre os modelos (em torno de 86%), o XGBoost demonstrou melhor equilíbrio entre sensibilidade e especificidade, confirmado pela curva ROC, com AUC de 0,869, superando o Random Forest (0,849) e a Árvore de Decisão (0,835). Conclui-se que a inclusão da variável “Quantidade de Parcelas” contribuiu para modelos mais robustos, sendo o XGBoost a escolha mais indicada para a classificação do cancelamento do parcelamento, por aliar maior poder discriminativo geral a uma redução relevante nos erros de classificação dos parcelamentos quitados.

A ordenação de desempenho observada é consistente com a literatura, que aponta a superioridade de métodos de ensemble baseados em árvores, especialmente os de boosting em gradiente, em dados tabulares heterogêneos (Grinsztajn et al., 2022; Shwartz-Ziv e Armon, 2022). Três mecanismos contribuíram para esse resultado: o ajuste sequencial dos resíduos, que permitiu ao XGBoost explorar padrões não lineares e interações complexas; a regularização incorporada à sua função objetivo, que controlou a complexidade e favoreceu a generalização; e a combinação de redução de viés e controle de variância, o que explica a progressão de desempenho entre os modelos. A estabilidade das métricas entre treino e teste, com diferenças inferiores a um ponto percentual, confirmou a ausência de “overfitting”.

Modelos sem a variável Quantidade de Parcelas

A exclusão da variável “Quantidade de Parcelas” promoveu uma redistribuição relevante da importância preditiva entre as demais “features”, permitindo uma análise mais granular dos fatores associados ao comportamento do contribuinte. Essa estratégia foi fundamental para avaliar a robustez dos modelos e a dependência da variável excluída.

Árvore de Decisão

Sem a variável dominante, a árvore de decisão reestruturou suas regras a partir da variável “Dívida X Faturamento” como nó raiz, seguida por “Método de Elaboração via Pedido”, “Valor da Dívida Parcelada”, “Quantidade de Processos Parcelados” e “Dívida Ativa”. Essa reconfiguração revelou que a relação entre o valor da dívida e o faturamento do contribuinte se tornou o fator mais discriminante na ausência do número de parcelas. O desempenho do modelo caiu em relação aos modelos que incluíam a variável “Quantidade de Parcelas”, registrando acurácia de 68,4%, sensibilidade de 85,6%, especificidade de 40,3% e AUC de 0,723. A queda na especificidade foi o reflexo mais direto da ausência de uma variável tão informativa. A otimização via GridSearchCV não alterou as regras nem as métricas, e as pequenas diferenças entre as métricas de treino e teste (acurácia 68,1% no treino e 68,4% no teste, sensibilidade 85,5% no treino e 85,6% no teste, especificidade 38,9% no treino e 40,3% no teste, precisão 70,2% no treino e 70,1% no teste, e AUC 0,7238 no treino e 0,7232 no teste) indicaram ausência de “overfitting”.

Random Forest

No “baseline” sem a “Quantidade de Parcelas”, o Random Forest apresentou acurácia de 70,0%, sensibilidade de 92,8% e especificidade de 32,8%. Essa configuração priorizou fortemente a identificação de cancelamentos, à custa da classificação dos quitados. Após a otimização (max_depth=6, max_features=’sqrt’, min_samples_leaf=5, n_estimators=300), o recall da classe cancelada atingiu 93,0% na validação cruzada e AUC de 0,768. A importância das variáveis revelou um ranking mais equilibrado e informativo: “Dívida X Faturamento” liderou com 25,4%, seguida por “Valor da Dívida Parcelada” (20,4%), “Método de Elaboração via Pedido” (17,7%), “Quantidade de Processos Parcelados” (11,2%) e “Dívida Ativa” (6,1%). Esse resultado indica que o perfil de risco do contribuinte é determinado por um conjunto multidimensional de fatores financeiros e comportamentais, e não apenas pelo volume de parcelas. As diferenças inferiores a um ponto percentual entre as métricas de treino e teste (acurácia 70,2% no treino e 70,0% no teste, sensibilidade 93,2% no treino e 93,0% no teste, especificidade 31,6% no treino e 32,3% no teste, precisão 69,6% no treino e 69,2% no teste, e AUC 0,7238 no treino e 0,7231 no teste) demonstraram a ausência de “overfitting”.

XGBoost

O XGBoost sem a “Quantidade de Parcelas” apresentou o melhor equilíbrio entre sensibilidade e especificidade neste grupo. No “baseline”, registrou acurácia de 72,6%, sensibilidade de 84,4% e especificidade de 53,4%. Após a otimização (max_depth=3, learning_rate=0.03, n_estimators=200, subsample=1.0, colsample_bytree=0.8), a acurácia foi de 71,0%, com recall de 87% para cancelados e 46% para quitados, e AUC de 0,778. A importância das variáveis seguiu padrão similar ao Random Forest, com “Dívida X Faturamento” (23,2%), “Método de Elaboração via Pedido” (12,3%), “Quantidade de Processos Parcelados” (11,8%) e “Valor da Dívida Parcelada” (9,4%) como principais preditores, confirmando a consistência entre os modelos “ensemble” quanto às variáveis mais relevantes. A ausência de “overfitting” foi demonstrada pelas pequenas diferenças entre as métricas das bases de treino e teste (acurácia 71,1% no treino e 71,4% no teste, sensibilidade 86,8% no treino e 86,9% no teste, especificidade 44,9% no treino e 45,9% no teste, precisão 72,5% no treino e 72,4% no teste, e AUC 0,7744 no treino e 0,7781 no teste).

A análise dos modelos sem a variável “Quantidade de Parcelas” revelou uma queda expressiva e generalizada no desempenho preditivo, evidenciando a relevância dessa “feature” para a tarefa de classificação. As curvas ROC registraram reduções substanciais nos valores de AUC em todos os algoritmos: a Árvore de Decisão caiu de 0,835 para 0,723, o Random Forest de 0,849 para 0,768, e o XGBoost de 0,869 para 0,778, indicando perda significativa de poder discriminativo. Esse padrão foi confirmado pelas matrizes de confusão. Embora o Random Forest tenha apresentado o maior número de verdadeiros positivos (10.124), isso ocorreu à custa de um volume elevado de falsos positivos (4.513), sugerindo um viés do modelo em classificar parcelamentos como cancelados, possivelmente por dificuldade em capturar padrões associados à quitação sem a informação de parcelamento. O XGBoost manteve o melhor equilíbrio relativo entre as classes, com 9.461 verdadeiros positivos e 3.060 verdadeiros negativos, além de registrar a menor taxa de falsos negativos (1.420) entre os três, o que o torna novamente o modelo mais adequado mesmo no cenário sem a variável de parcelas. Em conjunto, esses resultados reforçam que a exclusão da “Quantidade de Parcelas” empobrece a capacidade preditiva dos modelos de forma consistente, confirmando seu papel como uma das variáveis mais informativas para a predição de cancelamento dos parcelamentos.

A proeminência da variável “Quantidade de Parcelas” suscita considerações relevantes para a aplicação operacional do modelo. A informação sobre a quantidade de parcelas é definida no ato da formalização do acordo, sendo conhecida ex-ante e disponível desde a primeira competência do contrato, o que viabiliza a escoragem do parcelamento já no início de sua vigência. Contudo, eventos supervenientes, como reparcelamentos e renegociações, podem alterar o valor originalmente parcelado, recomendando a reescoragem periódica dos contratos ativos como rotina operacional. Quanto ao risco de dependência de um único preditor, os resultados do cenário sem a variável funcionam como análise de robustez: embora a exclusão reduza a AUC do XGBoost de 0,869 para 0,778, o modelo preserva poder discriminativo útil, indicando que a estratégia de priorização por risco não colapsa diante de eventual indisponibilidade ou degradação da qualidade dessa informação.

Sob a perspectiva substantiva, a força preditiva da variável “Quantidade de Parcelas” admite interpretação econômica plausível: prazos mais longos ampliam a exposição temporal do contrato a choques adversos na situação financeira do contribuinte e podem, adicionalmente, refletir um mecanismo de autosseleção. Contribuintes em maior dificuldade tendem a optar pelo maior fracionamento disponível da dívida. Nessa leitura, a “Quantidade de Parcelas” não constitui um artefato estatístico, mas uma aproximação de dimensões latentes de fragilidade financeira, o que confere coerência entre o comportamento dos modelos e o conhecimento de domínio da administração tributária.

A aplicação do modelo XGBoost à carteira ativa de parcelamentos de ICMS, composta por 11.942 parcelamentos de 6.582 contribuintes, totalizando R$ 2,752 bilhões, revelou uma concentração crítica de risco: 92,9% do valor total foi classificado com probabilidade de cancelamento igual ou superior a 50%. A partir dos limiares probabilísticos e do histórico de parcelas pagas, os parcelamentos foram segmentados em três grupos de risco. O Grupo 1, Risco Extremo, formado por parcelamentos com probabilidade igual ou superior a 80% de cancelamento, 41 ou mais parcelas e até 10 pagas, concentra 3.551 parcelamentos (29,7% da carteira) e R$ 1,488 bilhão (54,1%), com R$ 141 milhões vencendo já em 2026. O Grupo 2, Alto Risco, com a mesma probabilidade, mas mais de 10 parcelas pagas, reúne 2.374 parcelamentos (19,9%) e R$ 792,6 milhões (28,8%). O Grupo 3, Médio Risco, com probabilidade entre 50% e 79%, abrange 3.600 parcelamentos (30,1%) e R$ 287,4 milhões (10,4%).

Essa segmentação é consistente com o comportamento histórico dos cancelamentos. A análise da base histórica indicou que a maioria dos cancelamentos ocorre nas fases iniciais do parcelamento, com média de apenas 23% e mediana de 12% das parcelas cumpridas, validando os critérios de corte adotados para os grupos de risco. Diante desses resultados, propõe-se a implementação de réguas de cobrança diferenciadas por grupo e por status do parcelamento. Para parcelamentos com status Ativo Adimplente dos Grupos 1 e 2, prevê-se o envio de SMS, e-mail e acionamento pelo “call center” no dia anterior ao vencimento e imediatamente após o não pagamento. Para parcelamentos com status Ativo – Inadimplente dos Grupos 1 e 2, a régua é escalonada em quatro disparos de SMS e e-mail (10 dias antes, 1 dia antes, no vencimento e após o não pagamento), acionamento por “call center” no dia anterior e após o vencimento, e cobrança qualificada por auditor fiscal após o segundo inadimplemento. O Grupo 3 segue régua equivalente à de inadimplência dos grupos anteriores, com supressão da etapa de auditoria. Essa gradação intencional de intensidade otimiza a alocação de recursos de cobrança conforme a criticidade de cada segmento.

As projeções de recuperação fiscal, compreendidas como cenários ilustrativos baseados em “benchmarks” internacionais de administrações tributárias (OCDE, 2014; FMI, 2022), indicam um potencial significativo. Para o Grupo 1 (risco extremo), com baixíssima fração já paga, a recuperação potencial situa-se entre R$ 48 milhões e R$ 96 milhões no período 2026-2027, correspondendo a aproximadamente 15% dos vencimentos programados, com recuperação residual esperada para os anos subsequentes. No Grupo 2 (alto risco), com histórico parcial de adimplência, projeta-se uma recuperação entre R$ 104 milhões e R$ 145 milhões no triênio 2026-2028, compatível com taxas entre 25% e 35% sobre os valores a vencer. Já no Grupo 3 (risco médio), a aplicação de índices entre 40% e 60% resulta em uma recuperação estimada entre R$ 94 milhões e R$ 141 milhões no mesmo horizonte temporal. De forma agregada, sob tais premissas, o cenário de recuperação fiscal no período 2026-2028 situar-se-ia entre R$ 246 milhões e R$ 382 milhões. A quantificação rigorosa do impacto, contudo, demandará desenho avaliativo específico após a implantação da estratégia, conforme discutido nas limitações do estudo. Ainda assim, o resultado evidencia que a principal contribuição do modelo não reside apenas em sua capacidade preditiva, expressa pela AUC de 0,869 na base de teste, mas na reorientação estratégica que viabiliza: ao identificar contribuintes ainda formalmente adimplentes, porém com elevada propensão ao cancelamento, o modelo sustenta a transição de ações não segmentadas por risco para uma abordagem preditiva e preventiva de recuperação fiscal.

Em síntese, os resultados obtidos demonstram que os modelos de machine learning, especialmente o XGBoost, são eficazes na predição do cancelamento de parcelamentos de ICMS, com a variável “Quantidade de Parcelas” revelando-se um preditor central. A aplicação do modelo à carteira ativa de parcelamentos da Secretaria da Economia do Estado de Goiás permitiu identificar uma concentração crítica de risco, com a maioria do valor total dos parcelamentos apresentando alta probabilidade de cancelamento. Essa capacidade preditiva possibilita a transição de uma gestão reativa para uma abordagem proativa na cobrança, com o potencial de otimizar a recuperação fiscal e subsidiar políticas mais eficazes de gestão de débitos tributários.

4. Conclusão

O presente estudo buscou desenvolver e avaliar modelos de machine learning para a predição de cancelamento de parcelamentos de ICMS, visando subsidiar estratégias proativas de cobrança. Verificou-se que o algoritmo XGBoost demonstrou desempenho superior, com uma Área Sob a Curva ROC (AUC) de 0,869 no cenário que incluiu a variável Quantidade de Parcelas e 0,778 sem ela, evidenciando a centralidade desse preditor. A aplicação do modelo à carteira ativa de parcelamentos da Secretaria da Economia do Estado de Goiás revelou que 92,9% do valor total apresentava risco de cancelamento igual ou superior a 50%, com R$ 1,488 bilhão concentrado em parcelamentos de risco extremo. Esse achado é consistente com o comportamento histórico de cancelamentos nas fases iniciais dos acordos. A principal contribuição reside na capacidade de reorientar a gestão de débitos tributários de uma postura reativa para uma abordagem preditiva e preventiva, otimizando a alocação de recursos e ampliando o potencial de recuperação fiscal, com projeções de recuperação entre R$ 246 milhões e R$ 382 milhões no período de 2026-2028.

Não obstante os resultados alcançados, o estudo possui limitações. Os dados utilizados provieram de uma única unidade federativa e de um recorte temporal específico, o que restringe a generalização dos achados para outros contextos sem validação adicional. Além disso, por se tratar de um estudo observacional, os modelos identificaram associações preditivas, e não relações causais formais. A eficácia da régua de cobrança segmentada proposta demandará avaliação específica após sua implantação, e o desempenho dos modelos, mensurado em dados históricos, está sujeito a “model drift” por alterações legislativas ou no perfil da carteira, recomendando monitoramento contínuo e retreinamento periódico. Sugere-se para estudos futuros a incorporação de variáveis socioeconômicas e comportamentais adicionais, a aplicação de técnicas de aprendizado por reforço para otimização dinâmica das réguas de cobrança, e a avaliação longitudinal do impacto das estratégias propostas sobre as taxas efetivas de recuperação. Recomenda-se também a segmentação da base de dados em grupos mutuamente exclusivos, conforme o estágio de cobrança da dívida, para revelar padrões preditivos mais precisos e subsidiar políticas diferenciadas.

Referências Bibliográficas

Alves, E. L. G.; Viana, L. Z. B.; Santos, F.; Franco, W.; Pinheiro, V. 2023. Leveraging Property Tax Collection Through an Unsupervised Model for Taxpayer Qualification. In: Encontro Nacional de Inteligência Artificial e Computacional [ENIAC], 2023, Belo Horizonte, MG, Brasil. Anais… p. 1142-1156.

Brandão Filho, Murillo C. M.; Menezes Neto, E.J.; Vasconcelos, C. C. Perfil de inadimplência de créditos fiscais de autarquias e fundações públicas federais. Revista da AGU, 22(2):215-243.

Fenafisco, 2025 [Referência completa não encontrada no documento original]

Paes, N. L. 2014. Os efeitos dos parcelamentos sobre a arrecadação tributária. Estudos Econômicos, USP, 44(2): 323-350.

Santos, R. Q. 2022. Estimando a arrecadação da dívida ativa da União com machine learning: uma análise baseada nos dados de arrecadação do período de 2015 a 2021. Revista da CGU, 14(26): 223-237.

Stone, M. 1974. Cross-Validatory Choice and Assessment of

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

05 de outubro de 2026

Sistema interativo para geração e comparação de modelos preditivos de concessões mensais de crédito rural

A capacidade de prever o volume futuro de concessões de crédito rural é essencial para a alocação eficiente de recursos e definição de metas de desembolso. O trabalho teve como objetivo desenvolver uma plataforma interativa web para gerar, analisar e comparar modelos preditivos de séries temporais de concessões de crédito rural, abrangendo o período de março de 2011 a janeiro de 2026. Confrontaram-se técnicas de econometria (ARIMA, SARIMA, SARIMAX) e regressão linear com métodos de machine learning (Random Forest, XGBoost). A metodologia incluiu a coleta de dados mensais de concessões de crédito rural, variáveis macroeconômicas e indicadores de commodities agrícolas, seguida de análise exploratória e desenvolvimento da plataforma em arquitetura cliente-servidor com Python e tecnologias web. A aplicação da plataforma à previsão de crédito rural em três cenários (total, pessoa física e pessoa jurídica), avaliada por validação cruzada temporal, revelou que nenhuma técnica se mostrou universalmente superior. Os modelos de regressão linear com defasagem sazonal apresentaram os resultados mais consistentes ao longo de todos os folds, mantendo desempenho estável mesmo em períodos de mudança de patamar, nos quais os algoritmos de árvore de decisão registraram forte degradação. O cenário de pessoa jurídica apresentou baixa previsibilidade em todos os modelos. Os resultados demonstraram que a plataforma cumpriu seu objetivo, revelando que a complexidade algorítmica não garante superioridade preditiva e que a escolha do modelo deve ser guiada pelas características da série e pelo contexto de aplicação.

Palavras-chave: Agronegócio; Forecasting; Machine learning; Modelagem preditiva; Séries temporais.

05 de outubro de 2026

Festivais de música como plataforma de engajamento de marcas com consumidores da geração Z

Festivais de música consolidaram-se como ecossistemas complexos de experiência, nos quais a convergência entre entretenimento físico e narrativas digitais redefine as estratégias de posicionamento de marca. No cenário pós-pandemia, o setor de eventos apresentou uma retomada expressiva, estabelecendo-se como plataforma estratégica para o engajamento com a Geração Z, público que prioriza a autenticidade e a vivência de experiências compartilhadas em detrimento de formatos de publicidade tradicional. O estudo objetivou analisar de que forma as ativações de marca nesses ambientes impactaram o engajamento dos consumidores nascidos entre 1995 e 2010. A metodologia caracterizou-se por uma pesquisa quantitativa e descritiva, realizada por meio da aplicação de um questionário estruturado que obteve a participação de 163 respondentes. Os resultados demonstraram que as estratégias de marketing de experiência, especialmente as que integraram atributos estéticos e potencial de compartilhamento digital, apresentaram as maiores médias de percepção positiva. Verificou-se que a confiança na marca foi fortalecida após interações físicas bem-sucedidas, revelando uma simbiose entre o ambiente emocional do evento e a jornada digital do jovem. Em contraste, a percepção de autenticidade mediada por influenciadores digitais obteve o menor índice de concordância. Concluiu-se que o engajamento da Geração Z foi potencializado por estratégias híbridas que permitiram ao consumidor assumir o papel de protagonista na construção da narrativa da marca, priorizando a autenticidade da vivência direta.

Palavras-chave: Comportamento do consumidor; Consumo cultural; Estratégias transmídia; Influenciadores digitais; Marketing de experiência.

Compliance E Esg

05 de outubro de 2026

Compliance para mitigar e prevenir furtos em canteiros de obras: Programa de integridade aplicado à construção civil

Furtos em canteiros de obras representam um desafio significativo para a construção civil, gerando impactos financeiros, operacionais e reputacionais. Nesse contexto, programas de integridade e compliance surgiram como ferramentas de gestão para fortalecer a governança e mitigar riscos. O estudo objetivou propor um programa de conformidade aplicado à construção civil, focado na prevenção e mitigação de furtos em canteiros de obras. Adotou-se uma abordagem qualitativa, com apoio quantitativo, desenvolvida em duas etapas. Primeiramente, realizou-se uma pesquisa de campo entre fevereiro e março de 2026, aplicando um questionário eletrônico a profissionais do setor. Em seguida, elaborou-se um estudo de caso fictício, baseado em experiências profissionais do autor, integrando os resultados da pesquisa a práticas de gestão de riscos e governança. Os resultados evidenciaram a importância da implementação de programas de compliance no setor e indicaram que a combinação de mecanismos de controle, processos estruturados, capacitação de equipes, canais de denúncia, monitoramento contínuo e fortalecimento da cultura ética pode reduzir vulnerabilidades. Concluiu-se que a adoção de práticas de integridade amplia a capacidade preventiva das organizações e aprimora a governança e a gestão de riscos no setor.

Palavras-chave: Compliance; Construção civil; Furtos; Gestão de riscos; Governança corporativa.

05 de outubro de 2026

Painel multi-sinal para otimização da priorização de vulnerabilidades em segurança cibernética

A crescente proliferação de vulnerabilidades cibernéticas tornou inadequada a priorização baseada exclusivamente em métricas estáticas de severidade. Desenvolveu-se e avaliou-se um painel analítico multi-sinal para otimizar a priorização de vulnerabilidades cibernéticas, integrando Common Vulnerability Scoring System (CVSS), Exploit Prediction Scoring System (EPSS), critérios derivados do Stakeholder-Specific Vulnerability Categorization (SSVC) e o catálogo Known Exploited Vulnerabilities (KEV) como variável-alvo supervisionada. Consolidaram-se 137.854 registros de vulnerabilidades do NVD (2022–2025), com 607 KEVs confirmados (0,44%), caracterizando um problema de classificação com classe fortemente desbalanceada. Treinou-se um modelo Random Forest supervisionado com dez variáveis não-circulares e avaliou-se por métricas adequadas ao desbalanceamento. O modelo alcançou AUC-ROC de 0,9869 e AUC-PR de 0,4959, superando o EPSS isolado em ambas as métricas (AUC-ROC=0,9383 e AUC-PR=0,3231). A análise de discrepâncias com a abordagem determinística do SSVC revelou que 83,4% das vulnerabilidades foram sobrepriorizadas. Dos 4.584 CVEs classificados como P0, 4.029 representaram vulnerabilidades de alto risco iminente não confirmadas como exploradas, sinalizadas pelo modelo. Concluiu-se que a abordagem multi-sinal vai além da consulta ao catálogo KEV, identificando vulnerabilidades com alto potencial de exploração futura e orientando a priorização proativa de remediação.

Palavras-chave: Exploit prediction; Gestão de riscos; Gestão de vulnerabilidades; Known Exploited Vulnerabilities (KEV); Random Forest.

Neurociência E Aprendizagem Na Educação

05 de outubro de 2026

Meditação: uma ferramenta que colabora com o professor em sala de aula

O estudo objetivou levantar as práticas meditativas, seus benefícios, limitações e possibilidades de aplicação no contexto escolar, com foco científico e em publicações existentes, visando ampliar estratégias de promoção da saúde mental e bem-estar de estudantes e professores. Realizou-se uma pesquisa exploratória e descritiva, de abordagem qualitativa, fundamentada em revisão bibliográfica de artigos científicos, livros e documentos publicados nos últimos dez anos, e em relatos de experiência da pesquisadora. A metodologia incluiu a definição científica de meditação e a análise de estudos sobre meditação e atenção plena em ambientes escolares, incorporando contribuições da neurociência, mas evitando reducionismos biológicos da aprendizagem. Como resultado principal, elaborou-se uma Cartilha de Práticas Meditativas para Professores, concebida como material de apoio pedagógico complementar. Os achados indicaram que a meditação pode contribuir para a redução de sintomas de estresse, ansiedade e depressão, além de favorecer a atenção, autorreflexão, empatia e convivência. Concluiu-se que a cartilha oferece orientações simples e adaptáveis para a sala de aula, sendo uma ferramenta complementar que não substitui intervenções pedagógicas ou políticas públicas. A sustentabilidade dessas práticas requer articulação com o projeto pedagógico, apoio institucional e formação docente, integrando neurociência, pedagogia e experiência prática para uma educação mais atenta às dimensões cognitivas, emocionais, sociais e existenciais dos alunos.

Palavras-chave: Ambiente escolar; Atenção plena; Meditação; Neurociência; Saúde mental.

05 de outubro de 2026

Viabilidade econômico-financeira para incorporação imobiliária de moradia sênior no litoral norte de São Paulo

O envelhecimento populacional e as mudanças migratórias pós-pandemia intensificaram a demanda por modelos habitacionais que promovem o bem-estar e a inclusão social do público sênior, mitigando o isolamento. O objetivo consistiu em avaliar a viabilidade econômico-financeira da incorporação imobiliária de um empreendimento de habitação sênior no Litoral Norte de São Paulo. A metodologia adotou abordagem quantitativa e exploratória, utilizando o método de estudo de caso estruturado em três etapas: análise socioeconômica regional, pesquisa de mercado com público-alvo qualificado (renda superior a R$ 20 mil) e modelagem financeira de indicadores. Os resultados revelaram demanda reprimida significativa, especialmente em Caraguatatuba, onde 53,3% dos interessados residem no Vale do Paraíba e buscam apartamentos compactos com serviços integrados e lazer. A análise financeira de um modelo com 40 unidades apontou Valor Presente Líquido positivo de R$ 1.750 milhões, Taxa Interna de Retorno de 22,30% ao ano, “payback” simples de 3,90 anos e “payback” descontado de 4,54 anos, o que demonstrou robustez diante da Taxa Mínima de Atratividade de 15%. Concluiu-se que o empreendimento é viável e atrativo para investidores, superando opções conservadoras do mercado financeiro. A estratégia de captação prévia de cotistas e o controle do preço de venda mostraram-se fundamentais para a mitigação de riscos operacionais e garantia da execução da obra.

Palavras-chave: Caraguatatuba; Construção civil; Investimento imobiliário; Mercado imobiliário; Residencial sênior.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade