30 de setembro de 2026
Modelagem preditiva aplicada à autorregularização fiscal para otimização da arrecadação
Modelagem Preditiva Aplicada à Autorregularização Fiscal para Otimização da Arrecadação
Cleiber Cruzeiro Queiroz; Aimée Shirozono
DOI: 10.22167/2675-6528-202602792
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
Desenvolveu-se um modelo preditivo para apoiar a identificação de contribuintes com maior probabilidade de adesão a programas de autorregularização fiscal do ICMS no estado de Goiás. A partir de dados provenientes de documentos fiscais eletrônicos, da Declaração de Informações de Meios de Pagamento [DIMP] e de bases corporativas de malhas fiscais, construíram-se agrupamentos homogêneos de contribuintes, respeitando restrições legais associadas ao sigilo fiscal e à Lei Geral de Proteção de Dados [LGPD]. A modelagem preditiva realizou-se por meio do algoritmo Light Gradient Boosting Machine [LightGBM], com ajuste de hiperparâmetros via Grid Search e validação cruzada k-fold. Os resultados indicaram desempenho discriminatório do modelo em relação a abordagens tradicionais, com Área sob a Curva (AUC) de 0,63 e elevada capacidade de identificação de contribuintes com maior potencial de regularização. As análises de importância das variáveis e interpretação do modelo, por meio de Feature Importance e SHAP, evidenciaram que variáveis associadas ao volume econômico das operações e ao histórico de inconsistências fiscais exerceram maior influência na probabilidade de adesão. Os resultados sugerem que a aplicação de técnicas de aprendizado de máquina pode contribuir para tornar mais eficiente a seleção de contribuintes em programas de autorregularização fiscal, ampliando o potencial de recuperação de crédito tributário e fortalecendo estratégias de conformidade baseadas em dados.
Palavras-chave: administração tributária; Autorregularização fiscal; conformidade tributária; LightGBM; machine learning.
1. Introdução
A administração tributária global passa por uma reestruturação profunda, caracterizada pela transição de modelos operacionais historicamente centrados na verificação manual e repressiva de grandes volumes de dados para ecossistemas integrados, preditivos e orientados à conformidade cooperativa (Eberhartinger e Zieser, 2021). Essa transformação reflete uma mudança relevante na forma como se estabelece a relação entre o Estado e o contribuinte, na medida em que a lógica estritamente repressiva cede espaço a uma atuação baseada na confiança, na transparência e na prevenção de conflitos (Nunes e Garbaccio, 2023).
Nesse novo paradigma, a ampliação da conformidade tributária é buscada por meio da cooperação institucional, na qual o contribuinte se compromete a compartilhar informações fiscais relevantes, enquanto a administração tributária oferece maior segurança jurídica, previsibilidade nas decisões e canais permanentes de diálogo. A autorregularização fiscal surge como um desdobramento prático dos princípios da conformidade cooperativa, ao incentivar o contribuinte a corrigir espontaneamente eventuais inconsistências, fortalecendo a confiança mútua e reduzindo a necessidade de ações repressivas (Nunes e Garbaccio, 2023; Martinez, 2022). Nesse cenário, o uso de tecnologias digitais, inteligência artificial e técnicas de aprendizado de máquina tem sido empregado como instrumento de gestão de riscos e focalização da atuação fiscal, permitindo maior eficiência na seleção de contribuintes e na condução de ações preventivas (Yang, 2025).
No sistema tributário nacional, o Sistema Público de Escrituração Digital (SPED, 2007) organiza e viabiliza a entrega massiva e contínua das obrigações acessórias em formato digital. Por meio desse ambiente, os contribuintes transmitem recorrentemente grandes volumes de dados, que incluem documentos fiscais eletrônicos, a Escrituração Fiscal Digital (EFD) e a Escrituração Contábil Digital (ECD). Esse conjunto informacional é utilizado pela administração tributária para identificar inconsistências, realizar análises e apoiar a tomada de decisões. Na legislação do Estado de Goiás, o Art. 142-A da Lei nº 11.651/91 (Goiás, 1991), que integra o Código Tributário Estadual, estabelece as regras para a autorregularização fiscal, permitindo que os contribuintes com infrações tributárias possam, de forma espontânea, regularizar a sua situação.
No entanto, a viabilidade política e econômica da autorregularização fiscal depende da capacidade de identificar, de forma adequada, os contribuintes com maior potencial de conformidade. Notificações direcionadas a perfis com baixa propensão à regularização tendem a gerar custos desnecessários e a fragilizar a relação de confiança institucional. Por outro lado, a ausência de comunicação com contribuintes que apresentam elevado potencial de recuperação de crédito resulta em oportunidades perdidas de arrecadação. Estudos experimentais, como de Kleber et al. (2025), demonstram que mensagens comportamentais adaptadas ao público-alvo podem aumentar significativamente a probabilidade de cumprimento de obrigações fiscais, enquanto comunicações genéricas ou mal direcionadas têm pouco efeito ou podem até reduzir a resposta positiva (Jamison et al., 2021).
Diante desse cenário, a aplicação de técnicas de Inteligência Artificial, em especial de Machine Learning, apresenta-se como uma alternativa técnica capaz de identificar padrões, correlações e anomalias em grandes volumes de dados, gerando informações relevantes para apoiar a tomada de decisões estratégicas (Xu et al., 2024). Diferentemente dos sistemas especialistas baseados em regras predefinidas, que possuem capacidade limitada para lidar com a complexidade e a dinamicidade dos comportamentos contemporâneos, os modelos de aprendizado de máquina, especialmente aqueles fundamentados em técnicas de Gradient Boosting, como o LightGBM, têm demonstrado desempenho superior às abordagens estatísticas tradicionais, como a regressão logística, na tarefa de classificar e ordenar contribuintes para programas de conformidade tributária (Yang, 2025). Essa flexibilidade analítica permite identificar padrões mais complexos de comportamento fiscal, que muitas vezes não são capturados por sistemas de fiscalização baseados apenas em regras (Chen e Guestrin, 2016; Xu e Kong, 2020).
Nesse contexto, a motivação deste estudo reside na possibilidade de integrar a ciência de dados à gestão tributária para otimizar a seleção de contribuintes em programas de autorregularização fiscal. Ao direcionar de forma mais eficiente as ações administrativas, busca-se contribuir para o fortalecimento da conformidade tributária, a promoção da justiça fiscal e a sustentabilidade das contas públicas. Diante do exposto, o objetivo principal deste estudo é desenvolver um modelo preditivo capaz de apoiar a identificação de contribuintes com maior potencial de autorregularização no estado de Goiás.
2. Material e Métodos
O presente estudo caracterizou-se como uma pesquisa de natureza aplicada, com abordagem metodológica quantitativa, visando ao desenvolvimento de um modelo preditivo. O objetivo central foi apoiar a identificação de contribuintes com maior potencial de autorregularização no estado de Goiás, utilizando técnicas de aprendizado de máquina. A pesquisa foi conduzida no âmbito da Secretaria de Estado da Economia do Estado de Goiás, respeitando as restrições legais associadas ao sigilo fiscal e à Lei Geral de Proteção de Dados (LGPD).
Para a realização da pesquisa, utilizaram-se dados provenientes de 8.343.075 notas fiscais identificadas por malhas fiscais de autorregularização, a partir das quais foram selecionados 4.113 contribuintes. As fontes de dados incluíram documentos fiscais eletrônicos, informações da Declaração de Informações de Meios de Pagamento (DIMP) e bases corporativas de malhas fiscais. Todos os dados foram obtidos a partir de bases corporativas e armazenados nos servidores de banco de dados da Secretaria de Estado da Economia do Estado de Goiás.
A unidade de análise adotada para a modelagem preditiva foram grupos homogêneos de contribuintes, e não o contribuinte individual, visando reduzir a variabilidade aleatória e cumprir as restrições legais. Essa agregação resultou em 3.173 observações, construídas a partir de variáveis estruturantes como atividade econômica, geolocalização, natureza jurídica, volume de vendas e histórico de risco. Para qualificar os dados agregados, estabeleceu-se como critério de seleção a regularização de, no mínimo, 30% das notas fiscais por contribuinte e uma taxa de adesão superior a 50% no agrupamento.
A extração dos dados referentes às notas fiscais e à DIMP foi realizada por meio da ferramenta SAS Enterprise Guide v.9.2, com informações armazenadas em um banco de dados MySQL. A linguagem SQL foi empregada para consulta, saneamento, consolidação e agrupamento dos dados. O tratamento e a análise subsequente foram conduzidos em ambiente Python, utilizando as bibliotecas Pandas e NumPy para manipulação e transformação, e Scikit-learn para particionamento da base e validação cruzada.
A engenharia de variáveis estruturou e qualificou os dados fiscais, financeiros e cadastrais. Consolidaram-se informações por contribuinte, abrangendo quantitativos e valores de notas fiscais em autorregularização, ICMS devido, e valores pagos e parcelados. Totalizaram-se os valores de notas fiscais de entrada e de saída de 2024, e os valores da DIMP de 2024. Esses dados foram integrados a informações cadastrais, como CNAE, código da delegacia territorial, natureza jurídica e horas previstas de auditoria.
A partir da base consolidada, construíram-se variáveis derivadas para representar dimensões do perfil dos contribuintes, incluindo faixas de tempo de cadastro, faixas de valor da dívida de ICMS, faixas de porte econômico e faixas de exposição digital. Duas variáveis derivadas adicionais foram a Razão Logarítmica de Saídas por Entradas e a Razão da Dívida pelo Aporte, ambas com transformação para estabilizar a variabilidade. A variável-alvo, denominada TARGET, foi criada para classificar os agrupamentos quanto à adesão ou não ao processo de autorregularização, utilizando um critério de 50% de adesão.
A modelagem preditiva foi realizada por meio de uma abordagem supervisionada. Compararam-se Regressão Logística, Random Forest, XGBoost e Light Gradient Boosting Machine (LightGBM), sendo este último selecionado como algoritmo final devido à sua eficiência computacional e capacidade de modelar relações complexas e interações não lineares entre as variáveis, características adequadas ao contexto tributário (Friedman, 2001). A base de dados foi dividida em conjuntos de treinamento (70%) e teste (30%), de forma estratificada e com semente aleatória fixa.
Otimizou-se o desempenho do modelo e reduziu-se o risco de sobreajuste por meio do ajuste dos hiperparâmetros via Grid Search. A avaliação do desempenho do modelo foi conduzida com base nas métricas de Acurácia, Precisão, Recall, F1-Score e Área sob a Curva (AUC). A robustez foi avaliada por validação cruzada com cinco folds. A interpretação do modelo foi realizada por análises de importância das variáveis (Feature Importance) e valores SHAP, que indicam a contribuição de cada variável para a probabilidade prevista de adesão.
3. Resultados e Discussão
Os resultados da pesquisa revelaram insights significativos sobre os fatores que influenciam a adesão de contribuintes a programas de autorregularização fiscal no estado de Goiás, bem como a eficácia de um modelo preditivo baseado em aprendizado de máquina para identificar perfis com maior potencial de conformidade. A análise inicial das variáveis quantitativas e categóricas forneceu uma compreensão detalhada da distribuição e heterogeneidade dos dados, enquanto a modelagem preditiva e suas interpretações validaram a capacidade do algoritmo LightGBM em capturar padrões complexos de comportamento fiscal. Esses achados são cruciais para aprimorar as estratégias de administração tributária, direcionando ações de forma mais eficiente e baseada em evidências.
Análise de Variáveis Quantitativas
As estatísticas descritivas das variáveis quantitativas, sintetizadas nas Tabelas 1, 2 e 3, indicaram uma distribuição assimétrica para a maioria das variáveis financeiras e operacionais, um padrão comum em bases tributárias onde poucos agrupamentos concentram volumes elevados de operações e valores fiscais. Por exemplo, a quantidade de notas fiscais em autorregularização (QTD_NOTAS_AUTOREG) apresentou uma média de 2.629,40, mas uma mediana de apenas 52,00 e um primeiro quartil de 8,00, evidenciando que a maioria dos agrupamentos possui um volume reduzido de documentos, enquanto uma minoria concentra um grande volume. O elevado desvio padrão de 16.248,99 reforça a presença de valores extremos na distribuição, o que justifica a escolha de algoritmos robustos a essas características.
As variáveis monetárias, como o valor médio das notas fiscais em autorregularização (VLR_NOTA_AUTOREG), o ICMS devido (VLR_ICMS_AUTOREG), as operações de entrada (VLR_ENTRADAS) e saída (VLR_SAIDAS), e os valores apurados pela DIMP (VLR_DIMP), exibiram um padrão semelhante de forte dispersão. As médias dessas variáveis foram significativamente superiores às medianas, acompanhadas por desvios padrão elevados, indicando uma heterogeneidade econômica acentuada entre os contribuintes. Por exemplo, o valor médio das saídas (VLR_SAIDAS) registrou uma média de 48.286.125,95, mas uma mediana de 5.285.496,94, com um desvio padrão de 323.752.292,96. Essa característica dos dados reforça a adequação do algoritmo LightGBM, que é particularmente eficaz em lidar com distribuições assimétricas e relações não lineares entre as variáveis, conforme destacado por Chen e Guestrin (2016).
A razão entre dívida e porte econômico (RAZAO_DIVIDA_PORTE) concentrou-se próxima de zero para a maioria dos agrupamentos, com uma média de 0,68 e mediana de 0,00. No entanto, o terceiro quartil de 249,65 e um desvio padrão de 10,91 indicaram que, para uma parcela dos grupos, a dívida assume um peso significativo em relação ao volume de operações, o que pode influenciar a adesão à autorregularização. A taxa de adesão (TAXA_ADESAO) apresentou uma média de 0,45, com mediana e primeiro quartil de 0,00, refletindo uma concentração dos resultados nos extremos da distribuição. Isso significa que a maioria dos agrupamentos demonstrou baixa ou nenhuma adesão à autorregularização, enquanto uma parcela menor concentrou níveis elevados de regularização, o que corrobora a adequação do critério de 50% de adesão adotado para a definição da variável-alvo, conforme ilustrado na distribuição da taxa de adesão dos grupos e critério de classificação
.
Análise de Variáveis Categóricas
A análise das variáveis categóricas revelou padrões distintos de adesão à autorregularização. A variável FAIXA_FATURAMENTO, que segmenta os contribuintes em quartis com base no valor total das notas fiscais de saída, demonstrou uma relação direta com a taxa de adesão. Agrupamentos nos quartis inferiores de faturamento apresentaram menores taxas médias de adesão, enquanto os quartis superiores exibiram percentuais progressivamente mais elevados de regularização. Por exemplo, a faixa de faturamento de 0-25% registrou uma taxa de adesão de 34,8%, enquanto a faixa superior a 75% alcançou 58,9% de adesão, conforme observado na distribuição de contribuintes e taxa de adesão por faixa de faturamento
. Esse padrão indica que o porte econômico exerce uma influência relevante sobre o comportamento de adesão, reforçando sua importância como variável explicativa no modelo preditivo.
A variável NATUREZA_JURIDICA, apesar de apresentar forte desbalanceamento com a categoria ‘Sociedade Empresária Limitada’ concentrando aproximadamente 87% das observações, demonstrou relevância preditiva. As Sociedades Anônimas (S.A.) apresentaram as maiores taxas de adesão, com 62,1%, indicando um perfil de maior conformidade. Em contraste, os grupos ‘Individual’ e ‘Outros’ exibiram taxas inferiores, com 41,6% e 32,0% respectivamente, sugerindo maior propensão à não regularização. Esses resultados, apresentados na distribuição de contribuintes e taxa de adesão por natureza jurídica
, corroboraram a decisão de agrupar as categorias originais em macrogrupos para preservar o poder discriminatório da variável e evitar o overfitting, conforme a estratégia de categorical binning (p. 9).
A FAIXA_DIVIDA_ICMS, que categoriza o valor total do ICMS devido, também revelou uma associação com a propensão à regularização. Observou-se que a maioria dos contribuintes se concentra nas faixas de menor valor da dívida. No entanto, as faixas com valores mais elevados apresentaram as maiores taxas de adesão, alcançando 55,1% para dívidas acima de R$ 100.000,00, em comparação com 44,6% para dívidas até R$ 10.000,00. Esse achado, detalhado na distribuição de contribuintes e taxa de adesão por faixa do valor da dívida
, sugere que dívidas de maior magnitude podem motivar uma maior propensão à regularização, possivelmente devido a um maior risco associado ou a uma maior capacidade de gestão fiscal por parte desses contribuintes.
A variável FAIXA_EXPOSICAO_DIMP, que mede o grau de rastreabilidade das operações por meio da razão entre o valor da DIMP e o valor total médio das saídas, também se mostrou relevante. Os grupos sem exposição registraram a menor taxa média de adesão, com 28,3%. As faixas intermediárias, como 0-30% e 30-70%, exibiram percentuais mais elevados, com 59,4% e 50,0% de adesão, respectivamente. Embora a maior parte dos contribuintes esteja concentrada na faixa de maior exposição (>70%), com 48,0% de adesão, os resultados, conforme a distribuição de contribuintes e taxa de adesão por faixa de exposição
, indicam que o grau de exposição das operações por meios de pagamento está associado ao comportamento de regularização, sugerindo que a transparência das operações financeiras pode influenciar a conformidade fiscal.
Matriz de Correlação
A análise da matriz de correlação entre as variáveis quantitativas, apresentada na matriz de correlação das variáveis
, indicou que a maioria das variáveis possui correlações baixas ou moderadas entre si e em relação à variável-alvo. Esse padrão sugere uma relativa independência entre os atributos, o que é favorável para a modelagem preditiva, pois reduz o risco de multicolinearidade. As correlações mais elevadas foram observadas entre VLR_SAIDAS e VLR_ENTRADAS (0,65), um resultado esperado, uma vez que empresas com maior volume de operações de saída tendem a apresentar volumes correspondentes de entrada. De forma semelhante, verificou-se uma correlação relevante entre VLR_NOTA_AUTOREG e VLR_ICMS_AUTOREG (0,64), refletindo a relação direta entre o valor das operações em autorregularização e o montante do imposto devido.
As demais variáveis, incluindo as razões financeiras e os indicadores derivados, apresentaram correlações fracas tanto entre si quanto em relação à variável-alvo. Esse comportamento sugere que a adesão à autorregularização não é explicada por relações lineares simples, mas resulta da interação de múltiplos fatores econômicos, operacionais e estruturais. A baixa multicolinearidade e a complexidade das relações entre as variáveis reforçam a escolha de algoritmos de aprendizado de máquina, como o LightGBM, que são capazes de capturar relações não lineares e interações complexas, superando as limitações de modelos estatísticos tradicionais baseados em premissas de linearidade.
Comparação entre modelos de classificação
A etapa de comparação entre diferentes técnicas de modelagem preditiva supervisionada demonstrou o desempenho superior dos modelos baseados em árvores em relação à regressão logística. Conforme ilustrado na comparação de curvas ROC dos modelos de classificação
, o algoritmo LightGBM apresentou a maior Área sob a Curva (AUC) de 0,631. Ele foi seguido pelo Random Forest, com AUC de 0,623, e pelo XGBoost, com AUC de 0,611. A Regressão Logística, utilizada como modelo de referência, obteve um AUC de 0,594. Essa hierarquia de desempenho indica que os modelos de ensemble learning, especialmente aqueles baseados em gradient boosting, possuem maior capacidade discriminatória para identificar agrupamentos com maior probabilidade de adesão à autorregularização, confirmando a literatura que aponta a superioridade dessas técnicas em contextos de dados complexos (Yang, 2025).
Otimização de Hiperparâmetros (Grid Search)
A otimização dos hiperparâmetros do modelo LightGBM, realizada por meio da técnica de Grid Search, foi fundamental para maximizar o desempenho preditivo e reduzir o risco de sobreajuste. A melhor combinação de parâmetros identificada foi: class_weight = {0:1, 1:3}, learning_rate = 0,01, max_depth = 5, min_child_samples = 30, n_estimators = 500 e num_leaves = 31. Esses parâmetros indicam a utilização de árvores de profundidade moderada e uma taxa de aprendizado reduzida, estratégias que contribuem para um crescimento controlado do modelo e para a redução da tendência de capturar ruídos específicos da amostra. O ajuste do peso das classes favoreceu a estabilidade do modelo e a melhor identificação dos casos de adesão à autorregularização, o que é particularmente relevante em cenários de desbalanceamento de classes.
Avaliação de desempenho do modelo LightGBM
A avaliação do desempenho do modelo LightGBM no conjunto de dados de teste, utilizando métricas como Acurácia, Precisão, Recall, F1-Score e AUC, revelou um desempenho adequado para o objetivo do estudo. Os resultados obtidos foram: Acurácia de 0,536, Precisão de 0,503, Recall de 0,899, F1-Score de 0,645 e AUC de 0,626. O alto valor de Recall (0,899) é particularmente notável, pois indica uma elevada capacidade do modelo em identificar corretamente os agrupamentos com maior probabilidade de adesão à autorregularização. Essa característica é de grande importância para a administração tributária, pois minimiza o risco de deixar de selecionar contribuintes com potencial de recuperação de crédito tributário, evitando perdas de arrecadação.
Embora as métricas de Precisão e Acurácia tenham apresentado valores moderados, o F1-Score de 0,645 indica um equilíbrio satisfatório entre a identificação de casos positivos e o controle de erros de classificação. Além disso, a AUC de 0,626 demonstra uma capacidade discriminatória superior à de um classificador aleatório, evidenciando que o modelo é capaz de capturar padrões relevantes associados ao comportamento de adesão. Em conjunto, esses resultados sugerem que o modelo LightGBM possui desempenho adequado para apoiar processos de priorização e segmentação de contribuintes em programas de autorregularização fiscal, contribuindo para a eficiência das ações administrativas e o fortalecimento da conformidade tributária.
Validação Cruzada (Cross-Validation)
A robustez do modelo foi confirmada pela validação cruzada com cinco folds, conforme ilustrado na validação cruzada (Cross-Validation ROC)
. Os resultados indicaram valores de AUC variando entre 0,60 e 0,66, com uma média de 0,63 e um desvio padrão de 0,02. A baixa variabilidade observada entre os folds demonstra a estabilidade do desempenho do modelo frente a diferentes particionamentos da amostra, reduzindo a dependência dos resultados em relação a uma única divisão dos dados. Além disso, todas as curvas ROC se posicionaram acima da linha de referência do classificador aleatório, evidenciando uma capacidade discriminatória consistente na identificação dos agrupamentos com maior probabilidade de adesão à autorregularização. Esses resultados fornecem evidências da estabilidade e generalização do modelo, o que é crucial para sua aplicação em um ambiente operacional real.
Importância das Variáveis (Feature Importance – Gain)
A análise da importância das variáveis no modelo LightGBM, calculada com base no critério de ganho (gain), revelou que as variáveis relacionadas ao volume financeiro das operações apresentaram a maior influência na capacidade preditiva do modelo. O valor total das saídas (VLR_SAIDAS), com um ganho de 11054,7, e o valor total das entradas (VLR_ENTRADAS), com 9911,8, figuraram entre as variáveis de maior importância para a classificação. A razão entre saídas e entradas (RAZAO_SAIDA_ENTRADA), com 8524,6, e a quantidade de notas fiscais em autorregularização (QTD_NOTAS_AUTOREG), com 7793,8, também se destacaram. Esses resultados, apresentados na importância das variáveis (Feature Importance – Gain)
, indicam que o porte econômico e o nível de atividade operacional dos contribuintes exercem uma contribuição relevante para as predições realizadas pelo modelo.
Outras variáveis que se mostraram importantes incluem a Classificação Nacional de Atividades Econômicas (CNAE), com ganho de 5945,9, os valores movimentados por meios de pagamento (VLR_DIMP), com 5302,1, e o valor do ICMS associado às notas em autorregularização (VLR_ICMS_AUTOREG), com 4610,5. Em contraste, variáveis institucionais e administrativas, como horas previstas de auditoria (HORAS_AUDITORIA), natureza jurídica (NATUREZA_JURIDICA) e faixa de faturamento (FAIXA_FATURAMENTO), apresentaram uma contribuição relativa menor para o modelo. No conjunto, esses achados sugerem que fatores associados à escala econômica das operações e à exposição financeira do contribuinte são mais determinantes para a identificação de padrões de adesão à autorregularização do que características administrativas ou cadastrais mais genéricas.
Interpretação do Modelo (SHAP)
A interpretação do modelo por meio do SHAP Summary Plot, apresentado no SHAP Summary Plot
, confirmou a contribuição das variáveis para a probabilidade prevista de adesão à autorregularização. Observou-se que as variáveis associadas ao volume financeiro das operações, como VLR_SAIDAS, VLR_ENTRADAS e RAZAO_SAIDA_ENTRADA, exerceram a maior influência no comportamento do modelo. Valores mais elevados dessas variáveis tenderam a deslocar os pontos para a direita no gráfico, indicando uma maior probabilidade de regularização. Esse resultado reforça que níveis mais elevados de atividade econômica estão associados a maiores probabilidades previstas de adesão à autorregularização, em consonância com os achados da análise de Feature Importance.
Também se destacaram variáveis relacionadas ao histórico e à dimensão das inconsistências fiscais, como QTD_NOTAS_AUTOREG, VLR_ICMS_AUTOREG e VLR_DIMP, que contribuíram para explicar o comportamento de regularização. Em contraste, variáveis cadastrais ou administrativas, como natureza jurídica, faixas de faturamento e faixas de dívida, apresentaram impacto relativamente menor no modelo. Em termos gerais, a análise de SHAP reforça a consistência dos resultados obtidos na análise de importância das variáveis, indicando que o modelo utiliza principalmente informações financeiras e operacionais dos contribuintes para realizar as previsões. Fatores relacionados ao volume de operações e à exposição fiscal são, portanto, determinantes para a adesão à autorregularização, o que valida a capacidade do modelo em identificar contribuintes com maior potencial de conformidade.
Em síntese, o estudo demonstrou que o modelo preditivo baseado em LightGBM possui uma capacidade discriminatória robusta para identificar contribuintes com maior probabilidade de adesão a programas de autorregularização fiscal. As análises de importância das variáveis e de interpretação do modelo, por meio de Feature Importance e SHAP, consistentemente apontaram que o volume econômico das operações, a exposição fiscal e o histórico de inconsistências são os principais fatores que influenciam a propensão à regularização. Esses achados confirmam que a aplicação de técnicas de aprendizado de máquina pode otimizar a seleção de contribuintes, direcionando as ações da administração tributária de forma mais eficiente e baseada em dados, contribuindo diretamente para o objetivo de desenvolver um modelo preditivo para apoiar a identificação de contribuintes com maior potencial de autorregularização no estado de Goiás.
4. Conclusão
Este estudo buscou desenvolver um modelo preditivo capaz de apoiar a identificação de contribuintes com maior potencial de autorregularização fiscal no estado de Goiás. Verificou-se que o algoritmo Light Gradient Boosting Machine (LightGBM) demonstrou uma capacidade discriminatória robusta, com Área sob a Curva (AUC) de 0,63 e um elevado Recall de 0,899, indicando sua eficácia em identificar corretamente os agrupamentos com maior probabilidade de adesão. As análises de Feature Importance e SHAP consistentemente evidenciaram que variáveis associadas ao volume econômico das operações, como valores de entradas e saídas, e ao histórico de inconsistências fiscais, como o ICMS devido e a quantidade de notas em autorregularização, exerceram a maior influência na propensão à regularização. Esses achados sugerem que contribuintes com maior atividade econômica e maior exposição fiscal tendem a apresentar uma propensão mais elevada à regularização quando notificados. A aplicação desse modelo preditivo contribui para tornar mais eficiente a seleção de contribuintes em programas de autorregularização, otimizando a recuperação de crédito tributário e fortalecendo as estratégias de conformidade baseadas em dados.
Apesar da consistência metodológica e da robustez dos resultados, o estudo apresenta uma limitação principal relacionada à modelagem de agrupamentos homogêneos de contribuintes, em vez de unidades individuais. Essa abordagem foi adotada devido a restrições legais de sigilo fiscal e à Lei Geral de Proteção de Dados (LGPD), além da necessidade de mitigar a variabilidade aleatória dos dados. Contudo, a agregação pode introduzir um viés analítico decorrente da perda de granularidade. Para estudos futuros, recomenda-se a comparação entre modelagens agregadas e individuais, a incorporação de novas fontes de dados e a realização de validações empíricas em ambiente operacional, a fim de aprimorar a compreensão dos fatores que influenciam a conformidade tributária e refinar a capacidade preditiva.
Referências Bibliográficas
Chen, T., Guestrin, C. 2016. XGBoost: a scalable tree boosting system. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD ’16), 2016, California, San Francisco, USA.
Eberhartinger, E., Zieser, M. 2021. The effects of cooperative compliance on firms’ tax risk, tax risk management and compliance costs. Schmalenbach Journal of Business Research 73: 125-178.
Friedman, J. 2001. Greedy function approximation: a gradient boosting machine. The Annals of Statistics 29(6): 1189-1232.
Goiás. 1991. Lei nº 11.651, de 26 de dezembro de 1991. Institui o Código Tributário do Estado de Goiás. Diário Oficial do Estado de Goiás, Goiânia, 26 dez. 1991.
Jamison, J.; Mazar, N.; Sen, I. 2021. Applying behavioral insights to tax compliance: experimental evidence from Latvia. Journal of Tax Administration 6(2): 6-32.
Kleber, J.; Gangl, K.; Kirchler, E.; Florack, A. 2025. Taxpayers do not always follow the crowd: the effects of regulatory focus and social norm on tax compliance. Acta Psychologica 259(105288): 1-7.
Martinez, A. L. 2022. Cooperative compliance: SWOT analysis for the brazilian CONFIA program. Revista Electrónica de Direito 28(2): 127-153.
Nunes, R.V.; Garbaccio, G. 2023. Compliance cooperativo entre o fisco e o contribuinte. Revista Brasileira De Estudos Políticos 126: 173-206.
Sistema Público de Escrituração Digital [SPED]. 2007. Disponível em <http://www.planalto.gov.br/ccivil_03/_ato2007-2010/2007/Decreto/D6022.htm>. Acesso em: 30 dez. 2025
Xu, C.; Kong, Y. 2024. Random forest model in tax risk identification of real estate enterprise income tax. PLoS One 19(3): e0300928.
Yang, L. 2025. Predictive modeling of tax compliance risks: a comparative study of machine learning approaches. PLoS One 20(9): e0331715.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

