07 de outubro de 2026
Modelagem preditiva para priorização de inconsistências fiscais a partir do balancete da ECD
Modelagem Preditiva para Priorização de Inconsistências Fiscais a Partir do Balancete da Ecd
João Pedro Apolinário Cardoso; Thiago Gentil Ramires
DOI: 10.22167/2675-6528-202603036
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
A crescente complexidade das relações econômicas e o elevado volume de dados disponíveis para a administração tributária demandaram o desenvolvimento de ferramentas mais eficientes para a seleção de contribuintes submetidos à auditoria fiscal. Nesse contexto, aplicou-se modelos supervisionados de aprendizado de máquina, com base em dados extraídos da Escrituração Contábil Digital (ECD), para priorizar empresas em um cenário de restrição de recursos humanos e de rotulagem incompleta. Para tanto, construiu-se um conjunto de dados composto por variáveis contábeis derivadas da ECD e aplicaram-se os modelos de Regressão Logística e Random Forest. A Regressão Logística utilizou-se como referência linear, enquanto o Random Forest foi escolhido por sua capacidade de capturar relações não lineares e interações complexas entre variáveis estruturadas. Modelos de maior complexidade, como redes neurais, não foram priorizados, considerando-se a baixa disponibilidade de exemplos da classe positiva e o objetivo de adotar uma abordagem parcimoniosa e de fácil aplicação operacional. O desempenho dos modelos avaliou-se com foco na capacidade de concentrar casos positivos nas primeiras posições do ranking. Os resultados indicaram superioridade dos modelos baseados em árvores, especialmente do Random Forest, na priorização dos contribuintes. Observou-se, ainda, a identificação de padrões relevantes mesmo em contexto de rótulos imperfeitos. Concluiu-se que a abordagem proposta apresentou potencial para apoiar a seleção de contribuintes para auditoria e contribuir para a alocação mais eficiente de recursos públicos.
Palavras-chave: Análise de risco; Aprendizado supervisionado; Dados contábeis; Priorização de auditorias; Seleção de contribuintes.
1. Introdução
O processo de digitalização no setor público, que se intensificou a partir dos anos 2000, promoveu transformações significativas, especialmente na administração tributária. Nesse contexto, o Sistema Público de Escrituração Digital (SPED) foi implementado, substituindo declarações em papel por documentos digitais. Uma das principais ferramentas resultantes desse movimento é a Escrituração Contábil Digital (ECD), conforme o Manual de Orientação do Leiaute 9 da Escrituração Contábil Digital (Brasil [RFB], 2024), que se tornou essencial para as auditorias fiscais.
A ECD exige que os contribuintes declarem diversos livros contábeis, incluindo o balancete de verificação, a Demonstração do Resultado do Exercício (DRE) e o balanço patrimonial. Inicialmente, o acesso a esses dados era restrito à Receita Federal do Brasil (RFB), mas a Instrução Normativa RFB n° 2.003/2021 ampliou o acesso aos fiscos estaduais. Essa ampliação, juntamente com a padronização do Plano de Contas Referencial (registro 1051), permitiu o uso massivo dos dados da ECD para cruzamentos e comparações com outras obrigações fiscais, como a Escrituração Fiscal Digital (EFD) e as notas fiscais eletrônicas (Silva, 2025).
Dentre os componentes da ECD, o balancete de verificação se destaca como a fonte de dados mais rica para os fiscos estaduais. Ele é composto por saldos mensais consolidados por conta, detalhando saldos inicial e final, além dos valores lançados a débito e a crédito (Brasil [RFB], 2024). Com esses registros, o fisco pode realizar cruzamentos para identificar anomalias ou inconsistências fiscais, que servem como indícios para a seleção de empresas a serem auditadas.
Apesar dos avanços tecnológicos, a administração tributária ainda enfrenta limitações significativas de recursos humanos e operacionais. A seleção de contribuintes para auditoria demanda uma análise prévia de risco para priorizar os casos mais relevantes, visto que a ausência de autuação não garante necessariamente a regularidade fiscal de um contribuinte ou exercício. Essa realidade impõe um desafio na identificação eficiente de irregularidades.
Atualmente, as administrações tributárias utilizam malhas fiscais baseadas em regras rígidas para selecionar contribuintes. Contudo, o volume e a complexidade dos dados fiscais disponíveis superam a capacidade de análise humana, conforme apontado pela Federação Nacional dos Auditores e Fiscais de Tributos Municipais (FENAFIM, 2017). A literatura internacional também documenta a baixa capacidade adaptativa e a maior propensão a vieses dos modelos baseados em regras fixas em comparação com abordagens de aprendizado de máquina (Chan et al., 2022; Battaglini et al., 2025).
O presente estudo utiliza dados reais da Escrituração Contábil Digital (ECD) de empresas contribuintes do Estado de Goiás, extraídos dos registros de saldos periódicos (1150 e 1155), além de informações provenientes de auditorias fiscais realizadas em exercícios anteriores. O foco da pesquisa está na utilização dos dados contábeis da ECD e de variáveis derivadas, podendo ser incorporado, conforme a análise, dados complementares da Escrituração Fiscal Digital (EFD) e da Nota Fiscal Eletrônica (NF-e). Também são considerados dados cadastrais, como a Classificação Nacional de Atividades Econômicas (CNAE), de modo a permitir a identificação de padrões contábeis associados a diferentes segmentos econômicos.
Diante desse cenário, torna-se necessário adotar, nas administrações tributárias, mecanismos de mineração de dados e aprendizado de máquina como forma de apoio à tomada de decisão. A adoção dessas técnicas, aplicada à ECD, permitirá a construção de escores de risco, auxiliando na priorização de contribuintes para auditorias, reduzindo a necessidade de análises manuais, e contribuindo, assim, para o uso racional dos recursos públicos, conforme evidenciado por estudos empíricos na literatura recente (Battaglini et al., 2025; Yang, 2025). Nesse contexto, o trabalho aplica e avalia modelos de aprendizado de máquina supervisionado com o objetivo de gerar escores de risco que auxiliem na priorização de empresas e períodos a serem selecionados para auditoria fiscal, considerando o histórico de inconsistências identificadas em exercícios anteriores. A pesquisa faz parte dos esforços de inovação em ciência de dados na área tributária e contribui para o aprimoramento dos processos de seleção de contribuintes, bem como para o desenvolvimento de soluções analíticas com potencial de aplicação em outras administrações públicas.
2. Material e Métodos
O presente estudo, de natureza aplicada, empregou uma abordagem quantitativa para desenvolver e avaliar modelos de aprendizado de máquina supervisionado. O objetivo central foi gerar escores de risco que auxiliassem na priorização de empresas e períodos para auditoria fiscal, considerando o histórico de inconsistências identificadas em exercícios anteriores. A pesquisa concentrou-se na modelagem preditiva para otimizar a seleção de contribuintes em um cenário de recursos limitados.
A unidade de análise consistiu em empresas contribuintes do Estado de Goiás, com os dados organizados por exercício fiscal. Para a construção da base de dados, utilizaram-se informações reais provenientes da Escrituração Contábil Digital (ECD), especificamente os registros de saldos periódicos (1150 e 1155) do balancete de verificação, além de dados da Demonstração do Resultado do Exercício (DRE), ambos componentes da ECD.
Complementarmente, a base de dados incorporou informações obtidas de auditorias fiscais já finalizadas em exercícios anteriores, que serviram para rotular a variável resposta. Também foram incluídos dados cadastrais, como a Classificação Nacional de Atividades Econômicas (CNAE), com o propósito de identificar padrões de comportamento contábil associados a diferentes segmentos econômicos.
A variável resposta (Y) foi definida como binária. Atribuiu-se o valor 1 (um) quando a empresa foi autuada em determinado exercício ou quando apresentava fortes indícios de infração. O valor 0 (zero) foi atribuído aos demais casos, que incluíam tanto empresas analisadas sem irregularidades quanto aquelas que não foram objeto de auditoria, refletindo a escassez de recursos para análise de todos os contribuintes.
Essa definição da variável resposta caracteriza o problema como um cenário de classe positiva rara e rótulos negativos heterogêneos. Tal estrutura é comum em aplicações de auditoria fiscal, onde o foco é a priorização com base em risco para posterior triagem e seleção humana especializada (Chan et al., 2022; Malashin et al., 2025).
Na construção das variáveis explicativas, inicialmente considerou-se utilizar todas as contas do balancete de verificação. Contudo, para evitar um conjunto de dados excessivamente amplo, com variáveis correlacionadas e redundantes, optou-se pela criação de indicadores e índices contábeis derivados de contas relevantes para a auditoria fiscal presentes no balancete de verificação.
Esses indicadores foram desenvolvidos para representar o comportamento econômico-financeiro das empresas ao longo do exercício analisado, visando reduzir a dimensionalidade do conjunto de dados e melhorar a interpretabilidade do modelo. A seleção das contas e a construção dos indicadores foram orientadas por hipóteses de auditoria baseadas em presunções fiscais da legislação tributária do Estado de Goiás.
Foram criados indicadores envolvendo contas como Caixa, Bancos e Disponibilidades, para identificar desvios na relação entre elas. Também se consideraram indicadores associados ao saldo credor na conta Caixa, como o maior saldo credor anual, a média dos saldos credores, a quantidade de meses em que a conta permaneceu credora e sua relevância frente ao ativo total da empresa.
No passivo, foram desenvolvidos indicadores relacionados às contas Fornecedores e Adiantamentos de Clientes, calculando-se a relação dessas contas com o passivo total, o comportamento dos movimentos credores e devedores, a volatilidade dos saldos e a frequência de períodos sem movimentação. Adicionalmente, foram calculados indicadores clássicos como Prazo Médio de Recebimento (PMR), Prazo Médio de Estocagem (PME) e Prazo Médio de Pagamento (PMP).
As variáveis explicativas basearam-se nas contas contábeis padronizadas pelo Plano de Contas Referencial (COD_CTA_REF), conforme a vinculação realizada pelo contribuinte na transmissão da ECD. Após a análise de cada variável, aplicaram-se transformações logarítmicas na forma log(1 + x) para reduzir a assimetria e mitigar o impacto de valores extremos. Valores ausentes foram tratados de forma a preservar o significado econômico de cada indicador.
Para a implementação do modelo preditivo, avaliaram-se algoritmos de aprendizado de máquina supervisionado baseados em árvores de decisão. O algoritmo principal escolhido foi o Random Forest, devido à sua capacidade de capturar relações não lineares, lidar com interações complexas entre variáveis e apresentar desempenho robusto em cenários de alta dimensionalidade e desbalanceamento entre classes (Xu e Kong, 2024; Yang, 2025).
Como base de comparação, utilizou-se um modelo de regressão logística, servindo como referência linear para avaliar os ganhos obtidos pela adoção de modelos não lineares. A comparação permitiu verificar a adequação da escolha do Random Forest para o problema proposto.
A estratégia de avaliação focou na qualidade do ranking, priorizando a precisão do topo para minimizar falsos positivos e aumentar a eficiência do processo de seleção, conforme recomendado na literatura (Battaglini et al., 2025; Malashin et al., 2025). O conjunto de dados foi dividido em amostras de treinamento (70%) e teste (30%) por amostragem estratificada, preservando a proporção original das classes da variável resposta.
As variáveis categóricas, como a CNAE em dois dígitos, foram tratadas por meio de codificação dummy (one-hot encoding) na modelagem. O desempenho dos modelos foi avaliado com base em métricas tradicionais, como a Área sob a Curva ROC (AUC), e, principalmente, por métricas de qualidade do ranking, como Precision@K (Kar; Narasimhan; Jain, 2015). Essa escolha alinhou-se ao objetivo prático de priorizar os contribuintes com maior potencial de irregularidade fiscal.
3. Resultados e Discussão
Os resultados apresentados nesta seção derivam de testes preliminares conduzidos com modelos de aprendizado de máquina supervisionado, visando a priorização de auditorias fiscais. A análise fundamentou-se em dados contábeis extraídos da Escrituração Contábil Digital (ECD) e em variáveis derivadas, conforme detalhado na metodologia. Dada a limitação de recursos humanos para a realização de auditorias, o foco da avaliação recaiu sobre a capacidade dos modelos de concentrar, nas primeiras posições de um ranking, as empresas com maior probabilidade de apresentar divergências fiscais. Para tanto, empregou-se uma avaliação orientada à métrica Precision@K, que mede a proporção de casos positivos entre as K observações mais bem ranqueadas, complementada por outras métricas de desempenho.
O conjunto de dados utilizado para os experimentos foi dividido em amostras de treinamento e teste, mantendo uma proporção de 70% para treino e 30% para teste, respectivamente. Essa divisão foi realizada por meio de amostragem estratificada, garantindo a preservação da proporção original das classes da variável resposta (Y). As variáveis categóricas, como a Classificação Nacional de Atividades Econômicas (CNAE) em dois dígitos, foram tratadas por meio de codificação *dummy* (one-hot encoding) para sua inclusão nos modelos, assegurando que as características setoriais fossem adequadamente representadas na análise preditiva.
Desempenho dos modelos
Para a avaliação do desempenho, foram selecionados e comparados diferentes algoritmos. A Regressão Logística foi empregada como modelo de referência linear (*baseline*), enquanto o algoritmo Random Forest foi testado em três configurações distintas: conservadora, principal e mais profunda, refletindo diferentes níveis de complexidade. Adicionalmente, incluiu-se uma seleção aleatória como referência mínima de comparação, permitindo dimensionar o ganho proporcionado pelas abordagens de aprendizado de máquina. Essa estratégia de comparação visou a uma compreensão abrangente da eficácia dos modelos em um cenário de dados contábeis complexos e rotulagem imperfeita.
Os resultados obtidos na amostra de teste demonstraram uma clara superioridade dos modelos baseados em árvores, especialmente o Random Forest, em comparação com a Regressão Logística e a seleção aleatória. A métrica Área Sob a Curva ROC (AUC) para as três configurações do Random Forest situou-se em torno de 0,90, indicando uma excelente capacidade de discriminação global entre as classes. Em contraste, a Regressão Logística alcançou um AUC de aproximadamente 0,78, enquanto a seleção aleatória obteve um AUC de 0,47, evidenciando sua ineficácia na ordenação dos casos.
A configuração mais profunda do Random Forest apresentou o melhor desempenho geral, com AUC de 0,91. Esse resultado é particularmente relevante, pois um AUC próximo de 1,0 indica que o modelo é capaz de distinguir com alta precisão entre contribuintes com e sem indícios de irregularidades fiscais. A curva ROC do modelo Random Forest na configuração principal, com AUC de 0,90, ilustra graficamente essa capacidade de separação, mostrando uma taxa de verdadeiros positivos significativamente maior em relação à taxa de falsos positivos quando comparada a uma linha aleatória, o que é crucial para a eficiência da auditoria.
Essa performance superior dos modelos baseados em árvores está em consonância com a literatura recente, que aponta a eficácia de algoritmos como o Random Forest em contextos de dados complexos e multidimensionais, como os encontrados em auditorias fiscais (Chan et al., 2022; Yang, 2025). A capacidade desses modelos de capturar relações não lineares e interações complexas entre as variáveis contábeis e cadastrais, sem a necessidade de pressupostos rígidos sobre a distribuição dos dados, contribui significativamente para sua robustez e poder preditivo na identificação de padrões de risco.
Avaliação do ranking (Precision@K e Lift)
A avaliação do desempenho dos modelos com foco na qualidade do ranking foi realizada por meio das métricas Precision@K e Lift@K, que são particularmente adequadas para o contexto de auditoria fiscal, onde a priorização dos casos mais relevantes é fundamental. A métrica Precision@K mede a proporção de casos positivos dentro das K primeiras posições do ranking, enquanto o Lift@K indica quantas vezes o modelo é superior a uma seleção aleatória na concentração de casos positivos. Essas métricas são cruciais para a administração tributária, que opera com recursos limitados e precisa otimizar a alocação de esforços de auditoria.
A configuração mais profunda do Random Forest demonstrou um desempenho notável na concentração de casos positivos no topo do ranking. Para K=50, obteve-se um Precision@50 de 0,42, o que significa que 42% das 50 empresas mais bem ranqueadas pelo modelo eram, de fato, casos positivos. O Lift@50 para essa configuração foi de aproximadamente 22,42, indicando que o uso do modelo é cerca de 22 vezes mais eficaz na identificação de casos positivos do que uma seleção aleatória entre as 50 empresas mais prioritárias. Esses valores ressaltam a capacidade do modelo de direcionar os auditores para os contribuintes com maior probabilidade de apresentar inconsistências fiscais.
A configuração principal do Random Forest, adotada como referência para esta etapa da pesquisa, também apresentou resultados expressivos, com Precision@50 de 0,34 e Lift@50 de aproximadamente 18,15. Isso significa que 34% das 50 empresas mais bem ranqueadas por este modelo eram casos positivos, e a eficácia na identificação desses casos foi cerca de 18 vezes superior à de uma seleção aleatória. A análise do comportamento da métrica Precision@K para o modelo principal revelou que a precisão é significativamente mais elevada nas primeiras posições do ranking, diminuindo gradualmente à medida que o valor de K aumenta. Esse padrão é esperado e desejável em modelos de priorização, pois os casos de maior risco são naturalmente concentrados no topo, otimizando a eficiência da auditoria.
Em contraste, a Regressão Logística apresentou um Precision@50 de 0,16 e um Lift@50 de aproximadamente 6,41, evidenciando um desempenho inferior ao Random Forest na capacidade de capturar padrões não lineares e priorizar os contribuintes de risco. A seleção aleatória, por sua vez, obteve um Precision@50 de aproximadamente 0,02, servindo como uma base para dimensionar o ganho substancial proporcionado pelas abordagens supervisionadas. A superioridade do Random Forest nessas métricas reforça a adequação da utilização de modelos de aprendizado de máquina para a seleção de contribuintes, permitindo uma alocação mais eficiente dos recursos públicos.
Apesar do desempenho ligeiramente superior da configuração mais profunda do Random Forest no topo do ranking, optou-se por manter a configuração principal como modelo de referência. Essa decisão foi estratégica, considerando a natureza do problema, que envolve uma classe positiva rara e rótulos negativos heterogêneos, os quais não indicam necessariamente conformidade fiscal. Um modelo de complexidade intermediária, como o Random Forest principal, pode oferecer maior robustez, estabilidade do ranking e um melhor potencial de generalização, reduzindo o risco de sobreajuste aos dados de treinamento e garantindo uma aplicação mais consistente em cenários reais de auditoria.
Análise do ranking gerado
A análise do ranking gerado pelo modelo Random Forest (configuração principal) na amostra de teste revelou uma concentração significativa de casos positivos (Y=1) nas primeiras posições. Por exemplo, entre as 20 primeiras observações ranqueadas, verificou-se que 12 pertenciam à classe Y=1, indicando que o modelo possui uma capacidade adequada de ordenar os casos associados a inconsistências fiscais. As primeiras posições, como o primeiro colocado com um escore de 0,8584 (ano 2022, CNAE 46) e o segundo com 0,8062 (ano 2021, CNAE 47), eram de fato casos positivos, demonstrando a eficácia do modelo em identificar contribuintes de alto risco.
No entanto, observou-se também a presença de algumas observações classificadas como Y=0 entre as primeiras posições do ranking, como o terceiro colocado com escore de 0,7784 (ano 2022, CNAE 46) e o sétimo com 0,7671 (ano 2021, CNAE 47). Esse comportamento é consistente com a natureza da variável resposta adotada, na qual um valor 0 (zero) não implica necessariamente a ausência de irregularidade fiscal. Devido à escassez de recursos humanos, muitos contribuintes classificados como Y=0 podem ser casos que ainda não foram objeto de auditoria ou que, mesmo auditados, não tiveram irregularidades formalmente autuadas, mas ainda podem apresentar indícios de infração.
O posicionamento dessas observações com rótulo negativo no topo do ranking é, na verdade, um indicativo da utilidade do modelo como ferramenta de priorização. Esses casos podem representar potenciais alvos de interesse para auditorias futuras, pois o modelo atribuiu a eles escores elevados com base em padrões contábeis que sugerem risco, independentemente do histórico de autuação. Assim, o ranking gerado oferece subsídios objetivos para a tomada de decisão, auxiliando na alocação de recursos em processos de auditoria fiscal e contribuindo para o uso racional dos recursos públicos, ao direcionar a atenção para contribuintes que, de outra forma, poderiam passar despercebidos.
Distribuição dos escores
A análise da distribuição dos escores atribuídos pelo modelo Random Forest (configuração principal) para as classes positiva (Y=1) e negativa (Y=0) revelou padrões distintos. Observou-se que as observações com rótulo positivo, ou seja, aquelas com inconsistências fiscais identificadas, receberam, em média, escores mais elevados. Em contrapartida, as observações da classe negativa tenderam a receber escores inferiores. Essa separação entre as distribuições das duas classes é um indicativo claro da capacidade do modelo de discriminar adequadamente entre os casos com e sem indícios de irregularidade fiscal, o que é fundamental para a eficácia da priorização.
Apesar da clara separação, foi possível identificar regiões de sobreposição entre as distribuições dos escores das classes positiva e negativa. Essa sobreposição é um reflexo do caráter imperfeito da variável resposta, conforme discutido anteriormente. As observações classificadas como negativas (Y=0) podem incluir contribuintes que ainda não foram auditados ou que, mesmo auditados, não tiveram irregularidades formalmente identificadas, mas que, de fato, apresentam risco. Nesses casos, o modelo atribuiu escores mais altos, posicionando-os em regiões de sobreposição com a classe positiva, o que reforça a ideia de que esses contribuintes podem ser alvos válidos para futuras auditorias.
A existência dessa sobreposição, portanto, não diminui a validade do modelo, mas sim destaca a complexidade do problema de rotulagem em auditorias fiscais. Ela sugere que o modelo é capaz de identificar padrões de risco mesmo em um ambiente onde os rótulos históricos são incompletos ou imperfeitos. Essa característica é particularmente valiosa para as administrações tributárias, pois permite a identificação de potenciais irregularidades que as malhas fiscais tradicionais, baseadas em regras rígidas e rótulos históricos, poderiam não detectar. Assim, a distribuição dos escores corrobora a utilidade do modelo como uma ferramenta de apoio à decisão, capaz de refinar a seleção de contribuintes para auditoria.
Discussão dos Resultados e Limitações
Os resultados preliminares da pesquisa indicam que os modelos supervisionados baseados em árvores, notadamente o Random Forest, utilizando dados derivados da Escrituração Contábil Digital (ECD), apresentaram um desempenho consistente e robusto. Essa performance foi observada mesmo diante das restrições impostas pelo processo de rotulagem adotado, que caracteriza um cenário de rótulos imperfeitos. A comparação com o modelo linear de regressão logística demonstrou a superioridade do Random Forest tanto em termos de AUC quanto de Precision@K, sugerindo que os padrões associados ao problema de inconsistências fiscais envolvem relações não lineares e interações complexas entre as variáveis contábeis, as quais são bem capturadas por algoritmos baseados em árvores.
Do ponto de vista aplicado, os achados indicam um potencial significativo para aumentar a eficiência na seleção de contribuintes para auditoria. A capacidade do modelo de concentrar casos com indícios de irregularidade nas primeiras posições do ranking permite que a administração tributária otimize a alocação de seus recursos, direcionando os esforços de auditoria para um número reduzido de empresas com maior probabilidade de apresentar inconsistências. Isso contribui para um uso mais racional dos recursos públicos, maximizando o impacto das ações fiscais e aprimorando a arrecadação.
É fundamental observar que a presença de empresas com rótulo negativo (Y=0) nas primeiras posições do ranking não deve ser interpretada como um erro do modelo, mas sim como uma característica da natureza do rótulo adotado. O rótulo Y=0 inclui tanto empresas avaliadas sem apontamentos relevantes quanto aquelas que ainda não foram auditadas. Assim, o posicionamento dessas observações no topo do ranking reflete a atribuição de escores elevados a determinados perfis contábeis que o modelo identificou como de alto risco, independentemente da classificação histórica disponível. Isso caracteriza um cenário típico de classificação com rótulos imperfeitos (*label noise*), onde o modelo pode identificar riscos ainda não confirmados por auditorias prévias.
Apesar dos resultados promissores, o estudo apresenta limitações importantes que devem ser consideradas. A principal limitação refere-se à qualidade dos rótulos utilizados, uma vez que a ausência de autuação não implica necessariamente conformidade fiscal, introduzindo incerteza na variável resposta. Essa imperfeição nos rótulos pode influenciar a capacidade do modelo de generalizar para novos dados. Além disso, o modelo foi treinado com base em auditorias históricas, o que pode refletir vieses inerentes ao processo de seleção previamente adotado pela administração tributária, potencialmente perpetuando padrões de auditoria existentes.
Outra limitação relevante é que a análise se concentrou em um conjunto específico de indicadores derivados da ECD, não explorando outras bases fiscais complementares, como a Escrituração Fiscal Digital (EFD) ou a Nota Fiscal Eletrônica (NF-e), que poderiam fornecer informações adicionais para a identificação de riscos. A incorporação de novas bases de dados e o aprimoramento contínuo do processo de rotulagem, com a inclusão de novos rótulos positivos advindos de auditorias recentes, representam caminhos promissores para a melhoria e a robustez do modelo em futuras aplicações. Em síntese, os achados demonstram o potencial do aprendizado de máquina na priorização de auditorias, oferecendo uma ferramenta valiosa para a administração tributária, mesmo em um contexto de dados desafiador.
4. Conclusão
O presente estudo buscou aplicar e avaliar modelos supervisionados de aprendizado de máquina para gerar escores de risco, auxiliando na priorização de empresas e períodos para auditoria fiscal, considerando o histórico de inconsistências. Verificou-se que os modelos baseados em árvores, especialmente o Random Forest, demonstraram desempenho superior na capacidade de discriminação e priorização de contribuintes, em comparação com a regressão logística e a seleção aleatória. Observou-se que o Random Forest apresentou alta capacidade de concentrar casos com indícios de irregularidade nas primeiras posições do ranking, mesmo em um cenário de rótulos imperfeitos. A análise revelou que o modelo é eficaz em identificar padrões contábeis associados a risco, oferecendo um subsídio objetivo para a administração tributária. Essa abordagem contribui significativamente para a otimização da alocação de recursos públicos, direcionando os esforços de auditoria para os contribuintes com maior probabilidade de apresentar inconsistências fiscais e, assim, maximizando o impacto das ações de fiscalização.
Apesar dos resultados promissores, o estudo reconhece limitações importantes, como a qualidade dos rótulos históricos, em que a ausência de autuação não garante a conformidade fiscal, introduzindo incerteza na variável resposta. Adicionalmente, o treinamento do modelo com base em auditorias passadas pode refletir vieses inerentes aos processos de seleção anteriores. Para estudos futuros, sugere-se o aprimoramento contínuo do processo de rotulagem, com a inclusão de novos rótulos positivos advindos de auditorias recentes, e a incorporação de outras bases fiscais complementares, como a Escrituração Fiscal Digital (EFD) e a Nota Fiscal Eletrônica (NF-e). Recomenda-se, ainda, a ampliação das análises para avaliar a robustez e a estabilidade do modelo em diferentes contextos. Em síntese, a abordagem proposta representa uma ferramenta valiosa para o apoio à decisão na seleção de contribuintes, com potencial para aprimorar a eficiência e a racionalidade na gestão dos recursos públicos.
Referências Bibliográficas
Battaglini, M.; Guiso, L.; Lacava, F.; Miller, D.; Patacchini, E. 2025. Refining public policies with machine learning: the case of tax auditing. Journal of Econometrics 249: 105847.
Brasil. 2024. Manual de Orientação do Leiaute da Escrituração Contábil Digital (ECD). Versão 9.0. Receita Federal do Brasil [RFB], Brasília, DF, Brasil. Disponível em: https://www.gov.br/receitafederal/pt-br/centrais-de-conteudo/publicacoes/sped/ecd. Acesso em: 11 out. 2025.
Chan, T.; Tan, Y.; Tagkopoulos, I. 2022. Audit lead selection and yield prediction from historical tax data using artificial neural networks. PLOS ONE 17(11): e0278121.
Federação Nacional dos Auditores e Fiscais de Tributos Municipais [FENAFIM]. 2017. Machine Learning: aprendizagem de máquina e mineração de dados no combate à evasão fiscal. In: Prêmio Nacional de Educação Fiscal e Finanças Públicas, 2017, São Paulo, SP, Brasil. Anais… p. 1-10. São Paulo, SP, Brasil. Disponível em: https://www.fenafim.org.br/premio/wp-content/uploads/2019/04/2017_2_Machine_Learning.pdf. Acesso em: 11 out. 2025.
Kar, P.; Narasimhan, H.; Jain, P. 2015. Surrogate functions for maximizing precision at the top. arXiv preprint, arXiv:1505.06813. Disponível em: https://arxiv.org/abs/1505.06813. Acesso em: 01 fev. 2026.
Malashin, I.; Ruohonen, J.; Janes, A.; Iosifidis, G. 2025. Minimizing unnecessary tax audits using multi-objective hyperparameter tuning of XGBoost with focal loss. PLOS ONE 19(3): e0300928.
Silva, A.A. 2025. O uso dos dados agregados da ECD na auditoria contábil tributária. Instituto dos Auditores Fiscais do Estado da Bahia [IAF], Salvador, BA, Brasil. Disponível em: https://iaf.org.br/conteudo/9978/o-uso-dos-dados-agregados-da-ecd-na-auditoria-contabil-tributaria. Acesso em: 11 out. 2025.
Xu, C.; Kong, Y. 2024. Random forest model in tax risk identification of real estate enterprise income tax. PLOS ONE 19(3): e0300928.
Yang, L. 2025. Predictive modeling of tax compliance risks: a comparative study of machine learning approaches. PLOS ONE 20(9): e0331715.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

