07 de octubre de 2026
Modelado predictivo para la priorización de inconsistencias fiscales a partir del balance de comprobación de la ECD
Modelado Predictivo para la Priorización de Inconsistencias Fiscales a Partir del Balance de la Ecd
João Pedro Apolinário Cardoso; Thiago Gentil Ramires
DOI: 10.22167/2675-6528-202603036
Artículo derivado de Trabajo de Fin de Curso (TCC), con contenido basado en el trabajo original del estudiante y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, una solución de inteligencia artificial desarrollada por el Instituto Pecege para la síntesis y organización textual.
Resumen
La creciente complejidad de las relaciones económicas y el elevado volumen de datos disponibles para la administración tributaria demandaron el desarrollo de herramientas más eficientes para la selección de contribuyentes sometidos a auditoría fiscal. En este contexto, se aplicaron modelos supervisados de aprendizaje automático, basándose en datos extraídos de la Escrituración Contable Digital (ECD), para priorizar empresas en un escenario de restricción de recursos humanos y de etiquetado incompleto. Para ello, se construyó un conjunto de datos compuesto por variables contables derivadas de la ECD y se aplicaron los modelos de Regresión Logística y Random Forest. La Regresión Logística se utilizó como referencia lineal, mientras que el Random Forest fue elegido por su capacidad de capturar relaciones no lineales e interacciones complejas entre variables estructuradas. Modelos de mayor complejidad, como redes neuronales, no fueron priorizados, considerándose la baja disponibilidad de ejemplos de la clase positiva y el objetivo de adoptar un enfoque parsimonioso y de fácil aplicación operativa. El desempeño de los modelos se evaluó con enfoque en la capacidad de concentrar casos positivos en las primeras posiciones del ranking. Los resultados indicaron superioridad de los modelos basados en árboles, especialmente del Random Forest, en la priorización de los contribuyentes. Se observó, además, la identificación de patrones relevantes incluso en contexto de etiquetas imperfectas. Se concluyó que el enfoque propuesto presentó potencial para apoyar la selección de contribuyentes para auditoría y contribuir a la asignación más eficiente de recursos públicos.
Palabras clave: Análisis de riesgo; Aprendizaje supervisado; Datos contables; Priorización de auditorías; Selección de contribuyentes.
1. Introducción
El proceso de digitalización en el sector público, que se intensificó a partir de los años 2000, promovió transformaciones significativas, especialmente en la administración tributaria. En este contexto, se implementó el Sistema Público de Escrituración Digital (SPED), sustituyendo declaraciones en papel por documentos digitales. Una de las principales herramientas resultantes de este movimiento es la Escrituración Contable Digital (ECD), según el Manual de Orientación del Leyout 9 de la Escrituración Contable Digital (Brasil [RFB], 2024), que se ha vuelto esencial para las auditorías fiscales.
La ECD exige que los contribuyentes declaren diversos libros contables, incluyendo el balance de comprobación, la Cuenta de Pérdidas y Ganancias (DRE) y el balance general. Inicialmente, el acceso a estos datos estaba restringido a la Receita Federal do Brasil (RFB), pero la Instrucción Normativa RFB n° 2.003/2021 amplió el acceso a las haciendas estatales. Esta ampliación, junto con la estandarización del Plan de Cuentas Referencial (registro 1051), permitió el uso masivo de los datos de la ECD para cruces y comparaciones con otras obligaciones fiscales, como la Escrituración Fiscal Digital (EFD) y las facturas electrónicas (Silva, 2025).
Entre los componentes de la ECD, el balance de comprobación se destaca como la fuente de datos más rica para las haciendas estatales. Está compuesto por saldos mensuales consolidados por cuenta, detallando saldos inicial y final, además de los valores registrados a débito y a crédito (Brasil [RFB], 2024). Con estos registros, la hacienda puede realizar cruces para identificar anomalías o inconsistencias fiscales, que sirven como indicios para la selección de empresas a ser auditadas.
A pesar de los avances tecnológicos, la administración tributaria todavía enfrenta limitaciones significativas de recursos humanos y operativos. La selección de contribuyentes para auditoría demanda un análisis previo de riesgo para priorizar los casos más relevantes, dado que la ausencia de actuación no garantiza necesariamente la regularidad fiscal de un contribuyente o ejercicio. Esta realidad impone un desafío en la identificación eficiente de irregularidades.
Actualmente, las administraciones tributarias utilizan mallas fiscales basadas en reglas rígidas para seleccionar contribuyentes. Sin embargo, el volumen y la complejidad de los datos fiscales disponibles superan la capacidad de análisis humano, según lo señalado por la Federación Nacional de Auditores y Fiscales de Tributos Municipales (FENAFIM, 2017). La literatura internacional también documenta la baja capacidad adaptativa y la mayor propensión a sesgos de los modelos basados en reglas fijas en comparación con enfoques de aprendizaje automático (Chan et al., 2022; Battaglini et al., 2025).
El presente estudio utiliza datos reales de la Escrituración Contable Digital (ECD) de empresas contribuyentes del Estado de Goiás, extraídos de los registros de saldos periódicos (1150 y 1155), además de información proveniente de auditorías fiscales realizadas en ejercicios anteriores. El foco de la investigación está en la utilización de los datos contables de la ECD y de variables derivadas, pudiendo ser incorporados, conforme al análisis, datos complementarios de la Escrituración Fiscal Digital (EFD) y de la Nota Fiscal Electrónica (NF-e). También se consideran datos cadastrales, como la Clasificación Nacional de Actividades Económicas (CNAE), de modo a permitir la identificación de patrones contables asociados a diferentes segmentos económicos.
Ante este escenario, se vuelve necesario adoptar, en las administraciones tributarias, mecanismos de minería de datos y aprendizaje automático como forma de apoyo a la toma de decisiones. La adopción de estas técnicas, aplicada a la ECD, permitirá la construcción de puntuaciones de riesgo, auxiliando en la priorización de contribuyentes para auditorías, reduciendo la necesidad de análisis manuales, y contribuyendo, así, al uso racional de los recursos públicos, conforme evidenciado por estudios empíricos en la literatura reciente (Battaglini et al., 2025; Yang, 2025). En este contexto, el trabajo aplica y evalúa modelos de aprendizaje automático supervisado con el objetivo de generar puntuaciones de riesgo que auxilien en la priorización de empresas y períodos a ser seleccionados para auditoría fiscal, considerando el historial de inconsistencias identificadas en ejercicios anteriores. La investigación forma parte de los esfuerzos de innovación en ciencia de datos en el área tributaria y contribuye al perfeccionamiento de los procesos de selección de contribuyentes, así como al desarrollo de soluciones analíticas con potencial de aplicación en otras administraciones públicas.
2. Material y Métodos
El presente estudio, de naturaleza aplicada, empleó un enfoque cuantitativo para desarrollar y evaluar modelos de aprendizaje automático supervisado. El objetivo central fue generar puntuaciones de riesgo que ayudaran a priorizar empresas y períodos para la auditoría fiscal, considerando el historial de inconsistencias identificadas en ejercicios anteriores. La investigación se centró en la modelización predictiva para optimizar la selección de contribuyentes en un escenario de recursos limitados.
La unidad de análisis consistió en empresas contribuyentes del Estado de Goiás, con los datos organizados por ejercicio fiscal. Para la construcción de la base de datos, se utilizaron informaciones reales provenientes de la Escrituración Contable Digital (ECD), específicamente los registros de saldos periódicos (1150 y 1155) del balance de comprobación, además de datos de la Demostración del Resultado del Ejercicio (DRE), ambos componentes de la ECD.
Complementariamente, la base de datos incorporó información obtenida de auditorías fiscales ya finalizadas en ejercicios anteriores, que sirvieron para etiquetar la variable respuesta. También se incluyeron datos catastrales, como la Clasificación Nacional de Actividades Económicas (CNAE), con el propósito de identificar patrones de comportamiento contable asociados a diferentes segmentos económicos.
La variable de respuesta (Y) se definió como binaria. Se asignó el valor 1 (uno) cuando la empresa fue multada en un ejercicio determinado o cuando presentaba fuertes indicios de infracción. El valor 0 (cero) se asignó a los demás casos, que incluían tanto empresas analizadas sin irregularidades como aquellas que no fueron objeto de auditoría, reflejando la escasez de recursos para el análisis de todos los contribuyentes.
Esta definición de la variable de respuesta caracteriza el problema como un escenario de clase positiva rara y etiquetas negativas heterogéneas. Dicha estructura es común en aplicaciones de auditoría fiscal, donde el enfoque es la priorización basada en el riesgo para su posterior cribado y selección por parte de expertos humanos (Chan et al., 2022; Malashin et al., 2025).
En la construcción de las variables explicativas, inicialmente se consideró utilizar todas las cuentas del balance de comprobación. Sin embargo, para evitar un conjunto de datos excesivamente amplio, con variables correlacionadas y redundantes, se optó por la creación de indicadores e índices contables derivados de cuentas relevantes para la auditoría fiscal presentes en el balance de comprobación.
Estos indicadores fueron desarrollados para representar el comportamiento económico-financiero de las empresas a lo largo del ejercicio analizado, con el objetivo de reducir la dimensionalidad del conjunto de datos y mejorar la interpretabilidad del modelo. La selección de las cuentas y la construcción de los indicadores se orientaron por hipótesis de auditoría basadas en presunciones fiscales de la legislación tributaria del Estado de Goiás.
Se crearon indicadores que involucran cuentas como Caja, Bancos y Disponibilidades, para identificar desviaciones en la relación entre ellas. También se consideraron indicadores asociados al saldo acreedor en la cuenta Caja, como el mayor saldo acreedor anual, el promedio de los saldos acreedores, la cantidad de meses en que la cuenta permaneció acreedora y su relevancia frente al activo total de la empresa.
En el pasivo, se desarrollaron indicadores relacionados con las cuentas de Proveedores y Anticipos de Clientes, calculando la relación de estas cuentas con el pasivo total, el comportamiento de los movimientos acreedores y deudores, la volatilidad de los saldos y la frecuencia de períodos sin movimiento. Adicionalmente, se calcularon indicadores clásicos como Plazo Medio de Cobranza (PMR), Plazo Medio de Almacenamiento (PME) y Plazo Medio de Pago (PMP).
Las variables explicativas se basaron en las cuentas contables estandarizadas por el Plan de Cuentas Referencial (COD_CTA_REF), según el vínculo establecido por el contribuyente en la transmisión de la ECD. Tras el análisis de cada variable, se aplicaron transformaciones logarítmicas en la forma log(1 + x) para reducir la asimetría y mitigar el impacto de valores extremos. Los valores ausentes se trataron de forma a preservar el significado económico de cada indicador.
Para la implementación del modelo predictivo, se evaluaron algoritmos de aprendizaje automático supervisado basados en árboles de decisión. El algoritmo principal elegido fue Random Forest, debido a su capacidad para capturar relaciones no lineales, manejar interacciones complejas entre variables y presentar un rendimiento robusto en escenarios de alta dimensionalidad y desequilibrio entre clases (Xu y Kong, 2024; Yang, 2025).
Como base de comparación, se utilizó un modelo de regresión logística, sirviendo como referencia lineal para evaluar las ganancias obtenidas por la adopción de modelos no lineales. La comparación permitió verificar la adecuación de la elección del Random Forest para el problema propuesto.
La estrategia de evaluación se centró en la calidad del ranking, priorizando la precisión de la parte superior para minimizar los falsos positivos y aumentar la eficiencia del proceso de selección, según lo recomendado en la literatura (Battaglini et al., 2025; Malashin et al., 2025). El conjunto de datos se dividió en muestras de entrenamiento (70%) y de prueba (30%) mediante muestreo estratificado, preservando la proporción original de las clases de la variable respuesta.
Las variables categóricas, como la CNAE en dos dígitos, fueron tratadas mediante codificación dummy (one-hot encoding) en la modelización. El rendimiento de los modelos se evaluó basándose en métricas tradicionales, como el Área bajo la Curva ROC (AUC), y, principalmente, por métricas de calidad del ranking, como Precision@K (Kar; Narasimhan; Jain, 2015). Esta elección se alineó con el objetivo práctico de priorizar a los contribuyentes con mayor potencial de irregularidad fiscal.
3. Resultados y Discusión
Los resultados presentados en esta sección derivan de pruebas preliminares realizadas con modelos de aprendizaje automático supervisado, con el objetivo de priorizar auditorías fiscales. El análisis se basó en datos contables extraídos de la Escrituración Contable Digital (ECD) y en variables derivadas, según se detalla en la metodología. Dada la limitación de recursos humanos para la realización de auditorías, el enfoque de la evaluación se centró en la capacidad de los modelos para concentrar, en las primeras posiciones de un ranking, las empresas con mayor probabilidad de presentar discrepancias fiscales. Para ello, se empleó una evaluación orientada a la métrica Precision@K, que mide la proporción de casos positivos entre las K observaciones mejor clasificadas, complementada por otras métricas de rendimiento.
El conjunto de datos utilizado para los experimentos se dividió en muestras de entrenamiento y prueba, manteniendo una proporción del 70% para entrenamiento y el 30% para prueba, respectivamente. Esta división se realizó mediante muestreo estratificado, garantizando la preservación de la proporción original de las clases de la variable respuesta (Y). Las variables categóricas, como la Clasificación Nacional de Actividades Económicas (CNAE) en dos dígitos, se trataron mediante codificación *dummy* (one-hot encoding) para su inclusión en los modelos, asegurando que las características sectoriales fueran adecuadamente representadas en el análisis predictivo.
Desempeño de los modelos
Para la evaluación del desempeño, se seleccionaron y compararon diferentes algoritmos. La Regresión Logística se empleó como modelo de referencia lineal (*baseline*), mientras que el algoritmo Random Forest se probó en tres configuraciones distintas: conservadora, principal y más profunda, reflejando diferentes niveles de complejidad. Adicionalmente, se incluyó una selección aleatoria como referencia mínima de comparación, permitiendo dimensionar la ganancia proporcionada por los enfoques de aprendizaje automático. Esta estrategia de comparación apuntó a una comprensión abarcadora de la eficacia de los modelos en un escenario de datos contables complejos y etiquetado imperfecto.
Los resultados obtenidos en la muestra de prueba demostraron una clara superioridad de los modelos basados en árboles, especialmente el Random Forest, en comparación con la Regresión Logística y la selección aleatoria. La métrica Área Bajo la Curva ROC (AUC) para las tres configuraciones del Random Forest se situó en torno a 0,90, indicando una excelente capacidad de discriminación global entre las clases. En contraste, la Regresión Logística alcanzó un AUC de aproximadamente 0,78, mientras que la selección aleatoria obtuvo un AUC de 0,47, evidenciando su ineficacia en la ordenación de los casos.
La configuración más profunda del Random Forest presentó el mejor rendimiento general, con un AUC de 0,91. Este resultado es particularmente relevante, ya que un AUC cercano a 1,0 indica que el modelo es capaz de distinguir con alta precisión entre contribuyentes con y sin indicios de irregularidades fiscales. La curva ROC del modelo Random Forest en la configuración principal, con un AUC de 0,90, ilustra gráficamente esta capacidad de separación, mostrando una tasa de verdaderos positivos significativamente mayor en relación con la tasa de falsos positivos cuando se compara con una línea aleatoria, lo que es crucial para la eficiencia de la auditoría.
Este rendimiento superior de los modelos basados en árboles está en consonancia con la literatura reciente, que señala la eficacia de algoritmos como Random Forest en contextos de datos complejos y multidimensionales, como los encontrados en auditorías fiscales (Chan et al., 2022; Yang, 2025). La capacidad de estos modelos para capturar relaciones no lineales e interacciones complejas entre las variables contables y de registro, sin necesidad de supuestos rígidos sobre la distribución de los datos, contribuye significativamente a su robustez y poder predictivo en la identificación de patrones de riesgo.
Evaluación del ranking (Precision@K y Lift)
La evaluación del rendimiento de los modelos con enfoque en la calidad del ranking se realizó mediante las métricas Precision@K y Lift@K, que son particularmente adecuadas para el contexto de auditoría fiscal, donde la priorización de los casos más relevantes es fundamental. La métrica Precision@K mide la proporción de casos positivos dentro de las K primeras posiciones del ranking, mientras que Lift@K indica cuántas veces el modelo es superior a una selección aleatoria en la concentración de casos positivos. Estas métricas son cruciales para la administración tributaria, que opera con recursos limitados y necesita optimizar la asignación de esfuerzos de auditoría.
La configuración más profunda del Random Forest demostró un rendimiento notable en la concentración de casos positivos en la parte superior del ranking. Para K=50, se obtuvo un Precision@50 de 0,42, lo que significa que el 42% de las 50 empresas mejor clasificadas por el modelo eran, de hecho, casos positivos. El Lift@50 para esta configuración fue de aproximadamente 22,42, lo que indica que el uso del modelo es aproximadamente 22 veces más eficaz en la identificación de casos positivos que una selección aleatoria entre las 50 empresas más prioritarias. Estos valores resaltan la capacidad del modelo para dirigir a los auditores hacia los contribuyentes con mayor probabilidad de presentar inconsistencias fiscales.
La configuración principal de Random Forest, adoptada como referencia para esta etapa de la investigación, también presentó resultados expresivos, con Precision@50 de 0,34 y Lift@50 de aproximadamente 18,15. Esto significa que el 34% de las 50 empresas mejor clasificadas por este modelo eran casos positivos, y la eficacia en la identificación de estos casos fue aproximadamente 18 veces superior a la de una selección aleatoria. El análisis del comportamiento de la métrica Precision@K para el modelo principal reveló que la precisión es significativamente más elevada en las primeras posiciones del ranking, disminuyendo gradualmente a medida que el valor de K aumenta. Este patrón es esperado y deseable en modelos de priorización, ya que los casos de mayor riesgo se concentran naturalmente en la cima, optimizando la eficiencia de la auditoría.
En contraste, la Regresión Logística presentó un Precision@50 de 0,16 y un Lift@50 de aproximadamente 6,41, evidenciando un rendimiento inferior al Random Forest en la capacidad de capturar patrones no lineales y priorizar los contribuyentes de riesgo. La selección aleatoria, por su parte, obtuvo un Precision@50 de aproximadamente 0,02, sirviendo como una base para dimensionar la ganancia sustancial proporcionada por los enfoques supervisados. La superioridad del Random Forest en estas métricas refuerza la adecuación de la utilización de modelos de aprendizaje automático para la selección de contribuyentes, permitiendo una asignación más eficiente de los recursos públicos.
A pesar del rendimiento ligeramente superior de la configuración más profunda del Random Forest en la parte superior de la clasificación, se optó por mantener la configuración principal como modelo de referencia. Esta decisión fue estratégica, considerando la naturaleza del problema, que involucra una clase positiva rara y etiquetas negativas heterogéneas, las cuales no indican necesariamente cumplimiento fiscal. Un modelo de complejidad intermedia, como el Random Forest principal, puede ofrecer mayor robustez, estabilidad de la clasificación y un mejor potencial de generalización, reduciendo el riesgo de sobreajuste a los datos de entrenamiento y garantizando una aplicación más consistente en escenarios reales de auditoría.
Análisis del ranking generado
El análisis del ranking generado por el modelo Random Forest (configuración principal) en la muestra de prueba reveló una concentración significativa de casos positivos (Y=1) en las primeras posiciones. Por ejemplo, entre las 20 primeras observaciones clasificadas, se verificó que 12 pertenecían a la clase Y=1, lo que indica que el modelo posee una capacidad adecuada para ordenar los casos asociados a inconsistencias fiscales. Las primeras posiciones, como el primer puesto con una puntuación de 0,8584 (año 2022, CNAE 46) y el segundo con 0,8062 (año 2021, CNAE 47), eran de hecho casos positivos, demostrando la eficacia del modelo en la identificación de contribuyentes de alto riesgo.
Sin embargo, también se observó la presencia de algunas observaciones clasificadas como Y=0 entre las primeras posiciones del ranking, como el tercer clasificado con una puntuación de 0,7784 (año 2022, CNAE 46) y el séptimo con 0,7671 (año 2021, CNAE 47). Este comportamiento es coherente con la naturaleza de la variable de respuesta adoptada, en la que un valor 0 (cero) no implica necesariamente la ausencia de irregularidad fiscal. Debido a la escasez de recursos humanos, muchos contribuyentes clasificados como Y=0 pueden ser casos que aún no han sido objeto de auditoría o que, incluso habiendo sido auditados, no han tenido irregularidades formalmente registradas, pero aún pueden presentar indicios de infracción.
El posicionamiento de estas observaciones con etiqueta negativa en la parte superior del ranking es, de hecho, un indicativo de la utilidad del modelo como herramienta de priorización. Estos casos pueden representar potenciales objetivos de interés para futuras auditorías, ya que el modelo les ha asignado puntuaciones elevadas basándose en patrones contables que sugieren riesgo, independientemente del historial de multas. Así, el ranking generado ofrece subsidios objetivos para la toma de decisiones, ayudando en la asignación de recursos en procesos de auditoría fiscal y contribuyendo al uso racional de los recursos públicos, al dirigir la atención hacia contribuyentes que, de otra manera, podrían pasar desapercibidos.
Distribución de las puntuaciones
El análisis de la distribución de las puntuaciones asignadas por el modelo Random Forest (configuración principal) para las clases positiva (Y=1) y negativa (Y=0) reveló patrones distintos. Se observó que las observaciones con etiqueta positiva, es decir, aquellas con inconsistencias fiscales identificadas, recibieron, en promedio, puntuaciones más altas. En contrapartida, las observaciones de la clase negativa tendieron a recibir puntuaciones inferiores. Esta separación entre las distribuciones de las dos clases es un indicativo claro de la capacidad del modelo para discriminar adecuadamente entre los casos con y sin indicios de irregularidad fiscal, lo cual es fundamental para la eficacia de la priorización.
A pesar de la clara separación, fue posible identificar regiones de superposición entre las distribuciones de las puntuaciones de las clases positiva y negativa. Esta superposición es un reflejo del carácter imperfecto de la variable respuesta, como se discutió anteriormente. Las observaciones clasificadas como negativas (Y=0) pueden incluir contribuyentes que aún no han sido auditados o que, incluso auditados, no han tenido irregularidades formalmente identificadas, pero que, de hecho, presentan riesgo. En estos casos, el modelo asignó puntuaciones más altas, posicionándolos en regiones de superposición con la clase positiva, lo que refuerza la idea de que estos contribuyentes pueden ser objetivos válidos para futuras auditorías.
La existencia de esta superposición, por lo tanto, no disminuye la validez del modelo, sino que destaca la complejidad del problema de etiquetado en auditorías fiscales. Sugiere que el modelo es capaz de identificar patrones de riesgo incluso en un entorno donde las etiquetas históricas son incompletas o imperfectas. Esta característica es particularmente valiosa para las administraciones tributarias, ya que permite la identificación de posibles irregularidades que las mallas fiscales tradicionales, basadas en reglas rígidas y etiquetas históricas, podrían no detectar. Así, la distribución de las puntuaciones corrobora la utilidad del modelo como una herramienta de apoyo a la decisión, capaz de refinar la selección de contribuyentes para auditoría.
Discusión de los Resultados y Limitaciones
Los resultados preliminares de la investigación indican que los modelos supervisados basados en árboles, notablemente el Random Forest, utilizando datos derivados de la Escrituración Contable Digital (ECD), presentaron un desempeño consistente y robusto. Esta performance se observó incluso ante las restricciones impuestas por el proceso de etiquetado adoptado, que caracteriza un escenario de etiquetas imperfectas. La comparación con el modelo lineal de regresión logística demostró la superioridad del Random Forest tanto en términos de AUC como de Precision@K, sugiriendo que los patrones asociados al problema de inconsistencias fiscales involucran relaciones no lineales e interacciones complejas entre las variables contables, las cuales son bien capturadas por algoritmos basados en árboles.
Desde el punto de vista aplicado, los hallazgos indican un potencial significativo para aumentar la eficiencia en la selección de contribuyentes para auditoría. La capacidad del modelo de concentrar casos con indicios de irregularidad en las primeras posiciones del ranking permite que la administración tributaria optimice la asignación de sus recursos, dirigiendo los esfuerzos de auditoría hacia un número reducido de empresas con mayor probabilidad de presentar inconsistencias. Esto contribuye a un uso más racional de los recursos públicos, maximizando el impacto de las acciones fiscales y mejorando la recaudación.
Es fundamental observar que la presencia de empresas con etiqueta negativa (Y=0) en las primeras posiciones del ranking no debe interpretarse como un error del modelo, sino como una característica de la naturaleza de la etiqueta adoptada. La etiqueta Y=0 incluye tanto a empresas evaluadas sin señalamientos relevantes como a aquellas que aún no han sido auditadas. Así, el posicionamiento de estas observaciones en la cima del ranking refleja la asignación de puntuaciones elevadas a determinados perfiles contables que el modelo identificó como de alto riesgo, independientemente de la clasificación histórica disponible. Esto caracteriza un escenario típico de clasificación con etiquetas imperfectas (*label noise*), donde el modelo puede identificar riesgos aún no confirmados por auditorías previas.
A pesar de los resultados prometedores, el estudio presenta limitaciones importantes que deben ser consideradas. La principal limitación se refiere a la calidad de las etiquetas utilizadas, ya que la ausencia de actuación no implica necesariamente conformidad fiscal, introduciendo incertidumbre en la variable respuesta. Esta imperfección en las etiquetas puede influir en la capacidad del modelo para generalizar a nuevos datos. Además, el modelo fue entrenado con base en auditorías históricas, lo que puede reflejar sesgos inherentes al proceso de selección previamente adoptado por la administración tributaria, perpetuando potencialmente patrones de auditoría existentes.
Otra limitación relevante es que el análisis se centró en un conjunto específico de indicadores derivados de la ECD, sin explorar otras bases fiscales complementarias, como la Escrituración Fiscal Digital (EFD) o la Nota Fiscal Electrónica (NF-e), que podrían proporcionar información adicional para la identificación de riesgos. La incorporación de nuevas bases de datos y la mejora continua del proceso de etiquetado, con la inclusión de nuevas etiquetas positivas provenientes de auditorías recientes, representan caminos prometedores para la mejora y la robustez del modelo en futuras aplicaciones. En síntesis, los hallazgos demuestran el potencial del aprendizaje automático en la priorización de auditorías, ofreciendo una herramienta valiosa para la administración tributaria, incluso en un contexto de datos desafiante.
4. Conclusión
El presente estudio buscó aplicar y evaluar modelos supervisados de aprendizaje automático para generar puntuaciones de riesgo, auxiliando en la priorización de empresas y períodos para auditoría fiscal, considerando el historial de inconsistencias. Se verificó que los modelos basados en árboles, especialmente el Random Forest, demostraron un desempeño superior en la capacidad de discriminación y priorización de contribuyentes, en comparación con la regresión logística y la selección aleatoria. Se observó que el Random Forest presentó alta capacidad de concentrar casos con indicios de irregularidad en las primeras posiciones del ranking, incluso en un escenario de etiquetas imperfectas. El análisis reveló que el modelo es eficaz en identificar patrones contables asociados a riesgo, ofreciendo un subsidio objetivo para la administración tributaria. Este enfoque contribuye significativamente a la optimización de la asignación de recursos públicos, dirigiendo los esfuerzos de auditoría hacia los contribuyentes con mayor probabilidad de presentar inconsistencias fiscales y, así, maximizando el impacto de las acciones de fiscalización.
A pesar de los resultados prometedores, el estudio reconoce limitaciones importantes, como la calidad de las etiquetas históricas, donde la ausencia de actuación no garantiza la conformidad fiscal, introduciendo incertidumbre en la variable respuesta. Adicionalmente, el entrenamiento del modelo basado en auditorías pasadas puede reflejar sesgos inherentes a los procesos de selección anteriores. Para estudios futuros, se sugiere la mejora continua del proceso de etiquetado, con la inclusión de nuevas etiquetas positivas provenientes de auditorías recientes, y la incorporación de otras bases fiscales complementarias, como la Escrituración Fiscal Digital (EFD) y la Nota Fiscal Electrónica (NF-e). Se recomienda, además, la ampliación de los análisis para evaluar la robustez y la estabilidad del modelo en diferentes contextos. En síntesis, el enfoque propuesto representa una herramienta valiosa para el apoyo a la decisión en la selección de contribuyentes, con potencial para mejorar la eficiencia y la racionalidad en la gestión de los recursos públicos.
Referencias Bibliográficas
Battaglini, M.; Guiso, L.; Lacava, F.; Miller, D.; Patacchini, E. 2025. Refining public policies with machine learning: the case of tax auditing. Journal of Econometrics 249: 105847.
Brasil. 2024. Manual de Orientação do Leiaute da Escrituração Contábil Digital (ECD). Versão 9.0. Receita Federal do Brasil [RFB], Brasília, DF, Brasil. Disponível em: https://www.gov.br/receitafederal/pt-br/centrais-de-conteudo/publicacoes/sped/ecd. Acesso em: 11 out. 2025.
Chan, T.; Tan, Y.; Tagkopoulos, I. 2022. Audit lead selection and yield prediction from historical tax data using artificial neural networks. PLOS ONE 17(11): e0278121.
Federação Nacional dos Auditores e Fiscais de Tributos Municipais [FENAFIM]. 2017. Machine Learning: aprendizagem de máquina e mineração de dados no combate à evasão fiscal. In: Prêmio Nacional de Educação Fiscal e Finanças Públicas, 2017, São Paulo, SP, Brasil. Anais… p. 1-10. São Paulo, SP, Brasil. Disponível em: https://www.fenafim.org.br/premio/wp-content/uploads/2019/04/2017_2_Machine_Learning.pdf. Acesso em: 11 out. 2025.
Kar, P.; Narasimhan, H.; Jain, P. 2015. Surrogate functions for maximizing precision at the top. arXiv preprint, arXiv:1505.06813. Disponível em: https://arxiv.org/abs/1505.06813. Acesso em: 01 fev. 2026.
Malashin, I.; Ruohonen, J.; Janes, A.; Iosifidis, G. 2025. Minimizing unnecessary tax audits using multi-objective hyperparameter tuning of XGBoost with focal loss. PLOS ONE 19(3): e0300928.
Silva, A.A. 2025. O uso dos dados agregados da ECD na auditoria contábil tributária. Instituto dos Auditores Fiscais do Estado da Bahia [IAF], Salvador, BA, Brasil. Disponível em: https://iaf.org.br/conteudo/9978/o-uso-dos-dados-agregados-da-ecd-na-auditoria-contabil-tributaria. Acesso em: 11 out. 2025.
Xu, C.; Kong, Y. 2024. Random forest model in tax risk identification of real estate enterprise income tax. PLOS ONE 19(3): e0300928.
Yang, L. 2025. Predictive modeling of tax compliance risks: a comparative study of machine learning approaches. PLOS ONE 20(9): e0331715.
Artículo originario del Trabajo de Conclusión de Curso de la Especialización en Data Science y Analytics del MBA USP/Esalq
Para saber más sobre el curso, haga clic aquí y acceda a la plataforma MBX Academy