Innovación
10 de diciembre de 2025
Modelos de aprendizaje automático para clasificación fiscal a partir de descripciones textuales
Autor: Luis Felipe Dalle Molle — Asesor: Vinicius Rocha Bíscaro
Resumen elaborado por la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege orientada a la síntesis y redacción.
Este estudio desarrolló y evaluó modelos de aprendizaje automático para la clasificación automática de códigos de la Nomenclatura Común del Mercosur (NCM) a partir de descripciones de productos de informática. La investigación comparó la eficacia de los algoritmos Naive Bayes, Random Forest y Support Vector Machine (SVM) en un conjunto de datos real de una empresa del sector. El objetivo era crear una solución computacional para mitigar los riesgos de la clasificación fiscal manual, que presentaba una tasa de error de aproximadamente 10%, y optimizar la eficiencia operativa. La investigación buscó validar la aplicabilidad técnica de las herramientas y cuantificar la ganancia de rendimiento en relación con el proceso humano, proporcionando una base empírica para la automatización de tareas tributarias.
La clasificación fiscal de mercancías es fundamental para la conformidad tributaria y la competitividad empresarial. La correcta atribución del código NCM determina las alícuotas de impuestos como el Impuesto sobre Productos Industrializados (IPI), PIS/Pasep y COFINS. Errores en este proceso pueden resultar en multas, pérdida de beneficios fiscales y retrabajo administrativo. Además del impacto financiero, la imprecisión genera cuellos de botella operacionales, como la retención de mercancías en el despacho aduanero, causando retrasos en la cadena de suministro. La complejidad tributaria y las constantes actualizaciones normativas hacen que el proceso manual sea susceptible a fallas, justificando la búsqueda de soluciones automatizadas que ofrezcan mayor precisión y agilidad.
El sistema de clasificación NCM es un código de ocho dígitos basado en el Sistema Armonizado de Designación y Codificación de Mercancías (SA), un estándar internacional de seis dígitos adoptado por más de 200 países (Organización Mundial de Aduanas, 2025). El Mercosur añadió dos dígitos para mayor detalle, resultando en más de diez mil clasificaciones posibles (Ministerio de Hacienda, 2019). Esta granularidad aumenta la complejidad de la tarea, exigiendo profundo conocimiento técnico del producto y de la legislación. La descripción textual de la mercancía complementa el código, siendo esencial para la transparencia y conformidad del proceso.
Para la industria informática, la clasificación fiscal es estratégica. El gobierno brasileño, a través de organismos como el Ministerio de Ciencia, Tecnología e Innovación (MCTI), concede beneficios fiscales vinculados a una lista específica de códigos NCM. Un error en la clasificación puede descalificar a la empresa para el beneficio, impactando directamente su estructura de costos y competitividad. En este contexto, la precisión en la asignación de la NCM es un factor determinante para la viabilidad económica de las operaciones en el sector tecnológico.
La literatura académica demuestra el éxito del aprendizaje automático en tareas de clasificación de texto. Algoritmos como Support Vector Machine, Naive Bayes y Random Forest, combinados con la representación textual Term Frequency-Inverse Document Frequency (TF-IDF), presentan un rendimiento robusto en la categorización de productos (Altaheri & Shaalan, 2020). Investigaciones recientes han evolucionado hacia modelos como grandes modelos de lenguaje (LLMs) para clasificación fiscal (Marra de Artiñano et al., 2023) y enfoques multimodales que incluyen imágenes (Amel et al., 2024). Sin embargo, existe una brecha en la literatura sobre la aplicación de estas técnicas al sistema NCM brasileño, campo que este estudio pretende llenar al analizar la eficacia de modelos supervisados clásicos.
La metodología siguió un flujo de trabajo de Procesamiento del Lenguaje Natural (PLN). El punto de partida fue un conjunto de datos de una empresa de informática de São Paulo, con registros de 2018 a 2023. La base original contenía 4.601 observaciones, de las cuales se seleccionaron la descripción larga, la descripción corta, la descripción de ingeniería (todas en inglés) y el código NCM. El proceso se estructuró en cuatro etapas: preparación de los datos, preprocesamiento textual, vectorización y modelado.
La preparación de los datos incluyó la eliminación de filas duplicadas, datos faltantes y registros con NCMs inválidos. Para abordar el desequilibrio de clases, se excluyeron todas las clases de NCM con menos de cuatro ocurrencias, mitigando el riesgo de sesgo por clases raras (Zhang & Wallace, 2017). Después del filtrado, los tres campos de descripción textual se concatenaron en una única variable, denominada All_Desc, para consolidar la información descriptiva de cada producto.
El preprocesamiento textual se aplicó a la variable All_Desc para normalizar el texto y centrarse en los términos más informativos. Los pasos incluyeron la conversión a minúsculas, la eliminación de caracteres especiales y signos de puntuación, la eliminación de stopwords (palabras comunes sin valor semántico para la clasificación) y la aplicación de stemming para reducir las palabras a sus raíces morfológicas. Estas transformaciones son fundamentales para crear un vocabulario limpio y eficiente, mejorando el rendimiento de los algoritmos (Aggarwal & Zhai, 2012).
Para que los algoritmos procesaran el texto, las descripciones se convirtieron en vectores numéricos. Se utilizó el modelo Bag-of-Words (BoW), que representa cada texto como un vector de frecuencia de términos (McTear et al., 2016). Esta representación se refinó con el esquema de ponderación TF-IDF, que asigna mayor peso a palabras frecuentes en un documento específico, pero raras en el corpus general, destacando términos discriminatorios (Salton & Buckley, 1988).
Se probaron dos configuraciones de vectorización: unigramas (palabras individuales) y bigramas (pares de palabras consecutivas). El modelado se realizó con los algoritmos Naive Bayes, Random Forest y SVM. El conjunto de datos se dividió en 80% para entrenamiento y 20% para prueba, con muestreo estratificado. La optimización de hiperparámetros se realizó con GridSearchCV (Pedregosa et al., 2011), y la evaluación final se basó en métricas como precisión, exactitud, recall y F1-Score (Fávero et al., 2017).
La base de datos final contenía 4.279 observaciones y 50 clases de NCM. El análisis exploratorio reveló una distribución de frecuencia desigual entre las clases. La NCM 8471.30.19, correspondiente a “máquinas automáticas de procesamiento de datos portátiles”, fue una de las más representativas, lo que es consistente con el portafolio de la empresa. El análisis de frecuencia de palabras dentro de esa clase mostró una fuerte asociación con términos como “notebook”, “intel” y “laptop”, indicando la presencia de patrones textuales explorables por los modelos.
La evaluación comparativa probó el impacto de la representación textual (unigramas vs. bigramas) y del algoritmo (Naive Bayes, Random Forest y SVM). La hipótesis era que los bigramas mejorarían el rendimiento al capturar términos técnicos compuestos (Jurafsky & Martin, 2023). Los algoritmos fueron elegidos por sus enfoques distintos: Naive Bayes, un modelo probabilístico eficiente para datos dispersos (McCallum & Nigam, 1998); Random Forest, un método de ensemble que modela relaciones complejas (Breiman, 2001); y Support Vector Machine, un clasificador robusto para tareas de clasificación de texto de alta dimensionalidad (Cortes & Vapnik, 1995).
Los resultados cuantitativos confirmaron la superioridad del modelo Support Vector Machine combinado con la representación de texto en bigramas ponderados por TF-IDF. Este modelo alcanzó una precisión global del 96% y un F1-Score ponderado del 95,8%. El modelo SVM con unigramas también tuvo un buen desempeño, con un 95,5% de precisión. En comparación, el Random Forest alcanzó un 94,5% de precisión con bigramas, mientras que el Naive Bayes obtuvo un 92,8% en la misma configuración.
El rendimiento superior del SVM con bigramas puede explicarse por dos factores. Primero, la capacidad de los bigramas para capturar expresiones técnicas como “hard drive” o “power supply” proporcionó al modelo características más ricas y contextuales. Segundo, la naturaleza del algoritmo SVM, que busca el hiperplano de separación óptimo con margen máximo, es adecuada para datos de alta dimensionalidad y dispersos como las representaciones TF-IDF, permitiendo una buena generalización y evitando el sobreajuste (Cortes & Vapnik, 1995).
Se realizó un análisis detallado por clase para asegurar que el rendimiento global no enmascarara fallos en categorías específicas. El modelo SVM mantuvo métricas elevadas de precisión, recall y F1-Score incluso para clases con pocas muestras. Las clases mayoritarias, como la de portátiles, presentaron un F1-Score del 99%, pero muchas clases menos frecuentes también superaron el 90%. La matriz de confusión corroboró estos hallazgos, mostrando que la mayoría de las predicciones se concentraban en la diagonal principal, con pocas confusiones entre clases. Esta consistencia multiclase es fundamental para garantizar la fiabilidad del modelo en toda la cartera de productos.
La principal implicación de los resultados es su aplicación práctica. El rendimiento del modelo SVM, con una tasa de error de aproximadamente el 4% (inferida de la precisión del 96%), representa una mejora drástica en comparación con la tasa de error del 10% del proceso manual. Esta reducción de más del 50% en el riesgo de errores de clasificación tiene un impacto directo en la salud financiera y operativa de la empresa. La automatización minimiza la probabilidad de multas fiscales y la pérdida de beneficios, además de liberar al equipo fiscal de una tarea repetitiva. El tiempo ahorrado puede ser reasignado a actividades de mayor valor agregado, como la planificación tributaria estratégica. La consistencia del modelo también elimina la variabilidad del juicio humano, fortaleciendo la gobernanza de datos.
La robustez del modelo final demuestra que el aprendizaje automático es una herramienta poderosa para afrontar la complejidad tributaria brasileña. La capacidad de transformar descripciones textuales en clasificaciones fiscales precisas y automatizadas ofrece un diferencial competitivo, permitiendo que la empresa opere con mayor seguridad jurídica y agilidad. La investigación proporciona un caso de negocio convincente para la adopción de innovación tecnológica en el área fiscal.
Este trabajo demostró la concepción y validación de un sistema de clasificación fiscal automatizado. Partiendo de un problema de negocio concreto —la alta tasa de errores en la clasificación manual de NCMs—, se aplicó una metodología de ciencia de datos para desarrollar una solución eficaz. Los resultados confirmaron que algoritmos clásicos de aprendizaje automático superan el rendimiento humano en tareas de clasificación textual complejas. El modelo Support Vector Machine con vectorización TF-IDF en bigramas emergió como el enfoque más performático, con un 96% de acurácia.
La contribución de este estudio es práctica, al ofrecer una herramienta para reducir riesgos fiscales y aumentar la eficiencia, y académica, al llenar un vacío en la aplicación de NLP al sistema NCM, proporcionando un benchmark para investigaciones futuras. Como próximos pasos, se sugiere la exploración de técnicas de balanceo de clases, como SMOTE, y la experimentación con modelos basados en embeddings contextuales, como BERT. Un estudio futuro podría cuantificar el retorno de la inversión (ROI) de la implementación de la solución.
La investigación realizada demostró que la aplicación de modelos de aprendizaje automático, específicamente el Support Vector Machine con vectorización TF-IDF en bigramas, es un enfoque eficaz para la clasificación fiscal automática de productos de informática, superando significativamente la precisión del proceso manual.
Referencias
AGGARWAL, Charu C.; ZHAI, Chengxiang. Mining Text Data. Springer, 2012.
ALTÁHERI, H.; SHAALAN, K. Automatic Classification of Customs Commodity Codes Using Machine Learning. International Journal of Advanced Computer Science and Applications (IJACSA), v. 11, n. 7, p. 441-447, 2020.
AMEL, A. et al. HSCodeNet: Multi-Modal Prediction of Harmonized System Codes. arXiv preprint, 2024. Disponible en: <https://arxiv. org/abs/2406.04349>. Acceso en: 22 sep. 2025.
BREIMAN, Leo. Random Forests. Machine Learning, v. 45, n. 1, p. 5-32, 2001. Disponible en: <https://www. stat. berkeley. edu/~breiman/randomforest2001. pdf>. Acceso en: 12 sep. 2025.
CORTES, C.; VAPNIK, V. Support-vector networks. Machine Learning, v. 20, p. 273–297, 1995. Disponible en: <https://link. springer. com/article/10.1007/BF00994018>. Acceso en: 12 sep. 2025.
FÁVERO, L. P.; BELFIORE, P.; SILVA, F. L.; CHAN, B. Y. Manual de Análise de Dados: Estatística e Modelagem Multivariada com Excel®, SPSS® e Stata®. 2. ed. Rio de Janeiro: Elsevier, 2017.
FAZCOMEX Tecnologia para Comércio Exterior LTDA. Consulta NCM. 2025. Disponible en: <https://www. fazcomex. com. br/ncm/>. Acceso en: 12 sep. 2025.
JURAFSKY, D.; MARTIN, J. H. Speech and Language Processing. 3. ed. (draft). 2023. Disponible en: <https://web. stanford. edu/~jurafsky/slp3/>. Acceso en: 10 sep. 2025.
MARRA DE ARTIÑANO, I. et al. Classifying Goods with Machine Learning and Large Language Models. Proceedings of the 7th International Conference on Natural Language Processing and Information Retrieval (NLPIR), Tokyo, Japan, 2023.
MCCALLUM, A.; NIGAM, K. A comparison of event models for Naive Bayes text classification. AAAI-98 Workshop on Learning for Text Categorization, 1998.
MCTEAR, M.; CALLEJAS, Z.; GRIOL, D. Conversational Interfaces: Talking to Smart Devices. Springer International Publishing, 2016.
MINISTÉRIO DA FAZENDA. NCM. 2019. Disponible en: <https://www. gov. br/receitafederal/pt-br/assuntos/aduana-e-comercio-exterior/classificacao-fiscal-de-mercadorias/ncm>. Acceso en: 20 mar. 2025.
PEDREGOSA, F. et al. Scikit-learn: Machine Learning in Python. Journal of Machine Learning Research, v. 12, p. 2825–2830, 2011. Disponible en: <https://jmlr. org/papers/v12/pedregosa11a. html>. Acceso en: 12 sep. 2025.
SALTON, Gerard; BUCKLEY, Christopher. Term-weighting approaches in automatic text retrieval. Information Processing & Management, v. 24, n. 5, p. 513–523, 1988.
WORLDS CUSTOMS ORGANIZATION. Worlds Customs Organization – Official Web Page. Disponible en: <https://www. wcoomd. org/>. Acceso en: 20 mar. 2025.
ZHANG, Y.; WALLACE, B. A sensitivity analysis of (and practitioners’ guide to) convolutional neural networks for sentence classification. Cornell University, 2016.
Resumen ejecutivo del Trabajo de Conclusión de Curso de Especialización en Data Science & Analytics del MBA USP/Esalq
Más información sobre el curso; haga clic aquí: