Artículo

07 de octubre de 2026

Detección No Supervisada de Anomalías Comportamentales en Accesos Corporativos a Datos Sensibles

Detección No Supervisada de Anomalías de Comportamiento en Accesos Corporativos a Datos Sensibles

Jeferson Belinello da Silveira; Christian Duarte Caldeira

DOI: 10.22167/2675-6528-202603031

Artículo derivado de Trabajo de Fin de Curso (TCC), con contenido basado en el trabajo original del estudiante y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, una solución de inteligencia artificial desarrollada por el Instituto Pecege para la síntesis y organización textual.

Resumen

La digitalización de los procesos corporativos ha ampliado la exposición a amenazas internas, donde los colaboradores con acceso legítimo a los sistemas violan las políticas de seguridad. Partiendo de teorías conductuales del fraude, se investigó la identificación proactiva de estas amenazas. El objetivo fue proponer y evaluar un sistema de detección de anomalías estructurado en Análisis de Redes Sociales (SNA), comparando la eficacia de los algoritmos no supervisados Isolation Forest (IF) y Local Outlier Factor (LOF) en la identificación de patrones de acceso atípicos en una base de datos estocástica simulada. Para ello, se utilizó un dataset de aproximadamente 1 millón de logs, generado estocásticamente, que modeló perfiles probabilísticos con superposición de ruidos y accesos legítimos. La metodología implicó la modelización de las interacciones entre empleados y clientes como un grafo bipartito ponderado por riesgo, y se aplicaron IF y LOF sobre métricas topológicas de la red y puntuaciones de riesgo forense. Los resultados demostraron la superioridad del modelo LOF que, al enfocarse en la densidad local, rompió el camuflaje de las anomalías y alcanzó una media de Recall del 81,3% en múltiples simulaciones, superando el rendimiento del Isolation Forest (media de Recall del 56%). La solución demostró ser un enfoque viable y escalable para reforzar la ‘percepción de detección’, proporcionando a los gestores una base de accesos de alto riesgo para priorizar investigaciones precisas, en estricta conformidad con la LGPD.

Palabras clave: Análisis de Redes Sociales; Detección de anomalías; Fraude interna; LGPD; Machine Learning.

1. Introducción

La digitalización de los procesos corporativos, aunque ha impulsado la eficiencia operativa, ha ampliado significativamente la exposición de las organizaciones a amenazas internas. Estas amenazas se caracterizan por colaboradores que, al poseer acceso legítimo a los sistemas, violan las políticas de seguridad. El Informe de Investigaciones de Violación de Datos de Verizon (2023) destaca que aproximadamente el 74% de todos los incidentes de seguridad involucran el elemento humano. A diferencia de los ciberataques externos, que necesitan romper barreras de infraestructura, el riesgo interno es insidioso, ya que el agente malicioso opera dentro del perímetro de seguridad con credenciales válidas. La Association of Certified Fraud Examiners (ACFE, 2024) describe el “fraude ocupacional” como el uso de la posición profesional para enriquecimiento personal, actuando como un factor de corrosión silenciosa en las organizaciones (Pinheiro y Silva Cunha, 2003). El impacto financiero es sustancial, con pérdidas medias estimadas en el cinco por ciento de los ingresos anuales de las empresas, y el informe global de la ACFE (2024) registró, en 1.921 casos reales analizados, perjuicios superiores a 3,1 mil millones de dólares, con un perjuicio mediano de 145.000 dólares por incidente.

En el contexto brasileño, la materialidad de este riesgo se evidencia frecuentemente a través de operaciones de la Policía Federal (PF). En 2025, investigaciones revelaron esquemas estructurados de malversación digital operados por empleados con credenciales activas en instituciones como la Caixa Econômica Federal (Polícia Federal, 2025a; 2025c; 2025d). Solo en estos casos locales, el perjuicio directo causado por colaboradores supera los 4,6 millones de reales. Estos episodios, que ocurren de forma sistémica en diversas regiones del país (Polícia Federal, 2025b), demuestran que la confianza incondicional en los colaboradores no es una política de seguridad viable, reforzando la urgencia y la relevancia financiera del tema. La complejidad y materialidad de este riesgo evolucionan en paralelo a las transformaciones estructurales del mercado y de la sociedad. La creciente digitalización y la expansión del acceso a servicios en el escenario financiero brasileño, según el Banco Central de Brasil (2025), aumentaron el volumen de interacciones y el tráfico de datos sensibles. Este fenómeno, sumado a cambios demográficos como el envejecimiento poblacional (IBGE, 2024), diversifica la base de usuarios y exige soluciones adaptativas y escalables, ya que los métodos tradicionales de auditoría pierden eficacia ante la alta volumetría y la exposición prolongada de datos.

Para el diseño de sistemas de monitoreo eficaces, es fundamental distinguir las anomalías generadas por errores (descuido o falla de proceso) de aquellas generadas por fraudes. La ACFE (2024) define fraude como el uso deliberado de la posición profesional para obtener ganancias propias o enriquecimiento ilícito, resultando en lesión a los recursos de la institución. La comprensión etiológica de este comportamiento se basa históricamente en el Triángulo del Fraude, que postula la ocurrencia del ilícito por la convergencia simultánea de tres factores: presión, oportunidad y racionalización (Borba y Maragno, 2017). Sin embargo, en el contexto de accesos corporativos a bases de datos complejas, la literatura ha evolucionado hacia el modelo del Diamante del Fraude (Boldt, 2025), que añade un cuarto elemento decisivo: la capacidad técnica, donde el agente malicioso explota sus habilidades y conocimiento de los sistemas para extraer datos sin ser detectado.

Este riesgo, especialmente en el sector bancario, se ve agravado por las exigencias de la Ley General de Protección de Datos (LGPD) (Brasil, 2018). El acceso no motivado de un empleado a registros, extractos o historiales financieros de clientes, incluso sin desvío financiero inmediato, configura un incidente de seguridad y violación de la privacidad. Tradicionalmente, las instituciones utilizan auditorías por muestreo y sistemas basados en reglas determinísticas, que disparan alertas solo al sobrepasar límites volumétricos. Sin embargo, como demuestran Chandola, Banerjee y Kumar (2009), los defraudadores modernos diluyen sus accesos indebidos en comportamientos aparentemente normales, haciendo que los sistemas estáticos sean ineficaces en la detección del “fraude camuflado” y generando muchos falsos positivos. Es en este escenario que la Inteligencia Artificial, específicamente modelos de Machine Learning No Supervisado (Goldstein y Uchida, 2016), se vuelve crucial, ya que el secreto bancario restringe el uso de bases reales con fraudes etiquetados (Lerner y Flach, 2024), haciendo de las simulaciones estocásticas una vía científica y ética. El uso de Grafos y Análisis de Redes Sociales (SNA) permite evaluar el riesgo de las interacciones empleado-cliente (Akoglu, Tong y Koutra, 2015), y la implementación de IA en el combate al fraude interno tiene como objetivo instigar una fuerte “percepción de detección” (ACFE, 2024), actuando como mecanismo de control preventivo.

Ante la complejidad y materialidad de las amenazas internas, y la ineficacia de los enfoques tradicionales, se justifica la necesidad de desarrollar y evaluar sistemas predictivos de detección de anomalías. Así, el presente trabajo tiene como objetivo proponer y evaluar un sistema de detección de anomalías estructurado en Análisis de Redes Sociales (SNA), analizando y comparando la eficacia de los algoritmos no supervisados Isolation Forest (IF) y Local Outlier Factor (LOF) en la identificación de patrones de acceso atípicos en una base de datos estocástica simulada.

2. Material y Métodos

El presente estudio se caracterizó como una investigación aplicada de enfoque cuantitativo (Gil, 2008; Richardson, 1999). Tuvo como objetivo proponer y evaluar un sistema de detección de anomalías conductuales en accesos corporativos a datos sensibles, empleando técnicas de Machine Learning No Supervisado. La elección de este enfoque se debió a la restricción de acceso a bases de datos reales con fraudes etiquetados, en observancia al secreto bancario y a la Ley General de Protección de Datos (LGPD) (Lerner y Flach, 2024).

Para superar la escasez de datos reales y asegurar la reproducibilidad, se construyó una base de datos sintética estocástica, totalizando aproximadamente 1 millón de registros de log. Esta simulación modeló perfiles probabilísticos de comportamiento legítimo con ruido, fraude camuflada y fraude volumétrica. Se empleó una semilla aleatoria fija (random seed = 77) para garantizar la determinística de las distribuciones y la replicación exacta. El dataset simulado comprendió 1.000 empleados, 47.980 clientes y 990.570 registros de acceso.

La estructura de datos se organizó en tres bases interconectadas: Empleados (`id_empleado`, `id_sucursal`), Clientes (`id_cliente`, `id_sucursal_agencia`, `estado_cuenta`) y Registros de Acceso (`id_empleado`, `id_cliente`, `timestamp_acceso`, `fraude_simulado`). La variable `fraude_simulado` no se utilizó durante el entrenamiento, sirviendo como Ground Truth para la validación. La parametrización comportamental de la simulación estocástica estableció tres perfiles con superposición: legítimo con ruido (98,5% de la base), fraude camuflado y fraude volumétrico. Quince empleados fueron calibrados como defraudadores, divididos en tácticas de Exploradores, Necros y Reactivadores.

Los metadatos temporales (`timestamps de los logs`) emularon el horario comercial, con el 96% de los accesos concentrados entre las 08:00 y las 17:59, y el 4% distribuido como accesos atípicos. La metodología adoptó el Análisis de Redes Sociales (SNA), fundamentado en la Teoría de Grafos, para modelar las interacciones entre empleados y clientes (Akoglu, Tong y Koutra, 2015). Empleados y clientes fueron representados como “Nodos”, y los registros de acceso como “Aristas” en un grafo bipartito ponderado. Para extraer atributos topológicos, se utilizaron el Grado Ponderado y el PageRank (Page et al., 1999).

Para mitigar la “Paradoja del Volumen” y la “ceguera semántica” del PageRank en redes heterogéneas, se implementó una Ingeniería de Atributos basada en una Heurística de Puntuación Forense Ponderada. Se asignaron pesos exponenciales a los accesos según la criticidad: cuentas de clientes fallecidos recibieron peso 10; cuentas inactivas y accesos cross-filial recibieron peso 5; y accesos regulares recibieron pesos fraccionarios (0,3 y 0,5). Las variables derivadas incluyeron `total_acessos`, `v_fal`, `v_ina`, `v_cro` y la `Puntuación Total` (suma de las volumetrías multiplicada por los pesos de negocio).

Para la detección de anomalías, se comparó el rendimiento de dos algoritmos no supervisados: Isolation Forest (IF) (Liu, Ting y Zhou, 2008) y Local Outlier Factor (LOF) (Breunig et al., 2000). El IF se centra en el aislamiento de anomalías globales, mientras que el LOF adopta un enfoque basado en la densidad local, sensible a desviaciones de comportamiento camufladas (Chandola, Banerjee y Kumar, 2009). El hiperparámetro de contaminación se ajustó al 1,5%. No se realizó la división tradicional de los datos en entrenamiento y prueba, y los algoritmos operaron en un escenario “ciego” (zero-shot learning).

Para evaluar la capacidad de generalización, se realizó una validación cruzada a través de múltiples simulaciones (Monte Carlo). La semilla estocástica del generador de datos se modificó secuencialmente, creando cinco escenarios independientes, cada uno generando una nueva topología de red. El desarrollo computacional se realizó en Python, utilizando la biblioteca NetworkX para la modelización de grafos y scikit-learn para los algoritmos de Machine Learning. Se emplearon Modelos de Lenguaje a Gran Escala (LLMs) como soporte computacional para la estructuración y optimización de código, en conformidad con el Manual de Buenas Prácticas (Pecege, 2025).

3. Resultados y Discusión

La investigación de patrones de acceso atípicos en entornos corporativos sensibles reveló insights cruciales sobre la eficacia de algoritmos de detección de anomalías no supervisados. Los resultados obtenidos a partir de una base de datos estocástica simulada, con aproximadamente 1 millón de registros, permitieron validar la metodología propuesta y comparar el rendimiento del Isolation Forest (IF) y del Local Outlier Factor (LOF). El estudio demostró que la modelización de las interacciones como un grafo bipartito, ponderado por riesgo, aliada a una arquitectura híbrida de Machine Learning, es un enfoque prometedor para identificar amenazas internas camufladas, superando las limitaciones de las metodologías tradicionales basadas en reglas determinísticas y volumetría simple.

El análisis exploratorio de datos (AED) fue fundamental para comprender la complejidad del entorno simulado y validar la representatividad de las anomalías insertadas. El histograma de la métrica de Grado Ponderado, por ejemplo, evidenció una concentración de empleados legítimos en puntuaciones de riesgo más bajas, mientras que el box-plot demostró que la aplicación de puntuaciones forenses elevó la mediana de riesgo para los perfiles fraudulentos. Esta distinción inicial, sin embargo, no se tradujo en una separabilidad lineal obvia, confirmando la necesidad de enfoques más sofisticados para la detección.

La matriz de correlación de las variables derivadas reveló altas correlaciones entre atributos volumétricos, como el Total de Accesos y la Puntuación Total, lo cual era esperado debido a la derivación algebraica de la puntuación de riesgo a partir de la volumetría y pesos forenses. Sin embargo, la métrica topológica PageRank mantuvo una correlación sustancialmente más baja con las métricas de volumen absoluto. Este hallazgo es crucial, ya que la introducción de una variable topológica no lineal, como el PageRank, fue diseñada para romper el determinismo y permitir que los modelos de Machine Learning diferenciaran a un empleado con alto volumen de trabajo legítimo de un defraudador camuflado, abordando lo que se denominó “Paradoja del Volumen”.

El gráfico de dispersión, o scatter plot, ilustró visualmente la premisa central del estudio: la superposición comportamental. Al cruzar el PageRank con el Grado Ponderado, se observó una densa superposición espacial entre las acciones atípicas de los empleados legítimos (ruido) y las de los defraudadores. Esta representación confirmó que las fronteras de decisión lineales, típicas de sistemas estáticos basados en reglas, serían ineficaces para separar las clases de riesgo. La dispersión y superposición de los datos justificaron estadísticamente la adopción de algoritmos no supervisados, capaces de interpretar anomalías de densidad local, según lo destacado por Chandola, Banerjee y Kumar (2009).

La etapa de procesamiento topológico y visualización de la red (SNA) validó la escalabilidad del modelado por grafos. La red bipartita, compuesta por 48.980 nodos (empleados y clientes) y alrededor de 990 mil registros de interacción consolidados en aristas ponderadas, se instanció con éxito en memoria. La extracción de métricas topológicas, como Grado Ponderado y PageRank, demostró ser computacionalmente viable, permitiendo la evaluación de la influencia de riesgo de cada colaborador basándose en el peso de las conexiones y la centralidad atípica de las interacciones.

Sin embargo, se reconoció que el PageRank tradicional tiene limitaciones en redes heterogéneas, sufriendo de “ceguera semántica” al no diferenciar la naturaleza cualitativa de los nodos o el riesgo de negocio asociado a las conexiones. Para mitigar esta limitación y adecuar el modelo a la realidad de la auditoría forense, se adoptó una arquitectura híbrida. La puntuación de PageRank se utilizó como una variable topológica dentro de un espacio multidimensional, concatenada con una Puntuación Forense ponderada que asigna pesos específicos basados en el riesgo regulatorio y el estado de la cuenta del cliente. Este enfoque permitió una detección de anomalías altamente contextualizada, cruzando la centralidad estructural con la gravedad jurídica de los accesos.

En la comparativa de rendimiento de los modelos no supervisados, el algoritmo Isolation Forest (IF), parametrizado con 2.000 estimadores, obtuvo un Recall de 0,60, Precision de 0,60 y F1-Score de 0,60. Aunque el IF aisló perfiles con anomalías globales extremas, generando seis falsos positivos, falló en identificar al 40% de los defraudadores más cautelosos. Este resultado sugiere que, al centrarse en el aislamiento global, el IF puede tener dificultades para detectar fraudes que se camuflan en el comportamiento normal, según la teoría del Diamante del Fraude (Boldt, 2025) que enfatiza la capacidad del defraudador de explotar el conocimiento de los sistemas para evitar la detección.

En contrapartida, el modelo Local Outlier Factor (LOF), utilizando la distancia de Manhattan y evaluando los 25 vecinos más cercanos, demostró un rendimiento significativamente superior. El LOF alcanzó un Recall de 0,80, Precision de 0,80 y un F1-Score de 0,80. El análisis detallado reveló que el LOF logró capturar a doce de los quince defraudadores simulados, con solo tres falsos positivos entre las quince alertas generadas, resultando en una Precision del 80%. Este rendimiento indica que el LOF, al centrarse en la densidad local, fue más eficaz para romper el camuflaje de las anomalías, que se manifiestan como desviaciones con respecto a la vecindad topológica inmediata, y no necesariamente como anomalías globales.

La superioridad del LOF se atribuye a su capacidad para identificar desviaciones de comportamiento novedosas de carácter local, que a menudo se confunden con actividades lícitas, superando las tácticas de evasión conocidas como “Low and Slow Attacks” (Chandola, Banerjee y Kumar, 2009). Esta característica es particularmente relevante en escenarios de fraude interna, donde los agentes maliciosos buscan diluir sus acciones indebidas en un volumen masivo de transacciones legítimas. La capacidad del LOF para centrarse en la densidad local ha permitido que el modelo rompa este camuflaje, identificando patrones de acceso atípicos que el Isolation Forest no pudo aislar con la misma eficacia.

Para consolidar el análisis comparativo y evaluar la capacidad de generalización de los modelos, se realizó una validación cruzada mediante múltiples simulaciones de Monte Carlo. Al alterar secuencialmente la semilla estocástica del generador de datos, se crearon cinco escenarios independientes, cada uno con una nueva topología de red y distribución de ruido operativo y agentes maliciosos. Este enfoque mitigó el sesgo de una muestra única y probó la robustez de los algoritmos en diferentes condiciones.

Los resultados de la validación cruzada confirmaron la robustez de la arquitectura basada en la densidad local del LOF. El modelo presentó un Recall medio del 81,3% en la detección de la clase Fraude, alcanzando picos del 86,6% de identificación correcta de las amenazas ocultas en la mayoría de los escenarios. En contraste, el Isolation Forest demostró alta sensibilidad a las variaciones de la red, con su eficacia cayendo a menos del 50% en el Escenario 1 y estancándose en una media general del 56%. Este distanciamiento en las métricas de rendimiento refleja las limitaciones teóricas de los algoritmos basados en volumen, que se centran en anomalías globales y permiten la evasión de fraudes oportunistas.

Alcanzar una tasa media de detección (Recall) superior al 81% en un escenario con extremo desequilibrio de clases (solo 1,5% de anomalías) reviste una particular relevancia científica y operativa. En la literatura de Machine Learning aplicada a la auditoría, la evaluación del rendimiento de algoritmos estrictamente no supervisados es desafiante, ya que no poseen conocimiento previo de las etiquetas durante la fase de entrenamiento (Goldstein y Uchida, 2016). El hecho de que el modelo LOF, anclado en la topología de grafos, haya sostenido este alto rendimiento a lo largo de la validación cruzada demuestra un nivel de eficacia altamente competitivo en relación con los estándares académicos de la detección de anomalías puntuales.

Desde el punto de vista práctico y de negocio, este resultado resuelve la necesidad delineada en la introducción del estudio. La alta tasa de captura, aliada a un bajo índice de alarmas falsas, se traduce en una herramienta de cribado forense prometedora. En un entorno corporativo real, regido por los rigores de la LGPD (Brasil, 2018), esta asertividad optimiza los esfuerzos de investigación del equipo humano y evita la fricción organizacional de falsas acusaciones contra empleados de alta productividad. Este nivel de precisión cumple el objetivo de crear una fuerte “percepción de detección” (ACFE, 2024), disuadiendo amenazas internas sin sobrecargar operativamente los sistemas de respuesta a incidentes de la institución.

Una ventaja estratégica de esta arquitectura basada en el Análisis de Redes Sociales (SNA) reside en su extrema parametrización y flexibilidad arquitectónica. Al modelar las interacciones de acceso como un grafo ponderado, el sistema permite la asignación de “pesos” dinámicos a las aristas, calibrados según características granulares de las operaciones, como el horario, el volumen o el estado de la cuenta, y la sensibilidad de los datos del cliente. Esta plasticidad metodológica refleja el estado del arte en la transición de los sistemas estáticos de ciberseguridad a arquitecturas orientadas a datos (Mahajan, 2024).

A diferencia de los sistemas obsoletos basados en reglas volumétricas, la solución basada en Machine Learning es inherentemente autoajustable, actuando en tiempo real para verificar señales continuas de cambios de comportamiento (Soares, 2020). Si las tipologías de fraude evolucionan, la institución no necesita reestructurar los algoritmos centrales; basta con ajustar la función de ponderación del grafo. Esta capacidad de adaptación garantiza un mecanismo de mejora continua, permitiendo que la “percepción de detección” evolucione en simetría con la sofisticación de las amenazas, culminando en un sistema forense inteligente, dinámico y estrictamente alineado con los requisitos de privacidad de la LGPD.

En resumen, los resultados de esta investigación confirman que la detección proactiva de anomalías de comportamiento en accesos corporativos a datos sensibles es viable y eficaz a través de un enfoque híbrido que integra Análisis de Redes Sociales y algoritmos de Machine Learning no supervisados. La superioridad del Local Outlier Factor en la identificación de fraudes camufladas, aliada a la robustez demostrada en múltiples simulaciones, ofrece una herramienta poderosa para reforzar la seguridad interna, optimizar investigaciones y garantizar la conformidad con las regulaciones de protección de datos, respondiendo directamente al objetivo de proponer y evaluar un sistema de detección de anomalías.

4. Conclusión

El presente estudio buscó proponer y evaluar un sistema de detección de anomalías estructurado en Análisis de Redes Sociales (SNA), comparando la eficacia de los algoritmos no supervisados Isolation Forest (IF) y Local Outlier Factor (LOF) en la identificación de patrones de acceso atípicos en una base de datos estocástica simulada. Se verificó que la digitalización de los procesos corporativos amplió la exposición a amenazas internas, donde colaboradores con acceso legítimo violan políticas de seguridad, y que métodos tradicionales de auditoría se mostraban ineficaces contra el fraude camuflado. La metodología involucró el modelado de las interacciones entre empleados y clientes como un grafo bipartito ponderado por riesgo, utilizando un dataset de aproximadamente 1 millón de logs generados estocásticamente para mimetizar comportamientos anómalos y ruidos operacionales. Los resultados demostraron la superioridad del modelo LOF que, al enfocar en la densidad local, rompió el camuflaje de las anomalías y alcanzó un Recall medio de 81,3% en múltiples simulaciones, superando el desempeño del Isolation Forest, que obtuvo un Recall medio de 56%. Esta aproximación híbrida, que concatenó métricas topológicas de la red con puntuaciones de riesgo forense, demostró ser crucial para contextualizar la detección y superar la “ceguera semántica” del PageRank tradicional, diferenciando accesos legítimos de alto volumen de acciones fraudulentas.

La principal contribución del estudio reside en la proposición de un enfoque viable y escalable para la detección proactiva de amenazas internas, reforzando la “percepción de detección” y proporcionando a los gestores una base de accesos de alto riesgo para priorizar investigaciones precisas, en estricta conformidad con la LGPD. La solución representa una transición de sistemas estáticos basados en reglas a arquitecturas auto-adaptables y orientadas a datos, capaces de evolucionar con las tipologías de fraude. Sin embargo, la investigación utilizó una base de datos estocástica simulada debido a las restricciones de secreto bancario y LGPD, lo que exige validación en entornos reales para una implementación completa. Para estudios futuros, se sugiere la implementación de un mecanismo de bucle de retroalimentación, donde los resultados de las investigaciones humanas sobre las alertas generadas retroalimentan el modelo, permitiendo que la inteligencia artificial ajuste continuamente su sensibilidad topológica y aprenda nuevos patrones de fraude, mitigando falsos positivos y adaptándose a la evolución de las amenazas.

Referencias Bibliográficas

Association of Certified Fraud Examiners [ACFE]. 2024. Fraude Ocupacional 2024: Um Relatório para as Nações. Disponível em: Relatório ACFE 2024 para as Nações. Acesso em: 20 set. 2025.

Pinheiro, G.J.; Silva Cunha, L.R. 2003. A importância da auditoria na detecção de fraudes. Contabilidade Vista & Revista 14(1): 31-47.

Polícia Federal. 2025a. PF prende em flagrante funcionário da Caixa por peculato digital no Rio de Janeiro. Disponível em: https://www.gov.br/pf/pt-br/assuntos/noticias/2025/09/pf-prende-em-flagrante-funcionario-da-caixa-por-peculato-digital-no-rio-de-janeiro. Acesso em: 11 out. 2025.

Polícia Federal. 2025c

Verizon. 2023. Relatório de Investigações de Violação de Dados de 2023: Visão geral do setor público. Disponível em: https://www.verizon.com/business/resources/Ta5a/reports/2023-dbir-public-sector-snapshot.pdf. Acesso em: 03 set. 2025.

Artículo originario del Trabajo de Conclusión de Curso de la Especialización en Data Science y Analytics del MBA USP/Esalq

Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy

También te puede interesar

07 de octubre de 2026

Gobernanza en procesos: reducción de retrabajo, tiempo y costo en el cierre contable

La gobernanza corporativa, aplicada a la gestión de procesos organizacionales, se ha asociado con la mejora del control, la conformidad y la eficiencia operativa. El estudio investigó cómo los mecanismos de gobernanza corporativa, combinados con automatizaciones, influyeron en la eficiencia operativa y la conformidad interna en procesos críticos de cierre mensual en una empresa del agronegocio. Se llevó a cabo un estudio de caso exploratorio y descriptivo, con un enfoque mixto, que combinó observación participante, análisis documental y de registros operativos de sistemas y controles internos. La unidad de análisis comprendió procesos críticos, seleccionados por volumen, riesgo operativo y relevancia para el cierre contable. Los resultados indicaron que la aplicación de mecanismos estructurales de gobernanza, como la definición de competencias, la segregación de funciones, la estandarización de rutinas y la implementación de flujos de trabajo estructurados, se asoció con la reducción del tiempo de ejecución, la disminución de retrabajos y una mayor trazabilidad de las actividades. Se observó, además, que la reorganización de los procesos contribuyó a la reducción de la necesidad de horas extras, lo que indica un potencial de reducción de los costos operativos asociados al cierre mensual. Los hallazgos demostraron que la gobernanza, cuando se incorpora al diseño y la ejecución de los procesos, actúa como un elemento estructurante de la operación, promoviendo la alineación entre control, ejecución y desempeño organizacional.

Palabras clave: Automatización; Control interno; Costo operativo; Eficiencia operativa; Procesos organizacionales.

07 de octubre de 2026

Gobernanza Regulatoria de Sustancias Químicas en el Contexto del Acuerdo UE-Mercosur: Desafíos y Oportunidades para Brasil

La gobernanza regulatoria de sustancias químicas ha experimentado transformaciones profundas, impulsadas por el modelo europeo REACH y la creciente relevancia de la agenda ESG (Environmental, Social, and Governance). Se analizaron los impactos de la implementación de la Ley nº 15.022/2024 (Brasil REACH) y las dinámicas del Acuerdo de Asociación UE-Mercosur en la competitividad de la industria química brasileña. La investigación adoptó un enfoque cualitativo, fundamentado en análisis documental y en una entrevista semiestructurada con un especialista del sector. Los resultados demostraron que, si bien el Brasil REACH representa un avance en la convergencia normativa con estándares internacionales, su eficacia se vio limitada por lagunas en la capacidad institucional y por la incertidumbre operativa de las agencias reguladoras. Se constató que recientes incertidumbres políticas y debates en el Parlamento Europeo elevaron el riesgo percibido, pero no interrumpieron el proceso de adaptación industrial, que ocurrió de forma proactiva para atender a las exigencias de acceso a mercados globales y financiaciones sostenibles. Se observó que el cumplimiento regulatorio de sustancias químicas pasó a ser percibido no solo como un centro de costos, sino como un activo estratégico de gobernanza, esencial para la resiliencia de las empresas en cadenas globales de valor.

Palabras clave: Barreras técnicas al comercio; Capacidad institucional; Convergencia normativa; Gobernanza socioambiental; Regulación de sustancias químicas.

07 de octubre de 2026

Buenas prácticas para el fortalecimiento de la confianza en el canal de ética

El canal de ética se ha consolidado como un mecanismo relevante para la identificación de irregularidades y desvíos de conducta en el ámbito organizacional. Sin embargo, a pesar de su incentivo y obligatoriedad normativa, se observó resistencia a su uso por parte de los stakeholders. El estudio tuvo como objetivo examinar las principales dificultades relacionadas con la implementación y operación del canal, así como identificar medidas capaces de mitigar estas barreras y fortalecer su credibilidad ante los públicos interno y externo. La investigación se desarrolló en dos etapas complementarias: una fase teórica, que analizó la doctrina especializada y la legislación brasileña aplicable, y una fase empírica, que consistió en la realización de entrevistas semiestructuradas con profesionales del área de Compliance. Los resultados permitieron identificar requisitos esenciales para el funcionamiento adecuado del canal y evidenciaron buenas prácticas, como comunicación institucional clara, capacitación continua, compromiso de la alta dirección, flujo estructurado de tratamiento, salvaguardas al denunciante, divulgación criteriosa de resultados y monitoreo permanente. Se constató que las debilidades más recurrentes se derivaron de factores predominantemente comunicacionales, susceptibles de mitigación por estrategias de aculturamiento consistentes y segmentadas. Se concluyó que la confianza en el canal de ética es estructurante para su eficacia, y las vulnerabilidades identificadas pueden ser sustancialmente mitigadas por comunicación estratégica, contribuyendo a una cultura de integridad que valora la transparencia y el tratamiento técnico de las irregularidades.

Palabras clave: Credibilidad; Denuncia; Integridad; Stakeholders; Whistleblower.

07 de octubre de 2026

Modelado predictivo para la priorización de inconsistencias fiscales a partir del balance de comprobación de la ECD

La creciente complejidad de las relaciones económicas y el elevado volumen de datos disponibles para la administración tributaria demandaron el desarrollo de herramientas más eficientes para la selección de contribuyentes sometidos a auditoría fiscal. En este contexto, se aplicaron modelos supervisados de aprendizaje automático, basándose en datos extraídos de la Escrituración Contable Digital (ECD), para priorizar empresas en un escenario de restricción de recursos humanos y de etiquetado incompleto. Para ello, se construyó un conjunto de datos compuesto por variables contables derivadas de la ECD y se aplicaron los modelos de Regresión Logística y Random Forest. La Regresión Logística se utilizó como referencia lineal, mientras que el Random Forest fue elegido por su capacidad de capturar relaciones no lineales e interacciones complejas entre variables estructuradas. Modelos de mayor complejidad, como redes neuronales, no fueron priorizados, considerándose la baja disponibilidad de ejemplos de la clase positiva y el objetivo de adoptar un enfoque parsimonioso y de fácil aplicación operativa. El rendimiento de los modelos se evaluó con enfoque en la capacidad de concentrar casos positivos en las primeras posiciones del ranking. Los resultados indicaron superioridad de los modelos basados en árboles, especialmente del Random Forest, en la priorización de los contribuyentes. Se observó, además, la identificación de patrones relevantes incluso en contexto de etiquetas imperfectas. Se concluyó que el enfoque propuesto presentó potencial para apoyar la selección de contribuyentes para auditoría y contribuir a la asignación más eficiente de recursos públicos.

Palabras clave: Análisis de riesgo; Aprendizaje supervisado; Datos contables; Priorización de auditorías; Selección de contribuyentes.

07 de octubre de 2026

Desafíos culturales en la implementación del presupuesto en una empresa familiar de tecnología

Se abordó la implementación del proceso presupuestario en una empresa familiar de tamaño mediano del sector tecnológico, en transición de un modelo de gestión informal a prácticas más estructuradas de planificación y control. El objetivo fue analizar los desafíos culturales enfrentados en este proceso, con énfasis en las percepciones, adaptaciones y transformaciones organizacionales. Se realizó una investigación cualitativa y descriptiva, a través de un estudio de caso único en una empresa de Santa Catarina con aproximadamente 600 colaboradores. La recolección de datos incluyó entrevistas semiestructuradas con 12 participantes (directores, heads, gerentes y analistas) y análisis documental. Los resultados evidenciaron que el presupuesto fue reconocido como un instrumento relevante para ampliar la claridad financiera, orientar decisiones y fortalecer la planificación estratégica, promoviendo mayor previsibilidad y organización interna. Sin embargo, se identificaron desafíos culturales significativos, como la limitación de conocimiento financiero de los gerentes, la resistencia a la pérdida de autonomía y la necesidad de adaptación a nuevas rutinas. El proceso impulsó la formalización de información, la responsabilización de los líderes y la sustitución gradual de decisiones intuitivas por datos, actuando también como herramienta pedagógica para el aprendizaje organizacional y el desarrollo de competencias financieras. Se concluyó que la efectividad del proceso presupuestario está directamente relacionada con la capacidad de la organización para promover cambios culturales, el compromiso de los líderes y la evolución continua de las prácticas de gestión, contribuyendo a la profesionalización de la gestión en empresas familiares.

Palabras clave: Control; Decisión; Gobernanza; Planificación; Profesionalización.

Gestión Tributaria

07 de octubre de 2026

Reforma tributaria: impactos y desafíos para el productor rural persona física a través del sistema IVA dual

El estudio analizó los posibles impactos de la Reforma Tributaria brasileña sobre el Productor Rural Persona Física, comparando el sistema tributario vigente y el modelo del IVA Dual, compuesto por la CBS y el IBS. La investigación tuvo como objetivo examinar una operación específica de venta interestatal de 164 bovinos hembras destinados al sacrificio, realizada por un productor en Goiás a un frigorífico en São Paulo. Se utilizó un enfoque cualitativo, descriptivo, explicativo y aplicado, con investigación documental basada en documentos fiscales, contables y operativos. Se compararon el ICMS efectivamente liquidado en el escenario vigente y el escenario base proyectado del IVA Dual, adoptando la alícuota estimada del 25,45% como premisa de simulación. En la operación analizada, el valor de los tributos pasó de R$ 71.425,42 en el escenario vigente a R$ 187.014,09 en el escenario base proyectado. Se concluyó que, en las condiciones y premisas adoptadas, la Reforma Tributaria tiende a elevar la carga tributaria de la operación. El resultado puede servir como referencia para productores rurales que realicen operaciones similares y estén sometidos a condiciones tributarias y operativas equivalentes, no debiendo ser aplicado automáticamente a situaciones distintas ni considerado una previsión definitiva.

Palabras clave: Agronegocio; Actividad Rural; Carga Tributaria; Sistema Tributario.

Escolar

07 de octubre de 2026

Plan de negocio: Español Fácil

El presente estudio desarrolló un plan de negocio para un modelo innovador de enseñanza de español como lengua extranjera en Brasil. El objetivo fue crear una propuesta flexible y personalizada, que promoviera la autonomía del estudiante y el rigor académico. Para ello, se utilizó un estudio de caso múltiple con enfoque cualitativo, aplicando benchmarking unilateral de las empresas Open English, SMART Academia de Idiomas y Uber. La metodología siguió las directrices del Manual del Benchmarking. En la fase inicial, se propuso un Producto Mínimo Viable (PMV) con herramientas digitales de bajo costo para agendamiento, comunicación y gestión pedagógica. Los resultados indicaron que la viabilidad del proyecto reside en la combinación de materiales didácticos propios, estandarización metodológica, seguimiento postventa y uso estratégico de la tecnología. El modelo se configuró como un intermediario entre profesores y estudiantes, inspirado en la lógica operacional de Uber, e incorporó el rigor pedagógico de SMART Academia de Idiomas, con clases estructuradas por niveles y evaluaciones continuas. Se concluyó que la propuesta presenta viabilidad inicial y potencial de diferenciación, articulando flexibilidad operacional, diversidad de perfiles docentes y autonomía del estudiante. La implementación vía PMV se mostró adecuada para probar la aceptación y reducir riesgos, con potencial de escalabilidad internacional y futura búsqueda de inversores.

Palabras clave: Benchmarking; Enseñanza de español; Innovación educativa; Plataforma digital; Plan de negocio.

07 de octubre de 2026

Predicción de resistencia a ceftazidima-avibactam y susceptibilidad a carbapenémicos en variantes KPC

La creciente diseminación global de variantes de la enzima KPC asociadas a la resistencia a ceftazidima-avibactam (CZA) representó una amenaza crítica para la terapéutica antimicrobiana, especialmente ante la posible restauración de la susceptibilidad a los carbapenémicos. Este estudio tuvo como objetivo desarrollar y validar modelos predictivos basados en aprendizaje automático capaces de inferir, a partir de mutaciones en el gen blaKPC, los fenotipos de resistencia a CZA y susceptibilidad a carbapenémicos. Para ello, se construyó una base de datos con 281 variantes, de las cuales 162 poseían validación fenotípica y se utilizaron como conjunto de entrenamiento. Se empleó un enfoque genómico completo, incluyendo sustituciones, inserciones y deleciones, con codificación One-Hot y modelado supervisado utilizando algoritmos como Random Forest, Support Vector Machines (SVM), Regresión Logística y k-Nearest Neighbors (KNN), validados por validación cruzada y balanceo con SMOTE. Los resultados demostraron alto rendimiento predictivo para el modelo SVM, con F1-score superior al 96% para resistencia a CZA y aproximadamente 82% para carbapenémicos, evidenciando la relevancia de eventos estructurales (indels) en la función enzimática. Se observó un patrón consistente de trade-off evolutivo, en el cual la resistencia a CZA estuvo frecuentemente asociada a la pérdida de actividad contra carbapenémicos. Marcadores moleculares como D179Y e inserciones en el loop Omega no fueron identificados como determinantes críticos, siendo estadísticamente validados por prueba de Fisher con corrección de Bonferroni. Se concluyó que el aprendizaje automático permitió predecir fenotipos complejos con alta precisión, ofreciendo una herramienta prometedora para la vigilancia genómica y el apoyo a la decisión clínica en microbiología.

Palabras clave: aprendizaje automático; blaKPC; mutaciones estructurales; resistencia antimicrobiana; vigilancia genómica.