Artigo

07 de outubro de 2026

Detecção Não Supervisionada de Anomalias Comportamentais em Acessos Corporativos a Dados Sensíveis

Detecção Não Supervisionada de Anomalias Comportamentais em Acessos Corporativos a Dados Sensíveis

Jeferson Belinello da Silveira; Christian Duarte Caldeira

DOI: 10.22167/2675-6528-202603031

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

A digitalização dos processos corporativos ampliou a exposição a ameaças internas, onde colaboradores com acesso legítimo a sistemas violam políticas de segurança. Partindo de teorias comportamentais da fraude, investigou-se a identificação proativa dessas ameaças. O objetivo foi propor e avaliar um sistema de detecção de anomalias estruturado em Análise de Redes Sociais (SNA), comparando a eficácia dos algoritmos não supervisionados Isolation Forest (IF) e Local Outlier Factor (LOF) na identificação de padrões de acesso atípicos em uma base de dados estocástica simulada. Para isso, utilizou-se um dataset de aproximadamente 1 milhão de logs, gerado estocasticamente, que modelou perfis probabilísticos com sobreposição de ruídos e acessos legítimos. A metodologia envolveu a modelagem das interações entre funcionários e clientes como um grafo bipartido ponderado por risco, e aplicou-se IF e LOF sobre métricas topológicas da rede e pontuações de risco forense. Os resultados demonstraram a superioridade do modelo LOF que, ao focar na densidade local, rompeu a camuflagem das anomalias e atingiu média Recall de 81,3% em múltiplas simulações, superando o desempenho do Isolation Forest (média Recall de 56%). A solução demonstrou ser uma abordagem viável e escalável para reforçar a ‘percepção de detecção’, fornecendo aos gestores uma base de acessos de alto risco para priorizar investigações precisas, em estrita conformidade com a LGPD.

Palavras-chave: Análise de Redes Sociais; Detecção de anomalias; Fraude interna; LGPD; Machine Learning.

1. Introdução

A digitalização dos processos corporativos, embora tenha impulsionado a eficiência operacional, ampliou significativamente a exposição das organizações a ameaças internas. Estas ameaças são caracterizadas por colaboradores que, detendo acesso legítimo a sistemas, violam políticas de segurança. O Relatório de Investigações de Violação de Dados da Verizon (2023) destaca que aproximadamente 74% de todos os incidentes de segurança envolvem o elemento humano. Diferentemente dos ataques cibernéticos externos, que necessitam romper barreiras de infraestrutura, o risco interno é insidioso, pois o agente malicioso opera dentro do perímetro de segurança com credenciais válidas. A Association of Certified Fraud Examiners (ACFE, 2024) descreve a “fraude ocupacional” como o uso da posição profissional para enriquecimento pessoal, atuando como um fator de corrosão silenciosa nas organizações (Pinheiro e Silva Cunha, 2003). O impacto financeiro é substancial, com perdas médias estimadas em cinco por cento da receita anual das empresas, e o relatório global da ACFE (2024) registrou, em 1.921 casos reais analisados, prejuízos superiores a 3,1 bilhões de dólares, com um prejuízo mediano de 145.000 dólares por incidente.

No contexto brasileiro, a materialidade deste risco é frequentemente evidenciada por operações da Polícia Federal (PF). Em 2025, investigações revelaram esquemas estruturados de peculato digital operados por funcionários com credenciais ativas em instituições como a Caixa Econômica Federal (Polícia Federal, 2025a; 2025c; 2025d). Somente nestes casos locais, o prejuízo direto causado por colaboradores ultrapassa os 4,6 milhões de reais. Estes episódios, que ocorrem de forma sistêmica em diversas regiões do país (Polícia Federal, 2025b), demonstram que a confiança incondicional nos colaboradores não é uma política de segurança viável, reforçando a urgência e a relevância financeira do tema. A complexidade e materialidade desse risco evoluem em paralelo às transformações estruturais do mercado e da sociedade. A digitalização crescente e a expansão do acesso a serviços no cenário financeiro brasileiro, conforme o Banco Central do Brasil (2025), aumentaram o volume de interações e o tráfego de dados sensíveis. Este fenômeno, somado a mudanças demográficas como o envelhecimento populacional (IBGE, 2024), diversifica a base de usuários e exige soluções adaptativas e escaláveis, pois métodos tradicionais de auditoria perdem eficácia diante da alta volumetria e exposição prolongada de dados.

Para o desenho de sistemas de monitoramento eficazes, é fundamental distinguir anomalias geradas por erros (desatenção ou falha de processo) daquelas geradas por fraudes. A ACFE (2024) define fraude como o uso deliberado da posição profissional para obtenção de ganhos próprios ou enriquecimento ilícito, resultando em lesão aos recursos da instituição. A compreensão etiológica deste comportamento baseia-se historicamente no Triângulo da Fraude, que postula a ocorrência do ilícito pela convergência simultânea de três fatores: pressão, oportunidade e racionalização (Borba e Maragno, 2017). Contudo, no contexto de acessos corporativos a bases de dados complexas, a literatura evoluiu para o modelo do Diamante da Fraude (Boldt, 2025), que adiciona um quarto elemento decisivo: a capacidade técnica, onde o agente malicioso explora suas habilidades e conhecimento dos sistemas para extrair dados sem ser detectado.

Este risco, especialmente no setor bancário, é agravado pelas exigências da Lei Geral de Proteção de Dados (LGPD) (Brasil, 2018). O acesso não motivado de um funcionário a cadastros, extratos ou históricos financeiros de clientes, mesmo sem desvio financeiro imediato, configura um incidente de segurança e violação de privacidade. Tradicionalmente, as instituições utilizam auditorias por amostragem e sistemas baseados em regras determinísticas, que disparam alertas apenas ao ultrapassar limites volumétricos. No entanto, como demonstram Chandola, Banerjee e Kumar (2009), fraudadores modernos diluem seus acessos indevidos em comportamentos aparentemente normais, tornando os sistemas estáticos ineficazes na detecção da “fraude camuflada” e gerando muitos falsos positivos. É neste cenário que a Inteligência Artificial, especificamente modelos de Machine Learning Não Supervisionado (Goldstein e Uchida, 2016), torna-se crucial, pois o sigilo bancário restringe o uso de bases reais com fraudes rotuladas (Lerner e Flach, 2024), tornando as simulações estocásticas uma via científica e ética. O uso de Grafos e Análise de Redes Sociais (SNA) permite avaliar o risco das interações funcionário-cliente (Akoglu, Tong e Koutra, 2015), e a implementação de IA no combate à fraude interna visa instigar uma forte “percepção de detecção” (ACFE, 2024), atuando como mecanismo de controle preventivo.

Diante da complexidade e da materialidade das ameaças internas, e da ineficácia das abordagens tradicionais, justifica-se a necessidade de desenvolver e avaliar sistemas preditivos de detecção de anomalias. Assim, o presente trabalho tem como objetivo propor e avaliar um sistema de detecção de anomalias estruturado em Análise de Redes Sociais (SNA), analisando e comparando a eficácia dos algoritmos não supervisionados Isolation Forest (IF) e Local Outlier Factor (LOF) na identificação de padrões de acesso atípicos em uma base de dados estocástica simulada.

2. Material e Métodos

O presente estudo caracterizou-se como uma pesquisa aplicada de abordagem quantitativa (Gil, 2008; Richardson, 1999). Teve como objetivo propor e avaliar um sistema de detecção de anomalias comportamentais em acessos corporativos a dados sensíveis, empregando técnicas de Machine Learning Não Supervisionado. A escolha por esta abordagem foi ditada pela restrição de acesso a bases de dados reais com fraudes rotuladas, em observância ao sigilo bancário e à Lei Geral de Proteção de Dados (LGPD) (Lerner e Flach, 2024).

Para superar a escassez de dados reais e assegurar a reprodutibilidade, construiu-se uma base de dados sintética estocástica, totalizando aproximadamente 1 milhão de registros de log. Esta simulação modelou perfis probabilísticos de comportamento legítimo com ruído, fraude camuflada e fraude volumétrica. Uma semente aleatória fixa (random seed = 77) foi empregada para garantir a determinística das distribuições e a replicação exata. O dataset simulado compreendeu 1.000 funcionários, 47.980 clientes e 990.570 registros de acesso.

A estrutura de dados foi organizada em três bases interligadas: Funcionários (`id_funcionario`, `id_filial`), Clientes (`id_cliente`, `id_filial_agencia`, `status_conta`) e Logs de Acesso (`id_funcionario`, `id_cliente`, `timestamp_acesso`, `fraude_simulada`). A variável `fraude_simulada` não foi utilizada durante o treino, servindo como Ground Truth para validação. A parametrização comportamental da simulação estocástica estabeleceu três perfis com sobreposição: legítimo com ruído (98,5% da base), fraude camuflada e fraude volumétrica. Quinze funcionários foram calibrados como fraudadores, divididos em táticas de Exploradores, Necros e Reativadores.

Os metadados temporais (`timestamps dos logs`) emularam o horário comercial, com 96% dos acessos concentrados entre 08h00 e 17h59, e 4% distribuídos como acessos atípicos. A metodologia adotou a Análise de Redes Sociais (SNA), fundamentada na Teoria dos Grafos, para modelar as interações entre funcionários e clientes (Akoglu, Tong e Koutra, 2015). Funcionários e clientes foram representados como “Nós”, e os registros de acesso como “Arestas” em um grafo bipartido ponderado. Para extrair atributos topológicos, utilizaram-se o Grau Ponderado e o PageRank (Page et al., 1999).

Para mitigar o “Paradoxo do Volume” e a “cegueira semântica” do PageRank em redes heterogêneas, implementou-se uma Engenharia de Atributos baseada em uma Heurística de Pontuação Forense Ponderada. Atribuiu-se pesos exponenciais aos acessos conforme a criticidade: contas de clientes falecidos receberam peso 10; contas inativas e acessos cross-filial receberam peso 5; e acessos regulares receberam pesos fracionários (0,3 e 0,5). As variáveis derivadas incluíram `total_acessos`, `v_fal`, `v_ina`, `v_cro` e a `Pontuação Total` (soma das volumetrias multiplicada pelos pesos de negócio).

Para a detecção de anomalias, comparou-se o desempenho de dois algoritmos não supervisionados: Isolation Forest (IF) (Liu, Ting e Zhou, 2008) e Local Outlier Factor (LOF) (Breunig et al., 2000). O IF foca no isolamento de anomalias globais, enquanto o LOF adota uma abordagem baseada na densidade local, sensível a desvios comportamentais camuflados (Chandola, Banerjee e Kumar, 2009). O hiperparâmetro de contaminação foi ajustado para 1,5%. Não se realizou a divisão tradicional dos dados em treino e teste, e os algoritmos operaram em um cenário “cego” (zero-shot learning).

Para avaliar a capacidade de generalização, realizou-se uma validação cruzada através de múltiplas simulações (Monte Carlo). A semente estocástica do gerador de dados foi alterada sequencialmente, criando cinco cenários independentes, cada um gerando uma nova topologia de rede. O desenvolvimento computacional foi realizado em Python, utilizando a biblioteca NetworkX para a modelagem de grafos e scikit-learn para os algoritmos de Machine Learning. Modelos de Linguagem de Grande Escala (LLMs) foram empregados como suporte computacional para estruturação e otimização de código, em conformidade com o Manual de Boas Práticas (Pecege, 2025).

3. Resultados e Discussão

A investigação dos padrões de acesso atípicos em ambientes corporativos sensíveis revelou insights cruciais sobre a eficácia de algoritmos de detecção de anomalias não supervisionados. Os resultados obtidos a partir de uma base de dados estocástica simulada, com aproximadamente 1 milhão de registros, permitiram validar a metodologia proposta e comparar o desempenho do Isolation Forest (IF) e do Local Outlier Factor (LOF). O estudo demonstrou que a modelagem das interações como um grafo bipartido, ponderado por risco, aliada a uma arquitetura híbrida de Machine Learning, é uma abordagem promissora para identificar ameaças internas camufladas, superando as limitações das metodologias tradicionais baseadas em regras determinísticas e volumetria simples.

A análise exploratória dos dados (EDA) foi fundamental para compreender a complexidade do ambiente simulado e validar a representatividade das anomalias inseridas. O histograma da métrica de Grau Ponderado, por exemplo, evidenciou uma concentração de funcionários legítimos em pontuações de risco mais baixas, enquanto o box-plot demonstrou que a aplicação de pontuações forenses elevou a mediana de risco para os perfis fraudulentos. Esta distinção inicial, contudo, não se traduziu em uma separabilidade linear óbvia, confirmando a necessidade de abordagens mais sofisticadas para a detecção.

A matriz de correlação das variáveis derivadas revelou altas correlações entre atributos volumétricos, como o Total de Acessos e a Pontuação Total, o que era esperado devido à derivação algébrica da pontuação de risco a partir da volumetria e pesos forenses. No entanto, a métrica topológica PageRank manteve uma correlação substancialmente mais baixa com as métricas de volume absoluto. Este achado é crucial, pois a introdução de uma variável topológica não-linear, como o PageRank, foi projetada para romper o determinismo e permitir que os modelos de Machine Learning diferenciassem um funcionário com alto volume de trabalho legítimo de um fraudador camuflado, abordando o que se denominou “Paradoxo do Volume”.

O gráfico de dispersão, ou scatter plot, ilustrou visualmente a premissa central do estudo: a sobreposição comportamental. Ao cruzar o PageRank com o Grau Ponderado, observou-se uma densa sobreposição espacial entre as ações atípicas dos funcionários legítimos (ruído) e as dos fraudadores. Esta representação confirmou que as fronteiras de decisão lineares, típicas de sistemas estáticos baseados em regras, seriam ineficazes para separar as classes de risco. A dispersão e sobreposição dos dados justificaram estatisticamente a adoção de algoritmos não supervisionados, capazes de interpretar anomalias de densidade local, conforme destacado por Chandola, Banerjee e Kumar (2009).

A etapa de processamento topológico e visualização da rede (SNA) validou a escalabilidade da modelagem por grafos. A rede bipartida, composta por 48.980 nós (funcionários e clientes) e cerca de 990 mil registros de interação consolidados em arestas ponderadas, foi instanciada com sucesso em memória. A extração de métricas topológicas, como Grau Ponderado e PageRank, demonstrou ser computacionalmente viável, permitindo a avaliação da influência de risco de cada colaborador com base no peso das ligações e na centralidade atípica das interações.

Contudo, reconheceu-se que o PageRank tradicional possui limitações em redes heterogêneas, sofrendo de “cegueira semântica” por não diferenciar a natureza qualitativa dos nós ou o risco de negócio associado às conexões. Para mitigar essa limitação e adequar o modelo à realidade da auditoria forense, adotou-se uma arquitetura híbrida. O escore do PageRank foi utilizado como uma variável topológica dentro de um espaço multidimensional, concatenado com uma Pontuação Forense ponderada que atribui pesos específicos baseados no risco regulatório e no estado da conta do cliente. Essa abordagem permitiu uma detecção de anomalias altamente contextualizada, cruzando a centralidade estrutural com a gravidade jurídica dos acessos.

No comparativo de desempenho dos modelos não supervisionados, o algoritmo Isolation Forest (IF), parametrizado com 2.000 estimadores, obteve um Recall de 0,60, Precision de 0,60 e F1-Score de 0,60. Embora o IF tenha isolado perfis com anomalias globais extremas, gerando seis falsos positivos, ele falhou em identificar 40% dos fraudadores mais cautelosos. Este resultado sugere que, ao focar no isolamento global, o IF pode ter dificuldade em detectar fraudes que se camuflam no comportamento normal, conforme a teoria do Diamante da Fraude (Boldt, 2025) que enfatiza a capacidade do fraudador de explorar o conhecimento dos sistemas para evitar detecção.

Em contrapartida, o modelo Local Outlier Factor (LOF), utilizando a distância de Manhattan e avaliando os 25 vizinhos mais próximos, demonstrou um desempenho significativamente superior. O LOF alcançou um Recall de 0,80, Precision de 0,80 e um F1-Score de 0,80. A análise detalhada revelou que o LOF conseguiu capturar doze dos quinze fraudadores simulados, com apenas três falsos positivos entre os quinze alertas gerados, resultando em uma Precision de 80%. Este desempenho indica que o LOF, ao focar na densidade local, foi mais eficaz em romper a camuflagem das anomalias, que se manifestam como desvios em relação à vizinhança topológica imediata, e não necessariamente como anomalias globais.

A superioridade do LOF é atribuída à sua capacidade de identificar desvios comportamentais inéditos de caráter local, que muitas vezes são confundidos com atividades lícitas, superando as táticas de evasão conhecidas como “Low and Slow Attacks” (Chandola, Banerjee e Kumar, 2009). Esta característica é particularmente relevante em cenários de fraude interna, onde os agentes maliciosos buscam diluir suas ações indevidas em um volume massivo de transações legítimas. A capacidade do LOF de focar na densidade local permitiu que o modelo rompesse essa camuflagem, identificando padrões de acesso atípicos que o Isolation Forest não conseguiu isolar com a mesma eficácia.

Para consolidar a análise comparativa e avaliar a capacidade de generalização dos modelos, realizou-se uma validação cruzada por meio de múltiplas simulações de Monte Carlo. Ao alterar sequencialmente a semente estocástica do gerador de dados, foram criados cinco cenários independentes, cada um com uma nova topologia de rede e distribuição de ruído operacional e agentes maliciosos. Esta abordagem mitigou o viés de uma amostra única e testou a robustez dos algoritmos em diferentes condições.

Os resultados da validação cruzada confirmaram a robustez da arquitetura baseada na densidade local do LOF. O modelo apresentou um Recall médio de 81,3% na detecção da classe Fraude, atingindo picos de 86,6% de identificação correta das ameaças ocultas na maioria dos cenários. Em contraste, o Isolation Forest demonstrou alta sensibilidade às variações da rede, com sua eficácia caindo para menos de 50% no Cenário 1 e estagnando em uma média geral de 56%. Este distanciamento nas métricas de desempenho reflete as limitações teóricas dos algoritmos baseados em volume, que focam em anomalias globais e permitem a evasão de fraudes oportunistas.

Atingir uma taxa média de detecção (Recall) superior a 81% em um cenário com extremo desbalanceamento de classes (apenas 1,5% de anomalias) reveste-se de particular relevância científica e operacional. Na literatura de Machine Learning aplicada à auditoria, a avaliação de desempenho de algoritmos estritamente não supervisionados é desafiadora, pois não possuem conhecimento prévio dos rótulos durante a fase de treino (Goldstein e Uchida, 2016). O fato de o modelo LOF, ancorado na topologia de grafos, ter sustentado este alto desempenho ao longo da validação cruzada demonstra um nível de eficácia altamente competitivo em relação aos padrões acadêmicos da detecção de anomalias pontuais.

Do ponto de vista prático e de negócio, este resultado resolve a necessidade delineada na introdução do estudo. A alta taxa de captura, aliada a um baixo índice de alarmes falsos, traduz-se em uma ferramenta de triagem forense promissora. Em um ambiente corporativo real, regido pelos rigores da LGPD (Brasil, 2018), essa assertividade otimiza os esforços de investigação da equipe humana e evita a fricção organizacional de falsas acusações contra funcionários de alta produtividade. Este nível de precisão cumpre o objetivo de criar uma forte “percepção de detecção” (ACFE, 2024), dissuadindo ameaças internas sem sobrecarregar operacionalmente os sistemas de resposta a incidentes da instituição.

Um diferencial estratégico desta arquitetura baseada em Análise de Redes Sociais (SNA) reside na sua extrema parametrização e flexibilidade arquitetural. Ao modelar as interações de acesso como um grafo ponderado, o sistema viabiliza a atribuição de “pesos” dinâmicos às arestas, calibrados de acordo com características granulares das operações, como o horário, a volumetria ou o estado da conta, e a sensibilidade dos dados do cliente. Esta plasticidade metodológica reflete o estado da arte na transição dos sistemas estáticos de cibersegurança para arquiteturas orientadas a dados (Mahajan, 2024).

Ao contrário dos sistemas obsoletos baseados em regras volumétricas, a solução baseada em Machine Learning é inerentemente autoadaptável, atuando em tempo real para verificar sinais contínuos de alterações comportamentais (Soares, 2020). Caso as tipologias de fraude evoluam, a instituição não necessita reestruturar os algoritmos centrais; basta ajustar a função de ponderação do grafo. Esta capacidade de adaptação garante um mecanismo de melhoria contínua, permitindo que a “percepção de detecção” evolua em simetria com a sofisticação das ameaças, culminando em um sistema forense inteligente, dinâmico e estritamente alinhado com as exigências de privacidade da LGPD.

Em síntese, os resultados desta pesquisa confirmam que a detecção proativa de anomalias comportamentais em acessos corporativos a dados sensíveis é viável e eficaz por meio de uma abordagem híbrida que integra Análise de Redes Sociais e algoritmos de Machine Learning não supervisionados. A superioridade do Local Outlier Factor na identificação de fraudes camufladas, aliada à robustez demonstrada em múltiplas simulações, oferece uma ferramenta poderosa para reforçar a segurança interna, otimizar investigações e garantir a conformidade com as regulamentações de proteção de dados, respondendo diretamente ao objetivo de propor e avaliar um sistema de detecção de anomalias.

4. Conclusão

O presente estudo buscou propor e avaliar um sistema de detecção de anomalias estruturado em Análise de Redes Sociais (SNA), comparando a eficácia dos algoritmos não supervisionados Isolation Forest (IF) e Local Outlier Factor (LOF) na identificação de padrões de acesso atípicos em uma base de dados estocástica simulada. Verificou-se que a digitalização dos processos corporativos ampliou a exposição a ameaças internas, onde colaboradores com acesso legítimo violam políticas de segurança, e que métodos tradicionais de auditoria se mostravam ineficazes contra a fraude camuflada. A metodologia envolveu a modelagem das interações entre funcionários e clientes como um grafo bipartido ponderado por risco, utilizando um dataset de aproximadamente 1 milhão de logs gerados estocasticamente para mimetizar comportamentos anômalos e ruídos operacionais. Os resultados demonstraram a superioridade do modelo LOF que, ao focar na densidade local, rompeu a camuflagem das anomalias e atingiu um Recall médio de 81,3% em múltiplas simulações, superando o desempenho do Isolation Forest, que obteve um Recall médio de 56%. Esta abordagem híbrida, que concatenou métricas topológicas da rede com pontuações de risco forense, mostrou-se crucial para contextualizar a detecção e superar a “cegueira semântica” do PageRank tradicional, diferenciando acessos legítimos de alto volume de ações fraudulentas.

A principal contribuição do estudo reside na proposição de uma abordagem viável e escalável para a detecção proativa de ameaças internas, reforçando a “percepção de detecção” e fornecendo aos gestores uma base de acessos de alto risco para priorizar investigações precisas, em estrita conformidade com a LGPD. A solução representa uma transição dos sistemas estáticos baseados em regras para arquiteturas autoadaptáveis e orientadas a dados, capazes de evoluir com as tipologias de fraude. Contudo, a pesquisa utilizou uma base de dados estocástica simulada devido às restrições de sigilo bancário e LGPD, o que exige validação em ambientes reais para uma implementação completa. Para estudos futuros, sugere-se a implementação de um mecanismo de feedback loop, onde os resultados das investigações humanas sobre os alertas gerados retroalimentam o modelo, permitindo que a inteligência artificial ajuste continuamente sua sensibilidade topológica e aprenda novos padrões de fraude, mitigando falsos positivos e adaptando-se à evolução das ameaças.

Referências Bibliográficas

Association of Certified Fraud Examiners [ACFE]. 2024. Fraude Ocupacional 2024: Um Relatório para as Nações. Disponível em: Relatório ACFE 2024 para as Nações. Acesso em: 20 set. 2025.

Pinheiro, G.J.; Silva Cunha, L.R. 2003. A importância da auditoria na detecção de fraudes. Contabilidade Vista & Revista 14(1): 31-47.

Polícia Federal. 2025a. PF prende em flagrante funcionário da Caixa por peculato digital no Rio de Janeiro. Disponível em: https://www.gov.br/pf/pt-br/assuntos/noticias/2025/09/pf-prende-em-flagrante-funcionario-da-caixa-por-peculato-digital-no-rio-de-janeiro. Acesso em: 11 out. 2025.

Polícia Federal. 2025c

Verizon. 2023. Relatório de Investigações de Violação de Dados de 2023: Visão geral do setor público. Disponível em: https://www.verizon.com/business/resources/Ta5a/reports/2023-dbir-public-sector-snapshot.pdf. Acesso em: 03 set. 2025.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

07 de outubro de 2026

Governança em processos: redução de retrabalho, tempo e custo no fechamento contábil

A governança corporativa, aplicada à gestão de processos organizacionais, tem sido associada à melhoria do controle, da conformidade e da eficiência operacional. O estudo investigou como mecanismos de governança corporativa, combinados com automações, influenciaram a eficiência operacional e a conformidade interna em processos críticos de fechamento mensal em uma empresa do agronegócio. Conduziu-se um estudo de caso exploratório e descritivo, com abordagem mista, que combinou observação participante, análise documental e de registros operacionais de sistemas e controles internos. A unidade de análise compreendeu processos críticos, selecionados por volume, risco operacional e relevância para o fechamento contábil. Os resultados indicaram que a aplicação de mecanismos estruturais de governança, como definição de alçadas, segregação de funções, padronização de rotinas e implementação de workflow estruturado, associou-se à redução do tempo de execução, diminuição do retrabalho e maior rastreabilidade das atividades. Observou-se, adicionalmente, que a reorganização dos processos contribuiu para a redução da necessidade de horas extras, indicando potencial de redução dos custos operacionais associados ao fechamento mensal. Os achados demonstraram que a governança, quando incorporada ao desenho e à execução dos processos, atua como elemento estruturante da operação, promovendo alinhamento entre controle, execução e desempenho organizacional.

Palavras-chave: Automação; Controle interno; Custo operacional; Eficiência operacional; Processos organizacionais.

07 de outubro de 2026

Governança Regulatória de Substâncias Químicas no Contexto do Acordo UE-Mercosul: Desafios e Oportunidades para o Brasil

A governança regulatória de substâncias químicas passou por transformações profundas, impulsionadas pelo modelo europeu REACH e pela crescente relevância da agenda ESG (Environmental, Social, and Governance). Analisou-se os impactos da implementação da Lei nº 15.022/2024 (Brasil REACH) e as dinâmicas do Acordo de Associação UE-Mercosul na competitividade da indústria química brasileira. A pesquisa adotou uma abordagem qualitativa, fundamentada em análise documental e em uma entrevista semiestruturada com um especialista do setor. Os resultados demonstraram que, embora o Brasil REACH represente um avanço na convergência normativa com padrões internacionais, sua eficácia foi limitada por lacunas na capacidade institucional e pela incerteza operacional das agências reguladoras. Constatou-se que recentes incertezas políticas e debates no Parlamento Europeu elevaram o risco percebido, porém não interromperam o processo de adaptação industrial, que ocorreu de forma proativa para atender às exigências de acesso a mercados globais e financiamentos sustentáveis. Observou-se que o compliance regulatório de substâncias químicas passou a ser percebido não apenas como um centro de custos, mas como um ativo estratégico de governança, essencial para a resiliência das empresas em cadeias globais de valor.

Palavras-chave: Barreiras técnicas ao comércio; Capacidade institucional; Convergência normativa; Governança socioambiental; Regulação de substâncias químicas.

07 de outubro de 2026

Boas práticas para o fortalecimento da confiança no canal de ética

O canal de ética consolidou-se como mecanismo relevante para a identificação de irregularidades e desvios de conduta no âmbito organizacional. Contudo, apesar de seu incentivo e obrigatoriedade normativa, verificou-se resistência ao seu uso por stakeholders. O estudo objetivou examinar as principais dificuldades relacionadas à implementação e operação do canal, bem como identificar medidas capazes de mitigar essas barreiras e fortalecer sua credibilidade perante os públicos interno e externo. A pesquisa desenvolveu-se em duas etapas complementares: uma fase teórica, que analisou a doutrina especializada e a legislação brasileira aplicável, e uma fase empírica, que consistiu na realização de entrevistas semiestruturadas com profissionais da área de Compliance. Os resultados permitiram identificar requisitos essenciais para o funcionamento adequado do canal e evidenciaram boas práticas, como comunicação institucional clara, treinamento contínuo, engajamento da alta administração, fluxo estruturado de tratamento, salvaguardas ao denunciante, divulgação criteriosa de resultados e monitoramento permanente. Constatou-se que as fragilidades mais recorrentes decorreram de fatores predominantemente comunicacionais, passíveis de mitigação por estratégias de aculturamento consistentes e segmentadas. Concluiu-se que a confiança no canal de ética é estruturante para sua eficácia, e as vulnerabilidades identificadas podem ser substancialmente mitigadas por comunicação estratégica, contribuindo para uma cultura de integridade que valoriza a transparência e o tratamento técnico das irregularidades.

Palavras-chave: Credibilidade; Denúncia; Integridade; Stakeholders; Whistleblower.

07 de outubro de 2026

Modelagem preditiva para priorização de inconsistências fiscais a partir do balancete da ECD

A crescente complexidade das relações econômicas e o elevado volume de dados disponíveis para a administração tributária demandaram o desenvolvimento de ferramentas mais eficientes para a seleção de contribuintes submetidos à auditoria fiscal. Nesse contexto, aplicou-se modelos supervisionados de aprendizado de máquina, com base em dados extraídos da Escrituração Contábil Digital (ECD), para priorizar empresas em um cenário de restrição de recursos humanos e de rotulagem incompleta. Para tanto, construiu-se um conjunto de dados composto por variáveis contábeis derivadas da ECD e aplicaram-se os modelos de Regressão Logística e Random Forest. A Regressão Logística utilizou-se como referência linear, enquanto o Random Forest foi escolhido por sua capacidade de capturar relações não lineares e interações complexas entre variáveis estruturadas. Modelos de maior complexidade, como redes neurais, não foram priorizados, considerando-se a baixa disponibilidade de exemplos da classe positiva e o objetivo de adotar uma abordagem parcimoniosa e de fácil aplicação operacional. O desempenho dos modelos avaliou-se com foco na capacidade de concentrar casos positivos nas primeiras posições do ranking. Os resultados indicaram superioridade dos modelos baseados em árvores, especialmente do Random Forest, na priorização dos contribuintes. Observou-se, ainda, a identificação de padrões relevantes mesmo em contexto de rótulos imperfeitos. Concluiu-se que a abordagem proposta apresentou potencial para apoiar a seleção de contribuintes para auditoria e contribuir para a alocação mais eficiente de recursos públicos.

Palavras-chave: Análise de risco; Aprendizado supervisionado; Dados contábeis; Priorização de auditorias; Seleção de contribuintes.

07 de outubro de 2026

Desafios culturais na implantação do orçamento em uma empresa familiar de tecnologia

A implantação do processo orçamentário em uma empresa familiar de médio porte do setor de tecnologia, em transição de um modelo de gestão informal para práticas mais estruturadas de planejamento e controle, foi abordada. O objetivo foi analisar os desafios culturais enfrentados nesse processo, com ênfase nas percepções, adaptações e transformações organizacionais. Realizou-se uma pesquisa qualitativa e descritiva, por meio de um estudo de caso único em uma empresa de Santa Catarina com aproximadamente 600 colaboradores. A coleta de dados incluiu entrevistas semiestruturadas com 12 participantes (diretores, heads, gerentes e analistas) e análise documental. Os resultados evidenciaram que o orçamento foi reconhecido como instrumento relevante para ampliar a clareza financeira, orientar decisões e fortalecer o planejamento estratégico, promovendo maior previsibilidade e organização interna. Contudo, foram identificados desafios culturais significativos, como a limitação de conhecimento financeiro dos gestores, a resistência à perda de autonomia e a necessidade de adaptação a novas rotinas. O processo impulsionou a formalização de informações, a responsabilização das lideranças e a substituição gradual de decisões intuitivas por dados, atuando também como ferramenta pedagógica para aprendizado organizacional e desenvolvimento de competências financeiras. Concluiu-se que a efetividade do processo orçamentário está diretamente relacionada à capacidade da organização de promover mudanças culturais, engajamento das lideranças e evolução contínua das práticas de gestão, contribuindo para a profissionalização da gestão em empresas familiares.

Palavras-chave: Controle; Decisão; Governança; Planejamento; Profissionalização.

Gestão Tributária

07 de outubro de 2026

Reforma tributária: impactos e desafios para o produtor rural pessoa física por meio do sistema IVA dual

O estudo analisou os possíveis impactos da Reforma Tributária brasileira sobre o Produtor Rural Pessoa Física, comparando o sistema tributário vigente e o modelo do IVA Dual, composto pela CBS e pelo IBS. A pesquisa teve como objetivo examinar uma operação específica de venda interestadual de 164 bovinos fêmeas destinados ao abate, realizada por produtor em Goiás para frigorífico em São Paulo. Utilizou-se abordagem qualitativa, descritiva, explicativa e aplicada, com pesquisa documental baseada em documentos fiscais, contábeis e operacionais. Compararam-se o ICMS efetivamente apurado no cenário vigente e o cenário-base projetado do IVA Dual, adotando a alíquota estimada de 25,45% como premissa de simulação. Na operação analisada, o valor dos tributos passou de R$ 71.425,42 no cenário vigente para R$ 187.014,09 no cenário-base projetado. Concluiu-se que, nas condições e premissas adotadas, a Reforma Tributária tende a elevar a carga tributária da operação. O resultado pode servir como referência para produtores rurais que realizem operações semelhantes e estejam submetidos a condições tributárias e operacionais equivalentes, não devendo ser aplicado automaticamente a situações distintas ou considerado previsão definitiva.

Palavras-chave: Agronegócio; Atividade Rural; Carga Tributária; Sistema Tributário.

Escolar

07 de outubro de 2026

Plano de negócio: Espanhol Fácil

O presente estudo desenvolveu um plano de negócio para um modelo inovador de ensino de espanhol como língua estrangeira no Brasil. O objetivo foi criar uma proposta flexível e personalizada, que promovesse a autonomia do estudante e o rigor acadêmico. Para isso, utilizou-se um estudo de caso múltiplo com abordagem qualitativa, aplicando benchmarking unilateral das empresas Open English, SMART Academia de Idiomas e Uber. A metodologia seguiu as diretrizes do Manual do Benchmarking. Na fase inicial, propôs-se um Produto Mínimo Viável (PMV) com ferramentas digitais de baixo custo para agendamento, comunicação e gestão pedagógica. Os resultados indicaram que a viabilidade do projeto reside na combinação de materiais didáticos próprios, padronização metodológica, acompanhamento pós-venda e uso estratégico da tecnologia. O modelo se configurou como um intermediador entre professores e estudantes, inspirado na lógica operacional da Uber, e incorporou o rigor pedagógico da SMART Academia de Idiomas, com aulas estruturadas por níveis e avaliações contínuas. Concluiu-se que a proposta apresenta viabilidade inicial e potencial de diferenciação, articulando flexibilidade operacional, diversidade de perfis docentes e autonomia do estudante. A implementação via PMV mostrou-se adequada para testar a aceitação e reduzir riscos, com potencial de escalabilidade internacional e futura busca por investidores.

Palavras-chave: Benchmarking; Ensino de espanhol; Inovação educacional; Plataforma digital; Plano de negócio.

07 de outubro de 2026

Predição de resistência à ceftazidima-avibactam e suscetibilidade aos carbapenêmicos em variantes KPC

A crescente disseminação global de variantes da enzima KPC associadas à resistência à ceftazidima-avibactam (CZA) representou uma ameaça crítica à terapêutica antimicrobiana, especialmente diante da possível restauração da suscetibilidade aos carbapenêmicos. Este estudo teve como objetivo desenvolver e validar modelos preditivos baseados em aprendizado de máquina capazes de inferir, a partir de mutações no gene blaKPC, os fenótipos de resistência à CZA e suscetibilidade aos carbapenêmicos. Para isso, foi construída uma base de dados com 281 variantes, das quais 162 possuíam validação fenotípica e foram utilizadas como conjunto de treinamento. Empregou-se uma abordagem genômica completa, incluindo substituições, inserções e deleções, com codificação One-Hot e modelagem supervisionada utilizando algoritmos como Random Forest, Support Vector Machines (SVM), Regressão Logística e k-Nearest Neighbors (KNN), validados por cross-validation e balanceamento com SMOTE. Os resultados demonstraram alto desempenho preditivo para o modelo SVM, com F1-score superior a 96% para resistência à CZA e aproximadamente 82% para carbapenêmicos, evidenciando a relevância de eventos estruturais (indels) na função enzimática. Observou-se um padrão consistente de trade-off evolutivo, no qual a resistência à CZA esteve frequentemente associada à perda de atividade contra carbapenêmicos. Marcadores moleculares como D179Y e inserções no loop Omega não foram identificados como determinantes críticos, sendo estatisticamente validados por teste de Fisher com correção de Bonferroni. Concluiu-se que o aprendizado de máquina permitiu prever fenótipos complexos com alta acurácia, oferecendo uma ferramenta promissora para vigilância genômica e apoio à decisão clínica em microbiologia.

Palavras-chave: aprendizado de máquina; blaKPC; mutações estruturais; resistência antimicrobiana; vigilância genômica.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade