Artigo

05 de agosto de 2026

Arquitetura “serverless” para “web scraping” e inteligência artificial generativa em cibersegurança

Jansen Augusto Osorio; Elisa Antolli

DOI: 10.22167/2675-6528-202600963

Artigo elaborado pela ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege voltada à síntese e redação.

Resumo

Diante da fragmentação do conhecimento sobre fraudes digitais, desenvolveu-se uma arquitetura de software integralmente “serverless” para coleta automatizada de dados na web e disponibilização de inteligência em cibersegurança. O objetivo foi projetar, desenvolver e validar um sistema capaz de varrer portais públicos, categorizar dados sobre ilícitos cibernéticos por meio de um classificador híbrido de duas camadas e oferecer uma interface conversacional alimentada por Geração Aumentada por Recuperação (RAG). A implementação utilizou Python e serviços nativos da Amazon Web Services (AWS), com um pipeline de captura orquestrado por AWS Step Functions e Amazon EventBridge Scheduler. Os textos extraídos passaram por um classificador híbrido, combinando pontuação por palavras-chave e triagem pelo modelo Claude 3 Haiku via Amazon Bedrock. Os documentos aprovados foram armazenados em um data lake no Amazon S3, indexados no Amazon DynamoDB e vetorizados pelo Amazon Titan Text Embeddings V2 para alimentar o motor RAG, que utilizou Amazon Nova 2 Lite para gerar respostas. O sistema acumulou 744 documentos de 21 fontes ativas, totalizando 12,5 MB em 14 categorias de golpe. A camada de palavras-chave resolveu 79,8% dos casos, reduzindo significativamente as chamadas ao LLM. O assistente conversacional demonstrou eliminação de alucinações e precisão factual superior em comparação com o modelo sem contexto. A arquitetura revelou-se economicamente viável, com custo operacional inferior a US$ 3,50 mensais, representando uma redução de 98% em relação à infraestrutura convencional. Concluiu-se que a combinação de computação “serverless”, web scraping e inteligência artificial generativa oferece uma alternativa madura e financeiramente acessível para sistemas de vigilância temática em cibersegurança.

Palavras-chave: Computação em nuvem; Extração automatizada de dados; Geração Aumentada por Recuperação; Golpes digitais.

1. Introdução

A digitalização acelerada dos serviços financeiros reconfigurou as interações econômicas e sociais, especialmente no Brasil, onde o sistema de pagamentos instantâneos Pix, do Banco Central do Brasil (2026), já ultrapassa trezentos milhões de transações diárias. Essa conveniência, contudo, expandiu a superfície de ataque para criminosos digitais. A Federação Brasileira de Bancos (2024) aponta que a maioria dos golpes contra correntistas explora vulnerabilidades psicológicas, um fenômeno alinhado à taxonomia de engenharia social de Zaoui et al. (2024). Internacionalmente, o Internet Crime Complaint Center (2025), do FBI, registrou perdas superiores a dezesseis bilhões de dólares nos Estados Unidos em 2024. No Brasil, o Centro de Estudos, Resposta e Tratamento de Incidentes de Segurança (2026) observa uma crescente sofisticação em táticas como phishing e clonagem de aplicativos. Birthriya et al. (2024) reforçam que a exploração de vulnerabilidades humanas, e não falhas técnicas, torna a conscientização e a catalogação de fraudes tão essenciais quanto as contramedidas tecnológicas.

Apesar da urgência, o conhecimento sobre tipologias de fraudes, mecanismos e jurisprudência permanece fragmentado em diversas fontes públicas, dificultando a compreensão e a defesa eficazes. Nesse cenário, a extração automatizada de dados da web, técnica consolidada para construir bases analíticas a partir de fontes públicas (Lotfi et al., 2022), apresenta-se como uma alternativa viável. No entanto, a manutenção de infraestruturas convencionais para coleta contínua gera custos operacionais elevados, pois servidores virtuais consomem recursos mesmo em ociosidade (Hassan et al., 2021). Para contornar essa barreira, o modelo de computação “serverless” emerge como um paradigma promissor na nuvem. Jonas et al. (2019) argumentam que o “serverless” elimina a fricção operacional e adota cobrança proporcional ao uso, uma vantagem econômica confirmada por Shafiei et al. (2022), que identificaram a redução de custos como o benefício mais citado em estudos sobre essa arquitetura.

Paralelamente, os Grandes Modelos de Linguagem (LLMs) revolucionaram a busca e síntese de conteúdo, mas exibem uma fragilidade notória em domínios específicos como a cibersegurança: a tendência a produzir “alucinações”, ou seja, afirmações com aparência de veracidade sem correspondência factual (Gao et al., 2024). Para mitigar essa limitação, a arquitetura de Geração Aumentada por Recuperação (RAG) ancora as respostas do modelo a um repositório vetorial próprio, injetando contexto factual no momento da consulta e restringindo a geração ao que efetivamente consta nos documentos fornecidos (Lewis et al., 2020). Chen et al. (2024) demonstraram a superioridade do RAG em sistemas de perguntas e respostas sobre investigações de crimes cibernéticos, superando modelos generalistas sem contexto e bases de regras estáticas em fidelidade factual. Além disso, no campo da classificação automática de textos, abordagens híbridas que combinam regras ponderadas com LLMs oferecem um equilíbrio otimizado entre custo e precisão, reservando a inferência do modelo para os casos genuinamente ambíguos e economizando recursos (Brown et al., 2020).

A fragmentação do conhecimento sobre fraudes digitais e a necessidade de inteligência em cibersegurança acessível e atualizada justificam a busca por soluções inovadoras. A combinação da eficiência econômica da computação “serverless” com a capacidade de processamento e contextualização da inteligência artificial generativa, mediada por RAG e classificador híbrido, oferece um caminho promissor para superar as limitações das abordagens existentes. Assim, o presente trabalho teve como objetivo projetar, desenvolver e validar uma arquitetura de software integralmente “serverless” para web scraping, implementada em Python sobre serviços nativos da Amazon Web Services (AWS), capaz de varrer portais públicos nacionais e internacionais, categorizar automaticamente dados sobre ilícitos cibernéticos por meio de um classificador híbrido de duas camadas e disponibilizá-los por meio de uma interface conversacional alimentada por RAG, com custo operacional compatível com projetos acadêmicos e descrição suficiente para reprodução por terceiros.

2. Material e Métodos

Este trabalho configurou-se como uma pesquisa de natureza aplicada, focada na construção e validação de um artefato de software. O objetivo exploratório buscou ampliar a compreensão sobre a viabilidade de combinar coleta automatizada de dados, classificação híbrida de conteúdo e inteligência artificial generativa em uma arquitetura de baixo custo, um tema ainda pouco investigado de forma integrada na literatura (Gil, 2017). Adotou-se uma abordagem metodológica mista, com aspectos qualitativos na curadoria das fontes e na avaliação do assistente conversacional, e quantitativos na mensuração do volume de documentos, distribuição por categoria e custos operacionais.

O delineamento da pesquisa consistiu em um estudo de caso único, tendo como unidade de análise a arquitetura “serverless” desenvolvida e implantada em ambiente de produção na Amazon Web Services (AWS). O contexto do estudo abrangeu a área de cibersegurança, com foco em fraudes digitais. A coleta de dados ocorreu durante todo o período de testes do protótipo, com agendamento semanal, e a infraestrutura foi provisionada na região us-east-2 (Ohio) da AWS, selecionada pelo suporte simultâneo a tecnologias essenciais ao projeto.

O conjunto de dados utilizado não provém de repositórios preexistentes, mas foi inteiramente construído por meio de um pipeline de coleta automatizada em fontes públicas. A curadoria das fontes seguiu três etapas. Inicialmente, levantaram-se aproximadamente 45 fontes candidatas por meio de consulta a referências bibliográficas, busca em portais especializados em cibersegurança nos mercados brasileiro e norte-americano, e rastreamento de fontes citadas em relatórios de inteligência de ameaças, como o IC3 Annual Report e o IOCTA da Europol.

Na segunda etapa da curadoria, cada fonte candidata foi submetida a três critérios eliminatórios rigorosos. O primeiro critério avaliou a acessibilidade pública, verificando se o portal disponibilizava seus textos sem a necessidade de autenticação, assinatura ou CAPTCHA. O segundo critério exigiu recorrência mínima semanal de publicação de conteúdo pertinente, com ressalva para fontes de publicação mais espaçada cuja profundidade técnica justificava o monitoramento contínuo.

O terceiro critério de seleção focou na viabilidade técnica, que consistiu em um teste manual de “scraping”. Realizou-se uma requisição HTTP combinada com a biblioteca BeautifulSoup, amplamente utilizada para extração de dados em páginas estáticas (Kahlon e Singh, 2024), para verificar se o HTML devolvido continha o conteúdo editorial sem renderização de JavaScript. Fontes que dependiam de JavaScript, bloqueavam por “User-Agent” ou cujos arquivos robots.txt proibiam a indexação foram descartadas.

Das 45 fontes candidatas avaliadas, 35 foram aprovadas nos três crivos, enquanto as demais esbarraram em barreiras como “paywall”, estrutura HTML dinâmica, bloqueio por robots.txt ou frequência insuficiente. As 35 fontes aprovadas incluíram 20 em português e 15 em inglês, garantindo cobertura de golpes específicos do ecossistema brasileiro, como fraudes via Pix e clonagem de WhatsApp, além de ameaças emergentes em mercados mais maduros. Destas, 21 fontes permaneceram ativas durante a coleta.

A coleta de dados foi realizada por meio de pesquisa documental, com extração automatizada de textos publicados em portais públicos de cibersegurança, e levantamento de dados secundários de relatórios institucionais do CERT.br, FEBRABAN e FBI IC3. A extração automatizada de dados da web, técnica consolidada para construir bases analíticas (Lotfi et al., 2022), foi implementada em Python sobre serviços nativos da Amazon Web Services (AWS), utilizando o framework AWS Chalice para empacotamento e implantação.

A orquestração do pipeline de coleta foi realizada por meio do AWS Step Functions, uma estratégia adotada para contornar o limite de 15 minutos por invocação das funções Lambda, conforme documentado como vantajoso em revisões sobre plataformas “serverless” (Shafiei et al., 2022). O fluxo foi dividido em duas funções Lambda: uma função dispatcher e uma função crawler, que operaram sequencialmente para otimizar o processo de extração de dados.

A função dispatcher percorreu as 35 URLs “seed” aprovadas, extraindo os links das páginas de índice utilizando a biblioteca BeautifulSoup e retornando um array JSON com os endereços coletados. Em seguida, a função crawler recebeu cada link individualmente e executou o pipeline completo de extração, classificação e armazenamento. O estado Map do Step Functions distribuiu o array de links entre instâncias do crawler, com concorrência máxima de cinco invocações simultâneas, e cada tarefa dispôs de até duas retentativas automáticas com intervalo exponencial.

O gatilho para o pipeline de coleta foi um agendamento semanal configurado no Amazon EventBridge Scheduler, parametrizado com a expressão CRON cron(0 8 ? * MON *) e fuso horário America/Sao_Paulo. Antes de disparar qualquer requisição HTTP, o crawler calculou o hash MD5 da URL, truncado a 12 caracteres hexadecimais, e consultou uma tabela no Amazon DynamoDB. A existência de um registro prévio resultava no retorno da função com status “skipped”, evitando reprocessamento e consumo computacional desnecessário.

Os documentos coletados foram armazenados em um “data lake” estruturado no Amazon S3, organizado em subpastas nomeadas pela categoria e em formato .txt puro, escolhido pela leveza e compatibilidade com os leitores do Amazon Bedrock (AWS, 2026). Antes da gravação, cada texto passou por uma rotina de anonimização que removeu padrões de Cadastro de Pessoas Físicas (CPF), nomes em formato judicial e endereços residenciais, em conformidade com a Lei Geral de Proteção de Dados Pessoais (LGPD) (ANPD, 2026).

Cada documento aprovado pelo classificador gerou um registro na tabela DynamoDB, que armazenou metadados essenciais para a gestão e recuperação dos dados. Os atributos incluíram um identificador único (`doc_id`), a URL de origem (`url`), o identificador da fonte (`fonte`), a categoria atribuída (`categoria`), o método de classificação (`metodo`), a pontuação bruta da primeira camada (`score_keywords`), o timestamp da coleta (`data_coleta`), o caminho do arquivo no S3 (`s3_key`), o idioma detectado (`idioma`) e o tamanho do texto após limpeza e anonimização (`tamanho_bytes`).

A classificação automática dos dados sobre ilícitos cibernéticos foi realizada por um classificador híbrido de duas camadas sequenciais. Na primeira camada, implementada em Python, cada texto extraído recebeu uma pontuação calculada a partir de quatro faixas de termos bilíngues predefinidos. O dicionário de termos, composto por aproximadamente 120 palavras por idioma, incluía termos de peso positivo e termos de penalização, sendo bilíngue para acomodar fontes internacionais em inglês.

Os limiares de decisão para a primeira camada do classificador foram estabelecidos para otimizar a triagem. Textos com pontuação igual ou superior a cinco foram aceitos imediatamente, utilizando o método `keyword`. Aqueles com pontuação entre dois e quatro foram encaminhados para a segunda camada, designada como “zona cinza”. Textos com pontuação igual ou inferior a um foram rejeitados, aplicando o método `keyword_reject`. Essa estratégia de classificação em camadas ecoa o conceito de processamento hierárquico eficaz em tarefas de triagem textual (Brown et al., 2020).

Os textos que caíram na “zona cinza” foram encaminhados para a segunda camada do classificador, onde foram processados pelo modelo Anthropic Claude 3 Haiku, invocado por meio do Amazon Bedrock via InvokeModel. Os primeiros 1.500 caracteres de cada texto foram enviados com um “prompt” específico que exigia uma resposta em formato JSON. A escolha do Claude 3 Haiku foi motivada por sua eficiência econômica, com um custo estimado de US$ 0,003 por classificação.

Adotou-se uma política de “fail-open” para a segunda camada do classificador: em caso de falha na resposta do modelo de linguagem, o texto era aceito para priorizar a completude do dataset. Documentos aos quais o Claude 3 Haiku não atribuiu nenhuma das categorias predefinidas de golpe não foram descartados, sendo retidos no repositório sob o rótulo `nao_classificado`. Essa decisão intencional permitiu que textos sobre o ecossistema da cibersegurança, mesmo que periféricos, enriquecessem o contexto disponível para o motor RAG.

A camada de inteligência artificial generativa apoiou-se no Amazon Bedrock Knowledge Bases. O Bedrock leu os documentos .txt armazenados no S3, fragmentando cada texto em pedaços semânticos de aproximadamente 300 “tokens” com uma sobreposição de 10% entre fragmentos consecutivos. Essa sobreposição garantiu que informações na fronteira entre dois pedaços não se perdessem, prática recomendada em arquiteturas RAG (Gao et al., 2024).

Cada fragmento de texto foi submetido ao modelo Amazon Titan Text Embeddings V2, que os converteu em vetores de 1.024 dimensões em precisão “float”. Esses vetores foram armazenados no Amazon S3 Vectors, permitindo a recuperação por similaridade de cosseno. Quando um usuário submetia uma pergunta pela interface web, a rota POST /ask acionava a chamada RetrieveAndGenerate do Bedrock, que vetorizava o texto da pergunta e o comparava aos fragmentos indexados.

Os cinco trechos mais próximos foram recuperados e injetados, junto com um “prompt” de sistema, no modelo Amazon Nova 2 Lite (AWS, 2025). O “prompt” continha sete instruções explícitas: responder em português brasileiro, basear-se exclusivamente nos documentos recuperados, incluir orientações práticas de prevenção, indicar canais de denúncia, adotar linguagem acessível, formatar em Markdown e priorizar orientações de emergência caso o usuário aparentasse ser vítima de golpe.

O ponto de acesso ao sistema foi construído em duas partes. No lado do servidor, o AWS Chalice expôs seis rotas REST via Amazon API Gateway, incluindo “health check”, consulta ao assistente RAG, listagem categorizada, scan completo do dataset, estatísticas agregadas e exportação CSV. No lado do cliente, uma página HTML única, sem dependência de frameworks como React ou Angular, foi hospedada como sítio estático em um bucket S3, oferecendo um painel de métricas, uma tabela consultável do dataset e uma janela de conversação com o motor RAG.

A arquitetura “serverless” utilizou diversos serviços da Amazon Web Services para a implementação do pipeline. A Tabela 1 detalha os recursos AWS empregados no projeto, suas funções específicas e as configurações principais que sustentaram a operação do sistema de coleta, classificação e disponibilização de inteligência em cibersegurança.

Tabela 1. Recursos AWS utilizados no projeto

Serviço

Função no projeto

Configuração principal

Amazon EventBridge Scheduler

Gatilho semanal do pipeline

CRON(0 8 ? * MON *) / America/Sao_Paulo

AWS Step Functions

Orquestração dispatcher → crawler

Standard Workflow

AWS Lambda — dispatcher

Coleta de URLs das 35 fontes seed

Python 3.12 / 256 MB / até 15 min

AWS Lambda — crawler

Extração, classificação e armazenamento

Python 3.12 / 512 MB / concorrência 5

Amazon API Gateway

Exposição das 6 rotas REST

HTTP API via AWS Chalice

Amazon S3 — data lake

Armazenamento de documentos .txt por categoria

Subpastas por categoria

Amazon S3 — frontend

Hospedagem da interface web estática

Static website hosting

Amazon DynamoDB

Metadados dos documentos coletados

On-demand / tabela golpes-metadata

Amazon Bedrock — Claude 3 Haiku

Triagem dos textos da zona cinza (Camada 2)

Via InvokeModel API

Amazon Bedrock Knowledge Base

Indexação e recuperação RAG

Fragmentos de 300 tokens / sobreposição 10%

Amazon Titan Text Embeddings V2

Vetorização dos documentos

Vetores de 1.024 dimensões

Amazon S3 Vectors

Armazenamento e busca vetorial

Similaridade de cosseno

Amazon Nova 2 Lite

Geração das respostas conversacionais

Via RetrieveAndGenerate

Fonte: Dados originais da pesquisa

Identificaram-se algumas limitações metodológicas inerentes ao projeto. A paginação restrita à primeira página de cada portal monitorado introduziu um viés potencial em direção ao conteúdo mais recente, o que pode afetar a abrangência temporal dos dados coletados. Além disso, a categoria `outro_golpe`, que representou uma parcela significativa dos documentos, revelou que o vocabulário controlado empregado no classificador ainda não possuía granularidade suficiente para cobrir a diversidade real das fraudes emergentes.

Outra limitação observada foi a sincronização manual da Knowledge Base, que criava uma janela de defasagem de vários dias entre a coleta de novos dados e sua disponibilização para o motor RAG. Essa lacuna, embora passível de eliminação por meio de um gatilho S3 sem custo adicional relevante, representou uma restrição operacional durante o período de desenvolvimento e testes do protótipo.

3. Resultados e Discussão

Ao final da atualização mais recente refletida no painel do sistema, o pipeline de coleta e processamento de dados acumulou um total de 744 documentos, provenientes de 21 fontes ativas, e totalizando aproximadamente 12,5 megabytes de texto bruto armazenado no Amazon S3. Este volume de dados, embora representativo para um estudo de caso exploratório, destaca a natureza dinâmica e os desafios inerentes à coleta automatizada de informações na web. Das 35 fontes inicialmente curadas e aprovadas, 14 deixaram de fornecer conteúdo utilizável ao longo do período de operação do sistema. Este fenômeno não ocorreu de forma instantânea, mas foi um processo gradual, onde algumas fontes inicialmente responsivas passaram a bloquear requisições subsequentes, provavelmente devido à detecção de padrões de acesso automatizado, um comportamento comum de portais que buscam proteger seu conteúdo ou recursos. Outras fontes apresentaram alterações significativas em sua estrutura HTML, tornando os seletores configurados ineficazes e exigindo manutenção manual, que não foi contemplada no escopo deste projeto. Adicionalmente, duas fontes, embora tecnicamente acessíveis, reduziram sua frequência de publicação a um ponto que não mais satisfazia o critério de relevância estabelecido na curadoria inicial.

Este resultado sublinha a volatilidade do ambiente web e a necessidade de estratégias robustas para garantir a continuidade e a integridade da coleta de dados em projetos de web scraping. A literatura sobre o tema, como a revisão de Lotfi et al. (2022), frequentemente aborda as técnicas de extração, mas a estabilidade e a resiliência das fontes são desafios práticos que exigem atenção contínua. A dependência de estruturas HTML estáticas, conforme testado com a biblioteca BeautifulSoup (Kahlon e Singh, 2024), expõe o sistema a vulnerabilidades estruturais que demandam monitoramento e adaptação constantes. A implicação prática dessa constatação é que, mesmo em uma arquitetura “serverless” que minimiza o custo computacional ocioso, a manutenção de um pipeline de coleta de dados da web não é uma tarefa “configure e esqueça”. Ela exige um esforço contínuo de curadoria e adaptação para lidar com as mudanças nos portais de origem, o que pode se tornar um gargalo operacional em larga escala. A resiliência demonstrada pelas mais de duas dezenas de fontes que permaneceram produtivas, contudo, sugere que a arquitetura possui uma capacidade razoável de absorver variações, desde que a curadoria inicial seja rigorosa e os mecanismos de reprocessamento sejam bem definidos.

O classificador híbrido desenvolvido distribuiu os 744 documentos coletados em 14 categorias distintas, conforme detalhado na Tabela 2. A análise dessa distribuição revela insights importantes sobre a natureza do conteúdo coletado e as limitações do vocabulário controlado empregado.

Tabela 2. Distribuição dos 744 documentos por categoria

Categoria

Documentos (n)

Participação (%)

outro_golpe

311

41,8

nao_classificado

150

20,2

ransomware

106

14,2

phishing

69

9,3

falsa_central

37

5,0

data_breach

25

3,4

engenharia_social

13

1,7

deepfake_scam

12

1,6

supply_chain_attack

7

0,9

roubo_identidade

6

0,8

clonagem_whatsapp

4

0,5

crypto_fraud

2

0,3

golpe_pix

1

0,1

sextorsao

1

0,1

Total

744

100,0

Fonte: Resultados originais da pesquisa, painel do sistema CyberSec RAG, abr. 2026

A categoria “outro_golpe” representou a maior parcela dos documentos, com 311 registros, correspondendo a 41,8% do total. Essa predominância é explicada pela natureza dos textos jornalísticos e informativos que compõem o dataset. Muitos artigos abordam fraudes digitais de forma panorâmica, sem se ater a uma modalidade específica, ou descrevem golpes emergentes que ainda não haviam sido incorporados ao dicionário de palavras-chave do classificador. Este achado corrobora a natureza dinâmica e em constante evolução das ameaças cibernéticas, onde novas tipologias de fraude surgem rapidamente, desafiando a capacidade de sistemas de classificação baseados em vocabulários fixos. A implicação prática é a necessidade de um processo contínuo de atualização e expansão do dicionário de termos, talvez incorporando técnicas de aprendizado de máquina para identificar automaticamente novos padrões e termos relevantes, ou utilizando modelos de linguagem mais avançados para sugerir expansões ao vocabulário existente.

Os 150 documentos rotulados como “nao_classificado”, que correspondem a 20,2% do dataset, tangenciaram o tema da cibersegurança sem tratar diretamente de golpes específicos. Essa categoria, embora não classificada em uma fraude particular, foi intencionalmente retida no repositório. A decisão de não descartar esses documentos, alinhada à política de “fail-open” da segunda camada do classificador, permitiu que eles enriquecessem o contexto disponível para o motor RAG. Textos sobre vulnerabilidades técnicas, políticas de privacidade, ou notícias institucionais do ecossistema de cibersegurança, mesmo que periféricos, contribuem para uma base de conhecimento mais abrangente. Essa abordagem é crucial para sistemas RAG, que se beneficiam de um corpus de documentos mais vasto e contextualmente rico para gerar respostas mais informativas e menos propensas a alucinações, conforme destacado por Gao et al. (2024). A retenção desses documentos, portanto, representa um equilíbrio estratégico entre a precisão da classificação e a completude do contexto para a inteligência generativa.

As categorias de baixo volume, como “deepfake_scam” (12 documentos, 1,6%) e “supply_chain_attack” (7 documentos, 0,9%), sinalizaram tendências emergentes e de alta relevância no cenário de cibersegurança. Os registros de “deepfake_scam” documentaram situações onde criminosos empregaram vídeos ou áudios gerados por inteligência artificial para se passar por executivos ou familiares, uma modalidade de fraude cujo crescimento foi registrado pelo FBI IC3 entre 2023 e 2024 (FBI, 2025). Essa forma de ataque se enquadra na categoria de ataques baseados em personificação digital, conforme a taxonomia proposta por Zaoui et al. (2024). A detecção desses casos, mesmo em pequeno número, valida a capacidade do sistema de capturar informações sobre ameaças de ponta, que exigem uma compreensão aprofundada das tecnologias subjacentes e das táticas criminosas.

Similarmente, os sete registros de “supply_chain_attack” descreveram incidentes em que bibliotecas de código aberto foram comprometidas para distribuir “malware”, uma técnica que ganhou notoriedade após o caso XZ Utils em 2024. A inclusão desses temas no dataset demonstra a relevância das fontes monitoradas e a capacidade do pipeline de identificar ameaças complexas que afetam a integridade da cadeia de suprimentos de software. A presença dessas categorias de baixo volume, mas de alto impacto, reforça a importância de um sistema de inteligência que não apenas catalogue fraudes conhecidas, mas também monitore e identifique proativamente as novas táticas e técnicas empregadas por cibercriminosos. A capacidade de identificar essas tendências emergentes é uma vantagem estratégica para a prevenção e resposta a incidentes, permitindo que as organizações e o público se preparem para ameaças antes que se tornem generalizadas.

A eficácia do classificador híbrido foi um dos pilares da validação da arquitetura proposta. Dos 744 documentos processados, 594, o que representa aproximadamente 79,8% do total, foram resolvidos pela primeira camada do classificador, baseada em palavras-chave, sem a necessidade de invocar o modelo de linguagem (LLM). Os 150 documentos restantes, que caíram na “zona cinza” devido à ambiguidade de sua pontuação lexical, foram encaminhados para a segunda camada e processados pelo modelo Anthropic Claude 3 Haiku. Essa proporção de aproximadamente 80/20 corrobora a hipótese central do classificador híbrido: a primeira camada, mais econômica e rápida, absorveu a vasta maioria dos casos inequívocos, reservando a inferência do modelo de linguagem para as situações genuinamente ambíguas.

Este resultado prático demonstra uma redução significativa no volume de inferências pagas, especificamente uma diminuição de cerca de 79,8% nas chamadas ao LLM, em comparação com um cenário onde todos os 744 textos seriam processados pelo Claude 3 Haiku. Tal eficiência é um achado crucial, pois o custo de inferência de LLMs pode ser um fator limitante para a escalabilidade de sistemas baseados em inteligência artificial generativa. A abordagem de processamento hierárquico, que combina regras ponderadas com LLMs, é amplamente reconhecida na literatura por oferecer um equilíbrio superior entre custo e precisão em tarefas de triagem textual (Brown et al., 2020). O presente trabalho valida essa premissa em um contexto prático de cibersegurança, demonstrando que a alocação inteligente de recursos computacionais pode gerar economias substanciais sem comprometer a qualidade da classificação.

A política de “fail-open” adotada para a segunda camada do classificador, onde textos eram aceitos mesmo em caso de falha na resposta do modelo de linguagem, refletiu uma decisão arquitetural consciente. Em um sistema voltado à completude de um corpus de pesquisa sobre cibersegurança, a perda de um documento potencialmente relevante é considerada mais custosa do que a inclusão de um texto marginalmente incerto. Essa estratégia garante que o motor RAG tenha acesso ao maior volume possível de informações, mesmo que parte delas não seja perfeitamente categorizada, enriquecendo o contexto disponível para as consultas dos usuários. A eficácia do classificador híbrido, portanto, não se mede apenas pela precisão de cada camada isoladamente, mas pela sua capacidade de operar de forma sinérgica, otimizando recursos e garantindo a robustez do dataset para a camada de inteligência artificial generativa. Os achados de Chen et al. (2024) sobre a superioridade de abordagens RAG em domínios específicos de cibersegurança são reforçados pela eficiência e precisão alcançadas pelo classificador híbrido, que prepara o terreno para a geração de respostas contextualmente ricas e factualmente precisas.

A análise dos custos operacionais da arquitetura “serverless” revelou um dos resultados mais impactantes do projeto. O custo mensal estimado para a operação completa do sistema foi de apenas US$ 3,40. Este valor contrasta drasticamente com os cerca de US$ 180 mensais que seriam necessários para manter uma instância EC2 t3.medium equivalente, representando uma redução de aproximadamente 98% nos custos de infraestrutura. Essa economia substancial corrobora de forma enfática as análises de Jonas et al. (2019) sobre a superioridade econômica do modelo “serverless” em cargas esporádicas e valida os achados de Shafiei et al. (2022), que identificaram a redução de custos como o benefício mais citado em estudos sobre computação “serverless”.

A implicação prática dessa viabilidade econômica é profunda, especialmente para projetos acadêmicos e iniciativas com recursos limitados. A barreira de entrada para a construção de sistemas complexos de coleta, classificação e disponibilização de inteligência em cibersegurança é significativamente reduzida. Isso democratiza o acesso a tecnologias avançadas de processamento de dados e inteligência artificial, permitindo que pesquisadores e pequenas organizações desenvolvam e implementem soluções robustas sem a necessidade de investimentos pesados em infraestrutura ou de uma equipe dedicada à sua manutenção. A arquitetura “serverless”, ao eliminar a fricção operacional e adotar um modelo de cobrança proporcional ao uso, transforma o custo de infraestrutura de um investimento fixo e contínuo em uma despesa variável e minimizada, alinhando-se perfeitamente às necessidades de projetos com ciclos de uso intermitentes, como o pipeline de coleta semanal implementado. Este resultado não é apenas um argumento teórico, mas uma grandeza mensurável que tem implicações diretas para a sustentabilidade e escalabilidade de futuras pesquisas e aplicações.

A avaliação do assistente conversacional, que comparou as respostas do modelo Amazon Nova 2 Lite com e sem a camada RAG, constituiu o ponto de maior carga probatória do trabalho, conforme apresentado na Tabela 3. Os resultados demonstraram uma diferença substancial na qualidade, precisão factual e utilidade das respostas, validando a eficácia da Geração Aumentada por Recuperação (RAG) em um domínio específico como a cibersegurança.

Tabela 3. Comparação das respostas do Amazon Nova 2 Lite com e sem camada RAG

Pergunta

Com RAG

Sem RAG

“Quais são os golpes mais comuns envolvendo o Pix?”

Enumerou cinco modalidades (sobreposição de tela, falso atendente, QR Code adulterado, engenharia social via WhatsApp e chave Pix de terceiro), com referência às cartilhas do CERT.br e alertas da FEBRABAN; indicou canais de denúncia (Banco Central, PROCON, SaferNet)

Ofereceu conselhos genéricos sobre segurança digital sem citar fontes nem enumerar modalidades específicas de fraude Pix

“O que o CERT.br recomenda contra phishing?”

Reproduziu as seis orientações específicas presentes nos documentos do CERT.br: verificar remetente, não clicar em links, conferir URL, usar autenticação de dois fatores, manter software atualizado e reportar via cert.br/phishing

Fabricou suposta orientação do Banco Central sobre “blindagem de chave Pix”, inexistente nos documentos oficiais exemplo de alucinação (Gao et al., 2024)

“Como os tribunais tratam a clonagem de WhatsApp?”

Apontou enquadramento como estelionato qualificado por meio eletrônico (art. 171 do CP, alterado pela Lei 14.155/2021) e citou precedentes do STJ presentes no data lake

Limitou-se a generalidades jurídicas sem citar legislação específica nem jurisprudência aplicável

Fonte: Resultados originais da pesquisa

Na primeira pergunta, “Quais são os golpes mais comuns envolvendo o Pix?”, o modelo com RAG enumerou cinco modalidades específicas de fraude (sobreposição de tela, falso atendente, QR Code adulterado, engenharia social via WhatsApp e chave Pix de terceiro), com referências explícitas às cartilhas do CERT.br e alertas da FEBRABAN. Adicionalmente, indicou canais de denúncia concretos como o Banco Central, PROCON e SaferNet. Em contraste, a resposta sem RAG ofereceu apenas conselhos genéricos sobre segurança digital, sem citar fontes ou enumerar modalidades específicas de fraude Pix. Essa distinção é crucial, pois a especificidade e a ancoragem em fontes confiáveis aumentam a credibilidade e a utilidade da informação para o usuário, permitindo-lhe identificar e reagir a ameaças de forma mais eficaz.

A segunda pergunta, “O que o CERT.br recomenda contra phishing?”, revelou um problema crítico dos modelos de linguagem sem contexto: a alucinação. O modelo sem RAG fabricou uma suposta orientação do Banco Central sobre “blindagem de chave Pix”, uma recomendação inexistente nos documentos oficiais. Este é um exemplo clássico de alucinação, fenômeno bem documentado na literatura por autores como Gao et al. (2024) e Lewis et al. (2020), onde LLMs geram informações plausíveis, mas factualmente incorretas. Por outro lado, o modelo com RAG reproduziu fielmente as seis orientações específicas presentes nos documentos do CERT.br, incluindo verificar remetente, não clicar em links, conferir URL, usar autenticação de dois fatores, manter software atualizado e reportar via cert.br/phishing. A eliminação de alucinações é um benefício primordial do RAG, garantindo que as respostas sejam baseadas exclusivamente no conhecimento recuperado, o que é vital em domínios onde a desinformação pode ter consequências graves.

Finalmente, a terceira pergunta, “Como os tribunais tratam a clonagem de WhatsApp?”, demonstrou a capacidade do RAG de fornecer informações jurídicas precisas e contextualizadas. O modelo com RAG apontou o enquadramento da clonagem de WhatsApp como estelionato qualificado por meio eletrônico (artigo 171 do Código Penal, alterado pela Lei 14.155/2021) e citou precedentes do Superior Tribunal de Justiça (STJ) presentes no data lake. Em contrapartida, a resposta sem RAG limitou-se a generalidades jurídicas, sem citar legislação específica ou jurisprudência aplicável. Este resultado é de particular interesse para aplicações que exigem precisão em domínios normativos, como a LGPD, o Código Penal e as cartilhas de órgãos reguladores. A inexatidão factual em tais contextos pode desorientar usuários vulneráveis, justamente o público que este sistema pretende alcançar.

Esses resultados convergem com os achados de Chen et al. (2024), que demonstraram que sistemas RAG superam modelos generalistas em fidelidade factual quando aplicados a domínios específicos como o de investigações cibernéticas. A eliminação de alucinações observada no presente trabalho reforça a tese de Gao et al. (2024), segundo a qual a injeção de contexto recuperado reduz drasticamente a probabilidade de fabricação de conteúdo pelo modelo. As implicações práticas são vastas: um assistente conversacional ancorado em RAG pode servir como uma ferramenta confiável para educação pública, suporte a vítimas de golpes, e até mesmo para auxiliar profissionais do direito e da segurança na compreensão de tipologias de fraude e suas implicações legais. A capacidade de fornecer orientações práticas de prevenção e indicar canais de denúncia, como explicitamente instruído no prompt do sistema, eleva o valor do artefato de software para a sociedade, transformando informações dispersas em inteligência acionável e acessível.

Apesar dos resultados promissores, identificaram-se algumas limitações metodológicas inerentes ao projeto que merecem discussão. A paginação restrita à primeira página de cada portal monitorado introduziu um viés potencial em direção ao conteúdo mais recente. Embora essa estratégia tenha sido adotada para otimizar os recursos computacionais e simplificar a lógica do crawler, ela pode afetar a abrangência temporal dos dados coletados, potencialmente negligenciando artigos mais antigos, mas ainda relevantes, ou tendências que se desenvolvem ao longo de um período mais extenso. A implicação é que o dataset pode não ser totalmente representativo da evolução histórica das fraudes, focando mais nas ocorrências e discussões contemporâneas. Para futuras iterações, a implementação de uma estratégia de paginação mais profunda, embora com custo computacional ligeiramente maior, seria benéfica para enriquecer a dimensão temporal do corpus.

Outra limitação observada foi a proporção significativa de documentos classificados na categoria “outro_golpe”, que representou quase 42% do total. Este resultado revelou que o vocabulário controlado empregado no classificador híbrido ainda não possuía granularidade suficiente para cobrir a diversidade real e a rápida emergência de novas fraudes digitais. A constante inovação por parte dos criminosos cibernéticos significa que qualquer dicionário de termos fixo se tornará rapidamente obsoleto. A implicação é a necessidade de um mecanismo de atualização contínua do vocabulário, talvez por meio de técnicas de aprendizado de máquina para identificar novos termos e padrões, ou pela incorporação de feedback humano para refinar as categorias existentes. A expansão e o aprimoramento do dicionário de palavras-chave são cruciais para aumentar a precisão e a granularidade da classificação, permitindo uma análise mais detalhada das tipologias de golpe.

Finalmente, a sincronização manual da Knowledge Base do Amazon Bedrock criou uma janela de defasagem de vários dias entre a coleta de novos dados e sua disponibilização para o motor RAG. Essa lacuna, embora passível de eliminação por meio de um gatilho S3 sem custo adicional relevante, representou uma restrição operacional durante o período de desenvolvimento e testes do protótipo. A implicação dessa limitação é que o sistema, em sua configuração de teste, não operava em tempo real, o que poderia comprometer a relevância das respostas em um cenário de ameaças cibernéticas em rápida evolução. A automação da sincronização da Knowledge Base é uma melhoria direta e de baixo custo que transformaria o sistema em uma fonte de inteligência quase em tempo real, crucial para a eficácia na detecção e prevenção de fraudes emergentes. Essas limitações, embora presentes, não invalidam os resultados centrais do projeto, mas fornecem um roteiro claro para o aprimoramento e a expansão da arquitetura em futuras pesquisas e implementações.

4. Conclusão

Conclui-se que o objetivo foi atingido, uma vez que a arquitetura de software integralmente “serverless” para web scraping, classificação híbrida de dados sobre ilícitos cibernéticos e disponibilização de inteligência via interface conversacional RAG foi projetada, desenvolvida e validada com sucesso. A solução demonstrou notável viabilidade econômica, com um custo operacional mensal de apenas US$ 3,40, validando a premissa de que a computação “serverless” é ideal para projetos acadêmicos e com recursos limitados. A eficácia do classificador híbrido, que resolveu aproximadamente 80% dos casos na primeira camada lexical, otimizou o uso de recursos de LLM. Mais crucialmente, o assistente conversacional alimentado por RAG eliminou alucinações e forneceu respostas factualmente precisas e contextualizadas, superando significativamente o modelo sem contexto em domínios normativos e de cibersegurança.

Apesar dos resultados promissores, o projeto apresentou limitações instrutivas. A paginação restrita à primeira página dos portais introduziu um viés para o conteúdo mais recente, e a alta incidência da categoria “outro_golpe” revelou a necessidade de um vocabulário controlado mais granular e dinâmico para acompanhar a evolução das fraudes. Adicionalmente, a sincronização manual da Knowledge Base do RAG gerou uma defasagem temporal na atualização das informações. Para estudos futuros, sugere-se a implementação de estratégias de paginação mais profundas, o desenvolvimento de mecanismos de atualização automática do vocabulário do classificador, possivelmente com o auxílio de aprendizado de máquina, e a automação da sincronização da base de conhecimento do RAG para garantir a relevância quase em tempo real das informações.

Referências Bibliográficas

Amazon Web Services [AWS]. 2025. Introducing Amazon Nova 2 Lite, a fast, cost-effective reasoning model. Disponível em: https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/. Acesso em: 07 abr. 2026.

Amazon Web Services [AWS]. 2026. How Amazon Bedrock knowledge bases work. Disponível em: https://docs.aws.amazon.com/bedrock/latest/userguide/kb-how-it-works.html. Acesso em: 26 mar. 2026.

Autoridade Nacional de Proteção de Dados [ANPD]. 2026. Estudo técnico – A LGPD e o tratamento de dados pessoais para fins acadêmicos e para a realização de estudos por órgão de pesquisa. Disponível em: https://www.gov.br/anpd/pt-br/centrais-de-conteudo/documentos-tecnicos-orientativos/estudo-tecnico-a-lgpd-e-o-tratamento-de-dados-pessoais-para-fins-academicos-e-para-a-realizacao-de-estudos-por-orgao-de-pesquisa.pdf. Acesso em: 26 mar. 2026.

Banco Central do Brasil [BCB]. 2026. Pix em números. Disponível em: https://www.bcb.gov.br/estabilidadefinanceira/pix-em-numeros-estatisticas. Acesso em: 26 mar. 2026.

Birthriya, S.K.; Ahlawat, P.; Jain, A.K. 2024. A comprehensive survey of social engineering attacks: taxonomy of attacks, prevention, and mitigation strategies. Journal of Applied Security Research 20(2): 244-292.

Brown, T.B.; Mann, B.; Ryder, N.; Subbiah, M.; Kaplan, J.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; Agarwal, S.; Herbert-Voss, A.; Krueger, G.; Henighan, T.; Child, R.; Ramesh, A.; Ziegler, D.M.; Wu, J.; Winter, C.; Hesse, C.; Chen, M.; Sigler, E.; Litwin, M.; Gray, S.; Chess, B.; Clark, J.; Berner, C.; McCandlish, S.; Radford, A.; Sutskever, I.; Amodei, D. 2020. Language models are few-shot learners. Advances in Neural Information Processing Systems 33: 1877-1901.

Centro de Estudos, Resposta e Tratamento de Incidentes de Segurança no Brasil [CERT.br]. 2026. Phishing e outros golpes Cartilha de segurança para internet. Disponível em: https://cartilha.cert.br/fasciculos/phishing-golpes/fasciculo-phishing-golpes.pdf. Acesso em: 26 mar. 2026.

Chen, Z.; Li, Z.; Liu, Y.; Zhao, P.; Luo, J.; Hong, L. 2024. A RAG-based question-answering solution for cyber-attack investigation and attribution. ArXiv. Disponível em: https://arxiv.org/html/2408.06272v1. Acesso em: 26 mar. 2026.

Federal Bureau of Investigation [FBI]. 2025. 2024 Internet Crime Report. Disponível em: https://www.ic3.gov/AnnualReport/Reports/2024 IC3Report.pdf. Acesso em:

Federal Bureau of Investigation [FBI]. 2025. 2024 Internet Crime Report. Disponível em: https://www.ic3.gov/AnnualReport/Reports/2024 IC3Report.pdf. Acesso em: 07 abr. 2026.

Federação Brasileira de Bancos [FEBRABAN]. 2024. Saiba quais foram os 10 golpes mais aplicados contra clientes bancários em 2024. Disponível em: https://portal.febraban.org.br/noticia/4279/pt-br/. Acesso em: 26 mar. 2026.

Gao, Y.; Xiong, Y.; Gao, X.; Jia, K.; Pan, J.; Bi, Y.; Dai, Y.; Sun, J.; Wang, M.; Wang, H. 2024. Retrieval-augmented generation for large language models: a survey. ArXiv. Disponível em: https://arxiv.org/abs/2312.10997. Acesso em: 07 abr. 2026.

Gil, 2017 [Referência completa não encontrada no documento original]

Hassan, H.B.; Barakat, S.; Sarhan, Q. 2021. Survey on serverless computing. Journal of Cloud Computing 10(1): 1-29.

Jonas, E.; Schleier-Smith, J.; Sreekanti, V.; Tsai, C.; Khandelwal, A.; Pu, Q.; Shankar, V.; Carreira, J.; Krauth, K.; Yadwadkar, N.; Gonzalez, J.; Popa, R.; Stoica, I.; Patterson, D. 2019. Cloud programming simplified: a Berkeley view on serverless computing. ArXiv. Disponível em: https://arxiv.org/abs/1902.03383. Acesso em: 26 mar. 2026.

Kahlon, N.K.; Singh, W. 2024. Comparative analysis of web scraping tools for low-resource languages. International Journal of Engineering Trends and Technology 72(1): 284-299.

Lewis, P.; Perez, E.; Piktus, A.; Petroni, F.; Karpukhin, V.; Goyal, N.; Küttler, H.; Lewis, M.; Yih, W.; Rocktäschel, T.; Riedel, S.; Kiela, D. 2020. Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information Processing Systems 33: 9459-9474.

Lotfi, C.; Srinivasan, S.; Ertz, M.; Latrous, I. 2022. Web scraping techniques and applications: a literature review. Proceedings of the SCRS Conference on Intelligent Systems: 381-394.

Shafiei, H.; Khonsari, A.; Mousavi, P. 2022. Serverless computing: a survey of opportunities, challenges, and applications. ACM Computing Surveys 54(11s): 1-32.

Zaoui, M.; Bettahar, F.; Saidi, M. 2024. A comprehensive taxonomy of social engineering attacks and defense mechanisms: toward effective mitigation strategies. IEEE Access 12: 76244-76267.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

17 de setembro de 2026

Heterogeneidade Territorial do Bolsa Família: uma Análise por Clusters e Efeitos Fixos

O Programa Bolsa Família (PBF) representa uma das políticas de proteção social mais relevantes globalmente, o que justifica a investigação de seus efeitos diante das acentuadas e heterogêneas desigualdades regionais brasileiras. O estudo avaliou os reflexos socioeconômicos dos repasses do programa sobre a saúde, a educação e o mercado de trabalho nos municípios brasileiros, no período de 2004 a 2019. Para isso, aplicou-se a técnica de agrupamento K-means para segmentação territorial e estimaram-se modelos econométricos de dados em painel com efeitos fixos, tanto a nível nacional quanto segregados por clusters. Os resultados revelaram a natureza anticíclica do PBF no mercado de trabalho, com uma relação negativa entre repasses e vínculos empregatícios formais em quatro dos cinco clusters, sugerindo que os recursos foram mais intensos onde o mercado formal falhou. Na saúde, o programa associou-se à redução significante da mortalidade infantil evitável em municípios com maior equilíbrio socioeconômico, mas não apresentou efeito detectável em agrupamentos de maior precariedade estrutural, indicando que a transferência de renda é necessária, porém insuficiente sem infraestrutura de saúde funcional. Na educação, a análise por subperíodos mostrou atenuação progressiva do coeficiente nacional, refletindo a convergência das taxas de matrícula para um patamar de alta inércia temporal. Concluiu-se que o PBF cumpriu seu objetivo de proteção social de forma anticíclica e territorialmente focalizada, mas sua capacidade de transformar indicadores estruturais dependeu da sinergia com investimentos em infraestrutura pública.

Palavras-chave: Bolsa Família; Mortalidade Infantil; Municípios Brasileiros; Painel de Dados; Política Pública.

Gestão Tributária

17 de setembro de 2026

Limites Jurídicos e Práticos da Dedutibilidade Retroativa dos Juros sobre Capital Próprio

A gestão tributária adequada é crucial para a saúde financeira das empresas, especialmente no complexo sistema tributário brasileiro. Os Juros sobre Capital Próprio (JCP) constituem um mecanismo jurídico relevante para a remuneração do capital próprio, utilizado para otimizar a carga tributária. O estudo investigou a controvérsia sobre a dedutibilidade de JCP referentes a exercícios anteriores à deliberação societária que autoriza seu pagamento. Aplicou-se a metodologia de pesquisa e análise documental empírica, baseada em “Normative Systems”, para identificar cinco propriedades representativas dos argumentos jurídicos na jurisprudência administrativa e judicial. Analisaram-se acórdãos do Conselho Administrativo de Recursos Fiscais (CARF), revelando padrões decisórios predominantes, divergências interpretativas, incoerências argumentativas e significativa insegurança jurídica. Os resultados indicaram forte tendência de invalidação dos planejamentos envolvendo JCP extemporâneos na esfera administrativa. Contudo, o julgamento do Tema 1319 pelo Superior Tribunal de Justiça (STJ) seguiu direção oposta, consagrando tese favorável à dedutibilidade e estabelecendo um precedente paradigmático que pode influenciar a jurisprudência administrativa e redefinir os critérios decisórios.

Palavras-chave: CARF; gestão tributária; limitação temporal; lucro real; planejamento tributário.

17 de setembro de 2026

Símbolos da Moda Esportiva: Consumo, Identidade e Status entre Consumidores Brasileiros

A moda esportiva consolidou-se como linguagem simbólica de distinção social nas últimas décadas, impulsionada pela expansão do mercado de wellness e pela reconfiguração dos padrões de prestígio nas sociedades de consumo contemporâneas. O estudo objetivou compreender como os símbolos da moda esportiva influenciaram a construção de identidade e pertencimento e sua associação ao prestígio social entre consumidores brasileiros que adquiriram produtos do setor nos últimos 12 meses. Desenvolveu-se a pesquisa por meio de levantamento bibliográfico e pesquisa descritiva, com levantamento do tipo survey aplicado a uma amostra não probabilística por conveniência de 445 consumidores brasileiros de moda esportiva. Os principais resultados indicaram que a maioria dos respondentes associou marcas esportivas a percepções de status social; mais da metade reconheceu o wellness como novo símbolo de prestígio; e parcela expressiva percebeu o sportstyle como mais aceito em ambientes formais de trabalho. Em contrapartida, formas ostensivas de sinalização, como preferência por logotipos visíveis, influência de redes sociais e disposição a pagar sobrepreço, foram amplamente rejeitadas, revelando uma dissociação entre a atribuição simbólica de status e o comportamento de sinalização ostensiva. O consumidor brasileiro de moda esportiva com elevado capital cultural operou por meio de sinais simbólicos sutis e não ostensivos, compatíveis com o fenômeno do consumo inconspícuo, no qual a distinção social se manifestou de forma internalizada.

Palavras-chave: Consumo inconspícuo; Distinção; Prestígio social; Sportstyle; Wellness.

17 de setembro de 2026

Modelo Validado de Formação de Competência Técnica e Habilidades Não Técnicas em Indústrias Químicas Complexas

Analisou-se a implementação de um processo sistemático para o desenvolvimento e a atualização de competências técnicas e habilidades não técnicas em Operações Industriais e Segurança de Processo em uma indústria química de alta complexidade, pertencente a uma multinacional localizada no Polo Petroquímico de Camaçari, Bahia. O estudo objetivou implementar um processo mensurável e sustentável que assegurou a competência técnica e não técnica de 100% dos operadores, em conformidade com a legislação estadual da Bahia, diretrizes de institutos internacionais e políticas corporativas. A pesquisa caracterizou-se como um estudo de caso de abordagem mista, que envolveu diagnóstico documental, entrevistas semiestruturadas com 85 operadores experientes, análise de tarefas críticas e o desenvolvimento e aplicação piloto de um programa modular de treinamento. Este processo evidenciou a necessidade de alinhamento e atualização sistemática das competências requeridas. Os resultados obtidos indicaram a eficácia do modelo proposto, com 100% dos operadores concluindo os módulos teóricos e práticos e alcançando uma taxa de aprovação superior a 80%, além de conformidade operacional em campo. O trabalho contribuiu com um modelo estruturado de formação, incluindo matriz de competências, programas modulares de treinamento e diretrizes para certificação e recertificação, demonstrando potencial de replicação em outras unidades industriais de elevada complexidade e risco, e fortalecendo a segurança de processo e a sustentabilidade operacional.

Palavras-chave: Capacitação; Competência; Habilidades não técnicas; Segurança de processo; Treinamento.

Compliance E Esg

17 de setembro de 2026

Governança Pública Climática e Enchentes de 2024 no Rio Grande do Sul

As enchentes de 2024 no Rio Grande do Sul evidenciaram fragilidades estruturais na governança pública em um contexto federativo submetido a risco climático extremo. Este trabalho analisou, no recorte temporal de maio de 2024 a maio de 2025, como a atuação federal, estadual e municipal se estruturou diante da crise e em que medida a comparação com os Países Baixos ofereceu parâmetros úteis para o fortalecimento da resiliência institucional. A pesquisa adotou abordagem qualitativa, aplicada, exploratória e comparativa, com análise documental e análise de conteúdo de fontes oficiais, relatórios técnicos internacionais, atos normativos e pronunciamentos institucionais, organizados por categorias temáticas e interpretados com apoio do Modelo das Três Linhas do IIA. Os resultados mostraram que, embora os três níveis de governo tenham criado ou reestruturado instrumentos relevantes de coordenação e reconstrução após o desastre, prevaleceu uma institucionalidade reativa, posterior ao evento, com lacunas de continuidade administrativa, integração preventiva, monitoramento e accountability. Na comparação internacional, o modelo neerlandês destacou-se por combinar autoridade operacional permanente, base territorial clara, financiamento próprio e mecanismos mais robustos de monitoramento e responsabilização. Concluiu-se que os impactos das enchentes foram agravados menos pela ausência formal de normas e mais pela insuficiente articulação entre operação, gestão de riscos e controle. O fortalecimento da governança climática, no caso gaúcho, depende de institucionalizar coordenação, dados, financiamento e accountability em bases permanentes.

Palavras-chave: accountability; adaptação climática; gestão de riscos; governança multinível.

Digital Business

17 de setembro de 2026

Dados e Automação Utilizados em uma Campanha de Marketing na Engenharia Civil

A crescente utilização de dados no marketing digital impulsionou a adoção de estratégias mais orientadas por métricas e desempenho, com o Inbound Marketing em destaque. O uso de ferramentas de Business Intelligence (BI) mostrou-se fundamental para transformar dados em informações estratégicas, apoiando a tomada de decisão e a construção de bases de contatos qualificadas. Analisou-se como a ausência de integração entre sistemas de BI e plataformas de automação de marketing impactou a eficiência operacional e a efetividade das estratégias de Inbound Marketing em uma empresa de engenharia. Para isso, adotou-se uma abordagem descritiva de natureza qualitativa, baseada na análise dos processos operacionais envolvidos, desde a leitura de relatórios extraídos do BI e sua posterior transformação em mailings, até a preparação para importação no RD Station. Os resultados indicaram que o processo atual dependia de etapas manuais e empíricas, demandando tempo significativo. Identificaram-se limitações relacionadas à ausência de integração entre os sistemas, o que impactou diretamente a eficiência operacional e aumentou a dependência de atividades repetitivas. Concluiu-se que a estruturação adequada do processo de gestão de mailings e a integração entre BI e ferramentas de automação de marketing representam uma oportunidade para otimizar fluxos, melhorar a qualidade dos dados e fortalecer as estratégias de Inbound Marketing.

Palavras-chave: Automação de Marketing; Business Intelligence; Inbound Marketing; Integração de Sistemas; RD Station.

17 de setembro de 2026

Detecção de Anomalias no Monitoramento de Saúde de Pontes Usando Redes Neurais

O monitoramento da saúde estrutural de pontes tornou-se cada vez mais relevante diante do envelhecimento das infraestruturas e da intensificação de eventos extremos associados às mudanças climáticas. Nesse contexto, abordagens baseadas em dados destacaram-se como alternativas promissoras para o reconhecimento de anomalias. O estudo objetivou desenvolver e avaliar uma abordagem baseada em aprendizado de máquina para o reconhecimento de anomalias em séries temporais de aceleração estrutural. A metodologia adotada consistiu no uso de autoencoders treinados exclusivamente com dados representativos da condição íntegra, permitindo ao modelo aprender padrões associados ao estado saudável da estrutura; em seguida, o erro de reconstrução, quantificado por meio do erro quadrático médio (MSE), foi utilizado como critério para identificação de desvios em relação a essa condição. O conjunto de dados analisado foi composto por 1767 séries temporais de 1000 pontos cada, pertencentes a duas classes: íntegra (normal) e anômala (danificada). Os resultados obtidos demonstraram que o modelo proposto apresentou elevada capacidade de reconhecimento da classe anômala, com taxa de detecção superior a 90%, e desempenho global satisfatório, com área sob a curva ROC (AUC) próxima de 0,78, indicando boa capacidade discriminativa e reforçando o potencial da abordagem para aplicações em monitoramento estrutural.

Palavras-chave: Autoencoders; Detecção de Anomalias; Monitoramento de Pontes; Redes Neurais.

17 de setembro de 2026

Gestão Escolar Integrada: o Papel da Direção Administrativa na Capacitação da Equipe de Gestão Pedagógica para a Compreensão do Orçamento Escolar

A administração escolar foi abordada sob a perspectiva da integração entre gestores administrativos e pedagógicos, com foco na participação democrática, capacitação e qualificação dos atores. O objetivo geral consistiu na elaboração de um Guia de Orientações para Orçamento, direcionado à equipe de gestão pedagógica e mediado pela direção administrativa, visando instrumentalizar esses profissionais para a compreensão e participação nos processos financeiros e decisórios da instituição. Para tanto, o estudo desenvolveu-se em uma instituição particular privada, adotando uma abordagem qualitativa, descritiva e aplicada, com procedimento metodológico de estudo de caso. A pesquisa mapeou desafios práticos e dificuldades de comunicação entre os setores, analisou referenciais teóricos da gestão escolar e estruturou o instrumento formativo proposto. Os resultados demonstraram que a ausência de integração entre as áreas administrativa e pedagógica pode comprometer a efetividade da gestão escolar, evidenciando a necessidade de processos formativos contínuos que promovam entendimento mútuo, cooperação e construção coletiva de soluções. O Guia proposto fortaleceu a gestão democrática, elevou a qualificação da equipe pedagógica e melhorou os processos decisórios institucionais, destacando o papel formativo e estratégico do diretor administrativo.

Palavras-chave: Comunicação escolar; Gestão escolar participativa; Orçamento escolar.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade