Artigo

05 de agosto de 2026

Arquitetura “serverless” para “web scraping” e inteligência artificial generativa em cibersegurança

Jansen Augusto Osorio; Elisa Antolli

DOI: 10.22167/2675-6528-202600963

Artigo elaborado pela ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege voltada à síntese e redação.

Resumo

Diante da fragmentação do conhecimento sobre fraudes digitais, desenvolveu-se uma arquitetura de software integralmente “serverless” para coleta automatizada de dados na web e disponibilização de inteligência em cibersegurança. O objetivo foi projetar, desenvolver e validar um sistema capaz de varrer portais públicos, categorizar dados sobre ilícitos cibernéticos por meio de um classificador híbrido de duas camadas e oferecer uma interface conversacional alimentada por Geração Aumentada por Recuperação (RAG). A implementação utilizou Python e serviços nativos da Amazon Web Services (AWS), com um pipeline de captura orquestrado por AWS Step Functions e Amazon EventBridge Scheduler. Os textos extraídos passaram por um classificador híbrido, combinando pontuação por palavras-chave e triagem pelo modelo Claude 3 Haiku via Amazon Bedrock. Os documentos aprovados foram armazenados em um data lake no Amazon S3, indexados no Amazon DynamoDB e vetorizados pelo Amazon Titan Text Embeddings V2 para alimentar o motor RAG, que utilizou Amazon Nova 2 Lite para gerar respostas. O sistema acumulou 744 documentos de 21 fontes ativas, totalizando 12,5 MB em 14 categorias de golpe. A camada de palavras-chave resolveu 79,8% dos casos, reduzindo significativamente as chamadas ao LLM. O assistente conversacional demonstrou eliminação de alucinações e precisão factual superior em comparação com o modelo sem contexto. A arquitetura revelou-se economicamente viável, com custo operacional inferior a US$ 3,50 mensais, representando uma redução de 98% em relação à infraestrutura convencional. Concluiu-se que a combinação de computação “serverless”, web scraping e inteligência artificial generativa oferece uma alternativa madura e financeiramente acessível para sistemas de vigilância temática em cibersegurança.

Palavras-chave: Computação em nuvem; Extração automatizada de dados; Geração Aumentada por Recuperação; Golpes digitais.

1. Introdução

A digitalização acelerada dos serviços financeiros reconfigurou as interações econômicas e sociais, especialmente no Brasil, onde o sistema de pagamentos instantâneos Pix, do Banco Central do Brasil (2026), já ultrapassa trezentos milhões de transações diárias. Essa conveniência, contudo, expandiu a superfície de ataque para criminosos digitais. A Federação Brasileira de Bancos (2024) aponta que a maioria dos golpes contra correntistas explora vulnerabilidades psicológicas, um fenômeno alinhado à taxonomia de engenharia social de Zaoui et al. (2024). Internacionalmente, o Internet Crime Complaint Center (2025), do FBI, registrou perdas superiores a dezesseis bilhões de dólares nos Estados Unidos em 2024. No Brasil, o Centro de Estudos, Resposta e Tratamento de Incidentes de Segurança (2026) observa uma crescente sofisticação em táticas como phishing e clonagem de aplicativos. Birthriya et al. (2024) reforçam que a exploração de vulnerabilidades humanas, e não falhas técnicas, torna a conscientização e a catalogação de fraudes tão essenciais quanto as contramedidas tecnológicas.

Apesar da urgência, o conhecimento sobre tipologias de fraudes, mecanismos e jurisprudência permanece fragmentado em diversas fontes públicas, dificultando a compreensão e a defesa eficazes. Nesse cenário, a extração automatizada de dados da web, técnica consolidada para construir bases analíticas a partir de fontes públicas (Lotfi et al., 2022), apresenta-se como uma alternativa viável. No entanto, a manutenção de infraestruturas convencionais para coleta contínua gera custos operacionais elevados, pois servidores virtuais consomem recursos mesmo em ociosidade (Hassan et al., 2021). Para contornar essa barreira, o modelo de computação “serverless” emerge como um paradigma promissor na nuvem. Jonas et al. (2019) argumentam que o “serverless” elimina a fricção operacional e adota cobrança proporcional ao uso, uma vantagem econômica confirmada por Shafiei et al. (2022), que identificaram a redução de custos como o benefício mais citado em estudos sobre essa arquitetura.

Paralelamente, os Grandes Modelos de Linguagem (LLMs) revolucionaram a busca e síntese de conteúdo, mas exibem uma fragilidade notória em domínios específicos como a cibersegurança: a tendência a produzir “alucinações”, ou seja, afirmações com aparência de veracidade sem correspondência factual (Gao et al., 2024). Para mitigar essa limitação, a arquitetura de Geração Aumentada por Recuperação (RAG) ancora as respostas do modelo a um repositório vetorial próprio, injetando contexto factual no momento da consulta e restringindo a geração ao que efetivamente consta nos documentos fornecidos (Lewis et al., 2020). Chen et al. (2024) demonstraram a superioridade do RAG em sistemas de perguntas e respostas sobre investigações de crimes cibernéticos, superando modelos generalistas sem contexto e bases de regras estáticas em fidelidade factual. Além disso, no campo da classificação automática de textos, abordagens híbridas que combinam regras ponderadas com LLMs oferecem um equilíbrio otimizado entre custo e precisão, reservando a inferência do modelo para os casos genuinamente ambíguos e economizando recursos (Brown et al., 2020).

A fragmentação do conhecimento sobre fraudes digitais e a necessidade de inteligência em cibersegurança acessível e atualizada justificam a busca por soluções inovadoras. A combinação da eficiência econômica da computação “serverless” com a capacidade de processamento e contextualização da inteligência artificial generativa, mediada por RAG e classificador híbrido, oferece um caminho promissor para superar as limitações das abordagens existentes. Assim, o presente trabalho teve como objetivo projetar, desenvolver e validar uma arquitetura de software integralmente “serverless” para web scraping, implementada em Python sobre serviços nativos da Amazon Web Services (AWS), capaz de varrer portais públicos nacionais e internacionais, categorizar automaticamente dados sobre ilícitos cibernéticos por meio de um classificador híbrido de duas camadas e disponibilizá-los por meio de uma interface conversacional alimentada por RAG, com custo operacional compatível com projetos acadêmicos e descrição suficiente para reprodução por terceiros.

2. Material e Métodos

Este trabalho configurou-se como uma pesquisa de natureza aplicada, focada na construção e validação de um artefato de software. O objetivo exploratório buscou ampliar a compreensão sobre a viabilidade de combinar coleta automatizada de dados, classificação híbrida de conteúdo e inteligência artificial generativa em uma arquitetura de baixo custo, um tema ainda pouco investigado de forma integrada na literatura (Gil, 2017). Adotou-se uma abordagem metodológica mista, com aspectos qualitativos na curadoria das fontes e na avaliação do assistente conversacional, e quantitativos na mensuração do volume de documentos, distribuição por categoria e custos operacionais.

O delineamento da pesquisa consistiu em um estudo de caso único, tendo como unidade de análise a arquitetura “serverless” desenvolvida e implantada em ambiente de produção na Amazon Web Services (AWS). O contexto do estudo abrangeu a área de cibersegurança, com foco em fraudes digitais. A coleta de dados ocorreu durante todo o período de testes do protótipo, com agendamento semanal, e a infraestrutura foi provisionada na região us-east-2 (Ohio) da AWS, selecionada pelo suporte simultâneo a tecnologias essenciais ao projeto.

O conjunto de dados utilizado não provém de repositórios preexistentes, mas foi inteiramente construído por meio de um pipeline de coleta automatizada em fontes públicas. A curadoria das fontes seguiu três etapas. Inicialmente, levantaram-se aproximadamente 45 fontes candidatas por meio de consulta a referências bibliográficas, busca em portais especializados em cibersegurança nos mercados brasileiro e norte-americano, e rastreamento de fontes citadas em relatórios de inteligência de ameaças, como o IC3 Annual Report e o IOCTA da Europol.

Na segunda etapa da curadoria, cada fonte candidata foi submetida a três critérios eliminatórios rigorosos. O primeiro critério avaliou a acessibilidade pública, verificando se o portal disponibilizava seus textos sem a necessidade de autenticação, assinatura ou CAPTCHA. O segundo critério exigiu recorrência mínima semanal de publicação de conteúdo pertinente, com ressalva para fontes de publicação mais espaçada cuja profundidade técnica justificava o monitoramento contínuo.

O terceiro critério de seleção focou na viabilidade técnica, que consistiu em um teste manual de “scraping”. Realizou-se uma requisição HTTP combinada com a biblioteca BeautifulSoup, amplamente utilizada para extração de dados em páginas estáticas (Kahlon e Singh, 2024), para verificar se o HTML devolvido continha o conteúdo editorial sem renderização de JavaScript. Fontes que dependiam de JavaScript, bloqueavam por “User-Agent” ou cujos arquivos robots.txt proibiam a indexação foram descartadas.

Das 45 fontes candidatas avaliadas, 35 foram aprovadas nos três crivos, enquanto as demais esbarraram em barreiras como “paywall”, estrutura HTML dinâmica, bloqueio por robots.txt ou frequência insuficiente. As 35 fontes aprovadas incluíram 20 em português e 15 em inglês, garantindo cobertura de golpes específicos do ecossistema brasileiro, como fraudes via Pix e clonagem de WhatsApp, além de ameaças emergentes em mercados mais maduros. Destas, 21 fontes permaneceram ativas durante a coleta.

A coleta de dados foi realizada por meio de pesquisa documental, com extração automatizada de textos publicados em portais públicos de cibersegurança, e levantamento de dados secundários de relatórios institucionais do CERT.br, FEBRABAN e FBI IC3. A extração automatizada de dados da web, técnica consolidada para construir bases analíticas (Lotfi et al., 2022), foi implementada em Python sobre serviços nativos da Amazon Web Services (AWS), utilizando o framework AWS Chalice para empacotamento e implantação.

A orquestração do pipeline de coleta foi realizada por meio do AWS Step Functions, uma estratégia adotada para contornar o limite de 15 minutos por invocação das funções Lambda, conforme documentado como vantajoso em revisões sobre plataformas “serverless” (Shafiei et al., 2022). O fluxo foi dividido em duas funções Lambda: uma função dispatcher e uma função crawler, que operaram sequencialmente para otimizar o processo de extração de dados.

A função dispatcher percorreu as 35 URLs “seed” aprovadas, extraindo os links das páginas de índice utilizando a biblioteca BeautifulSoup e retornando um array JSON com os endereços coletados. Em seguida, a função crawler recebeu cada link individualmente e executou o pipeline completo de extração, classificação e armazenamento. O estado Map do Step Functions distribuiu o array de links entre instâncias do crawler, com concorrência máxima de cinco invocações simultâneas, e cada tarefa dispôs de até duas retentativas automáticas com intervalo exponencial.

O gatilho para o pipeline de coleta foi um agendamento semanal configurado no Amazon EventBridge Scheduler, parametrizado com a expressão CRON cron(0 8 ? * MON *) e fuso horário America/Sao_Paulo. Antes de disparar qualquer requisição HTTP, o crawler calculou o hash MD5 da URL, truncado a 12 caracteres hexadecimais, e consultou uma tabela no Amazon DynamoDB. A existência de um registro prévio resultava no retorno da função com status “skipped”, evitando reprocessamento e consumo computacional desnecessário.

Os documentos coletados foram armazenados em um “data lake” estruturado no Amazon S3, organizado em subpastas nomeadas pela categoria e em formato .txt puro, escolhido pela leveza e compatibilidade com os leitores do Amazon Bedrock (AWS, 2026). Antes da gravação, cada texto passou por uma rotina de anonimização que removeu padrões de Cadastro de Pessoas Físicas (CPF), nomes em formato judicial e endereços residenciais, em conformidade com a Lei Geral de Proteção de Dados Pessoais (LGPD) (ANPD, 2026).

Cada documento aprovado pelo classificador gerou um registro na tabela DynamoDB, que armazenou metadados essenciais para a gestão e recuperação dos dados. Os atributos incluíram um identificador único (`doc_id`), a URL de origem (`url`), o identificador da fonte (`fonte`), a categoria atribuída (`categoria`), o método de classificação (`metodo`), a pontuação bruta da primeira camada (`score_keywords`), o timestamp da coleta (`data_coleta`), o caminho do arquivo no S3 (`s3_key`), o idioma detectado (`idioma`) e o tamanho do texto após limpeza e anonimização (`tamanho_bytes`).

A classificação automática dos dados sobre ilícitos cibernéticos foi realizada por um classificador híbrido de duas camadas sequenciais. Na primeira camada, implementada em Python, cada texto extraído recebeu uma pontuação calculada a partir de quatro faixas de termos bilíngues predefinidos. O dicionário de termos, composto por aproximadamente 120 palavras por idioma, incluía termos de peso positivo e termos de penalização, sendo bilíngue para acomodar fontes internacionais em inglês.

Os limiares de decisão para a primeira camada do classificador foram estabelecidos para otimizar a triagem. Textos com pontuação igual ou superior a cinco foram aceitos imediatamente, utilizando o método `keyword`. Aqueles com pontuação entre dois e quatro foram encaminhados para a segunda camada, designada como “zona cinza”. Textos com pontuação igual ou inferior a um foram rejeitados, aplicando o método `keyword_reject`. Essa estratégia de classificação em camadas ecoa o conceito de processamento hierárquico eficaz em tarefas de triagem textual (Brown et al., 2020).

Os textos que caíram na “zona cinza” foram encaminhados para a segunda camada do classificador, onde foram processados pelo modelo Anthropic Claude 3 Haiku, invocado por meio do Amazon Bedrock via InvokeModel. Os primeiros 1.500 caracteres de cada texto foram enviados com um “prompt” específico que exigia uma resposta em formato JSON. A escolha do Claude 3 Haiku foi motivada por sua eficiência econômica, com um custo estimado de US$ 0,003 por classificação.

Adotou-se uma política de “fail-open” para a segunda camada do classificador: em caso de falha na resposta do modelo de linguagem, o texto era aceito para priorizar a completude do dataset. Documentos aos quais o Claude 3 Haiku não atribuiu nenhuma das categorias predefinidas de golpe não foram descartados, sendo retidos no repositório sob o rótulo `nao_classificado`. Essa decisão intencional permitiu que textos sobre o ecossistema da cibersegurança, mesmo que periféricos, enriquecessem o contexto disponível para o motor RAG.

A camada de inteligência artificial generativa apoiou-se no Amazon Bedrock Knowledge Bases. O Bedrock leu os documentos .txt armazenados no S3, fragmentando cada texto em pedaços semânticos de aproximadamente 300 “tokens” com uma sobreposição de 10% entre fragmentos consecutivos. Essa sobreposição garantiu que informações na fronteira entre dois pedaços não se perdessem, prática recomendada em arquiteturas RAG (Gao et al., 2024).

Cada fragmento de texto foi submetido ao modelo Amazon Titan Text Embeddings V2, que os converteu em vetores de 1.024 dimensões em precisão “float”. Esses vetores foram armazenados no Amazon S3 Vectors, permitindo a recuperação por similaridade de cosseno. Quando um usuário submetia uma pergunta pela interface web, a rota POST /ask acionava a chamada RetrieveAndGenerate do Bedrock, que vetorizava o texto da pergunta e o comparava aos fragmentos indexados.

Os cinco trechos mais próximos foram recuperados e injetados, junto com um “prompt” de sistema, no modelo Amazon Nova 2 Lite (AWS, 2025). O “prompt” continha sete instruções explícitas: responder em português brasileiro, basear-se exclusivamente nos documentos recuperados, incluir orientações práticas de prevenção, indicar canais de denúncia, adotar linguagem acessível, formatar em Markdown e priorizar orientações de emergência caso o usuário aparentasse ser vítima de golpe.

O ponto de acesso ao sistema foi construído em duas partes. No lado do servidor, o AWS Chalice expôs seis rotas REST via Amazon API Gateway, incluindo “health check”, consulta ao assistente RAG, listagem categorizada, scan completo do dataset, estatísticas agregadas e exportação CSV. No lado do cliente, uma página HTML única, sem dependência de frameworks como React ou Angular, foi hospedada como sítio estático em um bucket S3, oferecendo um painel de métricas, uma tabela consultável do dataset e uma janela de conversação com o motor RAG.

A arquitetura “serverless” utilizou diversos serviços da Amazon Web Services para a implementação do pipeline. A Tabela 1 detalha os recursos AWS empregados no projeto, suas funções específicas e as configurações principais que sustentaram a operação do sistema de coleta, classificação e disponibilização de inteligência em cibersegurança.

Tabela 1. Recursos AWS utilizados no projeto

Serviço

Função no projeto

Configuração principal

Amazon EventBridge Scheduler

Gatilho semanal do pipeline

CRON(0 8 ? * MON *) / America/Sao_Paulo

AWS Step Functions

Orquestração dispatcher → crawler

Standard Workflow

AWS Lambda — dispatcher

Coleta de URLs das 35 fontes seed

Python 3.12 / 256 MB / até 15 min

AWS Lambda — crawler

Extração, classificação e armazenamento

Python 3.12 / 512 MB / concorrência 5

Amazon API Gateway

Exposição das 6 rotas REST

HTTP API via AWS Chalice

Amazon S3 — data lake

Armazenamento de documentos .txt por categoria

Subpastas por categoria

Amazon S3 — frontend

Hospedagem da interface web estática

Static website hosting

Amazon DynamoDB

Metadados dos documentos coletados

On-demand / tabela golpes-metadata

Amazon Bedrock — Claude 3 Haiku

Triagem dos textos da zona cinza (Camada 2)

Via InvokeModel API

Amazon Bedrock Knowledge Base

Indexação e recuperação RAG

Fragmentos de 300 tokens / sobreposição 10%

Amazon Titan Text Embeddings V2

Vetorização dos documentos

Vetores de 1.024 dimensões

Amazon S3 Vectors

Armazenamento e busca vetorial

Similaridade de cosseno

Amazon Nova 2 Lite

Geração das respostas conversacionais

Via RetrieveAndGenerate

Fonte: Dados originais da pesquisa

Identificaram-se algumas limitações metodológicas inerentes ao projeto. A paginação restrita à primeira página de cada portal monitorado introduziu um viés potencial em direção ao conteúdo mais recente, o que pode afetar a abrangência temporal dos dados coletados. Além disso, a categoria `outro_golpe`, que representou uma parcela significativa dos documentos, revelou que o vocabulário controlado empregado no classificador ainda não possuía granularidade suficiente para cobrir a diversidade real das fraudes emergentes.

Outra limitação observada foi a sincronização manual da Knowledge Base, que criava uma janela de defasagem de vários dias entre a coleta de novos dados e sua disponibilização para o motor RAG. Essa lacuna, embora passível de eliminação por meio de um gatilho S3 sem custo adicional relevante, representou uma restrição operacional durante o período de desenvolvimento e testes do protótipo.

3. Resultados e Discussão

Ao final da atualização mais recente refletida no painel do sistema, o pipeline de coleta e processamento de dados acumulou um total de 744 documentos, provenientes de 21 fontes ativas, e totalizando aproximadamente 12,5 megabytes de texto bruto armazenado no Amazon S3. Este volume de dados, embora representativo para um estudo de caso exploratório, destaca a natureza dinâmica e os desafios inerentes à coleta automatizada de informações na web. Das 35 fontes inicialmente curadas e aprovadas, 14 deixaram de fornecer conteúdo utilizável ao longo do período de operação do sistema. Este fenômeno não ocorreu de forma instantânea, mas foi um processo gradual, onde algumas fontes inicialmente responsivas passaram a bloquear requisições subsequentes, provavelmente devido à detecção de padrões de acesso automatizado, um comportamento comum de portais que buscam proteger seu conteúdo ou recursos. Outras fontes apresentaram alterações significativas em sua estrutura HTML, tornando os seletores configurados ineficazes e exigindo manutenção manual, que não foi contemplada no escopo deste projeto. Adicionalmente, duas fontes, embora tecnicamente acessíveis, reduziram sua frequência de publicação a um ponto que não mais satisfazia o critério de relevância estabelecido na curadoria inicial.

Este resultado sublinha a volatilidade do ambiente web e a necessidade de estratégias robustas para garantir a continuidade e a integridade da coleta de dados em projetos de web scraping. A literatura sobre o tema, como a revisão de Lotfi et al. (2022), frequentemente aborda as técnicas de extração, mas a estabilidade e a resiliência das fontes são desafios práticos que exigem atenção contínua. A dependência de estruturas HTML estáticas, conforme testado com a biblioteca BeautifulSoup (Kahlon e Singh, 2024), expõe o sistema a vulnerabilidades estruturais que demandam monitoramento e adaptação constantes. A implicação prática dessa constatação é que, mesmo em uma arquitetura “serverless” que minimiza o custo computacional ocioso, a manutenção de um pipeline de coleta de dados da web não é uma tarefa “configure e esqueça”. Ela exige um esforço contínuo de curadoria e adaptação para lidar com as mudanças nos portais de origem, o que pode se tornar um gargalo operacional em larga escala. A resiliência demonstrada pelas mais de duas dezenas de fontes que permaneceram produtivas, contudo, sugere que a arquitetura possui uma capacidade razoável de absorver variações, desde que a curadoria inicial seja rigorosa e os mecanismos de reprocessamento sejam bem definidos.

O classificador híbrido desenvolvido distribuiu os 744 documentos coletados em 14 categorias distintas, conforme detalhado na Tabela 2. A análise dessa distribuição revela insights importantes sobre a natureza do conteúdo coletado e as limitações do vocabulário controlado empregado.

Tabela 2. Distribuição dos 744 documentos por categoria

Categoria

Documentos (n)

Participação (%)

outro_golpe

311

41,8

nao_classificado

150

20,2

ransomware

106

14,2

phishing

69

9,3

falsa_central

37

5,0

data_breach

25

3,4

engenharia_social

13

1,7

deepfake_scam

12

1,6

supply_chain_attack

7

0,9

roubo_identidade

6

0,8

clonagem_whatsapp

4

0,5

crypto_fraud

2

0,3

golpe_pix

1

0,1

sextorsao

1

0,1

Total

744

100,0

Fonte: Resultados originais da pesquisa, painel do sistema CyberSec RAG, abr. 2026

A categoria “outro_golpe” representou a maior parcela dos documentos, com 311 registros, correspondendo a 41,8% do total. Essa predominância é explicada pela natureza dos textos jornalísticos e informativos que compõem o dataset. Muitos artigos abordam fraudes digitais de forma panorâmica, sem se ater a uma modalidade específica, ou descrevem golpes emergentes que ainda não haviam sido incorporados ao dicionário de palavras-chave do classificador. Este achado corrobora a natureza dinâmica e em constante evolução das ameaças cibernéticas, onde novas tipologias de fraude surgem rapidamente, desafiando a capacidade de sistemas de classificação baseados em vocabulários fixos. A implicação prática é a necessidade de um processo contínuo de atualização e expansão do dicionário de termos, talvez incorporando técnicas de aprendizado de máquina para identificar automaticamente novos padrões e termos relevantes, ou utilizando modelos de linguagem mais avançados para sugerir expansões ao vocabulário existente.

Os 150 documentos rotulados como “nao_classificado”, que correspondem a 20,2% do dataset, tangenciaram o tema da cibersegurança sem tratar diretamente de golpes específicos. Essa categoria, embora não classificada em uma fraude particular, foi intencionalmente retida no repositório. A decisão de não descartar esses documentos, alinhada à política de “fail-open” da segunda camada do classificador, permitiu que eles enriquecessem o contexto disponível para o motor RAG. Textos sobre vulnerabilidades técnicas, políticas de privacidade, ou notícias institucionais do ecossistema de cibersegurança, mesmo que periféricos, contribuem para uma base de conhecimento mais abrangente. Essa abordagem é crucial para sistemas RAG, que se beneficiam de um corpus de documentos mais vasto e contextualmente rico para gerar respostas mais informativas e menos propensas a alucinações, conforme destacado por Gao et al. (2024). A retenção desses documentos, portanto, representa um equilíbrio estratégico entre a precisão da classificação e a completude do contexto para a inteligência generativa.

As categorias de baixo volume, como “deepfake_scam” (12 documentos, 1,6%) e “supply_chain_attack” (7 documentos, 0,9%), sinalizaram tendências emergentes e de alta relevância no cenário de cibersegurança. Os registros de “deepfake_scam” documentaram situações onde criminosos empregaram vídeos ou áudios gerados por inteligência artificial para se passar por executivos ou familiares, uma modalidade de fraude cujo crescimento foi registrado pelo FBI IC3 entre 2023 e 2024 (FBI, 2025). Essa forma de ataque se enquadra na categoria de ataques baseados em personificação digital, conforme a taxonomia proposta por Zaoui et al. (2024). A detecção desses casos, mesmo em pequeno número, valida a capacidade do sistema de capturar informações sobre ameaças de ponta, que exigem uma compreensão aprofundada das tecnologias subjacentes e das táticas criminosas.

Similarmente, os sete registros de “supply_chain_attack” descreveram incidentes em que bibliotecas de código aberto foram comprometidas para distribuir “malware”, uma técnica que ganhou notoriedade após o caso XZ Utils em 2024. A inclusão desses temas no dataset demonstra a relevância das fontes monitoradas e a capacidade do pipeline de identificar ameaças complexas que afetam a integridade da cadeia de suprimentos de software. A presença dessas categorias de baixo volume, mas de alto impacto, reforça a importância de um sistema de inteligência que não apenas catalogue fraudes conhecidas, mas também monitore e identifique proativamente as novas táticas e técnicas empregadas por cibercriminosos. A capacidade de identificar essas tendências emergentes é uma vantagem estratégica para a prevenção e resposta a incidentes, permitindo que as organizações e o público se preparem para ameaças antes que se tornem generalizadas.

A eficácia do classificador híbrido foi um dos pilares da validação da arquitetura proposta. Dos 744 documentos processados, 594, o que representa aproximadamente 79,8% do total, foram resolvidos pela primeira camada do classificador, baseada em palavras-chave, sem a necessidade de invocar o modelo de linguagem (LLM). Os 150 documentos restantes, que caíram na “zona cinza” devido à ambiguidade de sua pontuação lexical, foram encaminhados para a segunda camada e processados pelo modelo Anthropic Claude 3 Haiku. Essa proporção de aproximadamente 80/20 corrobora a hipótese central do classificador híbrido: a primeira camada, mais econômica e rápida, absorveu a vasta maioria dos casos inequívocos, reservando a inferência do modelo de linguagem para as situações genuinamente ambíguas.

Este resultado prático demonstra uma redução significativa no volume de inferências pagas, especificamente uma diminuição de cerca de 79,8% nas chamadas ao LLM, em comparação com um cenário onde todos os 744 textos seriam processados pelo Claude 3 Haiku. Tal eficiência é um achado crucial, pois o custo de inferência de LLMs pode ser um fator limitante para a escalabilidade de sistemas baseados em inteligência artificial generativa. A abordagem de processamento hierárquico, que combina regras ponderadas com LLMs, é amplamente reconhecida na literatura por oferecer um equilíbrio superior entre custo e precisão em tarefas de triagem textual (Brown et al., 2020). O presente trabalho valida essa premissa em um contexto prático de cibersegurança, demonstrando que a alocação inteligente de recursos computacionais pode gerar economias substanciais sem comprometer a qualidade da classificação.

A política de “fail-open” adotada para a segunda camada do classificador, onde textos eram aceitos mesmo em caso de falha na resposta do modelo de linguagem, refletiu uma decisão arquitetural consciente. Em um sistema voltado à completude de um corpus de pesquisa sobre cibersegurança, a perda de um documento potencialmente relevante é considerada mais custosa do que a inclusão de um texto marginalmente incerto. Essa estratégia garante que o motor RAG tenha acesso ao maior volume possível de informações, mesmo que parte delas não seja perfeitamente categorizada, enriquecendo o contexto disponível para as consultas dos usuários. A eficácia do classificador híbrido, portanto, não se mede apenas pela precisão de cada camada isoladamente, mas pela sua capacidade de operar de forma sinérgica, otimizando recursos e garantindo a robustez do dataset para a camada de inteligência artificial generativa. Os achados de Chen et al. (2024) sobre a superioridade de abordagens RAG em domínios específicos de cibersegurança são reforçados pela eficiência e precisão alcançadas pelo classificador híbrido, que prepara o terreno para a geração de respostas contextualmente ricas e factualmente precisas.

A análise dos custos operacionais da arquitetura “serverless” revelou um dos resultados mais impactantes do projeto. O custo mensal estimado para a operação completa do sistema foi de apenas US$ 3,40. Este valor contrasta drasticamente com os cerca de US$ 180 mensais que seriam necessários para manter uma instância EC2 t3.medium equivalente, representando uma redução de aproximadamente 98% nos custos de infraestrutura. Essa economia substancial corrobora de forma enfática as análises de Jonas et al. (2019) sobre a superioridade econômica do modelo “serverless” em cargas esporádicas e valida os achados de Shafiei et al. (2022), que identificaram a redução de custos como o benefício mais citado em estudos sobre computação “serverless”.

A implicação prática dessa viabilidade econômica é profunda, especialmente para projetos acadêmicos e iniciativas com recursos limitados. A barreira de entrada para a construção de sistemas complexos de coleta, classificação e disponibilização de inteligência em cibersegurança é significativamente reduzida. Isso democratiza o acesso a tecnologias avançadas de processamento de dados e inteligência artificial, permitindo que pesquisadores e pequenas organizações desenvolvam e implementem soluções robustas sem a necessidade de investimentos pesados em infraestrutura ou de uma equipe dedicada à sua manutenção. A arquitetura “serverless”, ao eliminar a fricção operacional e adotar um modelo de cobrança proporcional ao uso, transforma o custo de infraestrutura de um investimento fixo e contínuo em uma despesa variável e minimizada, alinhando-se perfeitamente às necessidades de projetos com ciclos de uso intermitentes, como o pipeline de coleta semanal implementado. Este resultado não é apenas um argumento teórico, mas uma grandeza mensurável que tem implicações diretas para a sustentabilidade e escalabilidade de futuras pesquisas e aplicações.

A avaliação do assistente conversacional, que comparou as respostas do modelo Amazon Nova 2 Lite com e sem a camada RAG, constituiu o ponto de maior carga probatória do trabalho, conforme apresentado na Tabela 3. Os resultados demonstraram uma diferença substancial na qualidade, precisão factual e utilidade das respostas, validando a eficácia da Geração Aumentada por Recuperação (RAG) em um domínio específico como a cibersegurança.

Tabela 3. Comparação das respostas do Amazon Nova 2 Lite com e sem camada RAG

Pergunta

Com RAG

Sem RAG

“Quais são os golpes mais comuns envolvendo o Pix?”

Enumerou cinco modalidades (sobreposição de tela, falso atendente, QR Code adulterado, engenharia social via WhatsApp e chave Pix de terceiro), com referência às cartilhas do CERT.br e alertas da FEBRABAN; indicou canais de denúncia (Banco Central, PROCON, SaferNet)

Ofereceu conselhos genéricos sobre segurança digital sem citar fontes nem enumerar modalidades específicas de fraude Pix

“O que o CERT.br recomenda contra phishing?”

Reproduziu as seis orientações específicas presentes nos documentos do CERT.br: verificar remetente, não clicar em links, conferir URL, usar autenticação de dois fatores, manter software atualizado e reportar via cert.br/phishing

Fabricou suposta orientação do Banco Central sobre “blindagem de chave Pix”, inexistente nos documentos oficiais exemplo de alucinação (Gao et al., 2024)

“Como os tribunais tratam a clonagem de WhatsApp?”

Apontou enquadramento como estelionato qualificado por meio eletrônico (art. 171 do CP, alterado pela Lei 14.155/2021) e citou precedentes do STJ presentes no data lake

Limitou-se a generalidades jurídicas sem citar legislação específica nem jurisprudência aplicável

Fonte: Resultados originais da pesquisa

Na primeira pergunta, “Quais são os golpes mais comuns envolvendo o Pix?”, o modelo com RAG enumerou cinco modalidades específicas de fraude (sobreposição de tela, falso atendente, QR Code adulterado, engenharia social via WhatsApp e chave Pix de terceiro), com referências explícitas às cartilhas do CERT.br e alertas da FEBRABAN. Adicionalmente, indicou canais de denúncia concretos como o Banco Central, PROCON e SaferNet. Em contraste, a resposta sem RAG ofereceu apenas conselhos genéricos sobre segurança digital, sem citar fontes ou enumerar modalidades específicas de fraude Pix. Essa distinção é crucial, pois a especificidade e a ancoragem em fontes confiáveis aumentam a credibilidade e a utilidade da informação para o usuário, permitindo-lhe identificar e reagir a ameaças de forma mais eficaz.

A segunda pergunta, “O que o CERT.br recomenda contra phishing?”, revelou um problema crítico dos modelos de linguagem sem contexto: a alucinação. O modelo sem RAG fabricou uma suposta orientação do Banco Central sobre “blindagem de chave Pix”, uma recomendação inexistente nos documentos oficiais. Este é um exemplo clássico de alucinação, fenômeno bem documentado na literatura por autores como Gao et al. (2024) e Lewis et al. (2020), onde LLMs geram informações plausíveis, mas factualmente incorretas. Por outro lado, o modelo com RAG reproduziu fielmente as seis orientações específicas presentes nos documentos do CERT.br, incluindo verificar remetente, não clicar em links, conferir URL, usar autenticação de dois fatores, manter software atualizado e reportar via cert.br/phishing. A eliminação de alucinações é um benefício primordial do RAG, garantindo que as respostas sejam baseadas exclusivamente no conhecimento recuperado, o que é vital em domínios onde a desinformação pode ter consequências graves.

Finalmente, a terceira pergunta, “Como os tribunais tratam a clonagem de WhatsApp?”, demonstrou a capacidade do RAG de fornecer informações jurídicas precisas e contextualizadas. O modelo com RAG apontou o enquadramento da clonagem de WhatsApp como estelionato qualificado por meio eletrônico (artigo 171 do Código Penal, alterado pela Lei 14.155/2021) e citou precedentes do Superior Tribunal de Justiça (STJ) presentes no data lake. Em contrapartida, a resposta sem RAG limitou-se a generalidades jurídicas, sem citar legislação específica ou jurisprudência aplicável. Este resultado é de particular interesse para aplicações que exigem precisão em domínios normativos, como a LGPD, o Código Penal e as cartilhas de órgãos reguladores. A inexatidão factual em tais contextos pode desorientar usuários vulneráveis, justamente o público que este sistema pretende alcançar.

Esses resultados convergem com os achados de Chen et al. (2024), que demonstraram que sistemas RAG superam modelos generalistas em fidelidade factual quando aplicados a domínios específicos como o de investigações cibernéticas. A eliminação de alucinações observada no presente trabalho reforça a tese de Gao et al. (2024), segundo a qual a injeção de contexto recuperado reduz drasticamente a probabilidade de fabricação de conteúdo pelo modelo. As implicações práticas são vastas: um assistente conversacional ancorado em RAG pode servir como uma ferramenta confiável para educação pública, suporte a vítimas de golpes, e até mesmo para auxiliar profissionais do direito e da segurança na compreensão de tipologias de fraude e suas implicações legais. A capacidade de fornecer orientações práticas de prevenção e indicar canais de denúncia, como explicitamente instruído no prompt do sistema, eleva o valor do artefato de software para a sociedade, transformando informações dispersas em inteligência acionável e acessível.

Apesar dos resultados promissores, identificaram-se algumas limitações metodológicas inerentes ao projeto que merecem discussão. A paginação restrita à primeira página de cada portal monitorado introduziu um viés potencial em direção ao conteúdo mais recente. Embora essa estratégia tenha sido adotada para otimizar os recursos computacionais e simplificar a lógica do crawler, ela pode afetar a abrangência temporal dos dados coletados, potencialmente negligenciando artigos mais antigos, mas ainda relevantes, ou tendências que se desenvolvem ao longo de um período mais extenso. A implicação é que o dataset pode não ser totalmente representativo da evolução histórica das fraudes, focando mais nas ocorrências e discussões contemporâneas. Para futuras iterações, a implementação de uma estratégia de paginação mais profunda, embora com custo computacional ligeiramente maior, seria benéfica para enriquecer a dimensão temporal do corpus.

Outra limitação observada foi a proporção significativa de documentos classificados na categoria “outro_golpe”, que representou quase 42% do total. Este resultado revelou que o vocabulário controlado empregado no classificador híbrido ainda não possuía granularidade suficiente para cobrir a diversidade real e a rápida emergência de novas fraudes digitais. A constante inovação por parte dos criminosos cibernéticos significa que qualquer dicionário de termos fixo se tornará rapidamente obsoleto. A implicação é a necessidade de um mecanismo de atualização contínua do vocabulário, talvez por meio de técnicas de aprendizado de máquina para identificar novos termos e padrões, ou pela incorporação de feedback humano para refinar as categorias existentes. A expansão e o aprimoramento do dicionário de palavras-chave são cruciais para aumentar a precisão e a granularidade da classificação, permitindo uma análise mais detalhada das tipologias de golpe.

Finalmente, a sincronização manual da Knowledge Base do Amazon Bedrock criou uma janela de defasagem de vários dias entre a coleta de novos dados e sua disponibilização para o motor RAG. Essa lacuna, embora passível de eliminação por meio de um gatilho S3 sem custo adicional relevante, representou uma restrição operacional durante o período de desenvolvimento e testes do protótipo. A implicação dessa limitação é que o sistema, em sua configuração de teste, não operava em tempo real, o que poderia comprometer a relevância das respostas em um cenário de ameaças cibernéticas em rápida evolução. A automação da sincronização da Knowledge Base é uma melhoria direta e de baixo custo que transformaria o sistema em uma fonte de inteligência quase em tempo real, crucial para a eficácia na detecção e prevenção de fraudes emergentes. Essas limitações, embora presentes, não invalidam os resultados centrais do projeto, mas fornecem um roteiro claro para o aprimoramento e a expansão da arquitetura em futuras pesquisas e implementações.

4. Conclusão

Conclui-se que o objetivo foi atingido, uma vez que a arquitetura de software integralmente “serverless” para web scraping, classificação híbrida de dados sobre ilícitos cibernéticos e disponibilização de inteligência via interface conversacional RAG foi projetada, desenvolvida e validada com sucesso. A solução demonstrou notável viabilidade econômica, com um custo operacional mensal de apenas US$ 3,40, validando a premissa de que a computação “serverless” é ideal para projetos acadêmicos e com recursos limitados. A eficácia do classificador híbrido, que resolveu aproximadamente 80% dos casos na primeira camada lexical, otimizou o uso de recursos de LLM. Mais crucialmente, o assistente conversacional alimentado por RAG eliminou alucinações e forneceu respostas factualmente precisas e contextualizadas, superando significativamente o modelo sem contexto em domínios normativos e de cibersegurança.

Apesar dos resultados promissores, o projeto apresentou limitações instrutivas. A paginação restrita à primeira página dos portais introduziu um viés para o conteúdo mais recente, e a alta incidência da categoria “outro_golpe” revelou a necessidade de um vocabulário controlado mais granular e dinâmico para acompanhar a evolução das fraudes. Adicionalmente, a sincronização manual da Knowledge Base do RAG gerou uma defasagem temporal na atualização das informações. Para estudos futuros, sugere-se a implementação de estratégias de paginação mais profundas, o desenvolvimento de mecanismos de atualização automática do vocabulário do classificador, possivelmente com o auxílio de aprendizado de máquina, e a automação da sincronização da base de conhecimento do RAG para garantir a relevância quase em tempo real das informações.

Referências Bibliográficas

Amazon Web Services [AWS]. 2025. Introducing Amazon Nova 2 Lite, a fast, cost-effective reasoning model. Disponível em: https://aws.amazon.com/blogs/aws/introducing-amazon-nova-2-lite-a-fast-cost-effective-reasoning-model/. Acesso em: 07 abr. 2026.

Amazon Web Services [AWS]. 2026. How Amazon Bedrock knowledge bases work. Disponível em: https://docs.aws.amazon.com/bedrock/latest/userguide/kb-how-it-works.html. Acesso em: 26 mar. 2026.

Autoridade Nacional de Proteção de Dados [ANPD]. 2026. Estudo técnico – A LGPD e o tratamento de dados pessoais para fins acadêmicos e para a realização de estudos por órgão de pesquisa. Disponível em: https://www.gov.br/anpd/pt-br/centrais-de-conteudo/documentos-tecnicos-orientativos/estudo-tecnico-a-lgpd-e-o-tratamento-de-dados-pessoais-para-fins-academicos-e-para-a-realizacao-de-estudos-por-orgao-de-pesquisa.pdf. Acesso em: 26 mar. 2026.

Banco Central do Brasil [BCB]. 2026. Pix em números. Disponível em: https://www.bcb.gov.br/estabilidadefinanceira/pix-em-numeros-estatisticas. Acesso em: 26 mar. 2026.

Birthriya, S.K.; Ahlawat, P.; Jain, A.K. 2024. A comprehensive survey of social engineering attacks: taxonomy of attacks, prevention, and mitigation strategies. Journal of Applied Security Research 20(2): 244-292.

Brown, T.B.; Mann, B.; Ryder, N.; Subbiah, M.; Kaplan, J.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; Agarwal, S.; Herbert-Voss, A.; Krueger, G.; Henighan, T.; Child, R.; Ramesh, A.; Ziegler, D.M.; Wu, J.; Winter, C.; Hesse, C.; Chen, M.; Sigler, E.; Litwin, M.; Gray, S.; Chess, B.; Clark, J.; Berner, C.; McCandlish, S.; Radford, A.; Sutskever, I.; Amodei, D. 2020. Language models are few-shot learners. Advances in Neural Information Processing Systems 33: 1877-1901.

Centro de Estudos, Resposta e Tratamento de Incidentes de Segurança no Brasil [CERT.br]. 2026. Phishing e outros golpes Cartilha de segurança para internet. Disponível em: https://cartilha.cert.br/fasciculos/phishing-golpes/fasciculo-phishing-golpes.pdf. Acesso em: 26 mar. 2026.

Chen, Z.; Li, Z.; Liu, Y.; Zhao, P.; Luo, J.; Hong, L. 2024. A RAG-based question-answering solution for cyber-attack investigation and attribution. ArXiv. Disponível em: https://arxiv.org/html/2408.06272v1. Acesso em: 26 mar. 2026.

Federal Bureau of Investigation [FBI]. 2025. 2024 Internet Crime Report. Disponível em: https://www.ic3.gov/AnnualReport/Reports/2024 IC3Report.pdf. Acesso em:

Federal Bureau of Investigation [FBI]. 2025. 2024 Internet Crime Report. Disponível em: https://www.ic3.gov/AnnualReport/Reports/2024 IC3Report.pdf. Acesso em: 07 abr. 2026.

Federação Brasileira de Bancos [FEBRABAN]. 2024. Saiba quais foram os 10 golpes mais aplicados contra clientes bancários em 2024. Disponível em: https://portal.febraban.org.br/noticia/4279/pt-br/. Acesso em: 26 mar. 2026.

Gao, Y.; Xiong, Y.; Gao, X.; Jia, K.; Pan, J.; Bi, Y.; Dai, Y.; Sun, J.; Wang, M.; Wang, H. 2024. Retrieval-augmented generation for large language models: a survey. ArXiv. Disponível em: https://arxiv.org/abs/2312.10997. Acesso em: 07 abr. 2026.

Gil, 2017 [Referência completa não encontrada no documento original]

Hassan, H.B.; Barakat, S.; Sarhan, Q. 2021. Survey on serverless computing. Journal of Cloud Computing 10(1): 1-29.

Jonas, E.; Schleier-Smith, J.; Sreekanti, V.; Tsai, C.; Khandelwal, A.; Pu, Q.; Shankar, V.; Carreira, J.; Krauth, K.; Yadwadkar, N.; Gonzalez, J.; Popa, R.; Stoica, I.; Patterson, D. 2019. Cloud programming simplified: a Berkeley view on serverless computing. ArXiv. Disponível em: https://arxiv.org/abs/1902.03383. Acesso em: 26 mar. 2026.

Kahlon, N.K.; Singh, W. 2024. Comparative analysis of web scraping tools for low-resource languages. International Journal of Engineering Trends and Technology 72(1): 284-299.

Lewis, P.; Perez, E.; Piktus, A.; Petroni, F.; Karpukhin, V.; Goyal, N.; Küttler, H.; Lewis, M.; Yih, W.; Rocktäschel, T.; Riedel, S.; Kiela, D. 2020. Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information Processing Systems 33: 9459-9474.

Lotfi, C.; Srinivasan, S.; Ertz, M.; Latrous, I. 2022. Web scraping techniques and applications: a literature review. Proceedings of the SCRS Conference on Intelligent Systems: 381-394.

Shafiei, H.; Khonsari, A.; Mousavi, P. 2022. Serverless computing: a survey of opportunities, challenges, and applications. ACM Computing Surveys 54(11s): 1-32.

Zaoui, M.; Bettahar, F.; Saidi, M. 2024. A comprehensive taxonomy of social engineering attacks and defense mechanisms: toward effective mitigation strategies. IEEE Access 12: 76244-76267.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

26 de agosto de 2026

Gerenciamento de Cronograma de Manutenção no Setor de Extração de Caldo em uma Indústria Sucroalcooleira

A manutenção de entressafra em indústrias sucroalcooleiras representa um projeto de alta complexidade, frequentemente comprometido por limitações na definição do escopo, no sequenciamento de atividades e nas estimativas de duração, afetando a confiabilidade e previsibilidade da execução. Objetivou-se aprimorar o gerenciamento do cronograma de manutenção de entressafra no setor de extração de caldo, por meio da aplicação das práticas do PMBOK 6ª edição, com foco na estruturação do escopo, sequenciamento lógico das atividades, melhoria das estimativas de duração e identificação do caminho crítico. A pesquisa caracterizou-se como um estudo de caso único, de natureza aplicada e abordagem mista, realizado em uma indústria sucroalcooleira. Os métodos incluíram análise documental de cronogramas de entressafra e coleta de dados por meio de questionários com profissionais da área. Inicialmente, diagnosticou-se o cronograma vigente, identificando lacunas. Em seguida, aplicaram-se ferramentas de gerenciamento do cronograma, como a Estrutura Analítica do Projeto (EAP), sequenciamento de atividades, estimativa análoga e bottom-up, e o método do caminho crítico (CPM), permitindo a comparação entre o cenário original e o reestruturado. Os resultados evidenciaram ganhos significativos em previsibilidade, organização das atividades, clareza nas dependências e maior controle sobre prazos e desvios, com a redução de atividades sem predecessoras ou sucessoras de 18,85% para 2,32%. Concluiu-se que a aplicação estruturada das boas práticas de gerenciamento do cronograma aprimorou o planejamento e contribuiu para a disponibilidade operacional na safra subsequente.

Palavras-chave: Caminho crítico; Confiabilidade do planejamento; Estrutura Analítica do Projeto (EAP); Planejamento operacional; Previsibilidade.

26 de agosto de 2026

Fomento à liderança de mulheres por meio da gestão estratégica de partes interessadas

A persistente sub-representação de mulheres em cargos de liderança revelou limitações nas estratégias institucionais de promoção da igualdade de gênero, destacando a necessidade de abordagens mais integradas entre gestão de projetos e negociação estratégica. O estudo objetivou analisar como estratégias de negociação e engajamento de partes interessadas fomentaram o compromisso institucional com políticas que impulsionam a liderança feminina, e propôs uma matriz estratégica orientada por uma perspectiva de gênero. Adotou-se uma abordagem de métodos mistos, de natureza convergente e articulação epistemológica crítica-transformativa, que combinou análise documental, estudos de caso institucionais e uma entrevista semiestruturada com uma líder feminina, seguida de análise temática e triangulação de dados para aumentar a robustez interpretativa. Os resultados indicaram que organizações que institucionalizaram práticas de governança, estabeleceram metas mensuráveis e incorporaram partes interessadas como participantes ativos demonstraram maior capacidade de converter compromissos discursivos em ações estruturadas. Evidenciou-se, ainda, que a integração entre negociação estratégica e gestão de partes interessadas potencializou a sustentabilidade das iniciativas de equidade de gênero. Concluiu-se que a implementação de uma matriz estratégica, denominada Matriz Estratégica de Engajamento de Stakeholders com foco em gênero (MEES-G), configurou-se como uma ferramenta de gestão relevante para fortalecer o compromisso institucional e facilitar transformações organizacionais consistentes, oferecendo orientação eficaz a gestores públicos e privados na implementação de políticas inclusivas.

Palavras-chave: Equidade; Governança; Inclusão organizacional; Representatividade; Transformação organizacional.

26 de agosto de 2026

Transformação do Modelo Comercial em Serviços Linguísticos para Maior Previsibilidade de Receita

A busca por previsibilidade de receita e maior controle sobre o desempenho comercial tem se tornado um desafio relevante na indústria de serviços linguísticos, caracterizada por alta variabilidade de demanda e modelos historicamente baseados em volume de serviços. Neste contexto, o estudo teve como objetivo analisar a reestruturação do modelo comercial de uma empresa do setor, com foco na transição de uma abordagem orientada à receita faturada para um modelo baseado na formalização de contratos e na previsibilidade de receita potencial. A pesquisa foi conduzida por meio de pesquisa-ação entre maio de 2024 e março de 2026, utilizando dados quantitativos provenientes de sistemas internos e dados qualitativos obtidos por observação participante e entrevistas com profissionais-chave. Os resultados quantitativos indicaram que a meta trimestral de contratos foi superada, atingindo 106% no primeiro trimestre de 2026, e os contratos firmados entre o final de 2025 e o primeiro trimestre de 2026 resultaram em uma projeção de receita de US$ 1.230.500, equivalente a aproximadamente 88% da meta anual, evidenciando aumento na previsibilidade da receita potencial. Qualitativamente, os dados apontaram maior clareza na avaliação da performance comercial, maior transparência na identificação dos fatores que impactam a conversão de contratos em receita e melhoria na integração entre as áreas envolvidas. Concluiu-se que a adoção de um modelo baseado em contratos contribui para uma gestão mais eficiente, previsível e orientada à geração sustentável de receita.

Palavras-chave: Contratos comerciais; Gestão comercial; Modelo de vendas; Pesquisa-ação; Serviços linguísticos.

Neurociência E Aprendizagem Na Educação

24 de agosto de 2026

Do Mundo à Mente: o Impacto Intercultural na Neuroplasticidade

Um estudo investigou a associação entre experiências interculturais e mudanças cognitivas autorrelatadas em adultos brasileiros, à luz do conceito de neuroplasticidade. A pesquisa caracterizou-se como exploratória, de abordagem mista, e foi composta por revisão bibliográfica narrativa e levantamento empírico. Este último foi realizado por meio de questionário online aplicado a 33 participantes que vivenciaram experiências em diferentes países. Coletaram-se dados sociodemográficos, características das vivências internacionais e autoavaliações relacionadas a funções executivas, aprendizagem, memória, atenção e comunicação social. Os resultados indicaram predominância de percepções positivas de mudanças cognitivas, especialmente nos domínios da flexibilidade cognitiva, planejamento, tomada de decisão, aprendizagem e competências comunicativas. A maioria dos participantes relatou a manutenção dessas mudanças ao longo do tempo, associando-as principalmente à duração da experiência, à necessidade de adaptação e ao contato intercultural direto. Os achados sugerem que experiências interculturais constituem contextos de estimulação cognitiva complexa, potencialmente associados a processos de reorganização funcional em múltiplos domínios cognitivos na vida adulta.

Palavras-chave: Adaptação cognitiva; Adaptação cultural; Aprendizagem; Flexibilidade cognitiva; Funções executivas.

Neurociência E Aprendizagem Na Educação

24 de agosto de 2026

Estudo Comparativo: o Conhecimento Docente sobre Neuroplasticidade e Práticas Pedagógicas na Rede Direta e Indireta

A primeira infância constitui um período crítico de plasticidade neural, no qual a qualidade das intervenções pedagógicas determina a arquitetura cerebral e o desenvolvimento integral da criança. O presente estudo teve como objetivo comparar o conhecimento docente sobre neuroplasticidade e sua aplicação prática em unidades de educação infantil de administração direta e indireta na cidade de São Paulo. A metodologia consistiu em um estudo de caso descritivo com abordagem mista, no qual foram aplicados questionários de autopercepção com docentes e realizada uma análise documental de projetos políticos pedagógicos, relatórios de desenvolvimento de alunos e diários de bordo. Os resultados indicaram que, embora ambas as redes tenham executado práticas neurocompatíveis, a Rede Direta apresentou maior intencionalidade pedagógica e segurança técnica 20% superior na identificação de marcos do desenvolvimento, fator diretamente associado à maior carga horária de formação continuada. O estudo evidenciou que a formação continuada atuou como um divisor entre a prática intuitiva e a mediação baseada em evidências. Concluiu-se que o acesso ao saber neurocientífico e a equiparação dos tempos de reflexão docente são fundamentais para garantir maior equidade no desenvolvimento infantil e a eficácia das políticas públicas de educação em territórios de vulnerabilidade.

Palavras-chave: Educação Infantil; Formação Docente; Neurociência Aplicada; Primeira Infância; Redes de Ensino.

24 de agosto de 2026

Precificação Baseada em Valor como Estratégia Competitiva Frente ao Modelo Orientado por Custos

A gestão estratégica de preços consolidou-se como fator determinante para a sustentabilidade e competitividade em mercados industriais, onde a transição de modelos baseados em custos para estratégias orientadas ao valor representa um desafio cultural e operacional crítico. Este estudo teve como objetivo comparar as práticas de precificação em duas unidades industriais do setor business-to-business (B2B), analisando como o alinhamento com a estratégia baseada em valor impacta a sustentabilidade do negócio. Para tanto, investigou-se uma unidade operacional e uma unidade que recentemente descontinuou suas atividades, buscando identificar correlações entre a gestão de preços e a viabilidade competitiva. Adotou-se uma abordagem qualitativa com elementos comparativos, a partir de entrevistas semiestruturadas aplicadas a gestores de duas empresas do setor metalmecânico, utilizando questões fechadas em escala Likert e perguntas abertas organizadas em sete dimensões analíticas relacionadas à maturidade em precificação. Os resultados evidenciaram que a empresa em operação apresentou maior estruturação de processos, melhor integração entre áreas, uso mais frequente de indicadores e ambiente cultural mais favorável à sustentação de preços com base no valor entregue ao cliente. Em contraste, a empresa descontinuada demonstrou fragilidades na formalização da precificação, baixa integração interfuncional, limitações na comunicação de valor e forte predominância de uma cultura orientada por custos. O estudo reforçou que a adoção da precificação baseada em valor requer a institucionalização de processos interfuncionais e governança para garantir a perenidade organizacional frente à pressão competitiva.

Palavras-chave: Concorrência; Cultura; Governança; Liderança.

24 de agosto de 2026

Modelo Preditivo de Risco Reputacional Baseado em Textos Jornalísticos

A reputação corporativa é um ativo intangível crítico, cuja volatilidade na era digital torna as organizações suscetíveis a crises por exposições midiáticas negativas. O estudo desenvolveu um modelo preditivo de risco reputacional para identificar se variáveis da cobertura de mídia, como volume, sentimento e léxico, atuam como precursores de danos severos. A metodologia fundamentou-se na coleta de dados via Web Scraping de notícias sobre eventos de risco ocorridos entre 2023 e 2025. O processamento utilizou Processamento de Linguagem Natural (NLP) para análise de sentimento e feature engineering. A modelagem consistiu em uma tarefa de classificação binária supervisionada, com o target de dano grave determinado por proxies quantificáveis, como impactos financeiros e penalidades regulatórias. Foram comparados os algoritmos Regressão Logística, Random Forest e XGBoost, além da implementação de um modelo Ensemble, em ambiente Python, validados pelas métricas AUC-ROC e F1-Score. Os resultados apontaram a superioridade da abordagem conjunta (Ensemble), que alcançou F1-Score de 0.878 e Recall de 85.4%, e a viabilidade de estimar a probabilidade de crises e estabelecer limiares de risco acionáveis. Comprovou-se a eficácia da integração entre NLP e Machine Learning para a mitigação proativa de riscos corporativos, oferecendo uma ferramenta de suporte à decisão para equipes de comunicação corporativa e gestão de riscos.

Palavras-chave: Análise de Sentimentos; Aprendizado de Máquina; Danos à reputação; Modelagem de Dados Históricos; Processamento de Linguagem Natural (PLN).

Compliance E Esg

24 de agosto de 2026

Liderança Feminina Negra no Brasil: como Políticas Corporativas de Diversidade Apoiam Trajetórias de Sucesso

O presente estudo analisou como as políticas corporativas de diversidade e inclusão influenciaram as trajetórias profissionais de mulheres negras que ocupam cargos de liderança no Brasil. O estudo buscou compreender as experiências e percepções dessas profissionais em relação às práticas organizacionais que moldaram seu desenvolvimento e ascensão. A pesquisa adotou uma abordagem qualitativa, descritiva e aplicada, e coletou dados por meio de levantamento de campo, utilizando questionário semiestruturado com 30 mulheres negras em posições de liderança. Os resultados revelaram que a maioria das participantes possuía alta qualificação acadêmica, atuava predominantemente na região Sudeste e ocupava cargos intermediários de liderança, como supervisão e coordenação. Observou-se a coexistência de trajetórias recentes e consolidadas, indicando avanços na inserção de mulheres negras em liderança, mas também a persistência de limites estruturais que dificultaram a progressão para níveis hierárquicos superiores. Esses achados indicaram que, embora as políticas de diversidade e inclusão fossem relevantes, seus efeitos mostraram-se insuficientes quando não articulados a transformações organizacionais mais amplas voltadas à equidade racial e de gênero, sugerindo que o esforço individual emergiu como estratégia central de trajetória em contextos de suporte institucional frágil.

Palavras-chave: Ascensão profissional; Diversidade organizacional; Inclusão; Interseccionalidade; Políticas corporativas.

24 de agosto de 2026

Segmentação Estratégica de Adquirentes Brasileiras por Clusterização Multivariada

O setor de adquirência desempenha um papel central na infraestrutura de pagamentos, e compreender as diferenças estruturais entre as empresas adquirentes, com base em indicadores operacionais e econômicos, mostrou-se crucial para diagnósticos e decisões fundamentados em dados. O estudo teve como objetivo segmentar as adquirentes brasileiras utilizando indicadores trimestrais de porte, capilaridade, mix de canais e métricas econômicas, empregando análise exploratória de dados e o algoritmo de agrupamento K-means para identificar perfis estratégicos distintos. Realizou-se uma pesquisa quantitativa, exploratória e descritiva, utilizando uma base de dados estruturada com informações trimestrais de adquirentes brasileiras ao longo de doze períodos. A definição do número de agrupamentos baseou-se no método do cotovelo (elbow method) e no coeficiente de silhueta, sendo a interpretação reforçada pela visualização via Análise de Componentes Principais (PCA). Os principais resultados revelaram a formação de dois perfis predominantes: um caracterizado por maior escala e capilaridade, com elevado volume de transações e spreads médios mais comprimidos; e outro com maior participação do canal remoto e maior monetização relativa, evidenciada pela taxa MDR e por spreads médios mais elevados. Concluiu-se que o agrupamento reduziu a complexidade multivariada do mercado a perfis interpretáveis, oferecendo uma base objetiva para benchmarking e para a interpretação estratégica do posicionamento das adquirentes, com potencial de aplicação na análise de dados para a tomada de decisões.Palavras-chave: Adquirência; Análise multivariada; K-means; Pagamentos digitais; Perfis estratégicos.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade