Artigo

Engenharia De Software

09 de outubro de 2026

ReasonGuard: Uma Plataforma de Auditoria de Raciocínio para Modelos de Linguagem Baseada em Decomposição Estruturada de Pensamento

Reasonguard: uma Plataforma de Auditoria de Raciocínio para Modelos de Linguagem Baseada em Decomposição Estruturada de Pensamento

Lucas Nastari Ziza; Lucas Cesar Gomes Alvarinho Squillante

DOI: 10.22167/2675-6528-202603200

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

Apresentou-se o ReasonGuard, uma plataforma de auditoria de raciocínio de Inteligência Artificial, desenvolvida como middleware de observabilidade entre aplicações cliente e modelos de linguagem de grande escala (LLMs). O trabalho teve como objetivo oferecer transparência e rastreabilidade para processos de tomada de decisão baseados em IA, abordando a lacuna na operacionalização de técnicas de raciocínio estruturado para fins de auditoria. O sistema interceptou, analisou e documentou interações com LLMs por meio de cinco módulos fundamentados nos paradigmas Chain-of-Thought (CoT), Tree-of-Thought (ToT) e Graph-of-Thought (GoT). Esses módulos capturaram trilhas de raciocínio, detectaram falhas lógicas estruturais, avaliaram a consistência de respostas e geraram relatórios de auditoria direcionados a diferentes perfis de stakeholders. A plataforma implementou-se com FastAPI (Python) no backend, React com TypeScript no frontend e PostgreSQL como banco de dados relacional, seguindo arquitetura modularizada com isolamento multitenancy por usuário. Os resultados demonstraram a viabilidade técnica da abordagem proposta, com todos os cinco módulos operacionais e integrados. Concluiu-se que o ReasonGuard contribui para a governança de IA ao instrumentalizar paradigmas de raciocínio estruturado como ferramentas de observabilidade e auditoria, preenchendo uma lacuna na literatura.

Palavras-chave: Auditoria de IA; Chain-of-Thought; Governança de IA; Modelos de Linguagem de Grande Escala; Transparência Algorítmica.

1. Introdução

Modelos de Linguagem de Grande Escala (LLMs) são sistemas de aprendizado profundo, tipicamente baseados na arquitetura Transformer, treinados sobre volumosas estruturas de dados para prever a continuação mais provável de uma sequência de texto. A partir desse mecanismo de predição estatística de tokens, emergem capacidades complexas de geração de linguagem, resposta a perguntas, sumarização e, mais recentemente, raciocínio em múltiplas etapas. É justamente essa capacidade emergente de raciocínio e sua aplicação a decisões de alto impacto que motiva o presente trabalho.

A crescente adoção de LLMs em contextos de tomada de decisão, incluindo áreas como saúde, direito, finanças e governança corporativa, tem evidenciado uma grande lacuna: a visualização dos processos de raciocínio que fundamentam as respostas geradas por esses sistemas. Um exemplo ilustrativo dessa problemática é o erro de “raciocínio plausível, porém falacioso”. Ao ser questionado sobre a viabilidade de um contrato com uma cláusula de rescisão automática em caso de atraso de pagamento, um LLM pode concluir corretamente que o contrato é rescindível, mas fundamentar essa conclusão em uma premissa não declarada e incorreta, como assumir erroneamente que qualquer atraso ativa a cláusula. A resposta final soa convincente e frequentemente está correta por coincidência, mas o raciocínio subjacente contém uma falha estrutural que, em um cenário real, poderia levar a uma decisão equivocada sem sinal explícito de erro para o usuário. Esse tipo de falha indetectável a partir da simples leitura da resposta final é o problema central que o ReasonGuard busca endereçar.

Embora os LLMs demonstrem capacidades expressivas em tarefas de raciocínio complexo, a ausência de mecanismos formais de auditoria e rastreabilidade compromete sua aplicabilidade em cenários que exigem responsabilização e conformidade regulatória. Do ponto de vista regulatório, o cenário global tem se movido em direção a exigências mais rigorosas de transparência. O Regulamento Europeu de Inteligência Artificial (União Europeia, 2024), por exemplo, estabelece obrigações específicas de transparência para sistemas de IA de alto risco, incluindo requisitos de documentação, rastreabilidade e explicabilidade. No contexto acadêmico, pesquisas recentes sobre infraestrutura de accountability para IA destacam que a responsabilização permanece frágil porque a transparência de processo raramente é registrada de forma durável e auditável (Mokander et al., 2025). É importante demarcar que, por se tratarem de redes neurais de bilhões de parâmetros cujo processamento interno não é diretamente interpretável, os LLMs permanecem, em essência, “caixas-pretas”. O que o ReasonGuard e as técnicas de decomposição estruturada de raciocínio oferecem não é a abertura dessa caixa-preta, mas sim a indução do modelo a expressar, em linguagem natural, uma justificativa passo a passo que possa ser registrada, versionada e auditada. Trata-se, portanto, de rastreabilidade do processo de geração das respostas, um registro verificável do que o modelo declarou como seu raciocínio e não de transparência plena ou reprodutibilidade do mecanismo interno de decisão do modelo, distinção que orienta todo o desenho da plataforma.

O conceito de raciocínio estruturado em modelos de linguagem ganhou destaque com o trabalho de Wei et al. (2022), que demonstraram a técnica de Chain-of-Thought (CoT). Essa técnica, ao explicitar passos intermediários de raciocínio antes da resposta final, melhora significativamente o desempenho em tarefas aritméticas, de senso comum e de raciocínio simbólico. A partir dessa base, Yao et al. (2023) propuseram o framework Tree of Thoughts (ToT), que generaliza o CoT ao permitir a exploração deliberada de múltiplos caminhos de raciocínio, tratando cada etapa intermediária como um nó de uma árvore de busca. Besta et al. (2024) avançaram ainda mais ao introduzir o Graph of Thoughts (GoT), que modela a informação gerada pelo LLM como um grafo arbitrário de proposições e suas dependências. Paralelamente, Wang et al. (2023) propuseram a abordagem de Self-Consistency, uma estratégia de decodificação que explora múltiplos caminhos de raciocínio e seleciona a resposta mais consistente entre eles, elevando o desempenho do CoT em benchmarks.

Apesar desses avanços, observa-se uma lacuna específica na literatura: os trabalhos citados acima concentram-se em duas frentes distintas e, até o momento, não integradas. A primeira frente trata essas técnicas (CoT, ToT, GoT e Self-Consistency) como métodos para melhorar o desempenho de LLMs em tarefas de raciocínio, sem preocupação com o registro persistente, verificável e auditável do processo gerado. A segunda frente, os trabalhos de auditoria e explicabilidade (Mokander et al., 2023; Zhao et al., 2024; Bilal et al., 2025; Mokander et al., 2025) discutem o que deveria ser auditado e propõem camadas conceituais de verificação, mas não apresentam uma implementação de referência que capture, estruture e persista, de forma sistemática e pronta para produção, o raciocínio decomposto segundo esses paradigmas. Não há, portanto, uma plataforma que opere na interseção dessas duas frentes: que utilize CoT, ToT e GoT não para melhorar a resposta do modelo, mas como instrumentos de observabilidade, capturando o raciocínio decomposto, persistindo-o com garantias de integridade e disponibilizando-o em formatos utilizáveis por equipes de compliance, jurídico e engenharia. É essa lacuna de operacionalização, a ausência de uma ponte entre a técnica de decomposição de raciocínio e a prática de auditoria em ambientes de produção, que o presente trabalho busca preencher.

Neste contexto, o presente trabalho propõe o ReasonGuard, uma plataforma de auditoria de raciocínio que instrumentaliza os paradigmas de raciocínio como mecanismos de observabilidade, operando entre aplicações cliente e provedores de LLM. O objetivo geral deste estudo é desenvolver e validar o ReasonGuard, uma plataforma de auditoria de raciocínio para modelos de linguagem baseada em decomposição estruturada de pensamento, com os seguintes objetivos específicos: (i) capturar trilhas completas de raciocínio com garantia de integridade criptográfica; (ii) detectar falhas lógicas estruturais como contradições, circularidade, saltos lógicos e premissas ocultas; (iii) avaliar a consistência de respostas por meio de múltiplas execuções com variações semânticas; e (iv) gerar relatórios de auditoria direcionados a diferentes perfis de stakeholders, contribuindo para a governança e a conformidade regulatória de sistemas baseados em IA.

2. Material e Métodos

A pesquisa realizada possui natureza aplicada, orientada à geração de conhecimentos práticos para solucionar a falta de transparência e auditabilidade nos processos de raciocínio de Modelos de Linguagem de Grande Escala (LLMs). O estudo caracterizou-se como exploratório-experimental, combinando a investigação de técnicas de decomposição de raciocínio com a implementação e validação de módulos em um ambiente controlado. A abordagem metodológica adotada foi quali-quantitativa, englobando tanto a análise estrutural do raciocínio extraído quanto o cálculo de métricas numéricas, como pontuações de validade e taxas de consistência.

O desenvolvimento do ReasonGuard seguiu uma metodologia iterativa e incremental, baseada em prototipação evolutiva, estruturada em seis fases sequenciais. Inicialmente, definiram-se os requisitos e a arquitetura do sistema, identificando-se os cinco módulos principais e adotando-se o padrão arquitetural de API Proxy. Em seguida, implementou-se o backend com os módulos core, seguido pela implementação do frontend com um dashboard interativo. As fases subsequentes incluíram a integração e autenticação com isolamento multitenancy, a construção de uma aplicação demo em Streamlit e, por fim, a otimização e o refinamento de performance e usabilidade.

A arquitetura do sistema ReasonGuard foi concebida como um proxy reverso com recursos de observabilidade, atuando como um middleware entre aplicações cliente e provedores de LLM. Esse arranjo permitiu a interceptação transparente de requisições sem a necessidade de modificação da aplicação cliente, possibilitando a análise em tempo real e o armazenamento independente dos dados de auditoria. Para o cliente, a comunicação permaneceu inalterada, exigindo apenas o direcionamento das requisições ao endpoint do proxy, que preservou a estrutura esperada de entrada e saída.

Durante o fluxo de comunicação, o API Proxy registrou as informações relevantes da requisição, aplicou os mecanismos de rastreamento, validação e análise definidos pela plataforma, e encaminhou a chamada ao provedor do modelo. Após o processamento pelo provedor, a resposta foi devolvida ao proxy, que a analisou, associou aos dados da requisição original, calculou métricas e gerou a trilha de auditoria antes de repassá-la ao cliente. Dessa forma, o provedor de LLM permaneceu responsável pela inferência do modelo, enquanto o middleware centralizou as funções de observabilidade, controle e auditoria.

A infraestrutura do ReasonGuard foi composta por quatro serviços orquestrados via Docker Compose. Incluiu-se um banco de dados PostgreSQL para persistência relacional, um backend implementado com FastAPI em Python contendo os cinco módulos core e nove rotas de API REST, um frontend desenvolvido com React e TypeScript para o dashboard interativo, e uma aplicação demo em Streamlit como exemplo de integração. O isolamento multitenancy foi garantido por filtragem de usuário em todas as consultas ao banco de dados, assegurando que cada usuário acessasse somente seus próprios registros.

Os módulos principais foram desenvolvidos como unidades autônomas, cada qual com responsabilidade única, e integrados progressivamente ao sistema completo. O Rastreador de Raciocínio, o primeiro módulo, fundamentou-se no paradigma Chain-of-Thought (CoT). Operou por meio da injeção de prompts estruturados nas requisições ao LLM, induzindo o modelo a decompor seu raciocínio em premissas, inferências e conclusões. O parsing foi realizado via expressões regulares, e cada registro recebeu um hash SHA-256 para garantir a integridade dos dados.

O Analisador de Caminhos, o segundo módulo, estendeu o conceito para múltiplos caminhos, implementando uma busca em árvore com avaliação heurística inspirada no paradigma Tree-of-Thought (ToT). O problema foi decomposto em dois a quatro subproblemas, para os quais foram geradas duas a três hipóteses com scores de viabilidade, variando de zero a cem. Caminhos com pontuação inferior a quarenta foram podados e documentados. As métricas capturadas incluíram o total de nós explorados, o total de caminhos podados e o score do caminho selecionado.

O Validador Lógico, o terceiro módulo, transformou o raciocínio extraído em um grafo dirigido de proposições, utilizando a biblioteca NetworkX, conforme o paradigma Graph-of-Thought (GoT). Cada nó representou uma proposição (premissa, inferência, conclusão ou premissa oculta) e cada aresta, uma relação lógica. O módulo detectou quatro tipos de falhas lógicas: contradições, saltos lógicos identificados como nós desconectados, premissas ocultas não declaradas e circularidade, esta última detectada por algoritmos de busca de ciclos. Um score de validade, de zero a cem, foi calculado com base na proporção de problemas em relação ao total de proposições.

O Verificador de Consistência, o quarto módulo, aplicou uma metodologia de teste por repetição inspirada no conceito de Self-Consistency (Wang et al., 2023). A consulta original foi reformulada semanticamente em cinco variações, preservando a intenção original. As respostas geradas foram comparadas par a par para identificar a permanência das informações centrais e detectar divergências. Calculou-se uma taxa de convergência, expressa em uma escala de zero a um, e um score de confiança final que combinou essa taxa-base com penalidades por divergências e bonificações por alta consistência.

O Gerador de Trilha de Auditoria, o quinto módulo, consolidou os dados de todos os módulos anteriores em relatórios multi-formato. Esses relatórios foram gerados em PDF via ReportLab, Excel via openpyxl e JSON nativo, e direcionados a três perfis de stakeholders: compliance (com hashes de integridade e trilhas cronológicas), jurídico (com cadeia de evidências e pontos de divergência) e técnico (com dados completos, estruturas brutas e métricas detalhadas).

A escolha da pilha tecnológica foi orientada por critérios de adequação ao domínio de IA, maturidade do ecossistema e produtividade no desenvolvimento. O backend foi implementado em Python 3.11 com FastAPI 0.109.0, aproveitando o suporte nativo a operações assíncronas, validação automática via Pydantic e documentação OpenAPI. A biblioteca NetworkX 3.2.1 forneceu os algoritmos de análise de grafos necessários ao Validador Lógico.

O frontend foi construído com React 18.2.0 e TypeScript 5.3.3, utilizando React Flow 11.10.2 para visualização interativa de grafos e árvores, Recharts 2.10.4 para gráficos de KPIs e Material-UI 5.15.6 como framework de interface. O gerenciamento de estado servidor empregou TanStack Query para cache e sincronização. A autenticação foi gerenciada pelo Clerk 4.30.0, com suporte a OAuth (Google) e email/senha, enquanto o PostgreSQL 14 proveu a persistência relacional com suporte a campos JSONB para armazenamento de estruturas flexíveis.

A estratégia de validação seguiu uma abordagem em três níveis. Na validação funcional, cada módulo foi validado individualmente quanto à corretude do parsing, à detecção de padrões e ao cálculo de métricas. O parsing correspondeu ao processo de interpretar e estruturar os dados recebidos, extraindo corretamente campos, etapas de raciocínio e demais informações relevantes das respostas do modelo para as análises subsequentes.

A validação de integração contemplou o fluxo completo de funcionamento do proxy, desde o recebimento da requisição enviada pela aplicação cliente até o encaminhamento ao provedor de LLM. Incluiu-se o processamento pelos módulos de auditoria, a persistência dos resultados e o retorno da resposta ao usuário. Também foram verificados os mecanismos de autenticação de ponta a ponta, incluindo a identificação do usuário, a autorização de acesso aos recursos e o isolamento dos dados durante toda a execução.

A validação da interface concentrou-se na apresentação correta das informações produzidas pelo sistema. Avaliou-se a renderização de grafos e árvores de raciocínio com dados reais, a organização visual dos nós e conexões, a exibição dos resultados das análises e a atualização dos indicadores de desempenho no dashboard. Buscou-se assegurar que as alterações nos dados processados fossem refletidas corretamente nos KPIs e nos demais componentes visuais da plataforma.

3. Resultados e Discussão

Os resultados obtidos no desenvolvimento do ReasonGuard demonstram a viabilidade técnica da abordagem proposta para operacionalizar técnicas de raciocínio estruturado como ferramentas de rastreabilidade e auditoria em ambientes de governança de Inteligência Artificial. A plataforma foi implementada com completude em relação aos requisitos especificados, com todos os cinco módulos core totalmente funcionais e integrados. É fundamental situar esses achados como evidência da funcionalidade de um protótipo, e não como uma validação estatística em escala de produção, uma distinção crucial para a interpretação de sua contribuição atual.

A arquitetura do sistema foi concebida para garantir a integridade e a rastreabilidade dos dados. O modelo de dados centraliza-se na entidade de usuário, vinculando a ela todos os registros gerados pelos módulos de rastreamento de raciocínio, análise de caminhos, validação lógica e verificação de consistência. As cadeias de raciocínio são armazenadas como sequências ordenadas de etapas, enquanto as análises de caminhos são representadas por estruturas hierárquicas com relações entre nós-pai e nós-filho. As validações lógicas, por sua vez, são modeladas como grafos de proposições e conexões direcionadas, com todas essas associações implementadas por chaves estrangeiras para assegurar a integridade referencial em relação ao usuário.

No backend, cada módulo opera com rotas e serviços próprios, utilizando SQLAlchemy para processar solicitações e persistir resultados. Essa organização modular permite que as análises sejam executadas de forma independente, mas posteriormente integradas na geração dos relatórios de auditoria. O frontend, por sua vez, foi estruturado em dez páginas dedicadas a funcionalidades específicas, incluindo um dashboard interativo, um chat integrado, e visualizações para rastreamento de raciocínio, análise de caminhos, validação lógica, verificação de consistência, relatórios de auditoria e configurações do sistema.

O Rastreador de Raciocínio, o primeiro módulo, implementa a interceptação de requisições e a injeção de instruções de cadeia de pensamento (Chain-of-Thought) em um objeto estruturado. Para cada requisição processada, o módulo registra as premissas declaradas, as inferências realizadas, a conclusão final e um nível de confiança, variando de 0 a 100, para cada passo do raciocínio. O parsing dessas informações é realizado por meio de expressões regulares, e cada registro recebe um hash SHA-256, que atua como uma “impressão digital” para garantir a integridade e detectar qualquer alteração indevida no conteúdo. Essa característica é essencial para cenários de compliance e auditoria regulatória, onde a imutabilidade da prova de raciocínio é irrefutável.

A interface de visualização do rastreador de raciocínio exibe detalhadamente o prompt original, o hash de integridade e os passos de raciocínio. Por exemplo, em uma consulta sobre a decisão de um carro autônomo desviar para salvar cinco pedestres em detrimento do passageiro, o sistema decompõe o raciocínio em premissas como “Um carro autônomo possui a capacidade de tomar decisões em situações de emergência” e “Salvar cinco vidas é considerado moralmente preferível a salvar uma vida”, cada uma com 100% de confiança. As inferências subsequentes, como a avaliação das consequências e a escolha da opção que minimiza a perda de vidas, também são registradas com seus respectivos níveis de confiança, culminando na conclusão final baseada na lógica utilitarista.

O Analisador de Caminhos, o segundo módulo, estende o conceito de raciocínio para múltiplos percursos, implementando uma busca em árvore com avaliação heurística inspirada no paradigma Tree-of-Thought. O problema é decomposto em dois a quatro subproblemas, para os quais são geradas duas a três hipóteses alternativas, cada uma com um score de viabilidade entre 0 e 100. Caminhos com pontuação inferior a 40 são podados e documentados, permitindo a identificação de linhas de raciocínio que, embora não apresentadas ao usuário final, podem ser relevantes ou revelar falhas potenciais. O índice de confiança atribuído a cada trajetória é uma autoavaliação declarada pelo próprio LLM, não uma métrica externa objetiva de correção.

A visualização interativa da árvore de decisão, implementada com React Flow, permite ao usuário navegar pelos nós explorados, identificar os caminhos podados e o caminho selecionado. Em um cenário de demissão de funcionários, por exemplo, o sistema pode apresentar a hipótese de “Comunicar abertamente as razões das demissões” com 85% de autoavaliação, e “Oferecer pacotes de demissão voluntária” com 75%. Uma hipótese como “Manter os funcionários no escuro até a demissão” pode ser podada com 30% de autoavaliação, indicando baixa viabilidade. As métricas capturadas por este módulo incluem o total de nós explorados, o total de caminhos podados e o score do caminho selecionado, fornecendo uma visão abrangente do espaço de solução explorado pelo LLM.

O Validador Lógico, o terceiro módulo, transforma o raciocínio extraído em um grafo dirigido de proposições, conforme o paradigma Graph-of-Thought, utilizando a biblioteca NetworkX para análise estrutural. Cada nó do grafo representa uma proposição (premissa, inferência, conclusão ou premissa oculta), e cada aresta indica uma relação lógica (suporte, contradição, implicação ou dependência). O módulo é capaz de detectar quatro tipos de falhas lógicas: contradições entre proposições conflitantes, saltos lógicos identificados como nós desconectados, premissas ocultas não declaradas e circularidade, detectada por algoritmos de busca de ciclos. Um score de validade, de 0 a 100, é calculado com base na proporção de problemas em relação ao total de proposições, sintetizando a qualidade lógica do raciocínio.

A detecção de falhas lógicas é ilustrada por exemplos como contradições, onde uma premissa que afirma que desviar para salvar cinco pedestres resulta na morte do passageiro entra em tensão com outra que sugere que salvar cinco vidas é moralmente preferível a salvar uma. Lacunas lógicas são identificadas pela falta de uma explicação clara sobre como a decisão se alinha à lógica utilitarista. Premissas ocultas, como a suposição de que a vida do passageiro é menos valiosa, são apontadas. A circularidade é detectada quando inferências se justificam mutuamente, criando um ciclo sem uma base externa, como um ciclo entre inferências 5, 6 e 8. Essas informações são cruciais para a auditoria, pois revelam fragilidades no processo de tomada de decisão do LLM.

O Verificador de Consistência, o quarto módulo, aplica uma metodologia de teste por repetição inspirada no conceito de Self-Consistency (Wang et al., 2023). A consulta original é reformulada semanticamente em cinco variações, e as respostas geradas são comparadas par a par para identificar a permanência das informações centrais, bem como omissões, contradições ou alterações relevantes. A taxa de convergência, expressa em uma escala de 0 a 1, corresponde à proporção de pares concordantes. O score de confiança final combina essa taxa-base com penalidades por divergências e bonificações por alta consistência, oferecendo uma medida da estabilidade semântica das informações.

A interface de verificação de consistência apresenta as respostas individuais de cada execução e descreve os pontos divergentes, indicando as respostas envolvidas e o nível de severidade atribuído a cada diferença. Em um exemplo, para a consulta “Se uma pessoa me agredir, até quanto tempo depois eu posso denunciar essa pessoa?”, o sistema pode apresentar uma taxa de convergência de 80% e um score de confiança de 72% após três execuções. Pontos divergentes podem incluir a menção de que o prazo pode chegar a 20 anos em uma resposta, enquanto outras não especificam, ou a diferença sobre o marco inicial da contagem do prazo. É importante notar que uma alta consistência não garante a correção, pois o modelo pode reproduzir o mesmo erro sistematicamente.

O Gerador de Trilha de Auditoria, o quinto e último módulo, consolida os dados de todos os módulos anteriores em relatórios multi-formato, incluindo PDF (via ReportLab), Excel (via openpyxl) e JSON nativo. Esses relatórios são direcionados a três perfis de stakeholders: compliance, que recebe hashes de integridade e trilhas cronológicas; jurídico, que foca na cadeia de evidências e pontos de divergência; e técnico, que acessa dados brutos, estruturas de grafos e métricas detalhadas. Essa segregação de informações atende às necessidades de diferentes contextos de uso, desde documentação formal até análise de dados e integração com outros sistemas, conforme ilustrado por um resumo executivo que apresenta métricas como Total de Decisões (13), Análises de Caminho (10), Validações Lógicas (10), Verificações de Consistência (9), Problemas Encontrados (23), Score Médio de Validade (53.0%) e Score Médio de Confiança (72.74%).

Uma aplicação demo, construída com Streamlit, demonstra a integração do ReasonGuard por meio de um chatbot interativo. O usuário pode ativar ou desativar cada módulo de análise individualmente e visualizar os resultados da auditoria em tempo real, tornando a plataforma ideal para demonstrações e provas de conceito. O sistema de autenticação, implementado com Clerk, suporta login por email com verificação obrigatória e OAuth via Google, garantindo persistência de sessão e proteção de rotas. Além disso, um sistema de API Tokens permite integrações programáticas por meio de tokens no formato `rg_`, armazenados com hash SHA-256 e com data de expiração configurável, com toda a infraestrutura orquestrada via Docker Compose, incluindo quatro serviços e health checks configurados.

A discussão dos resultados reitera que é viável operacionalizar técnicas de raciocínio estruturado, originalmente concebidas para melhorar o desempenho de LLMs, como ferramentas de rastreabilidade em ambientes de governança de IA. A abordagem de middleware transparente, que permite a integração de qualquer aplicação existente ao ReasonGuard sem modificações, apenas redirecionando o endpoint do LLM para o proxy, é um diferencial significativo. Isso elimina o custo de reengenharia que tipicamente inviabiliza a adoção de ferramentas de observabilidade em ambientes corporativos, sugerindo um caminho de adoção com baixo atrito para sistemas já em operação.

Retomando o problema de pesquisa sobre a ausência de plataformas integradas que operacionalizam CoT, ToT e GoT como mecanismos de auditoria em produção, os resultados indicam uma resposta parcialmente afirmativa. Do ponto de vista da viabilidade técnica, o problema foi resolvido, com todos os cinco módulos implementados, integrados e validados funcionalmente. Isso demonstra que os paradigmas podem ser reaproveitados como instrumentos de observabilidade em uma única plataforma coesa, e não apenas como técnicas isoladas de melhoria de desempenho. No entanto, a validação em escala, que envolveria a sustentação da rastreabilidade e detecção de falhas lógicas sob volume de dados real e diversidade de domínios, permanece apenas parcialmente respondida neste estágio, uma vez que a validação realizada cobriu a corretude funcional de cada módulo, mas não uma avaliação quantitativa de precisão e recall da detecção de falhas lógicas contra um conjunto de referência rotulado, nem um estudo de caso em ambiente de produção real. Essa distinção entre “viabilidade demonstrada” e “eficácia validada em escala” delimita com precisão a contribuição efetiva deste trabalho em seu estágio atual.

A segregação de relatórios por perfil de stakeholder (compliance, jurídico e técnico) endereça diretamente uma limitação identificada nas ferramentas de explicabilidade existentes (Zhao et al., 2024), que tipicamente produzem saídas técnicas de difícil consumo por equipes de compliance e jurídico. Ao gerar visões específicas para cada público, o ReasonGuard reduz a distância entre o dado técnico bruto e a decisão de governança que dele depende. Contudo, é preciso reconhecer os limites dessa evidência: trata-se, até o momento, de uma demonstração de viabilidade em ambiente controlado, e a validação da melhoria real exigiria, como trabalho futuro, um estudo comparativo com equipes de auditoria operando com e sem a plataforma, medindo, por exemplo, tempo de detecção de falhas ou taxa de conformidade regulatória.

Adotando uma leitura crítica dos próprios resultados, cabe destacar três limitações que emergem diretamente da análise. Em primeiro lugar, o índice de confiança utilizado tanto no Rastreador quanto no Analisador de Caminhos é uma autoavaliação declarada pelo próprio LLM, e não uma métrica calculada de forma independente. Como os LLMs são conhecidamente propensos a excesso de confiança mesmo em respostas incorretas, esse índice deve ser interpretado como um sinal adicional de auditoria, e não como garantia objetiva de correção, uma ambiguidade que a plataforma, em sua versão atual, não distingue explicitamente na interface.

Em segundo lugar, o Verificador de Consistência assume que a convergência entre múltiplas execuções é um proxy válido para correção do raciocínio. Entretanto, um LLM pode convergir de forma consistente para uma mesma resposta incorreta caso o erro decorra de uma limitação sistemática do modelo, como uma lacuna de conhecimento ou um viés de treinamento, em vez de uma variação aleatória de amostragem. Nesse cenário, a alta consistência mascararia, em vez de revelar, a falha. Por fim, os resultados apresentados refletem um volume de dados de teste ainda reduzido, o que limita a capacidade de generalizar as métricas de desempenho e usabilidade do dashboard para cenários de produção com maior throughput.

Em relação à literatura, enquanto trabalhos anteriores focam predominantemente na melhoria do raciocínio (Wei et al., 2022; Yao et al., 2023; Besta et al., 2024; Wang et al., 2023) ou na explicabilidade post-hoc de forma isolada (Mokander et al., 2023; Zhao et al., 2024; Bilal et al., 2025; Mokander et al., 2025), o ReasonGuard oferece uma contribuição distinta ao unificar esses paradigmas em uma plataforma de auditoria orientada à conformidade regulatória. A abordagem se alinha diretamente com os requisitos do Regulamento Europeu de Inteligência Artificial (União Europeia, 2024) para sistemas de IA de alto risco, provendo documentação, rastreabilidade e explicabilidade de forma sistemática, sempre no sentido de rastreabilidade do processo declarado pelo modelo, e não de acesso direto ao seu mecanismo interno de decisão.

4. Conclusão

O presente estudo buscou desenvolver e validar o ReasonGuard, uma plataforma de auditoria de raciocínio para modelos de linguagem, instrumentalizando a decomposição estruturada de pensamento para promover transparência e rastreabilidade em decisões baseadas em Inteligência Artificial. Verificou-se a viabilidade técnica da abordagem proposta, com a implementação e integração de cinco módulos operacionais. O Rastreador de Raciocínio capturou trilhas de pensamento com garantia de integridade criptográfica, enquanto o Analisador de Caminhos explorou múltiplos percursos de solução, identificando e documentando caminhos podados. O Validador Lógico transformou o raciocínio em grafos de proposições, detectando falhas estruturais como contradições, saltos lógicos e circularidade. O Verificador de Consistência avaliou a estabilidade semântica das respostas por meio de múltiplas execuções. Por fim, o Gerador de Trilha de Auditoria consolidou esses dados em relatórios adaptados a perfis de stakeholders, contribuindo para a governança e conformidade regulatória. A plataforma oferece uma contribuição significativa ao preencher uma lacuna na literatura, unificando paradigmas de raciocínio estruturado como ferramentas de observabilidade e auditoria em uma solução coesa, facilitando a adoção em ambientes de produção por meio de sua arquitetura de middleware transparente.

Contudo, identificou-se limitações importantes que delimitam a contribuição atual do ReasonGuard. O índice de confiança declarado pelo próprio LLM, tanto no rastreador quanto no analisador de caminhos, não constitui uma métrica objetiva de correção, podendo mascarar vieses de superconfiança do modelo. Adicionalmente, a alta consistência das respostas, verificada pelo módulo correspondente, não garante a exatidão, pois o modelo pode reproduzir erros sistemáticos. Os resultados apresentados refletem um volume de dados de teste ainda reduzido, o que restringe a generalização das métricas de desempenho para cenários de produção em larga escala. Para estudos futuros, sugere-se a construção de um conjunto de referência rotulado para validação quantitativa da detecção de falhas lógicas, a realização de estudos comparativos com equipes de auditoria em ambientes reais para mensurar a eficácia da plataforma, e o desenvolvimento de módulos para detecção de vieses cognitivos, aprimorando a robustez e a aplicabilidade do ReasonGuard em contextos regulatórios e de alto risco.

Referências Bibliográficas

BESTA, M. et al. Graph of Thoughts: Solving Elaborate Problems with Large Language Models. In: Proceedings of the AAAI Conference on Artificial Intelligence, v. 38, 2024. Disponível em: https://arxiv.org/abs/2308.09687.

BILAL, A.; EBERT, D.; LIN, B. LLMs for Explainable Al: A Comprehensive Survey. arXiv preprint, arXiv:2504.00125, 2025. Disponível em: https://arxiv.org/abs/2504.00125.

MOKANDER, J. et al. Audit Trails for Accountability in Large Language Models. arXiv preprint, arXiv:2601.20727, 2025. Disponível em: https://arxiv.org/abs/2601.20727.

MÖKANDER, J. et al. Auditing Large Language Models: A Three-Layered Approach. Al and Ethics, 2023. Disponível em: https://arxiv.org/abs/2302.08500.

UNIÃO EUROPEIA. Regulamento (UE) 2024/1689 do Parlamento Europeu e do Conselho de 13 de junho de 2024 (EU Artificial Intelligence Act). Jornal Oficial da União Europeia, 2024.

WANG, X. et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. In: Proceedings of the International Conference on Learning Representations (ICLR), 2023. Disponível em: https://arxiv.org/abs/2203.11171.

WEI, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. In: Advances in Neural Information Processing Systems (NeurIPS), v. 35, 2022. Disponível em: https://arxiv.org/abs/2201.11903.

YAO, S. et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. In: Advances in Neural Information Processing Systems (NeurIPS), v. 36, 2023. Disponível em: https://arxiv.org/abs/2305.10601.

ZHAO, H. et al. From Understanding to Utilization: A Survey on Explainability for Large Language Models. arXiv preprint, arXiv:2401.12874, 2024. Disponível em: https://arxiv.org/abs/2401.12874.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

Engenharia De Software

09 de outubro de 2026

O papel da densidade de texto instrutivo na eficiência de uma aplicação web.

O desenvolvimento de aplicações web se conecta à experiência do usuário, e este trabalho investigou como o uso excessivo de textos instrutivos pode retardar a conclusão de tarefas e impactar a eficiência da aplicação. O objetivo foi identificar o impacto da densidade textual do conteúdo instrutivo na eficiência de uma aplicação web, utilizando como principal referência a terceira lei de usabilidade de Krug. A pesquisa, de caráter exploratório e delineamento experimental quantitativo, empregou um teste A/B em uma aplicação web responsiva, onde a única variável controlada foi a densidade textual (alta vs. baixa, definida pela contagem de palavras). Participaram 25 usuários, e os dados foram coletados via Datadog RUM, mensurando tempo de conclusão, erros de submissão e taxa de conversão. Os resultados revelaram que a variante com densidade textual reduzida (variante B) apresentou uma taxa de conversão superior (58,3% contra 33,3% da variante A) e um tempo médio de conclusão significativamente menor (1:38 minutos contra 4:58 minutos da variante A), representando um aumento de 67,12% na eficiência. O teste t de Welch (p=0,042) confirmou que a redução da densidade textual impactou a eficiência. Concluiu-se que a redução da densidade textual afeta a eficiência e a taxa de conversão, reforçando a importância de conteúdo objetivo e conciso. Contudo, a baixa densidade textual, por si só, não garantiu o pleno entendimento, sendo essencial a comunicação clara e objetiva das instruções, validando a relevância do UX Writing.

Palavras-chave: Eficiência; Experiência de usuário; Teste A/B; Texto Instrutivo; Usabilidade.

Engenharia De Software

09 de outubro de 2026

Implementação de sistemas de analytics em ambientes de automação na indústria de processos

A digitalização de plantas de processo depende de coleta e armazenamento estruturados de dados, sem os quais não há visibilidade da operação. Chama-se analytics industrial a cadeia que percorre esses dados desde a aquisição do sinal no instrumento de campo, passando pelo armazenamento ordenado no tempo, até a disponibilização para análise e para outros sistemas. Softwares industriais proprietários cobrem hoje essa cadeia, e os custos de licenciamento e manutenção restringem sua adoção. O estudo teve por objetivo arquitetar, implementar e validar um sistema dessa natureza, empregando técnicas correntes de desenvolvimento de software e componentes sem custo de licenciamento. O sistema, denominado Sistema de Aquisição e Tratamento de Informações de Processo (SATIP), foi estruturado em três camadas independentes, tendo como fonte de dados um simulador de reator farmacêutico que executou uma receita de oito etapas e gerou séries temporais com variação estocástica. O simulador foi escrito em Go, linguagem adotada por gerar binários autocontidos, adequados à execução em equipamentos de borda. O armazenamento utilizou o TimescaleDB e a disponibilização foi realizada por meio de uma interface REST com um painel web. O sistema processou cerca de 414 mil registros por execução, com tendência multivariável, registro de alarmes e correlação temporal entre instrumentos. A arquitetura mostrou-se reproduzível e sem custo de licenciamento, e a identificação da degradação exigiu apenas as leituras já armazenadas pelo sistema.

Palavras-chave: Arquitetura de software; Digitalização; Integração IT/OT; Manutenção preditiva; Séries temporais.

Engenharia De Software

09 de outubro de 2026

Utilização da voz em conjunto a grandes modelos de linguagem como ferramenta à acessibilidade digital

A fala é uma base essencial para a interação humana, e para pessoas com deficiência, pode representar a principal forma de comunicação com o ambiente externo. Diante da crescente influência tecnológica, a identificação de comandos de voz emergiu como uma estratégia promissora para a interação homem-máquina. O trabalho explorou como a voz, em conjunto com Grandes Modelos de Linguagem (LLMs), pode ser utilizada de forma eficiente, natural e precisa. Para tal, empregaram-se diversos padrões de projetos e a linguagem Python, visando maior extensibilidade. Utilizou-se o Gemini como provedor de LLM, enviando o áudio diretamente e aproveitando sua capacidade de chamada de função para interagir com o dispositivo. Desenvolveu-se um sistema capaz de compreender a intenção do usuário e convertê-la em ações, cujo diferencial foi a capacidade de visão computacional baseada em capturas de tela e um sistema de malha para orientação da LLM. Os testes revelaram uma taxa de compreensão da intenção do usuário de 91,81% e uma taxa de sucesso na execução de 75,45% com o modelo “Flash-3” (top p 0,5 e top k 5). O sistema proposto validou a premissa de que a integração de LLMs a interfaces de voz aumenta a autonomia de usuários com deficiência motora, cumprindo o propósito de ser uma Tecnologia Assistiva moderna e eficaz. Contudo, foram levantadas questões sobre os custos da IA e a segurança dos dados do usuário, indicando a necessidade de aprimoramento.

Palavras-chave: Chamada de função; Interação homem-máquina; Reconhecimento de voz; Visão computacional.

Engenharia De Software

09 de outubro de 2026

EngTT: software para motor de frete rodoviário baseado em custos operacionais e parâmetros ANTT

O transporte rodoviário representa a principal modalidade logística do Brasil, com a composição dos custos de frete regulada pela Agência Nacional de Transportes Terrestres (ANTT). Diante da ausência de uma metodologia estruturada para o cálculo de frete e da dependência de planilhas isoladas no setor, desenvolveu-se o software EngTT. O objetivo foi criar uma ferramenta de apoio à decisão que integrasse variáveis operacionais, calculasse o custo total por rota e comparasse os resultados com o piso mínimo da ANTT, identificando cenários de não conformidade e compressão de margem antes da precificação. A metodologia adotada foi aplicada, quantitativa e experimental, com construção incremental orientada ao conceito de Produto Mínimo Viável (MVP). O sistema foi estruturado em três modos de uso – Montar Rota Visual, Batch por planilha e Scrape de rotas – compartilhando um motor de cálculo desacoplado e parâmetros centralizados. Os resultados obtidos demonstraram que o software atendeu ao objetivo proposto, evidenciando variações de margem e conformidade regulatória entre as rotas analisadas. Observou-se que rotas de maior extensão, como Ribeirão Preto × Guarujá, apresentaram incremento de custo devido à necessidade de diárias adicionais do motorista, enquanto rotas mais curtas, como Cajamar × Guarujá, mostraram maior aderência ao piso regulatório da ANTT. Concluiu-se que a solução desenvolvida é aplicável ao setor de transporte rodoviário de cargas como ferramenta eficaz de precificação e gestão operacional.

Palavras-chave: ANTT; Carga conteinerizada; Engenharia de software; Frete rodoviário; Python.

Engenharia De Software

08 de outubro de 2026

Pipeline de dados para o monitoramento de ações considerando a metodologia fundamentalista

O cenário financeiro brasileiro enfrenta desafios como o endividamento familiar, a baixa literacia financeira e a descentralização de informações para análise de investimentos. Diante disso, o objetivo da pesquisa consistiu em desenvolver um pipeline de dados financeiros, fundamentado em boas práticas de Engenharia de Dados, para estruturar, processar e disponibilizar informações relevantes que apoiassem a tomada de decisão de investidores individuais na análise de ações. Implementou-se uma arquitetura medalhão, utilizando MinIO S3 para armazenamento em camadas bronze, silver e gold, com Delta Lake para governança de dados. Empregou-se Apache Spark para processamento distribuído, Prometheus para monitoramento e Power BI para visualização analítica. Os dados foram majoritariamente demonstrações financeiras da Comissão de Valores Mobiliários (CVM). Construiu-se uma carteira teórica de investimentos com base nos princípios de Benjamin Graham (2017), aplicando filtros de seleção e validação de dados. Os resultados indicaram um retorno positivo de 32,88% para a carteira teórica, superando o índice Ibovespa (4,25%) no período de 2021 a 2024, embora inferior à taxa Selic (46,96%). Qualitativamente, o pipeline processou conjuntos de dados volumosos, com reduções significativas de redundâncias, como 99,27% na tabela BPA e 94,29% na DRE, após a aplicação de filtros. Evidenciaram-se ganhos em organização, rastreabilidade e qualidade dos dados, possibilitando análises financeiras estruturadas e mais robustas.

Palavras-chave: Arquitetura Medalhão; Engenharia de Dados; Investimentos; Pipeline de Dados.

Engenharia De Software

08 de outubro de 2026

Desempenho e Custo Total de Propriedade de Bancos de Dados em Nuvem e Infraestrutura Local

O presente estudo analisou o desempenho de operações de banco de dados em infraestruturas de nuvem e local, correlacionando o comportamento técnico com a projeção do Custo Total de Propriedade. A pesquisa caracterizou-se como um estudo quantitativo e experimental, no qual um sistema de testes submeteu instâncias isoladas de bancos de dados a cargas progressivas de execução, mensurando o impacto da latência de rede e do consumo computacional. Para a análise financeira, elaborou-se uma modelagem de investimentos e despesas operacionais diluídos em um ciclo de trinta e seis meses. Os resultados técnicos revelaram que o acúmulo da latência da internet causou severa degradação de tempo nas execuções em nuvem, apesar de a infraestrutura remota operar com alta ociosidade de processamento, registrando quase 98% de inatividade da CPU. Em contrapartida, o ambiente local obteve desempenho superior amparado pela comunicação de rede quase instantânea. No aspecto financeiro, a consolidação dos custos demonstrou um empate empírico entre o modelo de aquisição física e o de assinatura de serviço em um horizonte de três anos, mas o ambiente local mostrou-se mais vantajoso em um ciclo de sessenta meses. Concluiu-se que a degradação na nuvem não decorreu da capacidade computacional, mas da interação entre a latência de rota e o padrão de comunicação unitário da aplicação. A adoção da nuvem exige otimização profunda da arquitetura do sistema para minimizar a dependência de comunicação constante com o servidor remoto. Sem essa modernização, a infraestrutura local consolidou-se como a estratégia mais viável, garantindo alto desempenho, previsibilidade orçamentária e soberania dos dados.

Palavras-chave: Despesas operacionais (OPEX); Escalabilidade transacional; Latência de rede; Sistemas legados.

Engenharia De Software

08 de outubro de 2026

Integração assíncrona Slack-Jira via “middleware” de filas: comparação de soluções de “cloud computing”

A latência e a interoperabilidade entre sistemas corporativos distribuídos constituíram o problema investigado, motivado pelos custos e fragilidades das integrações manuais entre plataformas de colaboração e gestão de projetos. Desenvolveu-se e validou-se um “middleware” de integração assíncrona entre Slack e Jira, com o objetivo de reduzir o tempo de resposta percebido pelo usuário e garantir a estabilidade do sistema sob carga. A metodologia consistiu na construção de uma arquitetura de software orientada a eventos em Python, utilizando os padrões “producer-consumer” e “adapter” para isolar a interface do usuário do processamento de “backend”. A solução evoluiu para uma arquitetura agnóstica de nuvem, baseada em funções “serverless”, e foi submetida a testes de estresse em ambientes local, de rede real e de produção em duas nuvens. A arquitetura reduziu o tempo de espera do usuário de uma estimativa síncrona de 2.000 milissegundos para uma média local de 8,96 milissegundos. Sob carga de 50 requisições simultâneas, ambos os provedores de nuvem mostraram-se viáveis: a Amazon Web Services registrou menor latência média na camada de recepção (951,35 ms) e o dobro da vazão, enquanto a Microsoft Azure executou o processamento em segundo plano com mediana de 113 ms. A aplicação de “optimistic UI” assegurou fluidez de uso, e o nivelamento de carga por filas dispensou o sobredimensionamento de infraestrutura. O “middleware” consolidou-se como um modelo de referência corporativa escalável, resiliente e protegido contra o aprisionamento tecnológico.

Palavras-chave: Arquitetura orientada a eventos; Desacoplamento temporal; Eficiência operacional; Gestão de serviços de tecnologia da informação; Interoperabilidade de sistemas.

Engenharia De Software

05 de outubro de 2026

Usando IA generativa para escolha de banco de dados: Um framework orientado a requisitos para geração de Architecture Decision Records (ADRs)

O crescimento de aplicações intensivas em dados e a adoção da arquitetura de microsserviços ampliaram a necessidade da persistência poliglota, impondo uma alta carga cognitiva aos arquitetos de software na escolha e justificação de tecnologias de banco de dados. Este trabalho teve como objetivo propor e desenvolver um framework baseado em agentes de Inteligência Artificial (IA) para guiar a seleção tecnológica e gerar Architecture Decision Records (ADRs) fundamentadas. Empregou-se uma metodologia experimental e aplicada para construir uma base de conhecimento técnico. A técnica de Retrieval-Augmented Generation (RAG), juntamente com as bibliotecas LangChain e LangGraph, foi utilizada para orquestrar agentes e ancorar as respostas de um Large Language Model (LLM). O framework extraiu requisitos em linguagem natural, enriqueceu-os com RAG e os enviou ao LLM, que gerou ADRs para auxiliar na avaliação de trade-offs teóricos. Os resultados demonstraram que o agente com RAG reduziu respostas genéricas, aumentando o embasamento teórico e a rastreabilidade. A abordagem RAG comprovou sua eficácia frente a prompts convencionais (zero-shot), favorecendo a geração de ADRs com menor nível de alucinação e alto nível de rastreabilidade teórica. Concluiu-se que a ferramenta automatizada cumpriu a função de mapeamento de requisitos, resultando em documentos técnicos empiricamente embasados e auxiliando a governança e tomada de decisões em arquitetura de software.

Palavras-chave: Bancos de Dados; Inteligência Artificial; LangGraph; LLM; RAG.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade