Engenharia De Software
09 de outubro de 2026
ReasonGuard: Uma Plataforma de Auditoria de Raciocínio para Modelos de Linguagem Baseada em Decomposição Estruturada de Pensamento
Reasonguard: uma Plataforma de Auditoria de Raciocínio para Modelos de Linguagem Baseada em Decomposição Estruturada de Pensamento
Lucas Nastari Ziza; Lucas Cesar Gomes Alvarinho Squillante
DOI: 10.22167/2675-6528-202603200
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
Apresentou-se o ReasonGuard, uma plataforma de auditoria de raciocínio de Inteligência Artificial, desenvolvida como middleware de observabilidade entre aplicações cliente e modelos de linguagem de grande escala (LLMs). O trabalho teve como objetivo oferecer transparência e rastreabilidade para processos de tomada de decisão baseados em IA, abordando a lacuna na operacionalização de técnicas de raciocínio estruturado para fins de auditoria. O sistema interceptou, analisou e documentou interações com LLMs por meio de cinco módulos fundamentados nos paradigmas Chain-of-Thought (CoT), Tree-of-Thought (ToT) e Graph-of-Thought (GoT). Esses módulos capturaram trilhas de raciocínio, detectaram falhas lógicas estruturais, avaliaram a consistência de respostas e geraram relatórios de auditoria direcionados a diferentes perfis de stakeholders. A plataforma implementou-se com FastAPI (Python) no backend, React com TypeScript no frontend e PostgreSQL como banco de dados relacional, seguindo arquitetura modularizada com isolamento multitenancy por usuário. Os resultados demonstraram a viabilidade técnica da abordagem proposta, com todos os cinco módulos operacionais e integrados. Concluiu-se que o ReasonGuard contribui para a governança de IA ao instrumentalizar paradigmas de raciocínio estruturado como ferramentas de observabilidade e auditoria, preenchendo uma lacuna na literatura.
Palavras-chave: Auditoria de IA; Chain-of-Thought; Governança de IA; Modelos de Linguagem de Grande Escala; Transparência Algorítmica.
1. Introdução
Modelos de Linguagem de Grande Escala (LLMs) são sistemas de aprendizado profundo, tipicamente baseados na arquitetura Transformer, treinados sobre volumosas estruturas de dados para prever a continuação mais provável de uma sequência de texto. A partir desse mecanismo de predição estatística de tokens, emergem capacidades complexas de geração de linguagem, resposta a perguntas, sumarização e, mais recentemente, raciocínio em múltiplas etapas. É justamente essa capacidade emergente de raciocínio e sua aplicação a decisões de alto impacto que motiva o presente trabalho.
A crescente adoção de LLMs em contextos de tomada de decisão, incluindo áreas como saúde, direito, finanças e governança corporativa, tem evidenciado uma grande lacuna: a visualização dos processos de raciocínio que fundamentam as respostas geradas por esses sistemas. Um exemplo ilustrativo dessa problemática é o erro de “raciocínio plausível, porém falacioso”. Ao ser questionado sobre a viabilidade de um contrato com uma cláusula de rescisão automática em caso de atraso de pagamento, um LLM pode concluir corretamente que o contrato é rescindível, mas fundamentar essa conclusão em uma premissa não declarada e incorreta, como assumir erroneamente que qualquer atraso ativa a cláusula. A resposta final soa convincente e frequentemente está correta por coincidência, mas o raciocínio subjacente contém uma falha estrutural que, em um cenário real, poderia levar a uma decisão equivocada sem sinal explícito de erro para o usuário. Esse tipo de falha indetectável a partir da simples leitura da resposta final é o problema central que o ReasonGuard busca endereçar.
Embora os LLMs demonstrem capacidades expressivas em tarefas de raciocínio complexo, a ausência de mecanismos formais de auditoria e rastreabilidade compromete sua aplicabilidade em cenários que exigem responsabilização e conformidade regulatória. Do ponto de vista regulatório, o cenário global tem se movido em direção a exigências mais rigorosas de transparência. O Regulamento Europeu de Inteligência Artificial (União Europeia, 2024), por exemplo, estabelece obrigações específicas de transparência para sistemas de IA de alto risco, incluindo requisitos de documentação, rastreabilidade e explicabilidade. No contexto acadêmico, pesquisas recentes sobre infraestrutura de accountability para IA destacam que a responsabilização permanece frágil porque a transparência de processo raramente é registrada de forma durável e auditável (Mokander et al., 2025). É importante demarcar que, por se tratarem de redes neurais de bilhões de parâmetros cujo processamento interno não é diretamente interpretável, os LLMs permanecem, em essência, “caixas-pretas”. O que o ReasonGuard e as técnicas de decomposição estruturada de raciocínio oferecem não é a abertura dessa caixa-preta, mas sim a indução do modelo a expressar, em linguagem natural, uma justificativa passo a passo que possa ser registrada, versionada e auditada. Trata-se, portanto, de rastreabilidade do processo de geração das respostas, um registro verificável do que o modelo declarou como seu raciocínio e não de transparência plena ou reprodutibilidade do mecanismo interno de decisão do modelo, distinção que orienta todo o desenho da plataforma.
O conceito de raciocínio estruturado em modelos de linguagem ganhou destaque com o trabalho de Wei et al. (2022), que demonstraram a técnica de Chain-of-Thought (CoT). Essa técnica, ao explicitar passos intermediários de raciocínio antes da resposta final, melhora significativamente o desempenho em tarefas aritméticas, de senso comum e de raciocínio simbólico. A partir dessa base, Yao et al. (2023) propuseram o framework Tree of Thoughts (ToT), que generaliza o CoT ao permitir a exploração deliberada de múltiplos caminhos de raciocínio, tratando cada etapa intermediária como um nó de uma árvore de busca. Besta et al. (2024) avançaram ainda mais ao introduzir o Graph of Thoughts (GoT), que modela a informação gerada pelo LLM como um grafo arbitrário de proposições e suas dependências. Paralelamente, Wang et al. (2023) propuseram a abordagem de Self-Consistency, uma estratégia de decodificação que explora múltiplos caminhos de raciocínio e seleciona a resposta mais consistente entre eles, elevando o desempenho do CoT em benchmarks.
Apesar desses avanços, observa-se uma lacuna específica na literatura: os trabalhos citados acima concentram-se em duas frentes distintas e, até o momento, não integradas. A primeira frente trata essas técnicas (CoT, ToT, GoT e Self-Consistency) como métodos para melhorar o desempenho de LLMs em tarefas de raciocínio, sem preocupação com o registro persistente, verificável e auditável do processo gerado. A segunda frente, os trabalhos de auditoria e explicabilidade (Mokander et al., 2023; Zhao et al., 2024; Bilal et al., 2025; Mokander et al., 2025) discutem o que deveria ser auditado e propõem camadas conceituais de verificação, mas não apresentam uma implementação de referência que capture, estruture e persista, de forma sistemática e pronta para produção, o raciocínio decomposto segundo esses paradigmas. Não há, portanto, uma plataforma que opere na interseção dessas duas frentes: que utilize CoT, ToT e GoT não para melhorar a resposta do modelo, mas como instrumentos de observabilidade, capturando o raciocínio decomposto, persistindo-o com garantias de integridade e disponibilizando-o em formatos utilizáveis por equipes de compliance, jurídico e engenharia. É essa lacuna de operacionalização, a ausência de uma ponte entre a técnica de decomposição de raciocínio e a prática de auditoria em ambientes de produção, que o presente trabalho busca preencher.
Neste contexto, o presente trabalho propõe o ReasonGuard, uma plataforma de auditoria de raciocínio que instrumentaliza os paradigmas de raciocínio como mecanismos de observabilidade, operando entre aplicações cliente e provedores de LLM. O objetivo geral deste estudo é desenvolver e validar o ReasonGuard, uma plataforma de auditoria de raciocínio para modelos de linguagem baseada em decomposição estruturada de pensamento, com os seguintes objetivos específicos: (i) capturar trilhas completas de raciocínio com garantia de integridade criptográfica; (ii) detectar falhas lógicas estruturais como contradições, circularidade, saltos lógicos e premissas ocultas; (iii) avaliar a consistência de respostas por meio de múltiplas execuções com variações semânticas; e (iv) gerar relatórios de auditoria direcionados a diferentes perfis de stakeholders, contribuindo para a governança e a conformidade regulatória de sistemas baseados em IA.
2. Material e Métodos
A pesquisa realizada possui natureza aplicada, orientada à geração de conhecimentos práticos para solucionar a falta de transparência e auditabilidade nos processos de raciocínio de Modelos de Linguagem de Grande Escala (LLMs). O estudo caracterizou-se como exploratório-experimental, combinando a investigação de técnicas de decomposição de raciocínio com a implementação e validação de módulos em um ambiente controlado. A abordagem metodológica adotada foi quali-quantitativa, englobando tanto a análise estrutural do raciocínio extraído quanto o cálculo de métricas numéricas, como pontuações de validade e taxas de consistência.
O desenvolvimento do ReasonGuard seguiu uma metodologia iterativa e incremental, baseada em prototipação evolutiva, estruturada em seis fases sequenciais. Inicialmente, definiram-se os requisitos e a arquitetura do sistema, identificando-se os cinco módulos principais e adotando-se o padrão arquitetural de API Proxy. Em seguida, implementou-se o backend com os módulos core, seguido pela implementação do frontend com um dashboard interativo. As fases subsequentes incluíram a integração e autenticação com isolamento multitenancy, a construção de uma aplicação demo em Streamlit e, por fim, a otimização e o refinamento de performance e usabilidade.
A arquitetura do sistema ReasonGuard foi concebida como um proxy reverso com recursos de observabilidade, atuando como um middleware entre aplicações cliente e provedores de LLM. Esse arranjo permitiu a interceptação transparente de requisições sem a necessidade de modificação da aplicação cliente, possibilitando a análise em tempo real e o armazenamento independente dos dados de auditoria. Para o cliente, a comunicação permaneceu inalterada, exigindo apenas o direcionamento das requisições ao endpoint do proxy, que preservou a estrutura esperada de entrada e saída.
Durante o fluxo de comunicação, o API Proxy registrou as informações relevantes da requisição, aplicou os mecanismos de rastreamento, validação e análise definidos pela plataforma, e encaminhou a chamada ao provedor do modelo. Após o processamento pelo provedor, a resposta foi devolvida ao proxy, que a analisou, associou aos dados da requisição original, calculou métricas e gerou a trilha de auditoria antes de repassá-la ao cliente. Dessa forma, o provedor de LLM permaneceu responsável pela inferência do modelo, enquanto o middleware centralizou as funções de observabilidade, controle e auditoria.
A infraestrutura do ReasonGuard foi composta por quatro serviços orquestrados via Docker Compose. Incluiu-se um banco de dados PostgreSQL para persistência relacional, um backend implementado com FastAPI em Python contendo os cinco módulos core e nove rotas de API REST, um frontend desenvolvido com React e TypeScript para o dashboard interativo, e uma aplicação demo em Streamlit como exemplo de integração. O isolamento multitenancy foi garantido por filtragem de usuário em todas as consultas ao banco de dados, assegurando que cada usuário acessasse somente seus próprios registros.
Os módulos principais foram desenvolvidos como unidades autônomas, cada qual com responsabilidade única, e integrados progressivamente ao sistema completo. O Rastreador de Raciocínio, o primeiro módulo, fundamentou-se no paradigma Chain-of-Thought (CoT). Operou por meio da injeção de prompts estruturados nas requisições ao LLM, induzindo o modelo a decompor seu raciocínio em premissas, inferências e conclusões. O parsing foi realizado via expressões regulares, e cada registro recebeu um hash SHA-256 para garantir a integridade dos dados.
O Analisador de Caminhos, o segundo módulo, estendeu o conceito para múltiplos caminhos, implementando uma busca em árvore com avaliação heurística inspirada no paradigma Tree-of-Thought (ToT). O problema foi decomposto em dois a quatro subproblemas, para os quais foram geradas duas a três hipóteses com scores de viabilidade, variando de zero a cem. Caminhos com pontuação inferior a quarenta foram podados e documentados. As métricas capturadas incluíram o total de nós explorados, o total de caminhos podados e o score do caminho selecionado.
O Validador Lógico, o terceiro módulo, transformou o raciocínio extraído em um grafo dirigido de proposições, utilizando a biblioteca NetworkX, conforme o paradigma Graph-of-Thought (GoT). Cada nó representou uma proposição (premissa, inferência, conclusão ou premissa oculta) e cada aresta, uma relação lógica. O módulo detectou quatro tipos de falhas lógicas: contradições, saltos lógicos identificados como nós desconectados, premissas ocultas não declaradas e circularidade, esta última detectada por algoritmos de busca de ciclos. Um score de validade, de zero a cem, foi calculado com base na proporção de problemas em relação ao total de proposições.
O Verificador de Consistência, o quarto módulo, aplicou uma metodologia de teste por repetição inspirada no conceito de Self-Consistency (Wang et al., 2023). A consulta original foi reformulada semanticamente em cinco variações, preservando a intenção original. As respostas geradas foram comparadas par a par para identificar a permanência das informações centrais e detectar divergências. Calculou-se uma taxa de convergência, expressa em uma escala de zero a um, e um score de confiança final que combinou essa taxa-base com penalidades por divergências e bonificações por alta consistência.
O Gerador de Trilha de Auditoria, o quinto módulo, consolidou os dados de todos os módulos anteriores em relatórios multi-formato. Esses relatórios foram gerados em PDF via ReportLab, Excel via openpyxl e JSON nativo, e direcionados a três perfis de stakeholders: compliance (com hashes de integridade e trilhas cronológicas), jurídico (com cadeia de evidências e pontos de divergência) e técnico (com dados completos, estruturas brutas e métricas detalhadas).
A escolha da pilha tecnológica foi orientada por critérios de adequação ao domínio de IA, maturidade do ecossistema e produtividade no desenvolvimento. O backend foi implementado em Python 3.11 com FastAPI 0.109.0, aproveitando o suporte nativo a operações assíncronas, validação automática via Pydantic e documentação OpenAPI. A biblioteca NetworkX 3.2.1 forneceu os algoritmos de análise de grafos necessários ao Validador Lógico.
O frontend foi construído com React 18.2.0 e TypeScript 5.3.3, utilizando React Flow 11.10.2 para visualização interativa de grafos e árvores, Recharts 2.10.4 para gráficos de KPIs e Material-UI 5.15.6 como framework de interface. O gerenciamento de estado servidor empregou TanStack Query para cache e sincronização. A autenticação foi gerenciada pelo Clerk 4.30.0, com suporte a OAuth (Google) e email/senha, enquanto o PostgreSQL 14 proveu a persistência relacional com suporte a campos JSONB para armazenamento de estruturas flexíveis.
A estratégia de validação seguiu uma abordagem em três níveis. Na validação funcional, cada módulo foi validado individualmente quanto à corretude do parsing, à detecção de padrões e ao cálculo de métricas. O parsing correspondeu ao processo de interpretar e estruturar os dados recebidos, extraindo corretamente campos, etapas de raciocínio e demais informações relevantes das respostas do modelo para as análises subsequentes.
A validação de integração contemplou o fluxo completo de funcionamento do proxy, desde o recebimento da requisição enviada pela aplicação cliente até o encaminhamento ao provedor de LLM. Incluiu-se o processamento pelos módulos de auditoria, a persistência dos resultados e o retorno da resposta ao usuário. Também foram verificados os mecanismos de autenticação de ponta a ponta, incluindo a identificação do usuário, a autorização de acesso aos recursos e o isolamento dos dados durante toda a execução.
A validação da interface concentrou-se na apresentação correta das informações produzidas pelo sistema. Avaliou-se a renderização de grafos e árvores de raciocínio com dados reais, a organização visual dos nós e conexões, a exibição dos resultados das análises e a atualização dos indicadores de desempenho no dashboard. Buscou-se assegurar que as alterações nos dados processados fossem refletidas corretamente nos KPIs e nos demais componentes visuais da plataforma.
3. Resultados e Discussão
Os resultados obtidos no desenvolvimento do ReasonGuard demonstram a viabilidade técnica da abordagem proposta para operacionalizar técnicas de raciocínio estruturado como ferramentas de rastreabilidade e auditoria em ambientes de governança de Inteligência Artificial. A plataforma foi implementada com completude em relação aos requisitos especificados, com todos os cinco módulos core totalmente funcionais e integrados. É fundamental situar esses achados como evidência da funcionalidade de um protótipo, e não como uma validação estatística em escala de produção, uma distinção crucial para a interpretação de sua contribuição atual.
A arquitetura do sistema foi concebida para garantir a integridade e a rastreabilidade dos dados. O modelo de dados centraliza-se na entidade de usuário, vinculando a ela todos os registros gerados pelos módulos de rastreamento de raciocínio, análise de caminhos, validação lógica e verificação de consistência. As cadeias de raciocínio são armazenadas como sequências ordenadas de etapas, enquanto as análises de caminhos são representadas por estruturas hierárquicas com relações entre nós-pai e nós-filho. As validações lógicas, por sua vez, são modeladas como grafos de proposições e conexões direcionadas, com todas essas associações implementadas por chaves estrangeiras para assegurar a integridade referencial em relação ao usuário.
No backend, cada módulo opera com rotas e serviços próprios, utilizando SQLAlchemy para processar solicitações e persistir resultados. Essa organização modular permite que as análises sejam executadas de forma independente, mas posteriormente integradas na geração dos relatórios de auditoria. O frontend, por sua vez, foi estruturado em dez páginas dedicadas a funcionalidades específicas, incluindo um dashboard interativo, um chat integrado, e visualizações para rastreamento de raciocínio, análise de caminhos, validação lógica, verificação de consistência, relatórios de auditoria e configurações do sistema.
O Rastreador de Raciocínio, o primeiro módulo, implementa a interceptação de requisições e a injeção de instruções de cadeia de pensamento (Chain-of-Thought) em um objeto estruturado. Para cada requisição processada, o módulo registra as premissas declaradas, as inferências realizadas, a conclusão final e um nível de confiança, variando de 0 a 100, para cada passo do raciocínio. O parsing dessas informações é realizado por meio de expressões regulares, e cada registro recebe um hash SHA-256, que atua como uma “impressão digital” para garantir a integridade e detectar qualquer alteração indevida no conteúdo. Essa característica é essencial para cenários de compliance e auditoria regulatória, onde a imutabilidade da prova de raciocínio é irrefutável.
A interface de visualização do rastreador de raciocínio exibe detalhadamente o prompt original, o hash de integridade e os passos de raciocínio. Por exemplo, em uma consulta sobre a decisão de um carro autônomo desviar para salvar cinco pedestres em detrimento do passageiro, o sistema decompõe o raciocínio em premissas como “Um carro autônomo possui a capacidade de tomar decisões em situações de emergência” e “Salvar cinco vidas é considerado moralmente preferível a salvar uma vida”, cada uma com 100% de confiança. As inferências subsequentes, como a avaliação das consequências e a escolha da opção que minimiza a perda de vidas, também são registradas com seus respectivos níveis de confiança, culminando na conclusão final baseada na lógica utilitarista.
O Analisador de Caminhos, o segundo módulo, estende o conceito de raciocínio para múltiplos percursos, implementando uma busca em árvore com avaliação heurística inspirada no paradigma Tree-of-Thought. O problema é decomposto em dois a quatro subproblemas, para os quais são geradas duas a três hipóteses alternativas, cada uma com um score de viabilidade entre 0 e 100. Caminhos com pontuação inferior a 40 são podados e documentados, permitindo a identificação de linhas de raciocínio que, embora não apresentadas ao usuário final, podem ser relevantes ou revelar falhas potenciais. O índice de confiança atribuído a cada trajetória é uma autoavaliação declarada pelo próprio LLM, não uma métrica externa objetiva de correção.
A visualização interativa da árvore de decisão, implementada com React Flow, permite ao usuário navegar pelos nós explorados, identificar os caminhos podados e o caminho selecionado. Em um cenário de demissão de funcionários, por exemplo, o sistema pode apresentar a hipótese de “Comunicar abertamente as razões das demissões” com 85% de autoavaliação, e “Oferecer pacotes de demissão voluntária” com 75%. Uma hipótese como “Manter os funcionários no escuro até a demissão” pode ser podada com 30% de autoavaliação, indicando baixa viabilidade. As métricas capturadas por este módulo incluem o total de nós explorados, o total de caminhos podados e o score do caminho selecionado, fornecendo uma visão abrangente do espaço de solução explorado pelo LLM.
O Validador Lógico, o terceiro módulo, transforma o raciocínio extraído em um grafo dirigido de proposições, conforme o paradigma Graph-of-Thought, utilizando a biblioteca NetworkX para análise estrutural. Cada nó do grafo representa uma proposição (premissa, inferência, conclusão ou premissa oculta), e cada aresta indica uma relação lógica (suporte, contradição, implicação ou dependência). O módulo é capaz de detectar quatro tipos de falhas lógicas: contradições entre proposições conflitantes, saltos lógicos identificados como nós desconectados, premissas ocultas não declaradas e circularidade, detectada por algoritmos de busca de ciclos. Um score de validade, de 0 a 100, é calculado com base na proporção de problemas em relação ao total de proposições, sintetizando a qualidade lógica do raciocínio.
A detecção de falhas lógicas é ilustrada por exemplos como contradições, onde uma premissa que afirma que desviar para salvar cinco pedestres resulta na morte do passageiro entra em tensão com outra que sugere que salvar cinco vidas é moralmente preferível a salvar uma. Lacunas lógicas são identificadas pela falta de uma explicação clara sobre como a decisão se alinha à lógica utilitarista. Premissas ocultas, como a suposição de que a vida do passageiro é menos valiosa, são apontadas. A circularidade é detectada quando inferências se justificam mutuamente, criando um ciclo sem uma base externa, como um ciclo entre inferências 5, 6 e 8. Essas informações são cruciais para a auditoria, pois revelam fragilidades no processo de tomada de decisão do LLM.
O Verificador de Consistência, o quarto módulo, aplica uma metodologia de teste por repetição inspirada no conceito de Self-Consistency (Wang et al., 2023). A consulta original é reformulada semanticamente em cinco variações, e as respostas geradas são comparadas par a par para identificar a permanência das informações centrais, bem como omissões, contradições ou alterações relevantes. A taxa de convergência, expressa em uma escala de 0 a 1, corresponde à proporção de pares concordantes. O score de confiança final combina essa taxa-base com penalidades por divergências e bonificações por alta consistência, oferecendo uma medida da estabilidade semântica das informações.
A interface de verificação de consistência apresenta as respostas individuais de cada execução e descreve os pontos divergentes, indicando as respostas envolvidas e o nível de severidade atribuído a cada diferença. Em um exemplo, para a consulta “Se uma pessoa me agredir, até quanto tempo depois eu posso denunciar essa pessoa?”, o sistema pode apresentar uma taxa de convergência de 80% e um score de confiança de 72% após três execuções. Pontos divergentes podem incluir a menção de que o prazo pode chegar a 20 anos em uma resposta, enquanto outras não especificam, ou a diferença sobre o marco inicial da contagem do prazo. É importante notar que uma alta consistência não garante a correção, pois o modelo pode reproduzir o mesmo erro sistematicamente.
O Gerador de Trilha de Auditoria, o quinto e último módulo, consolida os dados de todos os módulos anteriores em relatórios multi-formato, incluindo PDF (via ReportLab), Excel (via openpyxl) e JSON nativo. Esses relatórios são direcionados a três perfis de stakeholders: compliance, que recebe hashes de integridade e trilhas cronológicas; jurídico, que foca na cadeia de evidências e pontos de divergência; e técnico, que acessa dados brutos, estruturas de grafos e métricas detalhadas. Essa segregação de informações atende às necessidades de diferentes contextos de uso, desde documentação formal até análise de dados e integração com outros sistemas, conforme ilustrado por um resumo executivo que apresenta métricas como Total de Decisões (13), Análises de Caminho (10), Validações Lógicas (10), Verificações de Consistência (9), Problemas Encontrados (23), Score Médio de Validade (53.0%) e Score Médio de Confiança (72.74%).
Uma aplicação demo, construída com Streamlit, demonstra a integração do ReasonGuard por meio de um chatbot interativo. O usuário pode ativar ou desativar cada módulo de análise individualmente e visualizar os resultados da auditoria em tempo real, tornando a plataforma ideal para demonstrações e provas de conceito. O sistema de autenticação, implementado com Clerk, suporta login por email com verificação obrigatória e OAuth via Google, garantindo persistência de sessão e proteção de rotas. Além disso, um sistema de API Tokens permite integrações programáticas por meio de tokens no formato `rg_`, armazenados com hash SHA-256 e com data de expiração configurável, com toda a infraestrutura orquestrada via Docker Compose, incluindo quatro serviços e health checks configurados.
A discussão dos resultados reitera que é viável operacionalizar técnicas de raciocínio estruturado, originalmente concebidas para melhorar o desempenho de LLMs, como ferramentas de rastreabilidade em ambientes de governança de IA. A abordagem de middleware transparente, que permite a integração de qualquer aplicação existente ao ReasonGuard sem modificações, apenas redirecionando o endpoint do LLM para o proxy, é um diferencial significativo. Isso elimina o custo de reengenharia que tipicamente inviabiliza a adoção de ferramentas de observabilidade em ambientes corporativos, sugerindo um caminho de adoção com baixo atrito para sistemas já em operação.
Retomando o problema de pesquisa sobre a ausência de plataformas integradas que operacionalizam CoT, ToT e GoT como mecanismos de auditoria em produção, os resultados indicam uma resposta parcialmente afirmativa. Do ponto de vista da viabilidade técnica, o problema foi resolvido, com todos os cinco módulos implementados, integrados e validados funcionalmente. Isso demonstra que os paradigmas podem ser reaproveitados como instrumentos de observabilidade em uma única plataforma coesa, e não apenas como técnicas isoladas de melhoria de desempenho. No entanto, a validação em escala, que envolveria a sustentação da rastreabilidade e detecção de falhas lógicas sob volume de dados real e diversidade de domínios, permanece apenas parcialmente respondida neste estágio, uma vez que a validação realizada cobriu a corretude funcional de cada módulo, mas não uma avaliação quantitativa de precisão e recall da detecção de falhas lógicas contra um conjunto de referência rotulado, nem um estudo de caso em ambiente de produção real. Essa distinção entre “viabilidade demonstrada” e “eficácia validada em escala” delimita com precisão a contribuição efetiva deste trabalho em seu estágio atual.
A segregação de relatórios por perfil de stakeholder (compliance, jurídico e técnico) endereça diretamente uma limitação identificada nas ferramentas de explicabilidade existentes (Zhao et al., 2024), que tipicamente produzem saídas técnicas de difícil consumo por equipes de compliance e jurídico. Ao gerar visões específicas para cada público, o ReasonGuard reduz a distância entre o dado técnico bruto e a decisão de governança que dele depende. Contudo, é preciso reconhecer os limites dessa evidência: trata-se, até o momento, de uma demonstração de viabilidade em ambiente controlado, e a validação da melhoria real exigiria, como trabalho futuro, um estudo comparativo com equipes de auditoria operando com e sem a plataforma, medindo, por exemplo, tempo de detecção de falhas ou taxa de conformidade regulatória.
Adotando uma leitura crítica dos próprios resultados, cabe destacar três limitações que emergem diretamente da análise. Em primeiro lugar, o índice de confiança utilizado tanto no Rastreador quanto no Analisador de Caminhos é uma autoavaliação declarada pelo próprio LLM, e não uma métrica calculada de forma independente. Como os LLMs são conhecidamente propensos a excesso de confiança mesmo em respostas incorretas, esse índice deve ser interpretado como um sinal adicional de auditoria, e não como garantia objetiva de correção, uma ambiguidade que a plataforma, em sua versão atual, não distingue explicitamente na interface.
Em segundo lugar, o Verificador de Consistência assume que a convergência entre múltiplas execuções é um proxy válido para correção do raciocínio. Entretanto, um LLM pode convergir de forma consistente para uma mesma resposta incorreta caso o erro decorra de uma limitação sistemática do modelo, como uma lacuna de conhecimento ou um viés de treinamento, em vez de uma variação aleatória de amostragem. Nesse cenário, a alta consistência mascararia, em vez de revelar, a falha. Por fim, os resultados apresentados refletem um volume de dados de teste ainda reduzido, o que limita a capacidade de generalizar as métricas de desempenho e usabilidade do dashboard para cenários de produção com maior throughput.
Em relação à literatura, enquanto trabalhos anteriores focam predominantemente na melhoria do raciocínio (Wei et al., 2022; Yao et al., 2023; Besta et al., 2024; Wang et al., 2023) ou na explicabilidade post-hoc de forma isolada (Mokander et al., 2023; Zhao et al., 2024; Bilal et al., 2025; Mokander et al., 2025), o ReasonGuard oferece uma contribuição distinta ao unificar esses paradigmas em uma plataforma de auditoria orientada à conformidade regulatória. A abordagem se alinha diretamente com os requisitos do Regulamento Europeu de Inteligência Artificial (União Europeia, 2024) para sistemas de IA de alto risco, provendo documentação, rastreabilidade e explicabilidade de forma sistemática, sempre no sentido de rastreabilidade do processo declarado pelo modelo, e não de acesso direto ao seu mecanismo interno de decisão.
4. Conclusão
O presente estudo buscou desenvolver e validar o ReasonGuard, uma plataforma de auditoria de raciocínio para modelos de linguagem, instrumentalizando a decomposição estruturada de pensamento para promover transparência e rastreabilidade em decisões baseadas em Inteligência Artificial. Verificou-se a viabilidade técnica da abordagem proposta, com a implementação e integração de cinco módulos operacionais. O Rastreador de Raciocínio capturou trilhas de pensamento com garantia de integridade criptográfica, enquanto o Analisador de Caminhos explorou múltiplos percursos de solução, identificando e documentando caminhos podados. O Validador Lógico transformou o raciocínio em grafos de proposições, detectando falhas estruturais como contradições, saltos lógicos e circularidade. O Verificador de Consistência avaliou a estabilidade semântica das respostas por meio de múltiplas execuções. Por fim, o Gerador de Trilha de Auditoria consolidou esses dados em relatórios adaptados a perfis de stakeholders, contribuindo para a governança e conformidade regulatória. A plataforma oferece uma contribuição significativa ao preencher uma lacuna na literatura, unificando paradigmas de raciocínio estruturado como ferramentas de observabilidade e auditoria em uma solução coesa, facilitando a adoção em ambientes de produção por meio de sua arquitetura de middleware transparente.
Contudo, identificou-se limitações importantes que delimitam a contribuição atual do ReasonGuard. O índice de confiança declarado pelo próprio LLM, tanto no rastreador quanto no analisador de caminhos, não constitui uma métrica objetiva de correção, podendo mascarar vieses de superconfiança do modelo. Adicionalmente, a alta consistência das respostas, verificada pelo módulo correspondente, não garante a exatidão, pois o modelo pode reproduzir erros sistemáticos. Os resultados apresentados refletem um volume de dados de teste ainda reduzido, o que restringe a generalização das métricas de desempenho para cenários de produção em larga escala. Para estudos futuros, sugere-se a construção de um conjunto de referência rotulado para validação quantitativa da detecção de falhas lógicas, a realização de estudos comparativos com equipes de auditoria em ambientes reais para mensurar a eficácia da plataforma, e o desenvolvimento de módulos para detecção de vieses cognitivos, aprimorando a robustez e a aplicabilidade do ReasonGuard em contextos regulatórios e de alto risco.
Referências Bibliográficas
BESTA, M. et al. Graph of Thoughts: Solving Elaborate Problems with Large Language Models. In: Proceedings of the AAAI Conference on Artificial Intelligence, v. 38, 2024. Disponível em: https://arxiv.org/abs/2308.09687.
BILAL, A.; EBERT, D.; LIN, B. LLMs for Explainable Al: A Comprehensive Survey. arXiv preprint, arXiv:2504.00125, 2025. Disponível em: https://arxiv.org/abs/2504.00125.
MOKANDER, J. et al. Audit Trails for Accountability in Large Language Models. arXiv preprint, arXiv:2601.20727, 2025. Disponível em: https://arxiv.org/abs/2601.20727.
MÖKANDER, J. et al. Auditing Large Language Models: A Three-Layered Approach. Al and Ethics, 2023. Disponível em: https://arxiv.org/abs/2302.08500.
UNIÃO EUROPEIA. Regulamento (UE) 2024/1689 do Parlamento Europeu e do Conselho de 13 de junho de 2024 (EU Artificial Intelligence Act). Jornal Oficial da União Europeia, 2024.
WANG, X. et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. In: Proceedings of the International Conference on Learning Representations (ICLR), 2023. Disponível em: https://arxiv.org/abs/2203.11171.
WEI, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. In: Advances in Neural Information Processing Systems (NeurIPS), v. 35, 2022. Disponível em: https://arxiv.org/abs/2201.11903.
YAO, S. et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. In: Advances in Neural Information Processing Systems (NeurIPS), v. 36, 2023. Disponível em: https://arxiv.org/abs/2305.10601.
ZHAO, H. et al. From Understanding to Utilization: A Survey on Explainability for Large Language Models. arXiv preprint, arXiv:2401.12874, 2024. Disponível em: https://arxiv.org/abs/2401.12874.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

