Ingeniería De Software
09 de octubre de 2026
ReasonGuard: Una Plataforma de Auditoría de Razonamiento para Modelos de Lenguaje Basada en Descomposición Estructurada de Pensamiento
Reasonguard: una Plataforma de Auditoría de Razonamiento para Modelos de Lenguaje Basada en Descomposición Estructurada del Pensamiento
Lucas Nastari Ziza; Lucas Cesar Gomes Alvarinho Squillante
DOI: 10.22167/2675-6528-202603200
Artículo derivado del Trabajo de Conclusión de Curso (TCC), con contenido basado en el trabajo original del alumno y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege para síntesis y organización textual.
Resumen
Se presentó ReasonGuard, una plataforma de auditoría de razonamiento de Inteligencia Artificial, desarrollada como middleware de observabilidad entre aplicaciones cliente y modelos de lenguaje de gran escala (LLMs). El trabajo tuvo como objetivo ofrecer transparencia y trazabilidad para procesos de toma de decisiones basados en IA, abordando la brecha en la operacionalización de técnicas de razonamiento estructurado para fines de auditoría. El sistema interceptó, analizó y documentó interacciones con LLMs a través de cinco módulos fundamentados en los paradigmas Chain-of-Thought (CoT), Tree-of-Thought (ToT) y Graph-of-Thought (GoT). Estos módulos capturaron rastros de razonamiento, detectaron fallas lógicas estructurales, evaluaron la consistencia de las respuestas y generaron informes de auditoría dirigidos a diferentes perfiles de stakeholders. La plataforma se implementó con FastAPI (Python) en el backend, React con TypeScript en el frontend y PostgreSQL como base de datos relacional, siguiendo una arquitectura modularizada con aislamiento multitenancy por usuario. Los resultados demostraron la viabilidad técnica del enfoque propuesto, con los cinco módulos operativos e integrados. Se concluyó que ReasonGuard contribuye a la gobernanza de IA al instrumentalizar paradigmas de razonamiento estructurado como herramientas de observabilidad y auditoría, llenando una brecha en la literatura.
Palabras clave: Auditoría de IA; Cadena de Pensamiento; Gobernanza de IA; Modelos de Lenguaje a Gran Escala; Transparencia Algorítmica.
1. Introducción
Los Modelos de Lenguaje de Gran Escala (LLMs) son sistemas de aprendizaje profundo, típicamente basados en la arquitectura Transformer, entrenados sobre voluminosas estructuras de datos para predecir la continuación más probable de una secuencia de texto. A partir de este mecanismo de predicción estadística de tokens, emergen capacidades complejas de generación de lenguaje, respuesta a preguntas, resumen y, más recientemente, razonamiento en múltiples etapas. Es precisamente esta capacidad emergente de razonamiento y su aplicación a decisiones de alto impacto lo que motiva el presente trabajo.
La creciente adopción de LLMs en contextos de toma de decisiones, incluyendo áreas como salud, derecho, finanzas y gobernanza corporativa, ha evidenciado una gran brecha: la visualización de los procesos de razonamiento que fundamentan las respuestas generadas por estos sistemas. Un ejemplo ilustrativo de esta problemática es el error de “razonamiento plausible, pero falaz”. Al ser interrogado sobre la viabilidad de un contrato con una cláusula de rescisión automática en caso de retraso de pago, un LLM puede concluir correctamente que el contrato es rescindible, pero fundamentar esta conclusión en una premisa no declarada e incorrecta, como asumir erróneamente que cualquier retraso activa la cláusula. La respuesta final suena convincente y frecuentemente es correcta por coincidencia, pero el razonamiento subyacente contiene una falla estructural que, en un escenario real, podría llevar a una decisión equivocada sin señal explícita de error para el usuario. Este tipo de falla indetectable a partir de la simple lectura de la respuesta final es el problema central que ReasonGuard busca abordar.
Aunque los LLM demuestran capacidades expresivas en tareas de razonamiento complejo, la ausencia de mecanismos formales de auditoría y trazabilidad compromete su aplicabilidad en escenarios que exigen rendición de cuentas y cumplimiento normativo. Desde el punto de vista regulatorio, el panorama global se ha movido hacia exigencias más rigurosas de transparencia. El Reglamento Europeo de Inteligencia Artificial (Unión Europea, 2024), por ejemplo, establece obligaciones específicas de transparencia para sistemas de IA de alto riesgo, incluyendo requisitos de documentación, trazabilidad y explicabilidad. En el contexto académico, investigaciones recientes sobre infraestructura de rendición de cuentas para IA destacan que la responsabilidad sigue siendo frágil porque la transparencia del proceso rara vez se registra de forma duradera y auditable (Mokander et al., 2025). Es importante delimitar que, al tratarse de redes neuronales de miles de millones de parámetros cuyo procesamiento interno no es directamente interpretable, los LLM permanecen, en esencia, “cajas negras”. Lo que ReasonGuard y las técnicas de descomposición estructurada de razonamiento ofrecen no es la apertura de esa caja negra, sino la inducción del modelo a expresar, en lenguaje natural, una justificación paso a paso que pueda ser registrada, versionada y auditada. Se trata, por lo tanto, de trazabilidad del proceso de generación de las respuestas, un registro verificable de lo que el modelo declaró como su razonamiento y no de transparencia plena o reproducibilidad del mecanismo interno de decisión del modelo, distinción que orienta todo el diseño de la plataforma.
El concepto de razonamiento estructurado en modelos de lenguaje ganó prominencia con el trabajo de Wei et al. (2022), quienes demostraron la técnica de Chain-of-Thought (CoT). Esta técnica, al explicitar pasos intermedios de razonamiento antes de la respuesta final, mejora significativamente el rendimiento en tareas aritméticas, de sentido común y de razonamiento simbólico. A partir de esta base, Yao et al. (2023) propusieron el framework Tree of Thoughts (ToT), que generaliza el CoT al permitir la exploración deliberada de múltiples caminos de razonamiento, tratando cada etapa intermedia como un nodo de un árbol de búsqueda. Besta et al. (2024) avanzaron aún más al introducir el Graph of Thoughts (GoT), que modela la información generada por el LLM como un grafo arbitrario de proposiciones y sus dependencias. Paralelamente, Wang et al. (2023) propusieron el enfoque de Self-Consistency, una estrategia de decodificación que explora múltiples caminos de razonamiento y selecciona la respuesta más consistente entre ellos, elevando el rendimiento del CoT en benchmarks.
A pesar de estos avances, se observa una brecha específica en la literatura: los trabajos citados anteriormente se centran en dos frentes distintos y, hasta el momento, no integrados. El primer frente trata estas técnicas (CoT, ToT, GoT y Self-Consistency) como métodos para mejorar el rendimiento de los LLM en tareas de razonamiento, sin preocupación por el registro persistente, verificable y auditable del proceso generado. El segundo frente, los trabajos de auditoría y explicabilidad (Mokander et al., 2023; Zhao et al., 2024; Bilal et al., 2025; Mokander et al., 2025) discuten qué debería auditarse y proponen capas conceptuales de verificación, pero no presentan una implementación de referencia que capture, estructure y persista, de forma sistemática y lista para producción, el razonamiento descompuesto según estos paradigmas. Por lo tanto, no existe una plataforma que opere en la intersección de estos dos frentes: que utilice CoT, ToT y GoT no para mejorar la respuesta del modelo, sino como instrumentos de observabilidad, capturando el razonamiento descompuesto, persistiendo con garantías de integridad y poniéndolo a disposición en formatos utilizables por equipos de cumplimiento, legales y de ingeniería. Es esta brecha de operacionalización, la ausencia de un puente entre la técnica de descomposición del razonamiento y la práctica de auditoría en entornos de producción, lo que el presente trabajo busca llenar.
En este contexto, el presente trabajo propone ReasonGuard, una plataforma de auditoría de razonamiento que instrumentaliza los paradigmas de razonamiento como mecanismos de observabilidad, operando entre aplicaciones cliente y proveedores de LLM. El objetivo general de este estudio es desarrollar y validar ReasonGuard, una plataforma de auditoría de razonamiento para modelos de lenguaje basada en la descomposición estructurada del pensamiento, con los siguientes objetivos específicos: (i) capturar rastros completos de razonamiento con garantía de integridad criptográfica; (ii) detectar fallos lógicos estructurales como contradicciones, circularidad, saltos lógicos y premisas ocultas; (iii) evaluar la consistencia de las respuestas a través de múltiples ejecuciones con variaciones semánticas; y (iv) generar informes de auditoría dirigidos a diferentes perfiles de stakeholders, contribuyendo a la gobernanza y el cumplimiento normativo de los sistemas basados en IA.
2. Material y Métodos
La investigación realizada tiene naturaleza aplicada, orientada a la generación de conocimientos prácticos para solucionar la falta de transparencia y auditabilidad en los procesos de razonamiento de Modelos de Lenguaje de Gran Escala (LLMs). El estudio se caracterizó como exploratorio-experimental, combinando la investigación de técnicas de descomposición de razonamiento con la implementación y validación de módulos en un entorno controlado. El enfoque metodológico adoptado fue cuali-cuantitativo, abarcando tanto el análisis estructural del razonamiento extraído como el cálculo de métricas numéricas, como puntuaciones de validez y tasas de consistencia.
El desarrollo de ReasonGuard siguió una metodología iterativa e incremental, basada en prototipado evolutivo, estructurada en seis fases secuenciales. Inicialmente, se definieron los requisitos y la arquitectura del sistema, identificándose los cinco módulos principales y adoptándose el patrón arquitectónico de API Proxy. A continuación, se implementó el backend con los módulos core, seguido por la implementación del frontend con un dashboard interactivo. Las fases subsiguientes incluyeron la integración y autenticación con aislamiento multitenancy, la construcción de una aplicación demo en Streamlit y, finalmente, la optimización y el refinamiento de rendimiento y usabilidad.
La arquitectura del sistema ReasonGuard fue concebida como un proxy inverso con capacidades de observabilidad, actuando como un middleware entre aplicaciones cliente y proveedores de LLM. Este arreglo permitió la interceptación transparente de solicitudes sin la necesidad de modificar la aplicación cliente, posibilitando el análisis en tiempo real y el almacenamiento independiente de los datos de auditoría. Para el cliente, la comunicación permaneció inalterada, requiriendo solo el direccionamiento de las solicitudes al endpoint del proxy, que preservó la estructura esperada de entrada y salida.
Durante el flujo de comunicación, el API Proxy registró la información relevante de la solicitud, aplicó los mecanismos de rastreo, validación y análisis definidos por la plataforma, y encaminó la llamada al proveedor del modelo. Después del procesamiento por parte del proveedor, la respuesta fue devuelta al proxy, que la analizó, asoció con los datos de la solicitud original, calculó métricas y generó la pista de auditoría antes de pasarla al cliente. De esta manera, el proveedor de LLM permaneció responsable de la inferencia del modelo, mientras que el middleware centralizó las funciones de observabilidad, control y auditoría.
La infraestructura de ReasonGuard estuvo compuesta por cuatro servicios orquestados vía Docker Compose. Se incluyó una base de datos PostgreSQL para persistencia relacional, un backend implementado con FastAPI en Python que contiene los cinco módulos core y nueve rutas de API REST, un frontend desarrollado con React y TypeScript para el dashboard interactivo, y una aplicación demo en Streamlit como ejemplo de integración. El aislamiento multitenancy se garantizó mediante filtrado de usuario en todas las consultas a la base de datos, asegurando que cada usuario accediera únicamente a sus propios registros.
Los módulos principales se desarrollaron como unidades autónomas, cada una con una responsabilidad única, e se integraron progresivamente al sistema completo. El Rastreador de Razonamiento, el primer módulo, se basó en el paradigma Chain-of-Thought (CoT). Operó mediante la inyección de prompts estructurados en las solicitudes al LLM, induciendo al modelo a descomponer su razonamiento en premisas, inferencias y conclusiones. El análisis se realizó a través de expresiones regulares, y cada registro recibió un hash SHA-256 para garantizar la integridad de los datos.
El Analizador de Caminos, el segundo módulo, extendió el concepto a múltiples caminos, implementando una búsqueda en árbol con evaluación heurística inspirada en el paradigma Tree-of-Thought (ToT). El problema se descompuso en dos a cuatro subproblemas, para los cuales se generaron dos a tres hipótesis con scores de viabilidad, variando de cero a cien. Los caminos con puntuación inferior a cuarenta fueron podados y documentados. Las métricas capturadas incluyeron el total de nodos explorados, el total de caminos podados y el score del camino seleccionado.
El Validador Lógico, el tercer módulo, transformó el razonamiento extraído en un grafo dirigido de proposiciones, utilizando la biblioteca NetworkX, conforme al paradigma Graph-of-Thought (GoT). Cada nodo representó una proposición (premisa, inferencia, conclusión o premisa oculta) y cada arista, una relación lógica. El módulo detectó cuatro tipos de fallas lógicas: contradicciones, saltos lógicos identificados como nodos desconectados, premisas ocultas no declaradas y circularidad, esta última detectada por algoritmos de búsqueda de ciclos. Se calculó una puntuación de validez, de cero a cien, con base en la proporción de problemas en relación al total de proposiciones.
El Verificador de Consistencia, el cuarto módulo, aplicó una metodología de prueba por repetición inspirada en el concepto de Self-Consistency (Wang et al., 2023). La consulta original se reformuló semánticamente en cinco variaciones, preservando la intención original. Las respuestas generadas se compararon par a par para identificar la permanencia de la información central y detectar divergencias. Se calculó una tasa de convergencia, expresada en una escala de cero a uno, y una puntuación de confianza final que combinó esta tasa base con penalizaciones por divergencias y bonificaciones por alta consistencia.
El Generador de Rastro de Auditoría, el quinto módulo, consolidó los datos de todos los módulos anteriores en informes multiformato. Estos informes se generaron en PDF vía ReportLab, Excel vía openpyxl y JSON nativo, y se dirigieron a tres perfiles de stakeholders: cumplimiento (con hashes de integridad y rastros cronológicos), jurídico (con cadena de evidencia y puntos de divergencia) y técnico (con datos completos, estructuras brutas y métricas detalladas).
La elección de la pila tecnológica se orientó por criterios de adecuación al dominio de IA, madurez del ecosistema y productividad en el desarrollo. El backend se implementó en Python 3.11 con FastAPI 0.109.0, aprovechando el soporte nativo para operaciones asíncronas, validación automática vía Pydantic y documentación OpenAPI. La biblioteca NetworkX 3.2.1 proporcionó los algoritmos de análisis de grafos necesarios para el Validador Lógico.
El frontend se construyó con React 18.2.0 y TypeScript 5.3.3, utilizando React Flow 11.10.2 para la visualización interactiva de grafos y árboles, Recharts 2.10.4 para gráficos de KPIs y Material-UI 5.15.6 como framework de interfaz. La gestión de estado del servidor empleó TanStack Query para caché y sincronización. La autenticación fue gestionada por Clerk 4.30.0, con soporte para OAuth (Google) y email/contraseña, mientras que PostgreSQL 14 proporcionó la persistencia relacional con soporte para campos JSONB para el almacenamiento de estructuras flexibles.
La estrategia de validación siguió un enfoque de tres niveles. En la validación funcional, cada módulo se validó individualmente en cuanto a la corrección del análisis sintáctico, la detección de patrones y el cálculo de métricas. El análisis sintáctico correspondió al proceso de interpretar y estructurar los datos recibidos, extrayendo correctamente campos, pasos de razonamiento y demás información relevante de las respuestas del modelo para los análisis subsecuentes.
La validación de la integración contempló el flujo completo de funcionamiento del proxy, desde la recepción de la solicitud enviada por la aplicación cliente hasta el reenvío al proveedor de LLM. Se incluyó el procesamiento por los módulos de auditoría, la persistencia de los resultados y el retorno de la respuesta al usuario. También se verificaron los mecanismos de autenticación de extremo a extremo, incluyendo la identificación del usuario, la autorización de acceso a los recursos y el aislamiento de los datos durante toda la ejecución.
La validación de la interfaz se centró en la presentación correcta de la información producida por el sistema. Se evaluó la renderización de grafos y árboles de razonamiento con datos reales, la organización visual de los nodos y conexiones, la visualización de los resultados de los análisis y la actualización de los indicadores de desempeño en el dashboard. Se buscó asegurar que los cambios en los datos procesados se reflejaran correctamente en los KPIs y en los demás componentes visuales de la plataforma.
3. Resultados y Discusión
Los resultados obtenidos en el desarrollo de ReasonGuard demuestran la viabilidad técnica del enfoque propuesto para operacionalizar técnicas de razonamiento estructurado como herramientas de trazabilidad y auditoría en entornos de gobernanza de Inteligencia Artificial. La plataforma se implementó con completitud en relación con los requisitos especificados, con los cinco módulos principales completamente funcionales e integrados. Es fundamental situar estos hallazgos como evidencia de la funcionalidad de un prototipo, y no como una validación estadística a escala de producción, una distinción crucial para la interpretación de su contribución actual.
La arquitectura del sistema fue concebida para garantizar la integridad y la trazabilidad de los datos. El modelo de datos se centraliza en la entidad de usuario, vinculando a ella todos los registros generados por los módulos de rastreo de razonamiento, análisis de caminos, validación lógica y verificación de consistencia. Las cadenas de razonamiento se almacenan como secuencias ordenadas de pasos, mientras que los análisis de caminos se representan por estructuras jerárquicas con relaciones entre nodos padre y nodos hijo. Las validaciones lógicas, a su vez, se modelan como grafos de proposiciones y conexiones dirigidas, con todas estas asociaciones implementadas por claves foráneas para asegurar la integridad referencial en relación con el usuario.
En el backend, cada módulo opera con sus propias rutas y servicios, utilizando SQLAlchemy para procesar solicitudes y persistir resultados. Esta organización modular permite que los análisis se ejecuten de forma independiente, pero se integren posteriormente en la generación de informes de auditoría. El frontend, por su parte, se estructuró en diez páginas dedicadas a funcionalidades específicas, incluyendo un dashboard interactivo, un chat integrado y visualizaciones para el seguimiento del razonamiento, análisis de caminos, validación lógica, verificación de consistencia, informes de auditoría y configuraciones del sistema.
El Rastreador de Razonamiento, el primer módulo, implementa la interceptación de solicitudes y la inyección de instrucciones de cadena de pensamiento (Chain-of-Thought) en un objeto estructurado. Para cada solicitud procesada, el módulo registra las premisas declaradas, las inferencias realizadas, la conclusión final y un nivel de confianza, que varía de 0 a 100, para cada paso del razonamiento. El análisis de esta información se realiza mediante expresiones regulares, y cada registro recibe un hash SHA-256, que actúa como una “huella digital” para garantizar la integridad y detectar cualquier alteración indebida en el contenido. Esta característica es esencial para escenarios de cumplimiento y auditoría regulatoria, donde la inmutabilidad de la prueba de razonamiento es irrefutable.
La interfaz de visualización del rastreador de razonamiento muestra en detalle el prompt original, el hash de integridad y los pasos de razonamiento. Por ejemplo, en una consulta sobre la decisión de un coche autónomo de desviarse para salvar a cinco peatones en detrimento del pasajero, el sistema descompone el razonamiento en premisas como “Un coche autónomo tiene la capacidad de tomar decisiones en situaciones de emergencia” y “Salvar cinco vidas se considera moralmente preferible a salvar una vida”, cada una con un 100% de confianza. Las inferencias posteriores, como la evaluación de las consecuencias y la elección de la opción que minimiza la pérdida de vidas, también se registran con sus respectivos niveles de confianza, culminando en la conclusión final basada en la lógica utilitarista.
El Analizador de Caminos, el segundo módulo, extiende el concepto de razonamiento a múltiples trayectorias, implementando una búsqueda en árbol con evaluación heurística inspirada en el paradigma Tree-of-Thought. El problema se descompone en dos a cuatro subproblemas, para los cuales se generan dos a tres hipótesis alternativas, cada una con una puntuación de viabilidad entre 0 y 100. Los caminos con una puntuación inferior a 40 se podan y documentan, permitiendo la identificación de líneas de razonamiento que, aunque no se presenten al usuario final, pueden ser relevantes o revelar fallos potenciales. El índice de confianza asignado a cada trayectoria es una autoevaluación declarada por el propio LLM, no una métrica externa objetiva de corrección.
La visualización interactiva del árbol de decisión, implementada con React Flow, permite al usuario navegar por los nodos explorados, identificar los caminos podados y el camino seleccionado. En un escenario de despido de empleados, por ejemplo, el sistema puede presentar la hipótesis de “Comunicar abiertamente las razones de los despidos” con un 85% de autoevaluación, y “Ofrecer paquetes de despido voluntario” con un 75%. Una hipótesis como “Mantener a los empleados en la oscuridad hasta el despido” puede ser podada con un 30% de autoevaluación, indicando baja viabilidad. Las métricas capturadas por este módulo incluyen el total de nodos explorados, el total de caminos podados y la puntuación del camino seleccionado, proporcionando una visión integral del espacio de solución explorado por el LLM.
El Validador Lógico, el tercer módulo, transforma el razonamiento extraído en un grafo dirigido de proposiciones, siguiendo el paradigma Graph-of-Thought, utilizando la biblioteca NetworkX para el análisis estructural. Cada nodo del grafo representa una proposición (premisa, inferencia, conclusión o premisa oculta), y cada arista indica una relación lógica (soporte, contradicción, implicación o dependencia). El módulo es capaz de detectar cuatro tipos de fallos lógicos: contradicciones entre proposiciones conflictivas, saltos lógicos identificados como nodos desconectados, premisas ocultas no declaradas y circularidad, detectada por algoritmos de búsqueda de ciclos. Se calcula una puntuación de validez, de 0 a 100, basándose en la proporción de problemas en relación con el total de proposiciones, sintetizando la calidad lógica del razonamiento.
La detección de fallas lógicas se ilustra con ejemplos como las contradicciones, donde una premisa que afirma que desviarse para salvar a cinco peatones resulta en la muerte del pasajero entra en tensión con otra que sugiere que salvar cinco vidas es moralmente preferible a salvar una. Las lagunas lógicas se identifican por la falta de una explicación clara sobre cómo la decisión se alinea con la lógica utilitarista. Se señalan premisas ocultas, como la suposición de que la vida del pasajero es menos valiosa. La circularidad se detecta cuando las inferencias se justifican mutuamente, creando un ciclo sin una base externa, como un ciclo entre las inferencias 5, 6 y 8. Esta información es crucial para la auditoría, ya que revela fragilidades en el proceso de toma de decisiones del LLM.
El Verificador de Consistencia, el cuarto módulo, aplica una metodología de prueba por repetición inspirada en el concepto de Self-Consistency (Wang et al., 2023). La consulta original se reformula semánticamente en cinco variaciones, y las respuestas generadas se comparan par a par para identificar la permanencia de la información central, así como omisiones, contradicciones o alteraciones relevantes. La tasa de convergencia, expresada en una escala de 0 a 1, corresponde a la proporción de pares concordantes. El score de confianza final combina esta tasa base con penalizaciones por divergencias y bonificaciones por alta consistencia, ofreciendo una medida de la estabilidad semántica de la información.
La interfaz de verificación de consistencia presenta las respuestas individuales de cada ejecución y describe los puntos divergentes, indicando las respuestas involucradas y el nivel de severidad asignado a cada diferencia. En un ejemplo, para la consulta “Si una persona me agrede, ¿cuánto tiempo después puedo denunciar a esa persona?”, el sistema puede presentar una tasa de convergencia del 80% y un score de confianza del 72% después de tres ejecuciones. Los puntos divergentes pueden incluir la mención de que el plazo puede llegar a 20 años en una respuesta, mientras que otras no especifican, o la diferencia sobre el hito inicial del cómputo del plazo. Es importante notar que una alta consistencia no garantiza la corrección, ya que el modelo puede reproducir el mismo error sistemáticamente.
El Generador de Rastro de Auditoría, el quinto y último módulo, consolida los datos de todos los módulos anteriores en informes multiformato, incluyendo PDF (vía ReportLab), Excel (vía openpyxl) y JSON nativo. Estos informes están dirigidos a tres perfiles de stakeholders: compliance, que recibe hashes de integridad y rastros cronológicos; jurídico, que se enfoca en la cadena de evidencia y puntos de divergencia; y técnico, que accede a datos brutos, estructuras de grafos y métricas detalladas. Esta segregación de información atiende a las necesidades de diferentes contextos de uso, desde documentación formal hasta análisis de datos e integración con otros sistemas, como se ilustra en un resumen ejecutivo que presenta métricas como Total de Decisiones (13), Análisis de Caminos (10), Validaciones Lógicas (10), Verificaciones de Consistencia (9), Problemas Encontrados (23), Puntuación Media de Validez (53.0%) y Puntuación Media de Confianza (72.74%).
Una aplicación de demostración, construida con Streamlit, demuestra la integración de ReasonGuard a través de un chatbot interactivo. El usuario puede activar o desactivar cada módulo de análisis individualmente y visualizar los resultados de la auditoría en tiempo real, lo que hace que la plataforma sea ideal para demostraciones y pruebas de concepto. El sistema de autenticación, implementado con Clerk, admite el inicio de sesión por correo electrónico con verificación obligatoria y OAuth a través de Google, garantizando la persistencia de la sesión y la protección de rutas. Además, un sistema de tokens de API permite integraciones programáticas a través de tokens en el formato `rg_`, almacenados con hash SHA-256 y con fecha de caducidad configurable, con toda la infraestructura orquestada a través de Docker Compose, incluyendo cuatro servicios y comprobaciones de estado configuradas.
La discusión de los resultados reitera que es viable operacionalizar técnicas de razonamiento estructurado, originalmente concebidas para mejorar el rendimiento de los LLM, como herramientas de trazabilidad en entornos de gobernanza de IA. El enfoque de middleware transparente, que permite la integración de cualquier aplicación existente a ReasonGuard sin modificaciones, solo redirigiendo el endpoint del LLM al proxy, es un diferencial significativo. Esto elimina el costo de reingeniería que típicamente inviabiliza la adopción de herramientas de observabilidad en entornos corporativos, sugiriendo un camino de adopción con baja fricción para sistemas ya en operación.
Retomando el problema de investigación sobre la ausencia de plataformas integradas que operacionalizan CoT, ToT y GoT como mecanismos de auditoría en producción, los resultados indican una respuesta parcialmente afirmativa. Desde el punto de vista de la viabilidad técnica, el problema se resolvió, con los cinco módulos implementados, integrados y validados funcionalmente. Esto demuestra que los paradigmas pueden ser reutilizados como instrumentos de observabilidad en una única plataforma cohesionada, y no solo como técnicas aisladas de mejora del rendimiento. Sin embargo, la validación a escala, que implicaría el mantenimiento de la trazabilidad y la detección de fallos lógicos bajo un volumen de datos real y diversidad de dominios, permanece solo parcialmente respondida en esta etapa, dado que la validación realizada cubrió la corrección funcional de cada módulo, pero no una evaluación cuantitativa de precisión y recall de la detección de fallos lógicos contra un conjunto de referencia etiquetado, ni un estudio de caso en un entorno de producción real. Esta distinción entre “viabilidad demostrada” y “eficacia validada a escala” delimita con precisión la contribución efectiva de este trabajo en su etapa actual.
La segregación de informes por perfil de stakeholder (cumplimiento, jurídico y técnico) aborda directamente una limitación identificada en las herramientas de explicabilidad existentes (Zhao et al., 2024), que típicamente producen resultados técnicos de difícil consumo para los equipos de cumplimiento y jurídico. Al generar vistas específicas para cada público, ReasonGuard reduce la distancia entre el dato técnico bruto y la decisión de gobernanza de la que depende. Sin embargo, es preciso reconocer los límites de esta evidencia: se trata, hasta el momento, de una demostración de viabilidad en un entorno controlado, y la validación de la mejora real requeriría, como trabajo futuro, un estudio comparativo con equipos de auditoría que operen con y sin la plataforma, midiendo, por ejemplo, el tiempo de detección de fallos o la tasa de cumplimiento regulatorio.
Al adoptar una lectura crítica de los propios resultados, cabe destacar tres limitaciones que surgen directamente del análisis. En primer lugar, el índice de confianza utilizado tanto en el Rastreador como en el Analizador de Caminos es una autoevaluación declarada por el propio LLM, y no una métrica calculada de forma independiente. Dado que los LLM son conocidos por ser propensos al exceso de confianza incluso en respuestas incorrectas, este índice debe interpretarse como una señal adicional de auditoría, y no como una garantía objetiva de corrección, una ambigüedad que la plataforma, en su versión actual, no distingue explícitamente en la interfaz.
En segundo lugar, el Verificador de Consistencia asume que la convergencia entre múltiples ejecuciones es un proxy válido para la corrección del razonamiento. Sin embargo, un LLM puede converger consistentemente a la misma respuesta incorrecta si el error se deriva de una limitación sistemática del modelo, como una brecha de conocimiento o un sesgo de entrenamiento, en lugar de una variación aleatoria de muestreo. En este escenario, la alta consistencia enmascararía, en lugar de revelar, la falla. Finalmente, los resultados presentados reflejan un volumen de datos de prueba aún reducido, lo que limita la capacidad de generalizar las métricas de rendimiento y usabilidad del dashboard a escenarios de producción con mayor throughput.
En cuanto a la literatura, mientras que trabajos anteriores se centran predominantemente en la mejora del razonamiento (Wei et al., 2022; Yao et al., 2023; Besta et al., 2024; Wang et al., 2023) o en la explicabilidad post-hoc de forma aislada (Mokander et al., 2023; Zhao et al., 2024; Bilal et al., 2025; Mokander et al., 2025), ReasonGuard ofrece una contribución distinta al unificar estos paradigmas en una plataforma de auditoría orientada a la conformidad regulatoria. El enfoque se alinea directamente con los requisitos del Reglamento Europeo de Inteligencia Artificial (Unión Europea, 2024) para sistemas de IA de alto riesgo, proporcionando documentación, trazabilidad y explicabilidad de forma sistemática, siempre en el sentido de trazabilidad del proceso declarado por el modelo, y no de acceso directo a su mecanismo interno de decisión.
4. Conclusión
El presente estudio buscó desarrollar y validar ReasonGuard, una plataforma de auditoría de razonamiento para modelos de lenguaje, instrumentalizando la descomposición estructurada del pensamiento para promover la transparencia y la trazabilidad en decisiones basadas en Inteligencia Artificial. Se verificó la viabilidad técnica del enfoque propuesto, con la implementación e integración de cinco módulos operativos. El Rastreador de Razonamiento capturó huellas de pensamiento con garantía de integridad criptográfica, mientras que el Analizador de Caminos exploró múltiples trayectorias de solución, identificando y documentando caminos podados. El Validador Lógico transformó el razonamiento en grafos de proposiciones, detectando fallos estructurales como contradicciones, saltos lógicos y circularidad. El Verificador de Consistencia evaluó la estabilidad semántica de las respuestas a través de múltiples ejecuciones. Finalmente, el Generador de Huella de Auditoría consolidó estos datos en informes adaptados a perfiles de stakeholders, contribuyendo a la gobernanza y el cumplimiento normativo. La plataforma ofrece una contribución significativa al llenar un vacío en la literatura, unificando paradigmas de razonamiento estructurado como herramientas de observabilidad y auditoría en una solución cohesiva, facilitando la adopción en entornos de producción a través de su arquitectura de middleware transparente.
Sin embargo, se identificaron limitaciones importantes que delimitan la contribución actual de ReasonGuard. El índice de confianza declarado por el propio LLM, tanto en el rastreador como en el analizador de caminos, no constituye una métrica objetiva de corrección, pudiendo enmascarar sesgos de superconfianza del modelo. Adicionalmente, la alta consistencia de las respuestas, verificada por el módulo correspondiente, no garantiza la exactitud, ya que el modelo puede reproducir errores sistemáticos. Los resultados presentados reflejan un volumen de datos de prueba aún reducido, lo que restringe la generalización de las métricas de rendimiento a escenarios de producción a gran escala. Para estudios futuros, se sugiere la construcción de un conjunto de referencia etiquetado para validación cuantitativa de la detección de fallos lógicos, la realización de estudios comparativos con equipos de auditoría en entornos reales para medir la eficacia de la plataforma, y el desarrollo de módulos para la detección de sesgos cognitivos, mejorando la robustez y la aplicabilidad de ReasonGuard en contextos regulatorios y de alto riesgo.
Referencias Bibliográficas
BESTA, M. et al. Graph of Thoughts: Solving Elaborate Problems with Large Language Models. In: Proceedings of the AAAI Conference on Artificial Intelligence, v. 38, 2024. Disponível em: https://arxiv.org/abs/2308.09687.
BILAL, A.; EBERT, D.; LIN, B. LLMs for Explainable Al: A Comprehensive Survey. arXiv preprint, arXiv:2504.00125, 2025. Disponível em: https://arxiv.org/abs/2504.00125.
MOKANDER, J. et al. Audit Trails for Accountability in Large Language Models. arXiv preprint, arXiv:2601.20727, 2025. Disponível em: https://arxiv.org/abs/2601.20727.
MÖKANDER, J. et al. Auditing Large Language Models: A Three-Layered Approach. Al and Ethics, 2023. Disponível em: https://arxiv.org/abs/2302.08500.
UNIÃO EUROPEIA. Regulamento (UE) 2024/1689 do Parlamento Europeu e do Conselho de 13 de junho de 2024 (EU Artificial Intelligence Act). Jornal Oficial da União Europeia, 2024.
WANG, X. et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. In: Proceedings of the International Conference on Learning Representations (ICLR), 2023. Disponível em: https://arxiv.org/abs/2203.11171.
WEI, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. In: Advances in Neural Information Processing Systems (NeurIPS), v. 35, 2022. Disponível em: https://arxiv.org/abs/2201.11903.
YAO, S. et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. In: Advances in Neural Information Processing Systems (NeurIPS), v. 36, 2023. Disponível em: https://arxiv.org/abs/2305.10601.
ZHAO, H. et al. From Understanding to Utilization: A Survey on Explainability for Large Language Models. arXiv preprint, arXiv:2401.12874, 2024. Disponível em: https://arxiv.org/abs/2401.12874.
Artículo originario del Trabajo de Conclusión de Curso de la Especialización en Ingeniería de Software del MBA USP/Esalq
Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy