← Últimos artículos
💻 computer science

Semantic Tracing in LLM-Based Multi-Agent Systems Using LangChain, LangGraph, and LangSmith for AI Governance

Este artículo presenta un marco de rastreo semántico para sistemas multiagente basados en LLM utilizando LangChain, LangGraph y LangSmith dentro del prototipo SHADOWAI-RISK, demostrando que la integración de la evaluación semántica reduce significativamente la deriva semántica y las violaciones de restricciones, incurriendo únicamente en un aumento moderado de la latencia y un costo local de cero.

Autores originales: Audrey Rahimi

Publicado 2026-07-28
📖 1 min de lectura☕ Lectura para el café

Autores originales: Audrey Rahimi

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Rastreo Semántico en Sistemas Multi-Agente Basados en LLM

Declaración del Problema
Las organizaciones que adoptan sistemas multi-agente basados en Modelos de Lenguaje Extensos (LLM) enfrentan desafíos significativos de gobernanza, incluyendo la "IA en la sombra" (Shadow AI), la propagación de alucinaciones, la deriva de instrucciones y la falta de visibilidad sobre cómo se producen las decisiones. Aunque las plataformas de observabilidad como LangSmith capturan trazas de ejecución, no miden inherentemente si los agentes preservaron el significado semántico, las restricciones y los compromisos de evidencia de sus instrucciones originales a través de los traspasos de agente a agente. Los marcos actuales carecen de un método integrado para tratar la "preservación del significado" como una magnitud de medida de primera clase y vincular estas mediciones con los controles de gobernanza de IA empresarial (por ejemplo, NIST AI RMF, Ley de IA de la UE).

Metodología
El estudio emplea un enfoque de métodos mixtos centrado en una extensión experimental local del prototipo SHADOWAI-RISK, una herramienta de investigación académica para la inteligencia de riesgos y gobernanza de IA empresarial. La metodología distingue entre la línea base determinista original y una nueva condición experimental:

  1. Arquitectura Experimental:

    • Orquestación: Implementada utilizando LangGraph (StateGraph) para gestionar nodos con estado (Inventario, Evidencia, Gobernanza, Revisión Humana) y enrutamiento condicional, incluyendo puertas de revisión humana obligatorias.
    • Razonamiento y Herramientas: Implementado utilizando LangChain (ChatOpenAI, ChatPromptTemplate, JsonOutputParser) para la invocación genuina de LLM, el envoltorio de herramientas (por ejemplo, búsqueda de NVD CVE) y el análisis de salida estructurada con mecanismos de reintento.
    • Observabilidad: LangSmith se utiliza estrictamente para el rastreo privado, la captura de spans y el registro de metadatos. No computa métricas semánticas ni toma decisiones de gobernanza.
    • Evaluación Semántica: Una capa separada basada en reglas compara los paquetes de traspaso para detectar deriva, omisión de restricciones y afirmaciones no sustentadas.
  2. Mecanismo de Traspaso (Handoff):

    • Los agentes intercambian Paquetes de Traspaso (validados con Pydantic) que contienen identificadores de objetivos, conjuntos de restricciones, fuentes de evidencia, niveles de confianza y riesgo residual.
    • Estos paquetes sirven como la unidad de análisis para medir la fidelidad semántica.
  3. Diseño Experimental:

    • Se completó una matriz controlada de 450 ejecuciones de flujo de trabajo (0 fallos terminales).
    • Condiciones:
      • Línea Base Determinista (preservada del prototipo original).
      • Multi-Agente LLM sin Evaluación Semántica (160 ejecuciones).
      • Multi-Agente LLM con Rastreo de LangSmith + Evaluación Semántica (160 ejecuciones).
      • Estudios de variabilidad y ablación (140 ejecuciones).
    • Métricas: Se definió un conjunto formal que incluye: Puntuación de Preservación Semántica (SPS), Fidelidad de Traspaso de Agente (AHF), Tasa de Deriva de Instrucción (IDR), Puntuación de Completitud de Traza (TCS), Precisión de Uso de Herramientas (TUA), Tasa de Cumplimiento de Gobernanza (GCR), Tasa de Propagación de Alucinaciones (HPR) y Puntuación de Fiabilidad del Flujo de Trabajo (WRS).

Contribuciones Clave
El artículo contribuye con ocho elementos específicos, distinguiendo entre características implementadas y arquitecturas propuestas:

  • C1: Un constructo conceptual para el rastreo semántico y una representación de paquete de traspaso.
  • C2: Un pipeline de observabilidad centrado en LangSmith y un conjunto formal de métricas (notando que la calibración humana está pendiente).
  • C3: Un prototipo local funcional con cuatro roles de agente y una Puerta de Revisión Humana.
  • C4–C5: Implementación genuina de la invocación de LLM mediante LangChain y la orquestación de LangGraph con enrutamiento de estado.
  • C6: Una separación explícita de la orquestación, el razonamiento, las salvaguardas deterministas, la captura de trazas, la evaluación semántica y la decisión humana.
  • C7: Una comparación de línea base versus experimental contra el prototipo SHADOWAI-RISK sin cambios.
  • C8: Un mapeo interpretativo de las señales de rastreo semántico hacia los controles de gobernanza (NIST, ISACA, UE, etc.).

Resultados
La matriz experimental completada (450/450 ejecuciones) arrojó los siguientes hallazgos comparativos entre la condición de LLM con evaluación semántica y la condición de LLM sin ella:

  • Completitud de la Traza (TCS): Significativamente menor en la condición con evaluación habilitada (0.624 vs. 0.912; Holm-ajustado p < 0.001, Cliff's δ ≈ −0.33). La capa de evaluación identificó spans/campos faltantes que la traza bruta no detectó.
  • Fiabilidad del Flujo de Trabajo (WRS): Significativamente menor con la evaluación semántica bajo esquemas de ponderación tanto iguales como de experto (efectos pequeños).
  • Métricas Semánticas y de Gobernanza: No se encontraron diferencias estadísticamente significativas para SPS, AHF, IDR, TUA, GCR, HPR o HEP entre las dos condiciones de LLM.
  • Precisión de Decisión: La corrección de la familia de decisiones fue similar (59/160 vs. 57/160; p ≈ 0.91).
  • Latencia: La condición con evaluación habilitada incurrió en una latencia significativamente mayor (~126.2s vs. ~101.7s; Cliff's δ ≈ 0.67, efecto grande).
  • Costo: Ambas condiciones incurrieron en $0 de costo local (usando ejecución de modelo local).
  • Detección de Deriva: En escenarios de perturbación controlada, la condición multi-agente detectó con éxito la deriva de instrucciones y la falta de evidencia, mientras que la línea base determinista no pudo detectar la deriva de restricciones a nivel de salto (aunque manejó correctamente los datos faltantes mediante reglas deterministas).

Significancia y Reivindicaciones
El artículo reclama modestamente que el valor principal de la extensión multi-agente es la transparencia de procesos y la auditabilidad, no una precisión de decisión final superior.

  • Valor de Gobernanza: El marco proporciona un mecanismo para inspeccionar cómo los agentes intercambian información, dónde se pierden las restricciones y dónde deben intervenir los controles de gobernanza. Soporta las funciones de "Medir" y "Gobernar" del NIST AI RMF al crear evidencia auditable del comportamiento de los agentes.
  • Realidad Operativa: El estudio demuestra que la arquitectura conceptual puede operacionalizarse utilizando LangChain, LangGraph y LangSmith sin modificar los despliegues de producción.
  • Limitaciones: Los autores declaran explícitamente que la efectividad de la preservación semántica no ha sido probada en producción. La calibración humana de los pesos de las métricas, los estudios de acuerdo entre evaluadores y la validación externa en corpus anotados siguen pendientes. Los hallazgos se basan en una extensión experimental local, no en un despliegue a escala de producción.
  • Conclusión: Para tareas de gobernanza de reglas fijas que solo requieren una recomendación final, la línea base determinista sigue siendo suficiente. Sin embargo, para entornos que requieren visibilidad en el razonamiento intermedio, la comunicación entre agentes y la responsabilidad semántica, la arquitectura multi-agente ofrece capacidades que el flujo de trabajo determinista carece, aunque a costa de una mayor latencia y complejidad de implementación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →