← 最新论文
💻 computer science

Semantic Tracing in LLM-Based Multi-Agent Systems Using LangChain, LangGraph, and LangSmith for AI Governance

本文通过在 SHADOWAI-RISK 原型中使用 LangChain、LangGraph 和 LangSmith,提出了一种用于基于大语言模型的多智能体系统的语义追踪框架,证明了集成语义评估能够显著减少语义漂移和约束违规,同时仅产生适度的延迟增加且零本地成本。

原作者: Audrey Rahimi

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Audrey Rahimi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:基于大语言模型(LLM)的多智能体系统中的语义追踪

问题陈述
采用基于大语言模型(LLM)的多智能体系统的组织面临着显著的治理挑战,包括“影子 AI”(Shadow AI)、幻觉传播、指令漂移以及对决策生成过程缺乏可见性。虽然像 LangSmith 这样的观测平台可以捕获执行追踪(traces),但它们本质上无法衡量智能体在智能体间的交接过程中,是否保留了其原始指令的语义含义、约束条件和证据承诺。现有框架缺乏一种集成方法,将“语义保留”视为一种一等公民的可测度量,并将其测量结果与企业级 AI 治理控制(如 NIST AI RMF、欧盟 AI 法案)相绑定。

研究方法
本研究采用了一种混合方法,核心是对 SHADOWAI-RISK 原型(一个用于企业 AI 治理与风险情报的学术研究工具)进行局部实验性扩展。该方法区分了原始的确定性基准(deterministic baseline)与一个新的实验条件:

  1. 实验架构:

    • 编排(Orchestration): 使用 LangGraph (StateGraph) 实现,用于管理状态化节点(库存、证据、治理、人工审核)及条件路由,包括强制性的人工审核关卡。
    • 推理与工具(Reasoning & Tools): 使用 LangChain (ChatOpenAI, ChatPromptTemplate, JsonOutputParser) 实现真实的 LLM 调用、工具封装(如 NVD CVE 查询)以及带有重试机制的结构化输出解析。
    • 可观测性(Observability): LangSmith 严格用于私有追踪、跨度(span)捕获和元数据记录。它并不负责计算语义指标或做出治理决策。
    • 语义评估(Semantic Evaluation): 一个独立的基于规则的层,用于比较交接数据包(handoff packets)以检测漂移、约束遗漏和未经支持的断言。
  2. 交接机制:

    • 智能体交换经过 Pydantic 验证的结构化交接数据包(Handoff Packets),其中包含目标标识符、约束集、证据来源、置信水平和残余风险。
    • 这些数据包作为衡量语义保真度的分析单元。
  3. 实验设计:

    • 完成了受控矩阵下的 450 次工作流执行(0 次终止失败)。
    • 实验条件:
      • 确定性基准(保留自原始原型)。
      • 无语义评估的 LLM 多智能体系统(160 次运行)。
      • 具备 LangSmith 追踪 + 语义评估的 LLM 多智能体系统(160 次运行)。
      • 变异性与消融研究(140 次运行)。
    • 指标: 定义了一套正式的指标体系,包括语义保留得分(SPS)、智能体交接保真度(AHF)、指令漂移率(IDR)、追踪完整性得分(TCS)、工具使用准确率(TUA)、治理合规率(GCR)、幻觉传播率(HPR)和工作流可靠性得分(WRS)。

核心贡献
本文贡献了八个具体要素,区分了已实现的功能与提议的架构:

  • C1: 提出了语义追踪的概念构架及交接数据包的表示形式。
  • C2: 构建了一个以 LangSmith 为中心的观测流水线及一套正式指标体系(注:人类校准尚在进行中)。
  • C3: 开发了一个包含四个智能体角色和一个人工审核关卡的可用局部原型。
  • C4–C5: 实现了真正的 LangChain LLM 调用与 LangGraph 状态化路由编排。
  • C6: 明确分离了编排、推理、确定性防护措施、追踪捕获、语义评估以及人类决策。
  • C7: 通过与未改变的 SHADOWAI-RISK 原型进行对比,完成了基准与实验条件的对照。
  • C8: 建立了语义追踪信号与治理控制(NIST、ISACA、欧盟等)之间的解释性映射。

结果
完成的实验矩阵(450/450 次运行)得出了 LLM 条件下“开启语义评估”与“未开启语义评估”之间的对比发现:

  • 追踪完整性 (TCS): 在启用评估的条件下显著降低(0.624 vs. 0.912;Holm 校正后 p < 0.001,Cliff's δ ≈ −0.33)。评估层识别出了原始追踪中未发现的缺失跨度/字段。
  • 工作流可靠性 (WRS): 在两种等权重和专家权重方案下,开启语义评估后的 WRS 均显著降低(效应较小)。
  • 语义与治理指标: 在两个 LLM 条件之间,SPS、AHF、IDR、TUA、GCR、HPR 或 HEP 均未发现统计学上的显著差异。
  • 决策准确性: 决策家族的正确性相似(59/160 vs. 57/160;p ≈ 0.91)。
  • 延迟: 启用评估的条件产生的延迟显著更高(~126.2s vs. ~101.7s;Cliff's δ ≈ 0.67,效应较大)。
  • 成本: 两种条件下的本地成本均为 $0(使用本地模型执行)。
  • 漂移检测: 在受控扰动场景中,多智能体条件成功检测到了指令漂移和证据缺失,而确定性基准则无法检测到跳步级的约束漂移(尽管它通过确定性规则正确处理了数据缺失)。

意义与主张
本文谦逊地主张,多智能体扩展的主要价值在于过程透明度与可审计性,而非更优的最终决策准确性。

  • 治理价值: 该框架提供了一种机制来检查智能体如何交换信息、约束在哪里丢失以及治理控制应在何处介入。它通过创建智能体行为的可审计证据,支持了 NIST AI RMF 中的“测量(Measure)”与“治理(Govern)”功能。
  • 操作现实: 研究表明,该概念架构可以在不修改生产部署的情况下,利用 LangChain、LangGraph 和 LangSmith 实现落地。
  • 局限性: 作者明确指出,语义保留的有效性尚未在生产环境中得到证实。指标权重的专家校准、评分者间一致性研究以及针对标注语料库的外部验证仍处于待定阶段。研究结果基于局部实验扩展,而非生产规模的部署。
  • 结论: 对于仅需最终建议、侧重于固定规则驱动的治理任务,确定性基准仍然足够。然而,对于需要洞察中间推理过程、智能体通信及语义问责性的场景,多智能体架构提供了确定性工作流所缺乏的能力,尽管这会带来更高的延迟和实现复杂度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →