LEDGER: Claim-to-Evidence Trace Graphs for Auditing LLM Agents
本文介绍了 LEDGER,这是一个追踪与审查系统,它通过构建分层证据与决策图,将原始的智能体执行事件转化为连接主张与其支持性动作、人工制品及验证步骤的结构化、可审计路径,从而应对验证复杂 LLM 智能体工作流日益增长的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:LEDGER —— 用于 LLM 智能体审计的“断言-证据”追踪图谱
问题陈述
随着大语言模型(LLM)智能体从单轮问答系统演变为能够执行长程技术工作流(涉及工具使用、代码执行、文件编辑和人工制品生成)的交互式工作者,其生产力的主要瓶颈已从输出生成转向了可审计性(auditability)。现有的观测系统(如 LangSmith)虽然提供了对执行事件(提示词、工具调用、错误、中间输出)的细粒度可见性,但这种可见性并不等同于可审计性。
审查人员目前面临着“扁平记录”问题:他们必须手动重建会话的逻辑结构,以确定哪些动作、人工制品和验证步骤支持了特定的结论。这种手动重建过程耗时耗力,难以随会话复杂度的增加而扩展,并且模糊了最终断言与底层证据之间的直接血缘关系。本文认为,有效的审计需要一种以证据为中心的方法,使审查人员能够从报告的结果回溯到产生该结果的具体动作和人工制品,而非仅仅阅读线性日志。
方法论:LEDGER 系统
作者引入了 LEDGER(分层执行评审的证据与决策图谱,Layered Evidence and Decision Graphs for Execution Review),这是一个在不修改原始交互式智能体会话的情况下,与之并行的侧向追踪与评审系统。LEDGER 并非取代观测功能,而是将捕获的记录重新组织为用于人工评审的分层语义追踪图谱。
1. 捕获与追踪记录
LEDGER 的基础是追踪记录(Trace Record),这是一个稳定的、非解释性的捕获会话数据的底层基质。
- 机制: 系统利用生命周期钩子(例如
SessionStart、PreToolUse、PostToolUse)和转录重构技术,来捕获包含消息、工具调用、结果和文件交互的 JSON 负载。 - 完整性: 这些记录保留了会话的原始顺序和内容,包括指向源转录的链接。它们作为“事实来源(source of truth)”,与任何推断出的结构相区别。
2. 分层图谱构建
LEDGER 将追踪记录组织成一个三层图结构:
- 证据节点(Evidence Nodes): 这些节点将紧密相关的追踪记录(例如一个工具调用及其结果)组合成可检查的工作单元。它们按类型(动作 vs. 人工制品)和类别(例如
user_message、tool_call、control、artifact)进行分类。人工制品节点专门代表可检查的对象,如代码补丁、图表、表格或命令输出。 - 工作流节点(Workflow Nodes): 这些节点将相关的证据节点组合成更高层级的任务阶段(例如
context、plan、inspect、execute、validate、claim)。这种抽象使得审查人员可以在阶段层面而非事件层面查看会话。 - 语义边(Semantic Edges): 通过类型化的有向边连接节点以定义关系。关键边类型包括:
uses(使用):一个工作单元消耗了一个人工制品。produces(生成):一个工作单元创建或修改了一个人工制品。checked_by(由...验证):一个变更被特定的步骤所验证。supports(支持):证据证明了某个断言。informs(告知):一个结果塑造了后续的计划。frames(框架化):一个需求为任务设定了上下文。
3. 界面与评审工作流
该系统提供了一个集成以下功能的本地仪表板:
- 图谱视图: 提供两层可视化(工作流层和证据层),允许审查人员从高层阶段向下追踪至具体证据。
- 人工制品检查: 直接索引并查看与图谱链接的底层人工制品(例如打开特定的图表、补丁或表格)。
- 追踪构建审计: 展示原始追踪记录和图谱更新的视图,使审查人员能够区分是智能体错误还是追踪错误(即验证图谱是如何从原始数据构建而成的)。
核心贡献
- 断言-证据追踪图谱构建: 一种将未经修改的智能体会话解析为分层语义图谱的方法,其中人工制品节点代表可检查的证据,且类型化的边明确地将断言与支持性的动作及验证步骤连接起来。
- 以证据为中心的评审界面: 一个统一了图谱级审计路径、源记录与人工制品的仪表板,使审查人员能够在工作流的逻辑结构与原始证据之间流畅切换。
- 捕获与解释的分离: 一种设计方案,严格将确定性的源记录(追踪记录)与推断出的结构(证据/工作流节点)分离,确保图谱仅作为审计辅助工具,而非不透明的事实来源。
实验结果与案例研究
论文通过两个使用开启了实时追踪的 Codex 智能体的案例研究验证了 LEDGER:
- 案例研究 1:表格数据分析: 智能体分析了空气质量数据以生成每日模式报告。追踪图谱成功展示了人工制品血缘关系,将最终断言通过生成的图表和汇总表回溯到源数据清洗步骤。它还突出了一个错误与修复序列,展示了如何追踪一个失败的脚本执行(由于缺失依赖项),对其进行修补并重新验证,使修复过程变得透明。
- 案例研究 2:代码库中的功能添加: 智能体为 NetworkX 库添加了一个最短路径工具。图谱区分了初始实现与随后的回归测试及保护性补丁。它允许审查人员将设计决策(将函数放置在特定模块中)回溯到仓库检查和文档阅读,并向前追踪至验证行为的具体测试。
在两个案例中,系统都展示了使“审计路径”显性化的能力,允许审查人员不仅验证断言是否成立,还验证其是如何通过特定的人工制品和检查得到支持的。
意义与主张
论文将 LEDGER 定位为智能体观测领域的一次必要进化。其意义在于将范式从可见性(看到发生了什么)转向可审计性(理解为什么结论是可靠的)。
- 适度主张: 作者明确指出,图谱构建并非完全确定性的;追踪器会解释哪些记录属于彼此并分配语义边。因此,该图谱被呈现为一种审计辅助工具,而非事实来源。界面设计旨在保持底层记录可见,以便审查人员验证图谱的构建过程。
- 未来方向: 论文建议未来的工作应旨在用确定性或可独立验证的结构(例如通过更强的仪器化或具备溯源能力的后端)来取代模型推断的结构,并改进视觉词汇,以更好地区分确定性关系与推断性关系。
最终,LEDGER 旨在通过在保留访问源记录权限的同时,使动作、人工制品与结论之间的联系变得可检查且可追踪,从而支持人类对复杂智能体工作流日益增长的监督需求。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。