← 最新论文
💬 NLP

Safeguarding LLM Agents from Misalignment through Provenance Analysis

本文介绍了 ProvenanceGuard,这是一个基于溯源的框架,通过将工具调用与智能体上下文中的可追溯证据进行校验,与传统的 LLM-as-a-judge 基准相比,显著提高了对 LLM 智能体失调的检测能力并减少了误干预。

原作者: Yining She, Yiliang Liang, Eunsuk Kang

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yining She, Yiliang Liang, Eunsuk Kang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位非常聪明、充满干劲的私人助理(一个 LLM Agent/大语言模型智能体)来协助处理日常任务。你告诉他:“请向 Daniel 要 30 美元。”由于这个助理与现实世界相连,他实际上可以发送电子邮件、转账或修改文件。

问题在于,这个助理有时过于积极,或者产生了误解。他可能没有按照你的要求去“要”钱,而是不小心把钱“汇”给了 Daniel。或者,他可能会在没有提到相关指令的情况下擅自支付一笔账单。这被称为对齐失调(misalignment):助理执行的操作在技术上遵循了规则,但违背了你的真实意图。

这篇论文介绍了一种名为 ProvenanceGuard 的新型安全系统,旨在在错误发生前将其拦截。以下是其工作原理的简易说明:

核心理念:寻找“纸质凭证”的侦探

作者意识到,现有的安全系统就像是一个老板仅仅询问第二个同样困惑的助理:“这是一个好主意吗?”这往往会导致回答不一致。

相反,ProvenanceGuard 扮演的是一名法医侦探的角色。它不只是靠猜测,而是要求提供纸质凭证(provenance)。它会追问:“你能向我展示,是在我们对话中的哪一段,或者在哪些指令中,你找到了执行这项特定操作的具体证据吗?”

如果助理无法指出你请求中的特定句子或之前的某个事实来证明该行为的合理性,系统就会拦截该操作。

三类错误

论文将“坏主意”分为三类,并使用侦探的清单进行检查:

  1. 工具错误(工具级 - Tool-Level):
    • 场景: 你说“请求款项”。助理却尝试使用“发送款项”工具。
    • 侦探检查: “这个工具匹配这项工作吗?”系统会检查工具的使用手册和你的请求。如果工具的功能描述与工作不符,操作将被拦截。
  2. 细节错误(参数级 - Parameter-Level):
    • 场景: 你说“给 Daniel 发送 30 美元”。助理使用了正确的工具,但因为猜错了名字,把钱发给了 Sarah。
    • 侦探检查: “你是从哪里得到‘Sarah’这个名字的?”如果助理无法在对话中指出任何提到“Sarah”的事实,系统会判定:“未发现证据。停止。”
  3. 盲目猜测(解释级 - Interpretation-Level):
    • 场景: 你说“处理这个请求”,但没有说明具体如何处理。助理决定自动支付一笔账单。
    • 侦探检查: “这是唯一的处理方式吗?”系统意识到你的请求很模糊。由于“处理”有多种解释方式(支付、拒绝或询问你),助理正在进行盲目猜测。系统会拦截该动作,并强制助理向你寻求澄清。

系统运作方式(三阶段流水线)

ProvenanceGuard 不是一个单一的问题,而是一个动作在发生前必须通过的三步安全检查站

  1. 检查点 1(工具): “这是这项工作的正确工具吗?”如果不是,停止
  2. 检查点 2(细节): “对于你使用的具体数字或名称,你有证据吗?”如果没有,停止
  3. 检查点 3(解释): “这是唯一的逻辑做法,还是存在其他可能性?”如果存在其他可能性,系统会认定助理在进行猜测,并停止以请求帮助。

结果:更聪明且更少干扰

作者使用两个不同的测试场景,针对 10 种不同的“大脑”模型(LLMs)对该系统进行了测试。

  • 更少的错误: 与旧方法(仅询问第二个 AI“这是否可以”)相比,ProvenanceGuard 拦截了几乎所有的错误行为。在一项测试中,它将错误率从 43% 降低到了 2%
  • 更少的干扰: 一个拦截所有内容的安全性系统是毫无用处的,因为它会阻止助理完成任何有益的工作。作者发现 ProvenanceGuard 非常擅长让正确的操作通过。它不会阻碍成功任务的完成,不像其他一些方法会过度拦截正常的动作。

总结

这篇论文提出,与其猜测 AI 智能体是否在做正确的事,不如要求它证明自己。通过要求智能体展示将其行为与你实际请求联系起来的“纸质凭证”,我们可以阻止它犯下危险且不可逆的错误(如发送资金或删除文件),同时又不会减慢它本应完成的有益工作。

注: 本文严格专注于防止软件智能体中出现的此类误解。它并不声称解决了所有的 AI 安全问题,也未讨论医疗或临床应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →