← 最新论文
🤖 machine learning

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

本文介绍了 TRACE,一种针对 LLM 智能体轨迹的新型双通道鲁棒归属水印,它通过叠加一个内容密钥选择通道和一个位置密钥计数通道,确保了动作选择的无失真性以及来源追踪的不可破解性,从而能够抵御转售者进行的对抗性删除和重写尝试。

原作者: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你制造了一个超级智能的机器人助手,它能订机票、点披萨,甚至还能修理你的 Wi-Fi。你把这个机器人卖给了一个中间商(即“经销商”),然后由他将其租给客户。问题在于?中间商可能会试图偷偷换成一个更便宜的机器人,声称那是他们自己制造的,或者干脆篡改日志来掩盖行踪。

通常情况下,为了证明谁对机器人的决策负责,我们会查看它的“日记”——即记录了它使用的每一个工具和采取的每一个行动的日志。但如果中间商拥有这份日记的所有权,他们就可以擦掉页面或重写故事,让它看起来像是他们完成的工作。现有的水印就像是写在日记页面上的隐形墨水;如果中间商重写了文本,这些墨水就会消失。

于是有了 TRACE,一种全新的数字指纹技术,旨在即使在日记所有者试图抹除痕迹时也能幸存下来。TRACE 不仅仅是在页面上书写,它还通过两种巧妙且不可见的手段改变了“故事”本身,这两种手段是无法在不破坏日记本身的情况下被撤销的。

双通道魔术

TRACE 使用两个不同的“通道”来隐藏其证明,就像间谍使用两个互相保护的密码一样。

1. “选择”通道(无形之手)
想象机器人必须选择一扇门走过去。总共有五扇门,但只有一扇通向宝藏。普通的机器人根据自身的逻辑进行选择。TRACE 的“选择”通道就像一只神奇的、无形的巨手,在不改变成功率的前提下,轻轻地引导机器人选择特定的门。

  • 运作方式: 它使用一个基于“当前故事内容”(内容)的秘密密钥来决定选择哪扇门。
  • 超能力: 如果中间商删除了日记中的一页(“删除攻击”),故事会发生跳跃,但无形之手会针对下一页立即重新校准。这就像是一个 GPS,如果你错过了一个转弯,它会立即重新规划路线。证明之所以能幸存,是因为它与选择的“内容”相关联,而不是与“页码”相关联。
  • 代价: 如果中间商重写了故事(例如将“门 A”改为“蓝色之门”),这个通道就会失效。因为无形之手原本在寻找“门 A”,现在它感到困惑了。

2. “计数”通道(万能钥匙)
现在,想象机器人的日记是按组组织的:一个决策,紧接着几个观察结果。TRACE 的“计数”通道不在乎文字内容,它在乎的是“结构”。它会秘密地在某些组中添加一个“幽灵记录”(冗余笔记),使这些组拥有两条笔记而不是一条。

  • 运作方式: 它使用一个基于组的“位置”(日记的骨架)的秘密密钥。它决定:“第 1 组获得一个幽灵笔记,第 2 组则没有。”
  • 超能力: 如果中间商重写了文本(将“门 A”改为“蓝色之门”),组内的笔记“数量”保持不变。结构保持原样。这个通道对于重写是不可破解的,因为中间商无法在不破坏日记格式的情况下改变笔记的数量。
  • 代价: 如果中间商删除了页面,计数就会发生变化,这个通道也会因此陷入混乱。

“双盲”防御机制

这里的精妙之处在于:中间商无法取胜。

  • 如果他们试图通过删除页面来隐藏“选择”通道,那么依赖于结构的“计数”通道依然完美无缺。
  • 如果他们试图通过重写文本来隐藏“计数”通道,那么依赖于内容的“选择”通道依然完美无缺。
  • 要想同时抹除两者,中间商必须删除 70% 的日记,并且重写几乎所有的内容。但如果他们这样做,日记就会变得支离破碎,变得毫无价值。他们亲手毁掉了自己试图销售的产品!

数据说明

研究人员在两个真实的机器人挑战任务上测试了 TRACE:ToolBench(短任务,约 1.4 个决策步骤/任务)和 ALFWorld(长任务,约 23 到 25 个决策步骤)。

  • 对机器人无损: TRACE 是“无失真”的。机器人在执行任务时的成功率与没有水印的机器人一样高。事实上,在 ALFWorld 上,未加水印的机器人成功率为 82.4%,而 TRACE 的成功率为 83.6%。其他试图强制进行选择的水印方法,会导致成功率下降 8.1 个百分点!
  • 检测得分: 在长任务(ALFWorld)中,“选择”通道达到了 z = 100 的检测得分。这是一个极其强烈的信号。即使中间商删除了 70% 的步骤,得分依然高于检测线。
  • 重写测试: 当一个超级智能 AI(“LLM 重写器”)尝试重写日记以隐藏水印时,“计数”通道的表现完全没有变化。它的得分纹丝不动。与此同时,旧的水印方法(如“红绿”法)得分几乎降至零。
  • 作弊成本: 要同时让两个通道失效,攻击者必须破坏常数比例的动作。论文从数学上证明,你不能仅仅通过“编辑”来逃避检测;你必须破坏整个服务。

TRACE 排除的情况

论文非常明确地说明了它做的事情:

  • 不是针对那些直接用另一个完全不同的模型替换掉机器人的中间商的“魔法护盾”。如果他们不再使用你的机器人,就没有任何水印可以寻找。
  • 不是针对单次示例下的短任务的解决方案。在 ToolBench(短任务)中,你需要将大约 10 条轨迹 聚合在一起,才能获得强有力的信号,因为单个短任务中的“决策熵”(随机性)不足。
  • 并不依赖于中间商的诚实。该系统专门设计用于应对那种“持有证据的人即是敌人”的情景。

总结

TRACE 是第一个能够证明机器人的行为属于其创造者的系统,即使持有日志的人是中间商,并且试图删除或重写这些日志。它通过将证明拆分为两部分来工作:一部分在删除中幸存,另一部分在重写中幸存。数学证明表明,要击败它,攻击者必须破坏他们试图销售的这项服务本身。这是一种鲁棒且无失真的方式,无论谁握着笔,都能让真相留在日记中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →