想象一下,你制造了一个超级智能的机器人助手,它能订机票、点披萨,甚至还能修理你的 Wi-Fi。你把这个机器人卖给了一个中间商(即“经销商”),然后由他将其租给客户。问题在于?中间商可能会试图偷偷换成一个更便宜的机器人,声称那是他们自己制造的,或者干脆篡改日志来掩盖行踪。
通常情况下,为了证明谁对机器人的决策负责,我们会查看它的“日记”——即记录了它使用的每一个工具和采取的每一个行动的日志。但如果中间商拥有这份日记的所有权,他们就可以擦掉页面或重写故事,让它看起来像是他们完成的工作。现有的水印就像是写在日记页面上的隐形墨水;如果中间商重写了文本,这些墨水就会消失。
于是有了 TRACE,一种全新的数字指纹技术,旨在即使在日记所有者试图抹除痕迹时也能幸存下来。TRACE 不仅仅是在页面上书写,它还通过两种巧妙且不可见的手段改变了“故事”本身,这两种手段是无法在不破坏日记本身的情况下被撤销的。
双通道魔术
TRACE 使用两个不同的“通道”来隐藏其证明,就像间谍使用两个互相保护的密码一样。
1. “选择”通道(无形之手)
想象机器人必须选择一扇门走过去。总共有五扇门,但只有一扇通向宝藏。普通的机器人根据自身的逻辑进行选择。TRACE 的“选择”通道就像一只神奇的、无形的巨手,在不改变成功率的前提下,轻轻地引导机器人选择特定的门。
- 运作方式: 它使用一个基于“当前故事内容”(内容)的秘密密钥来决定选择哪扇门。
- 超能力: 如果中间商删除了日记中的一页(“删除攻击”),故事会发生跳跃,但无形之手会针对下一页立即重新校准。这就像是一个 GPS,如果你错过了一个转弯,它会立即重新规划路线。证明之所以能幸存,是因为它与选择的“内容”相关联,而不是与“页码”相关联。
- 代价: 如果中间商重写了故事(例如将“门 A”改为“蓝色之门”),这个通道就会失效。因为无形之手原本在寻找“门 A”,现在它感到困惑了。
2. “计数”通道(万能钥匙)
现在,想象机器人的日记是按组组织的:一个决策,紧接着几个观察结果。TRACE 的“计数”通道不在乎文字内容,它在乎的是“结构”。它会秘密地在某些组中添加一个“幽灵记录”(冗余笔记),使这些组拥有两条笔记而不是一条。
- 运作方式: 它使用一个基于组的“位置”(日记的骨架)的秘密密钥。它决定:“第 1 组获得一个幽灵笔记,第 2 组则没有。”
- 超能力: 如果中间商重写了文本(将“门 A”改为“蓝色之门”),组内的笔记“数量”保持不变。结构保持原样。这个通道对于重写是不可破解的,因为中间商无法在不破坏日记格式的情况下改变笔记的数量。
- 代价: 如果中间商删除了页面,计数就会发生变化,这个通道也会因此陷入混乱。
“双盲”防御机制
这里的精妙之处在于:中间商无法取胜。
- 如果他们试图通过删除页面来隐藏“选择”通道,那么依赖于结构的“计数”通道依然完美无缺。
- 如果他们试图通过重写文本来隐藏“计数”通道,那么依赖于内容的“选择”通道依然完美无缺。
- 要想同时抹除两者,中间商必须删除 70% 的日记,并且重写几乎所有的内容。但如果他们这样做,日记就会变得支离破碎,变得毫无价值。他们亲手毁掉了自己试图销售的产品!
数据说明
研究人员在两个真实的机器人挑战任务上测试了 TRACE:ToolBench(短任务,约 1.4 个决策步骤/任务)和 ALFWorld(长任务,约 23 到 25 个决策步骤)。
- 对机器人无损: TRACE 是“无失真”的。机器人在执行任务时的成功率与没有水印的机器人一样高。事实上,在 ALFWorld 上,未加水印的机器人成功率为 82.4%,而 TRACE 的成功率为 83.6%。其他试图强制进行选择的水印方法,会导致成功率下降 8.1 个百分点!
- 检测得分: 在长任务(ALFWorld)中,“选择”通道达到了 z = 100 的检测得分。这是一个极其强烈的信号。即使中间商删除了 70% 的步骤,得分依然高于检测线。
- 重写测试: 当一个超级智能 AI(“LLM 重写器”)尝试重写日记以隐藏水印时,“计数”通道的表现完全没有变化。它的得分纹丝不动。与此同时,旧的水印方法(如“红绿”法)得分几乎降至零。
- 作弊成本: 要同时让两个通道失效,攻击者必须破坏常数比例的动作。论文从数学上证明,你不能仅仅通过“编辑”来逃避检测;你必须破坏整个服务。
TRACE 排除的情况
论文非常明确地说明了它不做的事情:
- 它不是针对那些直接用另一个完全不同的模型替换掉机器人的中间商的“魔法护盾”。如果他们不再使用你的机器人,就没有任何水印可以寻找。
- 它不是针对单次示例下的短任务的解决方案。在 ToolBench(短任务)中,你需要将大约 10 条轨迹 聚合在一起,才能获得强有力的信号,因为单个短任务中的“决策熵”(随机性)不足。
- 它并不依赖于中间商的诚实。该系统专门设计用于应对那种“持有证据的人即是敌人”的情景。
总结
TRACE 是第一个能够证明机器人的行为属于其创造者的系统,即使持有日志的人是中间商,并且试图删除或重写这些日志。它通过将证明拆分为两部分来工作:一部分在删除中幸存,另一部分在重写中幸存。数学证明表明,要击败它,攻击者必须破坏他们试图销售的这项服务本身。这是一种鲁棒且无失真的方式,无论谁握着笔,都能让真相留在日记中。
技术摘要:TRACE —— 一种双通道鲁棒归属水印
1. 问题定义与威胁模型
本文解决了针对大语言模型(LLM)智能体在特定对抗环境下——即**转售商威胁模型(reseller threat model)下的溯源归属(provenance attribution)**这一关键挑战。
- 背景: LLM 智能体通过转售商与用户进行交互,转售商可能会对智能体进行重新品牌化或替换底层模型。当涉及责任或使用情况的争议时,主要的证据是轨迹日志(trajectory log)(即工具调用、观察结果和执行动作的记录),而非模型的内部推理过程。
- 对抗者: 转售商拥有对轨迹日志的完全读写权限,因为他们必须处理这些日志进行计费和计量。他们是审计证据的实体。
- 攻击手段: 转售商试图通过执行两种特定的“洗白(laundering)”手段来剥离归属信息:
- 删除(Deletion): 修剪日志(丢弃步骤或观察结果)以移除识别提供者的记录。
- 重写(Rewriting): 对观察结果进行改写(paraphrasing),并将工具重命名为转售商的命名空间,同时保留日志的结构骨架(决策/观察标签的序列)。
- 现有方法的局限性: 先前的智能体水印(如 Agent Guide, AgentMark)依赖于单一信号,该信号要么基于内容,要么基于位置。
- 基于内容的密钥在重写攻击下会失效(因为内容被改变了)。
- 基于位置的密钥在删除攻击下会失效(因为序列发生了失步/去同步)。
- 现有方法缺乏针对“拥有证据本身的所有权”这一类对抗者的鲁棒性。
2. 方法论:TRACE 方案
作者提出了 TRACE,一种将两个独立且互补的水印叠加在单个轨迹上的双通道水印方案。其核心设计原则是:每个通道都针对一个由一种攻击类破坏、但被另一种攻击类保留的特定不变量(invariant)进行设计。
A. 选择通道(Selection Channel,基于内容密钥)
- 目标: 针对删除攻击的鲁棒性。
- 机制:
- 载体: 智能体在每个决策点选择的具体动作 (bi)。
- 密钥化: 源自前序动作历史 (Ai−1) 的局部内容以及一个秘密密钥 (key1)。
- 嵌入: 使用无失真指数竞速(distortion-free exponential race)(基于 Gumbel-max trick)。智能体精确地从其原始分布 Pi 中采样,但“竞速”的胜出者是由一个带密钥的随机值决定的。
- 检测: 检测器利用观察到的轨迹和密钥重演竞速过程。如果观察到的动作是带密钥竞速中的“胜出者”,则产生高分。
- 鲁棒性: 由于密钥依赖于内容,删除一个观察记录仅会导致紧随其后的下一个组的密钥失步(影响范围为一个决策组)。检测器会在删除后立即重新同步。
- 代价: 信号量受限于决策的香农熵(Shannon entropy)。确定性决策(熵为 0)不会产生信号;高熵决策产生的信号更强。
- B. 计数通道(Tally Channel,基于位置密钥)
- 目标: 针对重写攻击的鲁棒性。
- 机制:
- 载体: 一个决策组中的记录数量 (ki)(具体表现为是否附加了一个冗余的观察记录)。
- 密钥化: 严格源自轨迹的骨架(skeleton)(即决策/观察标签的序列)和一个秘密密钥 (key2)。它与文本内容无关。
- 嵌入: 在满足密钥条件的组中,嵌入器会附加一个上下文无关的冗余记录。该记录是前缀的确定性函数,不调用任何工具,也不会产生副作用,从而确保不会改变智能体未来的决策。
- 检测: 检测器统计每个组中的记录数,并将其与源自骨架的预期模式进行比较。
- 鲁棒性: 重写攻击会保留骨架(标签序列)。因此,组边界和计数保持不变。计数通道在任何保留骨架的重写攻击下都是无条件不变的。
C. 联合检测
检测器计算两个通道的 z-score。如果两个通道的最小 p 值低于阈值,则拒绝原假设(即认为轨迹未加水印)。这两个通道被设计为在原假设下是相互独立的。
3. 核心贡献
- 形式化威胁模型: 本文形式化了转售商威胁模型,其中对抗者拥有对证据的完全读写权限,并将删除和重写定义为不同的攻击类别。
- 双通道架构: TRACE 是首个同时实现以下特性的智能体水印:
- 无失真动作选择: 智能体的分布被证明未受改变。
- 删除下的自同步: 选择通道在一次删除后即可恢复同步。
- 重写下的无条件不变性: 计数通道无论内容如何修改都保持不变。
- 理论保证:
- 效用保持: 证明了选择通道不会改变智能体的动作分布(定理 5.1)。
- 熵-可检测性权衡: 证明了信号强度由决策熵的一半下界约束(定理 5.2)。
- 联合擦除代价: 证明了同时擦除两个通道会迫使对抗者要么编辑骨架(这会暴露其面临一致性审计),要么破坏轨迹的常数比例,从而实质性地破坏服务质量(定理 5.4)。
- 新的攻击基准: 引入了 LLM 重写器(LLM Rewriter),这是一种具有启发性且保持合理性的攻击,它通过将动作替换为不同但合理的替代品,作为衡量重写鲁棒性的严苛基准。
4. 实验结果
该方案在 ToolBench(短程,约 1.4 个决策组/任务)和 ALFWorld(长程,约 23-25 个决策步/任务)上进行了评估。
- 效用: TRACE 在两个基准测试中均能达到与未加水印智能体(Base)相当的成功率。相比之下,有偏向性的水印(如 Red-Green 基准)由于在低熵决策时的概率质量偏移,导致成功率显著下降(在 ALFWorld 上下降了高达 8.1 个百分点)。
- 检测能力:
- 干净日志: TRACE 实现了极高的检测得分(在 ALFWorld 上,选择通道的 z≈100)。
- 删除: 即使在 70% 的步骤删除下,选择通道仍具有可检测性(z 从 11.34 降至 4.06,但仍高于阈值)。
- 重写: 在 100% 重写强度下,计数通道保持完全不变(z 稳定在 ~14.34)。相反,基于内容的基准(RG, AM-F)在重写攻击下会崩塌至接近零或负值。
- 组合攻击: 只有当高删除(70%)与高重写(>60%)结合的“极端”情况发生时,才会同时抑制两个通道。这对应于转售商已经破坏了服务的可用性场景。
5. 意义与主张
本文声称 TRACE 为转售环境下的溯源问题提供了结构性解决方案,超越了经验性的鲁棒性,达到了数学上的保证。
- 问责制: 它使得即使在持有日志的实体(转售商)是对抗者的情况下,也能实现归属判定。
- 互补的不变量: 该工作表明,通过将信号拆分到互补的不变量(内容 vs. 骨架)中可以实现鲁棒性,从而确保没有任何单一攻击类可以在不破坏产品本身的情况下破坏水印。
- 无失真: 它证明了可以在不降低智能体任务性能的情况下实现行为水印,这是部署中的关键要求。
- 局限性: 作者指出,检测需要审计时能够访问候选动作集,并且计数通道会增加日志体积(存储开销),而非增加工具调用。他们也承认,如果转售商完全放弃原有的智能体并在不同模型上重新运行任务,水印将会消失,但这种缺失本身就标志着误导行为。
文章总结道,虽然没有任何单一信号方案能在对抗者完全控制证据的情况下生存,但利用互补嵌入的双通道方法可以使“洗白”日志的成本变得极其高昂。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。