✨ 要点🔬 技术摘要
想象一下,你拥有一台高度精密、定制打造的机器人厨师。你花费多年时间,用你的家族秘方和庞大的计算能力对其进行训练。现在,你想将它的“大脑”(指挥机器人如何运动的软件)作为一种服务卖给其他餐厅。你不想把实际的代码(权重)交给他们,因为他们可能会偷走、复制或将其卖给你的竞争对手。相反,你让他们通过一个“黑盒”接口来使用它:他们发送一个指令,比如“做个三明治”,然后机器人返回一组电机运动序列。
问题在于,以后你如何证明某家餐厅使用的是你的机器人大脑,而不是他们自己制造的廉价仿制品?
这篇论文介绍了一种新的**水印(watermark)**机器人大脑的方法。可以把它想象成一种隐藏的、肉眼不可见的墨水,只有你能看见,但它不会改变机器人的烹饪方式。
旧方法的缺陷
以往尝试为机器人添加水印的方法有两个主要缺陷:
“后门”法(The "Backdoor" Method): 这就像是在代码中隐藏一个秘密触发器(例如,如果机器人听到某种特定的声音,它就会跳一段奇怪的舞)。但如果你有很多不同的客户,你就需要为每个客户准备不同的秘密舞蹈,这非常麻烦。此外,如果客户稍后对代码进行了微调,那段舞蹈可能会失效。
“输出噪声”法(The "Output Noise" Method): 这就像是在机器人的动作中加入一种特定的嗡嗡声或震动,只有你能听到。但这就像是在机器人身上贴了一个醒目的红牌,上面写着“我是偷来的”。聪明的窃贼可以轻易地使用滤波器滤掉这种特定的嗡嗡声,而不会影响制作三明治的功能。
新的解决方案:“秘密种子”(The "Secret Seed")
作者提出了一种名为**密钥潜在溯源验证(Keyed Latent-Provenance Verification)**的方法。这里有一个类比:
想象机器人的大脑是一位需要决定下一步该做什么的厨师。在做出决策之前,厨师会掷一次硬币(或抽取一个随机数)来增加一点点创造力或“噪声”。
诀窍在于: 你(所有者)掷的不是普通的硬币,而是一个特殊的加权硬币 。对于其他人来说,它看起来完全像普通的硬币,但它带有只有你知道的微小且隐藏的偏差。
结果是: 机器人依然能做出完美的三明治。动作看起来 100% 正常。但由于这次“掷硬币”的过程略有不同,整个运动序列都携带了一个隐藏的指纹,就像面团中独特的纹路一样。
它是如何工作的(两个阶段)
1. 注入(植入种子) 当你部署机器人时,你会将普通的随机数生成器替换为你的“密钥化”版本。
类比: 想象你正在烤面包。你使用的特殊面粉混合物在顾客看来与普通面粉完全一样,口感也一样。但你知道,这种特定的混合物会在面包芯中留下微观且独特的晶体结构。
为什么它是安全的: 因为机器人的输出(面包)看起来和吃起来都是正常的,窃贼无法简单地通过“过滤掉”这种噪声来移除水印。如果他们试图平滑处理动作以去除这个“晶体”,他们可能会破坏制作三明治的能力。
2. 验证(寻找种子) 后来,你怀疑某家餐厅正在使用你的机器人。你无法看到他们电脑内部的情况,但你可以观察机器人的动作。
挑战: 你只能看到最终的动作(面包),看不到内部的随机数(面粉)。
解决方案: 你使用一种强大的数学工具(称为 MAP 优化 )来进行逆向推导。你会问:“如果我使用这个特定的秘密密钥运行我的机器人,它是否会产生我刚才看到的这些运动?”
测试: 你尝试用你的秘密密钥去匹配观察到的动作。如果数学计算结果显示:“是的,这个密钥完美地解释了这些运动”,那么你就拥有了所有权的证据。如果你尝试使用随机密钥,数学计算会显示:“不,这与观测到的情况不符。”
论文的研究发现
作者在两种不同类型的机器人大脑(一种基于图像,一种基于预测未来)和两种不同类型的机器人身体(单臂和双臂)上测试了该方法。
效果完美: 即使机器人在执行复杂任务,他们也能在几乎 100% 的情况下检测到他们自己的“秘密面粉”。
不会破坏机器人: 添加水印并没有导致机器人掉落三明治或动作变慢。
难以去除:
如果窃贼试图平滑机器人的动作(就像滤掉某种嗡嗡声),水印依然存在。
如果窃贼试图微调机器人的代码(微调/fine-tuning),水印依然存在。
唯一的破解方法: 窃贼必须彻底抛弃你的机器人大脑,利用你的数据从头开始训练一个新的机器人(这是一个被称为“蒸馏/distillation”的过程),并寄希望于新的机器人会偶然学到相同的隐藏模式。论文显示,这非常困难;新的机器人通常会忘记这个隐藏模式,因为它不是一种可见的模式,而是一种统计学上的模式。
核心结论
这篇论文为机器人所有者提供了一套“数字 DNA”检测系统。他们只需通过观察机器人的运动,就能证明机器人属于他们,而无需看到内部的代码。这就像即便面包师试图隐藏使用了你的特殊面粉的事实,你依然能仅凭观察面包表皮就判断出那是你的作品。
技术摘要:视觉-语言-动作(VLA)与世界动作模型(WAM)的水印技术
问题陈述
视觉-语言-动作(VLA)模型和世界动作模型(WAMs)正越来越多地作为黑盒服务进行部署,其中模型权重保持私有,但策略通过 API 或本地安装包执行。这些模型代表了重要的知识产权(IP),因为其训练需要大量的专有数据和计算资源。一个关键的挑战在于,当合作伙伴或对手试图在未经所有者许可的情况下重新销售或重新部署受保护的策略时,该如何应对。
现有的机器人策略水印解决方案面临两个主要局限性:
基于后门的注水印: 这些方法需要修改模型权重以触发特定动作。它们难以扩展到多用户识别场景,并且容易被随后的微调或行为克隆(behavior cloning)所削弱。
输出扰动类水印: 这些方法将信号嵌入到动作流的探索噪声中。然而,由于信号集中在输出的一个窄频带内,攻击者可以通过应用频谱分析和窄滤波器来移除水印,且对任务性能的影响极小,从而轻易检测并消除水印。
核心问题在于设计一种能够在黑盒设置下保护所有权、支持多密钥识别、对输出侧移除攻击具有鲁棒性,且不降低任务性能的水印机制。
方法论:基于键控潜变量溯源的验证
作者提出了键控潜变量溯源验证(Keyed Latent-Provenance Verification) ,这是一种两阶段方法,将所有权证据嵌入在潜变量噪声种子(latent noise seed)而非最终的动作输出中。
1. 指纹注入
注入过程发生在模型生成动作块(action chunk)之前。
机制: 模型所有者使用“带指纹的”种子(z c f p z^{fp}_c z c f p )替换采样器抽取的标准高斯噪声种子(z c z_c z c )。
键控扰动: 带指纹的种子是原始噪声与键控参考向量(r c r_c r c )的线性组合: z c f p = 1 − β 2 z c + β r c z^{fp}_c = \sqrt{1-\beta^2} z_c + \beta r_c z c f p = 1 − β 2 z c + β r c 其中 β \beta β 控制注入强度。参考向量 r c r_c r c 是使用由秘密密钥 k ∗ k^* k ∗ 、随机数 ν e \nu_e ν e 和块索引(chunk index)生成的伪随机生成器生成的。
统计不变性: 至关重要的是,生成的 z c f p z^{fp}_c z c f p 保留了与原始噪声完全相同的高斯分布(N ( 0 , I ) N(0, I) N ( 0 , I ) )。这确保了动作流不会表现出显式的、可被攻击者轻易过滤掉的加性信号。种子与密钥之间的相关性隐藏在模型的非线性生成过程中。
选择性注入: 并非每个动作块都会被标记。通过一个键控选择器决定哪些块会被扰动,以限制任务干扰并防止对手识别出特定的“被标记”块进行针对性移除。
2. 指纹验证
验证由拥有怀疑对象机器人执行动作(可能是部分或经过后处理的)的授权所有者进行。
MAP 潜变量恢复: 由于验证者无法看到内部种子,他们必须从观察到的动作(y c y_c y c )中恢复它。作者将其表述为一个最大后验概率(MAP)优化问题。验证者寻找一个潜变量种子 z ^ \hat{z} z ^ ,使得预测的动作(由 z ^ \hat{z} z ^ 生成)与观察到的动作之间的误差最小,同时惩罚对高斯先验的偏离。这种方法避免了需要猜测未观测动作通道的问题,而这正是用于图像水印的逆向 ODE 方法中的一个失效点。
键控条件评分: 恢复的种子通过匹配滤波器(内积)与候选键控参考进行比较。
校准与聚合: 为了处理不同任务和回合(episodes)之间的差异,验证者使用一组“诱饵”密钥对怀疑对象进行评分以实现归一化(Z-score)。来自多个回合(组聚合)的证据被累加,以对所有权或在多个候选者中识别特定密钥做出最终的二元决策。
核心贡献
键控潜变量溯源验证: 一种全新的框架,通过修改潜变量噪声种子为 VLA 和 WAM 的部署提供水印,保留了高斯噪声定律,并避免了可见的输出侧信号。
黑盒验证器设计: 一个能够利用 MAP 优化从部分、经过后处理的动作指令中恢复潜变量种子的验证系统,支持二进制所有权验证和多密钥识别。
全面的评估: 在两种策略族(π 0.5 \pi0.5 π 0.5 和 LingBot-VA)和两种机器人套件(LIBERO-10 和 RoboTwin)上进行了广泛实验,评估了其在输出侧攻击(裁剪、平滑、抖动、延迟)、所有者侧变体(LoRA、剪枝、量化)以及自适应微调攻击下的鲁棒性。
实验结果
该方法在四种模型-机器人组合上进行了评估。主要发现包括:
任务性能: 注入水印对任务成功率(通常在几个百分点以内)和回合长度的影响微乎其微。
检测准确率: 在没有攻击的情况下,通过聚合 16 个回合,该方法在所有组合中均实现了完美检测(在 1% 的假阳性率下,真阳性率 TPR 为 1.00)。
对输出攻击的鲁棒性: 水印在各种输出侧移除攻击下仍保持可检测性。虽然对于 π 0.5 \pi0.5 π 0.5 /LIBERO-10 组合,激进的平滑或抖动会降低检测率,但该方法通常保持了较高的鲁棒性。作者指出,足以移除水印的攻击通常也会显著降低任务性能。
对所有者变体的鲁棒性: 指纹在 LoRA 微调、剪枝和量化后依然存在。在压缩破坏了模型骨干网络(导致任务成功率下降)的情况下,经过聚合后指纹仍可恢复。
识别能力: 系统成功地在 33 个候选者中识别出了分配给怀疑策略的具体密钥,并在聚合后实现了高 Rank-1 准确率。
安全性分析:
误密钥风险: 随机或独立的密钥通过阈值的概率极低(根据阈值不同,经验估计在 10 − 3 10^{-3} 1 0 − 3 到 10 − 9 10^{-9} 1 0 − 9 之间)。
自适应移除: 白盒攻击(即对手通过微调策略来最小化水印得分)无法在不严重降低任务性能的情况下移除指纹。
蒸馏(Distillation): 行为克隆(在教师模型的输出上训练学生模型)成功移除了水印,因为学生学习的是动作分布,而不是教师采样器的特定噪声律不变性。作者将此视为一个边界:规避成本(训练一个新模型)变得极其高昂。
意义与主张
本文声称,键控潜变量溯源验证 为保护私有的生成式机器人策略提供了一种实用且鲁棒的机制。通过将水印嵌入在潜变量种子而非输出中,该方法避免了基于频率类水印的“廉价移除”漏洞。
作者强调,其保证是经验性的操作点 而非密码学证明。该方法旨在用于授权的、事后的审计,即所有者可以获取怀疑的服务。其意义在于,即使在权重隐藏且输出受到标准部署后处理的情况下,也能使所有者检测到未经授权的策略重新部署。这项工作凸显了一种权衡:虽然水印对于输出操纵和模型编辑具有鲁棒性,但它容易受到蒸馏的影响,这意味着规避成本从简单的过滤转向了昂贵的重新训练新策略的过程。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。