TRAP: Tail-aware Ranking Attack for World-Model Planning
本文介绍了 TRAP,这是一种新颖的后门攻击框架,它利用世界模型中想象轨迹的长尾排序结构,通过破坏决策关键路径的相对顺序来劫持长视野规划,从而在避开干净输入检测的同时引发持续的行为偏差。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人玩电子游戏或驾驶汽车。这个机器人并非仅仅对“当下”所见做出反应,而是使用一种“世界模型”。你可以将这个世界模型想象成一个白日梦引擎。在做出动作之前,它会闭上眼睛,为接下来的几分钟构想数百种不同的“如果……会怎样”的情景。它会自问:“如果我向左走,会发生什么?如果我向右走,会发生什么?”
随后,它会对这些白日梦进行评分。得分最高(例如获得最多分数或避免碰撞)的那些情景,就是它选择遵循的路径。
问题:白日梦中的隐秘诡计
本文的研究人员发现了一种黑客攻击这类“白日梦”机器人的新方法。他们将这种方法称为TRAP。
通常,黑客试图通过扰乱机器人的即时视觉来欺骗它(例如在停车标志上贴一张贴纸,让机器人误以为那是限速标志)。但作者发现,对于这类“白日梦”机器人而言,仅仅扰乱一秒钟的视觉是不够的。机器人的白日梦引擎非常擅长平滑处理,因此会忽略微小的故障。
真正的弱点:
研究人员意识到,机器人并不在乎每一个白日梦的确切分数。它只关心排名靠前的那少数几个。
- 想象机器人构想了 100 条路径。
- 其中 90 条都很糟糕(低分)。
- 10 条尚可。
- 2 条极其出色(分布的“尾部”)。
机器人几乎总是会选择那两条最出色的路径之一。其余的 98 条其实无关紧要。
攻击:TRAP(尾部感知排序攻击)
TRAP 攻击就像一位魔术师,他并不试图让所有的牌都消失,而是专门交换牌堆中的前两张牌。
- 触发器:黑客在机器人的摄像头视野中放置一个极小、几乎不可见的补丁(例如一个小贴纸或特定的像素图案)。
- 白日梦偏移:当机器人看到这个补丁时,它开始启动白日梦过程。由于这个补丁的存在,它通常选择的“出色”路径在其想象中突然显得略微糟糕;与此同时,一条原本糟糕的路径(“坏”路径)突然显得略微更好。
- 劫持:机器人内部的排序系统发生翻转。“坏”路径现在排名升至第 1 位,而“好”路径则跌至第 5 位。机器人信任它的白日梦,于是选择了那条坏路径。
TRAP 的工作原理(“秘密配方”)
论文指出,之前的攻击之所以失败,是因为它们试图同时降低所有内容的分数。TRAP 则更加聪明:
- 尾部感知:它只关注“尾部”——即那些真正决定机器人行动的一小群高分白日梦。它忽略了机器人无论如何都不会选择的 90% 的白日梦。
- 双重门控:想象你试图推动一块巨石。如果你用力过猛且方向错误,你可能会滑倒。TRAP 使用两个“门控”(安全检查),确保它只朝着正确的方向推动排序,而不会用力过猛导致机器人的大脑完全混乱并停止工作。这使得攻击既隐蔽又稳定。
结果
研究人员在两个著名的“白日梦”机器人(称为 DreamerV3 和 TD-MPC2)上测试了这种方法,让它们玩各种游戏并执行控制任务(例如控制虚拟猎豹奔跑或控制人形机器人行走)。
- 正常行为:当机器人没有看到触发器时,它表现得完全正常。它是一个“特洛伊木马”,在激活前看起来是无害的。
- 遭受攻击时:一旦微小的触发器出现,机器人的性能就会崩溃。在许多情况下,它从赢得比赛变成了彻底失败。
- 隐蔽性:即使机器人非常擅长忽略微小的视觉错误,该攻击依然有效。因为 TRAP 针对的是最佳想法的排序,而不仅仅是模糊图像,所以机器人自身的逻辑会被诱骗做出错误的选择。
为什么这很重要
论文总结道,随着我们构建更智能、更自主的代理,它们通过想象未来来进行规划,我们需要关注这种特定的脆弱性。仅仅因为一个机器人在“白日梦”方面很聪明,并不意味着它就是安全的;如果你能微妙地重新排列它最佳白日梦的顺序,你就能劫持它的整个未来。
简而言之:TRAP 并没有破坏机器人的眼睛;它重新排列了机器人的白日梦,使得它所想象的“最佳”未来实际上是一场灾难。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。