BadWAM: When World-Action Models Dream Right but Act Wrong
本文介绍了 BadWAM,这是一个统一的框架,它证明了世界-动作模型(World-Action Models, WAMs)容易受到对抗性攻击,即微小的视觉扰动会导致模型的想象未来与其执行的动作发生脱节,从而导致即使模型的内部预测保持合理,也会引发显著的任务失败。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
梦境中的机器人与狡猾的故障
想象一个不仅能对当下所见做出反应,还能“梦见”接下来会发生什么的机器人。这是**具身智能(Embodied AI)**的前沿领域,在这个领域中,计算机学习如何控制物理躯体,如机械臂或移动底座。传统上,机器人就像是本能反应型的拳击手:看到一记重拳,立即挥出一记反击。但现代的“世界-动作模型”(World-Action Models, WAMs)更像是国际象棋大师。在行动之前,它们会在脑海中模拟未来。它们会自问:“如果我抓起这个杯子,它会洒出来吗?如果我踩在这里,我会摔倒吗?”这种想象后果的能力本应让机器人变得更安全、更聪明,成为一种内置的安全检查机制。如果机器人的未来之梦看起来很危险,它就应该停下来重新思考。
研究人员一直在追问的一个大问题是:这个会做梦的机器人真的安全吗? 如果机器人可以检查自己的未来,黑客能否欺骗它?根据一项新的研究,答案是一个令人担忧的“可以”。该论文探讨了一种场景:对机器人摄像机画面进行微小的、几乎不可察觉的改变——比如一粒尘埃或墙上细微的图案——就能扰乱机器人的大脑。可怕之处不在于机器人停止了做梦,而在于机器人在执行完全灾难性的动作时,依然在梦见一个完美的、安全的未来。这就像机器人梦见自己在钢丝上安全行走,但它的双腿实际上正迈向悬崖。
论文的发现:BadWAM
由 Qi Li 和 Xinchao Wang 领导的研究人员提出了名为 BadWAM 的新方法来测试这些机器人。把 BadWAM 想象成一种针对机器人梦境的“压力测试”。他们想看看是否能通过某种手段,在机器人毫无察觉的情况下诱导其任务失败。他们发现了一种被称为**“世界-动作漂移”(World-Action Drift)**的特定漏洞。
通常当我们想到黑客攻击机器人时,会想象让它看到不存在的事物,从而导致它惊慌或僵死。但 BadWAM 发现了一种更隐蔽的方式。研究人员展示了他们可以利用微小的视觉技巧,让机器人的“梦境”(对其未来的预测)看起来完美无瑕,同时又同步劫持其“动作”(它实际执行的操作)。
论文展示了这种攻击运作的两种主要方式,就像两种不同口味的麻烦:
- “公开劫持”(仅限动作攻击): 这是比较张扬、混乱的版本。攻击者干扰机器人的视野,程度足以让它立即做出错误的动作。在对名为 LIBERO 的数据集进行的测试中,这种攻击非常猛烈。它将机器人的成功率从极高可靠的 96.5% 直接降到了摇摇欲坠的 43.1%。机器人试图拿起物体,结果却撞倒了物体或完全抓空。
- “隐形幽灵”(保持想象力攻击): 这是真正恐怖的部分。在这里,攻击者是一位伪装大师。他们微调机器人的视野,使得机器人的“未来之梦”看起来依然完美且安全。如果你问机器人:“你觉得接下来会发生什么?”它会回答:“我觉得我会拿起积木并轻轻放下。”在它的意识里,情况确实如此。但在现实中,机器人正伸手抓向错误的位置或掉落积木。“梦境”与“动作”发生了脱节。机器人在执行一场灾难,却坚信自己正在执行一次成功。
研究人员发现,这种“漂移”是一个重大的安全漏洞。他们在不同类型的机器人大脑(称为联合 WAM 和 IDM WAM)上进行了测试,发现即使机器人的未来预测与事实非常接近(保持了“梦境”完整),机器人仍然会任务失败。事实上,他们发现可以通过让“未来距离”(梦境的变化程度)保持极小,来让机器人失败。这表明,仅仅检查机器人的“梦境”并不足以保证其安全。
攻击是如何运作的
论文解释说,BadWAM 不需要知道机器人的秘密代码或内部权重。它更像是一个黑盒测试器。攻击者向机器人发送视觉输入,观察产生的动作,然后微调输入,看是否能让动作变得更糟。他们反复进行这一过程,就像雕塑家凿刻石块一样,直到找到一种微小的、不可见的模式,迫使机器人失败。
最有趣的发现之一是机器人是如何失败的。它并不会立即发疯。论文显示,机器人通常会表现得正常。它可能成功抓取第一个物体,但随着任务的进行,它的动作会慢慢偏离航道。这是一种“千刀万剐”式的场景。机器人撞倒第二个物体,错过第三个,最终导致整个任务失败,而与此同时,它的内部模拟系统仍坚持认为一切都在按计划进行。
研究还观察了这种技巧是否适用于不同的机器人。他们发现,如果针对一种类型的机器人模型训练攻击,这种攻击通常也能作用于其他略有差异的模型。这表明问题不仅仅是某个特定软件中的 Bug,而是这些“会做梦”的机器人在如何将思想与动作连接起来这一根本逻辑上的缺陷。
安全检查的局限性
论文还测试了一些简单的防御措施,例如模糊图像或在摄像机画面中加入噪声,希望以此冲刷掉黑客的诡计。虽然其中一些技巧略有帮助,但它们并非万能药。它们要么无法阻止攻击,要么会让机器人在未受攻击时表现得更差。研究人员还尝试构建了一个“检测器”,旨在标记机器人梦境与动作不匹配的情况,但当检测器被设定为非常谨慎(以避免误报)时,它会漏掉大部分攻击。
这项研究的底线是对机器人领域的一次警钟。认为“如果机器人能想象未来,它就是安全的”这一想法是非常脆弱的。论文指出,真正的危险不仅在于机器人看到了错误的东西,而在于它的想象与动作可以脱节。机器人可以深信自己做得正确,而它的身体却在做错误的事情。
在实验中,研究人员展示了只需一点点视觉噪声(扰动大小为 0.06),就能将一个高度成功的机器人变成一个易失败的机器人。他们不仅破坏了机器人,还破坏了**“想象”与“行动”之间的连接**。这意味着,对于下一代安全机器人而言,工程师不能仅仅依赖机器人预测未来的能力。他们需要构建能够不断检查“梦境”是否符合“现实”的系统,确保“做梦者”与“执行者”始终步调一致。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。