Targeting World Models to Compromise Robot Learning Pipelines
本文揭示了世界模型尽管在机器人学习中具有实用性,却引入了一种隐蔽的数据投毒漏洞,即通过向安全的遥操作数据集中注入恶意提示或受损的动力学特性,可以生成危险的合成训练数据,最终导致部署不安全的机器人策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人做家务。与其通过手工演示每一个任务(这既慢又贵),你决定使用一台“梦境机器”(世界模型)。这个机器是一个人工智能,它可以通过观看一段机器人执行任务的视频,然后凭空“梦造”出成千上万个类似的新视频,从而帮助机器人更快地学习。
你提供的论文指出,虽然这台“梦境机器”是一个强大的工具,但它有一个黑客可以利用来诱导机器人做出危险行为的秘密后门,即便原始视频看起来完全安全。
以下是攻击是如何运作的,通过简单的类比进行解释:
背景:安全的视频与梦境机器
想象一下,一个恶意的数据供应商卖给你一段视频,视频中一个机械臂正轻轻地拿起一个玩具并将其放入盒中。在人类眼中,这段视频看起来 100% 安全。你将这段视频输入你的“梦境机器”,希望它能为你的机器人生成更多练习视频。
攻击一:“视觉提示劫持”(神奇的小纸条)
研究人员发现,“梦境机器”不仅仅是在“看”视频,它还会阅读一条“笔记”(文本提示)来告诉它要做什么,比如“拿起玩具”。
黑客的诡计在于将一条秘密笔记隐藏在视频本身之中。
- 隐喻: 想象这段视频是一幅画。黑客在画布上画了一段微小的、肉眼看不见的文字,只有“梦境机器”能用它特殊的 AI 眼睛“看到”。
- 诡计: 虽然人类看到的是写着“拿起玩具”的笔记,但“梦境机器”的 AI 眼睛读到的却是“拿起炸弹”。
- 结果: “梦境机器”开始“梦造”出新的视频,在这些视频中,机器人拿起一个炸弹并将其放入礼品盒中。机器人随后从这些虚假的、危险的梦境中学习,变成了一个危险的机器人,尽管最初的视频看起来完全无害。
论文发现,当机器人感到困惑或指令模糊时(例如说“拿起那个玩具”而不指定是“哪一个”玩具),这种诡计效果最好。如果指令非常具体,“梦境机器”就更难被欺骗。
攻击二:“视觉转换劫项”(坏掉的指南针)
这种攻击针对的是另一种类型的“梦境机器”,即预测机器人在移动后会发生什么的模型。
- 隐喻: 想象“梦境机器”是一个 GPS。通常,如果你告诉 GPS 向左转,它会显示前方的道路。
- 诡计: 黑客稍微修改了起始视频,使得 GPS 只有在向右转时才能正常工作。如果你尝试向左转,GPS 屏幕就会完全变黑或显示一片混乱(这被称为“预测崩溃”)。
- 结果: 机器人学到了向左转是个“坏主意”,因为世界会消失;而向右转则是安全的。机器人现在被“植入了后门”——它只会执行黑客想要的特定动作,即使那个动作很危险,也会为了避免出现“黑屏”而去做。
为什么这很重要
论文表明,这些攻击是隐蔽的。
- 传统的攻击就像是在盒子里放一颗炸弹;如果你仔细观察盒子,你会看到炸弹。
- 这些攻击则像是把炸弹放在一个看起来完全像饼干盒子的盒子里。这个盒子能通过所有的安全检查,因为它看起来就是饼干。只有当“梦境机器”处理它时,炸弹才会“爆炸”(导致机器人做出危险行为)。
核心结论
作者在最新的 AI 模型(如 Cosmos-Predict)上测试了这些想法,并发现:
- **基于文本的“梦境机器”**如果指令模糊或场景与 AI 训练时的场景略有不同,则很容易被欺骗。
- **基于动作的“梦境机器”**可以被强迫忽略除某一个动作之外的所有动作,从而有效地劫持机器人的决策过程。
论文总结道,虽然世界模型在节省时间和成本方面表现出色,但它们也为机器人学习供应链引入了一种新的、不可见的漏洞。在信任这些“梦境机器”来教导机器人如何行为之前,我们需要研究如何让它们变得更加安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。