Masked Visual Actions for Unified World Modeling
本文介绍了掩码视觉动作(Masked Visual Actions),这是一种统一的像素空间控制接口,它利用视频模型,通过将动作表示为视觉场景内实体部分揭示的轨迹,来执行机器人操控中的前向动力学预测和逆向规划。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人完成一项新任务,比如做三明治或打开冰箱。在过去,科学家们必须使用机器人的语言,那通常是一串令人困惑的数字,告诉它的关节如何移动。这就像是只能通过向演员发送坐标表来指导一部电影。但最近,一种新型的“超级观察者”出现了:视频模型。这些 AI 系统在数百万小时的视频上进行了训练,因此它们拥有一种惊人的、近乎魔幻的直觉,了解世界是如何运作的。它们知道如果你推一下杯子,它会滑动;如果你掉下一个鸡蛋,它会破碎;如果你挥动手臂,空气会移动。它们对我们视觉世界的物理规律理解得比几乎任何其他工具都要深刻。研究人员一直在问的一个大问题是:我们能否利用这个“超级观察者”不仅是观察世界,而且是控制世界?我们能否用图像而不是数字与它对话,让它想象未来并告诉我们该怎么做?
这正是论文《用于统一世界建模的掩码视觉动作》(Masked Visual Actions for Unified World Modeling)所探讨的内容。研究人员——来自斯坦福大学和哈佛大学等顶尖大学的一个团队——开发了一种巧妙的方法,通过一种被称为“掩码视觉动作”(Masked Visual Actions)的方法来与这些视频模型进行对话。你可以把它想象成一场“填空游戏”或一副扑克牌的魔术。通常,当你想要视频模型展示接下来的画面时,你会给它一张起始图片并问:“接下来会发生什么?”但在这里,研究人员给了模型一个特殊的指令:“这是起始图片,这里有一个机器人手臂移动的、半透明的幽灵轮廓。现在,请你补全剩下的场景。”
这种魔力之所以发生,是因为该模型非常擅长理解事物之间的相互作用,以至于它可以利用同一个大脑扮演两种不同的角色。首先,它充当一个前向模型(Forward Model)。如果你向它展示机器人的移动,它会精确地预测世界的其余部分将如何反应。这就像向导演展示一个特技演员跳跃的动态分镜,AI 会立即生成汽车撞击发生的视频,因为特技演员撞到了车。这使得机器人在实际行动之前能够“想象”未来,从而帮助它们规划动作,而不损坏现实世界的物体。
其次,或许更令人惊讶的是,它可以作为一个逆向模型(Inverse Model)。这是相反的魔术技巧。与其展示机器人的移动,不如向模型展示你想要的结果——比如一个杯子在桌子上滑动到特定位置。你告诉 AI,“我希望杯子最终停在这里,”然后模型就会计算出实现这一目标所需的机器人动作。这就像问一位厨师,“我想要一份完美的牛排,”即使这位厨师从未做过那块特定的牛排,他也会立即写下实现目标的精确食谱和烹饪步骤。
该团队使用了一个惊人之少的样本量来测试这个想法——仅使用了来自真实机器人和计算机模拟的 15 小时视频片段。他们拿取了一个大规模预训练的视频模型,并对其进行了快速的“微调”(一个被称为 LoRA 微调的过程),以学习这种新的沟通方式。结果令人印象深刻。在测试中,该模型能够以极高的准确度预测机器人如何与厨房中的物体互动。它在“想象”未来方面表现得如此出色,以至于当他们使用它来规划机器人动作时,成功率显著提高,有时比单纯靠猜测高出了 26%。
他们发现的最令人兴奋的部分之一是,该方法在它从未见过的机器人身上同样有效。大多数机器人控制器就像定制的钥匙;它们只适配一种特定的锁(一种特定的机器人)。如果你改变了机器人的形状或大小,控制器就会失效。但由于这种新方法使用的是“图像”而非“数字”进行交流,它就像一把万能钥匙。当他们在一个完全不同的机器人(一个名为 R1-Pro 的双臂机器人)上进行测试时(该机器人在其训练数据中并不存在),模型并没有感到困惑或产生幻觉。它优雅地想出了如何移动这个新机器人去打开冰箱或关闭微波炉,而其他方法在面对这种情况时会完全失败。
研究人员还展示了这种“想象”是可靠的。当他们要求模型预测机器人堆叠积木或打开抽屉的结果时,“想象”的成功率与现实世界的成功率几乎完美匹配(相关性高达 0.982)。这意味着该模型是一个值得信赖的模拟器。它可以在机器人甚至还没动一下肌肉之前,就用来评估机器人的计划是否可行,从而节省时间并防止碰撞。
简而言之,这篇论文表明了一种弥合人类直觉与机器人行动之间鸿沟的新方法。通过将机器人运动视为 AI 可以解决的视觉谜题,研究人员创建了一个灵活、高效且对物理世界理解得惊人出色的系统。这不仅仅是关于让机器人移动,更是关于赋予它们一种“梦见”自身行为后果的方式,帮助它们学得更快、更安全。虽然该模型并不完美,并且仍然依赖于其所构建的视频模型的局限性,但它为这样一个未来开启了大门:机器人可以从观看视频和在脑海中规划中学习,就像我们一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。