✨ 要点🔬 技术摘要
想象一下,你正试图教一个超级聪明的机器人去预测未来。不是股票市场或天气的未来,而是房间的即时未来:如果机器人伸手去抓一个杯子,会发生什么?杯子会翻倒吗?还是会滑动?这就是“世界模型”(world model)的工作。把世界模型想象成机器人大脑里的一个心理电影放映机。与其通过实际抓取杯子来冒弄脏环境的风险,机器人会在内部运行一个模拟:“如果我做这个动作,视频显示杯子会倒下。”这非常有用,因为它让机器人在不破坏现实世界的情况下进行练习和规划。
但棘手之处在于:你如何告诉电影放映机该做什么动作?过去,科学家们尝试将机器人的原始计算机代码(例如“将关节3移动到角度45”)直接输入给电影制作者。问题在于,那种代码就像是针对特定机器人身体的秘密语言。它并没有向电影制作者展示机器人的样子,或者机器人在房间里的位置。这就像是在没有向导演展示演员的面孔或布景的情况下,只对导演说:“按下按钮X。”于是,电影制作者不得不同时猜测机器人的外形以及房间的反应,这工作量巨大,且经常导致混乱的画面。
这篇论文介绍了一种解决这一难题的巧妙新方法,称为“机器人因子化世界模型”(Robot-Factored World Models)。作者建议,我们不要再要求电影制作者去猜测机器人的肢体语言。相反,我们应该给电影制作者一段预先制作好的、像视频游戏角色一样渲染出来的机器人运动3D动画。他们称之为“名义轨迹”(nominal trajectory)。在机器人接触任何物体之前,计算机就会根据自身的指令,计算出机器人将会 如何运动,此时它暂时忽略房间里混乱的现实情况。然后,他们将这种计算转化为一段视觉视频,展示机器人的手臂和手部在空中漂浮的过程。
奇迹发生在我们将这个“漂浮机器人视频”与房间视频一起喂给世界模型时。模型不再需要猜测机器人的样子;它只需观察视频中机器人的运动,并学习房间中的物体如何对该特定动作做出反应。为了确保机器人知道自己是在实际接触杯子还是仅仅在上方悬停,他们还在其中加入了一张特殊的“深度图”(一种显示物体远近程度的视频)。
结果令人印象深刻。当他们在真实机器人数据上进行测试时,观看“渲染机器人视频”的模型在预测下一步会发生什么方面,比仅读取原始计算机代码的模型表现得要好得多。它对机器人形状和运动的理解如此之好,以至于即使是面对一个从未见过的不同 机器人尝试同样的动作,它也能预测出结果——只要将那个新机器人的运动也渲染成相同的视觉格式。他们甚至展示了你可以将人类移动手部的视频转化为机器人的运动,并让模型正确预测机器人将如何与物体互动。本质上,通过将机器人的动作从一串代码转变为一个清晰的视觉故事,他们教会了人工智能更清晰地理解物理世界。
技术摘要:通过机器人渲染实现机器人分解的世界模型
问题陈述 以动作驱动的视频世界模型旨在从初始状态和动作信号中预测未来的观测结果,从而在无需真实世界交互的情况下实现规划和策略改进。然而,如何向这些模型呈现机器人动作存在一个根本性的挑战。在物理机器人领域,动作通过两个截然不同的过程影响未来的观测:(1) 动作实现(Action Realization) ,即控制信号通过机器人的特定本体、控制器和运动学转化为机器人运动;(2) 场景响应(Scene Response) ,即环境通过接触和物体动力学对该运动做出反应。
现有方法直接以机器人特定的控制信号(如关节扭矩或笛卡尔位姿)为条件,迫使世界模型学习实现过程本身,而这一过程是针对特定本体且冗余的。相反,以记录的未来状态(已实现的轨迹)为条件,则会泄露模型本应预测的交互结果(接触、顺应性、延迟)。核心问题在于:如何识别一种在部署时可用、避免学习实现过程、且不会泄露未来交互结果的视觉条件信号。
方法论 作者提出了机器人分解世界模型(Robot-Factored World Models) ,将机器人特定的实现过程和渲染过程从世界模型本身中解耦。该方法引入了一个由三个主要部分组成的共享视觉接口:
标称轨迹条件化(动作实现): 系统并非输入原始控制命令或已实现的状态,而是通过机器人的控制器和运动学在无场景环境下处理动作序列 a 1 : F a_{1:F} a 1 : F ,以生成标称轨迹 q 1 : F q_{1:F} q 1 : F 。该轨迹代表了机器人在发生任何场景交互之前,在自由空间中将会 执行的运动。它作为一个部署可用的信号,在不编码接触结果的情况下,弥合了原始命令与已实现状态之间的鸿沟。
机器人渲染(视觉接口): 标称轨迹使用机器人的 URDF(统一机器人描述格式)被渲染到目标摄像机帧中。这产生了:
机器人网格 RGB (M 1 : F r g b M^{rgb}_{1:F} M 1 : F r g b ) :展示了机器人几何形状(连杆、夹持器、末端执行器)在场景中应有的外观的视频。
末端执行器深度 (D 1 : F e e f D^{eef}_{1:F} D 1 : F ee f ) :专门针对末端执行器的深度信息。 这种渲染方式将机器人的几何、运动学和外观进行了解耦,将动作纯粹以像素空间中的可见机器人几何形式呈现给世界模型。
相机感知静态上下文: 为了在不泄露未来动力学的情况下提供场景上下文,初始场景状态 S 0 S_0 S 0 沿相同的相机轨迹 C 1 : F C_{1:F} C 1 : F 进行渲染,以生成静态场景 RGB (B 1 : F r g b B^{rgb}_{1:F} B 1 : F r g b ) 和场景深度 (D 1 : F s c e n e D^{scene}_{1:F} D 1 : F sce n e )。该流提供了独立于机器人交互的外观和几何上下文。
模型架构 该世界模型被实例化为一个潜在视频扩散模型(具体使用了视频补全骨干网络)。条件输入 c c c 通过连接静态场景上下文、渲染的机器人网格、场景深度和末端执行器深度的编码潜在表示来形成。模型学习在给定这些视觉输入和文本提示 T T T (该提示描述场景上下文但不包含动作或未来结果)的情况下,预测未来视频 V 1 : F V_{1:F} V 1 : F 。训练目标是最小化潜在空间中预测速度与目标速度之间的流匹配(flow-matching)损失。
核心贡献
部署现实的接口: 作者引入了一种视觉接口,将动作实现为标称轨迹,并将其渲染为相机对齐的 URDF 网格 RGB 和末端执行器深度。这通过静态上下文流将场景外观和视角进行了分解。
深度感知: 接口通过增加末端执行器和场景深度,解决了仅靠 RGB 图像平面重叠无法区分的几何歧义(接近度、遮挡以及可能的接触)。
本体与来源泛化: 通过将动作表示为渲染的几何体而非特定于本体的控制信号,该接口将世界模型从特定的机器人控制器中解耦。这使得模型能够泛化到未见的机器人本体,并允许从重定向的人类演示中生成基于现实的机器人交互视频。
实验结果 该方法在 DROID 和 RoboCasa-GR1 数据集上进行了评估,将渲染接口与向量条件基线(以笛卡尔位姿为条件的 Ctrl-World 以及 AdaLN 状态向量基线)进行了对比。
定量性能: 在两个数据集上,渲染接口在 PSNR、SSIM 和 LPIPS 指标上均优于向量条件基线。具体而言,结合标称网格渲染和深度线索的方法取得了最佳结果(例如,在 RoboCasa-GR1 上为 24.61 PSNR,而状态向量基线为 17.67)。
定性分析: 渲染接口能更好地定位机器人运动和接触区域周围的场景变化。消融研究证实,使用标称轨迹(而非原始动作)提高了对齐度,并且添加深度线索显著帮助模型区分图像平面重叠与实际物理接触。
泛化能力: 模型成功泛化到了未见的机器人本体(例如带有 Inspire F1 手部的 xArm 6),只需将新的几何形状渲染进相同的接口即可。此外,它成功地从重定向的人类手部运动中生成了机器人操作视频,证明了该接口对运动来源是不可知的。
意义与主张 论文声称,通过将动作实现和机器人渲染进行分解,世界模型得以从学习特定于本体的控制动力学中解放出来,可以完全专注于预测场景如何响应可见的机器人几何体。这种方法解决了动作实现学习与未来状态泄露之间的权衡。作者断言,这种“机器人分解”的方法提供了一个跨不同视角和机器人本体的一致视觉接口,从而能够实现更鲁棒的规划,并能从包括人类演示在内的多样化运动源中生成有据可依的交互视频。
局限性 作者承认该方法需要已知的机器人 URDF 和相机与机器人之间的标定。此外,静态上下文流假设场景是静态的,这在模拟中是完全可用的,但在现实世界中如果没有前馈 3D 重建,则只能部分观测。最后,训练数据(DROID)主要以成功操作为主,这意味着模型对于抓取失败或滑动等情况的接触暴露有限,这可能会影响其在这些特定场景下的鲁棒性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。