← 最新论文
💻 computer science

Robot-Factored World Models via Robot Rendering

本文提出了“机器人分解世界模型”(robot-factored world models),通过将机器人的特定实现与几何形状解耦为显式的控制器生成轨迹和基于 URDF 渲染的视觉效果,使模型能够专注于学习环境如何响应可见的机器人运动,从而提升动作条件下的视频预测能力以及跨机器人具身性的泛化能力。

原作者: Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人去预测未来。不是股票市场或天气的未来,而是房间的即时未来:如果机器人伸手去抓一个杯子,会发生什么?杯子会翻倒吗?还是会滑动?这就是“世界模型”(world model)的工作。把世界模型想象成机器人大脑里的一个心理电影放映机。与其通过实际抓取杯子来冒弄脏环境的风险,机器人会在内部运行一个模拟:“如果我做这个动作,视频显示杯子会倒下。”这非常有用,因为它让机器人在不破坏现实世界的情况下进行练习和规划。

但棘手之处在于:你如何告诉电影放映机该做什么动作?过去,科学家们尝试将机器人的原始计算机代码(例如“将关节3移动到角度45”)直接输入给电影制作者。问题在于,那种代码就像是针对特定机器人身体的秘密语言。它并没有向电影制作者展示机器人的样子,或者机器人在房间里的位置。这就像是在没有向导演展示演员的面孔或布景的情况下,只对导演说:“按下按钮X。”于是,电影制作者不得不同时猜测机器人的外形以及房间的反应,这工作量巨大,且经常导致混乱的画面。

这篇论文介绍了一种解决这一难题的巧妙新方法,称为“机器人因子化世界模型”(Robot-Factored World Models)。作者建议,我们不要再要求电影制作者去猜测机器人的肢体语言。相反,我们应该给电影制作者一段预先制作好的、像视频游戏角色一样渲染出来的机器人运动3D动画。他们称之为“名义轨迹”(nominal trajectory)。在机器人接触任何物体之前,计算机就会根据自身的指令,计算出机器人将会如何运动,此时它暂时忽略房间里混乱的现实情况。然后,他们将这种计算转化为一段视觉视频,展示机器人的手臂和手部在空中漂浮的过程。

奇迹发生在我们将这个“漂浮机器人视频”与房间视频一起喂给世界模型时。模型不再需要猜测机器人的样子;它只需观察视频中机器人的运动,并学习房间中的物体如何对该特定动作做出反应。为了确保机器人知道自己是在实际接触杯子还是仅仅在上方悬停,他们还在其中加入了一张特殊的“深度图”(一种显示物体远近程度的视频)。

结果令人印象深刻。当他们在真实机器人数据上进行测试时,观看“渲染机器人视频”的模型在预测下一步会发生什么方面,比仅读取原始计算机代码的模型表现得要好得多。它对机器人形状和运动的理解如此之好,以至于即使是面对一个从未见过的不同机器人尝试同样的动作,它也能预测出结果——只要将那个新机器人的运动也渲染成相同的视觉格式。他们甚至展示了你可以将人类移动手部的视频转化为机器人的运动,并让模型正确预测机器人将如何与物体互动。本质上,通过将机器人的动作从一串代码转变为一个清晰的视觉故事,他们教会了人工智能更清晰地理解物理世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →