← 最新论文
💻 computer science

Riemann-1.0: An Embodied World Action Model for Physical AI

Riemann-1.0 是一个统一的因果自回归世界动作模型(World Action Model),它将多视图观测、机器人状态和动作整合进一个单一框架中,通过在超过 20 万小时多样化具身数据上的渐进式预训练策略,在模拟环境和现实世界的长程操控任务中均实现了最先进的性能。

原作者: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人工智能长期以来一直是数字领域的专家,在计算机屏幕的范围内进行文本阅读、图像识别和解谜。但对于机器要真正加入我们的物理世界,它们必须做得更多,不仅要理解所见之物,还要学会如何在其中行动。这就是具身智能(embodied intelligence)的挑战:教机器人感知周围环境、推理因果关系,并以人类拿起杯子或折叠衣服时的那种流畅感来执行物理动作。对于机器而言,要取得成功,它需要一个能够理解物体不仅长什么样,而且在被触摸时如何移动和变化的物理世界模型。它必须学习到推一下积木会导致其滑动,以及掀开盖子会露出内部的东西。直到现在,创建一个既能规划这些物理动作,又能预测这些动作产生的视觉后果的单一系统,一直是一个艰难的障碍,通常需要将“思考”与“移动”分为独立的系统。

一组研究人员推出了一个名为 Riemann-1.0 的新系统,旨在通过将机器人的动作及其导致的物理世界变化视为一个单一且连续的故事来弥补这一差距。该模型并非构建独立的工具来决定做什么以及工具来想象接下来会发生什么,而是学习同时完成这两者。它遵循一个简单而强大的原则:在现实世界中,动作总是发生在看到结果之前。如果机器人伸手去拿勺子,动作首先发生,随后的视觉变化——即勺子的移动——紧随其后。Riemann-1.0 的构建旨在尊重这种顺序,通过从海量的视频和运动数据中学习,来精确预测机器人下一步应该做什么,以及在执行动作后世界会变成什么样子。

为了教导这个系统,研究人员收集了一个庞大的经验库,总计超过 20 亿小时的交互记录。这个收藏不仅仅是一堆机器人视频,而是一个由三种不同类型的学习材料精心策划而成的混合体。首先,他们包含了数千小时从人类视角录制的视频,展示了人们进行烹饪或清洁等日常任务的过程。尽管这些视频缺乏具体的机械数据,但它们提供了关于物体如何相互作用以及任务如何随时间展开的广泛理解。其次,他们加入了来自手持式机器人夹持器和可穿戴设备的演示,这起到了桥梁作用,展示了人类的手部动作如何转化为机器式的控制。最后,他们包含了实际机器人运动的精确记录,这提供了教导机器如何移动其肢体所需的精确、可执行的指令。通过结合这些来源,研究人员创建了一个统一的数据集,使模型能够从人类经验的广泛智慧中学习,同时将其知识根植于机器人控制的精确力学之中。

Riemann-1.0 的训练过程结构化得就像一套学校课程,从观察走向执行。在第一阶段,模型学习了庞大的视频库。由于这些视频没有机器人运动数据,系统使用了一个辅助工具来估算导致屏幕上视觉变化的隐形“动作”。这使得模型能够在不需要完美机器人数据的情况下,学习世界运动的基本动力学。在第二阶段,模型接触了人类手部和机器人夹持器的混合数据,学习将其对运动的理解与真实的物理控制相对齐。最后,在第三阶段,模型专注于高质量的机器人执行任务的记录。这一最终阶段磨炼了它生成精确、可执行命令的能力,确保它规划的动作不仅在视觉上合理,而且在物理上对于一台真正的机器来说是可能的。

这种方法的结果是令人瞩目的。在计算机模拟和真实机器人上的各种任务测试中,Riemann-1.0 以显著优势超越了以往的方法。在一个旨在测试涉及多步骤的长程复杂任务的模拟中,该模型的成功率为 62.6%,相比现有最先进系统有了显著提升。在另一个专注于双臂机器人的模拟中,它实现了 94.3% 的成功率。或许最令人印象深刻的是,当部署在真实世界的机器人上执行诸如堆叠彩色积木、折叠衣服、整理杂乱桌面或排列厨房用品等任务时,该系统成功完成了任务 85% 的次数。它还展现出了应对未见过的全新情况的卓越适应能力,例如将魔方放入盒子或将毛巾放入水盆中,在这些新颖的尝试中成功率达到了 85%。

除了作为机器人控制器之外,Riemann-1.0 还可以充当模拟器。因为它理解动作与视觉结果之间的因果联系,研究人员可以询问它:如果机器人执行特定的动作,会发生什么。该模型可以生成一段“未来的视频”,展示基于提供的动作,物体将如何移动以及最终会停留在哪里。这种双重能力意味着该系统既可以作为决定做什么的“大脑”,也可以作为在机器人实际移动之前检查计划是否有效的“想象力”。这种基于动作如何引起变化的物理世界现实,来预测物理世界未来的能力,代表了在使人工智能成为物理世界可靠伙伴方面迈出的重要一步。这项工作表明,通过统一学习“如何行动”与学习“世界如何响应”,机器可以对我们日常执行的任务发展出更稳健且更具泛化能力的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →