← 最新论文
💻 computer science

μ0\mu_0: A Scalable 3D Interaction-Trace World Model

本文介绍了 μ0\mu_0,这是一个可扩展的 3D 世界模型,它通过预测交互点的平滑轨迹而非稠密像素或特定动作,利用一种新颖的“TraceExtract”系统从多样化的视频源中自动生成 3D 监督,从而实现与具体具身形态无关的机器人学习。

原作者: Seungjae Lee, Yoonkyo Jung, Jusuk Lee, Jonghun Shin, Amir Hossein Shahidzadeh, Yao-Chih Lee, H. Jin Kim, Jia-Bin Huang, Furong Huang

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Seungjae Lee, Yoonkyo Jung, Jusuk Lee, Jonghun Shin, Amir Hossein Shahidzadeh, Yao-Chih Lee, H. Jin Kim, Jia-Bin Huang, Furong Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个机器人如何烹饪、清洁或建造物品。通常,你会面临两个糟糕的选择:

  1. “像素”法(The "Pixel" Method): 你向机器人展示成千上万个视频,并要求它精确预测屏幕上的每一个像素在下一秒会是什么样子。这就像是要求一名学生为了学习如何开门,而去死记硬背墙上每一块砖的颜色。这会在无关紧要的背景细节(比如地板的颜色)上浪费大量的脑力,而这些细节对机器人的移动毫无帮助。

  2. “动作”法(The "Action" Method): 你记录下一个人类完成任务的过程,然后告诉机器人:“将你的左臂向前移动3英寸,然后挤压。”问题在于,这种方法只适用于那个特定的机器人手臂。如果换成一个形状不同的机器人,这些指令就失效了。你必须从头开始重新录制所有内容。

于是,出现了 µ0(读作 "mu-zero"): 这是一种位于两者之间的新型机器人教学方式。它不再关注像素,也不再死记硬背特定的手臂动作,而是学习预测 3D“交互轨迹”(interaction traces)

核心理念:“幽灵路径”(The "Ghost Path")

想象一个机器人试图拿起一个杯子。µ0 不去思考整个杯子或整个房间,而是专注于那些至关重要的特定“幽灵点”:

  • 夹持器的尖端。
  • 杯子的把手。
  • 手接触桌面的位置。

µ0 预测的是这些特定点在未来会遵循的平滑 3D 路径。这就像是在空中画出一条发光的、无形的线,清晰地展示出杯子应该移动到哪里。这条路径是与具体形态无关的(embodiment-agnostic),这意味着它不在乎机器人是一个巨大的工业机械臂、一个小型的轮式机器人,还是人类的手。如果“幽灵路径”说“把杯子移到这里”,任何机器人都能通过理解这条线,来计算出如何移动其独特的身体去跟随这条线。

他们是如何教学的:“轨迹提取”工厂(The "TraceExtract" Factory)

为了教导 µ0,研究人员构建了一个名为 TraceExtract 的数据引擎。想象一位电影剪辑师,他观看成千上万个杂乱的视频(来自人类、机器人和不同的摄像机),并自动完成三件事:

  1. 挑选主角: 它利用 AI 视觉忽略背景,找到这场戏的“主角”(杯子、工具、手)。
  2. 绘制线条: 它将这些点提升到 3D 空间中,即使摄像机在晃动或移动,也能创建一个一致的 3D 路径。
  3. 编写剧本: 它将视频分解为小的“事件”(如“抓取杯子”或“倒水”),并为每个动作编写一段简短的说明。

这把杂乱且未标注的视频转化成了一本整洁的教科书,上面写着:“这里有一个点,以及为了实现这个目标,它应该遵循的 3D 路径。”

两步学习法

µ0 的工作分为两个阶段,就像一位总建筑师和一支施工队:

  1. 建筑师(µ0): 首先,µ0 仅在视频上进行训练。它学习成为一个“世界模型”。它观察一张图片和一句话(例如,“拿起橙色的杯子”),然后预测关键点的未来 3D 路径。它从不接触机器人的电机指令;它仅仅是在学习物体运动的物理规律。一旦训练完成,这个部分就是“冻结”的——它是一个可重复使用的专家,永远不会改变。
  2. 施工队(动作专家/Action Expert): 当你想使用某个特定的机器人时,你会取出这个冻结的 µ0,并在其之上连接一个小型的新型“动作专家”。这个新部分会观察 µ0 预测的 3D 路径,并思考:“好吧,鉴于我特定的手臂形状,我需要执行哪些电机指令才能遵循这条路径?”

为什么这意义重大

论文声称 µ0 是一个游戏规则的改变者,因为它:

  • 具有可扩展性: 你可以利用互联网上的任何视频进行训练,而不局限于昂贵的机器人记录数据。
  • 高效: 它忽略了无聊的背景,只专注于真正移动的部分。
  • 表现更好: 在测试中,使用 µ0 “幽灵路径”的机器人表现得与使用大量特定机器人动作数据进行训练的机器人一样好(有时甚至更好)。
  • 可复用性: 你可以只训练一次 µ0,然后将其插入到你制造的任何新机器人中,而无需重新训练整个系统。

简而言之,µ0 教会机器人的是运动的概念(3D 路径),而不是运动的机制(具体的肌肉指令),这使得它们能够从互联网上丰富的各类人类视频中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →