← 最新论文
🤖 AI

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

DreamDojo 是一个基于 44,000 小时第一视角人类视频训练的基础世界模型,它通过连续潜动作学习多样化的灵巧交互,从而为开放世界、富接触环境下的通用机器人实现实时模拟、精确的动作控制能力以及有效的策略规划。

原作者: Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie
发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie, Ruijie Zheng, Dantong Niu, You Liang Tan, K. R. Zentner, George Kurian, Suneel Indupuru, Pooya Jannaty, Jinwei Gu, Jun Zhang, Jitendra Malik, Pieter Abbeel, Ming-Yu Liu, Yuke Zhu, Joel Jang, Linxi "Jim" Fan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要教一个机器人学会人类能做的一切:烹饪、清洁、修理物品以及玩玩具。问题在于,机器人非常昂贵,容易损坏,而且我们没有足够的机器人视频时长来教授它们所有的技能。

DreamDojo 是一个全新的机器人“大脑”,它通过学习人类视频(而不是机器人视频)来解决这个问题。你可以把它想象成一个通过在 YouTube 和 TikTok 上观看数百万小时人类日常活动视频来学习的机器人,而不是需要机器人亲自去完成每一项任务。

以下是它的工作原理,分为几个简单的概念:

1. 海量图书馆(数据)

通常,机器人的训练数据就像一个只有几本关于“如何拿起红色方块”书籍的小型图书馆。而 DreamDojo 的图书馆是一个海量的、无限的图书馆,包含了 44,000 小时 的人类视频。

  • 规模: 这就像是将一本笔记本与整个美国国会图书馆进行对比。
  • 多样性: 它涵盖了从厨房烹饪到车库修车的一切内容,涉及数千种不同的物体和技能。
  • 秘诀所在: 由于这些视频并没有附带“机器人指令”,团队发明了一种特殊的翻译器,叫做潜动作(Latent Actions)。想象一下你在看一段打开罐子的视频。尽管机器人无法看到精确的肌肉运动,但这个翻译器可以仅通过观察手部和罐子的移动方式,就推断出“旋转并拉动”的意图物理特性。它将视频转化成了一本任何机器人都能理解的通用说明书。

2. 模拟器(世界模型)

一旦机器人的大脑从这些视频中学到了知识,它就会变成一个世界模型(World Model)

  • 类比: 把世界模型想象成飞行员的飞行模拟器。在飞行员驾驶真正的飞机之前,他们会在模拟器中进行练习。如果在模拟器中犯了错,也不会有人受伤。
  • DreamDojo 的工作方式: 你可以告诉 DreamDojo,“想象机器人伸手去拿杯子,但没抓稳。”然后模型会生成一段接下来会发生什么的视频。它理解物理规律:如果你推一下杯子,它会滑动;如果你推得太重,它会从桌子上掉下来。它甚至能针对它从未见过的物体或环境,瞬间模拟出这些结果。

3. 速度提升(蒸馏)

原始的“大脑”非常聪明但反应缓慢,就像一位需要 10 分钟才能解出一道数学题的天才教授。但对于机器人要在现实世界中实时移动,它需要像人类一样思考。

  • 解决方案: 团队使用了名为**蒸馏(Distillation)**的过程。他们把那位缓慢而天才的教授,训练成了一个快速且年轻的学生(“学生模型”)。
  • 结果: 这个学生现在可以以 10.81 帧/秒 的速度预测未来。这足以实现实时运行。你可以使用 VR 控制器控制虚拟机器人,机器人会立即移动并做出反应,就像真实的人一样。

它能做什么?(基于论文的声明)

论文强调了这项技术主要有三种用途:

  1. 测试策略(机器人的“飞行模拟器”):
    在将机器人送入现实世界打包水果之前,你可以在 DreamDojo 中测试它的“大脑”。论文表明,如果一个机器人策略在 DreamDojo 模拟中表现良好,那么它在现实世界中几乎也同样出色(相关性达 99.5%)。这节省了时间,并防止了机器人在学习过程中损坏物品。

  2. 预先规划(“国际象棋选手”):
    当机器人需要执行一项复杂的任务时,它可以利用 DreamDojo 在脑海中“梦见”不同的结果。它可以尝试五种不同的抓取苹果的方式,看看哪一种会导致最好的结果,然后执行那个特定的动作。这让机器人变得更加聪明,并能更成功地完成困难任务。

  3. 实时遥操作(“虚拟孪生”):
    因为该模型速度极快,人类可以佩戴 VR 头显实时控制虚拟机器人。如果人类移动手部,虚拟机器人也会立即移动。这让人们可以远程“成为”机器人,对于那些人类无法直接进行或过于危险的任务非常有用。

总结

DreamDojo 是连接混乱多样的现实世界与精准机器人世界的桥梁。通过从网络上海量的人类活动中学习,并使用一种特殊的“翻译器”来理解无需标签的动作,它创造出了一个能够想象未来安全测试想法实时行动的机器人大脑。它将机器人从一个只能执行明确教学内容的僵化机器,转变为一个理解世界运作方式的灵活智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →