DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
DreamDojo 是一个基于 44,000 小时第一视角人类视频训练的基础世界模型,它通过连续潜动作学习多样化的灵巧交互,从而为开放世界、富接触环境下的通用机器人实现实时模拟、精确的动作控制能力以及有效的策略规划。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想要教一个机器人学会人类能做的一切:烹饪、清洁、修理物品以及玩玩具。问题在于,机器人非常昂贵,容易损坏,而且我们没有足够的机器人视频时长来教授它们所有的技能。
DreamDojo 是一个全新的机器人“大脑”,它通过学习人类视频(而不是机器人视频)来解决这个问题。你可以把它想象成一个通过在 YouTube 和 TikTok 上观看数百万小时人类日常活动视频来学习的机器人,而不是需要机器人亲自去完成每一项任务。
以下是它的工作原理,分为几个简单的概念:
1. 海量图书馆(数据)
通常,机器人的训练数据就像一个只有几本关于“如何拿起红色方块”书籍的小型图书馆。而 DreamDojo 的图书馆是一个海量的、无限的图书馆,包含了 44,000 小时 的人类视频。
- 规模: 这就像是将一本笔记本与整个美国国会图书馆进行对比。
- 多样性: 它涵盖了从厨房烹饪到车库修车的一切内容,涉及数千种不同的物体和技能。
- 秘诀所在: 由于这些视频并没有附带“机器人指令”,团队发明了一种特殊的翻译器,叫做潜动作(Latent Actions)。想象一下你在看一段打开罐子的视频。尽管机器人无法看到精确的肌肉运动,但这个翻译器可以仅通过观察手部和罐子的移动方式,就推断出“旋转并拉动”的意图和物理特性。它将视频转化成了一本任何机器人都能理解的通用说明书。
2. 模拟器(世界模型)
一旦机器人的大脑从这些视频中学到了知识,它就会变成一个世界模型(World Model)。
- 类比: 把世界模型想象成飞行员的飞行模拟器。在飞行员驾驶真正的飞机之前,他们会在模拟器中进行练习。如果在模拟器中犯了错,也不会有人受伤。
- DreamDojo 的工作方式: 你可以告诉 DreamDojo,“想象机器人伸手去拿杯子,但没抓稳。”然后模型会生成一段接下来会发生什么的视频。它理解物理规律:如果你推一下杯子,它会滑动;如果你推得太重,它会从桌子上掉下来。它甚至能针对它从未见过的物体或环境,瞬间模拟出这些结果。
3. 速度提升(蒸馏)
原始的“大脑”非常聪明但反应缓慢,就像一位需要 10 分钟才能解出一道数学题的天才教授。但对于机器人要在现实世界中实时移动,它需要像人类一样思考。
- 解决方案: 团队使用了名为**蒸馏(Distillation)**的过程。他们把那位缓慢而天才的教授,训练成了一个快速且年轻的学生(“学生模型”)。
- 结果: 这个学生现在可以以 10.81 帧/秒 的速度预测未来。这足以实现实时运行。你可以使用 VR 控制器控制虚拟机器人,机器人会立即移动并做出反应,就像真实的人一样。
它能做什么?(基于论文的声明)
论文强调了这项技术主要有三种用途:
测试策略(机器人的“飞行模拟器”):
在将机器人送入现实世界打包水果之前,你可以在 DreamDojo 中测试它的“大脑”。论文表明,如果一个机器人策略在 DreamDojo 模拟中表现良好,那么它在现实世界中几乎也同样出色(相关性达 99.5%)。这节省了时间,并防止了机器人在学习过程中损坏物品。预先规划(“国际象棋选手”):
当机器人需要执行一项复杂的任务时,它可以利用 DreamDojo 在脑海中“梦见”不同的结果。它可以尝试五种不同的抓取苹果的方式,看看哪一种会导致最好的结果,然后执行那个特定的动作。这让机器人变得更加聪明,并能更成功地完成困难任务。实时遥操作(“虚拟孪生”):
因为该模型速度极快,人类可以佩戴 VR 头显实时控制虚拟机器人。如果人类移动手部,虚拟机器人也会立即移动。这让人们可以远程“成为”机器人,对于那些人类无法直接进行或过于危险的任务非常有用。
总结
DreamDojo 是连接混乱多样的现实世界与精准机器人世界的桥梁。通过从网络上海量的人类活动中学习,并使用一种特殊的“翻译器”来理解无需标签的动作,它创造出了一个能够想象未来、安全测试想法并实时行动的机器人大脑。它将机器人从一个只能执行明确教学内容的僵化机器,转变为一个理解世界运作方式的灵活智能体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。