OMG: Omni-Modal Motion Generation for Generalist Humanoid Control
本文提出了 OMG,这是一个基于扩散模型的可扩展通用人形机器人控制框架,它通过结合分层架构与精心策划的数据集,实现了能够以语言、音频和参考动作作为条件的、最先进的全模态全身运动生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:机器人的大脑与小脑
想象一下,一个人形机器人(比如本研究中使用的 Unitree G1)正试图学习如何跳舞、走路或挥手。传统上,工程师必须一次只教机器人一项特定的技能,就像教狗“坐下”或“待命”一样。如果你想让机器人做一些新动作,通常需要从零开始,或者编写复杂的规则。
本文的作者提出了一种不同的方法,其灵感源自人体的工作方式。他们将机器人的控制系统分为两个部分:
- 大脑 (OMG-DiT): 这是“规划者”。它接收高层指令(如“挥手”或播放音乐),并计算出机器人下一步应该做什么。
- 小脑 (Motion Tracker): 这是“肌肉记忆”。它接收来自大脑的计划,并确保机器人的关节能够平稳移动且不会摔倒。
本文的研究重点在于构建一个更聪明的“大脑”,使其能够同时理解多种不同类型的指令。
问题所在:方言太多,数据不足
在本文发表之前,机器人运动数据就像一座图书馆,里面的书用不同的语言编写,有的缺页,有的甚至只是涂鸦。
- 有些数据带有文本描述。
- 有些带有音乐。
- 有些是人类跳舞的视频。
- 而这些数据都没有转化为机器人可以直接使用的格式。
为了解决这个问题,团队创建了 OMG-Data。你可以把它看作是一个大规模的翻译和编辑项目。他们收集了超过 1,000 小时 的各种来源的运动数据,对它们进行了清理,并将所有内容都翻译成了特定机器人(Unitree G1)能理解的“语言”。他们甚至使用物理模拟器检查了每一个动作,以确保机器人在尝试执行动作时不会绊倒或损坏自身的关节。
解决方案:“全模态”生成器
他们的核心系统被称为 OMG-DiT。你可以把它看作是一个集通用翻译员和创意总监于一身的角色。
它是如何工作的:
想象你正在参加一个派对。
- 文本输入: 有人喊道:“向前走!” 大脑理解了这句话,并规划了一条行走路径。
- 音频输入: 有人播放了一段嘻哈节奏。大脑听到了节奏,并规划了一段符合节拍的舞蹈。
- 视觉输入: 有人挥动双臂。大脑观察到了动作,并规划了模仿该挥手动作的路径。
- 组合输入: 有人在播放音乐的同时说:“跟着这个节奏跳舞!” 大脑将文字的含义与音乐的节奏结合起来,创造出一段独特的舞蹈。
OMG 的神奇之处在于,它不需要为每种新类型的指令重新进行训练。它使用了一个“共享骨干网络”(一个中央神经网络),该网络已经学习了运动的基本规则。当你给它一种新的指令类型(例如一个新的传感器或一种新的语言)时,它只需添加一个轻量级的“适配器”(adapter),即可将这种新输入连接到现有的脑部系统中。
关键成就(他们证明了什么)
它是一个“基础模型”: 正如大型语言模型(LLM)可以通过学习海量文本来写文章、写代码和写诗一样,这个模型通过学习海量的运动数据,掌握了运动规律。因此,它可以利用极少的额外训练来处理新任务。
- 类比: 如果你教一个人骑自行车,他学骑滑板的速度会比从未骑过任何东西的人快得多。这个机器人也是如此。
零样本组合能力 (Zero-Shot Composition): 该模型可以混合搭配它从未同时见过的指令。
- 示例: 如果它曾分别通过文本指令学习走路,以及通过音乐学习跳舞,那么即使在训练期间从未见过这两者的结合,它也能成功执行“一边跟着特定歌曲跳舞,一边向前走”的指令。
现实世界执行: 他们不仅仅是在计算机上进行模拟。他们将该系统应用在了真实的 Unitree G1 机器人上。机器人可以聆听音频、阅读文本或观察人类,并能立即实时开始运动而不会摔倒。
用通俗语言总结结果
- 更好的质量: 当被要求根据文本或音乐进行运动时,他们的机器人比以往的方法表现得更自然、更准确。
- 更快的适应能力: 当他们尝试教机器人一项新技能(例如跟随名为“Pico”的特定手部追踪传感器)时,预训练模型在几分钟内、利用极少的数据就能学会,而从零开始训练的模型则表现挣扎且需要更多数据。
- 可扩展性: 他们发现,通过增加计算能力来扩大“大脑”的规模,可以让机器人运动得更好,这表明随着我们增加数据和算力,这种方法可以变得越来越聪明。
总结
本文介绍了 OMG,这是一个赋予人形机器人“通用大脑”的系统。机器人不再是通过硬编码来学习每一个动作,而是从 1,000 多小时的数据中学习一种通用的运动语言。这使得机器人可以接受来自文本、音频或人类动作的指令,将它们混合在一起,并立即生成可以由真实机器人执行的安全物理动作。这是迈向让机器人像人类一样灵活地理解并响应世界的一大步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。