← 最新论文
💻 computer science

CLAW: Composable Language-Annotated Whole-body Motion Generation

本文提出了 CLAW,一个面向 Unitree G1 人形机器人的交互式 Web 管道,它通过组合式运动规划器与 MuJoCo 仿真中的底层全身体控制器生成物理可行的全身运动轨迹,并同步利用模板引擎自动生成多样化的语言标注,从而以开源形式支持大规模语言 - 运动配对数据的构建。

原作者: Jianuo Cao, Yuxin Chen, Masayoshi Tomizuka

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianuo Cao, Yuxin Chen, Masayoshi Tomizuka

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个机器人(比如图里的 Unitree G1 人形机器人)像人一样灵活地走路、跑步、甚至打拳击。以前,教机器人这些动作非常麻烦,就像请一群昂贵的舞蹈演员来录视频,然后让机器人笨拙地模仿。这不仅花钱多、速度慢,而且录下来的动作经常“水土不服”(比如脚滑、关节扭伤),还需要人工给每个动作写“说明书”(文字描述),累死人。

这篇论文介绍了一个叫 CLAW 的新系统,它就像是一个**“机器人动作的乐高积木工厂”**,专门用来批量生产“动作 + 文字描述”的配对数据,而且完全不需要真人去录视频。

我们可以用三个生动的比喻来理解它是怎么工作的:

1. 动作库:像“乐高积木”一样的动作模块

以前的方法是把整个动作当成一个不可分割的大块,而 CLAW 把动作拆成了25 种“乐高积木”。

  • 有的积木是“走路”,有的是“慢走”,有的是“跑步”,还有“趴着爬”、“打拳击”、“受伤走路”甚至“僵尸舞”。
  • 你可以随意挑选这些积木,给它们设定参数(比如:走多快?朝哪个方向?身体蹲多低?持续几秒?)。
  • 最酷的地方在于“拼接”:CLAW 能自动把这些积木无缝地拼在一起。比如,你可以让机器人先“快走”,然后瞬间切换到“趴下爬行”,再站起来“打一拳”。系统会自动处理中间的过渡,让动作看起来像行云流水,而不是生硬的跳切。

2. 双模式操作台:像“游戏手柄”和“视频剪辑软件”

为了让普通人也能轻松操作,CLAW 提供了两种界面:

  • 键盘模式(像玩赛车游戏):你就像在玩游戏一样,按键盘上的 W/A/S/D 控制机器人前进、转向,按 Q/E 调整方向,按空格键切换动作(比如从走路切换到拳击)。你可以实时探索,想怎么动就怎么动。
  • 时间轴编辑器(像剪视频):如果你想让机器人重复做一套复杂的动作(比如“先走 5 秒,再左转,然后打一套拳”),你可以像剪辑视频一样,把不同的动作片段拖到时间轴上,设定好每个片段的时长和参数。点一下“播放”,机器人就会完美地复现这套动作。

3. 自动翻译官:像“智能字幕生成器”

以前,每录一段动作,都需要人工写一段文字描述(比如“机器人向前走了 3 秒”)。CLAW 内置了一个**“自动翻译官”**。

  • 当你设定好动作参数(比如:速度 2 米/秒,方向向前,持续 3 秒),这个翻译官会瞬间生成8 种不同风格的文字描述。
    • 指令风:“向前走 3 秒。”
    • 自然风:“机器人轻快地向前迈进了 3 秒。”
    • 叙事风:“机器人迈着坚定的步伐向前行进,持续了 3 秒。”
  • 它不是随机瞎编,而是基于预设的词汇库(比如把“跑”替换成“冲刺”、“飞奔”),既保证了描述的多样性,又保证了准确性。这意味着,你可以瞬间获得成千上万条“动作 + 文字”的配对数据,用来训练机器人听懂人类的指令。

总结:为什么这很重要?

CLAW 就像是一个无限生产的“机器人动作训练场”。

  • 以前:请人录视频 -> 花钱 -> 动作不完美 -> 人工写标签 -> 数据量小。
  • 现在 (CLAW):在电脑里用“乐高积木”拼动作 -> 免费且无限 -> 动作物理真实(在模拟器里跑过) -> 自动生成标签 -> 数据量巨大。

这套系统不仅开源了,而且完全不需要真人出镜。它让机器人学习新动作变得像拼乐高积木一样简单、快速且充满创意,为未来机器人能听懂我们说“去把那个杯子拿过来,顺便跳个舞”打下了坚实的数据基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →