想象一下,你想教一个笨拙的机器人完成复杂的厨房家务,比如打开微波炉、叠放杯子或擦拭柜台。你有两个选择:要么花费数千美元记录机器人执行这些任务的过程(这既慢又贵),要么记录人类完成这些任务的过程(这既便宜又容易获取且数据丰富)。
核心问题在于,人类和机器人的构造非常不同。
- 人类拥有灵活的手指,可以进行无限种方式的扭转、旋转和抓握。
- 本研究中的机器人则拥有“平行夹持器”——基本上就是两个只能张开和闭合的僵硬钳子。
如果你试图直接将人类手部的动作复制到机器人身上,就像是在试图通过展示人类手指的方式来教一只狗弹钢琴。机器人会感到困惑,因为人类使用的那些“扭转”动作对于它僵硬的钳子来说毫无意义。机器人最终会变得手忙脚乱,或者做错动作。
解决方案:“作为桥梁动作的平移”
研究人员想出了一个聪明的技巧,称为**“桥梁动作”(Bridging Action)。他们决定不再尝试复制整个人类手部(包括那些令人困惑的扭转和旋转),而是只复制手腕的直线运动(平移)**。
可以这样理解:
- “多噪”的方式(旧方法): 尝试复制人类手部的精确 3D 旋转和角度。这就像是在不理解诗歌含义的情况下进行逐字翻译;听起来是对的,但意思全错了。
- “桥梁”的方式(新方法): 忽略旋转,只关注手部在空间中移动的位置(左、右、上、下)。这就像是翻译诗歌的“含义”,而不是具体的“词汇”。
通过专注于平移(从 A 点移动到 B 点)并忽略旋转(扭转),研究人员找到了一个人类和机器人都能理解的“共同语言”。
他们是如何构建这个“翻译器”的
为了实现这一目标,他们构建了一个特殊的 AI 模型(视觉-语言-动作模型),充当一个通用翻译器。其工作原理分为简单的三个步骤:
- “桥梁”信号: 他们提取人类的手腕运动,将其转化为简单的 3D 路径(就像在地图上画一条线)。这就是“桥梁”,因为无论是人类还是机器人,都能理解“向前移动”或“向左移动”,即便他们的移动方式不同。
- “交错式”训练: AI 在混合数据上进行训练。有时它看到人类移动手部(此时它只学习路径);有时它看到机器人移动手臂(此时它学习完整的路径加上钳子的抓握动作)。这个 AI 非常聪明,能够处理缺失的信息,就像一位厨师即使缺少一种特定的香料也能做出美味佳肴一样,通过利用现有的食材来完成烹饪。
- “绑定”技巧: 为了确保机器人确实学会了如何正确移动它的钳子,AI 被迫练习在利用简单的“人类路径”作为引导的同时,去预测机器人的完整动作。这就像学生通过先在模拟器上练习转向,然后再切换到真实的汽车上,但保留了同样的转向逻辑。
他们的发现
他们在 15 种不同的任务上进行了测试,从打开微波炉到叠放杯子。结果如下:
- 没有桥梁: 如果他们只是尝试复制机器人自身的有限数据,机器人几乎在所有任务上都会失败。
- 有了桥梁(人类数据): 当他们使用这种“仅平移”的人类数据来教授机器人时,机器人的表现突然变好了。它能够完成从未见过的任务,比如打开微波炉或叠放杯子。
- “旋转”问题: 当他们尝试使用完整的、带有噪声的人类手部旋转(即“多噪”方式)时,机器人的动作变得扭曲且笨拙,就像一个被缠乱了线的木偶。事实证明,简单的“平移”方法效果要好得多。
- “上限”测试: 他们还测试了如果喂给机器人“完美的”机器人数据,但将其视为人类数据处理(即忽略机器人的特定相机视角)会发生什么。结果显示机器人变得更强了,这表明如果我们能获得更干净的数据,这种方法可能会更加强大。
核心结论
这篇论文证明了,你不需要完美地模仿人类的身体结构来教机器人。你只需要找到共享的运动(手部经过的路径),并忽略那些不匹配的部分(扭转手指)。
通过使用这种“桥梁动作”,研究人员成功地将技能从廉价、丰富的人类视频转移到了机器人身上,使机器人无需成千上万次昂贵的机器人演示即可学习复杂的任务。这相当于在说:“不要担心人类是如何握住杯子的;只需教会机器人要把杯子放在哪里。”
技术摘要:作为桥接动作的平移
问题陈述
本文解决了将新型操纵技能从人类数据迁移到配备平行夹持器的双臂机器人上的挑战。虽然人类动作数据丰富、多样且成本低廉,易于扩展机器人学习,但直接迁移受到两个主要问题的阻碍:
- 噪声估计: 人类动作通常源自手部姿态估计器,这会引入显著的噪声,尤其是在旋转估计方面。
- 具身差异(Embodiment Mismatch): 人类手指的接触模式与平行机器人夹持器有着本质的不同。因此,从人类数据中提取的腕部旋转(6DoF)往往与平行夹持器的物理约束在语义上不匹配,导致直接回放时产生扭曲的行为。
以往的方法通常将人类视为另一种双臂 6DoF 具身形式,学习包含旋转的动作信号。作者认为,对于平行夹持器机器人而言,这种做法是次优的。
方法论
1. 桥接动作表示
作者没有学习完整的 6DoF 腕部姿态,而是提出了一种仅基于相对腕部平移(a3D−wrist)的桥接动作表示。
- 定义: 动作被定义为在初始头戴相机坐标系内的相对平移。该坐标系由人类(佩戴头戴式相机)和机器人(配备头戴相机)共同使用。
- 原理: 由于人类和机器人都是基于其感知进行行动的,因此在观察坐标系中的相对平移在物理上是有意义的,对噪声旋转估计具有鲁棒性,并且与具身无关。
- 公式化: 对于时间步 t 和未来窗口 k:
a3D−wristt+i=ΔW3D=trans((Tw←ct)−1Wwt+i)−trans((Tw←ct)−1Wwt)
其中 W 代表腕部姿态,T 代表相机姿态。
2. 统一模型架构
作者基于类似于 π0 的具有流匹配(flow matching)功能的视觉-语言-动作(VLA)模型进行构建。为了处理具有不同可用动作组件的异构数据源(人类 vs. 机器人),他们引入了一个交错动作序列:
- 序列顺序: a3D−wrist→a6D−eef→agripper。
- 处理缺失数据: 模型使用注意力掩码(attention masking)来处理变长输入。对于人类数据,6DoF 末端执行器(a6D−eef)和夹持器信号可能缺失或被遮蔽;对于机器人数据,所有组件均存在。
- 训练目标:
- 流匹配(Flow Matching): 用于生成动作块(action chunks)。损失函数仅在给定数据源可用的动作组件上计算。
- 交错监督: 至关重要的是,在人机协同训练期间,即使地面真值是 a6D−eef,模型也会被训练去预测 a3D−wrist(反之亦然)。这种“绑定”策略明确地将桥接表示与可执行的机器人动作联系起来。
3. 三阶段训练策略
- 第一阶段(预训练): 模型在约 600 小时的大规模人类动作数据(EgoDex + 外包 + 实验室数据)上进行预训练。由于在此规模下旋转和接触模式不可靠,仅对桥接信号(a3D−wrist)进行监督。
- 第二阶段(协同训练): 模型在通用的机器人抓取与放置数据(约 72 小时)和特定任务的实验室人类数据(每个任务约 3 小时)上进行协同训练。所有动作组件(a3D−wrist、a6D−eef、agripper)均处于激活状态,并通过随机用 a3D−wrist 替换 a6D−eef 来强化桥接连接。
- 第三阶段(少样本后训练): 模型在少量真实机器人演示(每个任务 10 条轨迹)上进行微调,以提高数据效率和最终性能。
关键结果
该方法在 ByteMini 机器人上通过 15 个新型双臂操纵任务(如打开微波炉、擦拭表面、堆叠杯子)进行了评估。
- 技能迁移: 仅在机器人抓取与放置数据上训练无法泛化到复杂任务。然而,使用桥接动作与人类数据进行协同训练,显著提高了任务进度和成功率。
- 平移 vs. 6DoF: 使用 6DoF 人类动作进行协同训练会导致噪声大、扭曲的行为。仅基于平移的桥接动作则产生了与任务需求一致的稳定、自然的姿态(例如,与微波炉把手对齐)。
- 可扩展性: 大规模纯人类预训练(阶段 I)显著提升了下游性能,证实了桥接表示的可扩展性。
- 数据效率: 与从头开始训练的模型相比,经过人类数据预训练的模型需要更少的机器人演示(few-shot)即可达到高性能。
- 对齐性: 在协同训练期间,桥接动作(a3D−wrist)的训练损失与可执行 6DoF 动作(a6D−eef)的损失高度一致,表明存在共享的目标景观。
- 上限: 当消除具身差异(将机器人数据视为仅使用平移监督的人类数据)时,性能进一步提升,这表明桥接表示本身非常有效,剩余的差距主要源于视觉/具身差异以及噪声。
局限性与失败案例
作者指出,仅平移的方法限制了在需要精确旋转调整的接触密集型操纵任务(如将吸管插入杯中或打开抽屉)中的迁移能力。在这些情况下,机器人通常能展示正确的意图,但由于缺乏旋转监督,在最后的接触步骤中失败。此外,由于观察间隙和人类动作噪声,捡起薄物体仍然具有挑战性。
重要性与主张
本文声称证明了:
- 鲁棒迁移: 与噪声较大的 6DoF 姿态估计相比,基于平移的桥接动作是实现从人类到平行夹持器机器人操纵知识迁移的更优媒介。
- 可扩展性: 这种表示能够有效地利用大规模、多样化的人类数据来预训练策略,从而减少对昂贵机器人数据采集的依赖。
- 统一学习: 带有注意力掩码的交错动作序列允许单个模型从具有缺失动作组件的异构数据源中学习,从而促进高效的人机协同训练。
这项工作表明,通过关注共享的感知-运动信号(相对平移)而非特定的具身细节(手指关节或完整的 6DoF 姿态),可以更有效地利用丰富的人类数据来扩展机器人学习。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。