✨ 要点🔬 技术摘要
想象一下,你想教一个机器人如何做饭、叠衣服或整理房间。传统的方法是雇佣一名人类,让其穿戴特殊的传感器,然后一遍又一遍地向机器人演示任务。这就像雇佣了一位只说某种特定“机器人语言”的私人导师。这既昂贵又缓慢,而且你只能获得短短几个小时的课程。
这篇论文提出了一个更简单的问题:为什么我们不能通过观看普通人做这些事情的 YouTube 视频来教机器人呢?
作者尝试了这种方法,但他们遇到了几道墙。他们建立了一个“训练营”,旨在弄清楚通过人类视频来教机器人究竟有哪些成功(或失败)的要素。以下是他们的发现,用通俗易懂的方式解释如下:
1. “手部”问题:观察细节
当你观看一个人倒咖啡的视频时,你的目光自然会聚焦在他们的手上。但计算机很难仅通过一段平面的二维视频,就准确推测出手的三维空间位置。
旧方法: 之前的尝试使用“单目”估计(即通过单个 2D 摄像头来猜测 3D 空间)。这就像试图仅通过观察云朵的影子来猜测云朵的确切形状;结果往往是模糊且错误的。
解决方法: 作者创建了一个名为 TriHands 的新数据集。他们采集了 532 段烹饪视频,并使用了多个摄像头(就像电影拍摄现场那样,从各个角度布置摄像头)来通过数学手段“三角测量”出手的精确位置。
结果: 这相当于在“模糊草图”与“高清晰度蓝图”之间做选择。他们发现,手部数据越准确,机器人的学习效果就越好。尽管他们使用的“模糊草图”方法(使用标准 AI)仍有一定的帮助,但“蓝图”方法的表现要优越得多。
2. “相机”问题:不同的镜头,不同的世界
想象一下,你正在使用一个带有广角鱼眼镜头(比如戴在头盔上的 GoPro)的视频来教机器人,而机器人的手臂上装的是一个标准摄像头。
问题所在: 在视频中,由于摄像头距离很近且视角极广,杯子看起来可能很大。但在机器人那里,由于摄像头视角较窄且距离较远,同一个杯子看起来就会很小。如果你直接把这两类图像都输入给机器人,它会感到困惑。这就像是通过观看有人驾驶卡丁车的视频来学习驾驶汽车,但视频缩放比例过大,导致路面看起来像是一条狭窄的走廊。
解决方法: 他们开发了一种方法来将“视频世界”的大小调整为与“机器人世界”相匹配。他们通过数学手段调整了视频,使物体在视觉上的比例和距离与机器人在实际操作时所看到的相一致。
结果: 这一简单的调整成为了改变局面的关键。如果没有它,机器人根本无法学习;有了它,机器人才能真正理解视频内容。
3. “身体”问题:人类与机器人的运动差异
人类拥有灵活的手臂、手腕和手指。而机器人通常拥有僵硬且带有关节的机械臂以及抓取器。
问题所在: 如果你强迫机器人完全模仿人类的手部动作,它就会失败。人类可以扭转手腕来抓取杯子,而机器人的手臂可能无法做出那样的弯曲。这就像试图通过展示老鹰飞行的视频来教企鹅飞行——企鹅只会拍打翅膀,然后摔倒。
解决方法: 他们并没有强迫机器人去“精确复制”人类,而是构建了一个特殊的“翻译器”网络。这个网络学习的是运动的“目标”(例如“拿到杯子”),但允许机器人利用自己的身体去寻找实现目标的路径。他们为机器人建立了一个理解自身身体的独立“大脑”,使其与人类的动作分离。
结果: 这种“专业化”处理让机器人能够理解人类的“意图”,而不会因为试图模仿不可能实现的动作而陷入僵局。
巨大的回报
作者在六种不同的任务(如堆叠碗具、倒水或拿起书本)上进行了测试。
“低数据量”下的奇迹: 当机器人自身的练习数据非常少(仅有几小时)时,加入人类视频使其成功率提升了近 30% 。这就像机器人原本只能勉强及格,但仅仅通过观看人类视频,就直接拿到了 A 等级的成绩。
“高数据量”下的现实情况: 当机器人拥有大量的自身练习数据时,人类视频带来的提升效果变小了,但它们仍然能提供一定的助力。
核心结论
通过视频来教机器人是可行的,但你不能只是把视频一股脑儿塞进机器人的大脑里并寄希望于好运。你需要具备三点:
清晰的手部标签: 你需要知道手的确切位置(而不只是一个猜测)。
尺度对齐: 你需要确保视频中的世界大小与机器人的世界看起来是一致的。
身体专业化: 你需要让机器人学会用自己的方式运动,而不是强迫它模仿人类的解剖结构。
通过解决这三个问题,作者证明了我们可以利用互联网上海量的视频资源,比以往任何时候都更快、更便宜地训练机器人。
技术摘要:在日常人类视频上进行机器人操控策略的共训(Cotraining)时,哪些因素至关重要?
问题陈述
构建通用机器人基础模型目前受到数据稀缺性的阻碍。虽然遥操作演示成本高昂且收集缓慢,而强化学习在奖励设计和从模拟到现实(sim-to-real)的迁移方面面临挑战,但互联网上的日常人类活动视频为物理智能提供了一个潜在的可扩展来源。然而,利用这些视频进行机器人操控并非易事。先前的工作要么依赖于将策略分解为中间组件(如 3D 姿态、可操作性)的模块化流水线,要么采用需要高度精选且对齐的数据进行端到端共训,这类数据要求人类动作必须与机器人运动学相匹配、摄像机完全一致,并且需要专门的硬件来捕捉精确的 3D 手部姿态。
本研究解决的核心问题是:哪些因素能够实现从不受约束的日常互联网视频到机器人的操控策略迁移? 具体而言,作者调查了两个主要难度的来源的影响:(1)3D 手部姿态标签的质量,以及(2)由自然人类运动和任务差异相对于机器人行为所引起的“动作差距”(action gap)。
方法论
1. TriHands 数据集
为了严格研究手部标签质量对结果的影响,而不受单目估计中固有噪声的影响,作者构建了一个新数据集:TriHands 。
来源: 来自 EgoExo4D 数据集的 532 段烹饪视频。
标注: 作者没有依赖单目估计器,而是使用多视图流水线来三角测量 3D 手部姿态。他们利用外参摄像机配合第一视角视图来生成高质量的 3D 标签。
精炼: 该流水线涉及使用重投影损失(reprojection loss)对 3D 手部姿态估计器(WiLoR)进行微调,该估计器基于 EgoExo4D 提供的部分 2D 标签。他们采用了直接线性变换(DLT)结合非线性精炼,通过选择能最大化摄像机数量并满足重投影误差阈值的摄像机子集来进行处理。
规模: 最终生成的数据集包含超过 28 小时的高质量、自然运动数据,拥有 3,042,406 帧 30fps 的右手帧。
2. 框架与架构
作者提出了一个共训框架,旨在平衡跨具身形态的观察/动作对齐,同时允许网络针对人类与机器人之间的特定运动学和感官差异进行专业化调整。
图像空间尺度对齐: 一个关键的、此前被忽视的步骤是进行物体图像空间尺度的对齐。由于人类和机器人的摄像机通常具有不同的焦距和视场角(FOV),作者对人类鱼眼图像进行了去畸变处理,并调整了机器人摄像机的外参(旋转和深度平移),以匹配人类场景的垂直 3D 范围。这确保了物体在网络输入中的呈现尺度相似。
动作空间对齐: 将人类 3D 手部姿态映射到机器人的动作空间(TCP 位姿和抓取指令)。为了处理由头部相机运动引入的多模态问题,通过将每步相机坐标系下的姿态转换到当前的头部坐标系下,使动作块(action chunks)保持稳定。动作块经过中心化处理并缩放到 ± 1 \pm 1 ± 1 ,以解决分布偏差。
架构(受 Transfusion 启发): 模型使用一种条件流匹配(conditional flow-matching)架构。
标记级融合(Token-Level Fusion): 与以往使用图像瓶颈(CLS token)的工作不同,该架构保留了完整的 ViT 图像 token,并通过共享注意力机制将其与带噪声的动作 token 进行拼接。
具身专业化: 网络采用独立的 FFN 专家来处理视觉 token 和动作 token。至关重要的是,它使用了具身特定的动作编码器和解码器 (分别为人类和机器人设计的独立 MLP),而不是共享权重。这使得模型能够学习不变的视觉表示,同时适应每种具身形态独特的运动动力学。
共训算法: 为了防止大量的人类数据淹没较小的机器人数据集,作者在每一步中从每种具身形态中抽取等量的 batch。这在数学上等同于对机器人损失进行加权,从而确保策略始终锚定在机器人运动学之上。
核心贡献
TriHands 数据集: 一个具有精确、三角测量 3D 手部标签的大规模日常人类视频数据集。作者证明,尽管 TriHands 的时长比大规模实验室数据集(如 EgoDex)少 5 倍,但其产生的机器人迁移性能更好,这突显了场景多样性比单纯的规模更为重要。
手部质量的影响: 研究表明,更高质量的 3D 手部标签能显著提升迁移效果。虽然最先进的单目估计器(HaWoR)相对于仅使用机器人训练仍有一定收益,但在单目估计与三角测量手部之间存在巨大的性能差距,尤其是在复杂任务中。
图像空间尺度对齐: 作者识别并证明了在跨数据集共训时对齐图像空间尺度的必要性。通过对机器人摄像机的虚拟位置进行简单的几何调整,可以显著提高迁移性能,这是目前领先的视觉-语言-动作(VLA)模型尚未考虑的因素。
面向自然运动的架构: 本文指出,专为实验室数据设计的标准共训方案(如共享动作编码器、图像瓶颈)无法有效地迁移到自然运动数据。相反,具身特定专业化 (即 token 级融合以及独立的编码器/解码器)对于弥合非受控人类视频中存在的巨大运动差距是必要的。
实验结果
作者使用 6 自由度 AgileX Piper 机械臂,在六个真实世界的操控任务(拾取、堆叠、重定向、拉动、翻书、倾倒)上评估了其方法。他们在 532 段人类视频和不同数量的机器人数据(3、5 或 10 个环境)上进行了训练。
性能增益: 所提出的共训方案在所有机器人数据区间内都带来了持续的改进。在低机器人数据区间(3 个环境)中,该方法在六项任务中实现了 29.7% 的绝对成功率提升 (相比之下,仅使用机器人训练的成功率为 12.0% vs 41.7%)。
缩放行为: 虽然人类数据的相对收益会随着任务特定机器人数据量的增加而递减(这是跨任务共训中的已知现象),但在低数据区间,其绝对增益仍然非常显著。
消融实验:
架构: 去除 token 级融合(改用 CLS token)或共享动作编码器/解码器会导致性能大幅下降,证实了专业化的必要性。
尺度对齐: 使用“严重失配”的针孔相机模型(未进行尺度校正)会导致性能与仅使用机器人训练相当,而使用范围匹配的对齐方式则使性能翻倍。
手部质量: 通过添加高斯噪声来模拟单目估计误差,会导致性能出现单调下降,证实了手部姿态的准确性是一个限制因素。
意义与主张
本文声称通过识别并解决区分此类数据与精选实验室演示的具体瓶颈,为利用互联网视频进行机器人共训指明了路径。作者断言:
自然运动是一把双刃剑: 虽然它提供了可扩展性,但其固有的运动差距要求进行架构层面的专业化(具身特定编码器/解码器),而非简单的对齐。
数据质量比规模更重要: 自然视频中的场景多样性(TriHands)表现优于规模更大但受限的实验室数据集(EgoDex)。
未来方向: 这项工作表明,未来手部姿态估计的改进(向三角测量标签的质量靠拢)将释放更大的迁移能力。作者指出,目前对运动学重定向(kinematic retargeting)的依赖可能会限制其在最复杂任务(如“倾倒”)上的有效性,这为未来的表征对齐和动作重定向研究留下了空间。
研究结论认为,虽然挑战依然存在,但结合高质量的手部标签、精细的图像空间对齐以及具身专业化的架构,使得在日常人类视频上进行共训成为一种可行且有效的策略,用于提升机器人操控能力,特别是在数据稀缺的场景下。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。