想象一下,你正试图教一个机器人成为一名称职的室友。你希望它能在屋子里走动、捡起一个杯子、折叠一条毛巾,甚至递给你一件工具。但目前,大多数机器人训练数据就像是一个只关于如何操作放在桌上的单机械臂的图书馆。对于那个机械臂来说,这些数据很完美,但它们无法教会一个完整的机器人如何行走、保持平衡以及同时使用双手。
这篇名为 《Humanoid Everyday》(人形机器人日常) 的论文介绍了一个针对这一问题的宏大解决方案。你可以把它想象成一本 “机器人日常生活百科全书”。
以下是研究人员构建的内容及其重要性的简单拆解:
1. 数据集:一场“机器人真人秀”
研究人员创建了一个庞大的视频和传感器数据集合,名为 Humanoid Everyday。
- 演员阵容: 他们使用了两台先进的人形机器人(Unitree G1 和 H1),它们看起来和移动起来都像人类,并配备了具有触觉感知能力的灵巧手。
- 剧情设定: 他们不仅仅是记录将一个盒子从 A 点移动到 B 点,而是记录了 260 个不同的“场景”或任务。这些任务从简单的动作(如捡起一个饺子玩具)到复杂的动作(如在提着门把手的同时行走或折叠毛巾)不等。
- 多样性: 这些任务涵盖了七个类别,包括:
- 基础家务(捡起物品)。
- 处理柔软物体(如布料或毛巾)。
- 使用工具(如橡皮擦)。
- 团队协作(递给人类物体)。
- 边走边工作(在执行任务时移动)。
- 规模: 他们记录了超过 10,000 个视频片段(轨迹)和超过 300 万帧 的数据。每个片段都包含了视频、深度信息(3D 距离)、激光扫描(LiDAR),甚至还有机器人的手“感觉到”了什么(触觉数据)。
2. 秘密武器:一支“超高速摄影团队”
收集这类数据非常困难,因为机器人的动作很快,如果摄像机的延迟哪怕只有一点点,数据就会失效。
- 问题所在: 官方的机器人软件就像是一条拥堵的单车道,数据会在其中卡顿。
- 解决方案: 团队构建了一个全新的“遥操作”系统(一种人类远程控制机器人的方式)。他们将数据采集过程比作一场 高速度接力赛。他们没有让一个人完成所有工作,而是将工作拆分到不同的“进程”(就像不同的跑者)中并行运行。
- 结果: 他们将延迟(滞后)从 500 毫秒降低到了仅 2 毫秒。这就像是从蜗牛爬行变成了冲刺,从而能够捕捉到平滑、高质量且看起来真正像人类动作的运动。
3. 云端“测试赛道”
机器人研究中最大的痛点之一是,并非每位科学家都拥有一台价值 10 万美元的人形机器人。
- 创新之处: 团队构建了一个 基于云端的评估平台。
- 运作方式: 想象一个远程控制赛道。世界各地的研究人员都可以将他们的机器人“大脑”(AI 策略)上传到云端。云端会将机器人的“眼睛”(摄像头画面)传输到研究人员的电脑上。研究人员的电脑计算出指令,并将指令发回实验室中的实体机器人。
- 益处: 这创造了一个 公平的竞争环境。每个人都在完全相同的任务、完全相同的房间、使用完全相同的机器人来测试他们的机器人。不再需要猜测你的机器人表现更好是因为它有不同的摄像头或不同的桌子。
4. 现实检验:机器人能做什么(以及不能做什么)
研究人员不仅收集了数据,还进行了测试。他们选取了几个著名的 AI 模型(目前用于机器人的“大脑”),并尝试教它们这些新任务。
- 好消息: 这些模型在某些方面表现得更好,尤其是当它们之前见过大量相似数据(预训练)时。表现最好的模型是名为 GR00T N1.5 的模型,它的成功率约为 51%。
- 坏消息: 机器人在处理最难的任务时仍然很吃力。
- “瓶中玫瑰”问题: 在一个要求机器人走过去并将细长的玫瑰茎放入微小花瓶开口的任务中,几乎所有的模型都失败了(成功率为 0%)。
- 原因: 机器人在进行大幅度动作时表现良好,但在处理精细动作所需的微小、精准调整方面表现很差。此外,当它们需要一边走路一边移动双手时,也会感到困惑。
总结
Humanoid Everyday 是一个庞大且高质量的机器人日常生活库,通过一套超高速系统采集,捕捉了每一个细节。它还附带了一个“云端测试赛道”,让任何人都能在真实的硬件上测试他们的机器人大脑。
这篇论文表明,虽然我们正在取得进展,但目前的机器人“大脑”仍像是在学走路的幼儿:它们可以做简单的动作,但当被要求同时进行行走和精细动作(如穿针引线)时,它们就会踉跄跌倒。这个数据集正是帮助它们成长所需的训练场。
技术摘要:Humanoid Everyday(人形机器人日常)
问题陈述
尽管人形机器人在全身能力(运动、舞蹈、奔跑)方面取得了显著进展,但通用人形机器人操控策略的发展仍受到三个主要差距的阻碍:
- 数据集局限性: 现有的数据集主要集中在静态机械臂或简单的移动平台。为数不多的现有类人机器人数据集通常局限于固定环境,缺乏任务多样性,忽略了下肢运动,并且未能捕捉复杂的真人与人形机器人之间的交互。
- 评估稀缺性: 缺乏用于在类人数据上基准测试学习型策略的标准评估平台。目前的框架主要局限于机械臂或模拟智能体,使得在不同的人形机器人策略之间进行公平、严谨的比较变得困难。
- 具身差距: 当前的数据集往往无法捕捉现实场景中所需的完整人类能力谱系,包括双手协调、全身运动以及与变形物体和工具的灵巧交互。
研究方法
1. 数据采集流水线
作者开发了一种高效的人类监督遥操作流水线,用于采集 Humanoid Everyday 数据集。
- 硬件: 数据使用两台 Unitree(宇树)人形机器人进行采集:G1(29 个自由度,配备带有触觉传感器的 7 自由度 Dex3-1 灵巧手)和 H1(27 个自由度,配备 6 自由度 INSPIRE 手)。两款机器人均携带 Intel RealSense RGB-D 相机和 Livox LiDAR 系统。
- 遥操作界面: 操作员佩戴 Apple Vision Pro 来捕捉手腕和手指的关键点。手指动作通过 dex-retargeting 系统映射到机器人手部,而手腕姿态则通过基于 Pinocchio 的逆运动学(IK)算法转换为手臂关节指令。
- 流水线优化: 不同于官方 Unitree 遥操作脚本中阻塞式的同步设计,作者实现了一个多进程、异步 I/O 流水线。该设计利用共享内存缓冲区,将数据流传输、写入、机器人控制和 IK 计算解耦为独立的进程/线程。
- 性能: 这种重构将控制延迟从 500 毫秒降低到了 2 毫秒,并将数据采集时间缩短了一半,从而实现了高频(30 Hz)控制和同步的多模态数据捕获。
2. 数据集组成
该数据集包含 10.3k 条轨迹 和超过 300 万帧 数据,涵盖了 7 个类别 中的 260 个独特任务:
- 基础操控: 拾取与放置任务。
- 变形物体操控: 与布料或柔软物体交互。
- 关节结构操控: 操作铰链式或有关节结构的物体。
- 工具使用: 利用外部物体实现目标。
- 高精度操控: 需要高精度的任务(例如插入花茎)。
- 人机交互 (HRI): 与人类的协作动作。
- 运动操控 (Loco-Manipulation): 将运动与操控相结合。
模态: 每个片段(episode)都包括 RGB 视频、深度图、LiDAR 扫描、触觉反馈、IMU 数据、关节姿态、关节动作以及自然语言标注。
3. 云端评估平台
为了解决标准化评估的缺失,作者引入了一个云端评估平台。
- 功能: 研究人员可以将策略上传至服务器,服务器将实时视觉输入(RGB、深度)和机器人状态从物理 G1 或 H1 机器人流式传输到客户端。
- 执行: 用户在本地运行推理,并将动作指令发回服务器,以便在物理机器人上执行。
- 监控: Web 界面提供第三人称视角和第一人称视角(egocentric)的任务执行视图。
- 效率: 该系统展示了能够连续运行超过 100 分钟且仅需极少人工干预(仅因电机过热进行 3 次干预)的能力,实现了可复现的、与硬件无关的基准测试。
4. 策略分析实验
作者在数据集上评估了一系列具有代表性的模仿学习和视觉-语言-动作(VLA)模型:
- 测试模型: Diffusion Policy (DP)、3D Diffusion Policy (DP3)、Action Chunking with Transformers (ACT)、OpenVLA、π0-FAST、π0.5 以及 GR00T N1.5。
- 训练策略: 对 VLA 模型采用了两阶段微调方法:先在完整的 Humanoid Everyday 数据集上进行预训练,随后针对特定任务类别进行适配。
- 消融实验: 对直接进行特定任务微调与两阶段预训练策略进行了对比。
关键结果
1. 策略性能
- 普遍困境: 由于高维动作空间(28 个自由度),所有端到端模仿策略都面临显著挑战。
- 具体模型表现:
- DP3 通常优于 DP,这归功于 3D 点云观测的鲁棒性,但在“运动操控”任务中表现不佳,因为较大的帧间变化使得点云不如 RGB 可靠。
- ACT 表现较差,它过度拟合了演示轨迹,无法适应场景变化。
- OpenVLA 在处理高频(30 Hz)数据时表现挣扎;将其降采样至 2 Hz 虽然改善了运动生成,但降低了平滑度。
- π0-FAST 因高维动作标记化(tokenization)导致解码错误,有时会导致机器人停顿。
- π0.5 生成的动作更平滑,但仍表现出过度拟合现象。
- GR00T N1.5 取得了最高的平均成功率(51%),这归功于在大规模人形机器人数据集上的广泛预训练。
- 失败模式: 最具挑战性的类别是运动操控和高精度操控。在“将玫瑰插入花瓶”这一任务中,几乎所有策略的成功率都为 0%,凸显了当前模型在细粒度视空间感知方面的不足。
2. 预训练效用
消融实验证实,在进行特定任务微调之前,先在 Humanoid Everyday 上进行预训练,能持续提升 VLA 模型的性能。这表明,接触多样化的人形行为可以提供一种有价值的先验知识,从而增强下游操控任务中的鲁棒性和稳定性。
意义与主张
本文将 Humanoid Everyday 定位为推动通用人形机器人操控研究的基础资源。其意义体现在三个方面:
- 数据多样性: 它通过提供大规模、多模态的集合,弥补了现有数据集的空白,涵盖了多样化的环境、全身运动、灵巧操控以及人类交互。
- 标准化基准测试: 配套的云端评估平台是首个专门为人形机器人设计的平台,降低了没有物理硬件访问权限的研究人员的准入门槛,并实现了公平、可复现的比较。
- 对局限性的洞察: 对当前策略的分析表明,虽然大型 VLA 模型展现出了潜力,但在高维控制、细粒度感知以及对动态环境的鲁棒性方面仍面临重大挑战。
作者总结道,尽管当前的模仿学习方法面临巨大障碍,但该数据集、评估平台以及对策略分析所获得的见解,共同为开发更具能力的具身智能体奠定了基础。他们承认了存在的局限性,例如需要针对高维空间设计专门的模型,以及当前策略无法自主重置环境,并将这些视为未来的研究方向。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。