← 最新论文
🤖 machine learning

Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation

本文介绍了“Humanoid Everyday”,这是一个包含超过 260 个任务、逾 10,000 条多模态轨迹的大规模多样化数据集,旨在推进开放世界人形机器人操控研究,并附带了对策略学习方法的分析以及一个标准化的云端评估平台。

原作者: Zhenyu Zhao, Hongyi Jing, Xiawei Liu, Jiageng Mao, Abha Jha, Hanwen Yang, Rong Xue, Sergey Zakharov, Vitor Guizilini, Yue Wang

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenyu Zhao, Hongyi Jing, Xiawei Liu, Jiageng Mao, Abha Jha, Hanwen Yang, Rong Xue, Sergey Zakharov, Vitor Guizilini, Yue Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人成为一名称职的室友。你希望它能在屋子里走动、捡起一个杯子、折叠一条毛巾,甚至递给你一件工具。但目前,大多数机器人训练数据就像是一个只关于如何操作放在桌上的单机械臂的图书馆。对于那个机械臂来说,这些数据很完美,但它们无法教会一个完整的机器人如何行走、保持平衡以及同时使用双手。

这篇名为 《Humanoid Everyday》(人形机器人日常) 的论文介绍了一个针对这一问题的宏大解决方案。你可以把它想象成一本 “机器人日常生活百科全书”

以下是研究人员构建的内容及其重要性的简单拆解:

1. 数据集:一场“机器人真人秀”

研究人员创建了一个庞大的视频和传感器数据集合,名为 Humanoid Everyday

  • 演员阵容: 他们使用了两台先进的人形机器人(Unitree G1 和 H1),它们看起来和移动起来都像人类,并配备了具有触觉感知能力的灵巧手。
  • 剧情设定: 他们不仅仅是记录将一个盒子从 A 点移动到 B 点,而是记录了 260 个不同的“场景”或任务。这些任务从简单的动作(如捡起一个饺子玩具)到复杂的动作(如在提着门把手的同时行走或折叠毛巾)不等。
  • 多样性: 这些任务涵盖了七个类别,包括:
    • 基础家务(捡起物品)。
    • 处理柔软物体(如布料或毛巾)。
    • 使用工具(如橡皮擦)。
    • 团队协作(递给人类物体)。
    • 边走边工作(在执行任务时移动)。
  • 规模: 他们记录了超过 10,000 个视频片段(轨迹)和超过 300 万帧 的数据。每个片段都包含了视频、深度信息(3D 距离)、激光扫描(LiDAR),甚至还有机器人的手“感觉到”了什么(触觉数据)。

2. 秘密武器:一支“超高速摄影团队”

收集这类数据非常困难,因为机器人的动作很快,如果摄像机的延迟哪怕只有一点点,数据就会失效。

  • 问题所在: 官方的机器人软件就像是一条拥堵的单车道,数据会在其中卡顿。
  • 解决方案: 团队构建了一个全新的“遥操作”系统(一种人类远程控制机器人的方式)。他们将数据采集过程比作一场 高速度接力赛。他们没有让一个人完成所有工作,而是将工作拆分到不同的“进程”(就像不同的跑者)中并行运行。
  • 结果: 他们将延迟(滞后)从 500 毫秒降低到了仅 2 毫秒。这就像是从蜗牛爬行变成了冲刺,从而能够捕捉到平滑、高质量且看起来真正像人类动作的运动。

3. 云端“测试赛道”

机器人研究中最大的痛点之一是,并非每位科学家都拥有一台价值 10 万美元的人形机器人。

  • 创新之处: 团队构建了一个 基于云端的评估平台
  • 运作方式: 想象一个远程控制赛道。世界各地的研究人员都可以将他们的机器人“大脑”(AI 策略)上传到云端。云端会将机器人的“眼睛”(摄像头画面)传输到研究人员的电脑上。研究人员的电脑计算出指令,并将指令发回实验室中的实体机器人。
  • 益处: 这创造了一个 公平的竞争环境。每个人都在完全相同的任务、完全相同的房间、使用完全相同的机器人来测试他们的机器人。不再需要猜测你的机器人表现更好是因为它有不同的摄像头或不同的桌子。

4. 现实检验:机器人能做什么(以及不能做什么)

研究人员不仅收集了数据,还进行了测试。他们选取了几个著名的 AI 模型(目前用于机器人的“大脑”),并尝试教它们这些新任务。

  • 好消息: 这些模型在某些方面表现得更好,尤其是当它们之前见过大量相似数据(预训练)时。表现最好的模型是名为 GR00T N1.5 的模型,它的成功率约为 51%
  • 坏消息: 机器人在处理最难的任务时仍然很吃力。
    • “瓶中玫瑰”问题: 在一个要求机器人走过去并将细长的玫瑰茎放入微小花瓶开口的任务中,几乎所有的模型都失败了(成功率为 0%)
    • 原因: 机器人在进行大幅度动作时表现良好,但在处理精细动作所需的微小、精准调整方面表现很差。此外,当它们需要一边走路一边移动双手时,也会感到困惑。

总结

Humanoid Everyday 是一个庞大且高质量的机器人日常生活库,通过一套超高速系统采集,捕捉了每一个细节。它还附带了一个“云端测试赛道”,让任何人都能在真实的硬件上测试他们的机器人大脑。

这篇论文表明,虽然我们正在取得进展,但目前的机器人“大脑”仍像是在学走路的幼儿:它们可以做简单的动作,但当被要求同时进行行走和精细动作(如穿针引线)时,它们就会踉跄跌倒。这个数据集正是帮助它们成长所需的训练场。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →