← 最新论文
💻 computer science

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Open-AoE 是一个开放的、社区驱动的数据集和工具链,通过提供 2,000 小时的结构化操作数据以及用于处理、重定向和训练各种机器人学习模型的完整流水线,弥合了可扩展的智能手机端第一视角视频采集与具身智能训练之间的差距。

原作者: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo W
发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图教一个机器人如何做三明治、修理漏水的水龙头或折叠一件衬衫。你不能只是给它喂一堆教科书;它需要通过观察和感受人类是如何做这些事情的来学习。这就是**具身智能(embodied intelligence)**的世界——在这里,计算机通过与物理世界的交互来学习,就像我们一样。但问题在于:机器人的视角与我们的不同。如果你从架子上的摄像头记录一段视频(“第三人称”视角),机器人能看到整个房间,却会错过手指微小的动作。如果你从机器人自己的眼睛(“自我中心”视角)进行记录,虽然视角对了,但要获取足够高质量的数据来教它,是非常困难且昂贵的。通常情况下,你需要把特制的、价格不菲的摄像头绑在人的头上,或者必须手动标注视频中的每一秒钟,以告诉计算机正在发生什么。如果没有一个庞大且易于使用的这类“人类视角”视频库,机器人很难学会日常生活中那些微妙的技巧。

这正是名为 Open-AoE 的新项目发挥作用的地方,它就像是一个用于教导机器人的大规模开源工具包。研究人员意识到,每个人口袋里都已经装着完美的摄像头:智能手机。因此,他们构建了一个系统,将成千上索普通人变成了数据收集者。他们开发了一款应用程序,记录人们使用自己的手机完成日常任务(如倒咖啡或在键盘上打字)的过程。但他们并没有止步于录制;他们还在云端建立了一个巨大的自动化工厂,将那些原始、杂乱的视频转化为超级有序、机器人可用的“课程”。

团队收集了惊人的 2,000 小时 视频,这些视频由超过 500 名不同的人 使用 400 多种不同类型的智能手机 采集而成。这可是个庞大的工程!视频涵盖了 400 多个不同的场景(从厨房到办公室)以及 8,000 多种不同的任务。这个项目的特别之处不仅在于规模,更在于系统为素材添加的“魔力”。利用先进的 AI 技术,该系统可以自动识别手部移动的确切位置(精确到手指的 21 个关节)、摄像机的移动轨迹,并将视频分解成细小的、具有意义的动作片段。它甚至还能为正在发生的动作编写文字描述。

你可以这样理解:以前,如果你想教机器人,你必须雇佣摄制组、购买昂贵的设备,并花费数年时间来剪辑素材。而 Open-AoE 就像是把智能手机发给每一个人,对他们说:“去拍摄你的日常生活吧”,然后拥有一个神奇的机器人编辑,能瞬间将这些影片转化为一本完美的、供机器人学习的教科书。论文表明这种方法是行之有效的,它提供了一个丰富且多样化的数据集,帮助机器人不仅理解“要做什么”,还理解“如何移动手部和眼睛”去完成任务。

研究人员还构建了一套工具集(“工具链”),让科学家们可以利用这些数据进行各种酷炫的操作。他们可以实现手部 3D 运动的可视化,将人类动作“重定向”(retarget)以适配不同的机器人身体(例如将人类的手臂转化为机器人手臂),并训练不同类型的 AI 模型。他们发现,通过使用这种多样化的、基于智能手机的数据,他们可以为机器人学习现实世界奠定一个更强大的基础,而无需耗费百万美元的设备。这是让机器人真正能够协助我们处理日常琐事的一大步,因为现在它们拥有了一个庞大的、关于人类经验的开放式图书馆供其研习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →