← 最新论文
💻 computer science

EgoAERO: Learning Dexterous Manipulation from a Single Egocentric Video without Object Assets

EgoAERO 是一个新颖的框架,它通过在不需要预扫描物体资产的情况下,利用单段第一视角 RGB-D 视频重建接触一致的轨迹,并引入大规模的 EgoDex-R 数据集,使机器人能够学习灵巧操作。

原作者: Yichen Niu, Haoran Lv, Xinrui Zhang, Xueyao Wan, Shiyu Gao, Ying Ai, Hui Xu, Yongqi Hu, Hengyi Zhang, Yang Xie, Zhaxizhuoma, Yue Zhao, Zhenshan Bing, Yan Ding, Jianxing Liu

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yichen Niu, Haoran Lv, Xinrui Zhang, Xueyao Wan, Shiyu Gao, Ying Ai, Hui Xu, Yongqi Hu, Hengyi Zhang, Yang Xie, Zhaxizhuoma, Yue Zhao, Zhenshan Bing, Yan Ding, Jianxing Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要教一只高技能的机器人手去完成一项精细的任务,比如剥橘子或拿起特定的工具。通常情况下,要做到这一点,你需要预先拥有该物体的完美 3D 蓝图(CAD 模型),或者先在实验室里对物体进行扫描。这就像是试图通过一段视频教人开车,却从未告诉过对方方向盘或踏板长什么样。

EgoAERO 是一个改变规则的新系统。它允许机器人仅通过观看一段由人从第一视角(例如佩戴 GoPro 头戴摄像头)录制的单段视频,就能学习复杂的灵巧任务,即使系统之前从未见过这个特定的物体,也没有它的 3D 模型。

以下是 EgoAERO 的工作原理,分为几个简单的步骤:

1. “智能侦探”(语义预处理)

首先,系统会观看视频,并要求一位“智能侦探”(一个名为 MLLM 的 AI)来理清故事脉络。

  • 问题: 在视频中,一个人可能正拿着一个杯子,但视频并不会明确说明“我正在拿着一个红色的马克杯”。
  • 解决方案: AI 会观察视频并结合任务描述,识别出正在使用的物体是什么以及目标是什么。随后,它会在视频中标记出该物体,为下一步做好准备。

2. “3D 雕塑家”(无资产重建)

这是最神奇的部分。通常,要教机器人,你需要一个预制的物体 3D 模型。但 EgoAERO 没有那个。相反,它在观看视频的同时,即时构建出物体的 3D 模型。

  • 挑战: 人的手经常会遮挡住物体的视线(遮挡问题),或者物体可能具有难以追踪的平淡、单一的表面。
  • 解决方案: 系统就像一位即便在雕像部分被遮挡时也能猜出其完整形状的雕塑家。它将视频中的数千个快照缝合在一起,利用深度信息(物体距离远近),并通过数学方法“填补空白”,从而创建一个平滑的物体 3D 网格(mesh)。同时,它还能计算出物体在 3D 空间中是如何移动和旋转的。

3. “稳定器”(自我运动补偿)

由于摄像机安装在人的头上,每当人转头时,视频中的整个世界都会随之移动。

  • 问题: 如果人转了头,即使物体本身纹丝不动,在视频里看起来也像是从桌子上滑走了。
  • 解决方案: EgoAERO 充当了“稳定器”操作员的角色。它计算出人头部的运动轨迹,并将这种运动从视频中减去。这确保了机器人看到的物体移动,仅仅是因为在移动,而不是因为摄像机在移动。

4. “物理修正器”(自适应接触优化)

有时,视频重建的结果在物理表现上可能会显得有些“错误”。例如,机器人可能会认为人的手指轻微悬浮在物体上方,或者物体稍微嵌入了手指内部(这在现实生活中是不可能的)。

  • 解决方案: 系统会进行快速的“物理检查”。它会轻轻地调整手部和物体的相对位置,使它们实现真实的接触。它能修复诸如“手指悬浮”或“幽灵穿透”之类的微小误差,以确保数据符合物理常理。

5. “两步舞步”(策略学习)

一旦系统拥有了干净、3D 化且经过物理修正的手部与物体视频,它就会开始教机器人如何操作。它分两个阶段进行:

  • 第 1 步:舞伴: 机器人首先学习单纯模仿人类的手部动作。它此时还不关心物体,只是学习如何像人类那样移动手指和手腕。
  • 第 2 步:微调: 现在机器人已经掌握了移动的方法,它开始学习一种“残差”(residual,即微小的修正)。它利用之前构建的 3D 物体数据来进行极其细微的调整。如果人类的手稍微滑了一下,或者物体需要抓得更紧,机器人会学习做出这些精准的微调,以确保任务成功完成。

结果:EgoDex-R

研究人员不仅开发了这个系统,还利用它创建了一个庞大的、可用于“修正”的视频库,称为 EgoDex-R。它包含了超过 400 万帧人类使用日常物品进行灵巧操作的画面,且完全不需要预先扫描 3D 模型。

为什么这很重要

简单来说,EeroAERO 将一段杂乱的现实世界视频转化为了机器人完美的、符合物理规律的指令手册。

  • 以前: 你需要为每一个你想让机器人触摸的物体准备一个完美的 3D 蓝图。
  • 现在: 你只需要一段人类操作的视频。系统会搞定剩下的事情。

论文表明,通过这种方式训练的机器人,其表现几乎可以媲美使用完美 3D 蓝图训练的机器人,这证明了你不需要昂贵的预扫描过程也能教会机器人复杂的动手技能。研究人员在模拟环境中进行了测试,并在真实机器人(配备 Inspire 手部的 Unitree G1)上进行了验证,结果证明该方法是有效的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →