← 最新论文
💻 computer science

EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning

EgoInfinity 是一个模块化的、网络规模级的 4D 数据引擎,它将任意互联网视频转化为度量手物交互表示和可执行的机器人轨迹,从而实现跨越多样化形态与视角的、可扩展的、无需人工干预的机器人学习与重定向。

原作者: Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个海量的 YouTube 视频库,里面记录着人们完成日常任务的过程——比如开箱子、倒汤、切水果或擦桌子。目前,机器人还无法真正从这些视频中“学习”,因为这些素材仅仅是平面的图像(2D)。机器人并不知道那个箱子有多重,汤离得有多远,或者人类的手指究竟是如何触碰把手的。这就像仅仅通过观看一部黑白电影来学习如何开车;你可以看到动作,但你感受不到方向盘或路面的触感。

EgoInfinity 是一个全新的“魔法引擎”,它能将这些扁平、杂乱的网络视频转化为机器人可以理解的 3D、具备物理属性的指令手册。以下是它的工作原理,分为几个简单的步骤:

1. “侦探”阶段(寻找线索)

首先,该引擎会扫描数百万个视频片段(专门来自一个名为 Action100M 的庞大数据集)。它扮演着侦探的角色,寻找有价值的内容。它会忽略无聊的部分,只专注于手部正在进行操作的时刻。

  • 比喻: 这就像一名电影剪辑师快速浏览 100 小时的原始素材,只为了找出演员真正开口说话的那 5 分钟,而忽略所有的静默部分。

2. “3D 翻译官”(将图像转化为几何数据)

一旦找到了好的片段,引擎就会开始将 2D 视频翻译成 3D 数据。它利用智能 AI 工具来推测:

  • 形状: 物体在 3D 空间中长什么样?(是一个圆形的苹果还是一个扁平的盒子?)
  • 位置: 物体在空间中的什么位置?
  • 手部: 人类的手指是如何移动的?
  • 比例: 这一切有多大?(那个杯子是 2 英寸高还是 2 英尺高?)

论文中称之为“度量校准(metric calibration)”。

  • 比喻: 想象你在看一张人拿着咖啡杯的照片。普通人可能会猜测大小。而 EgoInfinity 就像一个超级精确的 3D 扫描仪,它能瞬间知道杯子恰好是 4 英寸高,且手距离杯子 12 英寸,从而将扁平的照片变成一个你可以绕行观察的虚拟 3D 模型。

3. “现实检查”(修正错误)

AI 有时会产生混乱。如果手遮挡了物体,AI 可能会丢失对物体位置的追踪。EgoInfinity 有一个特殊的“交互感知优化(Interaction-Aware Refinement)”步骤。它会观察手与物体之间的关系。

  • 逻辑: 如果手握着物体,那么物体必须随手移动。如果手不动,物体也不应该漂浮开去。
  • 比喻: 这就像一位舞蹈教练在观看视频。如果视频出现故障,舞者的搭档突然飘向空中,教练会说:“不对,错了。如果他们牵着手,就必须同步移动。” 引擎通过这种方式修复这些故障,使物理效果看起来真实可靠。

4. “通用适配器”(教导不同的机器人)

这是最聪明的部分。该引擎并不只是机械地复制人类的身体动作。人类有长长的手臂和两只手;而机器人可能拥有短小的手臂、轮子或看起来完全不像手的抓取器。

  • 解决方案: EgoInfinity 会理清动作的“目标”(例如“拿起杯子”),然后将该目标翻译成机器人自己的语言。它会问:“这个特定的机器人如何才能实现同样的结果?”
  • 比 될喻: 想象你在教一只狗去捡球。你不会告诉狗“像人类一样奔跑”,而是告诉它,“去把球捡回来”,然后由狗自己决定如何使用它的爪子和腿去完成任务。EgoInfinity 对机器人也是如此:它提取人类的“捡球”动作,并告诉机器人的机械臂如何利用自身的关节来实现“捡球”。

他们究竟构建了什么?

作者们不仅提出了理论,还构建了一个运行系统并进行了测试:

  • Web 引擎: 他们创建了一个工具,可以自动处理这些视频,无需人类为每一帧进行标注。
  • 数据集: 他们处理了来自 Action100M 集合的 106 个视频,创建了一个包含 3D 手部与物体交互数据的库。
  • 真实机器人测试: 他们成功地教会了真实的机器人(如 Unitree G1 机器人和双臂 Franka 机器人)通过观看这些经过处理的视频来完成切割、倾倒和擦拭等任务。他们还利用这些数据训练了一个机器人手,使其能够抓取各种物体(如苹果、香蕉、汤罐)。

局限性在哪里?

论文诚实地说明了目前还做不到的事情:

  • 相机运动: 它在相机基本保持静止(如使用三脚架)时效果最好。如果相机剧烈晃动或由移动中的手持拍摄,它会表现得比较吃力。
  • 触觉: 它无法“感觉”。它知道手在哪里,但不知道机器人抓取的力度有多大,或者物体是否很滑。
  • 完美精度: 它非常擅长处理通用任务,但在处理需要极高精度的精细手术或需要精确指尖定位的任务时,可能还不够精准。

简而言之: EgoInfinity 是一座桥梁。它将混乱、无结构的 YouTube 人类视频转化为干净、符合物理规律且机器人可以读取并遵循的 3D 指令,从而让机器人无需昂贵的传感器或人类逐一演示,就能学习新的技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →