想象一下,你拥有一个海量的 YouTube 视频库,里面记录着人们完成日常任务的过程——比如开箱子、倒汤、切水果或擦桌子。目前,机器人还无法真正从这些视频中“学习”,因为这些素材仅仅是平面的图像(2D)。机器人并不知道那个箱子有多重,汤离得有多远,或者人类的手指究竟是如何触碰把手的。这就像仅仅通过观看一部黑白电影来学习如何开车;你可以看到动作,但你感受不到方向盘或路面的触感。
EgoInfinity 是一个全新的“魔法引擎”,它能将这些扁平、杂乱的网络视频转化为机器人可以理解的 3D、具备物理属性的指令手册。以下是它的工作原理,分为几个简单的步骤:
1. “侦探”阶段(寻找线索)
首先,该引擎会扫描数百万个视频片段(专门来自一个名为 Action100M 的庞大数据集)。它扮演着侦探的角色,寻找有价值的内容。它会忽略无聊的部分,只专注于手部正在进行操作的时刻。
- 比喻: 这就像一名电影剪辑师快速浏览 100 小时的原始素材,只为了找出演员真正开口说话的那 5 分钟,而忽略所有的静默部分。
2. “3D 翻译官”(将图像转化为几何数据)
一旦找到了好的片段,引擎就会开始将 2D 视频翻译成 3D 数据。它利用智能 AI 工具来推测:
- 形状: 物体在 3D 空间中长什么样?(是一个圆形的苹果还是一个扁平的盒子?)
- 位置: 物体在空间中的什么位置?
- 手部: 人类的手指是如何移动的?
- 比例: 这一切有多大?(那个杯子是 2 英寸高还是 2 英尺高?)
论文中称之为“度量校准(metric calibration)”。
- 比喻: 想象你在看一张人拿着咖啡杯的照片。普通人可能会猜测大小。而 EgoInfinity 就像一个超级精确的 3D 扫描仪,它能瞬间知道杯子恰好是 4 英寸高,且手距离杯子 12 英寸,从而将扁平的照片变成一个你可以绕行观察的虚拟 3D 模型。
3. “现实检查”(修正错误)
AI 有时会产生混乱。如果手遮挡了物体,AI 可能会丢失对物体位置的追踪。EgoInfinity 有一个特殊的“交互感知优化(Interaction-Aware Refinement)”步骤。它会观察手与物体之间的关系。
- 逻辑: 如果手握着物体,那么物体必须随手移动。如果手不动,物体也不应该漂浮开去。
- 比喻: 这就像一位舞蹈教练在观看视频。如果视频出现故障,舞者的搭档突然飘向空中,教练会说:“不对,错了。如果他们牵着手,就必须同步移动。” 引擎通过这种方式修复这些故障,使物理效果看起来真实可靠。
4. “通用适配器”(教导不同的机器人)
这是最聪明的部分。该引擎并不只是机械地复制人类的身体动作。人类有长长的手臂和两只手;而机器人可能拥有短小的手臂、轮子或看起来完全不像手的抓取器。
- 解决方案: EgoInfinity 会理清动作的“目标”(例如“拿起杯子”),然后将该目标翻译成机器人自己的语言。它会问:“这个特定的机器人如何才能实现同样的结果?”
- 比 될喻: 想象你在教一只狗去捡球。你不会告诉狗“像人类一样奔跑”,而是告诉它,“去把球捡回来”,然后由狗自己决定如何使用它的爪子和腿去完成任务。EgoInfinity 对机器人也是如此:它提取人类的“捡球”动作,并告诉机器人的机械臂如何利用自身的关节来实现“捡球”。
他们究竟构建了什么?
作者们不仅提出了理论,还构建了一个运行系统并进行了测试:
- Web 引擎: 他们创建了一个工具,可以自动处理这些视频,无需人类为每一帧进行标注。
- 数据集: 他们处理了来自 Action100M 集合的 106 个视频,创建了一个包含 3D 手部与物体交互数据的库。
- 真实机器人测试: 他们成功地教会了真实的机器人(如 Unitree G1 机器人和双臂 Franka 机器人)通过观看这些经过处理的视频来完成切割、倾倒和擦拭等任务。他们还利用这些数据训练了一个机器人手,使其能够抓取各种物体(如苹果、香蕉、汤罐)。
局限性在哪里?
论文诚实地说明了目前还做不到的事情:
- 相机运动: 它在相机基本保持静止(如使用三脚架)时效果最好。如果相机剧烈晃动或由移动中的手持拍摄,它会表现得比较吃力。
- 触觉: 它无法“感觉”。它知道手在哪里,但不知道机器人抓取的力度有多大,或者物体是否很滑。
- 完美精度: 它非常擅长处理通用任务,但在处理需要极高精度的精细手术或需要精确指尖定位的任务时,可能还不够精准。
简而言之: EgoInfinity 是一座桥梁。它将混乱、无结构的 YouTube 人类视频转化为干净、符合物理规律且机器人可以读取并遵循的 3D 指令,从而让机器人无需昂贵的传感器或人类逐一演示,就能学习新的技能。
技术摘要:EgoInfinity
1. 问题陈述
训练通用机器人需要既具规模性又具多样性的操作数据。虽然实验室采集和佩戴式第一视角数据集(如 Ego4D、OakInk2)提供了高质量的监督信号,但它们受限于规模、采集成本和任务多样性。互联网视频提供了海量且非结构化的类人操作知识库(例如 Action100M 包含 14.6 年的视频片段),但这些视频对于机器人而言并不直接具备可执行性。现有方法难以将任意 RGB 视频转换为可执行的机器人训练数据,因为这些视频缺乏度量 3D 几何、6 自由度物体状态、接触信息以及特定机器人的动作空间。简单地将 2D 动作提升(lifting)到机器人空间往往会导致接地不准(mis-grounded)或物理上不可行的行为。核心挑战在于如何自动处理大规模、野外环境下的视频,将其转化为结构化的、度量意义上的 4D 手部-物体交互(HOI)表示,且无需人工干预标注。
2. 方法论
EgoInfinity 是一个全自动、模块化的 4D 操作数据引擎,旨在将原始 RGB 视频转换为与智能体无关的、具有度量意义的手部与物体表示。该系统通过一个多阶段流水线运行:
3.1 模块化流水线架构
该引擎采用两阶段策略以实现可扩展性:
- 第一阶段(过滤): 通过轻量级的时间扫描,利用手部运动统计和相机运动线索识别存在手部的片段,从而过滤掉非操作类内容。
- 第二阶段(重建): 仅对活跃片段应用完整的重建堆栈。该流水线采用组件可替换的设计,允许随着基础模型的进步进行升级。
3.2 度量校准的手部-物体追踪
其核心设计原则是跨模块校准,以确保所有组件共享统一的度量尺度和相机坐标系,而非依赖于原始且未对齐的模型输出。
- 统一度量几何: 系统使用 MOGE-2 获取相机焦距和全局度量尺度,使用 FLOW3R 生成稠密深度图,并使用 GEOCALIB 进行重力向量估计。这使得图像空间的预测能够提升到共享的 3D 空间中。
- 手部追踪: WILOR 估计 MANA 手部参数(姿态和形状)以生成手部网格和 3D 关键点。补全模块用于稳定缺失或不稳定的估计。
- 物体发现与追踪: 物体通过将视频描述作为语义提示输入 SAM-3 进行自动发现,并通过 SAM-2 进行传播,最后结合深度信息进行提升。当视觉证据充足时,SAM-3D 会重建物体网格。FOUNDATIONPOSE++ 在与手部相同的度量坐标系内追踪 6 自由度物体的位姿轨迹。
3.3 交互感知精炼
为了解决纯视觉追踪中的时间不稳定性与漂移问题,系统根据检测到的交互状态对物体轨迹进行精炼:
- 状态分类: 利用光流(MEMFOF)和手部关键点将帧分类为静态(static)、抓取(grasped)或移动(moving)。
- 精炼逻辑:
- 抓取: 物体相对于手部坐标系进行刚性附着,采用与手掌对齐的规范变换。
- 静态: 物体锁定在其鲁棒的点云质心上。
- 移动: 物体保留其初始提议。
- 合理性检查: 抑制不合理的尺度和伪背景检测。
3.4 跨具身机器人运动重定向
该引擎包含一个功能性重定向器,可将恢复的 3D 手部运动转换为适用于多种机器人形态(如 Unitree G1、Robonaut2、Dual-Franka)的可执行关节轨迹。
- 根坐标系估计: 无需完整的全身人体姿态,系统通过一个 SE(3) 等变神经网络 (Φ),基于手部轨迹和可选的重力信息来估计特定的机器人根坐标系(例如躯干)。
- 流匹配(Flow-Matching): 该网络使用流匹配条件生成模型来建模合理的根坐标系分布,处理不同身体姿态产生相同手部运动的情况(这对于部分身体观测至关重要)。
- 训练: 网络完全在 MuJoCo 仿真中通过程序化生成的配对数据进行训练,并辅以追踪噪声、遮挡和重力噪声,以确保对野外环境下重建误差的鲁棒性。
- 执行: 根据 IK(逆运动学)收敛性、关节限制和可操作性选择候选根坐标系。最终轨迹通过 IK 和后优化(平滑)进行精炼。
3. 核心贡献
- EgoInfinity 引擎: 一个全自动、模块化的 4D 操作数据引擎,无需穿戴设备、深度传感器、CAD 模型或人工物体标注,即可将大规模互联网视频处理为度量手部-物体表示。
- 交互感知精炼: 一种结合了跨模块度量校准与交互状态精炼的新方法,相比纯视觉重建,能有效减少漂移并提高物理合理性。
- 功能性跨具身重定向: 一种能够估计特定机器人根变换的方法,旨在保持目标机器人约束下的任务相关手部运动,从而实现针对任意视角和部分人类观测的“视频到动作”迁移。
4. 结果与验证
作者从四个维度对 EgoInfinity 进行了验证:
- 数据获取与统计: 一个基于浏览器的服务器允许搜索和可视化经过筛选的 Action100M 子集(106 个片段,277 个物体)。统计数据显示,物体类别(容器、工具、食物)和交互状态(88% 的片段涉及操作)分布均衡。
- 重定向性能: 在 Unitree G1、Robonaut2 和 Dual-Franka FR3 上进行了测试。系统实现了 70.6% 至 82.1% 的 IK 成功率,根据机器人运动学复杂度的不同,平均位置误差在 2.86 cm 至 10.27 cm 之间。
- 真实机器人执行:
- 策略学习: 提取的手部运动作为先验知识,用于训练真实 LEAP 灵巧手的抓取策略,成功泛化到多种物体(苹果、香蕉、汤罐头)。
- 直接重定向: 运动被直接重定向到真实的双臂 Franka FR3 设置中,展示了切割、倾倒和擦拭等技能的功能性执行。
5. 重要性与主张
本文声称 EgoInfinity 为互联网视频到可执行机器人行为提供了一条可扩展的桥梁,解决了开放世界机器人学习中数据稀缺的瓶颈。通过优先考虑度量 3D 几何和交互感知精炼,而非仅仅是 2D 伪动作,该系统提升了从人类视频中提取数据的物理接地能力。模块化设计确保了引擎能够持续受益于感知和重建模型的进步。作者将 EgoInfinity 定位为不仅是一个静态数据集,而是一个通用的引擎,能够从任意规模的互联网源生成结构化的、机器人可用的 4D 数据,从而支持机器人学习、多模态接地和人机交互(HRI)领域的未来工作。
局限性: 该系统目前假设视频为近似静态相机拍摄(不包括佩戴式拍摄),且无法保证细粒度的接触级精度(例如精确的指尖位置或力的一致性),也无法提供触觉观测。重定向器是针对特定机器人的,其目标是功能性运动迁移而非精确的运动学模仿。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。