← 最新论文
🤖 AI

EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting

该论文提出了 EMPIRE,这是一个两阶段框架,它通过引入显式操纵规划作为一种可学习的中间表示,将操纵推理与运动合成解耦,并在新构建的 EMPIRE-651K 数据集上,在第一视角双手的操纵手部运动预测方面实现了最先进的准确率。

原作者: Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何制作三明治。你可以简单地给它看一段人类制作过程的视频,并要求机器人逐帧模仿手部动作。但这种方法往往会失败,因为机器人只看到了动作,却没理解动作背后的“意图”。它可能正确地抓住了面包,但随后却试图用握紧的拳头去涂抹果酱,或者在拿起罐子时忘记稳住盘子。要构建真正能够与世界互动的智能机器,我们需要让它们不仅理解手是如何移动的,还要理解为什么要这样移动,以及下一步要做什么。这就是“第一视角”(egocentric)视觉的核心挑战——在这种视角下,计算机像戴着头戴式摄像机的人类一样,从第一人称的角度观察世界。其目标是预测一个人的手下一步会做什么,这项技能对于与我们并肩工作的机器人、具有真实感的虚拟现实化身,以及能通过观看人类视频进行学习的机器来说都至关重要。

长期以来,研究人员一直尝试通过将视频和文本指令直接输入计算机模型,并要求它预测未来的手部位置来解决这个问题。这些模型通常基于大型语言和视觉系统,功能强大,但它们往往跳过了中间步骤。它们试图直接从“我看到了杯子和桌子”跳转到“手会移动到这里”,而没有明确推导出实现这一目标所需的动作序列。这就像是要求一个人在没有思考情节的情况下,通过猜测每段话的最后一句来写故事。这种捷径适用于简单的任务,但当任务变得复杂或持续时间较长时,误差就会不断累积,导致机器人的手开始偏离应有的轨迹。此外,试图让模型同时理解场景并生成动作会产生一种冲突:为了精准实现动作而产生的压力,实际上会模糊模型对场景的理解,使其随着时间的推移变得不再可靠。

一种被称为 EMPIRE 的新方法改变了游戏规则,它强制计算机在行动之前先进行规划。研究人员意识到,在人类伸手去拿物体之前,大脑已经规划好了一系列步骤:伸手、抓取、抬起和放置。EMPIRE 不再让计算机直接猜测最终的手部位置,而是要求计算机首先以结构化的格式写下这一系列步骤。这就是“规划”阶段。计算机观察视频、任务的文本描述,甚至包括物体距离的粗略估计,并生成一份清晰的、关于双手应如何动作的逐步清单。例如,它可能会输出一个计划,写道:“左手:抬起杯子;右手:稳住盘子。”这个计划充当了一个桥梁,将混乱的视觉世界转化为清晰、逻辑性的指令集。

一旦创建了这个计划,计算机就会冻结这部分大脑,进入第二阶段:“行动”。在这个阶段,系统的另一个部分会根据编写的计划和当前的手部位置来生成实际平滑、流利的动作。由于规划部分已被冻结,它不会因为生成动作的压力而被混淆或覆盖。这种分离确保了计算机对任务的理解保持稳定和清晰,即使在处理手指和手腕移动的复杂物理特性时也是如此。研究人员在他们构建的一个大规模新数据集上测试了这种两步法,该数据集包含超过 65 万个例子,涵盖了人们执行的 111 种不同任务,从折叠衣服到处理易碎物品。他们训练系统先预测计划,再预测动作,结果令人瞩目。

新系统以显著优势超越了以往的方法。在衡量预测的手部位置与真实位置的偏差时,新方法比现有的最佳模型减少了近 20% 的误差。更重要的是,它在预测手指运动的精细细节方面表现得更为出色,而这对于精细任务至关重要。其他模型可能能大致找准手的位置,但往往无法预测手指应如何弯曲或旋转。通过依赖明确的计划,新方法能让手指在较长时间内保持在正确的位置,即使是持续五秒或更长时间的任务,其预测依然准确。该系统还表现出了极高的效率,生成这些预测仅需一秒钟,而其他强大的模型则需要数分钟才能完成同样的工作。

这项研究表明,提升机器人手部能力的诀窍不在于单纯让模型变得更大或更快,而在于给它们一种更好的思考方式。通过强制系统在行动前阐明计划,研究人员发现了一种方法,既能保持计算机对世界的理解清晰,又能保证动作精准。这种方法在步骤复杂且时机关键的困难任务中表现尤为出色。它表明,当我们教机器进行分步思考,而不是仅仅猜测结果时,它们就能变得更加擅长以自然且可靠的方式与物理世界互动。这项工作为开发能够通过观察人类视频进行学习的机器人开辟了道路,使它们具备了超越简单模仿的理解力,从而能够应对日常生活中复杂的、多步骤的挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →