← 最新论文
💻 computer science

Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation

本文介绍了 EPIC-Contact,这是一个具有密集 3D 手-物接触标注的大规模野外第一视角数据集,以及 HOPformer,一种基于 Transformer 的模型,该模型通过利用交叉注意力机制来有效解决遮挡和泛化挑战,从而实现最先进的 3D 手-物姿态估计。

原作者: Siddhant Bansal, Zhifan Zhu, Shashank Tripathi, Jiahe Zhao, Michael J. Black, Dima Damen

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Siddhant Bansal, Zhifan Zhu, Shashank Tripathi, Jiahe Zhao, Michael J. Black, Dima Damen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你头上戴着一个摄像头,正在记录你的双手尝试打开罐子、倾倒水杯或搅拌锅里的东西时的样子。现在,试着教计算机理解你的手指究竟在哪里,以及它们是如何接触物体的,即使当你的手遮挡了视线、物体是透明的、或者背景很杂乱时也是如此。

这就是由布里斯托大学和马克斯·普朗克研究所的研究人员所解决的挑战,其针对的论文题目为**《迈向野外环境下第一视角下的 3D 手物姿态估计》(Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation)。作者们试图解决两个主要问题:数据智能**。

以下是他们解决方案的简单拆解:

1. 问题所在:处于“盲目”状态的计算机

目前的计算机在处理干净、影棚拍摄的照片时表现出色。但在现实世界(“野外”)中,情况会变得非常混乱。

  • 遮挡(Occlusion): 你的手经常会遮住物体,或者物体会遮住你的手。
  • 歧义性(Ambiguity): 仅仅通过观察一张平面的照片,很难准确判断你的拇指究竟是在哪里接触到一个光滑瓶子的。
  • 缺乏训练: 要教计算机完成这项任务,通常需要昂贵的动作捕捉设备和受控的实验室环境。这导致现有的数据大多局限于单调、简单的场景,看起来并不像真实生活。

2. 贡献一:EPIC-Contact 数据集(新的教科书)

为了解决缺乏高质量训练数据的问题,作者们创建了一个名为 EPIC-Contact 的新数据集。

  • 类比: 把之前的数据库想象成一本只印有白桌子上苹果照片的教科书。而 EPIC-Contact 则是一本充满了人们在凌乱厨房里真正“吃”苹果的照片的教科书,桌上可能有果汁,周围还有人在走动。
  • 他们做了什么: 他们采集了 2,300 段人们进行日常任务(如烹饪)的视频片段,并手动标注了手部的哪个部分接触到了物体的哪个部分。
  • 神奇之处: 他们并非靠猜测,而是使用了一种巧妙的过程,将手部的“接触点”映射到物体上。想象一下,在你手指接触杯子的位置画一个小点,然后瞬间将这个点转移到杯子表面的精确位置。他们针对数千帧画面进行了这样的操作,创建了一个庞大的“手与物接触”时刻的库。

3. 贡献二:HOPformer(聪明的侦探)

有了新的数据,他们构建了一个全新的 AI 模型,名为 HOPformer

  • 类比: 想象你在黑暗的房间里寻找一个丢失的玩具。
    • 旧的 AI (JointTransformer): 它观察房间并猜测玩具可能在哪里,但它经常会感到困惑,因为它不知道你的手是什么形状,也不知道你是如何握住玩具的。
    • HOPformer: 它表现得像一个完美了解你手部解剖结构的侦探。它先观察你的手,然后说:“啊,我看到你的手指正环绕着把手,”并利用这一知识瞬间推断出物体必须在什么位置。
  • 它是如何工作的: 该模型使用了一种“Transformer”(一种 AI 架构)。它获取图像,观察手部,并利用手的位置作为“先验”(一个强有力的提示)来确定物体的方位。它通过单步操作,同时预测双手和物体的位置。

4. 结果:赢得比赛

作者通过两种方式测试了他们的新模型和数据集:

  1. 在实验室中(ARCTIC 数据集): 他们在一个标准的、受控的数据集上进行了测试。HOPformer 以显著优势击败了现有的最优模型(SOTA)。它在预测手部和物体位置方面更加准确,并且在判断手部如何接触物体时犯错更少。
  2. 在野外中(EPIC-Contact): 他们在自己创建的杂乱、真实的场景数据集中进行了测试。在这里,提升更加剧烈。旧的模型表现得很挣扎(几乎失败),而 HOPformer 的成功率几乎翻了一番。它能更好地处理杂乱、遮挡以及复杂的照明情况。

总结

简而言之,这篇论文指出:“我们无法教计算机理解现实世界中的手物交互,是因为我们缺乏足够好的训练数据,也缺乏足够聪明的模型。”

  • 他们修复了数据问题,通过创建 EPIC-Contact——一个包含大量真实视频、具有精确 3D 标签(记录手部如何接触物体)的集合。
  • 他们修复了模型问题,通过创建 HOPformer——一个聪明的 AI,它利用手的形状和位置作为引导来寻找物体,即使在难以观察的情况下也是如此。

其结果是一个能够更好地理解现实世界中我们的双手与物体之间复杂“舞蹈”的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →