← 最新论文
💻 computer science

StableHand: Quality-Aware Flow Matching for World-Space Dual-Hand Motion Estimation from Egocentric Video

StableHand 是一种感知质量的流匹配框架,它通过四通道质量信号动态适应每帧观测可靠性,从而提升从第一人称视角视频中进行世界坐标系双手机动估计的精度,在应对遮挡和数据缺失方面实现了最先进的性能。

原作者: Huajian Zeng, Chaohua Yao, Yuantai Zhang, Jiaqi Yang, Rolandos Alexandros Potamias, Xingxing Zuo

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Huajian Zeng, Chaohua Yao, Yuantai Zhang, Jiaqi Yang, Rolandos Alexandros Potamias, Xingxing Zuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你头上戴着一台相机,正在记录你烹饪、搭建或摆弄物体时双手的动作。这被称为“第一人称视角视频”。现在,想象你希望机器人通过观看这段视频,精确学习你的双手在三维空间中的运动方式。

问题在于:你的双手经常消失不见。有时你转动头部,双手便离开了相机的视野;有时你抓起一个锅或一本书,物体遮挡了相机,使其无法看到你的手指。

StableHand 是一款新型计算机程序,旨在充当填补这些缺失信息的“最佳推测”侦探。它并非随机猜测,而是利用一套智能系统来决定该信任哪些数据、该修正哪些数据。

以下是其工作原理,分解为几个简单概念:

1. “信任度计”(质量信号)

大多数以前的程序对每一帧视频一视同仁。如果相机看到了你的手,它们就会使用;如果手变得模糊或被遮挡,它们仍会尝试使用,这往往导致机器人的动作看起来抖动或错误。

StableHand 则不同。它为你的双手的每个部分内置了一个“信任度计”。

  • 它检查你的手腕(控制手部移动的大关节)。
  • 它检查你的手指(执行抓握动作的小关节)。
  • 它分别检查左手右手

它给这四个部分中的每一个都赋予一个从 0 到 1 的分数。

  • 高分(1.0): “我看得很清楚!我完全信任这些数据。”
  • 低分(0.0): “这很模糊、被遮挡或丢失了。我无法信任这些数据。”

2. “智能编辑器”(流匹配)

一旦程序获得了信任度分数,它就会像一个非常聪明的视频编辑器那样运作,使用一种称为流匹配的技术。你可以将其想象为一个神奇的过程,能够“平滑”杂乱的视频,或“重现”缺失的场景。

这个魔法技巧如下:

  • 如果信任度分数高: 程序会说:“这部分我看得很清楚,所以我会将其锁定。”它会完全保留原始视频数据,确保动作准确无误。
  • 如果信任度分数低: 程序会说:“这部分我看不清楚。我会忽略不良数据,并利用我对双手通常如何运动的记忆来重现它。”

它对双手的每一个微小部分独立执行此操作。因此,如果你的左手腕可见,但左手手指被杯子遮挡,它会锁定手腕的位置,同时根据双手自然的运动方式“幻觉”(重建)出手指。

3. “记忆库”(先验知识)

程序如何知道如何重现缺失的手指呢?它已经学习了数千小时的双手操作视频。它建立了一个关于双手通常如何协同运动的“记忆库”。当相机失效时,它会从这个记忆库中提取信息来填补空白,确保重建出的手部看起来自然,并与另一只手保持一致。

4. 为何更优(结果)

研究人员在两个极具挑战性的视频数据集上测试了 StableHand:

  • HOT3D: 人们频繁转动头部,导致双手长时间消失在相机视野中的视频。
  • ARCTIC: 人们使用物体执行复杂任务的视频,其中双手不断被所持物体遮挡。

结果: StableHand 的准确度显著高于以往的方法。

  • 它将误差降低了20–25%
  • 它在最困难的部分表现尤为出色:当双手完全被遮挡或严重遮挡时。
  • 与旧方法会出现“漂移”(即手部随时间推移逐渐移动到错误位置)不同,StableHand 始终锚定在现实世界中。

总结类比

想象你正在尝试完成一个拼图,但有些拼图块缺失了,而有些你拥有的拼图块则被弄脏且模糊不清。

  • 旧方法试图强行将那些脏污的拼图块拼入,导致画面扭曲变形。
  • StableHand 则审视每一块拼图。如果一块拼图干净,它就将其放入拼图中。如果一块拼图被弄脏或缺失,它不会强行塞入一块坏拼图。相反,它会观察周围干净的拼图块,并利用其对画面的知识,完美地描绘出缺失的部分。

这使得机器人能够更可靠地从人类视频中学习,即使相机视野并不完美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →