HAP: A Hand-Driven Active Perception Framework for Egocentric Head Motion Prediction
本文介绍了 HAP,一种通过推断目标置信度并利用预测图对动态遮挡进行建模,从而预测未来第一视角头部运动的手控主动感知框架,该框架通过一个名为 Bottle 的新数据集进行了验证,并表现出优于现有基准方法的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当我们观察一个人伸手去拿杯子时,我们的眼睛并不仅仅是跟随手部移动;它们会预判手的走向,并移动以保持目标处于清晰视野内。这就是主动感知(active perception)的本质:即感知并非对世界的被动记录,而是一个主动的过程,通过移动身体来获取我们所需的特定信息。在机器人或人工智能试图理解人类行为的背景下,这构成了一个难题。大多数系统擅长预测手下一步会去哪里,但往往无法预测人的头会转向何处。如果一个机器人只追踪手部,可能会忽略掉“人即将转头看向转角以观察其抓取物”这一事实,从而导致交互笨拙或失败。理解头部如何通过移动来揭示隐藏物体,与了解手部如何移动同样重要,因为头部的朝向决定了人接下来将获取什么样的视觉证据。
上海交通大学与中国矿业大学的研究团队开发了一种解决此问题的新方法。他们创建了一个名为 HAP 的系统,全称为“手驱动主动感知框架”(Hand-Driven Active Perception framework)。HAP 不再将头部视为仅仅跟随手的身体次要部分,而是将其视为获取信息的工具。该系统通过观察人向物体伸手时的手部动作,进而推测其意图触摸哪个物体。它并未止步于此;它还会计算该物体可能如何被场景中的其他物品遮挡或阻挡。通过将对目标的猜测与当前可见及可能变得可见的场景地图相结合,该系统可以精确预测人的头部将如何转动,以保持对目标的注视。
为了构建并测试这一构想,研究人员首先必须创建一个新的视频数据集。他们录制了数百段人在桌面上伸手拿物体的短片,使用能够捕捉色彩和深度的相机进行拍摄。在这些视频中,物体保持静止,但随着人的移动,目标的可见性会发生变化,迫使人通过改变视线来观察其正在进行的操作。他们将这个数据集命名为 Bottle,其中包含了同步记录的手部运动和头部运动,展示了当目标变得难以观察时,人是如何调整其视角的。研究人员利用这些数据训练计算机模型,使其能够识别手部运动中预示特定目标的细微线索,并理解变化的场景视图如何影响头部的运动。
HAP 系统的核心是一种关于如何推理“隐藏物”的方法。当一个人伸手向物体时,系统会观察物体的形状和手的路径,从而为每个可能的候选目标分配一个概率。随后,它会构建一个动态的场景地图,追踪哪些物体正在遮挡其他物体的视线。这个地图不是静态的;它会随着人的移动而更新,不仅计算当前被遮挡的部分,还计算如果人的位置稍作偏移,哪些部分可能会变得被遮挡。系统使用一个按特定顺序处理这些关系的神经网络(类似于信息流),以理解目标的可见性随时间的变化情况。这使得模型能够预判:如果目标被部分遮挡,人很可能会转头以揭开遮挡物,而不仅仅是继续朝原方向注视。
研究结果表明,这种方法比以往的方法效果显著更好。在针对其新数据集和现有的公开视频集进行测试时,与其它先进模型相比,HAP 系统在预测头部未来位置和朝向方面的误差更小。研究人员发现,仅仅猜测目标是不够的;系统需要理解该目标不断变化的可见性才能做出准确预测。他们还发现,将复杂的预测与“头部保持匀速运动”这一简单假设相结合,有助于平滑结果,尤其是在预测近期动作时。这种结合了理解目标、追踪障碍物以及尊重自然运动流的方法,使得系统能够以高精度预测头部运动。
研究还探讨了如果系统被迫对目标做一个单一、确定的判断,而不是保持一系列可能性时会发生什么。结果显示,在目标选择上保留一定程度的不确定性,实际上提高了最终预测的准确度。这表明,在伸手接触目标之前的早期阶段,大脑很可能在考虑多种选项,而头部运动反映了这种灵活性。通过在模型中保留这种不确定性,系统能够更好地适应最终的结果。研究人员得出结论,最成功的预测来自于将头部视为一个主动传感器,它不断根据变化的场景景观进行调整,而非仅仅是手的被动追随者。
虽然该系统在受控的桌面实验环境中表现良好,但研究人员也承认,它在更复杂的现实世界环境中面临挑战。目前的方法需要大量的计算能力来追踪多个物体之间的关系,并且依赖于高质量的视频数据,而这类数据未必总能获得。然而,这些发现为创造能够更自然地与人类互动的机器人和虚拟助手提供了清晰的路径。通过理解头部运动是由“清晰观察目标”的需求所驱动的,这些系统可以预判人类的需求,并协调自身的动作以支持成功的交互。这项工作证明,要真正理解人类行为,机器必须学会不仅将世界视为移动部件的集合,更要将其视为一个观察者通过不断变换位置来寻找缺失环节的动态谜题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。