Beyond Pairwise Relations: Dynamic Manipulation Hypergraphs for Vision-Based Human Activity Recognition
本文提出了一种动态操纵超图框架,将演化的多实体交互建模为高阶关系单元而非成对边,在 EPIC-KITCHENS-100/VISOR 和 Assembly101 数据集上的细粒度人类活动识别中实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
要理解计算机如何看待人类活动,我们必须首先理解人类是如何看待活动的。当我们看到有人在切西红柿时,我们看到的不仅仅是手在移动或刀在闪烁。我们看到的是一个协调的事件,其中手、工具、蔬菜和切菜板共同参与了一个统一的动作。活动的意义在于这些独立的部件如何同时协同工作。几十年来,计算机视觉系统一直试图通过观察整个视频或追踪成对的对象(例如手接触刀)来识别这些时刻。虽然这些方法在处理简单任务时表现良好,但在动作依赖于一组复杂物品同时交互时,它们往往会显得力不从心。它们可能会看到手和刀,但却忽略了刀正压在切菜板上的西红柿这一点,而这对于理解该动作是“切割”而非仅仅是“拿着”至关重要。
一位研究人员开发了一种新方法,通过将物体组视为单一单元而非单独的配对,让计算机理解这些复杂的交互。该系统不再强迫计算机分析两个项目之间的每一种连接,而是将整个场景视为一系列多部分关系的集合。在研究中,研究人员在人们在厨房烹饪和用手组装物体的视频上测试了这种方法。他们发现,通过将手、工具和表面作为一个整体进行建模,计算机在准确识别正在发生的事情方面变得显著更好。该系统的准确率比以往的方法有了大幅提升,证明了观察交互的全貌比仅仅看到单个部件要强大得多。
这种新方法的核心是一个被称为“动态操纵超图”(dynamic manipulation hypergraph)的框架。要理解这意味着什么,请想象一张标准的地图,城市之间由道路连接。在传统的计算机模型中,每条连接都是两个城市之间的道路。如果你想描述一个三人聚会的场景,模型必须画出三条单独的道路将每个人与其他每个人连接起来。这会将群体拆分为单独的配对。然而,新方法则画出一个同时包含所有三个人的单一形状。用研究人员的话说,这个形状是一个“超边”(hyperedge),它将多个实体——比如左手、右手、工具和表面——连接成一个单一的意义单元。这使得计算机能够识别出该动作是由整个群体共同完成的,而不仅仅是由于个体之间的连接。
研究人员构建这个系统是为了应对“操纵”(即用手处理物体)这一特定挑战。他们专注于人们在烹饪或组装物品的视频,在这些情况下,物体之间的关系不断变化。系统首先识别场景中的关键参与者:左手、右手、被移动的物体、任何正在使用的工具以及物体所处的表面。然后,它观察这些参与者的移动和交互方式。如果一只手靠近一个工具,如果工具接触到一个物体,并且如果该物体正放在桌面上,系统就会将它们归为一组。它不仅在某一时刻这样做,而是在视频的每一个瞬间都进行操作,创建一个随时间演变的这些多部分组的序列。
一旦这些组形成,计算机就会使用一个推理网络来确定它们的含义。它在单个项目与其形成的组之间传递信息。例如,计算机学到刀不仅仅是靠近手,而是属于一个特定的组,该组包括手、西红柿和切菜板。这使其能够区分看起来相似的动作。一个人可能分别拿着刀和西红柿,这只是“拿着”。但如果刀、西红柿和切菜板都与手连接在同一个组内,系统就会识别出特定的动作——“切割”。研究人员在两组大型视频数据集上测试了这一点:一组是日常厨房活动,另一组是人们组装产品。在这两种情况下,新系统都优于现有的最佳方法。
结果非常显著。在厨房数据集上,与仅观察成对物体的最佳现有方法相比,新方法在识别复杂动作的能力上提高了近七个百分点。在组装数据集上,改进幅度更大,提升了近十个百分点。研究人员还将他们的系统与一个使用了相同的多部分组但没有随着视频播放而更新组的系统进行了比较。动态版本的表现明显更好,因为它会随着动作的展开而改变其对组的理解。这证明了时间性和关系的动态变化性与组本身一样重要。
为了确保系统确实学习到了正确的内容,研究人员观察了计算机最关注哪些组。他们发现,系统始终强调手、工具和表面都在进行交互的时刻。例如,当计算机正确识别切割动作时,是因为它聚焦于包含手、刀、西红柿和切菜板的那个组。当系统失败时,通常是因为它无法找到其中一个关键部分(如切菜板),从而导致组无法形成。这表明系统并不是根据视频的外观进行猜测,而是依赖于交互的实际结构。
该研究还解决了计算机视觉的一个常见局限性:对完美检测的依赖。该系统要求计算机首先在视频中找到手和物体。如果计算机漏掉了手或工具,组就无法形成,系统可能会遇到困难。研究人员承认了这种依赖性,指出他们的成功取决于准确定位这些物品的能力。然而,即便存在这一要求,新方法仍然证明了理解事件的高阶结构——即将群体视为一个整体——是向前迈出的关键一步。通过超越简单的配对并拥抱多实体交互的复杂性,研究人员展示了让计算机理解定义人类生活的细微且协调的动作的清晰路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。