Boundary-Gate Collaborative Enhancement GeoVis-GNN for Joint Segmentation and Label Recognition of Video Human-Object Interactions
本文提出了 BGCE-GeoVis-GNN,这是一个通过引入辅助边界模块和协同约束来增强视频人机交互联合分割与识别稳定性的新颖框架,旨在缓解由弱过渡引起的边界偏移和标签不连续问题,并在 MPHOI-72 和 CAD-120 数据集上实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机视觉领域,教机器理解视频通常涉及识别静态瞬间:一个人拿着杯子,或者一辆车转弯。但现实生活是连续的流动,动作在时间中展开、变化并相互作用。一个更高级的挑战涉及理解人与物体的交互,即计算机不仅要看到正在发生什么,还要将一段长视频分解为有意义的章节,并正确标注每个章节。想象观看一段某人制作咖啡的剪辑;机器需要准确知道“研磨豆子”这一动作何时结束以及“倒水”何时开始,并且必须在执行此任务时同时追踪那个人及其接触的物体。这项被称为联合时序分割与标签识别的任务,对于构建能够真正理解动态行为的系统至关重要,从智能监控到帮助机器人与人类协作。其难点在于这些转换往往是微妙、模糊或被短暂的混乱所中断的,这使得计算机很难精确判断一个动作何时停止,下一个动作何时开始。
北京工业大学的研究人员通过改进一个已有前景的系统解决了这一问题,重点关注计算机决定从一个动作切换到另一个动作的具体时刻。他们的工作围绕一种名为 GeoVis-GNN 的方法展开,该方法使用一种特殊的“门控”机制将视频帧组织成这些动作段。可以将这个门控想象成一个交通控制器,决定何时关闭一条动作车道并开启另一条。虽然原始系统很有效,但研究人员发现,在边界模糊或存在突然干扰的视频中,这个门控可能会变得不稳定(抖动)。它可能会过早、过晚地切换,甚至产生微小的、错误的片段,从而破坏故事的连贯性。研究团队并没有用一个全新的系统来替换这个门控(因为这可能会破坏计算机学习的微妙平衡),而是引入了一种协同增强机制,作为学习过程中的引导。
这种被称为 BGCE-GeoVis-GNN 的新方法增加了一层智能,帮助主门控保持稳定而不夺取其职责。研究人员构建了一个辅助模块来平滑视频数据,过滤掉诸如光线突然闪烁或短暂遮挡之类的短期噪声,然后学习识别动作真实的边界可能位于何处。这个助手并不强迫主门控改变主意;相反,它在训练阶段提供一个柔和的、具有鼓励性的参考。它轻轻地引导门控使其决策与这些更清晰的边界信号保持一致。此外,系统被教导要保持单个片段内动作表示的紧凑与一致,同时确保不同片段之间保持清晰的区别。这种双重策略确保了计算机能够构建出视频时间轴的稳定且连贯的图像,减少了导致锯齿状或错误边界分割的混乱。
在两个包含复杂人类交互的数据集上进行测试时,改进后的系统展现出了比其前身更好地处理这些困难转换的能力。在一个涉及两人使用多个物体的交互数据集上,新方法在严格的时序要求下,将匹配真实情况(ground truth)的片段准确率提高了近四个百分点。在另一个专注于日常活动(如清洁或烹饪)的数据集上,它也表现出了类似的增益,特别是在正确识别物体特定功能(affordance)方面——即人如何使用工具或器具。研究人员证实,这些改进源于平滑数据、将门控的软响应与学习到的边界对齐以及强制执行片段内一致性的特定结合。至关重要的是,在系统的最终使用过程中,辅助模块和额外的训练规则会被撤去,留下原始且精简的路径来进行最终预测。这意味着系统在变得更加可靠的同时,并没有变得更臃肿或更慢,为使视频理解在对时序和连续性有要求的现实应用中更加稳健提供了一种切实可行的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。