← 最新论文
💻 computer science

Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition

本文提出了一种名为相似性体积聚合(SimVA)的新框架,该框架从局部视觉 - 文本对应关系构建并细化稠密的四维时空相似性体积,以克服全局特征聚合的局限性,从而在零样本、少样本及基础到新颖的设置中实现开放词汇动作识别的竞争性性能。

原作者: Yerim So, Jiyeong Kim, Jiwon Yoon, Dongbo Min

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yerim So, Jiyeong Kim, Jiwon Yoon, Dongbo Min

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教计算机识别视频中的人类动作,比如“刷牙”或“挥动球棒”,但你希望它能理解任何动作,甚至是它从未见过的动作。这被称为开放词汇动作识别

本文介绍了一种名为SimVA(相似性体积聚合)的新方法,旨在解决计算机目前执行此类任务时存在的一个特定问题。以下是使用简单类比进行的分解说明:

问题:“模糊的集体照”

目前,大多数人工智能方法的工作流程如下:它们将视频切分成微小的片段(patch),然后立即将所有这些片段压缩成一个巨大的、模糊的摘要(即“全局表示”),然后再尝试将其与文本描述进行匹配。

  • 类比:想象一下,试图通过拍摄整个拥挤人群的整张照片,将其模糊化直到每个人都看起来像一个单一的颜色色块,然后问:“这个色块是足球运动员吗?”来识别体育场中特定的某个人。
  • 结果:你丢失了精细的细节。你无法看到手臂在哪里移动,或者球棒如何挥动。你丢失了“时空”线索(运动的具体位置和时机)。

解决方案:"4D 相似性图”

作者提出了SimVA,改变了策略。他们不再先模糊视频,而是保留视频的每一个微小片段,并将每个片段直接与文本描述进行比较。

  • 类比:与其制造一个模糊的色块,不如想象创建一个巨大的 4D“热力图”(即相似性体积)。
    • 维度:它映射了视频中的每一个点(空间)、时间中的每一刻(时间)以及每一个可能的动作词(词汇)。
    • 工作原理:对于视频中的每一个像素,人工智能会问:“这看起来有多像‘刷牙’?”它对每一帧和每一个词都进行这样的操作。
    • 结果:你得到了一张丰富、详细的地图,精确显示动作在哪里以及何时发生,而不是一个模糊的猜测。

挑战:数据量过大

每一个可能的动作词构建这种巨大的 4D 图,对计算机来说负担太重(这就像试图同时阅读图书馆里的每一本书)。

  • 解决方法(类别采样):人工智能使用一个智能过滤器。它首先快速粗略地浏览整个视频,以猜测哪 100 个动作词最有可能相关。然后,它针对这 100 个词构建详细的 4D 图。这使得过程既快速又高效,同时不会丢失重要细节。

优化过程:通往清晰的三个步骤

一旦人工智能拥有了这个 4D 图,它就会通过三个具体步骤对其进行优化,以提高答案的准确性:

  1. 空间聚合(“上下文”步骤)

    • 作用:它查看相邻的像素,以确保它们达成一致。如果一个像素说“这是球棒”,而旁边的像素说“这是水”,人工智能会平滑处理这些差异,以理解整个物体。
    • 类比:这就像侦探询问邻居:“你看到嫌疑人了吗?”以确认故事,而不是依赖单一不可靠的证人。
  2. 运动感知调制(“运动”步骤)

    • 作用:它专门寻找帧与帧之间移动的事物并将其高亮显示,同时忽略静态的背景内容(如墙壁或树木)。
    • 类比:想象用荧光笔观看视频。这一步高亮显示移动的部分(挥动的手臂),并调暗静态的部分(背景),使人工智能专注于动作,而不是风景。
  3. 时间聚合(“故事”步骤)

    • 作用:它将时间线上的点连接起来。它观察“相似度”如何从一秒变化到下一秒,以理解动作的流动。
    • 类比:这就像阅读连环画。你不仅仅看一个面板,而是阅读整个序列以理解故事(例如,球向上飞,然后落下)。本文使用一种名为Mamba的特殊工具来高效地阅读这个“故事”。

结果

本文声称,通过保留这些细粒度的细节并在“相似性空间”中处理它们(而不是先模糊它们),SimVA 的表现优于以往的方法。它在识别动作方面更加准确,特别是在以下情况:

  • 零样本:从未见过的动作。
  • 少样本:仅看到少量示例的动作。
  • 基础到新颖:区分已知动作与新出现的相似动作。

简而言之,SimVA阻止人工智能对视频“眯着眼看”,而是迫使它同时关注精细细节、运动和时机,从而对视频中发生的事情产生更智能的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →