← 最新论文
💻 computer science

QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding

本文提出了 QCA,一种无需训练、具备查询与内容感知能力的关键帧选择框架,该框架通过动态分配帧预算并优化多样性,以显著少于现有方法的帧数,实现了最先进的长视频理解性能。

原作者: Jun Peng, Baiyang Song, Jie Li, Hui Li, Yiyi Zhou, Rongrong Ji, Yonghong Tian

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Jun Peng, Baiyang Song, Jie Li, Hui Li, Yiyi Zhou, Rongrong Ji, Yonghong Tian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位朋友解释一部两小时长的电影,但你只有时间展示 128 张微小的快照(帧)。

如果你使用标准方法,即所谓的 “均匀采样”(Uniform Sampling),这就像是无论发生什么,每隔 30 秒就拍一张照片。你可能会拍到角色在睡觉、在走路或在吃饭的镜头。但如果最重要的时刻——比如角色突然拔出枪——发生在第 29 秒,你的相机会在开枪前一刻和开枪后一刻分别拍下照片,从而完全错过了这个动作。你最终得到的是一个乏味、重复且错失剧情的幻灯片。

这篇论文介绍了一种更聪明的挑选快照的方法,叫做 QCA(查询与内容感知)。你可以把 QCA 想象成一位 超级智能的电影剪辑师,他在你提出问题之前就先看完了整部电影,然后根据你的特定问题挑选出最完美的 128 帧画面。

以下是 QCA 的工作原理,分为三个简单的步骤:

1. “分而治之”策略

首先,QCA 将长视频切分成较小的块(就像书中的章节一样)。它不会以同样的方式对待视频中的每一分钟。

  • 类比: 想象你正在一本推理小说中寻找特定的线索。你不会以同样的强度阅读每一页。你会略读那些无聊的天气描写,但会非常仔细地阅读犯罪现场的页面。
  • QCA 的做法: 它观察视频中的每个“章节”,并询问两个问题:
    1. 相关性(Relevance): 这个部分的内容是否与你提出的问题相匹配?(例如,如果你问“谁在跑步?”,它会寻找跑步的场景)。
    2. 多样性(Variety): 这个部分是否与其他部分不同?(例如,如果整部电影都是一个人坐在椅子上,但突然间他站了起来,那么这就是一个值得捕捉的“偏差”)。

2. “智能预算”

一旦 QCA 知道哪些章节很重要,它就会决定从每个章节中提取多少张照片。

  • 类比: 把你的 128 张照片看作是一笔 预算。如果一个章节很无聊且不相关,QCA 几乎不会在这个章节上花钱。如果一个章节是电影的高潮且充满动作场面,QQCA 会在那里投入一大笔预算。
  • 结果: 与其均匀分布照片,不如在精彩的部分堆叠大量照片,而在无聊的部分只保留极少数照片。

3. “锚点与扩展”选择法

在这些重要的章节内部,QCA 会挑选出实际的帧。

  • 锚点(The Anchor): 首先,它会挑选出能够直接回答你问题的单帧最佳画面。(例如,拔枪的那一瞬间)。
  • 扩展(The Expansion): 然后,它会在同一个章节中寻找其他既与第一帧不同、又与问题相关的帧。(例如,描述一场打斗戏时,你选了一张出拳的照片作为“锚点”;接着,你会寻找一张人倒下的照片作为“多样性”展示。你会避免连续挑选 10 张出拳的照片,因为那是冗余的。你需要的是能讲述该特定时刻完整故事的照片。)

为什么这很重要?

论文声称,通过使用这种方法,计算机(特别是理解视频的 AI 模型)可以比以前更好地回答关于长视频的问题,即使它们被迫只能查看极少的帧。

  • 证据: 作者在几个困难的视频测试中进行了测试。当他们使用仅有 128 帧 的 QCA 方法时,AI 的得分达到了 67.8%
  • 对比: 一个非常强大且昂贵的 AI(GPT-4o)尝试回答同样的问题,但它被允许查看 256 帧(两倍于 QCA 的数据量)。即便拥有双倍的数据,GPT-4o 的得分也仅为 66.7%

最棒的部分:无需额外训练

通常,要让 AI 变得更聪明,你需要喂给它数千小时的数据来“教”它如何完成任务。这就像雇佣一名家教并进行数月的辅导。

  • QCA 的窍门: 这种方法 无需任何训练。它就像是给 AI 配戴了一副新的眼镜,帮助它看得更清楚,而不需要改变 AI 的大脑。你可以将它接入几乎任何现有的视频 AI 系统,并立即发挥作用。

总结

简而言之,QCA 是一个工具,它能阻止视频 AI 在无聊、重复的部分浪费时间。相反,它扮演着一位智能剪辑师的角色,只将有限的“照片预算”花在真正与你的问题相关的时刻,确保 AI 看到最重要的证据,从而给出正确的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →