← 最新论文
💻 computer science

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

本文介绍了 DAFS,一种针对长视频的无需训练的动态帧选择方法,该方法利用多模态大语言模型(MLLM)中的查询条件化跨模态注意力机制,在无需自回归生成的情况下高效识别相关帧,在严格的预算限制下显著优于均匀采样和基于先验训练的采样方法。

原作者: Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人去理解一部电影。这个机器人被称为“多模态大语言模型”(简称 MLLM),它就像一个天才学生,既能阅读文本,也能观察图片来回答问题。但问题在于,这个天才的注意力非常短暂。如果你试图通过向它展示每一帧画面(这其中有成千上万帧!)来展示一部完整的两小时电影,机器人的大脑就会过载并崩溃。它根本无法一次性处理这么多信息。

因此,科学家们面临的一个重大挑战是:我们如何从一部长电影中挑选出仅仅几个关键时刻展示给机器人,使其仍能理解整个故事?这有点像通过只给朋友看几页书来解释整部小说。如果你选错了页面,他们会感到困惑;如果你选对了页面,他们就能完美理解剧情。问题的关键在于,在还没读完整本书之前,你如何知道哪些页面是“正确”的呢?这正是这篇论文试图解决的棘手谜题。


问题:“鸡生蛋,蛋生鸡”的困境

研究人员注意到,计算机处理长视频的方式存在一个有趣的循环。为了从视频中挑选出最好的帧,你需要先理解视频;但为了理解视频,你需要先挑选出最好的帧。这就像是在品尝汤的味道之前,就试图找出汤里最好的食材一样。

目前大多数方法试图通过以下两种方式解决这个问题:

  1. 随机挑选帧: 就像从书中随机抽取页面一样。这种方法很快,但你可能会错过最重要的剧情转折。
  2. 使用“聪明但缓慢”的机器人: 一些方法使用沉重且复杂的 AI 来阅读视频并决定哪些部分重要。但这非常耗时,且需要消耗大量的计算能力,使得处理超长视频变得困难。

解决方案:“DAFS”侦探

由 Yilin Wang 及其同事领导的研究团队提出了一种聪明、免费且快速的解决方案,称为 DAFS(基于动态注意力的预算感知帧选择)。

把 DAFS 想象成一个在稍大的机器人内部工作的微型、高效的侦探。它是这样运作的:

1. “瞥一眼”的技巧(注意力)
研究人员发现,甚至在机器人完成对问题的“思考”之前,它就已经瞥见了图像中最重要的部分。在机器人的大脑中,存在着层层处理机制。在特定的中间层,机器人的“注意力”(即它的精神专注点)会自然而然地聚焦在与问题相匹配的视频部分上。

  • 类比: 想象你在人群中寻找某人,同时有人问你:“那个戴红帽子的人在哪里?”你的眼睛不会平等地扫描每个人,而是会瞬间跳向红帽子。论文发现,机器人在不需要被教导或无需预先“阅读”整个视频的情况下,会自动完成这种操作。

2. “无需训练”的魔力
通常,要让机器人擅长挑选帧,你需要用成千上熟的例子对其进行数小时的训练。DAFS 则不需要这样做。它只需观察机器人的自然“瞥视”(注意力图)并说:“啊哈!机器人已经在看正确的地方了。我们就抓取那些帧吧。”这意味着它可以立即应用于任何视频,而无需额外的训练。

3. “预算”平衡术
机器人有一个严格的信息承载限制(“Token 预算”)。你不能在只能处理 32 个 Token 的情况下展示 100 帧。

  • 类比: 想象你有一个背包,只能装下 32 件物品。如果你有一个 10 分钟的视频,你可能想挑选 32 帧。但如果是一个 2 小时的视频,你不能只挑 32 帧并试图覆盖整个故事;你必须减少挑选的帧数,但要让它们发挥更大的作用。
  • 论文使用了一种称为动态规划的数学策略来计算完美的组合。它决定:“对于短视频,我们挑选较少的帧,但以高细节度展示。对于长视频,我们挑选更多的帧,但以稍微简单一点的方式展示。”这确保了机器人在其背包限制内获得最佳视野。

他们的发现

团队在几个大型视频测试(如 Video-MME 和 MLVU)上测试了他们的方法。结果如下:

  • 优于随机采样: 当他们将 DAFS 与仅仅随机挑选帧(均匀采样)进行比较时,DAFS 要聪明得多。在 Video-MME 测试中,它将得分提高了多达 6.4 分。在 AI 测试领域,这是一个巨大的飞跃。
  • 优于“聪明但缓慢”的机器人: 它甚至击败了其他使用沉重、经过训练的 AI 来挑选帧的方法,但 DAFS 完成得更快,且不需要任何训练。
  • 无处不在: 最酷的部分是,这个“侦探”可以配合不同类型的机器人(不同的 AI 模型)以及不同类型的提问工作。你不需要在每次更换机器人或任务时都重新训练它。

结论

论文表明,我们不需要构建庞大、缓慢的系统来理解长视频。相反,我们可以使用一个轻量级的辅助工具,通过倾听机器人的自然“瞥视”来挑选最重要的时刻。

通过使用这种方法,研究人员证明了一个规模较小的机器人(仅有 20 亿参数)可以如此出色地挑选帧,以至于一个规模大得多的机器人也能高精度地回答关于长视频的问题。他们证明了你可以在不花费数小时训练或使用昂贵计算能力的情况下获得最佳结果。这有点像是意识到,寻找干草堆里的针,最好的方法不是搜遍整个干草堆,而是直接问干草堆,针藏在哪里——而在这种情况下,干草堆(AI)已经在指引方向了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →