← 最新论文
🤖 machine learning

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

该论文提出了名为 DIG 的免训练框架,通过区分全局与局部查询类型,分别采用高效均匀采样和查询感知帧选择策略,在显著降低计算成本的同时提升了大模型对长视频的理解性能。

原作者: Jialuo Li, Bin Li, Jiahao Li, Yan Lu

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Jialuo Li, Bin Li, Jiahao Li, Yan Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 DIG 的新方法,旨在解决大模型(LMMs)在处理超长视频时遇到的“消化不良”问题。

为了让你轻松理解,我们可以把看视频比作吃一顿大餐,把AI 模型比作一位胃口有限但知识渊博的食客

1. 核心难题:胃口有限,视频太长

现在的 AI 模型(食客)虽然很聪明,但它的“胃口”(上下文长度)是有限的。

  • 现状:面对一个长达几小时的视频(比如一部电影或纪录片),如果把每一帧画面(每一道菜)都塞给 AI 吃,它根本吃不消,要么直接“撑死”(报错),要么因为吃太多垃圾信息而“消化不良”(答非所问)。
  • 旧方法:以前的做法是“均匀采样”,就像不管视频讲什么,每隔 10 分钟就夹一口菜给 AI 吃。
    • 问题:如果视频前 10 分钟在讲风景,后 10 分钟在讲关键剧情,而你的问题是“主角最后说了什么?”,均匀采样可能会漏掉关键剧情,或者塞给你一堆无关的风景菜。

2. 论文的重大发现:问题分两种,吃法也要分两种

作者发现,并不是所有问题都需要“精挑细选”。他们把问题分成了两类:

  • 第一类:全局问题 (Global Query)
    • 例子:“这部电影的主题是什么?”、“视频里主要讲了什么故事?”
    • 比喻:这就像问食客“这顿饭整体是什么风味?”。这时候,均匀采样(每隔一段夹一口)反而最有效!因为你需要尝遍整桌菜,才能知道整体味道。这时候搞复杂的“挑菜”反而浪费时间和力气,效果还不好。
  • 第二类:局部问题 (Localized Query)
    • 例子:“那个穿红衣服的人在第几分钟摔倒了?”、“主角最后手里拿的是什么?”
    • 比喻:这就像问食客“那道红烧肉在哪?”。这时候,如果你还均匀地乱夹,很可能夹了一堆青菜(无关画面),却漏掉了红烧肉(关键信息)。这种情况下,必须精准挑菜,只把关键的那几口给 AI 吃。

以前的误区:大家以前觉得,为了回答所有问题,都必须搞一套复杂的“智能挑菜”系统,结果导致计算成本极高,而且对“全局问题”来说纯属多余。

3. 解决方案:DIG (Divide, then Ground)

作者提出了 DIG 框架,它的核心思想是:先分类,再行动

第一步:智能分类 (Divide)

在开始处理视频前,先让一个“大管家”(一个强大的语言模型)看一眼你的问题:

  • 如果是“全局问题”,管家说:“别费劲了,直接均匀夹菜吧!”(高效、省钱)。
  • 如果是“局部问题”,管家说:“好,启动‘精准挑菜’模式!”(虽然费点劲,但值得)。

第二步:精准挑菜 (Ground)

一旦确认为“局部问题”,DIG 会执行一套特殊的流程:

  1. 内容自适应筛选 (CAFS):它不看时间,而是看画面内容。比如,画面从“森林”突然变成“城市”,或者“猫”变成了“狗”,它就知道这里有重要转折,把这种关键帧(r-frames)挑出来。这就像在长视频里快速扫描,只保留场景变化的节点。
  2. AI 打分 (Reward Assignment):挑出来的这些关键帧,再交给 AI 模型自己打分:“这张图对回答问题有帮助吗?”
    • 如果有帮助,保留。
    • 如果没帮助,扔掉。
  3. 视频精炼:把高分的关键帧及其周围的一小段视频(为了保留上下文连贯性)拼接起来,形成一个新的、精简版的“小视频”。
  4. 最终进食:最后,再从这个“小视频”里均匀采样,喂给 AI 模型。

4. 效果如何?

  • 更聪明:在三个著名的长视频测试基准上,DIG 的表现都超过了现有的所有方法。
  • 更稳健:即使把输入的视频帧数从 8 帧增加到 256 帧(相当于把菜量加倍),其他方法可能会因为“吃撑了”而表现下降,但 DIG 依然能保持甚至提升准确率。
  • 更省钱:因为它对简单问题(全局问题)不瞎折腾,只在必要时才动用复杂算力,所以整体效率很高。

总结

这篇论文就像给 AI 配了一位聪明的点菜员

  • 如果你问的是整体感受,点菜员就按固定菜单上菜,简单快捷。
  • 如果你问的是具体细节,点菜员就化身美食侦探,在几千道菜里精准找出你最爱的那几道,剔除所有干扰项。

这种方法让 AI 在处理长视频时,既不会“撑死”,也不会“漏掉关键信息”,真正实现了按需分配,物尽其用

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →