← 最新论文
🤖 AI

AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding

AdaFocus 是一个高效的长视频理解框架,它通过结合查询感知的自适应相关性 - 多样性采样器与不确定性触发的零缓存磁盘检索机制,克服了一致性单次编码的局限性,从而按需逐步获取高分辨率证据,在多个基准测试中实现了更优的精度 - 效率权衡。

原作者: Xiao Yang, Yingzhe Ma, Haoxuan Yu, Zixin Li, Ning Qin

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiao Yang, Yingzhe Ma, Haoxuan Yu, Zixin Li, Ning Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过观看一部两小时的电影来解开一个谜团,但你只有极少量的内存来在脑海中保存这些画面。

问题:“全有或全无”的困境
当前的 AI 模型在观看长视频时面临艰难抉择:

  1. “蛮力”方法:它们试图记住每一帧。这就像试图 memorize 整部电影的每一秒。这过于沉重、过于缓慢,且常因一次性处理的信息量过大而导致 AI 困惑。
  2. “略读”方法:它们随机挑选几帧以节省内存。这就像翻书时只读第 1 页、第 50 页和第 100 页。问题在于?你可能会错过发生在第 49 页的关键线索。

解决方案:AdaFocus
该论文引入了 AdaFocus,一种更智能的视频观看方式。AdaFocus 不像试图记住一切或随机猜测,它更像是一位手持放大镜的侦探。它分两个主要阶段工作:

阶段一:“快速一瞥”(自适应预览)

首先,AI 以极快的速度、低分辨率浏览整个视频(就像以每秒 1 帧的速度观看电影预告片)。

  • 智能过滤器:它并非随机挑选帧,而是自问:“这一帧是否匹配我试图回答的问题?”
  • 安全网:如果问题模糊(例如:“视频的整体氛围是什么?”),AI 会切换到“广角”视角,以确保不错过整体画面。
  • 结果:它构建了一个微小而完美的视频“预览”,能轻松放入其内存中。

阶段二:“零缓存回看”(魔法技巧)

这是该论文最大的创新。通常,如果 AI 意识到自己遗漏了细节,它必须将整个视频重新加载到内存中以再次检查。这既缓慢又昂贵。

AdaFocus 的做法不同:它将视频保留在硬盘(“磁盘”)上,仅在需要时、在需要的那一刻,才提取所需的特定场景。

  • 置信度检查:在“快速一瞥”之后,AI 回答问题。但它也会检查自身的置信度:“我对此确定吗?”
  • 触发机制:如果 AI 不确定(置信度低),它不会惊慌。它会问:“我在视频的哪个部分感到困惑?”
  • 检索:它利用特殊的“零缓存”系统,瞬间跳转到硬盘上的特定时间戳,提取一段高质量的 3 秒片段并查看。这一过程无需将电影其余部分加载到内存中。
  • 重新作答:凭借这些新的、高质量的证据,它再次回答问题。

为何重要(结果)

作者在七个不同的视频挑战中测试了该方法。他们的发现如下:

  • 更高的准确率:AdaFocus 的得分显著优于其他方法。例如,在名为 VideoMME 的视频理解测试中,其准确率提高了 2.59 分。在名为 Charades-STA 的任务(精确定位视频中某事发生的时刻)中,其提升幅度高达 8.39 分
  • 超高效:与“蛮力”方法相比,它使用的“视觉令牌”(内存单元)减少了约 33 倍。这就像仅使用 33% 的拼图碎片却能获得更好的结果。
  • 无内存过载:由于它仅在必要时从磁盘提取数据,因此无需将整个视频存储在计算机昂贵的高速内存(RAM/VRAM)中。

核心结论

AdaFocus 通过将长视频理解视为渐进式调查而非一次性记忆测试,彻底改变了游戏规则。它先快速浏览,检查自身是否确信;若不确定,则进行针对性的、按需的“回看”以寻找缺失的线索。这使得 AI 能够在无需超级计算机将整个电影装入脑海的情况下,以高精度理解长而复杂的视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →