← 最新论文
💬 NLP

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

该论文提出了 AVOC,一种受检索启发的令牌压缩框架,通过将令牌选择重新定义为基于相关性、重要性和多样性的 top-KK 检索问题,增强了全模态大语言模型(Omni-Modal LLMs)对小时级音视频内容的理解,从而在长文本基准测试中实现了最先进的性能,并保持了在长达一小时上下文中的鲁棒性。

原作者: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的电影和会议录像库,这些视频往往长达数小时。你想就其中一段长视频向一个超级聪明的 AI 助手提一个非常具体的问题,比如:“在那句特定的台词之后,有多少人走进了地下室?”

问题在于,AI 的“大脑”(它的记忆窗口)太小了,无法一次性容纳整个视频。如果你尝试把整个视频喂给它,它会“卡死”。如果你试图通过只随机抽取一些帧来缩小规模,你可能会错过关键时刻。如果你试图保留每一个细节,你又会耗尽空间。

走进 AVOC:聪明的图书管理员

论文的作者们创造了一个名为 AVOC 的新系统。你可以把 AVOC 想象成一位极其熟练的图书管理员,她的任务是将一部 1 小时的电影总结成一份仅 10 页的“小抄”交给 AI,但她有一个非常明确的目标:这份小抄必须只包含回答你的问题所必需的信息。

AVOC 是如何工作的,我们可以借用搜索引擎寻找最佳结果的三条简单规则来理解:

1. 相关性(Relevance):“这符合问题吗?”

想象一下你问图书管理员:“谁走进了地下室?”

  • 旧方法: 图书管理员可能会给你展示一页关于厨房或天气情况的内容,仅仅因为那些场景很吵闹或色彩鲜艳。
  • AVOC 的做法: AVOC 会先看你的问题。它会扫描视频和音频,然后说:“好吧,我需要找到人们谈论地下室的部分。”它会高亮显示视频中相关的特定时刻以及音频中直接相关的特定词汇。这被称为文本引导评分(Text-Guided Scoring)

2. 重要性(Importance):“即便没有问题,这有趣吗?”

有时,你的问题很模糊,或者答案取决于视频展示了什么,而不仅仅是说了什么。

  • 类比: 想象你在人群中寻找一个特定的人。即使你不知道他们的名字,你也可能因为他们戴着一顶鲜红色的帽子(独特的视觉线索),或者因为他们是唯一在跳舞的人(独特的音频线索)而注意到他们。
  • AVOC 的做法: AVOC 会检查一个时刻本身是否具有“重要性”。它会观察视频和音频是如何相互呼应的。如果一个人的脸部(视频)与特定的声音(音频)相匹配,那么这个时刻就会获得较高的“重要性”评分,即使你的问题并没有提到它。这确保了 AI 不会错过隐藏的线索。

3. 多样性(Diversity):“不要重复给我看同样的东西!”

这是最棘手的部分。如果有一个场景是角色走进房间,然后走出,接着又走回房间,一个愚笨的系统可能会把这三个时刻都选出来,因为它们看起来非常相似。这会浪费空间。

  • 类比: 想象你在为旅行收拾行李。你不需要带三双完全一样的红袜子。你需要一双红色的、一双蓝色的和一双绿色的,以满足不同的需求。
  • AVOC 的做法: AVOC 使用了一种称为**时间感知多样性(Temporal-Aware Diversity)**的特殊规则。它会说:“如果我已经选了一个人走进房间的时刻,我就不会再选择紧接着发生的那个做同样动作的秒数。”但是,如果同样的事情在电影的一个小时后再次发生,AVOC 仍然会 选择那一个,因为它是一个不同的时间事件。这保持了总结的新鲜感,并覆盖了整个时间轴,同时避免了重复。

结果:一个超级聪明的总结

通过结合这三条规则,AVOC 将海量的、长达一小时的视频和音频流压缩成一个极小且高效的“标记(token)”序列。它丢弃了无聊、重复或无关的部分,只保留了那些“黄金碎片”般的信息。

他们发现了什么?

  • 它表现得比任何人都好: 在针对长视频(长达 90 分钟)的测试中,AVOC 回答问题的准确度远高于其他模型。它比排名第二的模型平均高出约 5 个百分点。
  • 它能找到“大海里的针”: 他们测试了 AI 是否能在 1 小时的视频中找到一个隐藏的特定数字。AVOC 几乎完美地找到了它,即使是在长达 1 小时的视频中;而其他模型则随着视频变长而开始失效。
  • 它很快: 尽管它在进行如此复杂的排序,但它并不会显著拖慢 AI 的速度。事实上,由于它丢弃了大量无用的数据,AI 处理视频的速度实际上比以前更快了。

简而言之,AVOC 教会了 AI 如何成为一个更好的阅读者:它不仅仅是读完一本 500 页书里的每一个字,它学会了如何略读、高亮重点并忽略废话,从而能够完美地回答你的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →