← 最新论文
💻 computer science

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

本文提出了 CoRDS,一种基于核心集的视频流理解方法,它通过双目标优化和正交性驱动的多样性准则,从键值缓存中选取紧凑、多样且具有代表性的子集,从而改进了逐 token 启发式剪枝,在固定内存预算下提升了多种视觉 - 语言模型及基准测试的性能。

原作者: Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一部非常长的电影,但只有一张小小的便利贴,用来记录最重要的部分,以便日后回答相关问题。这就是现代人工智能模型(称为视觉 - 语言模型)在尝试实时理解长视频时所面临的挑战。它们无法记住所有内容,因此必须将视频“压缩”成更小的记忆。

本文介绍了一种名为CoRDS(基于核心集的代表性与多样性选择)的新方法来解决这一问题。以下是其工作原理,辅以简单的类比:

问题:“近期性”陷阱

目前,大多数人工智能模型采用的“便利贴”策略依赖于简单的规则,例如:

  • “保留最新内容”:只记住最后几秒钟。
  • “保留最响亮的部分”:只记住看起来最明显或最明亮的部分。

作者认为,这就像试图通过只记住最后一幕或爆炸场面最大的那一幕来总结整部电影。你可能会错过 20 分钟前发生的、安静却至关重要的线索,而这些线索正是日后解开谜题所必需的。

解决方案:“策展人”方法

CoRDS 改变了游戏规则。它不再根据内容的“响亮”程度或“新旧”程度逐个挑选令牌(微小的视频数据片段),而是像一位博物馆策展人,试图打造一个能代表整个馆藏的小型展览。

以下是 CoRDS 使用的三大核心技巧:

1. “双手并用”视角(联合键值表示)
想象每一段视频数据都有两面:

  • “键”(标签):这告诉人工智能在过往中何处寻找。(例如:“这是那辆红色汽车的场景。”)
  • “值”(内容):这是实际的信息。(例如:“红色汽车撞上了一棵树。”)

旧方法往往只关注标签或只关注内容。CoRDS 则同时审视两者。它确保人工智能既能找到正确的记忆,又能保证该记忆确实包含正确的细节。这就像确保你既拥有该地点的地图(键),又拥有该地点的照片(值),而不是只有其中之一。

2. “覆盖全场”策略(核心集选择)
CoRDS 不再挑选单个“最佳”项目,而是问:“哪一小组项目能覆盖房间内最多的范围?”
如果你有一间摆满家具的房间,你不会只挑选最昂贵的那把椅子。你会挑选一把椅子、一张桌子、一盏灯和一块地毯,它们共同代表了整个房间的风格。CoRDS 通过数学方法选择一小组视频帧,使其“覆盖”整个视频历史的几何结构,确保没有任何主要的视觉风格或场景类型被遗漏。

3. “新角度”规则(正交多样性)
有时,你可能会挑选两个非常相似的项目(比如两把相同的红色椅子)。这会浪费空间。CoRDS 有一条规则来防止这种情况:“不要挑选与我们已拥有的东西过于相似的内容。”
它会寻找能提供“新角度”或新方向的项目。如果人工智能已经拥有一段关于红色汽车的记忆,除非这是覆盖该部分视频的唯一方式,否则它不会挑选另一辆红色汽车。它会主动寻找独特、不同的时刻,以使记忆更加多样化。

结果:更智能的记忆,而非更多的记忆

本文在四种不同的人工智能模型和五个不同的视频基准测试(包括长电影和直播流)上测试了该方法。

  • 优于竞争对手:CoRDS 始终胜过使用“近期性”或“响亮性”规则的现有方法(如 InfiniPot-V 和 StreamMem)。
  • 少即是多:即使人工智能被迫使用极小的内存(仅保留 1/16 的视频数据),CoRDS 的表现也优于那些使用旧方法但拥有更大内存的模型。
  • 超越“完整”模型:在某些情况下,CoRDS 的表现甚至优于试图记住整个未压缩视频的人工智能模型。这表明,通过去除视频中“冗余”或“嘈杂”的部分,人工智能实际上能更好地专注于重要线索(从而解决“大海捞针”的问题)。

总结

可以将 CoRDS 视为视频的智能编辑。它不仅仅是剪掉无聊的部分或只保留最新的片段,而是精心挑选一组多样化且具有代表性的时刻,以捕捉整个故事。这使得人工智能能够像观看了整段视频一样,回答关于一小时长视频的问题,却仅需使用一小部分计算机内存。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →