← 最新论文
💻 computer science

Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning

本文提出了名为 SCORE 的统一框架,通过引入基于惊喜增强状态表示的自适应策略网络,利用强化学习动态压缩视频令牌,在显著降低计算成本(实现 16 倍预填充加速)的同时,在极低保留率下仍保持了接近原始性能的长视频理解能力。

原作者: Shida Wang, YongXiang Hua, Zhou Tao, Haoyu Cao, Linli Xu

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Shida Wang, YongXiang Hua, Zhou Tao, Haoyu Cao, Linli Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 SCORE 的新方法,旨在解决人工智能(AI)在“看”长视频时遇到的一个巨大难题:信息过载

想象一下,你让一个超级聪明的 AI 助手看一部 1 小时的电影,然后问它剧情讲了什么。现在的 AI 模型(特别是多模态大语言模型)会把每一帧画面都拆解成成千上万个“视觉碎片”(Token)来理解。

这就好比让 AI 去读一本 1000 页的书,但书里 90% 的页面都是重复的空白页或者静止的风景画。AI 不得不把这些“废话”全读一遍,结果不仅读得慢(计算成本太高),而且读着读着就忘了前面说了什么(论文里叫“上下文腐烂”,Context Rot)。

为了解决这个问题,作者们发明了 SCORE,我们可以把它想象成一位**“超级精明的剪辑师”**。

1. 核心问题:AI 为什么会“晕”?

  • 现状:现在的视频压缩方法太死板。有的像“复印机”,不管内容是什么,都机械地删掉一半(比如每 3 帧删 1 帧);有的像“老式筛选器”,只根据简单的规则(比如颜色相似就删)。
  • 后果:这些方法要么删掉了重要的剧情(比如主角突然拔剑的瞬间),要么留下了太多没用的背景(比如静止的蓝天)。AI 被大量无用的信息淹没,导致反应变慢,甚至理解错误。

2. 解决方案:SCORE 是如何工作的?

SCORE 的核心思想是**“动态剪辑”,它不像以前那样死板,而是通过强化学习**(一种让 AI 通过试错来学习的机制)自己学会怎么剪。

关键创新点(用比喻解释):

  • “惊喜”信号(Surprise-Augmented State)

    • 比喻:想象你在看视频,如果画面里一只猫在睡觉,下一秒还在睡觉,这很无聊(没惊喜);但如果猫突然跳了起来,或者背景里有人走过,这就叫“惊喜”。
    • 作用:SCORE 会给每一帧画面加上一个“惊喜探测器”。它专门盯着那些发生变化的地方(比如动作、物体移动)。如果画面静止不动,它就告诉 AI:“这部分可以删掉”;如果画面有剧烈变化,它就大喊:“这部分很重要,必须保留!”
    • 效果:这让 AI 能精准地抓住“动”的地方,忽略“静”的背景。
  • “试错”训练法(强化学习与分组策略)

    • 比喻:在训练阶段,SCORE 不像以前那样只剪一次。它像是一个**“剪辑实习生”**,面对同一段视频,它会尝试剪出 16 个不同的版本(有的剪得多,有的剪得少)。
    • 打分:然后,它把这 16 个版本都交给“考官”(冻结的大模型)去回答问题。如果某个版本虽然剪掉了很多字,但回答依然很准确,SCORE 就会得到高分奖励;如果剪过头导致答错了,就会受到惩罚。
    • 进化:通过这种不断的“尝试 - 打分 - 调整”,SCORE 学会了在“保留多少信息”和“删掉多少废话”之间找到完美的平衡点。
  • “从假到真”的进阶训练(课程学习)

    • 比喻:直接让实习生去剪复杂的真实电影太难了,容易学坏。所以,作者先让它在**“假视频”**上练手。这些假视频是由几张静止图片拼成的,变化非常剧烈(要么完全不动,要么突然切换),非常清晰。
    • 作用:先在简单的“假视频”上学会基本的剪辑逻辑,然后再去处理复杂的、充满噪点的真实世界视频。这就像先练练字帖,再写文章一样,让学习过程更顺畅。

3. 成果有多牛?

实验结果显示,SCORE 的表现令人惊叹:

  • 速度快得飞起:在只保留 10% 的视觉信息(相当于把 100 页书删掉 90 页)的情况下,AI 处理视频的速度提升了 16 倍
  • 聪明反被聪明误?不,是更聪明了:在保留 25% 信息时,它的表现甚至比不删减任何信息(原版)还要好!
    • 为什么? 因为原版被太多废话干扰了(上下文腐烂),而 SCORE 把垃圾信息都清理掉了,让 AI 能更专注地看重点。
  • 通用性强:它不仅在一个模型上好用,换到别的模型上也能立刻上手,不需要重新设计。

总结

SCORE 就像给 AI 戴上了一副**“智能墨镜”
以前的 AI 看视频是“全盘接收”,不管好坏都塞进脑子里,结果脑子塞爆了。
现在的 SCORE 让 AI 学会了
“抓重点”:它自动过滤掉静止的蓝天、重复的动作,只把那些“有戏”**(发生突变、有动作)的片段留给大脑处理。

这不仅让 AI 看视频快得像闪电,而且因为去除了干扰,它看得更准、更懂剧情。这对于未来让 AI 实时分析监控视频、理解超长电影或进行实时视频对话,都是巨大的突破。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →