AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
本文提出了名为 AdaptToken 的免训练框架,通过利用模型响应熵作为全局控制信号来动态分配长视频理解中的 Token 预算并实现早期停止,从而在显著降低推理成本的同时提升了多模态大模型在长视频任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一种名为 AdaptToken 的新方法,旨在解决人工智能(AI)在看超长视频时遇到的“记不住”和“算不过来”的难题。
为了让你更容易理解,我们可以把 AI 看视频的过程想象成一个学生参加一场极其漫长的考试。
1. 核心难题:学生为什么“晕”了?
现在的 AI 模型(MLLM)很聪明,能看懂短视频。但如果视频长达几小时(比如一部电影或一场马拉松),视频里包含的画面信息(Token)多到惊人。
- 内存爆炸:就像学生的书包塞不进几千本书,AI 的“短期记忆”(显存)装不下这么多帧画面。
- 注意力分散:即使强行塞进去,AI 也会因为信息太多而“晕头转向”,抓不住重点,就像学生在几千页的复习资料里找不到答案。
以前的方法通常是**“挑帧”**:比如每隔 10 秒截一张图。但这就像只看书的目录,可能会漏掉关键细节,或者把很多无关紧要的废话(比如空镜头、背景)也带进去了。
2. 解决方案:AdaptToken 的“聪明策略”
AdaptToken 不需要重新训练 AI,它像是一个聪明的“学习委员”,帮 AI 制定了一套**“自适应复习策略”**。它主要做了三件事:
第一步:把视频切成“复习小组”
它不是一次性看整个视频,而是把长视频切成一个个小段落(Group)。
- 比喻:就像把一本 1000 页的厚书,分成 20 个章节,每次只读一个章节。
第二步:用“自信度”来分配精力(核心创新)
这是 AdaptToken 最巧妙的地方。它利用 AI 自己的**“不确定性”**(熵)来判断哪个段落重要。
- 怎么判断? 当 AI 看完一个段落并尝试回答问题时,它会计算自己有多“自信”。
- 高自信(低熵):AI 说:“这部分内容很关键,我很有把握!” 策略:给这个段落分配更多的“注意力名额”,仔细分析里面的每一个像素细节。
- 低自信(高熵):AI 说:“这部分好像跟问题没啥关系,我有点懵。” 策略:直接忽略大部分细节,只保留最核心的几个词。
- 比喻:就像你在复习时,发现某章内容让你豁然开朗(自信度高),你就多花 90% 的时间精读;发现某章全是废话(自信度低),你就只扫一眼标题,甚至直接跳过。
第三步:见好就收(AdaptToken-Lite)
如果 AI 在看了前几个关键段落之后,已经非常有把握能回答问题了,它就直接停止看后面的视频了!
- 比喻:就像侦探破案,如果在前 10 分钟的视频里已经找到了确凿的凶手证据,就不需要把剩下的 2 小时视频全看完再结案。这能节省一半的时间。
3. 为什么要“去重”?(位置感知)
有时候,连续的几个段落内容其实差不多(比如两个人在说话,背景没变)。如果 AI 把这两个段落都仔细看,就是浪费精力。
- 策略:AdaptToken 会检查选出来的细节,如果发现两个细节太像了(比如都是同一个杯子),它就删掉一个,保留多样性。
- 比喻:就像整理笔记,如果连续三页都写着“今天天气不错”,你就只记一次,把空间留给更重要的内容。
4. 效果如何?
论文在四个著名的长视频测试集上进行了验证,效果非常惊人:
- 更准:在 Qwen2.5-VL 7B 这个模型上,平均准确率提升了 6.7%。这意味着 AI 真的变得更聪明了。
- 更省:即使是 10,000 帧(极长)的视频,它也能处理,而且不会把电脑内存撑爆。
- 更快:使用“见好就收”模式(Lite 版),推理时间减少了一半,但准确率几乎没掉。
总结
AdaptToken 就像给 AI 装上了一个**“智能导航仪”**:
- 它知道哪里是重点(通过 AI 的自信度判断),就把精力集中在那里。
- 它知道哪里是废话,就直接略过。
- 它知道什么时候该停,一旦找到答案就立刻交卷。
这让 AI 在面对超长视频时,不再是“死记硬背”或“盲目浏览”,而是学会了**“有的放矢”**,既看得快,又看得准。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。