← 最新论文
💻 computer science

One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding

该论文提出了名为 X-Comp 的极端压缩模型,通过引入可学习的渐进式 Token 级压缩和基于 LLM 注意力分数的查询条件帧级选择,并结合局部注意力机制缓解位置偏差,实现了长视频理解中“每帧一个 Token"的高效压缩,在显著增加采样帧数的同时提升了模型性能。

原作者: Zheyu Zhang, Ziqi Pang, Shixing Chen, Xiang Hao, Vimal Bhat, Yu-Xiong Wang

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Zheyu Zhang, Ziqi Pang, Shixing Chen, Xiang Hao, Vimal Bhat, Yu-Xiong Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 XComp 的新方法,旨在解决人工智能(AI)在理解超长视频时遇到的“记不住”和“算不过来”的难题。

为了让你轻松理解,我们可以把 AI 看成一个正在备考的超级学生,把长视频看成一本厚厚的百科全书

1. 以前的困境:学生被书压垮了

想象一下,老师(AI 模型)要让学生看完一本 1000 页的百科全书,然后回答一个关于书里某个细节的问题。

  • 问题所在:以前的 AI 模型就像个记性不好的学生。它把每一页(每一帧视频画面)都拆成几百个碎片(Token)来记忆。如果书太厚(视频太长),碎片数量就会超过它的“大脑容量”(上下文长度限制)。
  • 后果:为了不让大脑爆炸,以前的方法只能粗略地翻书。比如,它可能只读第 1 页、第 100 页、第 200 页……中间的内容全跳过了。结果就是,它错过了很多关键情节,答错了问题。

2. XComp 的核心绝招:两个“魔法”

XComp 提出了两个聪明的策略,让学生既能读完整本书,又能记住关键细节,而且不费脑子。

魔法一:学会“提炼精华” (LP-Comp)

  • 以前的做法:像做物理题一样,直接扔掉不重要的碎片(比如把第 100 页的 100 个碎片直接删掉 99 个)。这很危险,因为扔掉的碎片里可能藏着答案。
  • XComp 的做法:它训练学生主动学习如何“压缩”
    • 比喻:想象学生每读完一页,就立刻在脑子里把这一页的几百个细节,提炼成一句最核心的“金句”
    • 效果:不管书有多厚,最后他脑子里只存着“每页一句金句”。这样,1000 页的书就变成了 1000 句金句,大脑完全装得下,而且没有丢失核心信息。
    • 关键点:这种“提炼”能力不是靠死记硬背(启发式规则),而是通过专门训练(Supervised Tuning)学会的,就像请了一位私教教学生如何写摘要。

魔法二:学会“有的放矢” (QC-Comp)

  • 以前的做法:即使每页只存一句金句,如果书有 10000 页,学生还是得读 10000 句,太累了。而且,学生容易犯“首尾效应”——只记得开头和结尾,中间的内容容易忘(Lost in the Middle)。
  • XComp 的做法:它让学生先看题目,再找书
    • 比喻:老师问:“书里那个穿红衣服的人在做什么?”
    • 操作:学生不会从头读到尾。他会利用一种“雷达”(注意力机制),快速扫描整本书,只把那些提到“红衣服”的页面挑出来,其他的直接忽略。
    • 解决“首尾效应”:为了防止学生只记得开头和结尾,XComp 把书切成很多小段(比如每 64 页一段),让学生分段阅读。这样,每一段的开头和结尾都是独立的,学生就不会漏掉中间段落的细节了。

3. 最终成果:超级学霸

通过这两个魔法的结合,XComp 做到了:

  1. 极度压缩:把每一帧视频压缩成仅仅 1 个 Token(就像把一页书变成一句话)。
  2. 精准筛选:只保留和问题最相关的画面。
  3. 效率爆表
    • 以前只能看 100 帧,现在能看几千帧
    • 以前看长视频像“走马观花”,现在能“细节满满”。
    • 训练成本极低:只需要用2.5% 的数据量就能训练出这种能力(就像只用了 2.5% 的练习题,学生就学会了所有解题技巧)。

总结

这就好比:
以前看长视频,AI 像是在大海里捞针,只能随机捞几把,很容易漏掉。
现在有了 XComp,AI 就像拥有了超级磁铁(学会提炼)和精准导航(学会筛选),不仅能轻松看完整部 1 小时的电影,还能精准地告诉你电影里第 35 分钟那个穿红衣服的人到底在干什么,而且脑子还不累!

一句话总结:XComp 让 AI 学会了如何把长视频“读薄”,既保留了所有关键信息,又极大地提高了阅读速度和理解能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →