← 最新论文
💻 computer science

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

本文提出了一种名为 STC 的即插即用分层压缩框架,通过缓存重用相似帧特征(STC-Cacher)和压缩视觉 Token 序列(STC-Pruner),在显著降低 ViT 编码与 LLM 预填充延迟的同时,保持了极高的视频理解准确率。

原作者: Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

发布于 2026-02-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

1. 遇到的难题:解说员的“大脑过载”

想象一下,你正在看一场极其激烈的足球直播。

  • 传统的 AI(像个死脑筋的速记员): 他每秒钟都要把画面里的每一个像素、每一个球员、每一根草皮都重新画一遍,记在笔记本上。因为视频帧数极多,他的笔尖快冒烟了(计算量巨大),笔记本很快就写满了(内存爆炸),导致他反应越来越慢,甚至直接卡死。
  • 实时性的挑战: 这种解说员不能等整场比赛结束了再总结,他必须在进球发生的瞬间就喊出来。但目前的 AI 还没法在保持“高智商”的同时,做到这么高的“反应速度”。

2. STC 的绝招:两层“减负”策略

STC 就像给这个解说员请了两个超级助手,分别负责**“眼睛”“大脑”**。

第一招:STC-Cacher —— “眼睛”的省力法(针对视觉编码阶段)

比喻:盯着“动”的地方,忽略“不动”的地方。

在足球赛中,大部分时间背景(观众席、草地、广告牌)是几乎不动的。

  • 笨办法: 每一秒钟都重新观察一遍草地长什么样。
  • STC-Cacher 的做法: 它会先拍一张“标准照”(参考帧)。在接下来的几秒钟里,如果发现画面大部分还是原来的样子,它就直接**“复用”之前的记忆,只把那些“动起来”**的东西(比如飞奔的球员、飞出的足球)重新观察一遍。
  • 效果: 眼睛不用时刻全神贯注看所有细节,只盯着变化,大大节省了体力(降低了 ViT 编码的计算量)。

第二招:STC-Pruner —— “大脑”的精简法(针对语言模型阶段)

比喻:只记“重点”,不记“废话”。

解说员的笔记本(LLM 的输入)如果记了太多废话,他思考起来就会变慢。

  • 笨办法: 把每一秒钟看到的画面细节全部写进笔记。
  • STC-Pruner 的做法: 它有两个“过滤器”:
    1. 时间过滤器(跟过去比): “刚才那球已经踢过了,不用再记一遍了。”
    2. 空间过滤器(跟当前比): “这一片全是草地,没啥信息量,跳过!”
  • 结果: 它只把那些**“既跟过去不一样,又跟当前背景不一样”**的精华信息(比如突然出现的红牌、进球瞬间)记在笔记上。
  • 效果: 笔记变得非常精简,解说员(LLM)读笔记的速度飞快,反应极其灵敏。

3. 总结:STC 到底厉害在哪?

如果用一句话总结,STC 就是让 AI 学会了**“抓重点”**:

  1. 看的时候不累: 看到没变化的东西就“查字典”复用,只看新变化(STC-Cacher)。
  2. 记的时候不乱: 剔除重复和无意义的信息,只留精华(STC-Pruner)。

最终战果:
在实验中,这种方法让 AI 的反应速度提升了非常多(比如 LLM 预处理延迟降低了 45.3%),而且最神奇的是,它几乎没有变笨(准确率保留了 99%)。

这意味着,未来的 AR 眼镜或智能助手,可以像真人一样,一边流畅地看视频,一边实时、聪明地跟你聊天,而不会因为“脑子转不过来”而卡顿。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →