← 最新论文
💬 NLP

Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference

本文提出了一种名为 ASL 的免训练方法,通过利用注意力分数排序的令牌方差来自适应地选择关键层进行令牌剪枝,从而在满足 KV 缓存预算的同时,显著提升了大语言模型在困难任务中的推理精度与性能平衡。

原作者: Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ASL (Adaptive Selection Layer,自适应选择层) 的新方法,旨在解决大型语言模型(LLM)在处理超长文本时遇到的“内存爆炸”和“反应迟钝”的问题。

为了让你轻松理解,我们可以把整个 LLM 推理过程想象成一位正在阅读一本厚达 10 万页的百科全书的“超级侦探”

1. 背景:侦探的困境(KV Cache 问题)

想象一下,这位侦探(LLM)正在读一本巨书。为了回答问题,他必须记住之前读过的所有关键信息。

  • KV Cache(键值缓存):就是侦探脑子里的“笔记”。每读一页,他就要记下一笔。
  • 问题:如果书有 10 万页,他的脑子(显存)根本装不下这么多笔记。笔记太多,不仅占地方,而且每次找信息都要翻遍所有笔记,速度极慢。

2. 现有的笨办法:固定剪枝(Layer-wise Token Pruning)

为了解决脑子装不下的问题,以前的方法(如 FastKV)想出了一个策略:“只记重点,扔掉废话”

  • 做法:他们规定,侦探读到第 15 页时,必须停下来,把前 15 页里最重要的 100 个词挑出来记在脑子里,剩下的几千个词全部扔掉。从第 16 页开始,只基于这 100 个词继续读。
  • 缺点:这个“第 15 页”是死板规定的,不管书的内容是什么。
    • 简单任务(比如问“书里第一章讲了什么”):侦探在第 5 页就能找到答案。在第 15 页才做决定,虽然有点晚,但还能接受。
    • 困难任务(比如“在 10 万页里找一句特定的暗语”):侦探可能读到第 50 页还在迷茫,因为线索太隐蔽。如果强行在第 15 页就扔掉其他词,他可能把真正的线索也扔了,导致完全找不到答案

这就好比:不管你是去超市买瓶水(简单),还是去大海捞针(困难),保安都规定你在进门的第 10 步就必须扔掉身上 90% 的行李。买水的人觉得没事,但捞针的人早就把针扔了。

3. 核心创新:ASL(自适应选择层)

这篇论文提出的 ASL,就像给侦探配了一个聪明的“直觉助手”。这个助手不规定死在第几页做决定,而是观察侦探的“注意力”变化

核心原理:看“排名”变不变

助手会观察侦探对书中每个词的“关注度”(注意力分数):

  1. 刚开始读(浅层):侦探对书里的词都很模糊,觉得“这个好像有点用,那个也好像有点用”,大家的关注度排名忽高忽低,变化很大(方差大)。这时候扔东西太早,容易扔错。
  2. 读到深处(深层):侦探终于看明白了!“啊!原来只有这几个词是关键的!”此时,关键词的排名非常稳定,不再乱跳(方差变小)。

ASL 的策略

  • 助手会一直盯着这个“排名稳定性”。
  • 一旦它发现:“嘿,侦探的注意力已经稳定地集中在某几个词上了,排名不再剧烈波动了!”
  • 立刻喊停:“就是现在!把不重要的词扔掉,只保留这几个核心词!”

比喻

  • 旧方法:不管你在听什么歌,都在第 30 秒切歌。
  • ASL:监听你的心跳。如果你听的是轻音乐,心跳平稳,第 10 秒就切;如果你听的是摇滚,心跳剧烈,那就等到第 60 秒心跳平稳了再切。它根据任务的“难度”自动调整时机。

4. ASL 带来的好处

  1. 简单任务不浪费:如果是简单的问答,侦探很快就能锁定重点,ASL 会早早地(比如第 10 层)就让他开始“精简笔记”,速度飞快
  2. 困难任务不丢分:如果是很难的“大海捞针”任务,ASL 会等到侦探彻底想明白(比如第 25 层)再让他精简,准确率极高
  3. 灵活适应:不需要人工去调参数,它自己就能根据任务难度决定“什么时候开始扔垃圾”。

5. 实验结果:真的好用吗?

作者让 ASL 和现有的“死板方法”(如 FastKV)在三个大考(InfiniteBench, RULER, NIAH)中 PK:

  • 找针任务(NIAH):在 25 万字的长文中找一句话。旧方法经常找丢,ASL 几乎全对。
  • 复杂推理:在长文档中做数学题或代码调试。ASL 的准确率明显高于旧方法。
  • 速度:虽然 ASL 因为要“观察”一下再决定,比死板方法稍微慢了一点点(就像多花了一秒思考),但它用这点微小的时间代价,换来了巨大的准确率提升。特别是在最难的任务上,它完胜对手。

总结

ASL 就像是一个“懂行”的图书管理员。
以前的管理员不管书多难,都机械地在第 15 页开始删书。
ASL 这个新管理员会观察读者(模型)的读书状态:“你看起来还在迷茫,先别删,继续读;哦,你眼神亮了,思路清晰了,好,现在可以开始删掉废话了!”

这种方法让大模型在处理超长文本时,既省内存,又不丢分,还能自动适应各种难度的任务,是长文本推理领域的一大进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →