← 最新论文
💬 NLP

What Layers When: Learning to Skip Compute in LLMs with Residual Gates

本文提出了一种名为 GateSkip 的残差门控机制,通过在预训练模型基础上引入可微门控实现逐 token 的层跳过,在保持高准确率的同时显著降低了推理计算量,且具有训练稳定、易于结合其他加速技术等优势。

原作者: Filipe Laitenberger, Dawid Kopiczko, Cees G. M. Snoek, Yuki M. Asano

发布于 2026-02-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Filipe Laitenberger, Dawid Kopiczko, Cees G. M. Snoek, Yuki M. Asano

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

1. 现状:死脑筋的“超级学生”

现在的 AI 模型(比如 ChatGPT 的底层架构)有一个特点:无论问题难还是简单,它每一层、每一个字都要进行“全功率运转”

比喻:
想象你在做数学题。

  • 遇到“1+1=?”这种送分题,你只需要大脑转一下(1秒钟)就能得出答案。
  • 遇到“证明黎曼猜想”这种难题,你需要翻遍图书馆、推演几天几夜。

但现在的 AI 就像一个**“死脑筋学生”:哪怕面对“1+1=?”这种送分题,它也要像面对难题一样,调动全身所有的脑细胞、翻开所有的书、写满几十页草稿纸。这不仅浪费时间**,还极其耗电

2. GateSkip 的核心思想:给大脑装上“智能开关”

研究人员提出了 GateSkip。它给 AI 的每一层大脑都装上了一个**“智能闸门”(Gate)**。

这个闸门的作用是:在处理每一个字(Token)时,先快速判断一下:“这个字重要吗?我需要动用全身力量来处理它吗?”

比喻:
这就像给学生配了一个**“智能助教”**。

  • 当学生看到“的”、“了”、“是”这些没啥营养的虚词时,助教会按住闸门说:“这些字不重要,直接跳过,别浪费脑细胞!”
  • 当学生看到“黎曼猜想”、“化学武器”或者“复杂的逻辑推理”时,助教会立刻打开闸门,大喊:“注意!重点来了!全速运转!”

这就是“按需分配计算资源”:简单的字“走捷径”,难的字“走正道”。

3. 这项技术厉害在哪里?(三大亮点)

① 它是“温和的进化”,而不是“推倒重来”

以前的方法(比如 Mixture-of-Depths)试图强行改变 AI 的思考方式,结果往往会导致 AI “学傻了”(训练不稳定)。
GateSkip 采用的是一种**“平滑的调节”**。它不是直接切断,而是通过一个“调节阀”来控制信息的流量。这就像是在高速公路上加装了智能分流器,而不是直接拆掉路面,所以 AI 能够非常稳定地学会如何“偷懒”。

② “偷懒”的同时,智商反而可能更高

这是一个非常神奇的发现:在某些任务上,即使我们让 AI 跳过了一些计算,它的表现反而变好了!
比喻:
这就像一个学生,因为学会了“抓重点”,不再被那些琐碎的废话干扰,反而能更专注地思考核心逻辑,考试成绩反而提升了。

③ 它是“全能型选手”

GateSkip 不挑食。它不仅能让模型跑得快,还能和现有的其他“瘦身技术”(比如量化、剪枝)完美配合。就像给一个原本就精干的运动员又穿上了轻便的智能运动服,速度更快,负担更轻。

4. 总结:它改变了什么?

  • 更省钱、更省电: 减少了不必要的计算,意味着运行 AI 的成本更低。
  • 更快速: 遇到简单问题秒回,不再“磨磨唧唧”。
  • 更聪明: 能够识别出哪些是“锚点”(比如句首、标点符号),哪些是“核心内容”,从而把精力花在刀刃上。

一句话总结:GateSkip 让 AI 学会了“看菜吃饭”,在简单问题上“走捷径”,在复杂问题上“拼全力”,实现了效率与智力的双赢。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →