← 最新论文
💬 NLP

Experience-Driven Dynamic Exits for LLMs with Reinforcement Learning

该论文提出了 LEDE,一个利用离线强化学习来动态优化大语言模型退出层和推测长度的框架,实现了相比于标准自回归解码和静态推测基准线的显著推理加速。

原作者: Yanyu Zhu, Hoilam Pao, Niu Hu, Wei Guo, Shaoxiong Zhan, Boyu Lai, Zitai Wang, Yongqin Zeng, Hai-Tao Zheng

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanyu Zhu, Hoilam Pao, Niu Hu, Wei Guo, Shaoxiong Zhan, Boyu Lai, Zitai Wang, Yongqin Zeng, Hai-Tao Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在读一本由超级智能 AI 编写的非常长且复杂的书。每当这个 AI 想要写下一个词时,它都必须进行一场大规模的脑力马拉松,检查其内部“大脑”中的每一个章节,以确保这个词是完美的。这就是当前 AI 模型的工作方式:它为每一个词都要经历整个过程,这使得它们既慢又耗能。

这篇论文介绍了一种名为 LEDE(基于学习的动态退出,Learning-based Dynamic Exit)的新系统,它就像是一个聪明的教练,教导 AI 如何在不损失准确性的情况下寻找捷径。

以下是它的工作原理,使用简单的类比:

问题:“一刀切”的马拉松

目前的 AI 模型使用一种叫做投机采样解码(Speculative Decoding)的方法。你可以把这想象成 AI 有一个“草稿助手”(一个更小、更快的自身版本)来猜测接下来的几个词。然后,主 AI 会检查这些猜测。

然而,目前这种方式是非常僵化的。这就像一位教练在对助手说:“无论句子是什么,永远只猜 4 个词,并且永远在检查完大脑第 5 层后停止。”

  • 问题在于: 有些词很简单(比如“的”或“和”)。AI 不需要通过马拉松来预测它们。而有些词很难(比如复杂的数学或编程)。AI 需要进行深度思考。
  • 结果: 这种僵化的系统在处理简单的词时浪费了能量,而在处理难词时有时又过于匆忙,从而导致错误或错失加速的机会。

解决方案:LEDE 的“聪明教练”

LEDE 改变了游戏规则,它使用强化学习(一种通过试错来学习的 AI 训练方式,就像狗学习耍俏来换取零食一样)。

LEDE 不再使用固定规则,而是训练一个“聪明教练”(一个智能体)来进行实时决策。以下是类比:

  1. 状态(检查点): 当 AI 编写一个词时,它会经过大脑的不同层级。在每一层,聪明教练都会观察 AI 的“信心”。

    • 类比: 想象 AI 正在爬一座山。在每一步,教练都会问:“你确定知道前方的路吗?”如果 AI 非常自信,教练会说:“太棒了,就在这里停下!”如果 AI 很困惑,教练会说:“继续向上爬,以获得更好的视野。”
  2. 动作(决策): 教练在每一步有两个选择:

    • 退出(Exit): “停在这里!我们已经有足够的信息来猜测这个词了。”(这节省了时间)。
    • 继续(Continue): “继续深入大脑,以获得更好的猜测。”(这确保了准确性)。
  3. 奖励(零食): 教练通过获得分数来学习。

    • 如果它提前停止且猜测正确,它会获得大奖(因为它节省了时间)。
    • 如果它提前停止且猜测错误,它会受到惩罚(因为它浪费了时间去修复错误)。
    • 如果它在不需要的时候继续前进,它会受到小额惩罚(因为它浪费了能量)。

它是如何学习的(离线训练)

在 AI 真正与人类交流之前,聪明教练会在模拟器中进行练习。它会运行数千个示例,尝试不同的策略。

  • 它尝试提前停止,然后晚一点停止,然后再早一点停止。
  • 它保留了一个“笔记本”(经验回放池/Replay Buffer),记录了哪些做法有效,哪些无效。
  • 随着时间的推移,它学会了一个完美的策略:“对于简单的句子,在第 3 层停止。对于困难的编程任务,要走到第 8 层。”

结果:为 AI 加速

论文在多个 AI 模型(如 Llama-2 和 Llama-3)上测试了 LEDE,发现它比旧的僵化方法快得多。

  • 速度: 它比标准的缓慢方法快了 2.0 到 2.7 倍
  • 效率: 即使与使用固定规则的其他“聪明”方法相比,LEDE 也快了 17%
  • 质量: AI 并没有犯更多的错误;它只是学会了何时停止思考并开始写作。

总结

把旧的 AI 想象成一个在回答像“2+2 等于几?”这样简单问题之前,必须读完教科书每一页的学生。
LEDE 则像是一个已经学会识别问题的学生:“噢,这是一个简单的问题,我立刻就知道答案,所以我直接写下来就行了。”但如果问题很难,这个学生知道要读完整个章节。

通过教会 AI 变得灵活——明确知道何时停止以及何时继续——LEDE 让大型语言模型在不需要改变其大脑结构本身的情况下,变得显著更快、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →