← 最新论文
💬 NLP

MARS: Enabling Autoregressive Models Multi-Token Generation

MARS 是一种无需修改架构或增加参数的轻量级微调方法,它通过训练指令调优的自回归模型实现单次前向传播生成多个令牌,在保持基准精度的同时将吞吐量提升 1.5 至 1.7 倍,并支持根据负载动态调整生成速度。

原作者: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

发布于 2026-04-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 MARS 的新方法,它能让现有的大语言模型(AI)在生成文字时“一次多写几个字”,从而大大加快生成速度,而且不需要改变模型的结构,也不会让模型变笨。

为了让你更容易理解,我们可以把大语言模型想象成一个极其谨慎的“填字游戏高手”

1. 现状:为什么现在的 AI 写得慢?

想象一下,这个“填字高手”(现在的 AI 模型)在写文章时,有一个死板的规矩:每次只能填一个格子

  • 哪怕他非常确定下一个词是“的”(比如前面刚写了“今天天气很”),他也必须停下来,花同样的精力去“思考”并填上这一个字。
  • 这就好比你在开车,哪怕前面是笔直的高速公路,你也必须每隔几米就踩一次刹车、挂一次挡,然后再加速。这非常浪费时间和燃料(计算资源)。

2. 以前的尝试:为什么它们不够好?

为了解决这个问题,以前的科学家尝试过几种方法,但都有大毛病:

  • 投机解码(Speculative Decoding): 就像给这位高手配了一个“小助手”(草稿模型)。小助手先猜几个字,高手再检查。但这需要同时运行两个模型,内存占用翻倍,就像为了跑得快,你不得不背着一个沉重的背包。
  • 多头预测(Medusa 等): 给高手的头上长了几个“额外的眼睛”(额外的预测头)。这需要重新设计模型结构,就像为了让他一次看多几个字,强行给他装上了义眼,不仅复杂,还容易让他原本的能力退化。

3. MARS 的妙招:给高手“开小灶”

MARS 的方法非常巧妙,它没有给模型加任何新零件,也没有换模型,只是给模型进行了一次特殊的“特训”

核心比喻:从“单字填”到“整句猜”

想象一下,MARS 的训练过程是这样的:

  1. 正常训练(保持本色): 模型继续像以前一样,一个字一个字地学,保证它原本的能力不退步。
  2. 蒙眼特训(多字预测): 训练时,把句子中接下来要写的几个字(比如 4 个)用黑布([MASK] 掩码) 盖住,让模型看着前面的内容,一次性猜出被盖住的这 4 个字是什么。

关键点在于:

  • 如果模型很有把握(比如猜“的”、“是”这种词): 它就能一次性把黑布下的 4 个字都猜对,直接输出,速度瞬间提升 1.5 到 1.7 倍。
  • 如果模型没把握(比如遇到复杂的逻辑推理): 它发现猜不准,就会自动退回到“一次猜一个字”的保守模式,保证质量不下降。

这就像是一个智能的“变速齿轮”:路况好(内容简单)时,它自动挂高档,一次跑很远;路况差(内容复杂)时,它自动挂低档,稳稳当当。

4. 为什么 MARS 能成功?(填补了三个坑)

以前的“蒙眼猜字”方法之所以失败,是因为它们破坏了模型原本的“直觉”:

  1. 方向感乱了: 以前的方法允许模型“回头看”被盖住的字(双向注意力),但这会让模型在写文章时逻辑混乱。MARS 坚持只向前看(因果注意力),保持逻辑连贯。
  2. 位置感乱了: 以前的方法预测的字和原来的位置对不上。MARS 严格对齐,确保它猜的字就是下一个该出现的字。
  3. 顺序感乱了: 以前的方法可能乱序输出。MARS 坚持从左到右,像正常人说话一样。

最厉害的一点: MARS 在训练时,不仅让模型猜被盖住的字,还强迫它同时复习原本的字。这就好比学生做题时,既做“填空题”,又做“选择题”,确保他即使学会了“猜整句”,也不会忘了“怎么写字”。

5. 实际效果:快且稳

  • 质量不变: 即使开启“加速模式”,模型在数学题、逻辑推理等任务上的准确率几乎没有损失,甚至因为训练更充分,在某些任务上比原来还强。
  • 速度提升: 在批量处理任务时(比如同时回答 4 个人的问题),速度提升了 1.71 倍
  • 灵活控制: 这是一个“可调节”的旋钮。如果服务器很忙,管理员可以把“置信度阈值”调低,让模型更激进地一次多写几个字,哪怕牺牲一点点质量换取速度;如果用户要求高质量,就调高阈值,让它一次只写一个字,保证完美。

总结

MARS 就像是给大语言模型装上了一个“自适应巡航系统”。
它不需要换引擎(改架构),也不需要多背行李(加参数)。它只是教会了模型:“当你确定接下来要说什么时,就大胆地一口气说完;当你不确定时,就慢下来一个字一个字说。”

这让 AI 在保持聪明(高质量)的同时,变得非常高效(高速度),而且随时可以根据需求调整快慢,是未来 AI 部署的一个非常实用的升级方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →