← 最新论文
🤖 machine learning

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

该论文提出了 QUADS,一种双侧量化误差对齐方法,通过不对称量化感知训练和残差激活补偿来解决激活误差,从而稳定了混合专家模型(Mixture-of-Experts models)的 NVFP4 强化学习,进而实现了与 FP8 相比显著提升吞吐量且达到 BF16 级精度的效果。

原作者: Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人去解决复杂的谜题,比如数学题或编写代码。为了变得真正厉害,机器人不仅仅是死记硬背答案;它通过尝试成千上万种不同的解决方案来练习,获取关于哪些方案奏效的反馈,然后调整自己的大脑以下次做得更好。这个过程被称为强化学习(Reinforcement Learning)。然而,这里有一个陷阱:机器人的“思考”与“学习”部分(训练器)通常与“生成答案”的部分(展开引擎)是分离的。为了让学习生效,这两个部分需要使用完全相同的语言。如果训练器是用高清晰度(像 4K 电影)进行思考,而生成器却被迫使用模糊的低分辨率版本(像像素化的 8 位游戏)进行表达,机器人就会感到困惑。它会开始犯错,因为其行为的“重要性”被这种模糊感扭曲了。这种不匹配是一个巨大的问题,因为它会减慢整个学习过程,让机器人变得聪明起来需要耗费极长的时间。

现在,想象我们想要让机器人思考得更快。我们可以进一步缩小它的脑容量,使用一种超低分辨率的格式,叫做“NVFP4”。这就像是试图让一辆高速赛车在由细小、粗糙的小石子组成的土路上行驶。它承诺会非常快——比目前的标准快得多——但这些石子太粗糙了,以至于赛车的轮子(机器人的逻辑)开始打滑并失控。机器人试图学习,但由于这条粗糙的赛道,它在仅仅跑了几圈后就发生了碰撞。大问题在于:我们能否让这条超快但粗糙的赛道在机器人不发生碰撞的情况下正常运作?

这正是该论文中的研究人员致力于解决的问题。他们发现,仅仅把机器人放在这条粗糙且快速的赛道上,会导致它在训练大约 150 步内发生惨烈的失败。机器人的置信度得分(对数概率)会发生剧烈的漂移,导致它停止学习。通过仔细的实验,他们弄清楚了为什么会发生这种情况。事实证明,问题不在于权重(机器人存储的知识),因为权重可以很容易地实现同步。真正的罪魁祸首是激活值(activation)——即机器人在思考时产生的即时、动态的计算。因为这条粗糙的赛道(NVFP4)过于粗糙,这些即时的计算会发生扭曲,以至于训练器无法仅通过观察权重来修复它。

为了解决这个问题,团队发明了一种巧妙的两部分策略,他们称之为 QUADS(跨双侧量化误差对齐)。你可以把它想象成训练器与生成器之间的一场舞蹈。在训练器这一侧,他们使用了一种特殊的技术,称为“非对称量化感知训练”。他们并没有试图强迫训练器去使用生成器的粗糙语言,而是保持训练器的“思考”(激活值)处于高清晰度,但强制其“记忆”(权重)去匹配生成器的粗糙格式。这样一来,训练器就能准确知道当它观察权重时,生成器所看到的是什么,从而防止产生混乱。

但这本身还不够。当生成器尝试计算新的想法时,它仍然会在粗糙的石子上踉跄。因此,在生成器的这一侧,他们增加了“残差激活补偿”。想象一下,生成器正在粗糙的赛道上行走,它意识到:“嘿,我的脚在特定的石子上打滑了!”它并没有停止整场比赛去修复赛道,而是采取了一个微小、快速的动作,仅仅针对那一次打滑进行修正,同时保持比赛的其他部分依然保持超高速。他们识别出了计算中最容易打滑的部分(“高残差通道”),并给了它们一个微小的、额外的助力,以保持航向,同时让比赛的其他部分依然运行得飞快。

结果令人印象深刻。通过使用这种双侧舞蹈,机器人不仅在粗糙的赛道上生存了下来,而且表现得几乎与在平滑的高清赛道上跑步一样出色。在测试中,与直接使用没有任何帮助的粗糙赛道相比,这种新方法将机器人的成功率提高了约 21.5 个百分点。更棒的是,它保留了速度优势,比之前的标准方法快了约 16%。这篇论文表明,虽然粗糙的赛道本身很危险,但只要有了正确的对齐以及针对易打滑位置的一点额外修正,我们终究可以让这些超快、低精度的 AI 模型可靠地运行起来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →