← 最新论文
💬 NLP

Consolidating Rewarded Perturbations for LLM Post-Training

本文介绍了 CoRP,这是一种无需梯度的后训练方法,它通过利用低秩结构将奖励加权高斯扰动整合为单次模型更新,从而在实现较基座模型显著性能提升的同时,消除了类似 RandOpt 等基于集成方法的多次推理开销。

原作者: Zheyu Zhang, Shuo Yang, Gjergji Kasneci

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Zheyu Zhang, Shuo Yang, Gjergji Kasneci

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“厨师太多”的困境

想象你拥有一位才华横溢、训练有素的大厨(基础模型),他几乎能做任何菜。你想教他做出一道特定的、完美的菜肴(比如一道复杂的数学题或一段代码)。

通常,为了教一位大厨,你会使用强化学习(RL)。你让他们做菜、品尝,如果味道好,你就微调一下他们的食谱。这就像是使用梯度一步步调整食谱。这种方法有效,但速度慢且计算成本高。

最近,一种名为 RandOpt 的新方法出现了。RandOpt 不再是一步步微调食谱,而是说:“我们干脆给大厨的基础食谱撒上一堆随机香料,看看会发生什么。”

  • 它创建了 5,000 个略有不同的厨师版本(通过向权重中添加随机的“扰动”或噪声)。
  • 它在一些练习菜品上测试所有 5,000 个版本。
  • 它挑选出表现最好的前 50 个版本。
  • 代价是: 为了给顾客上菜,你必须要求这 50 位“专家级”厨师同时做这道菜,然后根据最终答案进行投票。
    • 优点: 它非常聪明。
    • 缺点: 它极其缓慢。每做一顿饭,你都得运行 50 个厨师。此外,你不能轻易地将他们合并成一位“大师级”厨师,因为他们的“个性”(权重)可能会产生冲突。

论文的问题:我们能合并这个团队吗?

作者们问道:“我们能否将那 50 位获胜的专家合并成一个单一的厨师,这样我们每次只需要运行一个厨师,而不是 50 个?”

如果我们只是简单地平均他们的食谱,通常会失败。为什么呢?因为虽然他们都很擅长烹饪,但他们学习解决问题的方式可能各不相同。如果你盲目地混合他们,他们的改进方案会互相抵消,最终导致你得到的厨师比最初的还要差。

发现:隐藏的“低秩秘密”

在构建解决方案之前,作者进行了一项“拆分实验”。他们将 5,000 名随机厨师分成两半,并观察了表现最好的那一半。

他们发现了一个令人惊讶的几何模式:尽管这些厨师是随机创建的,但他们的“优秀程度”并不是到处乱飞的。相反,所有有用的改进都集中在一个极其特定的“子空间”(一个狭窄的可能性的走廊)内。

你可以这样理解:如果你向一面巨大的墙投掷 1,000 支飞镖,它们看起来可能很随机。但如果你仔细观察,你会发现每一支“好”飞镖都落在了一个微小的、隐形的圆圈内。论文发现,即使飞镖的平均方向并不总是一致的,但在每一个测试案例中,这种“圆圈”(低秩结构)都是存在的。

解决方案:CoRP(整合奖励扰动)

作者构建了一个名为 CoRP 的工具,旨在将这些专家合并为一个可部署的模型。它通过一个三步走的招聘流程来工作:

  1. 猎头(奖励加权聚合):
    首先,CoRP 查看表现最好的厨师,并询问:“共同点在哪里?”它基于得分最高的厨师创建一个“建议方向”。这就像是在说:“好吧,最好的厨师似乎都用了更多的蒜。”

  2. 兼容性检查(重加权):
    这是神奇的一步。CoRP 不仅仅是听从那些“大蒜”厨师的意见。它会检查每一位专家,看其风格是否与建议的方向相符。

    • 如果一位厨师擅长用蒜,但也坚持要加入巧克力(这与大蒜主题冲突),CoRP 会说:“不行,你太不兼容了。”它会降低该厨师的权重。
    • 如果一位厨师擅长用蒜,且没有添加任何奇怪的东西,CoRP 会说:“太棒了,你非常契合。”它会提升该厨师的权重。
    • 类比: 想象你在盖房子。你有 50 位优秀的建筑师。你不会直接平均他们的蓝图(那样会搞得一团糟)。你会选择一个最佳的设计方向,然后只聘请那些特定的想法能够支持该方向、且不会产生冲突的建筑师。
  3. 安全检查员(留出验证门控):
    在最终确定新的单一厨师之前,CoRP 会在一组这些厨师从未见过的菜品上测试新食谱。

    • 如果新厨师在这些新鲜菜品上的表现确实更好,CoRP 就会批准更新。
    • 如果新厨师的表现变差了(或者仅仅是持平),CoRP 会说:“不,我们还是沿用原来的厨师吧。”它拒绝进行任何没有实质帮助的改动。

结果:一个厨师,一次运行,巨大收益

论文在 5 种不同的模型(从小型到大型)和 5 种不同的任务(数学、编程、创意写作)上进行了测试。

  • 速度: RandOpt(50 厨师团队)回答一个问题需要 50 次前向传播。CoRP 只需要 1 次前向传播。它的推理速度快了 50 倍。
  • 效率: CoRP 仅使用了 RandOpt 用于训练的 1/10 计算能力(扰动预算)。
  • 性能:
    • CoRP 使基础模型平均提升了 8.1 分
    • 它找回了那个庞大的 50 厨师团队所实现的性能增益中的 一半以上,但使用的是单一模型。
    • 在某些情况下(如创意写作),CoRP 甚至击败了单一人选方案(RandOpt K=1),并且非常接近 50 厨师团队的表现。

总结

这篇论文表明,你不需要一个由 50 个 AI 模型组成的委员会来获得出色的结果。通过寻找这些模型改进过程中隐藏的“共同几何结构”,并仔细过滤掉那些产生冲突的模型,你可以将它们合并为一个单一、高效的模型

这就像是意识到,与其雇佣 50 个不同的顾问来解决问题,不如雇佣一位能够综合了这 50 人中最佳想法、且不会让大家争论不休的专家。你既得到了群体的智慧,又拥有了单个人的速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →