← 最新论文
🤖 AI

How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors

本文提出了信息最大化增强探索(IMAX)框架,该框架通过在训练软前缀以重塑模型先验并采用信息最大化奖励,解决了可验证奖励强化学习(RLVR)中的熵崩溃问题,从而在不同规模的大语言模型上显著提升了推理性能和轨迹多样性。

原作者: Yifan Xu, Junren Chen, Yifan Chen

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Xu, Junren Chen, Yifan Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一位才华横溢却思维僵化的“冰冻天才”(大型语言模型),它在解决数学问题时极其聪明,但容易陷入死胡同。当你让它解题时,它可能在 80% 的情况下给出正确答案,却总是用完全相同的方式求解。一旦它在某类问题上卡住,就会反复尝试同一种失败的策略。这篇论文将这种现象称为“熵崩溃”——模型变得过于可预测,不再探索新的、可能更优的思考方式。

论文提出了一种名为IMAX(信息最大化增强探索)的新方法来解决这一问题。以下是其工作原理,辅以简单类比:

问题所在:“一刀切”的天才

将 AI 模型想象成一位拥有固定食谱的顶级厨师。如果你要求做蛋糕,他每次都能做出完美的香草蛋糕。但如果你要求做“巧克力蛋糕”,而他只会做香草蛋糕,他就可能失败。
现有方法试图通过告诉厨师“尝试更随机一些!”来解决这个问题。但这通常只会导致厨师把随机食材扔进锅里,制造出一团糟(充满噪声、低质量的答案)。

解决方案:“魔法头带”(软前缀)

与其重新训练整个厨师(既昂贵又缓慢),作者给厨师戴上了一个魔法头带

  • 头带:这是一种“软前缀”——附着在你问题前端的一小套不可见的指令。
  • 诀窍:厨师的大脑(模型)保持冻结且不变。但根据佩戴的头带不同,他们会彻底改变解决问题的整体思路
    • 头带 A告诉厨师:“像数学家一样,用方程一步步求解。”
    • 头带 B告诉厨师:“像侦探一样,将其分解为不同情形并排除不可能的选项。”
    • 头带 C告诉厨师:“像程序员一样,编写一个快速脚本。”

创新点:“多样性教练”(InfoMax 奖励)

这是最巧妙的部分。如果仅仅给厨师这些头带,它们最终可能都会以相同的方式行事。为了防止这种情况,作者加入了一位多样性教练(即 InfoMax 奖励)。

想象一个游戏:厨师佩戴不同的头带来解决同一个谜题。多样性教练观察这些解决方案并提问:

  • “头带 A 产生的解决方案与头带 B 的完全不同吗?”
  • “它们都正确吗?”

如果头带 A 和头带 B 都产生了完全相同且乏味的答案,教练会给予惩罚。但如果头带 A 使用代数,头带 B 使用几何,且两者都得出了正确答案,教练就会给予奖励。

这迫使系统学习一个头带池,其中每个头带都能解锁一种其他头带所不具备的、独特的、高质量的思考方式。

结果:一支专业化的思考者团队

经过训练后,你拥有的不再是一个在各方面都“还行”的单一 AI。你拥有一个冻结的 AI,它可以根据你给它佩戴的“头带”,瞬间切换成数学家侦探程序员

论文在困难的数学问题上测试了该方法。他们发现:

  1. 更好的覆盖度:系统不再仅仅以单一方式(Pass@1)获得正确答案,而是能以多种不同方式找到正确答案(Pass@4 和 Avg@4 显著提升)。
  2. 没有混乱:与旧方法单纯添加随机噪声不同,该方法在保持答案高质量的同时实现了多样性。
  3. 高效性:由于他们只训练了微小的“头带”,而非整个庞大的大脑,因此运行速度更快、成本更低。

简而言之:这篇论文告诉我们,与其强迫一个聪明的模型变得更加随机,不如给它一套“思维模式”(前缀),并训练它以每种模式分别采用不同、独特且正确的解题方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →