← 最新论文
🤖 machine learning

SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs

本文提出了SAGE框架,该框架通过引导函数重塑反向KL锚点分布,克服了大语言模型中标准RLVR的探索局限性,从而在数学推理任务上同时提升了pass@1和pass@k指标。

原作者: Chanuk Lee, Minki Kang, Sung Ju Hwang

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Chanuk Lee, Minki Kang, Sung Ju Hwang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和富有创意的类比,对论文《SAGE:塑造锚点以引导大语言模型在 RLVR 中的探索》的解释。

核心问题:“安全路径”陷阱

想象一下,你正在训练一个大语言模型(LLM)来解决高难度的数学问题。你使用了一种名为**可验证奖励强化学习(RLVR)**的方法。这就像学生参加一场模拟测试,只有答案完全正确时,他们才能获得一颗金星。

这篇论文指出了这类学生学习过程中一个令人沮丧的问题:

  • “安全路径”习惯:一旦学生找到了一种能获得金星的方法,他们往往就会固守这一种确切的方法,不再尝试新的解题思路。
  • 结果:如果你让学生只尝试一次解题,他们通常能答对(pass@1 很高)。但如果你让他们尝试 256 次,看能否找到任何其他正确答案,他们却无法发现新的解决方案(pass@k 很低)。

论文将这种现象称为**“模式坍塌”**。模型陷入了死胡同,反复使用它已知的几种推理模式,而不是去发现解决新问题的巧妙方法。

为什么会发生这种情况?“锚定绳索”

为了防止学生完全跑偏(产生胡言乱语),研究人员用一种名为反向 KL 正则化的数学“ leash(牵引绳)”,将他们系在一个“参考模型”(一位聪明但基础的教师)身上。

  • 类比:想象学生是一只狗,参考模型是地面上的一个柱子。牵引绳(反向 KL)防止狗跑得太远。
  • 问题:这根绳子太紧了。它迫使狗必须紧贴着柱子。即使 10 英尺外的灌木丛里藏着一根美味的骨头(正确答案),狗也够不着,因为绳子每次都会把它拉回柱子旁。狗只能学会在柱子周围的狭小区域嗅探。

失败的尝试

研究人员尝试了两种显而易见的解决办法,但都失败了:

  1. 剪断绳子:如果你完全移除绳子,狗就会乱跑。它可能会找到骨头,但也会冲进车流(产生幻觉)并忘记如何守规矩。它会陷入“奖励黑客”行为(作弊通过测试)。
  2. 更换绳子类型:有些人尝试使用不同类型的绳子(前向 KL),让狗能跑得更远。但这往往导致狗 wander 到毫无骨头的无用田野里,徒耗精力。

解决方案:SAGE(塑造锚点以引导探索)

作者提出了一种名为SAGE的新方法。他们不是剪断绳子或更换绳子类型,而是重塑柱子周围的地面

  • 类比:想象柱子依然存在,但 SAGE 方法在灌木丛中放置了一个“磁铁”或“向导”。
  • 工作原理:系统会观察学生的思考过程。如果学生犹豫不决或感到困惑(高“熵”或不确定性),SAGE 就会说:“嘿,这是一个分叉点!这里可能有一条新路径。”它会温和地将学生推向这些不确定、未探索的区域,同时让他们完全脱离教师的掌控。

这就像一位教练站在灌木丛中,挥舞着旗帜喊道:“试试这条路!虽然看起来有风险,但可能会带你获得金星”,同时仍将学生系在主教师身上以确保安全。

具体做法(“引导函数”)

论文建议使用模型自身大脑发出的简单信号来决定在哪里进行引导:

  • 惊讶:如果模型对即将说出的某个词感到惊讶,这可能意味着它正在探索新事物。
  • 困惑/不确定性:如果模型不确定下一个词该选哪个(高熵),这就是一个“分叉点”,可能存在多种解决方案。

SAGE 利用这些信号创建一个引导函数。它实际上是在说:“当你处于一个充满不确定性的十字路口时,稍微更倾向于那条你尚未走过的路径。”

结果:单次尝试更优,多次尝试更佳

论文在 AIME 和 AMC 等高难度数学竞赛上测试了这种方法。

  • 标准训练(死胡同):模型在首次尝试解题时表现更好,但它停止寻找新的解题方法。
  • SAGE 训练:模型不仅在首次尝试解题时表现更好,而且在给予多次尝试机会时,在寻找多种不同正确答案方面也表现得更好。

核心要点:
SAGE 证明你不必在“稳定性”(坚守安全路径)和“探索性”(寻找新路径)之间做选择。通过智能地重塑锚点(牵引绳),你可以引导模型去探索那些新推理模式所在的“灌木丛”,同时防止它冲进车流。

一句话总结

SAGE 是一种新的训练技巧,它在保持 AI 模型安全稳定的同时,温和地鼓励它们探索未经尝试的、富有创造性的解题方法,防止它们陷入重复的循环。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →