← 最新论文
🤖 machine learning

LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts

本文介绍了 LoRA 支架化策略优化(LoRA Scaffolded Policy Optimization, LSPO),这是一种采样时机制,它通过临时拟合一个低秩适配器来生成成功的解决方案,从而在所有采样展开均失败的“悬崖”提示词上恢复强化学习梯度,进而显著提升了在 AIME 和 MATH 等基准测试上的数学推理性能,相比于标准基线表现更为出色。

原作者: Ken Ding

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Ken Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人解决数学题。你并不会坐在那里纠正它的每一个错误;相反,你让机器人尝试解决一个问题,检查答案是否正确,然后给它一个“大拇指”或“踩一脚”。这被称为强化学习(Reinforcement Learning)。为了让学习过程更快,机器人会对同一个问题连续尝试十次。如果它其中一些做对了,一些做错了,机器人就会明白:“嘿,那些得到‘大拇指’的尝试比平均水平要好!”它利用这种差异来弄清楚如何改进。这是这些系统学习的标准方式。

但有一个棘手的情况,这种方法会撞上一堵墙。想象一下,机器人尝试解决一个问题十次,结果每一次都失败了。这十次尝试都得到了“踩一脚”。因为每一次尝试都同样糟糕,机器人无法分辨哪一次是“没那么糟”或“更接近答案”的。数学计算表明它们之间的差异为零,因此机器人得不到任何指令,它完全无法学习。这就像站在悬崖边缘,地面突然坠落;机器人在它尚无法解决的最难问题面前停滞不前,常规的学习方法在这里失效了。这就是“悬崖问题”,它让那些最聪明、最困难的挑战完全无法被学习过程触及。

于是,出现了一个新想法,叫做 LoRA 支架策略优化(LSPO)。把 LSPO 想象成一个聪明的安全网,在机器人掉下悬崖之前接住它。当机器人尝试一个难题且每次都失败时,系统会暂停常规学习,并掏出一个名为 LoRA 适配器的小巧、临时的“辅助轮”。这并不是对机器人大脑的永久性改变;它只是一个微小的、可拆卸的小装置。

这就是魔术时刻:系统会从数据库中取出那个难题的“正确答案”,并快速教会这个小装置如何解决它。这就像是在那一瞬间给了机器人一张“小抄”。然后,机器人再次尝试这个问题,但这一次它带着这张小抄。突然间,它解决了问题!系统将这次成功的尝试替换进那组十次尝试中。现在,不再是十次失败,而是九次失败和一次成功。数学逻辑再次生效了!机器人终于能看到糟糕尝试与优秀尝试之间的差异,并从中学习如何变得更好。

最棒的部分在于,一旦机器人从那次成功的尝试中学习完毕,系统会立即撕掉这张“小抄”(LoRA 适配器)并将其丢弃。机器人的永久大脑只从经验中学习,但它不会保留这个临时装置。这确保了机器人保持“纯净”,不会因为这张小抄而在以后感到困惑。

研究人员在用 103,000 道数学题训练的模型上测试了这一方法。他们发现这种方法效果极佳。在 16 项不同的测试(混合了各种数学竞赛和难度等级)中,这种新方法在 16 项中有 15 项胜过了旧的标准方法,其中一项是平局。在一些最难的测试中,新方法的成功率提升了高达 10.7 个百分点。他们还精确测量了这个“安全网”发挥作用的频率:它成功地将大约 43% 的那些“卡住”的失败组转化为了可以进行学习的组。

这篇论文并不声称已经解决了所有的数学问题,也不声称找到了适用于所有情况的完美方案。它表明,通过使用一个临时的低秩适配器来修复这些特定的“悬崖”时刻,我们可以找回此前丢失的学习信号。这些结果是基于特定模型和数据集的具体实验,展示了这种“拼接并丢弃”的方法是一种有前景的方式,能帮助 AI 模型应对它们目前面临的最困难的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →