Exploration-Driven Optimization for Test-Time Large Language Model Reasoning
本文提出了探索驱动优化(EDO),这是一个新颖的框架,它将促进多样性的探索目标整合到如 iDPO 和 GRPO 等迭代后训练方法中,以解决推理时采样多样性与强化学习引起的分布锐化之间的张力,从而提升大语言模型在分布内和分布外任务上的推理性能与稳定性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢的学生(一个大语言模型),正在学习解决复杂的数学谜题。你希望他成为一名解题大师。
通常,在训练这些学生时,我们会使用一种称为强化学习的方法。这就像一位严厉的教练,只奖励学生找到唯一最佳答案的行为。久而久之,学生非常擅长找到那条特定的路径。但问题在于:他们停止了探索。他们陷入了“思维定势”,只知道一种解题方式。如果那一种方式行不通,他们就没有备选方案。
这就产生了一个矛盾。为了解决非常棘手的谜题,我们通常在测试时使用一种称为**“自一致性”*的技术。这就像要求学生将同一个问题解答 10 次,然后选择出现频率最高的答案。如果学生能生成 10 种不同*的解题思路,这种方法效果极佳。但如果学生被训练成只懂一种思路,让他们尝试 10 次,得到的只是 10 份相同(且可能错误)的答案副本。
这篇论文提出了一种新的训练方法,称为EDO(探索驱动优化),以解决这一问题。
核心理念:“好奇的探索者”与“稳妥的专家”
作者们意识到,为了让“自一致性”技巧生效,模型在训练期间必须成为一个好奇的探索者,而不仅仅是一个稳妥的专家。
- 旧方法(专家模式): 教练说:“如果你答对了,很好!如果你答错了,试着更像你上次答对时的样子。”学生学会了反复重复相同的成功模式。结果是一种非常狭窄、极其“尖锐”的思维方式。
- 新方法(EDO - 探索者模式): 教练说:“答对答案,但同时也不要仅仅重复你上次做过的事。尝试一条略有不同的路径。如果你一直做完全相同的事情,我会轻轻推你一把,让你尝试新事物。”
富有创意的类比:迷宫与手电筒
想象学生身处一个巨大的黑暗迷宫(问题空间)中,试图找到出口(正确答案)。
- 标准训练: 学生找到了一条通往出口的路径。他们获得了奖励。下一次,他们被训练成以激光般的专注度遵循完全相同的路径。他们不再观察墙壁或其他走廊。如果那条唯一的路径后来被堵住了,他们就困住了。
- EDO 训练: 学生找到了一条通往出口的路径并获得了奖励。但教练增加了一条规则:“你还必须探索几条你以前从未尝试过的侧廊。”学生学会了保持他们的“手电筒”(概率分布)照亮范围宽广,照亮许多不同的路径,而不仅仅是他们知道有效的那一条。
实际运作方式
这篇论文采用了两种现有的训练方法(称为iDPO和GRPO),并将这种“好奇心”规则加入其中。他们将新版本称为ED-iDPO和ED-GRPO。
- 机制: 从数学上讲,如果模型对其之前的答案过于“舒适”,就会施加一种“惩罚”。它迫使模型保持轻微的“不适”和多样性,从而保持选择的开放性。
- 结果: 当他们测试这些新模型时,他们得到的不仅仅是一个好答案;而是生成了多种多样的不同解决方案。
为何这很重要(“测试时”的魔力)
由于模型现在能生成多样化的解决方案,“自一致性”技巧(要求提供 10 个答案并进行投票)突然变得有效得多。
- 之前: 要求 10 个答案 得到 10 个相同的错误答案 投票 仍然错误。
- 使用 EDO: 要求 10 个答案 得到 10 种不同的解题思路(有些正确,有些错误) 投票 正确答案胜出,因为它以不同形式多次出现。
结果
作者在困难的数学竞赛(如 AIME 和 MATH 数据集)上测试了这种方法。
- 准确率: 新方法(ED-iDPO 和 ED-GRPO)正确解决的问题数量超过了之前的最佳方法。
- 多样性: 模型产生的答案更加多样化(通过单词和步骤的差异程度来衡量)。
- 稳定性: 与其他有时会导致模型“崩溃”(忘记一切并变得重复)的方法不同,EDO 在整个训练过程中保持了模型的稳定性和创造性。
总结
简而言之,EDO 教导 AI 模型减少对“完美一致性”的执着,更愿意拥抱“创造性多样性”。 通过迫使模型在训练期间探索不同的路径,当被要求在测试时生成多个解决方案时,它在解决难题方面变得更为出色。这就像是一个只死记硬背一种解法的学生,与一个充分理解问题全貌、能够从许多不同角度找到答案的学生之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。