QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation
该论文提出了名为 QuestA 的简单有效策略,通过在强化学习训练过程中引入部分解答进行问题增强,显著提升了大语言模型在数学推理任务上的表现,并在使用 15 亿参数模型时于 AIME24、AIME25 和 HMMT25 等基准测试中取得了新的最先进成果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一种名为 QUESTA 的新方法,旨在让大型语言模型(LLM)变得更聪明,特别是在解决数学难题方面。
为了让你轻松理解,我们可以把训练 AI 的过程想象成教一个学生参加奥林匹克数学竞赛。
1. 遇到的难题:为什么直接“刷题”行不通?
在传统的训练方法(强化学习 RL)中,研究人员通常让模型直接去解那些很难的数学题。这就好比让一个刚学会加减法的学生,直接去解微积分难题。
- 问题 A(太难了): 如果题目太难,学生完全没思路,怎么猜都猜不对。这时候,老师(奖励机制)只能给“零分”。学生学不到任何东西,因为不知道哪里错了,也不知道该怎么改。这就叫**“奖励稀疏”**(Reward Sparse)。
- 问题 B(太简单了): 如果只给简单的题目,学生虽然能拿高分,但只是死记硬背了套路。一旦遇到新难题,他就束手无策了。而且,如果只练简单的,学生可能会变得“盲目自信”,遇到稍微难一点的题反而发挥失常(论文中提到的"Pass@k"下降现象,就像考试时只会做一种题型,稍微变个花样就懵了)。
核心矛盾: 练简单的没用,练太难的根本学不会。
2. QUESTA 的解决方案:给“脚手架”
QUESTA 的核心思想非常巧妙:不要直接扔给学生难题,而是先给他一部分答案作为“提示”或“脚手架”。
想象一下,你正在教学生解一道复杂的几何题:
- 传统做法: 直接问:“请证明这个定理。”学生抓耳挠腮,最后瞎写一通,错了。
- QUESTA 做法: 你在题目后面加了一句提示:“提示:首先,我们要证明三角形 ABC 是等腰三角形……"
- 学生看到提示,思路瞬间打开了,顺着这个提示继续往下推导,最后成功解出了题。
- 在这个过程中,学生不仅学会了这道题,更重要的是,他学会了“如何思考”。
关键点: 在训练时,我们给模型看“部分答案”(比如解题的前 50%),让它完成剩下的部分。等模型练熟了,我们再减少提示(比如只给前 25%),最后完全不给提示。这就叫**“课程学习”(Curriculum Learning)**。
3. 为什么这招这么管用?(通俗版原理)
论文里用数学理论证明了这一点,我们可以用**“寻宝游戏”**来比喻:
- 没有提示时: 想象你在一个巨大的迷宫里找宝藏。宝藏(正确答案)藏在迷宫深处,但你手里没有地图。你每走一步都是瞎蒙,找到宝藏的概率极低(比如 1/10000)。如果你蒙了 1000 次都没找到,你就放弃了,或者不知道下一步该往哪走。
- 有了提示时: 现在有人告诉你:“宝藏就在迷宫的前半段,你只需要再走 10 步就能到。”
- 这时候,你找到宝藏的概率瞬间变成了 1/10。
- 你更容易获得“成功”的反馈(奖励),从而更快地学会怎么走出迷宫。
- 等你在“有提示”的情况下练熟了,再让你去“没提示”的迷宫,你其实已经掌握了走迷宫的规律,成功率自然就高了。
理论结论: 给一点提示,能让模型学习新知识的效率提高平方级(比如从需要试 10000 次变成只需要试 100 次)。
4. 实验结果:小模型也能逆袭
研究者用这个方法来训练一个只有 15 亿参数(1.5B,属于比较小的模型)的数学模型。
- 结果惊人: 这个“小模型”经过 QUESTA 训练后,在 AIME(美国数学邀请赛)等顶级数学竞赛题上的得分,竟然超过了很多 320 亿参数甚至更大的模型!
- 对比: 就像是一个普通高中生,通过这种“带提示”的魔鬼训练,最后考出了比清华北大尖子生还高的数学成绩。
- 稳定性: 以前那种直接练难题的方法,模型容易“变笨”(多样性下降,只会一种解法),但 QUESTA 训练出来的模型,解题思路更灵活,遇到新题也能举一反三。
5. 总结
QUESTA 就像是一位高明的教练,它不直接让学生去死磕最难的题,而是:
- 拆解难题: 把大难题拆成小步骤。
- 提供脚手架: 先给一部分答案,让学生顺着思路往下走。
- 逐步撤梯: 等学生熟练了,再慢慢减少提示,直到学生能独立解题。
这种方法不仅让模型学得更快、更稳,还让那些原本“带不动”的小模型,展现出了惊人的推理能力。这证明了:有时候,教学生“怎么想”比直接让他“做题”更重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。