Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics
本文介绍了“问题催生问题”(Question Begets Question, QbQ),这是一种自我演进的课程,通过从模型当前的优势中迭代生成问题变体,以克服数据稀缺和推理轨迹限制,通过在 AIME 上实现 16.5% 的 pass@1 分数,成功打破了竞赛数学微调中的性能瓶颈。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教导一位才华横溢但缺乏经验的学生如何解决世界上最难的谜题。你的谜题库很小,而且你并没有带有逐步解释的答案解析——只有最终答案。你试图通过给学生提供更多的谜题来教导他们,但无论你添加多少,学生都会遇到一个瓶颈。他们会在某种技能水平上停滞不前,即使经过再多的练习也无法变得更好。这是人工智能(AI)领域研究人员经常面临的一个头疼问题。他们希望 AI 能够学习复杂的技能,如数学或法律,但他们经常会面临练习题不足、缺乏展示思考过程的详细“思维路径”,并目睹 AI 陷入一种令人沮丧的“天花板”状态,即它仅仅是停止了进步。
这篇论文深入探讨了这一问题。研究人员想要看看他们是否可以在不需要人类教师写出每一步解题过程的情况下,打破那个学习天花板。他们使用了一个智能计算机程序(一个 AI 模型)和一套棘手的数学竞赛题目。他们并没有只是向 AI 输入更多重复的问题,而是发明了一个聪明的技巧,叫做“问题催生问题”(Question-begets-Question)。这就像一位大师级厨师,他不仅仅是给学徒更多的食谱,而是针对学徒几乎已经掌握的食谱,微调其中的食材,从而制作出一道略有不同但全新的菜肴。通过不断地根据 AI 几乎 掌握的内容来创造这些新的、略有变化的挑战,研究人员发现了一种方法,可以将 AI 推向更高的极限。
自进化教学大纲的故事
研究人员从一个名为 Qwen2.5-Math-7B 的计算机模型开始。在开始阶段,这个模型在一种特定的高中数学竞赛(AIME)方面表现得很糟糕。它只能独立解决大约 5.6% 的问题。团队想要看看是否能教它变得更好,但他们面临着三个巨大的障碍:练习题不足、缺乏写出思考过程的“答案解析”,以及担心模型会直接撞上一堵墙并停止学习。
为了解决问题不足的问题,他们使用了一种称为“问题催生问题”(QbQ)的方法。想象一下,你有一个关于计算三角形面积的数学题。制作更多练习题的常规方法只是改变数字(让三角形变大或变小)。但研究人员的“教师”AI 做得更聪明。它选取了一个学生几乎能做对的问题,并应用了特定的“转换规则”。例如,它可能会将问题从寻找面积改为寻找该三角形内部圆的半径,或者它可能会要求以不同的数制给出答案。这些新问题虽然新鲜且多样化,但它们测试的是完全相同的核心技能。
然而,仅仅生成大量的这类新问题是不够的。当他们用一个由真实问题和合成问题组成的静态混合集来训练模型时,模型遇到了一个天花板。它的表现从 5.6% 提高到了大约 12.5% 或 14.5%,然后就停止了。无论他们喂给它多少数据,模型都无法变得更好。这就像一个学生背诵了特定练习测试的一套答案,却无法处理同一个问题的某种新变化。
突破出现在他们不再将训练数据视为一个静态的堆积物,而是将其视为一个自进化的课程时。他们没有给模型一个巨大的、混合在一起的问题包,而是将训练组织成了若干轮次。以下是奇迹发生的过程:
- 检查点: 在每一轮结束时,他们会对模型刚刚学习过的题目进行测试。
- 甜点区: 他们寻找那些模型大部分时间能做对、但并非每一次都能做对的问题。他们称之为“基本正确”区。
- 种子: 他们将这些特定的“基本正确”问题作为“种子”,用来生成下一批新的、难度略微增加的变体。
- 循环: 他们在这一批新问题上训练模型,再次检查,找到新的“基本正确”问题,并重复此过程。
最令人惊讶的部分是什么?研究人员发现,当模型在它已经擅长的问题上进行练习时,进步速度最快,而不是在它表现极差的问题上。通常,我们认为学习是通过纠正最大的错误来实现的。但在这里,AI 通过获取它的“差一点就成功”的案例,对其进行微调,并掌握这些案例,从而实现了最佳学习。这就像一名网球运动员,提升水平的方法不是一遍又一遍地把球打进球网,而是通过拿回一个通常能成功回击的球,并不断为其增加一点旋转。
通过使用这个自进化的循环进行 20 轮 训练,模型并没有撞到天花板。它一直在攀升。虽然其他方法在 14.5% 左右就进入了平台期,但这种自进化方法将模型的成功率推高到了 16.5%(在最终测试中具体为 16.46%),且从未表现出停止的迹象。更令人印象深刻的是,模型学会了解答它从未见过的更难的问题,这证明了所谓的“天花板”并不是模型大脑的限制,而是我们组织训练方式的限制。
研究人员还确保了 AI 不仅仅是在复制教师的“思考过程”。他们从未向 AI 展示教师的逐步推理过程;他们只展示了问题和最终答案。这意味着 AI 学会了独立思考,而不仅仅是模仿人类。这项研究表明,AI 经常停滞不前,并不是因为它太笨而无法学习更多,而是因为我们经常给它提供错误的练习方式。通过不断重塑课程,使其精准匹配 AI 当前所处的水平,我们可以帮助它突破自身的极限。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。