Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation
本文引入了一种“先竞争后协作”的框架,在该框架中,前沿人工智能模型通过基于执行的验证进行排名,以共同构建一套课程,当该课程用于带有可验证奖励的强化学习时,能显著提高编程学生在难题上的表现,而对相同解法进行传统的模仿学习反而会使其表现下降。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个编程课堂,这里聘请了四位来自不同科技巨头的超级明星教师——我们暂且称之为 Anthropic、OpenAI、xAI 和 Google 战队——来教导一名非常聪明的学生(一个名为 Qwen2.5-Coder 的模型)。目标是什么?是看哪位老师最优秀,以及如何结合他们的教导,让这个学生成为一名编程奇才。
研究人员组织了一场规模宏大、高规格的编程锦标赛。他们没有让老师们互相评分(因为这往往会导致他们为了交情而给彼此打 A+),而是使用了一个严格的、像机器人一样的裁判:计算机本身。如果老师编写的代码能够实际运行并通过隐藏测试,则视为获胜;如果代码崩溃,则视为失败。
锦标赛:谁是最好的老师?
首先,老师们面临两类挑战:
- 基础题: 标准编程问题。在这里,四位老师都表现得非常出色,在经过了一点“自我修正”(即获得第二次机会来修复错误)后,他们的得分都接近完美的 99–100%。论文指出,这并不是因为他们都是天才,而是因为他们都在训练数据中见过这些特定的题目。这就像是一个学生在做一套已经背过的练习题。
- 难题: 棘手的、竞赛级别的题目。这是真正拉开差距的地方。
- Gemini 取得了领先,解决了 77% 的难题。
- Claude 和 Codex(OpenAI)难分伯仲,得分均为 69%。
- Grok 则垫底,仅解决了 50%。
论文谨慎地指出,虽然 Gemini 处于领先地位,但差距并不巨大,且排名完全基于代码的实际表现,而非老师们声称的表现。
大惊喜:模仿老师反而会“害”了学生
这里出现了一个打破常规教学规则的转折。通常情况下,如果你有一群聪明的老师,你会认为学习的最佳方式是模仿他们的作业。研究人员尝试了这种方法:他们提取了所有老师经过验证的、可运行的代码,并让学生模型仅仅去模仿它(这种方法被称为 SFT)。
结果却是,学生的表现变差了。
- 在标准测试中,学生的得分从 76.7% 降至 72.7%。
- 在困难的竞赛题目上,得分从 5.9% 骤降至 2.9%。
论文认为,对于一个已经具备一定能力的学生来说,仅仅模仿答案并不能提供帮助;它反而会造成困扰。这就像一名有天赋的篮球运动员,试图通过观看四位不同职业球员的集锦来学习,然后试图同时模仿他们的动作——这只会打乱他原本的节奏。试图成为别人的过程中的“知识冲突”让学生失去了自我。
获胜策略:在实践中学习,而非模仿
那么,如果模仿行不通,什么方法才有效呢?研究人员尝试了另一种方法,称为 RLVR(带有可验证奖励的强化学习)。
他们并没有把老师们的最终答案交给学生去抄袭,而是将老师们经过验证的问题作为学生的练习场。学生被允许尝试独立解决这些问题。
- 如果学生的代码运行成功并通过了测试,他就会获得“奖励”(来自计算机的高五)。
- 如果失败了,则没有奖励,并且必须重试。
这奏效了!
- 学生在困难竞赛题目上的得分从 5.9% 跳升至 8.8%(峰值)。
- 这实现了 49% 的相对提升。
论文指出,拥有多位老师的价值不在于将他们的答案汇聚起来让学生去模仿,而在于构建一个庞大的、经过验证的“健身房”,让学生通过亲自动手、获取反馈并观察结果是否有效来进行学习。
核心结论
论文总结道,虽然我们可以根据代码运行的效果对这些 AI 老师进行排名,但真正的魔力在于:当我们不再要求学生去模仿老师,而是利用老师的工作来创造一个充满挑战的环境,让学生通过试错来学习时,奇迹才会发生。
重点不在于教室内是否有最聪明的老师,而在于构建一个可以让学生练习、失败、获得清晰的错误信号并不断尝试直到成功的“游乐场”。研究人员发布了所有的代码和数据,以便任何人都可以亲自运行这些测试并验证数据的准确性,从而证明有时,学习的最佳方式是停止模仿,开始行动。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。