Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning
本文介绍了 Aryabhata 2,这是一种基于 GPT-OSS-20B 并通过强化学习训练的语言模型,它通过利用高质量课程和渐进式部署探索,在 JEE 和 NEET 等竞争性 STEM 考试中实现了更优的性能和更高的 token 效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢但略显散漫的学生,名叫GPT-OSS-20B。这位学生阅读过海量的书籍,掌握大量事实,但当你要求他解决棘手的多步骤数学或科学问题(例如印度最艰难的大学入学考试中的题目)时,他有时会喋喋不休、陷入困惑,或者花费极长时间才能写下答案。他或许能得出正确答案,但为此消耗了大量“墨水”(计算机令牌),既昂贵又缓慢。
这篇论文的作者希望在不购买“更大大脑”(即更大规模模型)的情况下,将这位学生培养成解题冠军。他们创造了一位名为Aryabhata 2的新学生。
以下是他们如何实现这一目标的简要说明,通过简单的类比来阐述:
1. 训练场:一位严格的教练
研究人员没有仅仅让学生阅读更多书籍(这是标准训练的做法),而是像一位严格的教练那样,利用强化学习进行指导。
- 奖励机制:想象一款电子游戏,只有当你正确地解决谜题并清晰解释时,才能获得积分。如果学生答错了,得零分;如果答对了,但用十页的篇幅去写本可用一段话解释清楚的答案,得分也会降低。
- “裁判”:教练并不仅凭学生的自我陈述就予以采信。他们使用一位超级聪明的“裁判”(另一个 AI)来检查每一个步骤。如果数学推导不成立或逻辑存在缺陷,答案会立即被驳回。
2. 课程安排:从易到难
研究人员没有一开始就把学生扔进深水区。他们建立了一个三级训练营:
- 第一级(格式规范):首先,他们教导学生如何正确握笔。重点在于确保答案整洁,并遵循特定的结构。
- 第二级(刻苦训练):接着,他们给学生提供数千道练习题。随着学生进步,教练会加大题目难度。如果学生持续保持 70% 的正确率,教练就会替换出更棘手的问题。
- 第三级(变数挑战):最后,他们让学生同时尝试多种不同的方法来解决同一道难题。想象一下,让学生同时尝试 128 条不同的路径来解开一个迷宫。这帮助他们发现了此前未曾见过的巧妙捷径。
3. 秘诀:“扩展探索”
通常,在训练人工智能时,你或许会要求它解决一次问题。而 Aryabhata 2 的训练则是针对每一个问题生成多种不同的尝试。
- 类比:这就像侦探破案。侦探不是只跟随一个直觉,而是派出 128 个不同的团队去寻找线索。只要哪怕一个团队找到了正确的线索,案件就能告破。这种方法帮助模型更快、更可靠地找到通往答案的“黄金路径”。
4. 结果:更快、更聪明、更精简
当他们在真实考试(如 JEE 和 NEET)甚至超难数学竞赛(如 AIME)中测试 Aryabhata 2 时,结果令人印象深刻:
- 更高的准确率:它正确解决的问题数量超过了其“父模型”(GPT-OSS-20B),甚至击败了一些规模更大、成本更高的模型。
- “令牌”节省:这是最大的胜利。原始模型往往写出冗长曲折的解释。Aryabhata 2 学会了简洁。它使用了多达64% 更少的词汇(令牌)来达成相同(或更好)的结果。
- 类比:如果旧模型像是一位为了找到完美镜头而拍摄 100 张照片的游客,那么 Aryabhata 2 就像是一位只需按一次快门就能拍出完美照片的专业摄影师。
核心结论
该论文声称,通过使用一套非常具体、高质量的练习题以及一种智能的多阶段训练方法,他们将一个标准的 200 亿参数 AI 转变为了专门的STEM 推理专家。它无需成为巨型模型就能变得聪明;它只需要正确的练习类型,以及一位深知如何奖励良好行为的教练。
他们未声称的内容:
该论文并未声称此 AI 能取代人类教师、诊断医疗状况或用于一般对话。它是专门为解决竞争性考试中的科学、数学和工程问题而构建的,旨在作为这些特定学科的高效导师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。