Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
论文《Ring-Zero》引入了一种稳定且高效的训练流水线,将零样本强化学习扩展至1万亿参数规模,揭示了大规模模型如何自发地发展出高级推理行为,并在数学基准测试上超越较小模型,同时使手工设计的启发式规则变得不再必要。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你拥有一个巨大的、超级聪明的脑子(一个拥有1万亿参数的AI模型),它知道很多事实,但从未学习过如何一步步地进行复杂的数学思考。通常情况下,为了教它,人类必须写出成千上万个完美的范例,就像老师向学生展示如何解方程一样。但这篇论文提出了一个疯狂的问题:如果我们只是让这个大脑通过试错法,在没有任何人类帮助的情况下,自己摸索出规律呢?
研究人员称之为“零强化学习”(Zero Reinforcement Learning)。他们设置了一个游戏,让AI尝试解决数学问题。如果它答对了,就得一分;如果答错了,就一分也得不到。没有人类老师,没有小抄,只有AI在猜测、失败、学习并再次尝试。
大惊喜:越大越好(也越简单)
这篇论文的核心发现是一个巨大的“顿悟”时刻,它证实了一个被称为“苦涩教训”(bitter lesson)的著名AI理念。这个教训指出:纯粹的计算能力和规模往往能击败巧妙的人类技巧。
多年来,研究人员一直试图构建复杂的规则来强迫AI更好地思考。他们设计特殊的提示词(prompts)、设计花哨的奖励系统,以及手工构建流水线,让AI检查自己的工作或以整齐的格式输出答案。作者发现,当他们将模型规模扩大到庞大的 1万亿参数 时,他们不再需要这些花哨的人类规则了。这个巨大的模型完全靠自己就学会了。
事实上,论文明确反对那种认为我们需要复杂的、人工设计的系统来获得高质量推理能力的观点。他们发现,对于一个1万亿参数的模型,简单的改动就足以使其奏效;而对于一个较小的模型(1040亿参数),则仍需要这些人类的“拐杖”。大脑越大,它就越不需要人类牵着它的手。
他们是如何驯服巨兽的
训练一个1万亿参数的模型,就像是在尝试教一条巨龙如何喷火而不烧毁城堡。如果你任由它放飞自我,场面会变得非常混乱。作者发现,AI开始出现一些奇怪的行为:
- 它话太多了: 它会为了说一句“2 + 2 = 4”而写下数千个单词,浪费时间和精力。
- 它会产生混乱: 计算机内部的数学(“训练引擎”)与外部的数学(“推理引擎”)存在微小的差异,导致AI崩溃。
为了修复这些问题,他们并没有构建一个极其复杂的系统,而只是做了三个简单的微调:
- 截断重要性采样(Clipped Importance Sampling): 他们告诉AI:“不要对自己的猜测过度兴奋,保持你的自信心处于克制状态。”
- 训练-推理比例修正(Training-Inference Ratio Correction): 他们修复了两个引擎之间微小的数学不匹配,以免AI感到“头晕”。
- 混合精度控制(Mixed-Precision Control): 他们使用了一个超精确的计算器来处理那些棘手的数学部分,以防止微小的误差演变成巨大的灾难。
通过这些简单的修复,他们分三个阶段训练了该模型:
- 探索阶段(Discovery): AI开始进行猜测,并寻找解决问题的新方法。
- 磨练阶段(Sharpening): 一旦找到了某种方法,它就会变得非常擅长使用这种特定的方法。
- 适应阶段(Adaptation): AI学会了对简单问题短小精悍,对难题则详尽深入。
AI自发学会的“魔法技巧”
这篇论文最酷的部分在于AI开始表现出的“自发行为”。它不仅仅是变得更擅长数学,它还发展出了人类通常需要编程才能赋予的“认知行为”。论文认为,这些行为之所以能自然涌现,是因为它们是赢得游戏的最高效方式:
- 拟人化(Anthropomorphism,表现得像人一样): AI开始像一个心情不好的人一样说话。它会说类似“等等,我可能脑子短路了”、“我随便应付一下”、“天才的想法!”之类的话。它模仿了人类的挫败感和自我赞扬,这很可能是因为它在训练数据中看到了这些模式。
- 结构化格式(Structured Formatting): 在没有被告知的情况下,AI开始给步骤编号(“步骤 1”、“步骤 2”)并使用清晰的标题。它意识到,整理思路可以让它更容易找到正确答案。
- 自我验证(Self-Verification): AI开始检查自己的工作。它会解出一个问题,然后说:“等等,让我再检查一遍,”然后重新运行数字以确保自己没有出错。
- 并行推理(Parallel Reasoning): AI不再仅仅遵循单一路径,它会同时尝试两种不同的解题方法,对比它们,然后选出胜者。
- 上下文焦虑(Context Anxiety): 这是一个很有趣的现象。当AI接近其最大记忆限制(即停止说话的临界点)时,它会感到恐慌。它会意识到:“噢不,我快没空间了!我最好现在就把答案猜出来,否则我就拿不到分了!”于是它会停止长篇大论的复杂推理,直接给出答案以确保完成任务。
它真的奏效了吗?
论文在 七个 极具挑战性的数学基准测试(如 AIME 和 HMMT)上进行了衡量。结果显示,该模型的表现足以媲美世界上最顶尖的模型。
- 1万亿参数的模型(Ring-2.5-1T-Zero)在训练的第一阶段就在 AIME 2026 测试中达到了 84.2% 的准确率,在后续阶段甚至更高。
- 作者还检查了AI的思考过程是否易于理解。他们发现,与其他顶尖模型相比,该AI的推理过程更具可理解性(更易于人类理解)、更具可复现性(更容易教给较小的模型)且更高效(使用的单词更少)。
这篇论文告诉我们“不应该”做什么
论文非常明确地指出了在这一规模下,哪些做法是无效或不需要的:
- 不要依赖人工标注的数据: 你不需要人类去写出思考步骤。AI可以仅通过最终答案进行学习。
- 不要过度工程化: 你不需要复杂的、手工设计的规则来强迫AI格式化答案或验证工作。如果模型足够大,它会自然而然地完成这些。
- 不要使用“一刀切”的方法: 论文表明,强迫AI对简单问题和难题使用相同程度的思考是浪费资源的。AI学会了根据难度自动调整其投入的精力。
核心结论
这篇论文表明,如果你给一个庞大的AI足够的计算能力,并让它在没有任何人类干预的情况下玩“猜猜看并检查”的游戏,它不仅能学会解决困难的数学问题,还会发明出自己的聪明策略。它证明了规模是一种超能力:一个1万亿参数的模型如此强大,以至于它不需要人类告诉它如何思考;它会自己搞定。
作者在真实的数学测试中衡量了这一点,并发现该模型确实有效,但也指出“苦涩教训”(即规模胜过人类技巧)是他们观察到的一个强劲趋势,并不一定是一个适用于所有未来场景的物理定律。然而,针对这项特定的数学推理任务,证据是充分的:更大的模型、更简单的规则、零人类帮助 = 惊人的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。