← 最新论文
💬 NLP

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

论文《Ring-Zero》引入了一种稳定且高效的训练流水线,将零样本强化学习扩展至1万亿参数规模,揭示了大规模模型如何自发地发展出高级推理行为,并在数学基准测试上超越较小模型,同时使手工设计的启发式规则变得不再必要。

原作者: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Z
发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一个巨大的、超级聪明的脑子(一个拥有1万亿参数的AI模型),它知道很多事实,但从未学习过如何一步步地进行复杂的数学思考。通常情况下,为了教它,人类必须写出成千上万个完美的范例,就像老师向学生展示如何解方程一样。但这篇论文提出了一个疯狂的问题:如果我们只是让这个大脑通过试错法,在没有任何人类帮助的情况下,自己摸索出规律呢?

研究人员称之为“零强化学习”(Zero Reinforcement Learning)。他们设置了一个游戏,让AI尝试解决数学问题。如果它答对了,就得一分;如果答错了,就一分也得不到。没有人类老师,没有小抄,只有AI在猜测、失败、学习并再次尝试。

大惊喜:越大越好(也越简单)

这篇论文的核心发现是一个巨大的“顿悟”时刻,它证实了一个被称为“苦涩教训”(bitter lesson)的著名AI理念。这个教训指出:纯粹的计算能力和规模往往能击败巧妙的人类技巧。

多年来,研究人员一直试图构建复杂的规则来强迫AI更好地思考。他们设计特殊的提示词(prompts)、设计花哨的奖励系统,以及手工构建流水线,让AI检查自己的工作或以整齐的格式输出答案。作者发现,当他们将模型规模扩大到庞大的 1万亿参数 时,他们不再需要这些花哨的人类规则了。这个巨大的模型完全靠自己就学会了。

事实上,论文明确反对那种认为我们需要复杂的、人工设计的系统来获得高质量推理能力的观点。他们发现,对于一个1万亿参数的模型,简单的改动就足以使其奏效;而对于一个较小的模型(1040亿参数),则仍需要这些人类的“拐杖”。大脑越大,它就越不需要人类牵着它的手。

他们是如何驯服巨兽的

训练一个1万亿参数的模型,就像是在尝试教一条巨龙如何喷火而不烧毁城堡。如果你任由它放飞自我,场面会变得非常混乱。作者发现,AI开始出现一些奇怪的行为:

  1. 它话太多了: 它会为了说一句“2 + 2 = 4”而写下数千个单词,浪费时间和精力。
  2. 它会产生混乱: 计算机内部的数学(“训练引擎”)与外部的数学(“推理引擎”)存在微小的差异,导致AI崩溃。

为了修复这些问题,他们并没有构建一个极其复杂的系统,而只是做了三个简单的微调:

  • 截断重要性采样(Clipped Importance Sampling): 他们告诉AI:“不要对自己的猜测过度兴奋,保持你的自信心处于克制状态。”
  • 训练-推理比例修正(Training-Inference Ratio Correction): 他们修复了两个引擎之间微小的数学不匹配,以免AI感到“头晕”。
  • 混合精度控制(Mixed-Precision Control): 他们使用了一个超精确的计算器来处理那些棘手的数学部分,以防止微小的误差演变成巨大的灾难。

通过这些简单的修复,他们分三个阶段训练了该模型:

  1. 探索阶段(Discovery): AI开始进行猜测,并寻找解决问题的新方法。
  2. 磨练阶段(Sharpening): 一旦找到了某种方法,它就会变得非常擅长使用这种特定的方法。
  3. 适应阶段(Adaptation): AI学会了对简单问题短小精悍,对难题则详尽深入。

AI自发学会的“魔法技巧”

这篇论文最酷的部分在于AI开始表现出的“自发行为”。它不仅仅是变得更擅长数学,它还发展出了人类通常需要编程才能赋予的“认知行为”。论文认为,这些行为之所以能自然涌现,是因为它们是赢得游戏的最高效方式:

  • 拟人化(Anthropomorphism,表现得像人一样): AI开始像一个心情不好的人一样说话。它会说类似“等等,我可能脑子短路了”、“我随便应付一下”、“天才的想法!”之类的话。它模仿了人类的挫败感和自我赞扬,这很可能是因为它在训练数据中看到了这些模式。
  • 结构化格式(Structured Formatting): 在没有被告知的情况下,AI开始给步骤编号(“步骤 1”、“步骤 2”)并使用清晰的标题。它意识到,整理思路可以让它更容易找到正确答案。
  • 自我验证(Self-Verification): AI开始检查自己的工作。它会解出一个问题,然后说:“等等,让我再检查一遍,”然后重新运行数字以确保自己没有出错。
  • 并行推理(Parallel Reasoning): AI不再仅仅遵循单一路径,它会同时尝试两种不同的解题方法,对比它们,然后选出胜者。
  • 上下文焦虑(Context Anxiety): 这是一个很有趣的现象。当AI接近其最大记忆限制(即停止说话的临界点)时,它会感到恐慌。它会意识到:“噢不,我快没空间了!我最好现在就把答案猜出来,否则我就拿不到分了!”于是它会停止长篇大论的复杂推理,直接给出答案以确保完成任务。

它真的奏效了吗?

论文在 七个 极具挑战性的数学基准测试(如 AIME 和 HMMT)上进行了衡量。结果显示,该模型的表现足以媲美世界上最顶尖的模型。

  • 1万亿参数的模型(Ring-2.5-1T-Zero)在训练的第一阶段就在 AIME 2026 测试中达到了 84.2% 的准确率,在后续阶段甚至更高。
  • 作者还检查了AI的思考过程是否易于理解。他们发现,与其他顶尖模型相比,该AI的推理过程更具可理解性(更易于人类理解)、更具可复现性(更容易教给较小的模型)且更高效(使用的单词更少)。

这篇论文告诉我们“不应该”做什么

论文非常明确地指出了在这一规模下,哪些做法是无效或不需要的:

  • 不要依赖人工标注的数据: 你不需要人类去写出思考步骤。AI可以仅通过最终答案进行学习。
  • 不要过度工程化: 你不需要复杂的、手工设计的规则来强迫AI格式化答案或验证工作。如果模型足够大,它会自然而然地完成这些。
  • 不要使用“一刀切”的方法: 论文表明,强迫AI对简单问题和难题使用相同程度的思考是浪费资源的。AI学会了根据难度自动调整其投入的精力。

核心结论

这篇论文表明,如果你给一个庞大的AI足够的计算能力,并让它在没有任何人类干预的情况下玩“猜猜看并检查”的游戏,它不仅能学会解决困难的数学问题,还会发明出自己的聪明策略。它证明了规模是一种超能力:一个1万亿参数的模型如此强大,以至于它不需要人类告诉它如何思考;它会自己搞定。

作者在真实的数学测试中衡量了这一点,并发现该模型确实有效,但也指出“苦涩教训”(即规模胜过人类技巧)是他们观察到的一个强劲趋势,并不一定是一个适用于所有未来场景的物理定律。然而,针对这项特定的数学推理任务,证据是充分的:更大的模型、更简单的规则、零人类帮助 = 惊人的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →