← 最新论文
🤖 AI

QED-Nano: Teaching a Tiny Model to Prove Hard Theorems

本文提出了名为 QED-Nano 的 4B 参数开源模型,通过蒸馏 DeepSeek-Math-V2 风格、基于评分标准的强化学习以及引入推理缓存的迭代优化三阶段训练策略,使其在 Olympiad 级数学证明任务上的表现超越了 Nomos-1 和 GPT-OSS-120B 等更大规模的开源模型,并接近 Gemini 3 Pro 等专有模型的水平,同时大幅降低了推理成本。

原作者: LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于**"QED-Nano"的论文,简单来说,它讲述了一个“小个子巨人”的故事:研究人员如何训练一个只有40 亿参数**(在 AI 界算是个“小不点”)的模型,让它能够像国际数学奥林匹克(IMO)的金牌得主一样,写出严谨、复杂的数学证明。

为了让你更容易理解,我们可以把这篇论文的核心内容想象成**“培养一个天才数学神童”**的过程。

1. 背景:为什么我们要造“小神童”?

目前,最厉害的 AI 数学模型(比如那些拥有几百亿甚至上千亿参数的“超级大脑”)确实很强,能解出最难的奥数题。但是,它们就像住在皇宫里的贵族

  • 太贵了:训练和运行它们需要巨大的算力和电费。
  • 太神秘了:它们的训练方法通常是商业机密,大家不知道它们是怎么学会的。
  • 难复制:普通研究者根本玩不起。

QED-Nano 的目标就是:能不能用**“小作坊”(小模型)和“公开配方”**(开源方法),培养出同样厉害甚至更聪明的数学神童?答案是:能!

2. 训练配方:三步走战略

研究人员给这个 4B 的小模型设计了一套独特的“特训营”,分为三个阶段:

第一阶段:模仿大师(SFT - 监督微调)

  • 比喻:就像让小学生临摹一位大数学家的笔记。
  • 做法:研究人员找来了一个超级强大的模型(DeepSeek-Math-V2,有 685B 参数,是个“数学泰斗”),让它写出很多高质量的奥数证明。然后,让小模型(QED-Nano)去背诵和模仿这些证明的写法。
  • 目的:让小模型先学会“数学证明长什么样”,掌握正确的格式和逻辑风格,而不是瞎编乱造。

第二阶段:实战演练与打分(RL - 强化学习)

  • 比喻:光会临摹不行,还得上考场。这时候,老师(AI 裁判)不再只看最终答案对不对,而是按步骤打分
  • 做法
    • 小模型尝试解题。
    • 一个专门的“裁判 AI"(基于规则)会给它的证明打分。这个打分表非常细致:如果你证明了关键的不等式,得 4 分;如果你逻辑跳跃了,扣 2 分;如果你完全错了,得 0 分。
    • 小模型根据分数不断调整自己的策略,“哪里扣分就改哪里”
  • 创新点:以前的 AI 只关心“答案对不对”,但奥数证明需要长篇大论的逻辑链条。这个“按步骤打分”的方法,教会了小模型如何一步步构建严密的逻辑,而不是走捷径。

第三阶段:学会“复盘”与“迭代”(Reasoning Cache - 推理缓存)

  • 比喻:这是最精彩的一步。想象一个学生在解一道极难的题,他写了一大堆,发现走不通。普通人可能会死磕,但 QED-Nano 学会了**“停下来总结”**。
  • 做法
    • 模型每写一段,就停下来,把刚才的思路总结成一句话(就像写日记摘要)。
    • 然后,它带着这个“摘要”继续写下一段。
    • 如果卡住了,它就基于之前的摘要重新思考,而不是从头再来。
  • 效果:这就像给小模型装了一个**“外挂大脑”。它不需要一次性写出几万字的证明,而是通过“写一段 -> 总结 -> 再写一段”**的循环,把复杂的长证明拆解成 manageable(可管理)的小块。这让它在测试时能思考得更久、更深,而不会把自己绕晕。

3. 成果:小个子打败大巨人

训练完成后,QED-Nano 的表现令人震惊:

  • 以小博大:它虽然只有 4B 参数,但在奥数证明测试(IMO-ProofBench)上的得分,吊打了很多 30B、120B 甚至 235B 的大模型。
  • 逼近巨头:当给它配上“推理缓存”这个外挂(让它能花更多时间思考)后,它的表现甚至接近了谷歌的 Gemini 3 Pro(一个闭源的超级商业模型)。
  • 性价比之王:它的推理成本只有那些大模型的几十分之一

4. 核心启示

这篇论文告诉我们一个重要的道理:在 AI 领域,并不是“越大越好”。

  • 大模型像是一个博闻强记但反应迟钝的百科全书,什么都能聊,但处理极度复杂的逻辑推理时,可能因为太“重”而显得笨拙。
  • 小模型 + 好方法(如 QED-Nano)则像是一个经过严格特训的特种兵。只要给它正确的训练方法(模仿大师、精细打分、学会复盘),它就能在特定领域(如数学证明)爆发出惊人的战斗力。

总结

QED-Nano 就像是一个**“平民英雄”。它证明了,我们不需要依赖那些昂贵、封闭的“超级大脑”,通过开源的、巧妙的方法,也能训练出能够解决世界最难题的“小天才”。这不仅让数学研究变得更便宜、更透明,也让我们看到了 AI 在特定领域“小而美”**的巨大潜力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →