← 最新论文
💻 computer science

OpenDeepThink: Parallel Reasoning via Bradley--Terry Aggregation

OpenDeepThink 是一种基于种群的测试时计算框架,它通过聚合成对的 Bradley-Terry 比较来筛选、变异和演化候选解,从而增强大语言模型的推理能力,在无需重新微调模型的情况下,于 Codeforces 等客观基准测试中实现了显著的性能提升。

原作者: Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个非常棘手的谜题,比如一道复杂的数学题或一个棘手的编程挑战。通常,当你要求人工智能解决它时,人工智能会尝试沿着一条长长的直线进行思考。如果它在早期犯了一个小错误,整个答案就会分崩离析,它不得不从头开始。

这篇论文介绍了一种名为OpenDeepThink的新方法。这种方法不是要求人工智能沿单一线索思考,而是要求它在一个群体中思考。

以下是其工作原理,通过类比分解为简单的步骤:

1. “头脑风暴派对”(并行采样)

OpenDeepThink 不是要求人工智能提供一个答案,而是要求它同时生成20 个不同的答案

  • 类比:想象你是一位老师,让 20 名学生解答一道数学题。你不仅仅等待最聪明的孩子;你让每个人立即写下他们的解法。有些会非常出色,有些尚可,有些则完全错误。

2. “锦标赛”(成对比较)

现在你有 20 个解决方案,但如何挑选最好的一个呢?通常,你可能会问人工智能:“这个答案好吗?”但论文指出,人工智能在真空中判断自己的工作并不擅长(它往往过于自信或带有偏见)。

  • 解决方案:不是问“这个好吗?”,而是要求人工智能将两个答案并排进行比较。“在方案 A 和方案 B 之间,哪一个更好,为什么?”
  • 类比:想想体育锦标赛。仅仅通过观察,很难说出谁是“世界上最好的球员”。但如果你让球员 A 和球员 B 进行一场比赛,就更容易看出谁赢了。人工智能充当裁判,观察成对的解决方案相互较量,并为每一对宣布获胜者。

3. “记分牌”(Bradley–Terry 聚合)

在人工智能比较了许多成对方案后,它不仅仅是计算胜场。它使用一个特殊的数学公式(称为 Bradley–Terry)来创建全局排名。

  • 类比:想象足球联赛积分榜。如果 A 队击败了 B 队,而 B 队击败了 C 队,数学逻辑就知道 A 队可能比 C 队更强,即使它们尚未交手。这就为这 20 个解决方案创建了一个可靠的“排行榜”。

4. “进化”(变异与选择)

这就是魔法发生的地方。系统不仅仅是选出获胜者然后停止。它会在多轮(代)中进化解决方案。

  • 底部 25%(失败者):最差的解决方案被扔进垃圾桶。
  • 顶部 25%(精英):最好的解决方案被保留下来,但它们也有机会改进。
  • 中间 75%(变异者):人工智能利用“批评”(即一个方案击败另一个方案的原因)来重写解决方案。
    • 类比:想象教练与球员交谈。教练不只是说“你做得很好”,而是说“你输了是因为你的奔跑速度太慢”。球员随后利用这些具体反馈来改变策略。如果反馈表明需要一种全新的方法,人工智能可能会完全重写一个解决方案。

5. “最终对决”

经过几轮这样的“锦标赛与训练”循环后,系统会对剩余的最优解决方案进行一次最终、非常详细的比较,以选出要提交的唯一最佳答案。

为什么这很重要?

  • 无需“作弊条”:通常,要确认人工智能是否正确,你需要人类或计算机程序来检查答案(即“验证器”)。OpenDeepThink 不需要这个。它仅通过让人工智能与自己进行比较,就能找出最佳答案。
  • 更擅长难题:论文在非常困难的编程问题(如竞技编程中的问题)上测试了这种方法。他们发现,这种方法使顶级人工智能(Gemini 3.1 Pro)的表现如同更高级别的专家,将其“技能评级”提升了 400 多分。
  • 它知道自己的局限:该方法在具有明确对错答案的学科(如数学或编程)上效果极佳。然而,在主观话题上(如撰写文章或讨论历史),它有时会表现得更差。这是因为比较“观点”比比较“事实”更难。如果裁判(人工智能)无法区分好观点和坏观点,整个系统就会陷入混乱。

代价

权衡在于速度和成本。由于人工智能必须生成 20 个答案,成对比较它们,并多次重写它们,因此需要大量的计算能力和时间(在他们的测试中,每个问题约需 27 分钟)。这就像雇佣一整支专家团队和一组评委来解决一个问题,而不是只问一个人。

简而言之:OpenDeepThink 将人工智能的推理从“个人冲刺”转变为“团队锦标赛”。通过让人工智能与自己竞争,并通过比较从自身的错误中学习,它解决难题的能力远超其独自作战时的水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →