想象一下,你正在尝试解决一个非常棘手的谜题,比如一道复杂的数学题或一个棘手的编程挑战。通常,当你要求人工智能解决它时,人工智能会尝试沿着一条长长的直线进行思考。如果它在早期犯了一个小错误,整个答案就会分崩离析,它不得不从头开始。
这篇论文介绍了一种名为OpenDeepThink的新方法。这种方法不是要求人工智能沿单一线索思考,而是要求它在一个群体中思考。
以下是其工作原理,通过类比分解为简单的步骤:
1. “头脑风暴派对”(并行采样)
OpenDeepThink 不是要求人工智能提供一个答案,而是要求它同时生成20 个不同的答案。
- 类比:想象你是一位老师,让 20 名学生解答一道数学题。你不仅仅等待最聪明的孩子;你让每个人立即写下他们的解法。有些会非常出色,有些尚可,有些则完全错误。
2. “锦标赛”(成对比较)
现在你有 20 个解决方案,但如何挑选最好的一个呢?通常,你可能会问人工智能:“这个答案好吗?”但论文指出,人工智能在真空中判断自己的工作并不擅长(它往往过于自信或带有偏见)。
- 解决方案:不是问“这个好吗?”,而是要求人工智能将两个答案并排进行比较。“在方案 A 和方案 B 之间,哪一个更好,为什么?”
- 类比:想想体育锦标赛。仅仅通过观察,很难说出谁是“世界上最好的球员”。但如果你让球员 A 和球员 B 进行一场比赛,就更容易看出谁赢了。人工智能充当裁判,观察成对的解决方案相互较量,并为每一对宣布获胜者。
3. “记分牌”(Bradley–Terry 聚合)
在人工智能比较了许多成对方案后,它不仅仅是计算胜场。它使用一个特殊的数学公式(称为 Bradley–Terry)来创建全局排名。
- 类比:想象足球联赛积分榜。如果 A 队击败了 B 队,而 B 队击败了 C 队,数学逻辑就知道 A 队可能比 C 队更强,即使它们尚未交手。这就为这 20 个解决方案创建了一个可靠的“排行榜”。
4. “进化”(变异与选择)
这就是魔法发生的地方。系统不仅仅是选出获胜者然后停止。它会在多轮(代)中进化解决方案。
- 底部 25%(失败者):最差的解决方案被扔进垃圾桶。
- 顶部 25%(精英):最好的解决方案被保留下来,但它们也有机会改进。
- 中间 75%(变异者):人工智能利用“批评”(即一个方案击败另一个方案的原因)来重写解决方案。
- 类比:想象教练与球员交谈。教练不只是说“你做得很好”,而是说“你输了是因为你的奔跑速度太慢”。球员随后利用这些具体反馈来改变策略。如果反馈表明需要一种全新的方法,人工智能可能会完全重写一个解决方案。
5. “最终对决”
经过几轮这样的“锦标赛与训练”循环后,系统会对剩余的最优解决方案进行一次最终、非常详细的比较,以选出要提交的唯一最佳答案。
为什么这很重要?
- 无需“作弊条”:通常,要确认人工智能是否正确,你需要人类或计算机程序来检查答案(即“验证器”)。OpenDeepThink 不需要这个。它仅通过让人工智能与自己进行比较,就能找出最佳答案。
- 更擅长难题:论文在非常困难的编程问题(如竞技编程中的问题)上测试了这种方法。他们发现,这种方法使顶级人工智能(Gemini 3.1 Pro)的表现如同更高级别的专家,将其“技能评级”提升了 400 多分。
- 它知道自己的局限:该方法在具有明确对错答案的学科(如数学或编程)上效果极佳。然而,在主观话题上(如撰写文章或讨论历史),它有时会表现得更差。这是因为比较“观点”比比较“事实”更难。如果裁判(人工智能)无法区分好观点和坏观点,整个系统就会陷入混乱。
代价
权衡在于速度和成本。由于人工智能必须生成 20 个答案,成对比较它们,并多次重写它们,因此需要大量的计算能力和时间(在他们的测试中,每个问题约需 27 分钟)。这就像雇佣一整支专家团队和一组评委来解决一个问题,而不是只问一个人。
简而言之:OpenDeepThink 将人工智能的推理从“个人冲刺”转变为“团队锦标赛”。通过让人工智能与自己竞争,并通过比较从自身的错误中学习,它解决难题的能力远超其独自作战时的水平。
技术摘要:OpenDeepThink
问题陈述
当前大语言模型(LLM)扩展测试时计算量的范式,主要集中于扩展单一推理轨迹的深度(例如,更长的思维链或树搜索)。尽管这些方法有效,但此类顺序式方法存在一个关键脆弱性:早期的单一错误可能导致整个推理轨迹偏离。相反,像 Best-of-N 采样这样的并行方法(生成多个候选解)则面临“选择瓶颈”。从候选池中选出最佳候选解,通常需要真实值验证器(在开放式任务中不可用)、训练好的奖励模型或逐点 LLM 评判器。论文指出,逐点 LLM 评判本质上具有噪声且存在正向偏差,在缺乏外部验证的情况下,难以可靠地区分正确与错误的解决方案。
方法论:OpenDeepThink
作者提出了 OpenDeepThink,这是一种基于种群的测试时计算框架,旨在扩展推理广度,而无需外部验证器或特定领域的设施。该系统维护一个包含 n 个候选解的种群,并利用单个 LLM(π)作为生成器和评判器,在 T 代中对其进行演化。
该流程在每个世代中分为三个 distinct 阶段:
并行采样与成对比较:
- 系统初始化包含 n 个候选解。
- 在每一代中,候选解被随机配对(每个候选解有 K 个对手)。
- LLM 评判器执行成对比较,判断哪个解决方案更有可能被假设的在线评判器接受。关键在于,评判器还会生成自然语言的理由(批评意见)来解释其裁决。
- 为减轻位置偏差,候选解的呈现顺序被随机化。
Bradley–Terry 聚合:
- 系统不依赖原始胜率,而是使用 Bradley–Terry (BT) 模型 聚合成对结果。
- BT 模型通过最大化观测比较的对数似然,并考虑所面对对手的实力,为每个候选解估算全局技能分数(si)。这种“软验证器”将嘈杂的成对投票转化为连贯的全局排名。
- 选择: 前 25% 的候选解被保留为“精英”。后 25% 被丢弃。中间 50% 和精英(总计前 75%)进入变异阶段。
反馈驱动的变异:
- 前 75% 的候选解根据其成对比较中聚合的自然语言批评意见进行变异。
- 变异提示明确允许模型要么完善当前解决方案,要么完全放弃它并采用根本不同的方法。这旨在防止模型仅仅“修补”有缺陷的策略。
- 该过程重复 T 代。
最终选择:
- 在最后一代之后,对剩余种群进行更密集的成对比较轮次(M 个对手)。
- 最终的 Bradley–Terry 排名选出提交的解决方案。
整个流程设计为在每一轮内“极易并行”,仅需八次 LLM 调用的顺序深度(一次初始采样,T=3 时每代两轮,以及一次最终选择轮次)。
主要贡献
- 无验证器框架: OpenDeepThink 消除了对真实值测试用例或训练好的奖励模型的需求,通过使用 Bradley–Terry 聚合的成对 LLM 评判作为软验证器。
- 基于种群的演化: 不同于在单一轨迹上迭代的自我完善方法,OpenDeepThink 维护多样化的种群,允许错误通过面对面比较而非自我评估来暴露。
- 跨模型可迁移性: 该框架证明,单一组超参数可以在无需重新调整的情况下,有效扩展不同能力模型(Gemini 3.1 Pro、3 Flash 和 2.5 Pro)的推理能力。
- CF-73 数据集: 作者发布了 CF-73,这是一组经过策划的 73 个由专家标注的 Codeforces 问题(评级 2000–3100),本地评估与官方裁决之间的一致性达到 99%,专门设计用于避免预训练污染。
实验结果
该框架在 192 个竞争性编程问题(CF-73 和 NOI-119)以及多领域 HLE 基准测试中的 82 个问题上的表现进行了评估,使用 Gemini 3.1 Pro 作为基础模型。
竞争性编程(Codeforces):
- OpenDeepThink 在八轮顺序迭代(约 27 分钟实际时间)中,将 Gemini 3.1 Pro 的有效 Codeforces Elo 提升了 +405 分(从约 2851 提升至约 3256)。
- 这一增益与"Gemini 3 Deep Think"在 LiveCodeBench Pro 上相对于基础模型实现的 +411 分提升相当。
- 在“困难”问题(基础模型 pass@1 约为 11%)上,该框架通过演化将通过率提升至 36%,通过选择提升至 50%。
- 该框架成功迁移至较弱(Gemini 3 Flash)和较强(Gemini 2.5 Pro)的模型,无需超参数调整。
跨领域(HLE 基准测试):
- 结果参差不齐且依赖于领域。在 客观可验证领域(数学、生物学、物理学),该框架显示出增益(例如,物理学提升 +17 分)。
- 在 主观领域(人文学科、社会科学),性能显著下降(例如,人文学科下降 -25 分)。
- 作者将此归因于成对评判器的可靠性:在评判器能可靠区分正确性的地方,BT 聚合会放大信号;在判断模糊的地方,迭代选择会放大噪声。
消融研究:
- 成对 vs. 逐点: 成对评判在诊断集上达到了 86% 的准确率,而逐点评判为 59%,证实了相对比较优于绝对评分。
- 反馈信号: 负面反馈(对出错的批评)驱动了几乎所有的变异改进;正面反馈提供的收益微乎其微。
- 演化 vs. 选择: 在简单问题上,选择(BT 聚合)是主导因素。在困难问题上,演化变异过程是改进的主要驱动力。
意义与主张
论文认为,OpenDeepThink 解决了测试时计算扩展中的一个根本瓶颈:在没有外部验证的情况下,无法从并行候选池中选出最佳候选解。通过结合 成对 Bradley–Terry 聚合 与 反馈驱动的变异,该框架使 LLM 能够在开放式领域内迭代提升推理质量。
作者声称,该框架的有效性紧密依赖于成对评判器的可靠性。它充当“软验证器”,在具有客观正确性标准的领域(如竞争性编程)能显著提升性能,但在评判器无法可靠区分正确与错误推理的主观领域,可能会降低性能。这项工作表明,未来的扩展工作应侧重于基于种群的设计,利用相对比较而非绝对自我评估,前提是底层判断机制是稳健的。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。