CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing
本文介绍了 CoBa,这是一种通过在生成与验证之间动态分配推理资源来优化测试时扩展(test-time scaling)的计算平衡路由策略,在实现数学推理基准测试达到最先进准确率的同时,显著降低了与传统扩展方法相比的计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解决一个非常棘手的谜题。你的能量有限,可以用这三种方式来使用它:你可以思考一个新的答案,你可以复查一个你已经拥有的答案,或者你可以直接说:“好了,我完成了,这是我的最佳猜测。”长期以来,试图解决难题(如数学谜题)的计算机一直被告知要通过一遍又一遍地做其中一件事来“更努力地尝试”。它们可能会生成一百个不同的答案并挑选出最受欢迎的一个,或者可能会花费巨大的能量去用一个超级聪明但缓慢的机器人裁判来检查每一个答案。问题在于,这就像是用大锤去砸坚果。如果答案显而易见,检查一百次就是一种浪费;如果答案超级难,仅仅随机猜测可能永远也找不到。核心问题在于,科学家们在思考:我们该如何分配有限的能量,才能在不耗尽电池的情况下得到正确答案?
这就是名为 CoBa 的新理念发挥作用的地方。把 CoBa 想象成一个团队的智能经理。它不是告诉每个工人做完全相同的事情,而是观察情况并决定下一步的最佳行动。如果工人们已经在为一个简单的答案达成一致,CoBa 会说:“太棒了,停!我们完成了。”如果他们感到困惑,CoBa 可能会说:“让我们再找两个人提供一些想法。”但如果他们卡在了一个很难的问题上,CoBa 会说:“好吧,让我们把最好的两个想法发给超级专家裁判进行检查。”研究人员在数千个数学问题上测试了它,发现通过成为一名智能经理,CoBa 可以获得与“暴力破解”方法(即尝试所有可能的方法)相同的超高分,但使用的“昂贵能量单位”(称为参数加权 Token)减少了 49.1%。这就像是在吃到同样美味佳肴的同时,只用了原来一半的食材。
问题所在:“越多越好”的陷阱
一段时间以来,让 AI 变得更聪明解决问题的最佳方法就是向它投入更多的计算能力。如果你想要更好的答案,你就要求 AI 生成更多的解决方案。如果你想确保准确,你就让第二个 AI 去检查所有这些方案。这就像是在干草堆里找一根针,即使针就在最上面,你却搬来了上千个人去搜寻整个干草堆。这确实有效,但极其昂贵且缓慢。
本文指出,这种“一刀切”的方法是浪费的。有些问题很简单,只需要扫一眼;而另一些问题则很难,需要深度思考。但旧方法对待所有问题的方式都是一样的。它们会在一个简单的数学问题和复杂的奥林匹克竞赛级难题上,投入同样巨大的能量。本文作者希望通过将“测试时扩展”(即在测试期间让 AI 进行更深入的思考)转变为一个资源分配问题来解决这个问题。他们问道:“在固定的能量预算下,我们应该把下一份能量花在生成一个新想法、检查一个旧想法,还是直接停止?”
解决方案:智能经理 (CoBa)
作者引入了 CoBa(计算平衡的测试时扩展),它就像是 AI 大脑的交通控制器。它是这样运作的,分步骤如下:
- 热身: 首先,CoBa 要求 AI 生成一组具有多样性的少量答案(就像询问两位朋友的想法)。这是“热身”阶段。
- 廉价检查: 接下来,它对所有答案进行快速、低能耗的检查。这就像问一位朋友:“这听起来对吗?”它既快又便宜。
- 决策: 根据廉价检查的结果,CoBa 会做出选择:
- 停止: 如果大家都达成共识且廉价检查非常有信心,Co-Ba 会立即停止。没必要浪费能量。
- 生成更多: 如果答案各不相同,CoBa 会要求再提供一些想法,以获得更多选项。
- 强力验证: 如果有几个很有前景但仍有不确定性的答案,CoBa 会将仅这些特定的候选答案发送给“超级法官”(一个功能更强大、更昂贵的 AI 模型)进行深度、彻底的检查。
这就是关键区别:CoBa 不会用“超级法官”去检查所有内容,它只发送那些最有吸引力的候选者。它把昂贵的能量留给了真正需要它的时刻。
结果:更聪明,而非更辛苦
研究人员在超过 3,000 个数学问题上测试了这个系统,范围涵盖从标准学校数学到非常困难的竞赛级谜题(如 AIME 和 AMC)。他们将 Co-Ba 与传统的“暴力破解”方法进行了对比。
- 重大胜利: 最好的 CoBa 版本(称为 Co-Ba-Routed-Strong)达到了 85.13% 的准确率。这几乎与最昂贵的方法(使用自评估加权投票系统得分 85.20%,以及使用“Best-of-16”多数投票得分 85.12%)持平。
- 节省开支: 奇迹发生的部分在这里。为了获得同样的高分,昂贵的方法使用了大量的计算能力。Co-Ba-Routed-Strong 使用的参数加权 Token 比自评估方法少了 49.1%,比 Best-of-16 方法少了 58.9%。
- 权衡: 文中指出,“Best-of-16”方法(即生成 16 个答案并选取最常见的那个)在准确率上仍然略微领先(仅 0.01 个百分点),但其运行成本是 Co-Ba 的 2.43 倍。Co-Ba 表明,对于大多数实际应用场景,这点微小的准确率提升并不值得付出如此巨大的成本。
这对未来意味着什么
论文表明,AI 推理的未来不仅仅在于构建更大、更强的模型,而在于如何更聪明地利用我们拥有的资源。作者发现,最大的瓶颈并不总是检查环节;有时,问题在于 AI 最初根本没有产生正确的答案。在最难的问题上(如 AIME 2025),即使是最聪明的经理,如果初始的“想法池”中没有包含正确答案,也无法找到它。
然而,对于绝大多数问题,Co-Ba 展示了我们可以停止浪费能量。通过使用一种“分诊”系统——对所有人进行廉价检查,仅对棘手的对象进行昂贵检查——我们可以在不破费大量资金的情况下获得最佳结果。论文总结道,这种方法将“先知差距”(即 AI 在已知答案的情况下本可以做到的程度与它实际表现之间的差距)转化为了一个有用的信号。如果 AI 失败了,我们现在可以确切知道问题出在哪里:是我们停止得太早了?是检查了错误的候选者?还是我们最初就需要生成更好的想法?
简而言之,Co-Ba 教会我们,在 AI 的世界里,时机和针对性与原始力量同样重要。重要的不是你思考得有多努力,而是知道何时该深入思考,以及何时该停止。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。