← 最新论文
🤖 machine learning

Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

本文提出了一个用于推理型大语言模型测试时扩展(test-time scaling)的系统性框架,该框架区分了三种结构化推理机制,建立了将系统性能与候选诊断指标分离的评估原则,并定义了旨在解决当前不同推理算法之间缺乏可比性问题的复现标准。

原作者: Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipi
发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解开一个非常难的谜题,比如一个复杂的数学问题或一个棘手的逻辑谜题。你有一个超级聪明的的朋友(一个大型语言模型,简称 LLM),他知道很多事实,但有时在思考过快时会卡住或犯一些愚蠢的错误。在人工智能的世界里,有一个不断兴起的概念叫做“推理时缩放”(test-time scaling)。你可以把这看作是给你的朋友更多的思考时间、更多的纸张,或者更多尝试解决问题的机会。与其只是问他一个问题并直接接受他脑子里蹦出的第一个答案,不如让他大声说出思考过程,或者让他尝试三种不同的方法,又或者让他检查自己的工作。一个核心问题是研究人员正在探讨的:给予计算机更多的“思考时间”究竟是让它变得更聪明了,还是仅仅让它话变得更多了?

长期以来,科学家们一直在通过让 AI 生成多个答案并从中挑选出最好的一个,或者让它在不同的路径中搜索解决方案来进行测试。但问题在于,每个人都在使用略有不同的规则。有些研究人员让 AI 尝试 100 个不同的答案并选出赢家;有些让 AI 在说话中途改变主意;还有些让它像侦探寻找线索一样进行搜索。因为每个人使用的“剧本”都不同,所以很难比较谁的表现真正更好。这就像是在不了解使用了多少燃料或是在什么样的赛道上行驶的情况下,仅凭行驶距离来比较一辆赛车、一辆自行车和一艘火箭飞船的速度一样。这篇论文介入并指出:“等等,我们需要停止这种混淆,开始进行正确的测量。”

这篇论文的作者们——来自凯斯西储大学的一个团队——本质上是在为我们如何测试这些“思考机器”建立一套新的规则手册。他们认为,“推理时缩放”并不是单一的概念,它实际上包含三种截然不同的策略,我们需要将它们分开对待。首先是“单路径”(Single-Track)法,在这种方法下,AI 在一条长路径上思考,也许会在过程中纠正自己,就像一个徒步旅行者在走同一条路时停下来修正错误的转向。其次是“叶节点级”(Leaf-Level)法,AI 会生成一大堆完全不同的最终答案(就像面包师制作 100 个面包),然后在最后挑选出最好的一个。第三种是“前缀级”(Prefix-Level)法,这更像是一个树状探索者;AI 会向许多不同的方向分支,检查哪些分支看起来有希望,并在旅程结束前就剪掉那些死胡同。

论文发现,将所有这些方法视为同一种东西是一个错误。如果你仅仅说“我们使用了更多的计算能力”,你并不知道这些能力是如何被使用的。作者们展示了,仅仅因为 AI 生成了更多答案,并不意味着你挑选出的最终答案就会更好。事实上,如果挑选赢家的方法有缺陷,增加答案的数量反而可能让最终结果变差,这有点像有 100 个人对一部电影投票,但却使用了一个会选出最烂电影的坏掉的投票机。

为了解决这种混乱,该团队不仅是在空谈,还完成了繁重的实际工作。他们创建了一个包含超过 200 万个推理轨迹(可以理解为记录 AI 解决问题每一步骤的巨大图书馆)的海量新库,涵盖了数学、科学和逻辑谜题。他们利用这个库测试了 27 种不同的开源 AI 模型。他们的研究结果表明,虽然给予 AI 更多的思考时间确实可以帮助它更频繁地找到正确答案(他们称之为“发现”/discovery),但这并不总是意味着 AI 会知道如何从这一堆答案中挑选出正确的那一个(这被称为“选择”/selection)。他们发现,对于某些模型,仅仅通过让它们尝试更多次,找到正确答案的机会可以从大约 56% 上升到 82%,但每一个尝试都是正确的概率却显著下降了。这意味着 AI 变得更擅长寻找宝藏了,但要分辨哪张地图才是真实的地图却变得越来越难了。

论文还强调,我们不能只看最终得分就草草收场。要真正理解一个 AI 是否变得更聪明,我们需要准确知道它是如何被测试的:使用了什么提示词、尝试了多少次、最终答案是如何被选出的,甚至包括计算机运行的微小细节。他们认为,如果没有这些细节,比较不同的 AI 模型就像是在拿苹果和橘子做比较。通过提供一个清晰的框架来衡量这些“思考预算”,并发布他们的大规模数据集供所有人使用,他们希望能停止这种混乱,并帮助整个领域获得清晰、公平且可复现的结果。简而言之,他们是在告诉我们,要构建真正的智能 AI,我们不能靠猜测它们如何思考,而要用尺子去测量,而不是靠猜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →