← 最新论文
💬 NLP

Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions

本文引入了一种考试风格的评估框架,揭示了当前的推理模型无法在多个问题之间策略性地分配共享的测试时计算预算,而是表现为贪婪的顺序求解器,优先考虑呈现顺序而非问题难度或价值。

原作者: Chenrui Fan, Yize Cheng, Ming Li, Yongyuan Liang, Tianyi Zhou, Soheil Feizi

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenrui Fan, Yize Cheng, Ming Li, Yongyuan Liang, Tianyi Zhou, Soheil Feizi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正坐在一座巨大的、高科技的图书馆里,书本是由被称为“推理模型”的高级计算机编写的。这些计算机非常擅长解决谜题,但它们有一个奇怪的癖好:谜题越难,它们在回答之前“思考”得就越多。这个思考过程会消耗一种叫做“计算量”(compute)的东西,这就像是一种有限的能量供应,或者是一个严格的时间限制。科学家们早就知道,如果你给这些计算机更多的时间来思考单个难题,它们解决问题的能力就会提高。但现在出现了一个新问题:如果你给这些计算机一叠不同的谜题,但只给它们一个共享的、总体的时限,会发生什么?计算机能否决定哪些谜题值得它投入精力,还是说它只会机械地按顺序处理出现的每一个谜题,在简单的题目上浪费时间,导致在看到后面的难题之前就精疲力竭了?这就是研究人员试图解决的大谜团,因为如果这些聪明的计算机无法在处理一组任务时管理好自己的能量,它们在需要同时处理多项工作的现实世界场景中可能会失败。

这篇题为《思考过度而非思考聪明》(Thinking Hard, Not Smart)的论文深入探讨了正是这样一个问题。研究人员为世界上几种最先进的推理模型设计了一场数字“考试”。他们没有给每个问题分配独立的时间限制,而是给了整场考试一个共享的“思考 Token”预算(一种计算努力的单位)。这场考试包含不同难度的题目,有些题目分值更高,模型必须弄清楚如何分配有限的能量以获得最高总分。结果令人震惊:这些模型的表现并不像那些懂得策略的考生。它们并没有为了给高分值的简单题留出能量而跳过一个低分值的难题,而是表现得像一个贪婪的学生,只是从头到尾机械地阅读题目。它们在最初的几个问题上投入了巨大的精力,往往在还没看到试卷末尾时就用完了 Token,而无论后面的题目分值有多高,情况都是如此。

研究发现,这些模型是“位置盲目”的策略家。它们似乎并不在意一个问题是被标记为“难”还是“易”,也不在意它是值 20 分还是 5 分。它们大多只是遵循题目呈现的顺序。如果一个问题排在第一位,它们就会把所有精力倾注其中;如果排在最后,它们往往会完全忽略它。研究人员通过打乱题目顺序并改变其分值进行了测试,但模型并未做出调整。即使研究人员给模型提供了特殊的提示,要求它们“提前计划”和“明智分配”,模型也没有改变习惯。它们仍然以同样的方式消耗能量,只是将这种缺乏策略的行为分布得稍微均匀了一些。这表明,虽然这些模型在针对单个问题进行“深度思考”方面做得越来越好,但它们尚未学会如何对“哪些问题值得思考”进行“聪明思考”。

为了让这一点更清晰,想象一下你有一个背包,重量限制严格为 10 磅,而你在一个有 20 件物品的跳蚤市场上。有些物品很重但很值钱(高价值、高成本),有些很轻但几乎不值钱(低价值、低成本),还有些很重但毫无价值。一个聪明的购物者会查看整个清单,挑选出那些“单位重量价值最高”的物品,填满背包以获得最多的钱。但这些 AI 模型表现得就像一个只顾着抓取第一个看到的物品,然后是第二个,接着是第三个,直到背包重到拎不动为止的购物者。等到他们走到队伍后端时,已经没有空间装下那些最好的交易了。研究人员发现,随着问题(或物品)的数量从 5 个增加到 20 个,模型在覆盖整个列表方面的表现变得越来越差。例如,面对 20 个问题时,模型仅对其中的 4 到 8 个问题进行了认真处理,剩下的则完全被忽视了。

论文还观察了模型是否会对问题的难度做出反应。事实证明,它们确实会在开始处理难题后花费更多时间,但它们是在已经开始处理之后才这样做的。它们不会看着一个难题说:“这看起来很难,我先跳过它,为以后留点能量。”相反,它们直接投入其中,意识到很难,然后不断进行,直到耗尽能量。这就是作者所说的“反应式”而非“前瞻式”思考。它们擅长在开始解决一个问题时去解决它,但不擅长决定哪些问题值得开始。

有趣的是,研究人员在数学问题和编程问题上都进行了测试,结果是一致的。无论是解决方程还是编写计算机程序,模型的行为都像是在固定轨道上的火车:它们向前移动,一个问题接一个问题,直到燃料耗尽。它们不会跳出轨道去寻找更容易或更有价值的站点。这项研究结论指出,这种在多个任务之间管理共享预算的能力,是当前模型所缺乏的一种独特技能。它们知道如何“思考得深”,但还没有学会如何“分配思考”。这不仅仅是一个小小的瑕疵;它表明,当我们要求这些模型执行更复杂的、多步骤的任务时,我们可能需要教给它们一种全新的“元认知”——即思考自身思考过程并管理资源的能力,而不仅仅是解决眼前的谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →