Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation
本文通过证明改变推理 Token 预算会显著改变模型的性能和排序,揭示了非单调行为、排名反转以及模型互补性,从而挑战了大型语言模型排名稳定的假设,并指出有必要建立以预算为条件的评估协议。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你置身于一座巨大的图书馆,书中的内容是由被称为“大语言模型”(LLM)的超级智能机器人编写的。这些机器人几乎可以阅读一切,并能回答关于数学、科学和历史的问题。长期以来,人们在挑选“最佳”机器人时,只是向它们提问,然后看谁先给出正确答案。他们假设如果 A 机器人在一次测试中比 B 机器人更好,那么无论在什么情况下,它都会更好。这就像是通过只看谁先冲过终点线来评判一场比赛,而不关心他们被允许跑多久。
但这里有一个转折:这些机器人并不只是瞬间完成“思考”。它们是一个词一个词地写出答案,就像一条长长的思维链。它们被允许写的词数越多,它们在给出答案前就能“思考”得越久。这种对能写多少词的限制被称为“Token 预算”(token budget)。把它想象成给学生不同的考试时间。有些学生可能需要很多时间来解决一个难题,而有些学生如果时间太多,可能会因为过度思考而陷入混乱。科学家们面临的大问题是:如果我们改变时间限制,“最佳”机器人是否依然是最佳?或者说,冠军是否会随着我们允许它们思考的时间长短而改变?这正是研究人员想要探究的。
“过度思考”问题:为什么时间并不总是越多越好
在这项研究中,研究人员设计了一个大规模实验,观察四种不同的 AI 模型在三项棘手的测试中的表现:小学数学、竞赛级数学以及研究生水平的科学问题。他们不仅让模型运行,还强制要求它们在特定的“思考”量(以 Token 衡量)后停止。他们测试了七种不同的限制,范围从极小的 64 个 Token(思考时间非常短)到巨大的 4,096 个 Token(大量的思考时间)。
他们的发现证明了“单一最佳模型”的概念是一个神话。模型的排名会完全取决于它们被给予了多少时间,排名会随之发生翻转和变化。
“过度思考”的惊喜
你可能会认为,给机器人更多的时间去思考总会有助于它得到正确答案。但研究人员发现了一些奇怪的现象:有时,给模型更多的 Token 实际上会让它得到错误的答案。他们称之为“过度思考”(overthinking)。
想象一个学生已经知道了一个数学题的答案。如果你给他 10 分钟,他能正确写下答案。但如果你给他 30 分钟,他可能会开始怀疑自己,改变答案,最后反而得到了错误的结果。研究发现,这种情况发生在约 3% 到 19% 的问题中。更糟糕的是,这并不是题目本身的问题,而是针对每个特定机器人的。一个让某个模型“过度思考”并导致失败的问题,对于另一个模型来说可能完全没问题。这就像一个人如果准备演讲的时间太长可能会感到紧张,而另一个人则能在充足的准备时间中表现出色。
伟大的排名大洗牌
正因如此,这场“比赛”的赢家一直在变化。
- 在较简单的数学测试(GSM8K)中,当给予中等时间(256 个 Token)时,一个大型模型(LLaMA-3.3 70B)成为了冠军。但一旦他们给予模型更多时间(高达 4,096 个 Token),一个较小的模型(GPT-OSS 20B)便夺得了领先地位并保持至今。
- 在最难的科学测试(GPQA)中,最小的模型(LLaMA-3 8B)在时间紧迫时(256–512 个 Token)实际上表现最好。但随着时间的增加,较大的模型赶了上来,并最终与它并列第一。
这意味着,如果你今天看到一个排行榜说“模型 X 是最好的”,那么这句话仅在特定的时间限制下才是成立的。如果你改变时间限制,模型 X 可能会突然变成表现最差的一个。
“先知”差距:为什么我们需要智能开关
研究人员还问道:“如果我们能神奇地为每一个问题挑选出最完美的模型,我们的表现会有多好?”他们构建了一个理论上的“先知”(Oracle,即完美选择器),它能为每个特定的问题和时间限制选择最佳模型。
结果令人震惊。在困难的科学测试中,这个完美的选择器能比单个运行的最佳模型多获得 27.8 个百分点 的正确率。即使是在较简单的数学测试中,差距也非常显著(高达 16.9 个百分点)。这证明了没有任何一个机器人是全能的。有时小机器人是最好的,有时大机器人是最好的,有时它们全都错了。
我们能构建智能开关吗?
团队尝试构建了一个“路由器”(router)——一个智能系统,它观察一个问题和时间限制,然后决定由哪个机器人来回答。
- 在同类测试内部: 当他们在数学问题上训练路由器并在数学问题上进行测试时,效果非常好。利用“时间限制”作为线索有助于它选择正确的机器人,将准确率提高了 1.6 到 5.7 个百分点。
- 跨不同测试: 但当他们试图使用同一个路由器从数学切换到科学问题时,它就糊涂了。用于数学的“时间限制”线索在科学领域并不奏效。事实上,在跨领域切换时,使用这些线索反而让路由器的表现下降了 1.2 个百分点。这表明,关于“你拥有多少时间”与“得到正确答案”之间的关系,在不同的学科中是不同的。
总结
这篇论文传达的核心教训简单而有力:不存在单一的“最佳”AI 模型。 关于“哪个模型最好?”的答案完全取决于“你让它们思考多久”。
如果你正在为只能给 AI 极短时间的手机开发 App,一个小巧、快速的模型可能是你的冠军。如果你正在运行一个可以给 AI 数小时思考时间的服务器,那么一个不同的、更大的模型可能会胜出。过去那种通过选出一个赢家来涵盖所有人的排名方式已经失效了。相反,我们需要说:“模型 A 最擅长短回答,模型 B 最擅长长回答,而且有时候,如果你给它们太多的时间,它们反而可能会搞砸。”
研究人员建议,在未来,我们不应再追求一个单一的分数,而应该开始报告模型在不同时间限制下的表现。如果我们想要有效地使用这些模型,我们需要智能系统,能够知道何时该调用那个敏捷的小思考者,何时该调用那个庞大的慢思考者——因为随着时钟的滴答声,赢家随时都在改变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。