← 最新论文
🤖 AI

How Inference Compute Shapes Frontier LLM Evaluation

本文表明,前沿大语言模型的性能对推理时计算预算和评估协议高度敏感,并主张基准测试应当报告能力与可用计算量之间的函数关系,而非依赖于可能低估模型潜力的限制性固定预算。

原作者: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在测试一支优秀的侦探团队,以选拔出谁才是解决复杂谜题的最优人选。在过去,你可能会给他们一个严格的规则:“你有10分钟时间,且只有一次书写答案的机会。”如果他们失败了,你会说:“这个侦探不够优秀。”

但这篇文章认为这种方法是不公平的。它指出,有些侦探只是需要更多的时间、第二次检查工作的机会,或者一个关于他们第一次猜测错误的提示。如果你给了他们这些东西,他们或许能完美地破解谜题。

研究人员使用世界上最先进的AI模型(即“侦探”)对七个非常困难的挑战进行了测试,范围涵盖编写计算机代码、解决高级数学问题、诊断医学病例以及破解网络安全系统。

以下是研究结果的简单解释:

1. “时间限制”陷阱

大多数AI测试都会对模型使用的“思考时间”(token/字符)设定严格限制。研究人员发现,对于许多困难任务,这种限制会在AI即将理清头绪的关键时刻将其切断。

  • 类比: 想象一名学生正在参加数学考试。他们知道如何解题,但老师在10分钟后停止了考试。学生得了不及格,不是因为他们不会数学,而是因为他们用完了时间。
  • 结果: 当研究人员给予AI模型更多的思考时间(高达平时的30倍)时,它们在高级数学和网络安全等困难任务上的得分显著提高。然而,在某些任务(如某些软件工程问题)中,模型在正常的时限内已经解决了它们能解决的大部分内容,因此给予更多时间并没有带来太大帮助。

2. “第二次机会”效应

研究人员还测试了如果允许AI在失败尝试后再次尝试会发生什么。

  • 类比: 想象你在玩电子游戏。如果你死了,就直接出局了吗?还是你可以重新开始并尝试不同的策略?
  • 结果: 让AI“重启”或提交新答案,几乎提高了所有测试的得分。
    • 有提示时: 如果AI被告知“那个答案是错的,再试一次”,它在寻找正确解决方案方面变得更出色,尤其是在处理长篇、复杂的任务时。
    • 无提示时: 如果AI必须在不知道自己对错的情况下自行猜测,它的表现虽然也有提升,但幅度没那么大。
    • 注意事项: 在某些测试中,AI只需要一两次尝试就能成功;而在另一些测试中,它需要尝试10次甚至15次才能最终成功。

3. 没有统一的标准

最重要的发现是,不同类型的题目需要不同种类的“帮助”。

  • 类比: 想象你有一个工具箱。锤子很适合钉钉子,但对螺丝钉毫无用处。你不能把锤子用在所有东西上并期望它奏效。
  • 结果:
    • 网络安全与数学: 这些任务非常依赖于更多的时间更多次的尝试。AI在工作时间越长的情况下,表现就越好。
    • 医学诊断: 这项任务在增加时间后并没有明显改善。它似乎遇到了一个瓶颈,即更多的思考也无法提供帮助。
    • 软件工程: 这些任务在增加时间后略有提升,但主要还是需要被允许多次尝试。

4. 新型模型有所不同

研究人员测试了不同年份的模型(旧型号 vs 新型号)。

  • 类比: 把旧模型想象成需要大量时间和许多提示才能破案的初级侦探。新型模型则像是资深侦探;他们能解决更难的案件,也更可靠,但他们并不一定在利用时间方面变得更快。
  • 结果: 新型模型不仅仅是变得“更快”地使用时间,而是变得更擅长于:
    1. 解锁更难的任务: 它们可以解决旧模型根本无法触及的问题。
    2. 更高的可靠性: 当它们解决问题时,在第二次尝试时犯错的可能性更低。
    • 有趣的是,最新的模型有时不需要那么多“第二次机会”,因为它们往往能第一次就答对。

核心结论

该论文认为,我们不能通过单次测试中带有严格时间限制的单一分数来判断一个AI的真实智能。

  • 得分取决于规则: 一个AI的得分取决于你给它多少时间、是否允许它重试,以及是否告诉它对错。
  • 建议: 与其说“模型X得分为80%”,我们应该说“模型X在1分钟内得分为80%,但在10分钟内得分为95%”。这能提供一个更清晰的图景,让我们了解AI的实际能力,特别是在涉及安全和政策决策时,我们需要知道这些系统的最大潜力,而不仅仅是它们在压力下的表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →