← 最新论文
🤖 AI

Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence

本文审计了前沿人工智能预测的测量基础,并发现关键的数据缺口、基准测试的不一致性以及来源集中度削弱了基于简单趋势的预测,从而论证了可辩护的预测必须建立在具有透明协议和链接的显式、版本化测量系统之上。

原作者: Fabricio F Costa

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Fabricio F Costa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

我们生活在一个人工智能的能力经常被以天气预报般的精准度进行预测的时代。专家们通过观察计算机运行速度的提升、喂给它们的数据量以及它们在标准化测试中的表现,来猜测机器何时能达到人类水平的推理能力,甚至超越人类。这些预测通常以日历上的一个具体日期形式呈现,暗示到某一年,人工智能将能够解决复杂问题或执行特定任务。其逻辑似乎显而易见:如果你能测量一辆汽车的速度,你就能计算出它何时到达目的地。但这种方法依赖于一个隐藏的假设——即今天用来测量速度的尺子与昨天是一样的,且路上的每一辆车所使用的速度计都是正常工作的。

Fabricio F. Costa 的一项新分析挑战了这一假设。该论文并非认为预测人工智能的未来是不可能的,而是指出目前我们尝试预测的方式是建立在一个不稳固的基础之上的。作者对用于做出这些预测的公共记录进行了严格的审计,他没有将数据视为图表上的平滑曲线,而是将其视为一系列独立的事件、测量值和来源。调查显示,构建这些系统的资源与其实际性能之间的联系,远比流行的预测所暗示的要更加碎片化。研究发现,支持这些预测的证据往往是不完整的、不一致的,并且严重依赖于单一的信息源,这使得新闻中经常引用的具体日期与其说是科学结论,不如说更像是一种猜测。

要理解问题的规模,首先必须了解这些预测通常是如何构建的。研究人员通常试图将两件事联系起来:训练模型所使用的计算量,以及它在基准测试中取得的结果。基准测试(benchmark)仅仅是一套标准化的题目或任务,旨在衡量特定的技能,比如回答常识问题或解决数学问题。其核心理念是,随着你给予模型更多的计算能力,它在这些测试中的得分会以一种可预测的方式上升。如果你能绘制出这种关系图,你就可以向前投影,看得分何时达到某个特定阈值。然而,为了使这种投影有效,你需要拥有数据点,其中计算量和测试得分是在同一个系统中同时已知的。

当作者检查了 62 个主要人工智能系统的公开记录时,一个显著的缺口出现了。虽然许多系统的计算量信息是可获得的,但对于大量最先进的闭源模型来说,这些信息却缺失了。相反,来自一个被广泛引用的特定测量程序(名为 METR)的性能得分在许多闭源模型中是可用的,但在开源系统中却完全缺失。这导致了一种情况:用于绘制连线的两个数据点——“燃料”和“速度”——很少能在同一台机器上共存。在全部 62 个系统中,只有 7 个系统同时记录了计算量估算值和性能得分。这意味着,预测中经常看到的平滑曲线实际上是穿过极少数数据点绘制出来的,而其余的景观则是一片空白。

当你考虑到这些测试本身并不是静态的时候,问题就变得更加深层了。正如一把尺子可能会被更换为带有略微不同刻度的尺子一样,用于衡量人工智能的基准测试也在不断更新、修订或更换,以防止模型仅仅是死记硬背答案。审计观察了这些不同版本的测试是如何相互关联的。研究发现,当你尝试将旧版本测试的分数与新版本进行比较时,它们之间的关系并不总是简单的线性偏移。有时,新测试衡量的东西略有不同,或者难度的变化方式会导致分数出现意外的跳跃或下降。研究通过观察系统在两个版本的流行测试中的表现来验证这一点,发现旧分数与新分数之间的联系在很大程度上取决于用于比较它们的数学方法。在某些情况下,新版本似乎显示出比旧版本更陡峭的进步,而在另一些情况下,进步看起来却是平缓的。这表明,得分的上升并不一定意味着人工智能变得更聪明了,可能仅仅是因为测试发生了变化。

另一个关键问题是证据的集中度。用于追踪人工智能进展的大部分具体数据点都来自单一的测量程序。在审计记录的 71 个主要定量事件中,有 52 个仅来自一个来源。这就像试图通过仅来自一个城市的温度计读数来理解整个大陆的气象模式。虽然那个城市的数据可能是准确的,但它无法告诉你大陆的其他地区是否正在经历同样的情况。审计还指出,许多此类测量来自于实验室发布,而非现实世界的实地测试。在实验室中,条件是受控的,但在现实世界中,人工智能会与不可预测的环境、不同的用户以及不同程度的支持进行交互。论文认为,依赖单一来源和单一类型的测试会产生一种虚假的确定感,即人们之所以对预测充满信心,仅仅是因为数据看起来具有一致性,尽管这种一致性并非真正的独立。

作者还研究了用于连接这些不同测量值的统计检验的效力。分析显示,目前的数据集通常太小,无法检测到除了剧烈变化之外的任何细微变化。如果计算量与性能之间的关系发生了微小的改变,目前的记录很可能会完全忽略它。研究计算得出,要可靠地检测出这些系统改进方式的微小转变,研究人员需要在许多不同的系统上同时进行新旧基准测试。如果没有这样更大、更多样化的数据集,任何声称确切知道何时达到特定里程碑的预测本质上都是在猜测。

该论文并不建议我们停止尝试衡量人工智能的进步。相反,它呼吁采用一种更诚实、更复杂的方法。作者提议采用一种“组合式”(portfolio)的测量方法,而不是试图将人工智能的所有能力压缩进一个数字或一个日期中。这将涉及同时追踪不同的指标:运行一个模型需要多少能源和资金、它的长期可靠性如何、它在现实任务中的表现如何,以及它如何处理安全风险。它还需要一个系统,让不同的研究小组使用不同的方法测试相同的模型,以确保结果不仅仅是某个特定实验室或特定测试产生的产物。其目标是摆脱“单一完美尺子”的概念,转向一套能够衡量智能不同侧面及其各自不确定性的工具集。

最终,研究结论认为,关于人工智能未来的可辩护预测必须对其测量对象以及测量方式保持透明。它必须承认数据缺失的地方、测试发生变化的地方,以及证据的来源。如果一个预测只是给出一个日期而不解释其背后的测量系统,那么它就不是一个科学主张,而是一个猜测。论文敦促该领域将测量系统本身视为预测的一部分,承认日期本身的意义取决于用于寻找它的那把尺子。在整个领域能够建立起一个在许多不同系统中都能对计算量、性能和现实世界成果进行持续且独立测量的记录之前,任何预测中最精确的部分将是日历上的日期,而最不精确的部分将是我们在通往那个日期途中实际测量到的内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →