← 最新论文
🤖 AI

Benchmarking at the Edge of Comprehension

本文介绍了“抗批判基准测试”,这是一种对抗性框架,通过定义“无法被对手证伪的答案”即为正确,从而实现对超越人类理解能力的前沿大语言模型的评估,同时利用人类作为针对局部主张的有界验证者。

原作者: Samuele Marro, Jialin Yu, Emanuele La Malfa, Oishi Deb, Jiawei Li, Yibo Yang, Ebey Abraham, Sunando Sengupta, Eric Sommerlade, Michael Wooldridge, Philip Torr

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Samuele Marro, Jialin Yu, Emanuele La Malfa, Oishi Deb, Jiawei Li, Yibo Yang, Ebey Abraham, Sunando Sengupta, Eric Sommerlade, Michael Wooldridge, Philip Torr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对论文《在理解边缘进行基准测试》的解释。

问题:“过于聪明”的测试

想象你是一位老师,试图测试你的学生。多年来,你编写数学题,发给学生,并根据你的答案钥匙进行评分。但现在,你的学生变得如此聪明,以至于他们能在几秒钟内解决你编写的题目。更糟糕的是,他们开始解决那些极其困难的问题,以至于连你这位老师都无法 100% 确定他们的答案是对是错。

这就是论文所描述的情况。随着人工智能(AI)模型变得越来越聪明,它们正在“饱和”(击败)我们所有的现有测试。我们正进入一个“后理解时代”。这是一种花哨的说法,意思是:AI 如此先进,以至于人类无法再可靠地生成问题或检查答案。

如果我们无法检查答案,我们就无法衡量 AI 是否真的在进步。这就像试图批改一份物理试卷,而试卷中的答案涉及你无法理解的方程式。

解决方案:“抗批判”游戏

作者提出了一种测试这些超级智能 AI 的新方法。他们不再问“这个答案对吗?”(因为人类无法做到),而是问:"有人能证明这个答案是错的吗?"

他们称之为抗批判基准测试

这更像是一场辩论俱乐部法庭审判,而不是一场标准考试:

  1. 基准测试者(检察官): 一个 AI 负责创建一个难题,并试图找出另一个 AI 答案中的缺陷。
  2. 答题者(被告): 另一个 AI 尝试解决问题并为其解决方案辩护。
  3. 法官(人类): 人类不尝试解决整个问题。相反,他们充当特定小主张的裁判。

运作方式:“局部证人”规则

该论文基于对数学和逻辑的一个巧妙观察:往往更容易发现单个错误,而不是解决整个问题。

  • 类比: 想象一位天才写了一篇 50 页的证明。检查整个证明是否完美可能需要人类花费数年时间。但如果这位天才在第 12 页犯了一个微小的代数错误,人类可以在几秒钟内发现这个特定错误。
  • 规则: 只有当答案经受住攻击时,才被视为“正确”。如果“检察官”AI 指出了一个具体错误(一个“证人”),并且“法官”(人类)确认该错误确实存在,那么答题者就输了。如果检察官试图找出错误但失败了,答题者就赢了。

人类法官不需要理解整个解决方案;他们只需要验证一个小而局部的声明,例如:“这一步是否真的遵循了前一步?”或者“这个数值计算是否错误?”

游戏机制

该论文建立了一个结构化的游戏,为 AI 模型设定了两个主要角色:

  1. 出题者: 这个 AI 能否创建一个难到足以难倒他人,但又不至于坏到无法解决的问题?
  2. 解题者: 这个 AI 能否解决问题并抵御对其答案的攻击?

他们使用一种统计系统(称为Bradley-Terry 模型,类似于国际象棋中使用的Elo 等级分系统)来对模型进行排名。

  • 如果一个 AI 在辩论中不断获胜(解决了其他人无法破解的问题),它的分数就会上升。
  • 如果一个 AI 不断失败(无法解决问题或无法辩护),它的分数就会下降。
  • 关键在于,该系统还评估 AI 在编写问题方面的能力。

结果:它有效吗?

作者使用复杂的数学测试了八个不同的 AI 模型。以下是他们的发现:

  • 符合现实: 这种“辩论游戏”产生的排名与人类设计的传统测试非常吻合。现实世界中“最聪明”的 AI 在这种新游戏中也是“最聪明”的。
  • 人类可以被(某种程度上)取代: 即使他们使用较弱的 AI 模型来充当“法官”而不是人类,结果仍然保持一致。这表明发现特定错误比解决整个问题更容易,因此即使是“较弱”的法官也能发现“强大”AI 的错误。
  • 稳定性: 当他们多次运行测试时,分数没有发生剧烈变化。

核心结论

该论文认为,我们不需要完全理解一个解决方案就能知道它是否好。我们只需要能够在它出错时抓住它。

通过将基准测试转变为一种对抗性游戏,让模型试图破坏彼此的答案,而人类充当小主张的裁判,即使 AI 变得过于聪明以至于我们无法完全理解,我们仍然可以继续衡量 AI 的进步。这将目标从“我们知道答案吗?”转变为“我们能识破谎言吗?”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →