← 最新论文
🤖 AI

LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation

本文介绍了 LivingArena,这是一个自动化的、抗污染的评估框架,其中大语言模型通过对抗性问题生成与回答,迭代地探测彼此的知识边界,从而产生一个能够揭示特定失效模式和高阶探测能力的稳定排行榜,这种能力区别于静态基准测试和人类偏好。

原作者: Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:全球最聪明的计算机正在不断进行测试,以争夺谁才是“最强”。长期以来,科学家们一直使用静态考试——就像是一个所有人都在参加的、巨大且一成不变的单选题测验。但问题在于:这些测验很快就会过时。一旦计算机学会了答案,它们就会仅仅进行死记硬背,导致测试失去了意义。这就像试图通过让一名跑步者在速度永远不会增加的跑步机上跑步来测量其速度;最终,他们都会达到机器的最高速度,而你无法分辨出谁才是真正的最快。

为了解决这个问题,研究人员正在寻找一种新的方法来测试这些“大语言模型”(LLMs)——即那些能够编写故事、解决数学问题和编写代码的超智能AI大脑。与其给它们固定的测试,不如让我们让这些计算机互相测试?这篇论文提出了一个引人入胜的问题:这些AI大脑是否知道其他AI大脑所不知道的知识?如果一个AI能精准地发现另一个AI的弱点,并提出一个让其栽跟头的问题,我们或许终于找到了衡量谁才是真正聪明的方法,而无需人类去编写数以千计的问题,也不必担心计算机通过死记硬背题库来作弊。


活体竞技场:一场永无止境的“抓包”游戏

见见 LivingArena。不要把它看作是一个教室,而要把它看作是一个高规格、自动化的辩论俱乐部,十个世界上最聪明的AI模型正锁在这个锦标赛中。这里没有人类老师发放工作表,AI们轮流担任 提问者(Questioner)回答者(Answerer)

游戏规则如下:

  1. 设陷阱: 一个AI(提问者)必须发明一个刁钻的问题,提供正确答案,并解释为什么该答案是正确的。
  2. 安全检查: 在另一个AI看到问题之前,由三名“裁判”AI组成的评审团会检查该问题是否毫无意义、答案是否确实正确以及逻辑是否成立。如果提问者犯错或试图欺骗裁判,他们会被惩罚。这就像裁判吹响了犯规的哨声。
  3. 对决: 如果问题通过了检查,第二个AI(回答者)就会尝试解决它。
  4. 计分: 如果回答者答错了,提问者得一分。如果回答者答对了,回答者得一分。

目标不仅仅是变得聪明,而是要成为一名 侦探。最聪明的玩家不仅是那些掌握最多事实的人,更是那些能够精准洞察对手不知道什么,并针对该特定弱点发起攻击的人。

重大发现:“我知道你的弱点在哪里”

研究人员让10个顶尖的AI模型参与了这场锦标赛,共进行了360场比赛和3,600轮对局。他们发现了一些令人惊叹的事实:AI们确实知道彼此不知道的东西。

当模型相互对战时,它们并不仅仅是提出随机的难题。它们开始“阅读”对手。如果一个AI在逻辑谜题上跌倒了,下次比赛时,另一个AI会立即再出一个逻辑谜题。它们实际上是在说:“嘿,你上次在这里栽了跟头;让我们看看这次你能不能行。”

论文显示,这些模型可以 定位弱点。例如,其中一个顶尖模型(GPT-5.5)非常擅长此道,在它发现对手在特定类型的推理上有缺陷后,它会在随后的回合中针对该主题进行连环攻击,命中对手弱点的频率达到了52%。这就像一名棋手注意到对手只要棋盘上有马就会失误,然后每次都会立即把马移动到那个位置一样。

然而,这存在一个极限。论文发现,一个AI 无法 提出一个比其自身大脑处理能力更难的问题。如果一个AI不理解某个概念,它就无法发明一个关于该概念的刁钻问题来难倒别人。这就像一个不懂微积分的学生无法编写一份刁钻的微积分试卷来难倒他们的老师。问题的难度始终受限于提问者自身的知识水平。

计分板:谁赢了?

这场锦标赛产生了一个稳定的排名(称为Elo排行榜),将模型分为五个不同的等级。

  • 冠军: GPT-5.5 占据了榜首。它在回答问题方面表现完美(准确率100%),并且在寻找弱点方面非常有侵略性(命中率26.3%)。
  • 被动玩家: 一些模型,如 Claude 系列,擅长回答问题但对于提问却非常羞涩。它们很少尝试难倒对手,这使得它们的总分处于中游水平。
  • “自我伤害”惩罚: 这是游戏的一个关键部分。如果提问者提出了一个坏问题(即答案错误或存在逻辑缺陷的问题),他们会失去一分。这迫使AI保持诚实和谨慎。那些过度自信或“幻觉”(凭空捏造事实)的模型受到了严厉惩罚。例如,GPT-5.2 的“自我伤害”率非常高(42.7%),这意味着它不断提出糟糕的问题并损害了自己的分数,这使其跌落到了排行榜的底端。

为什么这很重要

这篇论文表明,同行探测(peer probing)——即让AI互相测试——是衡量“真实”智能的一种比传统测试更好的方法。

研究人员发现,这种新方法衡量的维度与人类通常偏好的维度不同。在人类投票的竞技场中,那些说话礼貌、回答冗长华丽的模型往往会获胜。但在 LivingArena 中,这些华丽的风格并没有帮助。相反,获胜者是那些 事实精准、能够 承认自己不知道某些事情 并且在寻找真相方面具有 侵略性 的模型。

研究结论指出,虽然我们无法构建一个比房间里最聪明的AI还要难的测试,但我们可以构建一个随着AI变得越来越聪明而变得越来越难的系统。随着模型的进步,它们自然会为彼此提出越来越难的问题,从而创造出一个永不枯燥、永不饱和的“活体”基准。这是一个自我更新的竞赛,终点线不断移动,确保我们始终能分辨出谁才是真正的最快跑者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →