← 最新论文
🤖 AI

Knowledge Index of Noah's Ark

本文介绍了 KINA,这是一个经过严格设计的、包含 261 个学科的 899 个条目的知识基准测试,它采用贪婪近似法来确保代表性,并利用“加分赛”机制(bonus-on-bar tournament)来保证标注质量,揭示了 42 个领先模型之间具有层级性的性能格局,且在达到饱和之前仍有显著的提升空间。

原作者: Sheng Jin, Minghao Liu, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang
发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Sheng Jin, Minghao Liu, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan, Ge Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想测试一群学生的聪明程度,但你不想给他们考标准的数学试卷,而是想看看他们是否真正理解了 261 个不同学科的“精髓”,从高级工程学到冷门的各种历史。

这篇论文介绍了 KINA(诺亚方舟知识指数),一种全新的、高度复杂的“考试”,旨在测试大型语言模型(AI)。作者认为,以往的考试存在三个主要缺陷:它们过于宽泛而不公平;给评审人员的报酬太低,导致他们缺乏责任感;且结果过于不稳定,难以信任。KINA 通过全新的设计解决了这些问题。

以下是通过简单的类比对 KINA 工作原理进行的解释:

1. 问题所在:“懒惰调查” vs. “专家地图”

旧方式: 想象一下,试图通过向墙上乱投飞镖并观察落点来绘制一块大陆的地图。以前的 AI 测试就是这样做的:它们从各处抓取数千个问题。有时它们击中了某个深刻的重要概念;有时则只是击中了一个琐碎的事实。其结果是一张混乱的地图,无法显示出 AI 真正的弱点在哪里。
KINA 的方式: 作者将这场考试视为在建造一艘**“诺亚方舟”**。他们并没有随机抓取动物,而是精心挑选了恰好 899 个项目,来代表 261 个特定的“学科”(就像一个微小而完美的生态系统)。

  • 类比: 与其说是投掷飞镖,不如说他们使用了一种“贪婪选择”算法。想象一下,你的船上空间有限,你需要挑选出那些能代表森林中最独特、最重要部分的动物。KINA 挑选的问题充当了每个学科的“锚点”,确保测试覆盖了每个领域的“核心”,而非仅仅是容易的部分。

2. 问题所在:“固定工资” vs. “锦标赛”

旧方式: 想象一下,你雇佣人们来批改这些试卷,无论他们工作多努力,每检查一份试卷只付 10 美元。一个理性的劳动者会只做最基本的工作以换取那 10 美元,从而导致“懒惰共识”,让糟糕的问题混入其中。
KINA 的方式: 作者引入了 “加薪锦标赛”(Bonus-on-Bar Tournament)

  • 类比: 想象两个评委在给同一个问题评分。他们都有基本工资,但只有给出更高分数(且该分数必须通过严格的质量阈值)的那个人,才能获得一笔丰厚的奖金
  • 结果: 这创造了一种竞争机制,促使人们变得更加细心和彻底。如果一个评委偷懒,他就会把奖金输给竞争对手。论文在数学上证明了,这种系统比旧有的“固定薪资”系统更能迫使评审人员投入更多精力并发现更多错误。

3. 问题所在:“一次性快照” vs. “稳定的排行榜”

旧方式: 如果你在 100 个问题上测试一个 AI,5 分的分差可能仅仅是运气(就像掷骰子一样)。你无法确定模型 A 是否真的比模型 B 更好。
KINA 的方式: 作者对他们的研究结果进行了“压力测试”。他们使用了一种称为**“自助法”(bootstrapping)**的统计技术(想象一下拍下一张排行榜的照片,然后打乱题目顺序,再拍下 1,000 张新照片,看看排名是否依然成立)。

  • 结果: 他们发现,顶层的排名非常稳定(像一艘坚固的船),但中层的排名则比较摇摆。他们警告我们不要过度纠结于中层模型之间微小的差异,因为这些差距可能只是噪声。

他们发现了什么?(比赛结果)

他们在这一新考试上测试了 42 种不同的 AI 模型。以下是总结:

  • 获胜者: 最强的 AI(Gemini-3.1-Pro-Preview)得分约为 53%。紧随其后的两位(Claude 和 GPT)表现接近,大约在 50% 左右。
  • 差距: 即便是最优秀的 AI,也近乎一半的问题答错了。这场考试远未被“攻克”。
  • 惊喜之处: 最聪明的 AI 之间的最大差异并不在于数学或科学(在这些领域它们表现都不错)。真正的战场在于人文和社会科学(如历史、社会学和哲学)。
    • 类比: 这就像一场比赛,所有人在铺设平整的公路(科学)上跑得很快,但真正的胜负取决于谁能在泥泞、复杂的森林小径(人文)中穿行。
  • 工具: 给 AI 提供搜索引擎的访问权限有所帮助,但效果并不均衡。它帮助较弱的模型填补记忆空白,帮助较强的模型验证事实,但它并不能神奇地让所有人变得完美。

核心启示

KINA 不仅仅是一个更难的测试,它是一个设计更好的测试

  1. 它确保问题真正代表了学科的灵魂
  2. 它以一种能迫使评审人员保持诚实和彻底的方式来支付报酬。
  3. 它承认某些排名是波动的,并告诉我们不要过度解读微小的差异。

论文得出结论,虽然 AI 正在变得越来越聪明,但在理解人类文化和历史等复杂、微妙的世界方面,仍有巨大的提升空间

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →