← 最新论文
🤖 AI

Submodular Benchmark Selection

本文在多元高斯模型下,将评估大语言模型时选择一小部分具有信息量的相关基准测试子集的形式化问题表述为次模最大化问题,并证明在小规模子集情形下,基于贪心互信息的方法在插补任务上优于基于熵的方法。

原作者: Alexander Smola

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Smola

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位美食评论家,试图品尝一个巨大且无尽的自助餐中的每一道菜,以决定哪位厨师最出色。你有 57 道不同的菜肴(基准测试)需要尝试。但品尝每一道菜都需要耗费无尽的时间,花费巨额资金,而且你的胃也只能承受有限的分量。

问题出在哪里?许多菜肴的味道非常相似。如果你喜欢辣味意大利面,你可能也会喜欢辣味面条。它们是“相关的”。因此,核心问题是:你实际上只需要品尝哪一小部分菜肴,就能了解全貌?

这篇由 Alex Smola 撰写的论文,提供了解决该确切问题的数学配方。它将不同 AI 模型在不同测试中的得分视为一大锅汤中的食材,利用一个名为次模优化(submodular optimization)的数学分支(这仅仅是一种“边际收益递减”的 fancy 说法)来挑选最佳的子集。

以下是他们方法的分解,使用了简单的类比:

1. 两种策略:“多样化采样者”与“连接者”

作者提出了两种不同的方法来挑选你的小份基准测试子集。可以将它们想象为针对该自助餐的两份不同的购物清单。

  • 策略 A:“多样化采样者”(熵最大化)

    • 目标: 挑选彼此截然不同的菜肴。
    • 类比: 你想要一道辣菜、一道甜菜、一道咸菜和一道酸菜。你不想要三种不同类型的辣味意大利面,因为它们告诉你的信息都是一样的。
    • 工作原理: 这种方法寻找“最独特”的基准测试。这就像挑选地图上的枢纽点。论文指出,这在数学上等同于一种名为“枢轴 Cholesky 分解”(pivoted Cholesky)的标准技术,这是一种将大矩阵分解为更小、更易处理部分的方法。
    • 结果: 这对于获得广泛的概览非常有用,但它可能会遗漏将菜肴联系在一起的特定细节。
  • 策略 B:“连接者”(互信息)

    • 目标: 挑选那些能告诉你关于未挑选其他菜肴最多信息的菜肴。
    • 类比: 想象你挑选了一道“万能钥匙”菜肴。如果你知道厨师如何处理这一道特定的菜,你就能准确推测出他们如何处理其他 50 道菜,即使你从未品尝过它们。你不仅仅是在寻找多样性;你正在寻找那道作为通往菜单其余部分最佳“枢纽”或“桥梁”的菜肴。
    • 工作原理: 这种方法计算一个基准测试能为你提供多少关于其余未选基准测试的信息。
    • 结果: 论文发现,对于小预算(仅品尝 1 到 5 道菜),“连接者”策略是获胜者。它比“多样化采样者”更能准确地预测缺失的得分。

2. “缺失菜单”问题

在现实世界中,并非每个 AI 模型都在每个基准测试上接受过测试。这就像一份菜单,有些厨师尚未烹饪某些菜肴。数据是不完整的。

  • 解决方案: 作者使用了一种称为**EM(期望最大化)**的统计技巧。
  • 类比: 想象你试图猜测汤的食谱,但你只有几勺汤。你根据你拥有的东西猜测缺失的食材,品尝这个“猜测”,然后调整你的食谱。你反复重复这个过程,直到你的猜测变成对整个汤非常准确的估计。这使得他们即使在数据杂乱且不完整的情况下,也能构建出完整的图景。

3. “代理差距”(获胜者为何获胜)

论文发现了一个有趣的怪癖,他们称之为“代理差距”。

  • 观察: “多样化采样者”(熵)实际上在减少剩余菜肴的数学误差(残差方差)方面做得更好。它挑选的是统计上最独立的项。
  • 转折: 然而,当涉及到预测未挑选的菜肴的得分时,“连接者”(互信息)胜出,尤其是当你只能挑选少数几道时。
  • 为什么? 因为“多样化采样者”挑选的是独特的项,但它们可能对于猜测其他项并没有太大帮助。“连接者”挑选的是与组内其余部分紧密相连的项。如果你想预测未来,你需要的是枢纽,而不仅仅是离群值。

4. 结果:你需要多少?

作者在来自十个不同 AI 排行榜(例如拥有 57 个科目的 MMLU 和拥有 56 个任务的 MTEB)的真实数据上测试了这一点。

  • 好消息: 你不需要测试所有内容。
  • 数据:
    • 在 MMLU 数据集(57 个科目)上,仅挑选5个精心挑选的基准测试,就使他们能够以**91%**的准确率预测其余 52 个的得分。
    • 即使在一个杂乱且不完整的数据集上,挑选 15 个基准测试也捕捉到了整个集合一半以上的信息。
  • 可视化: 他们观察了数据的“谱”(就像观察彩虹中的颜色)。他们发现信息被打包在非常少量的“颜色”(维度)中。一旦你挑选了正确的少数几个,其余的只是噪音。

总结

如果你想在既不破费又不耗尽耐心的情况下评估 AI 模型:

  1. 不要只挑选随机的测试。
  2. 不要只挑选最“不同”的测试。
  3. 挑选那些作为组内其余部分最佳“连接者”的测试。
  4. 如果你只有极小的预算(1–5 个测试),请使用互信息方法。如果你拥有更大的预算,“多样化采样者”会迎头赶上。

这篇论文提供了一份数学“购物清单”,帮助研究人员停止在冗余测试上浪费时间,转而关注那些真正重要的少数测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →