← 最新论文
💬 NLP

Large Language Model Selection with Limited Annotations

本文介绍了 SELECT-LLM,这是一个新颖的框架,它利用从成对模型输出相似性中推导出的预期信息增益,主动选择最少数量的查询进行标注,从而在无需访问模型权重的情况下,显著降低评估成本并有效识别出针对特定任务的最佳大语言模型。

原作者: Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch, Torsten Hoefler, Nezihe Merve Gürel

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch, Torsten Hoefler, Nezihe Merve Gürel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位招聘经理,正试图为一份非常具体的工作寻找完美的员工。你拥有一个庞大的候选人池,共有 156 名候选人(这些就是大语言模型,或称 LLMs)。你知道他们都很聪明,但你不知道哪一位实际上最擅长你的特定任务。

通常,为了弄清楚这一点,你会要求每一位候选人参加一场完整的、包含 100 道题的测试,然后雇佣一支昂贵的专家团队来批改每一份答案。这既缓慢、昂贵,又令人疲惫不堪。

这篇论文介绍了一种名为SELECT-LLM的新方法。把它想象成一位超级聪明的招聘助理,它只需让候选人回答测试中的一小部分题目——也许只需 5 到 10 道题,而不是 100 道——就能找出最佳人选。

以下是其工作原理,使用简单的类比来说明:

问题:“盲测”

想象你有 156 位不同的厨师(即 AI 模型),你想找出谁做的披萨最好。

  • 旧方法:你要求每位厨师做 100 个披萨。你雇佣 100 位美食评论家来品尝每一个披萨并撰写报告。这在时间和金钱上代价高昂。
  • 随机方法:你要求厨师们只做 5 个披萨,但这 5 道题是随机挑选的。也许这 5 位厨师都擅长做芝士披萨,却不擅长做意式辣香肠披萨。你可能仅仅因为运气不好而选错了赢家。

解决方案:SELECT-LLM(“智能测验”)

SELECT-LLM 就像一位侦探,确切知道哪些问题能揭示真相。它不只是随机挑选问题,而是挑选信息量最大的问题。

以下是逐步流程:

  1. 设置:你拥有一个“潜在问题池”(题库)和一份候选模型列表。
  2. 猜谜游戏:系统查看如果让所有模型回答某个问题,它们说什么(此时尚不需要人类进行评分)。
  3. “分歧”检测器:系统会问:“如果我问这个问题,顶尖候选者会给出截然不同的答案吗?”
    • 如果所有顶尖厨师都给出完全相同的答案,那么这个问题对于区分它们来说就没什么用处。
    • 如果最好的厨师们给出了截然不同的答案,那这个问题就是黄金。它是能帮你找出谁真正最优秀的那个问题。
  4. 选择:系统挑选出那个“黄金”问题,并请一位人类专家(“神谕”)仅批改那一个答案。
  5. 更新:基于这单次评分,系统更新其对厨师们的排名。它可能会说:“哦,厨师 A 答对了,但厨师 B 答错了。厨师 A 现在更可能是赢家。”
  6. 重复:它重复这一过程,始终挑选下一个能在剩余顶尖竞争者中引发最多“分歧”的问题,直到它有足够的信心选出赢家。

为什么这很重要?

该论文在 23 种不同类型的任务(如数学、新闻摘要、语言翻译和回答科学问题)以及 156 种不同的 AI 模型上测试了这种方法。

  • 结果:与次优方法相比,SELECT-LLM 使用**少至 84%**的人类评分就找到了最佳模型。
  • 类比:与其雇佣 100 位评论家品尝 100 个披萨,这种方法可能只需要 15 位评论家品尝 15 个披萨,就能找到完全相同的赢家。

关键特性

  • 对“黑盒”友好:你不需要了解 AI 模型内部的构建方式(如代码或权重)。你只需要看它们说了什么。这既适用于开源模型,也适用于昂贵的闭源商业模型(例如你通过 API 付费使用的模型)。
  • 模型无关:它不在乎模型是大是小,也不在乎它们使用什么语言。它只看它们答案的相似性。
  • 安全:即使它没有选出绝对的 #1 模型,它也几乎总是能选出一个非常接近最佳模型的模型,因此你不会得到糟糕的结果。

总结

SELECT-LLM 是一种明智的策略,旨在停止在不必要的测试上浪费资金。它不再要求每个 AI 参加完整考试并由人类批改所有内容,而是只问那少数几个恰到好处的问题,从而快速识别出明星模型。它将一场庞大而昂贵的搜索,变成了一次快速高效的搜寻。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →