← 最新论文
💻 computer science

Cost-Efficient Estimation of General Abilities Across Benchmarks

该论文提出了基于“宽尺度项目级数据集”(WILD)的评估框架,通过结合改进的多维项目反应理论与最优实验设计驱动的自适应选题,并引入成本感知折扣因子,成功在仅需观察 16 个题目且将评估成本降低 85% 的情况下,实现了对大语言模型在 112 个未见任务上性能的高精度预测(平均绝对误差小于 7%)。

原作者: Michael Krumdick, Adam Wiemerslage, Seth Ebner, Charles Lovering, Chris Tanner

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Krumdick, Adam Wiemerslage, Seth Ebner, Charles Lovering, Chris Tanner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在解决一个**“如何用最少的钱,最快地给大模型(LLM)做体检”**的问题。

想象一下,现在有成千上万个不同的“考试题目”(比如数学题、写代码、回答历史问题、讲笑话等)用来测试大模型的能力。但是,如果我们要给一个新模型做全面评估,把它所有题目都跑一遍,那得花多少钱(计算成本)和时间啊!而且,很多题目其实测的是同一个东西,就像你为了测一个人的数学能力,没必要让他做 100 道完全一样的加减法题。

这篇论文提出了一个**“聪明又省钱”**的评估新方案。

1. 核心问题:为什么现在的考试太贵了?

以前的评估就像是在**“大海捞针”**。

  • 题目太多太杂:有简单的,有超级难的。
  • 成本差异巨大:有些题目(比如简单的选择题)就像问“今天天气怎么样”,模型回答一下只要几毛钱;但有些题目(比如复杂的代码生成或长篇推理)就像让模型“写一部小说”,成本可能是前者的几十倍甚至上百倍。
  • 盲目测试:以前的方法往往是随机抽题,或者把所有题都做完,不管题目贵不贵,也不管这道题对判断模型能力到底有没有用。

2. 他们的解决方案:像“心理医生”一样做评估

作者们引入了心理学(Psychometrics)里的一个概念,叫**“项目反应理论”(IRT)**。

  • 打个比方:以前我们看学生成绩,只看总分(比如考了 80 分)。但 IRT 理论认为,每个学生的能力是由几个**“核心素质”**(比如逻辑力、记忆力、创造力)组成的。
  • 多维视角:这篇论文把大模型的能力看作是一个**“多维度的能力包”**。它不只是看模型“聪不聪明”,而是看它在不同维度上的表现。
  • WILD 数据集:为了训练这个“心理医生”,他们收集了一个超级大的数据库(叫 WILD),里面有 65 个不同的大模型,在 10 万多个题目上的表现记录。这就像是一个包含了无数学生答题记录的“超级题库”。

3. 两大创新:如何既准又省?

创新一:聪明的“选题策略”(自适应选择)

想象你在给一个学生做能力测试:

  • 笨办法:随机抽题。可能抽了 10 道太简单的题,模型全对,你根本不知道它上限在哪;或者抽了 10 道太难的,模型全错,你也测不出它的真实水平。
  • 聪明办法(论文的方法)
    1. 先问模型 1 道题。
    2. 根据回答,系统立刻判断:“哦,它这道题做对了,说明它基础不错,下一题我要问个稍微难一点的,看看它的极限在哪。”
    3. 如果做错了,系统就换个简单点的,确认它是不是真的不会。
    • 结果:只需要问16 道题,就能非常精准地预测出这个模型在100 多道其他题目上的表现,误差不到 7%。这就像只问几个关键问题,就能猜出一个人的智商和性格。

创新二:会“算账”的选题(成本感知)

这是这篇论文最厉害的地方。

  • 痛点:有些题目虽然很有信息量(能测出能力),但它特别(比如需要生成很长的代码)。
  • 新策略:系统不仅看题目“有没有用”,还看题目“贵不贵”。
    • 如果一道题很便宜(比如短问题),但信息量也还行,系统会优先选它。
    • 如果一道题很贵,除非它极其重要,否则系统会避开。
  • 效果:通过这种“精打细算”,他们把评估所需的总成本(Token 消耗)降低了 85%
    • 以前:为了达到同样的准确度,可能需要消耗 141,000 个 Token(相当于花了 141 块钱)。
    • 现在:只需要 22,000 个 Token(只要 22 块钱)。
    • 比喻:就像以前为了买水果,非要开车去 100 公里外的大超市(贵且远);现在他们发现,楼下小卖部虽然品种少点,但足够你挑到最新鲜、最划算的那几种,省下的油钱和路费惊人。

4. 总结:这对我们意味着什么?

这篇论文就像给大模型评估界装上了**“导航仪”“省钱计算器”**。

  • 以前:评估一个大模型,就像让它在迷宫里乱跑,直到撞墙(跑完所有题)才知道它行不行,又慢又贵。
  • 现在:有了这套方法,我们只需要走几条最关键的捷径,就能精准地知道这个模型在迷宫里能走多远,而且花费只有原来的 1/6

一句话总结
作者们通过收集海量数据,发明了一种**“像心理医生一样懂行、像精算师一样省钱”**的评估方法,让我们能用极低的成本,快速、准确地了解大模型的真实能力,不再需要盲目地“撒网式”测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →