← 最新论文
💬 NLP

CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks

CoEval 是一个开源框架,它能够生成无污染、属性可控的基准测试,并利用多样化的评判模型集成,在无需标注数据或依赖公开基准测试的情况下,为自定义任务可靠地对语言模型进行排名。

原作者: Alexander Apartsin, Yehudit Aperstein

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Apartsin, Yehudit Aperstein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位招聘经理,正试图为一份非常特定的工作挑选最优秀的员工,比如“整理一个混乱的仓库”或“编写关于园艺的幽默笑话”。你面临一个问题:你没有任何过往的绩效评估(标注数据),而且大家都在使用的标准测试(公开基准测试)对你来说毫无用处,因为候选人们在学习过程中已经把答案背下来了。

这正是 CoEval 所解决的问题。它是一个全新的开源工具,可以帮助你根据你的特定需求对 AI 模型进行排名,而无需人类专家来评分,也不必担心作弊问题。

以下是它的工作原理,通过简单的类比进行拆解:

1. “新鲜测试”生成器(禁止作弊)

通常,AI 模型参加的是一些存在已久的旧测试(如 SAT 或 GRE)。因为这些测试非常流行,AI 模型很可能在训练过程中已经看到了这些问题,并记住了答案。这就像一个学生通过背诵答案表而不是学习数学知识来应付考试。

CoEval 改变了游戏规则。它不再使用旧问题,而是使用一个“教师 AI”,仅根据你对任务的描述,即时发明全新的问题。

  • 类比: 想象一位老师在学生进教室的同时才开始编写数学试卷。学生无法背诵答案,因为问题直到那一秒才存在。
  • 结果: 论文证明了这些新问题是 100% 新鲜的。它们与任何主要的公开测试库都不存在任何 13 个连续单词的重复,这意味着 AI 无法通过回忆旧数据来作弊。

2. “陪审团”式的评委(多样性胜过数量)

一旦 AI 模型回答了这些新鲜问题,就必须有人来评分。你可以要求一个超级聪明的 AI 来评分,但这很冒险。单个评委可能会有奇怪的偏见,比如更喜欢长篇大论而非简短精炼的回答,或者更喜欢与其自身模型家族相似的回答。

CoEval 采用了“陪审团”机制。它从不同的公司收集一小组评委(例如,分别来自 OpenAI、Anthropic 和 Google 的评委)。

  • 类比: 想象一个法庭。如果你只有一个以脾气暴躁著称的法官,判决可能会不公平。但如果你有一个来自不同背景的三人陪审团,他们的个人怪癖就会相互抵消。如果一个评委喜欢长篇大论而另一个讨厌,那么平均分就会变得公平。
  • 重大发现: 论文发现,在陪审团中比陪审团里有多少人更重要。增加来自同一家公司的评委只会放大他们共同的偏见。相反,一个多样化的小型组合是非常可靠的。事实上,单个评委有时会产生“负相关”(给出错误的答案),但多样化的陪审团几乎不会出现这种情况。

3. “无需人工”的工厂

通常,要构建一个好的测试,需要人类来编写问题并评分。这既慢又贵。

  • 类比: CoEval 就像一个全自动化的工厂。你给它一个蓝图(任务描述),它会自动完成以下步骤:
    1. 设计测试题目。
    2. 让 AI 候选人参加测试。
    3. 组建多样化的陪审团来评分。
    4. 输出最终排名。
  • 成本: 作者进行了一项大规模研究,进行了近 8,000 次评估,而成本仅相当于一杯咖啡的价格(5.89 美元)。它的成本之低,让你可以在每个新 AI 模型发布时都运行一次新的测试。

4. 为什么这很重要

论文在三个不存在“标准答案”的现实场景中测试了 CoEval:

  • 药物相互作用: 确定两种药物是否会产生冲突。
  • 临床推理: 诊断患者症状。
  • 法律分析: 解读法律。

在这些领域,不存在标准的“金标准”测试。CoEval 成功地对模型进行了排名,展示了哪些模型最适合这些特定工作。它甚至捕捉到了一个事实:一个较小的、更便宜的模型实际上比一个较大的模型表现更差,而这可能是单个带有偏见的评委可能会忽略掉的。

核心总结

CoEval 是一个工具,它在说:“不要信任那些被背诵过的旧测试。不要依赖于可能带有偏见的单个评委。相反,请为你的特定工作生成一个新鲜的测试,并让一个多样化的小型团队来评分。”

它将测试 AI 这一复杂且昂贵的过程,转变为一个廉价、可重复且公平的过程,任何团队都可以使用它来找到符合其特定需求的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →