← 最新论文
🤖 machine learning

Codifying the Judge: Scalable Evaluation via Program Distillation

本文介绍了 PAJAMA,这是一个可扩展的评估系统,它将大语言模型的决策逻辑提炼为透明且具成本效益的程序化评审器,在匹配大语言模型评审器性能的同时,显著降低了延迟和 API 成本。

原作者: Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家大型图书馆的馆长,每天都有成千上万的人向你提交他们写的作品。你的工作就是阅读这些作品,决定哪些是最优秀的,并给予它们奖项。在人工智能的世界里,这正是计算机试图评判其他计算机时所发生的事情。我们称之为“LLM-as-a-judge”(以大语言模型作为评委),即一个超级智能的 AI 阅读两个答案并选出胜者。这已经成为了测试 AI 模型优劣的标准方式。但这里有一个巨大的问题:要求一个超级智能的 AI 去阅读每一篇故事是非常昂贵、缓慢的,而且有时 AI 会为它的选择编造一些并不成立的理由。这就像雇佣一位著名的、昂贵的评论家来阅读图书馆里的每一本书;最终,你会耗尽资金,甚至无法判断这位评论家是在公平公正,还是仅仅因为那天心情不好。

这就是这篇新论文切入的地方。研究人员提出了一个简单的疑问:与其雇佣著名的评论家去读每一本书,不如我们请这位评论家写一本规则手册,然后让一群快速、廉价的机器人根据这些规则来读书如何?他们称之为“程序蒸馏”(program distillation)。与其每次都让昂贵的 AI 进行思考,不如教它编写一套指令(一个计算机程序),使其能够瞬间完成评判。这就像是将一个缓慢、昂贵的人类大厨变成一个快速、自动化的烤面包机,只要你给它正确的食谱,它就能每次都做出完美的吐司。论文表明,这种新方法不仅更快、更便宜,而且在决策方面更加诚实,因为你可以通过阅读代码来确切了解它为什么选择了胜者。

论文的核心思想:将大脑转化为工具箱

本文的作者——来自威斯康星大学麦迪逊分校的 Tzu-Heng Huang、Shengqi Qiu 和 Frederic Sala——正在解决 AI 评判中“昂贵且不透明”的问题。他们提出了一个名为 PAJAMA(程序即评委自动化模型评估)的系统。不要把 PAJAMA 仅仅看作一个单一的评委,而要把它看作一个工作坊,在那里他们构建了一整套专门的工具来负责评分。

以下是这一神奇过程的步骤:

1. 一次性的“大脑倾倒”
通常,当你想要一个 AI 评判一对答案时,你必须每次都将问题和答案发送给 AI。这既费钱又费时。PAJA 改变了游戏规则。他们不再要求 AI 评判每一个答案,而是要求 AI 编写一个程序(一段代码),这个程序懂得如何进行评判。
想象一下,你有一位才华横溢但动作缓慢的艺术评论家。与其每次都请他看一万幅画,不如请他为机器人写一份手册。手册里写着:“如果画作中有蓝天,给 5 分;如果天空很凌乱,减 2 分。”一旦评论家写好了这份手册,你就不再需要他了。你只需要运行机器人即可。论文显示,AI 可以编写这些“评判手册”(程序),它们在识别逻辑错误、检查故事是否连贯或观察答案是否过短方面表现得惊人地出色。

2. 机器人委员会
一个机器人可能不擅长数学但擅长语法;另一个可能擅长发现谎言但拙于风格。因此,PAJAMA 不仅仅制作一个程序,而是制作一个由它们组成的委员会。他们要求 AI 编写许多不同的程序,每个程序都从略微不同的角度来审视答案。
为了确保这些机器人不会全都说同样的话(否则会变得无趣且毫无用处),研究人员给了它们不同的“评分标准”或清单。一个机器人检查逻辑流,另一个检查主题一致性,还有一个检查格式。这就像是一个评审团,其中一位是语法老师,一位是逻辑教授,而另一位是风格教练。

3. “信心”开关
有时,即使是机器人委员会也会感到困惑。也许两个答案如此相似,以至于机器人无法做出决定。这就是 PAJAMA 高明之处。它有一个“信心计”。如果机器人很确定,它们就会大声宣布胜者。但如果它们不确定,或者它们全部弃权(说“我不知道”),PAJAMA 就有一个备选方案。它会将这些棘手的案例发送给昂贵的、超级智能的 AI 评委(即 LLM),仅针对这些特定的问题进行处理。
这就像博物馆里的保安。如果一名访客看起来很正常,保安会让他直接通过。但如果有人看起来很可疑,保安就会打电话给经理请经理来仔细查看。这样一来,你只在处理难题时才支付昂贵经理的费用,从而在处理简单任务时节省了大量资金。

他们的发现:快速、廉价且出奇地聪明

研究人员在五个不同的数据集和四个不同的 AI 模型家族上测试了这个系统。以下是他们的发现:

  • 速度至上: 程序化评委的速度极快。它们处理答案的速度比标准的 AI 评委快 47.25 倍。普通的 AI 评委可能需要一两秒钟来思考,而这些程序可以在瞬间完成,因为它们只是在运行简单的数学和逻辑规则,而不是试图像人类一样去“思考”。
  • 准确率很高: 尽管它们快速且廉价,但依然非常出色。这组程序平均而言能达到一个 130 亿参数的大型 AI 模型(一个非常聪明的模型)的准确度。在某些情况下,仅由 8 个程序组成的小型团队就达到了 70 亿参数模型的准确度。
  • “帕累托前沿”的突破: 在科学领域,“帕累托前沿”(Pareto frontier)是指两个事物之间最佳的平衡点,比如速度与准确度。通常,如果你想要更高的速度,就会失去准确度。PAJAMA 打破了这个规则。通过利用程序处理简单任务,并利用 AI 处理困难任务,他们找到了一个甜点区,在这里他们同时获得了更高的准确度和更高的速度。例如,在与特定 AI 模型配对时,他们在提高 5% 准确度的同时,速度提升了近 3 倍。
  • 更便宜的训练: 他们还使用这些程序来训练其他 AI 模型(一个被称为“奖励模型蒸馏”的过程)。他们发现,使用程序的判断来教导一个新的 AI,比使用著名的、昂贵的 AI 来进行教学要便宜 50 倍。在这些程序数据上训练出的新 AI,其表现与使用昂贵数据训练出的 AI 一样好,甚至更好。
  • 诚实度与偏差: AI 评委的一个主要问题是它们可能存在偏差。它们可能仅仅因为答案长就喜欢长答案,或者偏好带有华丽格式的答案。由于 PAJAMA 的评委是实际的计算机程序,你可以清楚地看到它们在做什么。如果一个程序对长度有偏好,你只需打开代码,找到那行写着“增加长度分值”的代码,然后将其删除即可。论文表明,通过“校准”(修复)这些程序,我们可以显著减少这些偏差,使评判更加公平。

为什么这很重要

该论文认为,我们不需要为了让 AI 评判 AI 而不断支付巨额账单。通过将评委的“思考”部分转化为一套可重用的、透明的规则,我们可以实现评估的可扩展性。它将一个黑盒(我们不知道 AI 为什么做出某种选择)变成了一个清晰、可检查的过程。

作者们谨慎地指出,这并不是一个可以取代所有 AI 评委的魔杖。有时,问题过于复杂,无法用简单的规则解决,这也是为什么他们保留了昂贵的 AI 作为处理难题的备份。但在绝大多数日常评判任务中,这种“程序蒸馏”方法提供了一种在不产生高成本、高延迟和隐藏偏差的情况下,获得高质量结果的方法。这是一种从“要求天才去做所有的工作”,转向“教导天才如何建立一支高效的工人团队”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →