← 最新论文
🤖 AI

ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation

该论文介绍了 ExecRubrics,这是一个将模糊的自然语言评估标准转化为可验证、可执行 Python 程序的框架,在多种基准测试中,与传统的黑盒 LLM 评判器相比,它实现了更快、更具可解释性且通常更准确的长文本响应评估。

原作者: Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. Agichtein

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. Agichtein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,大型语言模型已成为写作、推理和解决问题的强大工具。然而,随着这些系统变得越来越强大,一个显著的挑战也随之出现:我们如何知道它们的答案是否真正优秀?目前,许多开发者依赖于充当裁判的自动化系统,即由一个人工智能来评估另一项工作的成果。虽然这种方法速度很快,但它往往像是一个“黑盒”在运行。裁判可能会在没有解释原因的情况下给出一个高分,或者可能因为“好坏”的标准过于模糊而忽略了细微的错误。这种缺乏透明度的现象在医疗或金融等高风险领域是危险的,因为在这些领域,一个被误解的指令就可能导致严重的后果。为了解决这个问题,研究人员长期以来一直尝试使用评分量表(rubrics)——即将复杂任务分解为更小、更易管理的组成部分的详细准则清单。然而,传统的评分量表是用自然语言编写的,这使得它们容易产生歧义。像“要提供帮助”或“避免医疗错误”这样的短语对不同的裁判可能有不同的含义,从而重新引入了系统原本旨在消除的主观性。

埃默里大学(Emory University)和滑铁卢大学(University of Waterloo)的研究团队提出了一种名为 ExecRubrics 的新途径。与其将评估标准留作模糊的句子,不如将其转化为紧凑的、可执行的计算机程序。想象一下,评分量表不再是一段人类或机器需要阅读并理解的文字段落,而是一套计算机可以直接运行的精确指令。在这个框架下,一个好答案的标准被写成了代码。这段代码可以检查特定事项,例如响应中是否提到了特定的医疗警告、是否遵循了特定的格式,或者是否避免了某些类型的逻辑错误。由于逻辑是以代码形式编写的,因此它是确定性的,这意味着对于相同的输入,它始终会产生相同的结果,从而消除了人类或“黑盒”裁判中存在的猜测和变数。研究人员在三个不同的基准测试上测试了这个想法,包括一个医疗建议数据集和一个专注于论证质量的数据集。他们发现,这些可执行的评分量表在对响应进行排序方面,可以达到与依赖昂贵 AI 裁判的传统语言类评分量表相当、甚至更好的效果。更重要的是,这种新方法的速度极快,比标准方法快了多达 320 倍,同时还能提供清晰、可检查的记录,说明为什么某个响应得到了特定的分数。

这项工作的核心在于将评分量表的意图从“描述”转变为“操作”。在标准设置中,评分量表可能会说:“响应应恰当地建议寻求紧急护理。”为了评估这一点,需要另一个 AI 裁判来阅读响应并决定其是否符合该标准。这种决策是主观的,并且会根据执行裁判的 AI 模型不同而有所变化。ExecRubrics 方法取代了这一步骤。研究人员使用先进的语言模型将那条自然语言指令转换为一个 Python 程序。这个程序不仅仅是阅读文本,它还会主动扫描文本中的特定模式。它可能会寻找与紧急情况相关的关键词,检查响应是否建议就医,或者验证它是否避免了对严重症状提供虚假的安慰。如果响应包含正确的元素,代码就会加分;如果缺失这些元素或包含了危险的建议,则会扣分。这个过程不是模拟或猜测,而是规则的直接执行。研究人员表明,通过允许这些程序使用标准的文本处理工具——即可以计数单词、识别名称或检测否定的库——他们可以创建更加复杂的评估器。这些工具就像是代码的放大镜,使代码能够发现简单的文本搜索可能错过的细节,例如医疗响应是否正确处理了患者的过敏情况,或者论证是否承认了反方观点。

当团队将此方法应用于现实世界的数据集时,结果令人瞩目。在一个名为 HealthBench 的医疗建议基准测试中,可执行评分量表的偏好准确率达到了 53%,与表现最好的自然语言评分量表基准线持平。在一个名为 ArgQuality 的论证质量数据集中,可执行评分量表的准确率达到了 92%,超越了传统方法。在第三个关于通用帮助性数据集的测试(HelpSteer)中,它们达到了 78% 的准确率。这些数字表明,代码驱动的评估器能够在不需要人类或单独的 AI 来反复解释规则的情况下,成功区分高质量和低质量的响应。该系统的速度同样令人印象深刻。虽然使用 AI 裁判来评估每个标准的传统方法需要大量时间,但可执行评分量表能在不到一秒钟的时间内完成同样的任务。在某些情况下,新方法比旧方法快了 320 倍。这种速度结合能够看到究竟触发了哪条规则的能力,为那些对精度和速度要求极高的领域提供了一个强大的替代方案。

研究人员还探索了这些评分量表如何处理超出简单清单范畴的复杂逻辑。在传统的评分量表中,标准通常被视为独立的项,只是简单地相加。然而,现实世界的评估通常需要更多的细微差别,例如处理异常情况或应用惩罚。可执行评分量表可以直接编码这些依赖关系。例如,在关于青霉素过敏的医疗查询中,代码可以激活一个特定的分支,在奖励提供非青霉素替代方案建议的同时,惩罚任何关于阿莫西林的推荐。这种条件逻辑在静态清单中很难捕捉,但对于计算机程序来说却是自然的。研究表明,通过引入外部工具,这些评分量表可以变得更加具有表达力,能够检查诸如可读性、情感基调或特定安全警告的存在情况。这种灵活性表明,该方法可以适应不同领域(从医疗保健到法律推理)的独特需求,而不会失去其透明度。

尽管取得了这些成功,作者也谨慎地指出,这并非完美的解决方案。他们指出,虽然评分逻辑现在变得明确了,但评分量表本身是由 AI 生成的,这意味着如果初始指令不清晰,它们可能会存在缺陷或偏差。还存在一种风险,即如果使用这些评分量表来训练 AI 模型,模型可能会学会“钻空子”,通过包含特定的关键词或结构来触发高分,而实际上并没有提供好的答案。研究人员强调,可执行评分量表应被视为提高评估透明度和问责制的工具,而不是人类监督的替代品。在高风险环境中,仍然需要人类专家来审查规则,确保其公平性,并验证代码是否符合现实世界的需求。研究表明,这种方法是迈向未来的一大步,在那个未来,AI 评估不再是一个黑盒,而是一个可以被检查、编辑并信任的清晰、可审计的过程。

这项工作的意义不仅在于让评估变得更快。通过将评估标准转化为代码,研究人员在人类判断的抽象目标与计算机程序的精确执行之间建立了一座桥梁。这实现了一种通过人类评分员或不透明 AI 裁判难以实现的连贯性。如果需要更改评分量表,可以直接在代码中进行编辑,并且该更改的影响可以立即得到测试。这使得评估过程变得更加动态,并能对新需求做出响应。研究还强调了这些评分量表用于训练 AI 模型的潜力,为什么是“好的响应”提供了清晰的信号。然而,作者警告称,系统的成功很大程度上取决于生成的代码质量以及它所能使用的工具。在某些情况下,可执行评分量表的表现略逊于表现最好的手工编写基准线,特别是在复杂的医疗场景中,因为在这种场景下,情况的细微差别可能很难仅靠代码来捕捉。这表明,虽然该方法功能强大,但它尚未成为人类专业知识的完全替代品。

最终,这项研究为我们如何评估人工智能的质量提供了一个全新的视角。它从单一、神秘的分数概念转向了一个透明、可验证的规则系统。研究结果表明,通过使评估逻辑显性化,我们可以构建出不仅更高效而且更值得信赖的系统。随着 AI 持续融入社会的各个关键领域,审计和理解决策是如何做出的能力变得越来越重要。ExecRubrics 提供了一个实现这一目标的框架,将评分的抽象艺术转变为一种具体的、可执行的科学。这项工作并不声称已经解决了所有 AI 评估的问题,但它提供了一条充满希望的前行之路——在这条路上,成功的标准将像执行它们的代码一样清晰且可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →