← 最新论文
🤖 AI

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

本文介绍了Rulers,这是一个三阶段推理时框架,它将人类评分标准转化为锁定规范、强制实施结构化证据 grounding,并应用事后校准,以克服常见失效模式,从而在多样化的文本评估任务中实现更可靠、与人类对齐的大语言模型评分。

原作者: Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,正在批改数百篇学生作文。你手中有一份详细的评分标准(即规则清单),上面写着:“一篇得高分的作文必须具备清晰的论点、有力的证据,且没有拼写错误。”

现在,想象你雇佣了一个超级聪明的机器人(人工智能)来帮你批改这些作文。你将评分标准和作文交给机器人,它随即输出一个分数。

然而,正如这篇论文的作者所发现的那样,问题在于这个机器人有点“自由散漫”。如果你用稍有不同的方式问它同一个问题,或者改变规则的顺序,它可能会为同一篇作文给出截然不同的分数。这就像问一个人:“那栋楼有多高?”根据你提问的方式不同,得到的回答可能是“十层楼高”、“三十米”或“挺高的”。

这篇论文介绍了一个名为RULERS的新系统来解决这个问题。请将 RULERS 想象成一位严格的经理,而不是一个新的机器人,它教导机器人如何每次都完美地遵守规则。

以下是 RULERS 的工作原理,分为三个简单的步骤:

1. “锁定蓝图”(第一阶段)

通常,当你要求 AI 批改某物时,你每次都会将评分标准粘贴到对话框中。AI 每次都会重新阅读,从而导致混乱。

RULERS 改变了这一点。在批改任何一篇作文之前,它会将人工制定的评分标准转化为一份锁定且不可更改的蓝图

  • 类比:想象你在烤蛋糕。与其每次烤蛋糕时都去读食谱书(你可能会把一杯糖误读为一杯面粉),不如将精确的用量写在一张永久卡片上。你将这张卡片锁在玻璃柜里。无论你烤多少蛋糕,都使用完全相同的这张卡片。
  • 作用:它将杂乱无章的自然语言评分标准转化为一份严格的清单,包含需要勾选的具体方框(0、1 或 2)。一旦这份“蓝图”制作完成,针对该特定任务,它将永不改变。

2. “证据侦探”(第二阶段)

在旧方法中,AI 可能会直接说:“这篇作文很好,因为感觉不错。”这很难让人信服。

RULERS 迫使 AI 扮演侦探的角色。它不能仅仅给出一个分数;它必须指出作文中证明其观点的确切句子。

  • 类比:想象法庭上的一位法官。法官不能只说:“我认为被告有罪。”他们必须说:“被告有罪,因为发现了这一特定证据,位于这一特定段落中。”
  • 作用:对于清单上的每一项,AI 必须引用学生作文中支持其决定的确切部分。如果 AI 说“这篇作文有清晰的论点”,它必须高亮显示该论点出现的那句话。这使得评分变得可审计(你可以核查其工作)。

3. “分数翻译器”(第三阶段)

即使有了锁定的蓝图和侦探,AI 对分数的内部“感觉”也可能与人类不同。AI 可能认为"4 分”是一个很高的分数,而人类认为"4 分”只是平均水平。

RULERS 增加了最后一步:校准

  • 类比:想象 AI 讲“机器人语”,而人类讲“人类语”。AI 说:“这篇作文是 4.5 分!”但人类期望的是 3 分或 5 分。RULERS 利用一小部分人类已经批改过的作文来构建一个翻译器。它学习到:“当 AI 说 4.5 分时,人类通常意指 4 分。”然后,它调整最终分数以符合人类的期望。
  • 作用:它将 AI 的结构化分数进行数学转换,使其与真实人类教师的实际评分方式保持一致。

为什么这很重要?

该论文在四种不同类型的写作任务(如学生作文、摘要和创意写作)上,使用不同的 AI 模型测试了这一系统。

  • 结果:与以往的方法相比,RULERS 使 AI 的分数与人类分数更加吻合。
  • 稳定性:如果你稍微改变评分标准的措辞(例如将“好写作”改为“高质量写作”),RULERS 仍能给出一致且相同的分数。而其他方法则会感到困惑并给出不同的分数。
  • 证明:由于 AI 必须提供“证据”(来自文本的引文),你实际上可以看到它为什么给出这个分数。它不再是一个神秘的“黑箱”,而是一个透明的过程。

简而言之

该论文认为,要获得一个可靠的 AI 裁判,你不仅仅需要一个更聪明的机器人。你需要一个系统,该系统能够:

  1. 锁定规则,使其不发生改变。
  2. 迫使机器人通过引文展示其工作过程。
  3. 翻译机器人的数字,使其符合人类标准。

通过做这三件事,RULERS 将一个反复无常的 AI 转变为一个稳定、值得信赖的评分者,人类可以真正依赖它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →