JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment
本文介绍了 JudgmentBench,这是一个由专业律师标注的包含 30 项法律任务的新颖基准,该基准同时提供了评分细则分数和成对偏好数据,结果表明,相较于基于评分细则的评分方法,比较性判断在恢复质量排名方面表现显著更优,且所需标注时间不到前者的一半。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在评估一批由人工智能撰写的法律文件的质量。你有两种主要方法可以做到这一点,而本文正是这两者之间的一场正面较量,旨在看哪一种方法能真正告诉你哪份文件更优。
以下是两位竞争者的详细解析:
两位评委
清单式评委(基于评分细则的打分):
想象一位严格的老师正在批改一篇作文。他们手中有一份漫长而详细的清单:“你使用了逗号吗?是(+1 分)。你提到了日期吗?是(+1 分)。你避免了俚语吗?是(+1 分)。”他们将这些分数相加,得出最终得分。- 本文的观点: 这种方法试图将“质量”拆解为微小且可衡量的部分。由于每个人都遵循相同的规则,这种方法感觉既精确又公平。
品尝式评委(比较判断):
想象一位在餐厅的美食评论家。他们不是去测量汤的含盐量或温度,而是被并排端上两碗汤,并被问道:“哪一碗味道更好?”他们不需要用食材来解释“为什么”,只需凭借直觉和经验选出胜者。- 本文的观点: 这种方法依赖于评委对质量的整体“感觉”,直接比较两件事物,而不是孤立地给其中一件事物打分。
实验设计
研究人员利用现实世界的法律任务(如起草合同或分析法庭文件)设立了一场“品尝测试”。他们并非随机询问路人,而是聘请了来自美国顶级律师事务所的51 位经验丰富的律师。
为了确保测试公平,他们为每项法律任务创建了三个版本:
- “优秀”版本: 高质量作品。
- “良好”版本: 尚可的作品。
- “中等”版本: 平庸的作品。
他们隐藏了标签,使律师们不知道哪个是哪个。随后,他们将律师分为两组:
- A 组必须使用**清单(评分细则)**对每份文件进行打分。
- B 组必须成对比较文件,并使用**品尝测试(比较判断)**选出胜者。
结果:巨大的惊喜
研究人员希望看看哪一组能正确识别出“优秀”版本优于“良好”版本,而“良好”版本又优于“中等”版本。
获胜者:品尝式评委(比较判断)
- 准确性: 仅仅并排比较文件的律师在发现质量差异方面表现好得多。他们正确对文件进行排序的能力近乎完美(得分为 1.0 中的 0.91)。然而,清单式评委则表现挣扎(得分仅为 0.15)。这仿佛清单式评委是在猜测,而品尝式评委则看得清清楚楚。
- 速度: 品尝式评委的速度也快了两倍以上。他们完成每项任务仅需约 2 分钟,而清单式评委则耗时近 5 分钟。
该研究还使用 AI“自动评分器”(利用另一款 AI 来评分)进行了测试,结果 AI 品尝式评委也击败了 AI 清单式评分器。
为什么清单失败了?
本文提出了一些理由,解释为何详细的清单不适合复杂的法律工作:
- “缺失部分”问题: 法律工作就像一幅复杂的画作。你不能仅仅通过测量红色颜料的用量或笔触的数量来判断它是否是一幅杰作。清单迫使律师只关注特定的、预先定义的项目(例如“你是否引用了该案例?”),但却遗漏了作品的“魔力”——例如战略判断、有说服力的行文流畅度或微妙的细微差别。清单只见树木,不见森林。
- “光环效应”: 当律师看到一份表面上看起来很棒的文件时,他们可能会下意识地给清单上的每一项都打高分,即使它在某些方面实际上很薄弱。
- 认知负荷: 对每份文件停下来检查 20 个不同的复选框在精神上是非常疲惫的。对人类大脑来说,说“这份感觉比那份好”要容易得多。
结论
本文得出结论,对于法律这样高风险、复杂的工作(其中“质量”很难用简单的列表来定义),并排比较两件事物比试图对照清单给它们打分,是一种更好、更快且更准确的质量评估方法。
不过,作者补充了一个小小的警示:如果你需要确切知道某事失败的原因(例如审计),清单仍然有用。但如果你主要目标仅仅是找出哪个输出最好,那么“并排比较”方法显然是获胜者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。