LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation
本文介绍了 LP-Eval,这是一套与法律专家共同设计的评分标准和数据集,用于评估源自欧盟法院判决的大语言模型生成法律命题的质量,研究结果表明,尽管模型生成的输出总体质量较高,但其表现因案件年代而异,且由评分标准引导的大语言模型评估器虽优于直接评分,但仍缺乏人类专家所具备的细粒度敏感度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名律师,正试图向客户解释一份复杂的法院裁决。你不想把整份 50 页的文件读给他们听;你希望将其提炼成一句清晰、有力的话,以捕捉“游戏规则”。在法律界,这种总结句被称为法律命题。
本文旨在教授计算机(具体而言是大语言模型,即"LLMs")自动撰写这些总结句,并探讨如何公平地对其评分。
以下是该研究的简要说明:
1. 问题所在:“黄金标准”难以寻觅
在许多计算机任务中,你可以轻松判断答案是对是错(例如数学题)。但在法律领域,总结一条规则几乎不存在唯一的“正确”方式。你可以说“法律规定了 X",也可以说“在条件 Y 下,X 适用”。两者可能都是正确的,但表述不同。
正因如此,传统的计算机评分工具(仅计算单词匹配度)并不奏效。它们无法判断一句话是否“听起来”像法律,却实际上表达了完全不同的含义。此外,计算机有时会“产生幻觉”——编造根本不存在的规则。
2. 解决方案:“法律成绩单”(评分细则)
为了解决这一问题,研究人员与真实的法学教授合作,制定了一份名为LP-Eval的评分细则(评分清单)。你可以将其想象成学生作文的成绩单,只不过这里是针对法律规则的。
评分细则不再给出像"B+"这样的单一等级,而是主要检查两个方面:
- 骨架(形式有效性): 这句话是否具备三个必要的“骨架”?
- 立场: 它是否表明了立场?
- 对象: 它是否在讨论法律规则(而不仅仅是事实)?
- 具体性: 它是否足够具体?
- 如果缺少任一“骨架”,该句子即被视为“无效”。
- 血肉(质量维度): 如果骨架完整,它的撰写质量如何?
- 简洁性: 它是简练精悍,还是冗长啰嗦?
- 忠实度: 它是否紧扣原文,还是凭空捏造?
- 概括性: 它是一条普遍适用的规则,还是仅适用于某个微小的细节?
3. 实验:教导计算机
研究人员选取了 100 段来自真实欧盟法院裁决的段落,要求三种不同的人工智能模型为其撰写法律命题。随后,他们让两位人类法律专家利用这份新的“成绩单”对这些人工智能的产出进行评分。
他们的发现如下:
- 人工智能在基础方面表现尚可: 大多数人工智能生成的句子都是“有效”的(即具备正确的“骨架”)。
- 旧案与新案: 人工智能在总结古老、著名的案例(那些众所周知、多年来被反复讨论的案例)方面,表现明显优于全新、近期的案例。这就像学生可能在考他们读过上百遍的经典故事时能拿高分,但在面对昨天刚出版的故事时却会感到吃力。
- 人工智能作为评分者: 研究人员还让人工智能对其他人工智能的产出进行评分。
- 好消息: 当人工智能使用详细的“成绩单”(评分细则)时,它与人类专家达成一致的概率,远高于它仅尝试给出一个总体分数时。
- 坏消息: 即使有了评分细则,人工智能依然“缺乏乐感”(即缺乏敏锐度)。它无法察觉“对旧案的良好总结”与“对新案的良好总结”之间微妙的差异。人类专家能感受到这种区别,而人工智能仅仅将它们视为大致相同。
4. 数据集
该团队不仅完成了实验,还将“作业”向公众发布。他们构建了一个数据集,其中包含:
- 原始法院段落。
- 人工智能尝试撰写的总结。
- 人类专家的详细评分和注释。
核心结论
本文表明,计算机在撰写法律摘要方面正变得日益出色,尤其是在处理众所周知的法律时。然而,它们在应对新颖、复杂案例的细微差别方面仍存在困难。此外,如果你希望计算机对法律工作进行评分,你不能仅仅问它“这好吗?”你必须给它一份详细的清单(评分细则)供其遵循,否则它将错过人类专家能够捕捉到的重要细节。
简而言之: 计算机可以撰写法律规则,如果给予严格的清单,它们也能对这些规则进行评分,但它们仍缺乏区分经典案例与新鲜案例所需的“法律直觉”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。