Where Experts Disagree, Models Fail: Detecting Implicit Legal Citations in French Court Decisions
本文引入了一个用于检测法国民法典隐性引用的基准测试,并证明了专家在这些案例上的分歧是内在难度的关键信号,揭示了虽然模型在有争议的实例上表现挣扎,但一种多模型共识方法可以有效地在无监督的情况下对高置信度候选对象进行排序。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名侦探,正试图在一个巨大的法国法院判决书图书馆中破解一个谜题。你的任务是寻找那些“隐藏的线索”:即法官在做出裁决时,虽然从未在文中明确提及某项具体规则的名字,却实际运用了《民法典》中特定规则的时刻。
这就像一位厨师做出了一个完美的蛋糕,却从未在食谱中列出“面粉”二字。你知道他用了面粉,因为蛋糕尝起来有面粉的味道,但文本本身并未提及。在法律领域,这些被称为隐性引用(implicit citations)。
核心问题:“盲点”
通常情况下,律师通过搜索像“第1192条”这样的关键词来寻找法律。但如果法官应用了该条款却未写下编号,搜索引擎就会变得“失明”。这造成了我们对法律如何被实际应用的理解鸿沟。本文作者希望构建一个计算机程序(模型),使其能够像超级侦探一样发现这些隐藏的规则。
实验:三位专家的测试
为了教导计算机,团队创建了一个包含 1,015 对文本的特殊测试集。他们要求三位法律专家观察每一对文本,并做出判断:“法官是在使用这项法律,还是仅仅在陈述事实?”
有趣的事情发生了。专家们并不总是达成一致。在大约三分之一的情况下(339例),专家们产生了分歧。有人可能会说:“是的,这是法律!”而另一个人则会说:“不,这只是事实。”
主要发现:人类失误之处,计算机也同样失误
该论文最大的发现是一个转折。通常,当专家产生分歧时,我们认为这只是“噪声”或混乱。但作者发现,这种分歧实际上是一个警告信号。
当专家无法就是否使用了某项法律达成一致时,计算机模型几乎每次都会失败。
- 表现最好的计算机团队(一个“集成”模型)整体得分为 0.70,表现尚可。
- 然而,看看那些错误:计算机产生的三分之二的误报(即在并非应用法律时错误地判定为“是的,这是法律!”)恰好发生在这些人类专家产生争论的棘手案例中。
论文表明,这些并非随机错误。它们是内在的困难。“应用法律”与“陈述事实”之间的界限是模糊的,即使对人类而言也是如此。当人类感到不确定时,计算机也更容易表现得“自信地错误”。
本文排除的情况(“非”清单)
- 这不仅仅是“噪声”: 论文反对认为专家分歧只是应被忽略的杂乱数据的观点。相反,它是一个信号,表明该案例确实具有难度。
- 这并非一个已解决的问题: 作者并未声称他们构建了一个可以取代律师的完美工具。他们明确指出,对于这些棘手的案例,实现完美的分类(即每次都能正确判断“是/否”)目前是不可能的。
- 这不仅仅是关于计算机的“大脑”: 失败的原因并非因为计算机“笨”。即使在计算机非常有信心(给出高分)时,它在这些存在争议的案例上仍然是错误的。论文表明,当人类发生争论时,置信度并不等于准确度。
曙光:一种新的玩法
那么,如果计算机无法给出完美的“是/否”答案,它是否就没用了?作者说并非如此。他们建议换一种游戏规则:排序(Ranking)。
不要问计算机“这是法律吗?”(因为它可能会出错),而是问它:“哪 200 个案例最有可能涉及该法律?”
- 通过让多个模型进行投票并对结果进行排序,他们创建了一个“候选短名单”。
- 当他们查看前 200 名候选者时,76% 的案例实际上是正确的。
- 这意味着律师可以使用该工具扫描数千份文件,从而获得一份可以进行人工复核的最具潜力的“隐藏线索”清单。
我们有多确定?
作者在语言表达上非常谨慎。
- 他们利用 1,015 个案例的数据库,精确地测量了分歧和错误率。
- 他们证明了错误集中在有争议的案例中,且这一现象在十个不同的模型中均有体现。
- 他们暗示(但并未证明)这种模式的存在是因为法律的“开放结构”(open texture)——这是一个法律概念,指法律规则拥有清晰的核心,但在应用过程中存在模糊的边缘。
- 他们演示了无需人类标签即可工作的无监督排序工具(unsupervised ranking tool)可以在前 200 个结果中达到 76% 的精确度。
总结
论文的结论是,我们不应期望计算机能在这些模糊的法律边缘完美取代人类的判断。相反,AI 的最佳用途是作为一个高功率的聚光灯。它无法告诉你最终的判决,但它可以从一百万个案例中照亮那最具潜力的 200 个候选者,让专家进行最后的、至关重要的决策工作。
简而言之:当专家产生分歧时,模型也会失效。但如果你利用模型去寻找那个“可能”的堆栈,你依然能找到黄金。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。