← 最新论文
💬 NLP

GreekBarRetrieval: A Benchmark for Greek Statutory Retrieval

本文介绍了 GreekBarRetrieval,这是一个源自律师考试题目的新型希腊法律条文检索基准,并证明了基于大语言模型的十轮查询重构循环能显著提升 BM25 的性能,使其能够超越原始稠密检索器及其他先进的检索策略。

原作者: Ernest Beta, Odysseas S. Chlapanis, Dimitrios Galanis, Ion Androutsopoulos

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Ernest Beta, Odysseas S. Chlapanis, Dimitrios Galanis, Ion Androutsopoulos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在法律领域,寻找适用于特定情况的正确规则是正义的基础。当律师或法官需要回答有关犯罪或合同的复杂问题时,他们不能仅依靠记忆;他们必须找到规范该情况的确切法律文本。这一过程被称为“法定检索”(statutory retrieval),涉及在成千上万条法律条文中搜索出真正相关的少数几条。挑战在于,人们用普通、日常的语言描述现实生活中的事件,而规范这些事件的法律则是用专门的、抽象的代码编写的。一个人可能会说:“他拒绝给药,”但法律可能会将同一个概念表述为“不履行行为义务”。弥合人类语言与法律书写方式之间的这种差距非常困难,尤其是对于像希腊语这样具有复杂词汇结构、使得简单的词汇匹配变得不可靠的语言。如果没有准确检索这些法律文本的能力,人工智能系统就无法提供可靠的答案或解释其推理过程,而这在法律环境中是一项至关重要的要求。

希腊的研究人员通过创建一个名为 GreekBarRetrieval 的新测试场来解决这一问题。他们利用真实的希腊律师执业考试题目构建了这个基准测试,这些考试是律师从业必须通过的严格测试。在这些考试中,考生会被呈现一个详细的法律案例故事,并被要求识别哪些具体的刑法条文或其他法律适用。研究人员提取了 283 道此类考试题目及其背后的完整故事,并将它们与一个包含 6,308 条候选法律条文的海量库进行配对。目标是观察计算机系统能否通过观察一个问题及其故事,随后成功地从那个庞大的库中找到隐藏的正确法律条文。这种设置是独特的,因为它测试了系统在尝试撰写答案之前检索源材料的能力,从而将搜索技能与推理技能分离开来。

当研究人员首次测试标准的计算机搜索方法时,结果显示了两种不同方法之间的明显分歧。一种被称为“稀疏检索”(sparse retrieval)的方法,其原理是寻找问题与法律文本之间的精确单词匹配。另一种被称为“稠密检索”(dense retrieval)的方法,则利用先进的人工智能来理解词汇背后的含义,即使具体的词汇不同。在初步测试中,基于含义的系统表现得更为出色,成功在排名前一百个结果中找到相关条文的概率约为 77%。相比之下,基于单词匹配的系统成功率仅为 36% 左右。这证实了当问题语言与法律语言差异巨大时,仅仅进行单词匹配往往是不够的。

然而,研究人员发现,通过使用大语言模型在计算机查找答案之前重写搜索问题,可以显著提高单词匹配系统的性能。AI 被要求将原始的、充满无关细节的混乱故事转化为精确、正式的法律语言,剔除叙事性的冗余。这一简单的“查询重构”步骤将单词匹配系统的成功率从 36% 提升到了 60%,有效地缩小了与更复杂的基于含义的系统之间的差距。研究发现,这种重写问题的方法比其他常见的技巧(例如先将希腊语文本翻译成英语,或调整搜索引擎的内部设置)更为有效。

为了进一步提升性能,团队引入了一种计算机进行搜索、审查所获结果、然后根据这些结果再次进行搜索的方法。这种迭代过程模仿了人类律师在阅读一些初始文档后改进其搜索策略的方式,它使单词匹配系统的成功率达到了 67%。虽然这并未完全超越表现最好的基于含义的系统(后者达到了 73%),但它产生了一个更加有序的结果列表,将最重要的条文放在了列表的最顶端。这尤其有价值,因为法律系统通常需要处理有限数量的文档。然而,研究人员指出,这种迭代方法是有代价的:它要求计算机进行更多的计算,并且完成搜索所需的时间也显著增加,与单次直接搜索相比。

研究结论认为,虽然理解含义的高级人工智能系统功能强大,但它们并非唯一的途径。通过使用大语言模型将日常问题转化为正式的法律语言,即使是更简单、更快速的搜索工具也能变得非常高效。这表明,提升法律人工智能的关键不仅在于构建更大的模型,还在于确保所提出的问题清晰且使用了正确的术语。研究人员公开了他们的数据和代码,为测试计算机如何驾驭复杂的希腊法律图景提供了一个新的标准,同时也为改进其他语言的法律搜索工具提供了蓝图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →