← 最新论文
💬 NLP

LEXam: Benchmarking Legal Reasoning on 340 Law Exams

本文介绍了 LEXam,一个源自 116 门法律课程 340 场考试的基准测试,包含 7537 道英德双语法律试题及推理指导,旨在评估大语言模型在长篇幅、多步骤法律推理任务中的能力,并通过结合人类专家验证的 LLM 裁判范式实现了可扩展的推理质量评估。

原作者: Yu Fan, Jingwei Ni, Jakob Merane, Yang Tian, Yoan Hermstrüwer, Yinya Huang, Mubashara Akhtar, Etienne Salimbeni, Florian Geering, Oliver Dreyer, Daniel Brunner, Markus Leippold, Mrinmaya Sachan, Alexa
发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Fan, Jingwei Ni, Jakob Merane, Yang Tian, Yoan Hermstrüwer, Yinya Huang, Mubashara Akhtar, Etienne Salimbeni, Florian Geering, Oliver Dreyer, Daniel Brunner, Markus Leippold, Mrinmaya Sachan, Alexander Stremitzer, Christoph Engel, Elliott Ash, Joel Niklaus

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 LEXAM 的新项目,你可以把它想象成给大型人工智能(AI)模型举办的一场"超级法律期末考试"。

以前,AI 在数学或科学题上表现不错,就像是个只会做标准答案的“优等生”。但在法律领域,事情变得复杂多了。法律不仅仅是背条文,更需要像律师一样进行逻辑推理发现关键问题,并在模糊的情境中做出判断。

为了测试 AI 到底有没有真本事,研究团队从瑞士苏黎世大学的法学院收集了 340 份真实的期末考试卷,涵盖了 116 门不同的课程。这就像是从全球最顶尖的“法律训练营”里,把过去几年的考题都搬到了 AI 面前。

以下是这篇论文的通俗解读:

1. 考试长什么样?(数据集)

这次考试包含 7500 多道题,分为两种形式:

  • 简答题(开卷大作文):这是最难的部分。题目会给出一个复杂的案例(比如:A、B、C 三人签合同,其中有条款说“要么在瑞士仲裁,要么在法国法院打官司”,这到底算不算数?)。AI 需要像法学生一样,一步步写出推理过程,引用具体的法律条款。
  • 选择题(多选):题目给出几个陈述,让 AI 判断哪些是对的。为了增加难度,研究人员故意把选项数量从 4 个增加到 32 个,就像在 32 个嫌疑人里找那个唯一的真凶,以此测试 AI 是否真的懂,还是靠瞎蒙。

特别之处:这些题目有英文和德文两种语言,而且不仅考瑞士法律,还涉及国际法和比较法。这就像要求 AI 同时精通“本地方言”和“国际通用语”。

2. 谁来当考官?(评估方法)

以前我们怎么知道 AI 答得对不对?通常是看它最后的答案跟标准答案字面像不像。但这在法律界行不通,因为法律推理的过程比结果更重要。

  • 以前的做法:像批改语文作文,看字数和关键词。
  • LEXAM 的做法:他们请来了一个"超级考官团"。
    • 首先,他们找了几位拥有博士学位的真人法律专家,给 50 道题打分,确立了“人类标准”。
    • 然后,他们训练了一个由多个顶尖 AI 组成的"AI 考官团"(Ensemble LLM-as-a-Judge)。这个考官团非常严格,它会检查 AI 是否引用了错误的法律条款,逻辑是否通顺,有没有“胡编乱造”(幻觉)。
    • 关键点:他们发现,只要这个"AI 考官团”设计得好,它的打分和真人专家的高度一致。这意味着以后我们可以用 AI 来大规模、低成本地给法律 AI 打分,而不需要每次都请昂贵的律师来阅卷。

3. AI 考得怎么样?(实验结果)

结果有点让人“清醒”:

  • 推理能力仍是短板:即使是目前最聪明的 AI(比如 GPT-5、DeepSeek-R1 等),在面对需要多步推理的复杂法律案例时,依然会犯错。它们经常像“死记硬背的学生”,能背出法律条文,但不会灵活运用。
  • 选项越多越容易晕:在选择题中,当选项从 4 个增加到 32 个时,AI 的准确率大幅下降。这说明它们有时候是靠“排除法”或“猜谜”在做题,而不是真正理解了逻辑。
  • 语言和文化差异:AI 在英文题目上表现通常比德文好,这可能是因为训练数据中英语法律资料更多。
  • 小模型 vs 大模型:有趣的是,一些经过专门“推理训练”的小模型,在某些任务上甚至能打败那些参数巨大的旧模型。

4. 为什么这很重要?(意义)

  • 不仅是考试,更是体检:LEXAM 不仅仅是一个排行榜,它像是一次全面的“体检”,告诉我们 AI 在法律领域哪里强、哪里弱。
  • 防止“一本正经地胡说八道”:法律是高 stakes(高风险)领域。如果 AI 给律师或法官提供错误的法律建议,后果不堪设想。这个基准测试能帮助开发者发现 AI 的“幻觉”和逻辑漏洞。
  • 未来的方向:研究团队表示,这只是第一步。他们计划把考试范围扩大到美国、中国、欧盟等更多地区,让 AI 真正学会处理全球复杂的法律事务。

总结

简单来说,LEXAM 就是给 AI 法律能力的一次“高考”。它告诉我们:现在的 AI 虽然能写写法律文书,但在处理复杂的逻辑推理和真实案例时,离真正的“法律专家”还有很长的路要走。而且,我们终于有了一套科学的方法,能像人类老师一样,严格地给 AI 的“法律作业”打分了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →