BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law
本文介绍了 BenGER,这是一个用于评估大语言模型在德语法律中基于包含关系的法律推理能力的综合性基准数据集,研究表明封闭的旗舰模型引领了性能表现,而人机协同创作显著优于无辅助的人类工作,所有结论均通过稳健的“大语言模型作为裁判”框架得到验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何成为律师。但并非任何律师,而是专攻德国那种具体、僵化且高度结构化法律体系的律师。在这个体系中,解决法律问题并非靠猜测正确答案,而是遵循一种名为“涵摄”(subsumption)的严格配方。
将其想象成烘焙蛋糕:食谱要求你列出每一种食材,精确解释其为何符合食谱,并证明它如何与其他食材混合,之后你才能说“蛋糕做好了”。如果你跳过任何一步,或者仅仅说“这是蛋糕”,即便蛋糕味道很好,你也会失败。
本文 BenGER 是一项全新的庞大测试,旨在考察现代人工智能(大语言模型)是否真的能遵循这种严格的德国法律配方。
以下是他们所做工作的分解,辅以简单的类比:
1. 测试厨房(数据集)
研究人员建立了一个名为 BenGER 的巨大“测试厨房”。它包含三种类型的挑战:
- 大型考试: 596 个长篇、复杂的法律案例(类似于法学院学生的期末考试),要求 AI 撰写完整、结构化的解决方案。
- 快速测验: 531 个关于法律原则的简短问题。
- “基准马拉松”(人机实验室): 一组特殊的 15 个新问题,研究人员不仅要求 AI 解决这些问题,还要求真实人类以两种方式解决:
- 单人模式: 人类仅依靠书籍和互联网独立工作。
- 共创模式: 人类与 AI 助手协作撰写解决方案。
2. 评委(评分方式)
给法律论文评分 notoriously 棘手。即使是人类专家也常常意见不一。一位教授可能给某篇论文打"A",而另一位教授对同一份作品却打"C"。
为了解决这个问题,研究人员没有只请一个人给 AI 评分,而是构建了一个“机器人评委”(作为评委的 LLM),该评委基于非常具体的评分标准(评分清单)进行了训练。
- 评分标准: 想象一张包含 10 个类别的记分卡,例如“你是否找到了正确的法律?”、“你是否将事实与法律联系起来了?”以及“你的写作是否有条理?”。
- 验证: 为了确保他们的机器人评委没有偏见或失常,他们将其评分结果与一个由三位真实人类专家组成的评审团进行了对比,这些专家在不知情的情况下对相同的答案进行了评分。
- 结果: 机器人评委出奇地公正。当他们用机器人评委替换掉一位人类评分员时,最终的小组总分并未发生太大变化。机器人评委的可靠性与人类专家相当。
3. 结果(谁赢了?)
他们测试了 12 种不同的 AI 系统,范围从最强大的“旗舰”模型(AI 世界的超级计算机)到更小、更快的“效率”模型。
- 冠军: 大型闭源“旗舰”模型(如来自 OpenAI、Anthropic 和 Google 的模型)脱颖而出。它们得分最高,经常获得可与顶尖法学生相媲美的“及格分数”。
- 黑马: 开源模型(可免费下载)表现尚可,但总体上落后于大型商业模型。
- 神奇组合: 最令人惊讶的发现是关于人机共创。当人类被允许使用 AI 协助撰写答案时,他们的分数飙升。他们不仅做得和 AI 一样好,而且比独自工作的人类做得更好,甚至击败了独自工作的 AI。这就像一位人类厨师使用高科技搅拌机,烘焙出了比厨师独自制作或机器独自制作都要更好的蛋糕。
4. “陷阱”(论文对我们的警示)
作者非常诚实地指出了局限性:
- 黑箱: 他们通过 API 测试了面向公众销售的 AI。他们无法看到引擎盖下的“引擎”,因此不知道确切原因为何一个模型优于另一个,只知道它确实更好。
- 配方的特异性: 此测试严格针对德国法律。德国律师的思维方式(即“涵摄”配方)不同于美国或英国的律师(后者更依赖先例)。你不能拿这些结果来说“这个 AI 在纽约会成为一名优秀的律师”。
- 记忆风险: 部分测试题目来自公开期刊。AI 有可能只是从互联网上记住了答案,而非真正“思考”了问题。然而,新的“基准马拉松”问题(AI 此前未曾见过)显示了类似的结果,这表明 AI 实际上是在学习逻辑,而不仅仅是在作弊。
核心结论
这篇论文指出:"我们建立了一个针对德国法律推理的严格、公正的测试。目前最好的 AI 模型在遵循规则方面已经非常出色,但尚未完美。然而,当人类与 AI 携手合作时,他们变成了超级律师,其表现超越了单独工作的人类和 AI。"
他们还证明,聪明的机器人评委可以几乎像满屋的人类教授一样可靠地给这些论文评分,这有助于在未来扩大法律教育和测试的规模。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。