Multi-Legal-Bench: Evaluating LLMs on Legal Reasoning Across Jurisdictions, Languages, and Legal Traditions
本文介绍了 Multi-Legal-Bench,这是首个跨司法管辖区基准,用于评估六个国家和四个语系中的法律推理能力,结果表明任务表现因司法管辖区而异,且标签集对齐而非语言亲缘性或分词器效率,是跨语言少样本迁移成功的主要预测因子。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在测试一群新晋的“超级聪明学生”(即大型语言模型,LLMs)对法律的理解程度。
过去,研究人员仅在一个国家(通常是美国或英国)和一种语言(英语)中测试这些学生。这就像给纽约的学生做数学测试,然后假设结果能准确反映他们在东京的数学测试表现。但法律因地而异,语言也各不相同,因此这一假设存在缺陷。
本文介绍了Multi-Legal-Bench,这是一项旨在解决该问题的全新“全球成绩单”。以下是其运作方式,辅以简单类比:
1. “同一试卷,不同课堂”的理念
研究人员创建了一个基准测试,其中题目完全相同,但课堂环境不同。
- 学生:他们测试了 11 种不同的人工智能模型(有些庞大,有些小巧)。
- 课堂:他们选取了 6 个国家:乌克兰、法国、荷兰、波兰、捷克和立陶宛。
- 科目:他们没有要求人工智能撰写论文,而是基于真实的法院文件,给出了 5 项具体的逻辑任务:
- 法院类型分类:“这是刑事案件还是民事案件?”(类似于将邮件分类为“垃圾邮件”与“账单”)。
- 判决形式分类:“这是最终判决还是临时命令?”(类似于区分“期末考试”与“随堂测验”)。
- 案件结果预测:“基于事实,谁会胜诉?”(最难的部分,类似于在棋局结束前预测赢家)。
- 法律规范提取:“找出文本中引用的具体法律条款。”(类似于在段落中找出所有红色的字)。
- 案由类别预测:“这个案件是关于什么的?税务?家庭?合同?”(类似于按体裁整理书籍)。
2. “稀疏地图”的现实
研究人员并未强迫每个国家都为每项任务提供数据。他们诚实地反映了现实世界的混乱。
- 类比:想象一张城市地图,其中有些街道有交通信号灯,而有些则没有。他们并没有为那些没有交通灯的街道发明假的信号灯。他们只是如实绘制了数据存在的位置。这形成了一个“稀疏”的网格(有些格子填满,有些留空),这实际上更诚实地揭示了不同国家法律数据的存储状况。
3. 重大发现(他们的发现)
A. “一刀切”行不通
法律领域不存在“最佳人工智能”。
- 类比:将人工智能模型想象成不同类型的汽车。一辆车可能在赛道(法国法律)上最快,但在泥泞场地(波兰法律)上表现糟糕。另一辆车可能在泥泞中表现出色,但在赛道上却缓慢。
- 结果:在法国排名第一的模型,在波兰可能垫底。你不能仅仅挑选“最聪明”的模型;你必须为特定的国家和任务挑选合适的模型。
B. “语系”神话
研究人员原本认为,像乌克兰语和波兰语这样互为“表亲”(均为斯拉夫语族)的语言,会让人工智能更容易进行知识迁移。
- 类比:他们预期,如果教会一名学生乌克兰语,他们就能轻松理解波兰语的类似测试。
- 结果:他们错了。人工智能实际上从乌克兰语迁移到法语(远房表亲)的表现,比迁移到波兰语更好。
- 原因:这与语言无关,而与标签有关。如果“答案键”(人工智能必须选择的类别)看起来相似,人工智能的表现就好,即使语言完全不同。如果答案键杂乱且不同,即使语言相似,人工智能也会挣扎。
C. “提示”效应(少样本学习)
他们测试了在测试前给人工智能一些示例(提示)是否有帮助。
- 结果:这取决于任务。
- 对于文档分类(判决形式),提供示例就像给学生一张作弊小抄——它在所有地方都有帮助。
- 对于预测案件胜负,提供示例就像抛硬币。有时有帮助,有时会混淆人工智能。
- 对于简单分类(法院类型),人工智能已经非常优秀,不需要提示。
D. “词数”陷阱
他们考察了“分词器生育力”,即模型将一个词拆解成多少个微小片段(token)所需的情况。
- 类比:想象一个学生用 2 个字母写一个词,而另一个学生用 10 个字母写同一个词。你可能会认为写 10 个字母的学生效率低下。
- 结果:他们发现,模型在拆解单词方面的“效率”并不能预测其在实际法律任务中的智能程度。一个用更多“字母”写词模型,其准确性可能与用更少字母的模型一样高。“效率”指标适合预测测试成本,但却是预测模型实际表现好坏的糟糕指标。
4. 核心结论
本文是对任何试图将人工智能用于法律领域的人发出的警告:不要假设在一个国家有效的方法在另一个国家也有效。
- 如果你为法国构建法律人工智能,不要仅仅因为它们都在欧洲,就假设它在波兰也能行得通。
- 如果你看到某个模型在“用词效率”上很高,不要假设它在解决法律问题上就是最棒的。
- 唯一能确定人工智能是否适合你特定法律体系的方法,是用你的特定数据和你的特定规则对其进行测试。
研究人员已将其所有数据、问题和结果公开,因此任何人都可以运行自己的“成绩单”,以查看哪种人工智能最适合其特定的法律环境。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。