Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
本文介绍了 Magis-Bench,这是一个源自巴西司法考试的基准测试,用于评估 23 个最先进的大语言模型在法官级别的法律推理与写作任务上的表现,结果显示即使是表现最佳的模型在撰写具有充分说理的司法判决时也难以取得高分。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场高风险的烹饪比赛。通常,当我们测试人工智能时,是让它去“烹饪”一道菜(即撰写法律论据或合同)。但在真实的法律体系中,最重要的工作不仅仅是烹饪;而是担任“法官”的角色,去品尝这道菜,判断其优劣,并解释其通过或失败的原因。
本文 Magis-Bench 正是关于测试人工智能在“法官”这一角色上的表现。
问题:人工智能能担任法官吗?
大多数法律领域的人工智能测试都是要求计算机扮演律师:“为这位客户撰写辩护词。”但真正的法官必须完成一项更艰巨的任务:倾听双方意见,摒弃个人情感,严格适用规则,并撰写出经得起 scrutiny(严格审查)的最终裁决。
作者们想要知道:当前的 AI 模型能否像真正的法官那样行事?
测试:“治安法官”考试
为了测试这一点,研究人员并没有编造虚假问题。他们从 2023 年至 2025 年间用于招聘真实法官的、极具竞争力的巴西实际考试中,提取了 74 道真实题目。
可以将这些考试视为法官的“律师资格考试”。它们包括:
- 论述题:“这里有一个混乱的法律情境;请解释相关法律。”
- 起草任务:“这里是事实;请撰写完整的、正式的法院判决书(最终裁决)。”
关键在于,每道题目都配有 官方答案要点(评分标准)。这就像老师的评分表,明确规定了提及特定法律或遵循特定结构能获得多少分。
方法:AI 对 AI
由于聘请 23 位人类法官来为 23 个不同的 AI 模型批改 74 篇论文将极其昂贵且缓慢,研究人员使用了一个巧妙的技巧:让 AI 给 AI 打分。
- 参赛者:他们挑选了 23 个目前最智能的 AI 模型(来自 Google、OpenAI、Anthropic 等公司)。
- 法官:他们使用了另外四个非常强大的 AI 模型充当评分者。
- 规则:“法官 AI"对答案的撰写者身份一无所知。它们仅查看题目、官方答案要点以及 AI 的回答,然后给出 0 到 10 分的评分。
结果:AI“法官”意见一致
以下是发生的情况:
- 法官们意见一致:四位 AI 法官彼此之间的意见几乎完全一致(一致率高达 98.4%)。这就像四位美食评论家完全一致地认定哪一家餐厅是最好的。这让研究人员确信评分是公平的,而非随机产生的。
- 获胜者:表现最好的是 Google 的 Gemini-3-Pro-Preview(得分:6.97/10),其次是 Gemini-3-Flash 和 Claude-4.5-Opus。
- 现实检验:即使是“获胜者”也只获得了 6.97 分(满分 10 分)。这还不到 70%。
这意味着什么
该论文得出结论:虽然人工智能在法律任务方面正变得更好,但 对它们而言,扮演法官的角色仍然非常困难。
- 差距:当前的 AI 模型就像那些能背诵教科书的学生,但在将规则应用于混乱的现实生活情境时,却难以具备人类法官那样的细微差别和权威性。
- 基准:研究人员发布了所有题目、答案以及评分代码,以便其他科学家能够继续测试并改进这些模型。
简而言之:我们要求人工智能参加真实的法官考试。最聪明的模型只拿到了"C"或"B"的成绩,这证明虽然它们正变得越来越聪明,但尚未准备好在法庭上取代人类法官。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。