← 最新论文
💬 NLP

GradeLegal: Automated Grading for German Legal Cases

本文通过系统评估 27 种大型语言模型,解决了德国法律考试评分中的瓶颈问题,发现以推理为导向的模型结合参考答案和评分标准能够有效近似公法领域的专家评分(但在刑法领域效果稍逊),且集成策略可进一步提升可靠性。

原作者: Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn, Michael Granitzer, Jelena Mitrovic

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn, Michael Granitzer, Jelena Mitrovic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位在非常严格的学校任教的老师,在那里批改考试就像解开一个复杂的谜团。在德国,法学学生参加的书面考试篇幅极长(有时长达 10 到 30 页手写内容!),评分等级从 0 到 18。获得高分对他们的未来职业生涯至关重要。

问题在于?学生太多,而足以批改所有试卷的专家教师却太少。获取结果需要数周甚至数月,造成了巨大的瓶颈。

这篇论文 GradeLegal 提出了一个简单的问题:人工智能(AI)能否充当这些高难度德国法学考试的可靠评分者?

以下是研究人员发现的成果,通过日常类比进行解释:

1. “空白画布”与“食谱书”

研究人员测试了 27 种不同的 AI 模型(有些是免费开源的,有些是付费私有的),以观察它们批改学生答案的能力。他们尝试了不同的方式来要求 AI 完成这项工作:

  • “猜猜我在想什么”方法(任务无关型): 他们只是告诉 AI:“批改这份试卷。”
    • 结果: AI 感到困惑。这就像让厨师在没有食谱或食材的情况下做饭。AI 给出的分数几乎完全是随机的,有时甚至比抛硬币还差。
  • “展示答案”方法(示例解答): 他们向 AI 提供了一份优秀学生应写的完美范例。
    • 结果: 有所改善,但仍不完美。AI 知道“正确”答案长什么样,但不知道如何针对小错误具体扣分。
  • “规则手册”方法(评分细则): 他们向 AI 提供了一份严格的检查清单(评分细则),上面写着:“如果你提到了 X,给 2 分;如果你漏掉了 Y,扣 1 分。”
    • 结果: 这是一个转折点。AI 突然明白了如何将学生杂乱的法律论点转化为具体的分数。
  • “超级教师”方法(评分细则 + 示例解答): 他们向 AI 同时提供了完美范例和严格的规则手册。
    • 结果: 这是获胜者。 当 AI 同时拥有这两者时,其评分表现几乎与公法(一种特定类型的法律)领域的专家相当。

2. “刑法”与“公法”的谜题

研究人员测试了两种类型的法学考试:

  • 公法: 这些考试就像结构清晰的拼图,有明确的路径。在提供正确工具的情况下,AI 在此表现非常出色,与人类专家不相上下。
  • 刑法: 这些考试就像一个混乱的迷宫。问题更加开放,学生可以用许多不同且复杂的方式论证他们的观点。
    • 结果: AI 在此处更加吃力。即使拥有最佳工具,它也无法像处理公法那样轻易地与人类专家匹敌。这就像批改只有一个正确答案的数学测试(公法)与批改存在多种有效解释的创意写作比赛(刑法)之间的区别。

3. “团队合作”效应(集成学习)

研究人员想知道:如果我们不只使用一个 AI,而是使用一个团队呢?
他们尝试结合三个不同 AI 模型的意见,创建一个“超级评分者”。

  • 类比: 想象让三位不同的评委给一名体操运动员打分,然后取中间分。
  • 结果: 这种“团队”方法通常比单个最佳 AI 模型表现更好。它平滑了某个 AI 可能犯下的怪异错误。这令人振奋,因为这意味着一组免费开源的 AI 有时能胜过最昂贵的付费 AI 模型。

4. “推理”因素

他们测试了“推理”模型(逐步思考的 AI)与“非推理”模型(仅预测下一个词的 AI)。

  • 结果: “推理”模型在理解法律论点的深层逻辑方面要出色得多。这就像仅仅死记硬背字典的机器人与真正调查线索的侦探之间的区别。

结论

该论文得出结论:AI 可以帮助批改德国法学考试,但前提是你必须把它当作一名初级助手,而不是魔法棒。

  • 必须给它一份清晰的规则手册(评分细则)和一份示例答案。
  • 它在结构化考试(公法)中表现最佳,并且仍在努力学习如何处理刑法的混乱复杂性。
  • 目前,它最适合作为练习和自我测试的工具(帮助学生在真实考试前了解他们的可能表现),而不是用于对其成绩做出最终且改变人生的决定。

简而言之:AI 是一位强大的新教学助手,但它需要一套非常清晰的指令和人类主管的监督,才能发挥最佳工作效果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →