← 最新论文
💬 NLP

A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

本研究揭示,尽管大语言模型评判者与人类考官在具有明确评分标准的泰国律师资格考试论文上达成一致,但大语言模型在模糊案例中系统性地未能复现少数人类解读,而是始终与多数人类观点保持一致,从而掩盖了其无法捕捉专家分歧全貌的缺陷。

原作者: Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在举办一场高风险的法律论文质量评审竞赛。你拥有一份非常具体的规则手册(即“评分标准”),用于指导评分者如何给答案打分。通常,规则手册是清晰的:如果答案正确,就给予高分;如果推理糟糕,就给予低分。

但有时,规则手册会陷入“灰色地带”。当学生得出了最终正确答案,却遗漏了一个特定且至关重要的法律引用时,规则手册并未明确说明该如何处理。这就是“规则静默”地带。

本文是一项两部分实验,旨在观察人类与人工智能(AI)法官如何处理这些灰色地带。

第一部分:“考试”(第一阶段)

首先,研究人员将 8 个不同的人工智能模型置于“学生席位”。它们必须像 42 名真实的泰国法律学生一样撰写法律论文。这些 AI 模型由人类专家进行盲评。

  • 结果:AI 模型的表现与平均人类学生相当。有些表现优异,有些平平无奇,有些则显得吃力。它们都“身在其中”。

第二部分:“评分”(第二阶段)

接下来,研究人员拿同样的论文,请两组人进行评分:

  1. 人类小组:三位真实且持有认证的法律考试评审员。
  2. AI 小组:一个庞大的群体,包含 26 个不同的人工智能模型(包括之前参加考试的模型,以及许多其他模型)。

他们给所有人提供了完全相同的四项内容以供审视:问题、规则手册、“完美”答案要点以及学生的论文。

重大发现:“单行道”

研究人员发现了一个有趣的分歧,但这仅出现在规则手册静默的棘手问题上。

人类的分歧
三位人类专家意见不一。

  • 其中两位(B 和 C) 表示:“学生抓住了要点,推理也足够好。给他们高分(6–8 分)。”
  • 另一位(A) 表示:“学生遗漏了一个关键引用。这使得推理‘不可用’。给他们非常低的分数(1–2 分)。”
  • 这就像体育裁判:两位裁判认为球员“在界内”,而一位裁判认为他们“出界”。双方使用的是同一本规则手册,但对灰色地带的解读不同。

AI 的分歧(不对称性)
这里变得有些奇怪。研究人员原本预期 26 个 AI 模型会分裂,可能有些站在严格的人类(A)一边,有些站在宽容的人类(B 和 C)一边。

  • 事实并非如此
  • 26 个 AI 模型中有 22 个 站在了两位宽容的人类(B 和 C)一边。他们给出了高分。
  • 3 个 AI 模型 感到困惑,给出了中等分数。
  • 零个 AI 模型 站在严格的人类(A)一边。即使是那个试图表现严格的人工智能(GPT-5.4 Nano),其一致性也不足以真正匹配严格人类的风格。

隐喻
想象一群 26 台不同的相机正在拍摄一幅画作。

  • 三位人类艺术评论家看着这幅画,意见不一:两位称其为杰作,一位称其为失败之作。
  • 你让这 26 台相机描述这幅画。
  • 结果:所有 26 台相机都同意那两位称其为杰作的评论家。没有一台相机同意那位称其为失败之作的评论家。尽管这些相机品牌、尺寸和价格各不相同,但它们都以相同的方式“看到”了这幅画,完全忽略了那位严格评论家的视角。

这为何重要?

该论文指出,当我们构建用于评分论文的人工智能系统时,我们通常会选择与“平均”人类评分者意见最一致的人工智能。

  • 由于本研究中的大多数人类(3 人中的 2 人)持宽容态度,人工智能也学会了宽容。
  • 人工智能并非以平衡的方式学会“公平”;它学会了不对称。它收敛于多数观点,完全忽略了少数观点,尽管该少数观点是一种有效且合法的解释。

“双重角色”的意外

研究人员还注意到人工智能“个性”中奇怪的一面。

  • 在阶段 1 中表现糟糕的学生(它们在自己的论文中得分较低)的 AI 模型,实际上在阶段 2 中成为了最一致的宽容法官
  • 在阶段 1 中表现优异的学生的 AI 模型,却只成为了“尚可”的法官。
  • 教训:擅长撰写答案并不意味着擅长评分答案。这两种技能截然不同。

核心结论

这项研究表明,AI 法官彼此之间非常稳定且一致,但它们存在盲点。当人类专家在灰色地带规则上意见不一时,AI 并不会折中处理或探索所有有效观点。相反,它会压倒性地选择“多数”人类观点,并忽略“少数”观点。

如果你使用 AI 来评分论文,你得到的不仅仅是一个第二意见;你得到的是一面镜子,它如此强烈地反射多数观点,以至于少数观点完全消失。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →