← 最新论文
🤖 AI

Gated Against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks

本文揭示了像 UA-JudgeExam 这样的法律多项选择基准测试,模型往往可以在不阅读问题的情况下,仅通过利用可利用的选项位置偏差和干扰项模式来解决这些问题,因此必须进行严格的门控和去偏差处理,以准确评估真实的法律推理能力。

原作者: Volodymyr Ovcharov

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Volodymyr Ovcharov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,研究人员经常通过让计算机回答多项选择题来测试其智能程度,这非常类似于学生参加标准化考试。这些测试的标准评分方式很简单:如果计算机选择了正确答案,它就得一分。但这种方法存在一个隐藏的缺陷。计算机并不一定需要理解问题就能得到正确答案。有时,备选答案列表本身就包含了足够的线索,足以揭示正确选项,即便问题本身被完全隐藏起来也是如此。当错误选项写得不好,或者正确选项是唯一看起来像真实、完整句子的选项时,就会发生这种情况。如果机器仅通过观察选项就能猜中正确的字母,那么这项测试测量的就不是智能,而是它识别选项中模式的能力。对于任何试图评估法律人工智能的人来说,这是一个严重的问题,因为如果测试本身有缺陷,结果就会产生误导。

一位研究人员着手调查这一问题,使用了一个来自乌克兰的庞大真实法律问题库。这些问题是为参加高风险资格考试的法官编写的,并附带官方验证的答案。该研究人员想看看现代人工智能模型是否可以在从未见过问题本身的情况下解决这些问题。他们提取了数千个此类题目,只向人工智能展示四个可能的答案,而将问题完全隐藏。他们发现,人工智能即使不看问题,也能比随机猜测更频繁地猜中正确答案。事实上,一个模型仅通过观察选项,正确率就接近 38%,这一得分远高于随机猜测所预期的 25%。这是因为正确答案通常是自包含的法律陈述,而错误答案则包含微妙的错误或听起来不自然。人工智能学会了在不需要知道问题在问什么的情况下,识别出“听起来正确”的法律条文。

随后,研究人员尝试了一种常见的补救措施:他们过滤掉了那些人工智能可以盲猜的题目,只保留了人工智能失败的题目。他们希望这能留下一个真正测试推理能力的干净题目集。然而,他们的实验揭示了一个令人震惊的事实:这种补救措施并不奏效。他们使用一个特定的 AI 模型构建了这个过滤器,但当他们用另一个更强大的模型测试剩余题目时,那个新模型仍然能以很高的准确率盲猜答案。这个过滤器仅仅是移除了对第一个模型容易被利用的问题,并没有移除对更聪明的模型容易被利用的问题。研究表明,随着人工智能模型的进步,它们变得越来越擅长捕捉选项中的这些隐藏线索,这意味着为一种模型清理出的测试,对于更优秀的模型而言会立即失效。

研究人员还发现,问题不在于法律学科本身,而在于问题的编写方式。他们将乌克兰的考试题目与另一种名为 LEXam 的不同格式法律测试进行了对比。在 LEXam 测试中,选项不是完整的句子,而是像“说法一和三”这样的短指针,指向问题中的列表。因为这些选项本身没有意义,所以人工智能无法在不阅读问题的情况下猜出答案。当研究人员在不同的测试格式上测试这些人工智能模型时,模型无法再盲猜答案;它们的得分正好处于随机猜测的水平。这证明了缺陷不在于人工智能的推理能力,而在于测试题目的设计。当选项是完整的、自包含的陈述时,测试容易受到利用;当选项只是指针时,测试则是安全的。

研究得出结论,仅仅过滤掉“坏”问题并不是解决办法,因为“坏”问题的定义取决于人工智能有多聪明。为了获得对人工智能能力的真实衡量,研究人员必须报告两个数字:模型在包含完整问题时的表现,以及在隐藏问题时的表现。他们还必须考虑到模型倾向于选择特定字母(例如总是选择“A”)的行为,这会人为地抬高分数。论文建议,对于法律考试及类似的专业测试,答案选项的格式是最关键的因素。如果答案是以完整的命题形式编写的,测试很可能会被能够单独阅读选项的人工智能所破坏。如果答案被设计成指针,测试才能保持对推理能力的有效衡量。研究人员发布了整个数据集及其测试结果,以便他人能够准确看到哪些问题泄露了信息,哪些没有,从而为构建更好、更诚实的人工智能评估提供了一条清晰的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →