← 最新论文
💬 NLP

Knowing the Form, Not the Function: Automatically Auditing Answer--Authority Decoupling in Legal Benchmarks

本文提出了一个针对法律基准测试的联合评估框架,该框架同时评估答案的正确性与法律依据的溯源性,并揭示了模型经常将这两个维度解耦,且仅依赖答案准确性会导致误导性的性能指标。

原作者: Hsien-Jyh Liao

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Hsien-Jyh Liao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你置身于一座巨大的、高科技的图书馆中,里面的机器人正在学习如何成为律师。在这个世界里,有一种特别的游戏叫做“基准测试”(benchmark)。它就像一场期末考试,机器人需要阅读一个棘手的法律问题并选出正确的答案。长期以来,老师们(科学家们)只关心机器人是否得到了最终答案。如果机器人说“正确选项是 B”,它就会得到一颗金星。但问题在于,有时机器人虽然说了“B”,却给出了一个完全虚构或错误的理由,比如引用了一部并不存在的法律,或者指向了错误的规则手册。

这篇论文深入探讨了那个图书馆中的一个特定角落:法律基准测试的世界。把这些基准测试想象成 AI 律师的标准化考试。其核心概念是权威溯源(Authority Grounding)。用通俗的话来说,这意味着检查机器人的答案是否确实得到了它声称使用的真实、官方法律的支持。这就像是一个学生是在数学考试中通过展示正确的公式来得出答案,还是仅仅靠猜出了正确答案之间的区别。作者之所以关注这一点,是因为如果我们只根据最终答案来评分,我们可能会误以为一个机器人是一位才华横溢的律师,而实际上它只是一个恰好表现得很有自信的幸运猜题者。

研究人员决定用来自台湾国家考试(台湾司法考试)的真实题目,与四个不同的 AI 模型(可以把它们想象成四个不同的机器人学生)进行一场游戏。他们要求机器人解决法律谜题并解释其推理过程,但并没有明确告诉它们:“嘿,你必须引用具体的法律条文。”令人惊讶的是,机器人开始自发地引用法律,就像真正的律师那样。

以下是论文发现的一个大惊喜:机器人的答案往往是对的,但引用的法律是错的;有时答案是错的,但引用的法律却是对的。 这就像一个学生在历史考试中得到了正确答案,却引用了错误的世纪作为来源。论文将这种现象称为“双重解离”(double dissociation),这是一个高级说法,意指“得到正确答案”和“找到正确法律”这两项技能可以完全脱节。

在刑法部分的考试中,论文精确测量了这种情况发生的频率。他们发现,在 24.0% 到 42.4% 的情况下,机器人给出了正确的答案,但完全遗漏了正确的法律。更奇怪的是,在 15.2% 到 21.7% 的情况下,机器人给出了错误的答案,但却正确地引用了正确的法律。这证明了仅仅因为机器人得到了最终答案,并不意味着它真正理解了背后的法律规则。

作者还做了一个小实验。他们告诉机器人:“如果你不确定确切的法律编号,你不必说出来。”当这样做时,机器人引用法律的频率减少了,但它们得到正确答案的能力几乎没有变化。这表明机器人并不是在利用法律来推导答案;它们只是在得出答案后,把法律当作一种装饰添加上去。

那么,结论是什么呢?论文认为我们需要改变对这些 AI 律师的评分方式。我们不能再只看最终答案了。我们必须检查“凭据”——即它们引用的具体法律。如果我们不这样做,我们可能会在庆祝一个实际上是在编造法律事实、只是碰巧猜对答案的机器人。作者建议,未来的测试应该将答案和法律引用一起评分,因为目前的系统正遗漏掉真相中极大的一个部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →