← 最新论文
💬 NLP

Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis

本文认为,仅靠大规模预训练不足以使大语言模型具备可靠的法律“通常含义”分析能力,因为实证证据表明,其结论对提示词的微小变化缺乏稳健性,且与人类判断仅呈中度相关,因而无法适用于高风险司法场景中的权威性用途。

原作者: Abhishek Purushothama, Junghyun Min, Brandon Waldon, Nathan Schneider

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Abhishek Purushothama, Junghyun Min, Brandon Waldon, Nathan Schneider

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一位法官在法庭上试图弄清楚法律中一个令人困惑的词语对普通人究竟意味着什么。例如,合同条款中的“景观美化”是否涵盖建造蹦床?传统上,法官可能会自问:“我的邻居会怎么想?”或者查阅字典。

最近,一些法律专家和法官开始向大型语言模型(LLM)——即驱动聊天机器人的同一种人工智能——提出这个问题。其想法是:“如果人工智能几乎阅读了互联网上所有写过的内容,它一定确切知道普通人如何使用词语,对吧?”

这篇论文是一项重大而严谨的实验,旨在检验这一想法是否成立。研究人员扮演了坐在审判席上的“严厉批评者”,对这些人工智能模型进行了严格的压力测试。以下是他们发现的简要说明:

1. “坏钟”问题

研究人员让 15 个不同的人工智能模型(从小型模型到庞大的 GPT-4)来判断 138 个不同的保险场景是否属于承保范围。

  • 发现:其中一些人工智能模型就像一只卡在“否”字上的坏钟。无论故事内容如何,它们每次都给出完全相同的答案。
  • 比喻:想象你问一位天气预报员:“下雨了吗?”如果他们在晴天、阴天和暴风雪中都说“是”,那么他们实际上并没有在看天空,而只是在重复脚本。有几个人工智能模型正是如此,未能真正“阅读”法律案件的具体细节。

2. 提示词的“魔术”

研究人员随后尝试了一个魔术:他们提出了完全相同的问题,但仅仅改变了提问的方式

  • 情境 A:“约翰是否受保?是或否?”
  • 情境 B:“约翰是否不受保?是或否?”
  • 情境 C:“你是否同意约翰受保?”
  • 发现:人工智能的答案会剧烈摇摆。在一种提问版本中,人工智能可能有 90% 的把握认为约翰受保。而在稍有不同的版本中(例如添加一个“不”字或颠倒选项顺序),人工智能可能有 90% 的把握认为他不受保。
  • 比喻:这就像一个根据你书写纸张颜色而改变主意的意见箱。如果你以一种方式向模型提问,它会说“是”。如果你以另一种方式问同样的问题,但将“否”选项放在前面,它就说“否”。这意味着律师可能会为了得到他们想要的答案而“四处挑选”提示词,而不是获取真相。

3. 不懂语言的“翻译”

研究人员将人工智能的答案与真实人类(普通英语使用者)的实际想法进行了比较。

  • 发现:人工智能与人类仅中等程度地达成一致。即使是最优秀的人工智能模型(如 GPT-4),只有在确切知道如何解读其概率分数时,正确率才约为 83%。但在真实的法庭上,你无法窥探这些分数;你只能得到答案。
  • 比喻:想象你聘请一位翻译来告诉你一群人的想法。如果翻译的正确率是 83%,这听起来不错。但在法律案件中,每六次就出错一次是一场灾难。这就像一台 GPS,83% 的时间能把你带到正确的城市,但其余 17% 的时间却把你丢在沼泽里。

结论

该论文认为,仅仅因为人工智能阅读了大量数据(大规模预训练),并不意味着它理解普通人的思维方式。

作者得出结论,这些人工智能模型目前过于脆弱且不可靠,不能作为法律案件的最终定论。它们尚未成为普通含义的“权威”来源。如果法官依赖它们而不加以核查,他们可能会信任一只坏钟,或者一个根据字体大小改变主意的意见箱。

简而言之:人工智能是一位流利的谈话者,但在决定词语对普通人意味着什么时,它并不是一个可靠的思考者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →