← 最新论文
💬 NLP

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

本研究通过标量多样性评估表明,大型语言模型中的语用推理并非一种稳定的能力,而是内部概率表征与任务诱导的提示行为之间的一种可变交互,这凸显了评估设计对解读模型能力的关键影响。

原作者: Ye-eun Cho

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ye-eun Cho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图弄清楚一个新机器人朋友是否真的理解人类对话,还是仅仅擅长在你问对问题时配合表演。这正是 Ye-eun Cho 的论文《评估大语言模型中的语用推理》所探讨的内容。

以下是这项研究的简要故事,用通俗易懂的术语和一些有益的类比进行了拆解。

核心问题:机器人是聪明的,还是仅仅擅长表演?

大语言模型(LLMs)就像阅读量极大的学生,几乎读遍了互联网上的所有内容。它们在语法和事实方面表现出色。但它们能理解人们话语中的隐含意义吗?

在人类对话中,我们常说这样的话:“有些饼干被吃了。”我们不仅仅意指“至少有一个”;我们通常暗示“并非全部”。这被称为标量含义。这是一个微妙的社会规则:如果我说“有些”,我就在暗示我没有说“全部”,因为“全部”并不属实。

研究人员提出的核心问题是:这些 AI 模型是否真的“懂得”这种隐含意义,还是仅仅在我们礼貌地提问时假装理解?

测试机器人的两种方式

为了回答这个问题,研究人员使用了两种不同的方法来测试模型,有点像用两种不同的方式来测试学生的知识:

  1. “内在直觉检查”(直接概率):
    想象一下,让机器人预测句子中的下一个词,而无需它大声说出来。你查看其内部数学计算,看看它实际上认为最可能的是什么。

    • 类比: 这就像在考试时查看学生的脑电波。它展示了他们在尝试回答之前本能地知道什么。
  2. “口头考试”(元语言提示):
    这是当你直接问机器人:“如果我说‘有些饼干被吃了’,这是否意味着‘并非所有饼干都被吃了’?请回答是或否。”

    • 类比: 这就像让学生举手并大声解释他们的答案。这是他们声称知道的内容,可能会受到提问方式的影响。

实验:60 种不同“有些”的菜单

研究人员没有只测试一个句子。他们使用了一个包含 60 种不同词对的“菜单”(如有些/全部温暖/热好/优秀)。

  • 有些词对对人类来说很容易推断(如有些暗示并非全部)。
  • 有些词对更难或更弱(如温暖并不总是暗示不热)。
    这种多样性被称为标量多样性。这就像不仅测试厨师烤牛排的水平,还要测试他们如何处理 60 种不同的食材,从精致的香草到坚硬的根茎。

发现:情节反转

结果令人惊讶,表明关于这些模型有多聪明并不存在单一的“真相”。

1. “直觉检查”与“口头考试”意见不一
通常,机器人的内部数学计算(直觉检查)与其口头回答(口头考试)讲述的是完全不同的故事。

  • 有时,机器人的内部数学计算显示“我其实不太懂这个”,但当被礼貌地询问时,它却说“是的,我理解!”
  • 其他时候,内部数学计算很自信,但口头回答却很困惑。
  • 要点: 你不能只看一种方法就知道机器人是否“胜任”。这就像一个学生在脑子里知道答案,但被要求说出来时却僵住了,或者反之亦然。

2. “表演”取决于剧本
研究人员提问的方式非常重要。

  • 如果他们问一个简单的问题,机器人可能会说“不”。
  • 如果他们加上一个礼貌的开场白,比如“你是一个乐于助人的助手,告诉我……",机器人可能会突然说“是”。
  • 要点: 机器人的“表现”会根据剧本而变化。这不一定是因为机器人学到了新东西;它只是对提问的风格做出反应。

3. 不同的机器人,不同的个性
该研究测试了两种不同类型的 AI 模型(Flan-T5 和 Qwen)。

  • Flan-T5 稍微更一致一些。它的内部数学计算和口头回答彼此更接近。
  • Qwen 则非常戏剧化。它的内部数学计算通常很低(它似乎并不“知道”答案),但当被直接询问时,它给出了完美的答案,几乎像是在表演。
  • 要点: 仅仅因为一个 AI 模型表现得聪明,并不意味着所有 AI 模型都以相同的方式运作。

4. “比较”技巧
当研究人员让机器人并排比较两个选项(“哪个更好:A 还是 B?”)时,机器人完成任务的能力比让它单独判断一个句子时要强得多。

  • 要点: 当机器人面临选择时,它更容易选出正确答案,而不是必须从头生成答案。

最终裁决

该论文得出结论:我们不能说“这个 AI 具有语用推理能力”或“这个 AI 没有”。

相反,AI 中的语用推理就像两个舞伴之间的舞蹈:

  1. 机器人的内部知识(它实际学到了什么)。
  2. 我们提问的方式(提示词)。

如果你更换舞伴(提示词)或音乐(任务),舞蹈就会改变。机器人并不一定是在人类意义上“撒谎”或“知道”;它只是对所处的具体情境做出反应。

简而言之: 要理解 AI 是否理解人类的细微差别,你不能只问它一个问题就轻信其回答。你必须观察它在许多不同情境下的行为,因为它的“能力”不是一个固定的特征——它是它所知道的内容与你提问方式相结合的产物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →