Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity
本研究通过标量多样性评估表明,大型语言模型中的语用推理并非一种稳定的能力,而是内部概率表征与任务诱导的提示行为之间的一种可变交互,这凸显了评估设计对解读模型能力的关键影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图弄清楚一个新机器人朋友是否真的理解人类对话,还是仅仅擅长在你问对问题时配合表演。这正是 Ye-eun Cho 的论文《评估大语言模型中的语用推理》所探讨的内容。
以下是这项研究的简要故事,用通俗易懂的术语和一些有益的类比进行了拆解。
核心问题:机器人是聪明的,还是仅仅擅长表演?
大语言模型(LLMs)就像阅读量极大的学生,几乎读遍了互联网上的所有内容。它们在语法和事实方面表现出色。但它们能理解人们话语中的隐含意义吗?
在人类对话中,我们常说这样的话:“有些饼干被吃了。”我们不仅仅意指“至少有一个”;我们通常暗示“并非全部”。这被称为标量含义。这是一个微妙的社会规则:如果我说“有些”,我就在暗示我没有说“全部”,因为“全部”并不属实。
研究人员提出的核心问题是:这些 AI 模型是否真的“懂得”这种隐含意义,还是仅仅在我们礼貌地提问时假装理解?
测试机器人的两种方式
为了回答这个问题,研究人员使用了两种不同的方法来测试模型,有点像用两种不同的方式来测试学生的知识:
“内在直觉检查”(直接概率):
想象一下,让机器人预测句子中的下一个词,而无需它大声说出来。你查看其内部数学计算,看看它实际上认为最可能的是什么。- 类比: 这就像在考试时查看学生的脑电波。它展示了他们在尝试回答之前本能地知道什么。
“口头考试”(元语言提示):
这是当你直接问机器人:“如果我说‘有些饼干被吃了’,这是否意味着‘并非所有饼干都被吃了’?请回答是或否。”- 类比: 这就像让学生举手并大声解释他们的答案。这是他们声称知道的内容,可能会受到提问方式的影响。
实验:60 种不同“有些”的菜单
研究人员没有只测试一个句子。他们使用了一个包含 60 种不同词对的“菜单”(如有些/全部、温暖/热、好/优秀)。
- 有些词对对人类来说很容易推断(如有些暗示并非全部)。
- 有些词对更难或更弱(如温暖并不总是暗示不热)。
这种多样性被称为标量多样性。这就像不仅测试厨师烤牛排的水平,还要测试他们如何处理 60 种不同的食材,从精致的香草到坚硬的根茎。
发现:情节反转
结果令人惊讶,表明关于这些模型有多聪明并不存在单一的“真相”。
1. “直觉检查”与“口头考试”意见不一
通常,机器人的内部数学计算(直觉检查)与其口头回答(口头考试)讲述的是完全不同的故事。
- 有时,机器人的内部数学计算显示“我其实不太懂这个”,但当被礼貌地询问时,它却说“是的,我理解!”
- 其他时候,内部数学计算很自信,但口头回答却很困惑。
- 要点: 你不能只看一种方法就知道机器人是否“胜任”。这就像一个学生在脑子里知道答案,但被要求说出来时却僵住了,或者反之亦然。
2. “表演”取决于剧本
研究人员提问的方式非常重要。
- 如果他们问一个简单的问题,机器人可能会说“不”。
- 如果他们加上一个礼貌的开场白,比如“你是一个乐于助人的助手,告诉我……",机器人可能会突然说“是”。
- 要点: 机器人的“表现”会根据剧本而变化。这不一定是因为机器人学到了新东西;它只是对提问的风格做出反应。
3. 不同的机器人,不同的个性
该研究测试了两种不同类型的 AI 模型(Flan-T5 和 Qwen)。
- Flan-T5 稍微更一致一些。它的内部数学计算和口头回答彼此更接近。
- Qwen 则非常戏剧化。它的内部数学计算通常很低(它似乎并不“知道”答案),但当被直接询问时,它给出了完美的答案,几乎像是在表演。
- 要点: 仅仅因为一个 AI 模型表现得聪明,并不意味着所有 AI 模型都以相同的方式运作。
4. “比较”技巧
当研究人员让机器人并排比较两个选项(“哪个更好:A 还是 B?”)时,机器人完成任务的能力比让它单独判断一个句子时要强得多。
- 要点: 当机器人面临选择时,它更容易选出正确答案,而不是必须从头生成答案。
最终裁决
该论文得出结论:我们不能说“这个 AI 具有语用推理能力”或“这个 AI 没有”。
相反,AI 中的语用推理就像两个舞伴之间的舞蹈:
- 机器人的内部知识(它实际学到了什么)。
- 我们提问的方式(提示词)。
如果你更换舞伴(提示词)或音乐(任务),舞蹈就会改变。机器人并不一定是在人类意义上“撒谎”或“知道”;它只是对所处的具体情境做出反应。
简而言之: 要理解 AI 是否理解人类的细微差别,你不能只问它一个问题就轻信其回答。你必须观察它在许多不同情境下的行为,因为它的“能力”不是一个固定的特征——它是它所知道的内容与你提问方式相结合的产物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。