Tracing the ongoing emergence of human-like reasoning in Large Language Models
本文揭示,尽管大语言模型在语义逻辑方面表现出高准确率,但它们通常无法复现人类那种能够根据语境丰富条件语句含义的语用推理能力,而无论模型架构或训练导向如何,这种能力仍属于新兴能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人理解人类的对话。你想知道这个机器人仅仅是一本超快的字典,只知道单词的定义,还是它真正学会了人类实际交谈和思考的“不成文规则”。
这篇论文就像是一份针对 25 种不同人工智能模型(大型语言模型,或称 LLM)的“成绩单”,测试的是它们具备人类式推理能力的情况。以下是研究发现的简要说明,使用了简单的类比。
测试:“如果”游戏
研究人员使用了一个涉及“如果”句子的经典逻辑谜题。在人类对话中,“如果”句子根据情境不同,可能意味着两种截然不同的含义。
- “交易”(标准条件句):
- 例子: “如果你割草,我就给你 50 美元。”
- 人类逻辑: 我们将其理解为严格的交易。只有你割了草,你才能得到钱。如果你没割,你就拿不到钱。我们添加了一条隐含规则:“不割草 = 没钱”。
- “提醒”(饼干条件句):
- 例子: “如果你饿了,烤箱里有披萨。”
- 人类逻辑: 我们将其理解为一条有用的提示。无论你是否饿,披萨都在那里。“如果”并不是披萨存在的条件;它只是用来确认你是否需要它的一种方式。
挑战: 研究人员要求人类和 AI 模型判断在棘手情境下,句子的后半部分(结果)是否为真。
- 情境: 你没割草。你拿到钱了吗?(人类会说“没有”,因为这是交易)。
- 情境: 你不饿。烤箱里有披萨吗?(人类会说“有”,因为披萨反正都在那里)。
结果:“字面派”与“灵活派”
研究发现,人类和 AI 在处理这些测试时存在明显的分歧。
1. 人类是“语境侦探”
人类擅长读字里行间的意思。我们知道关于割草的承诺是一项严格交易,而关于披萨的评论只是一个有用的事实。我们会根据情境自动调整理解。
2. AI 模型是“字面机器人”
AI 模型通常未能像人类侦探那样行事。它们陷入了两个主要陷阱:
- 陷阱 A:“严格会计”
一些模型表现得像僵化的计算机程序。它们看到句子“如果你割草,我就付钱”,然后说:“好吧,从逻辑上讲,如果你没割草,这句话在技术上仍然是真的,因为条件未满足。”它们忽略了隐含的交易。它们过于专注于严格逻辑,而忽视了人类含义。 - 陷阱 B:“过度修正者”
其他模型试图表现得过于聪明。它们决定所有“如果”句子都是严格交易。因此,当它们听到“如果你饿了,烤箱里有披萨”时,它们会想:“啊,所以如果你不饿,就没有披萨。”它们将“割草”规则套用到了披萨句子上,这是错误的。
核心结论: AI 模型非常擅长掌握“如果”的字典定义(逻辑),但在理解社会语境(语用学)方面却表现糟糕。它们就像背熟了剧本却不懂角色情感的演员。
AI 的“类型”重要吗?
研究人员想知道 AI 的“个性”或“架构”是否会改变结果。他们检查了:
- 开源与闭源: 拥有公开代码的模型(开源)是否比保密的模型(闭源)表现更好?没有。
- 专用与通用: 专为“推理”构建的模型是否比通用聊天机器人表现更好?没有。
- 架构: 具有特定内部设计(混合专家模型)的模型是否比标准模型表现更好?没有。
这就像测试不同品牌的汽车,看哪一款在冰面上开得更好。令人惊讶的是,无论是法拉利还是丰田,它们都以同样的方式打滑。理解这些“不成文规则”的能力,并不是仅仅因为模型更大或更复杂就自动获得的。它似乎是一种特定的、涌现的技能,某些模型碰巧拥有,而另一些则没有,但你无法仅通过查看模型规格来预测这一点。
“去语境化偏差”
作者将这个问题称为“去语境化偏差”。
想象一个学生,他在练习册上做数学题很出色,但当你让他用数学和朋友们分摊晚餐账单时,他却失败了。AI 就是那个懂数学(逻辑)但没学会如何将其应用于现实生活(语境)的学生。由于 AI 是在文本上训练的,却并不真正生活在现实世界中,它难以理解有时“如果”意味着交易,而有时它只是意味着“顺便提一下”。
总结
- 人类自然地切换于严格逻辑与社会语境之间。
- AI 倾向于固守一条僵硬的规则(要么总是严格,要么总是宽松),而忽略了细微差别。
- 原因: 这与模型的规模或是否“开源”无关。而是目前 AI 缺乏那种帮助人类区分承诺与建议的“现实世界根基”。
该论文得出结论:虽然 AI 在逻辑方面正在变得更好,但这种“类人”的察言观色和理解隐含意义的能力,仍然处于发展阶段。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。