LLM and Human Modes of Representation
本文探讨了近期关于大语言模型与人类在语言知识和现实世界推理方面如何表征及处理信息的对比研究,强调尽管大语言模型实现了令人印象深刻的流畅度,但它们在处理机制上与人类有所不同,且在学习和泛化能力方面通常效率较低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:“超级学生” vs. “人类大脑”
想象一下,大语言模型(LLMs)就像是一个过度痴迷的学习者,读遍了图书馆里的每一本书。这个学生可以比几乎任何人都更快地背诵事实、撰写论文并解决谜题。但本文认为,这个学生并不像人类那样“理解”世界。他们极其擅长模式匹配(识别数据中熟悉的形状),但在深度推理(弄清楚事情发生的“为什么”或为未知情况做计划)方面往往表现挣扎。
本文对比了人类和这些 AI 模型在两个主要领域的操作方式:语言(我们如何说话和写作)以及推理(我们如何思考和计划)。
第一部分:语言实验室(我们如何说话)
本文测试了三项具体的语言任务,以观察 AI 是否像人类一样思考。
1. “句子味觉测试”(接受度)
任务: 人类被要求评价一个句子的“自然度”。有时句子显得很奇怪是因为上下文的原因(例如,在一段关于汽车的文字后,展示了一个关于猫的句子)。
人类的方式: 人类像是选择性过滤器。如果你给他们看一张海滩的照片,同时让他们判断一个关于数学问题的句子,他们可以轻松忽略海滩图片,只专注于数学。当上下文令人困惑时,他们也倾向于给出“中庸”的分数,从而平滑掉极端情况。
AI 的方式: AI 就像一张撕不掉的便利贴。即使你向它展示一张海滩图片,AI 也会“粘”在图像上,让它影响对数学句子的判断。它无法像人类那样过滤掉视觉噪音。
结果: AI 很好地模仿了人类的分数,但它走的是另一条路径。它会将所有信息(甚至是无关的信息)都留在记忆中,而人类则会主动丢弃不需要的信息。
2. “语法迷宫”(主谓一致)
任务: 你能否分辨出长而复杂的句子中哪个动词与主语匹配?
- 例子: “那把 [那个站在柜子旁边的男人拿着的] 钥匙 [是] 为他的车准备的。”
- 主语是“钥匙”,但中间有很多其他的词。
人类的方式: 人类会感到疲劳。随着句子变得越来越长、越来越纠缠,我们的脑子会变得模糊,从而犯更多错误。这就像试图握住一根又长又重的绳子;中间的结越多,就越难保持两端相连。
AI 的方式: AI 像是一个超强记忆机器人。它不会疲劳。事实上,通过一点点提示(一个小小的推动),AI 解决这些纠缠句子的能力甚至能超过人类。它不会因为中间出现了关于柜子的词就忘记了“钥匙”。
结果: AI 在这些测试中胜出了,但并不是因为它像人类一样理解语法规则。它胜出是因为它拥有一个巨大的“上下文窗口”,可以在不丢失任何信息的情况下同时保留所有的词。
3. “故事讲述者”(生成叙事)
任务: 观察一系列图像并围绕它们写一个故事。
人类的方式: 我们写的的故事是令人惊喜且具有连贯性的。我们以创意的方式连接点滴,保持角色的一致性,我们的故事让人感觉是“原创”的。如果衡量我们词汇的可预测性,我们会表现出相当高的不可预测性(高“困惑度”)。
AI 的方式: AI 写的的故事是流畅且通顺的,但感觉有些“稳妥”。它们就像是由所有写过的故事混合而成的奶昔。它们缺乏让故事显得鲜活的深层、隐藏的联系。AI 的故事非常可预测(低“困惑度”),因为它只是根据其训练数据选择最可能的下一个词。
结果: 人类写出的故事更具原创性和连贯性。AI 写出的故事虽然流畅,但显得有些平庸,缺乏人类故事中的那种“灵气”。
第二部分:推理健身房(我们如何思考)
本文还测试了 AI 是否真的能通过逻辑“思考”问题,还是仅仅在基于模式进行猜测。
1. “侦探”(自然语言推理)
任务: 给定两个句子,根据第一个句子,第二个句子是正确的、错误的还是无关的?
- 前提: “一个男人正在睡觉。”
- 结论: “这个男人正在踢足球。”(错误/矛盾)
人类的方式: 我们使用现实世界的知识。我们知道睡觉和踢足球不能同时发生。我们理解词语的含义。
AI 的方式: 如果问题看起来和它学习过的完全一样,AI 在这方面表现出色。但如果稍微改变措辞,或者询问一个它从未见过的领域(比如特定的医学期刊),AI 的表现就会下降。它就像一只学舌的鹦鹉,听到“睡觉”和“足球”在一起时就会学会说“错误”,但它并不真正理解这些词的意思。
结果: AI 是一个模式匹配器,而不是深度思考者。一旦模式发生变化,它就会失败。
2. “医生”(图像解读)
任务: 查看医学扫描图(如 MRI)并诊断问题。
人类的方式: 医生观察图像,理解解剖结构,并通过症状进行推理。
AI 的方式: AI 通常能得到正确答案,但它并不需要图像。如果只给 AI 症状的文本描述(没有图片),它能得到同样的分数。它就像一个背下了考试题目答案表的学生,并没有真正研读过教科书。它识别的是症状的文本模式,而不是在“看”疾病本身。
结果: AI 是一个强大的文本描述阅读工具,但它并没有进行深层的诊断推理。
3. “规划者”(解决复杂谜题)
任务: 解决困难的数学/逻辑谜题,比如寻找送货卡车的最短路径(旅行商问题)或装载背包问题。
人类的方式: 我们使用逻辑和策略。如果规则稍有变化,我们能够进行调整。
AI 的方式: AI 尝试根据模式来猜测答案。当谜题变大或规则表述方式改变时,AI 的准确率会崩塌。它就像一个只会加法运算的计算器,但只能加它以前见过的数字。如果你问它一种新的数字类型,它就会失效。
结果: AI 擅长于特定的、经过训练的谜题,但它无法泛化到新的、复杂的现实世界问题中,因此它在通用规划方面表现较差。
最终结论
本文得出结论:AI 既不是“随机鹦鹉”(只会机械重复数据的无意识机器),也不是“通用智能”(类人思维者)。
- 它是一个“模式大师”: 它极其擅长捕捉语言和数据中的统计模式。它可以模仿人类的流畅度,甚至在特定的、狭窄的任务(如语法测试)中击败人类。
- 它缺乏“深度理解”: 它不具备人类那种过滤无关信息、理解事物背后“为什么”、以及创造真正原创且连贯叙事的能力。
核心启示: AI 是一个在表面上看起来非常出色的工具,但在底层,它的处理方式与人类完全不同。它并不是像我们一样在“思考”;它是在像一台超级快速的计算器一样计算概率。要让它真正有用,我们需要研究如何让它像人类一样进行推理,而不只是像机器一样预测单词。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。