Can LLMs interpret figurative language as humans do?: surface-level vs representational similarity
尽管大型语言模型在对话的表层解释上与人类保持一致,但在表示层面却存在显著分歧,特别是在处理诸如成语、俚语和讽刺等依赖语境及社会语用学的比喻性语言时,其中 GPT-4 在受测模型中表现出了最接近人类模式的近似程度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何理解人类的笑话、讽刺和俚语。你给它看一个句子:“This food is gas”(这食物绝了),然后问它:“这有趣吗?”或者“这是积极的吗?”
德州农工大学(Texas A&M University)的研究人员进行了一项研究,提出了一个棘手的问题:当机器人给出与人类相同的答案时,它是否真的像人类那样思考?
以下是他们的研究结果,使用了一些日常类比。
实验: “味觉测试”
研究人员设置了一个大规模的味觉测试,但用的不是冰淇淋,而是 240 个不同的句子。这些句子涵盖了六种语言“风味”:
- 常规型 (Conventional): 普通句子(例如:“狗在外面”)。
- 习语型 (Idiomatic): 词义并非字面意思的短语(例如:“Bite the bullet”,意为硬着头皮上)。
- 情感型 (Emotional): 充满情感的句子。
- 幽默型 (Funny): 笑话和双关语。
- 讽刺型 (Sarcastic): 言不由衷。
- Z世代俚语 (Gen Z Slang): 现代网络用语(例如:“This food is gas”)。
他们要求 211 名人类和四种不同的 AI 模型(包括 GPT-4、Llama 和 Mistral)对每一个句子进行 40 个不同问题的评分,例如“这是积极的吗?”或“这令人担忧吗?”,评分范围为 1 到 10 分。
两种比较方式:“得分” vs. “地图”
研究人员从两个截然不同的角度观察了结果:
1. 表面层面的相似性(记分板)
这就像是在看一场足球比赛的最终比分。如果 AI 对一个笑话说“8/10”,而人类也说“8/10”,那么它们看起来就很一致。
- 研究发现: 在这个层面上,AI 模型(尤其是最聪明的那个 GPT-4)看起来非常像人类。对于大多数句子,它们给出的分数与人类非常接近。看起来它们像是站在同一阵营的。
2. 表征相似性(地图)
这是更深层的部分。想象你和朋友都在画一张城市地图。
- 人类的地图: 你知道“披萨店”就在“公园”旁边,而“学校”离“墓地”很远。你的地图是基于你对世界的理解而具有特定结构的。
- AI 的地图: AI 可能也会把“披萨店”和“公园”放在一起,但原因却大不相同。也许它认为两者很近,是因为它们都含有“place”(地方)这个词,而不是因为它们在现实生活中是如何运作的。
研究人员使用了一种叫做表征相似性分析 (Representational Similarity Analysis, RSA) 的数学工具来比较这些地图的“结构”。他们不仅检查分数是否匹配,还检查了句子之间的“关系”是否相同。
大揭秘:“冒充者”效应
以下是他们的发现:
- 表面现象具有欺骗性: AI 模型非常擅长模仿人类的“得分”。如果你问:“这是讽刺吗?”,AI 通常会像人类一样回答“是”。
- 地图却大相径庭: 当研究人员观察底层的“地图”时,发现 AI 和人类其实相距甚远。AI 组织句子意义的方式与人类完全不同。
类比:
把 AI 想象成一只非常出色的鹦鹉。
- 如果你问这只鹦鹉:“这句话有趣吗?”,它可以完美地回答“是”,就像人类一样。
- 但鹦鹉并不真正理解这个笑话。它只是知道当人类听到这种特定的词语模式时,通常会说“是”。
- 然而,人类理解这个笑话,是因为人类理解社会语境、语气以及隐藏的含义。
不同“风味”的研究结果
研究发现,AI 的“鹦鹉技能”在某些类型的语言中表现得更好,而在另一些类型中则较差:
- 情感型与常规型句子: AI 的地图与人类的地图在某种程度上是相似的。判断“我很伤心”是负面的,要比判断“我兴奋得都要给我的植物浇水了”是否有趣要容易得多。
- 习语、讽刺与俚语: 这是 AI 在“地图测试”中失败的地方。
- 习语: 当人类听到“Break a leg”(祝好运)时,知道它的意思是“祝你好运”。AI 经常会在将此正确映射到“好运”的概念时感到困惑,因为它会被“break”(折断)和“leg”(腿)这些字面意思所干扰。
- 讽刺与俚语: 这些高度依赖社会语境和人类共同的经验(如 Z 世代俚语)。AI 在处理这些内容时的内部地图与人类的地图差异巨大。这就像 AI 虽然在说同样的词,但其内在逻辑完全不同。
“大脑袋” vs. “小脑袋”
研究对比了不同的 AI 模型:
- GPT-4: 这是“大脑袋”。它的地图与人类最接近,但仍不是完美的匹配。它是最接近人类的模型,但仍然存在差距。
- 较小的模型 (Llama, Mistral): 它们离人类更远。它们的地图与人类非常不同,尤其是在处理讽刺和俚语等棘手问题时。
核心结论
论文得出结论:仅仅因为 AI 给出了与人类相同的答案,并不意味着它以相同的方式理解语言。
AI 非常擅长模式匹配(模仿记分板),但它缺乏人类所拥有的那种深刻的、社交性的、基于语境的“落地感”(grounding)。它以自己独特的方式组织意义,这在处理简单任务时效果很好,但在面对复杂、充满情感或具有文化特殊性的语言时就会失效。
简而言之:AI 是一个非常出色的演员,它可以说出正确的台词,但它并不一定能感受到台词背后的情感。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。