LLMs Lean on Priors, Not Programming Language Semantics
本文通过引入 PLSemanticsBench 证明了当代大语言模型主要依赖于预训练的词汇关联,而非系统性地根据提供的形式化程序语义进行推理,这一点从它们在面对语义变异、新颖符号和长执行轨迹时表现出的性能剧烈下降中得到了证实。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:大语言模型是在思考,还是在瞎猜?
想象一下,你正在教一名学生玩一种新的棋类游戏。你递给他一本规则手册并说:“在这个游戏中,如果你掷出了 6 点,就要向后移动。”
一个理解规则的聪明学生会立即向后移动。
然而,一个通过玩过成千上万种其他棋类游戏而记住了模式的学生可能会犹豫。他可能会想:“等等,在《大富翁》和《妙妙星球》里,掷出 6 通常意味着向前移动。我就按通常那样向前走吧,因为通常都是这样。”他们是在依赖过去的经验(即他们的“先验知识”),而不是遵循你刚刚给出的特定规则。
这篇论文提出了一个问题:大语言模型(LLMs)表现得像那个遵循新规则的聪明学生,还是像那个忽略新规则、只会记忆模式的学生?
实验:一种“魔法”编程语言
为了测试这一点,研究人员创建了一种特殊的轻量级编程语言,称为 C⋆。你可以把这种语言看作一张白纸。
随后,他们设置了一个棘手的测试,包含三种不同的场景:
- 标准测试(Standard Test): 他们给模型提供代码和常规规则(例如
+表示加法)。这就像是在玩一场正常的国际象棋。 - “交换”测试(KeywordSwap): 他们保持代码外观完全不变,但交换了规则手册中符号的含义。
- 诡计: 他们告诉模型:“在这个版本中,
+符号实际上表示减法。” - 目标: 如果模型真正遵循规则,它应该进行减法运算。如果它是在依赖记忆,它仍然会进行加法,因为它习惯了
+代表加法。
- 诡计: 他们告诉模型:“在这个版本中,
- “外星人”测试(KeywordObf): 他们用奇怪的外星字符(类似于古代遗忘的文字符号)替换了所有熟悉的符号,并给出了一个定义这些外星符号含义的规则手册。
- 目标: 由于模型从未见过这些符号,它必须完全依赖新的规则手册。它无法通过利用对
+通常含义的记忆来“作弊”。
- 目标: 由于模型从未见过这些符号,它必须完全依赖新的规则手册。它无法通过利用对
结果:“模式记忆者”赢了(也输了)
研究人员测试了 11 个目前最顶尖的 AI 模型。结果如下:
1. 当规则正常时:
模型的表现非常出色!它们能以极高的准确率(高达 90%)预测代码的结果。它们看起来像天才。
2. 当规则被交换时(“加”变成了“减”):
模型的表现崩溃了。其准确率下降了 40% 到 60%。
- 类比: 这就像一位做过百万个汉堡的厨师。你告诉他:“今天我们要做一个汉堡,但面包其实是土豆做的。”一个真正的厨师会使用土豆。然而,这些模型仍然试图使用面包,因为它们的脑海中已经形成了“汉堡 = 面包”的深刻印象。它们无法通过覆盖其“肌肉记忆”来遵循你的新指令。
3. 当规则是外星语时(“KeywordObf”):
在这里,模型的表现比交换测试稍好一些,但仍然面临很大困难。它们无法完全信任新的规则手册。
4. 长程任务(复杂的循环):
当代码变得冗长且复杂(就像一个有很多章节和循环的长篇故事)时,几乎所有的模型都失败了。即使是“最聪明”的模型,也只能正确处理大约 35% 的长复杂序列。它们在故事的中途迷失了方向,并忘记了原本应该遵循的规则。
“推理型”模型 vs. “非推理型”模型
研究人员还测试了专门设计用于“逐步思考”(称为推理模型)的模型。
- 好消息: 这些模型比标准模型更擅长遵循新规则。
- 坏消息: 即使是最好的“推理型”模型,在规则被交换时也失败了。它们仍然过度依赖以前见过的内容。它们可以短期内遵循规则,但一旦规则变得古怪或任务变得漫长,它们就会退回到旧有的习惯中。
“思维链”(自言自语)
研究人员尝试了一种叫做“思维链”(Chain of Thought)的技巧,即要求模型在给出答案之前先大声解释自己的思考过程。
- 结果: 这有助于模型在处理正常任务时表现更好。但当规则被交换(例如
+变成减法)时,“大声说话”并没有起到作用。模型仍然会在数学计算上出错,因为它们的内部“肌肉记忆”实在太强大了。
结论
论文得出结论:目前的 AI 模型并不是基于规则进行真正的“推理”。 相反,它们是统计学上的猜测者,高度依赖于它们在训练数据中见过的内容。
- 隐喻: 想象一个背熟了剧本的演员。如果你告诉他:“今天我们要即兴发挥,而且‘你好’这个词的意思其实是‘再见’”,他们很可能还是会说“你好”,因为这是他们习惯说的词。他们并没有真正处理新的含义,而是在背诵记忆中最可能的词汇。
简而言之: 如果你想让 AI 遵循一套全新的严格规则(比如一种新的编程语言或一份新的法律合同),目前的模型是不可靠的。它们很可能会忽略你的新规则,转而去做它们认为你可能想要表达的意思,即基于它们过去训练经验的直觉。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。