← 最新论文
💬 NLP

Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models

这项研究表明,虽然双向 BERT 模型在对称逻辑演绎方面免疫于阻碍自回归 GPT 模型的“反转诅咒”,但两种架构在复杂的集合推理方面都表现挣扎,这表明模型选择应当根据生物医学知识图谱构建等任务的具体逻辑需求进行定制。

原作者: Da Wu, Jingye Yang, Kai Wang

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Da Wu, Jingye Yang, Kai Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

聪明的小机器人与镜像迷宫

想象一下,你正在教一个机器人理解世界。你给它看一张猫的照片,并说:“这是猫。”随后,你给它看“猫”这个词,并问:“哪个图片与此对应?”人类的大脑可以毫不费力地完成这种切换;我们知道如果“猫”等于“图片”,那么“图片”就等于“猫”。但长期以来,那些最先进的计算机大脑——即大型语言模型(LLMs)——却在处理这种简单的翻转时表现挣扎。它们就像是那些背下了答案列表,但一旦你把问题倒过来问,它们就不知道该如何回答的学生。这种特定的故障被称为“逆转诅咒”(Reversal Curse)。

为了理解为什么这很重要,可以将这些 AI 模型想象成两种不同类型的读者。一种是解码器(Decoder,例如著名的 GPT 系列),它从左到右阅读故事,仅根据之前出现的内容来预测下一个词。它擅长写故事或完成句子,但它无法向前窥探以看到全貌。另一种是编码器(Encoder,例如 BERT),它一次性阅读整个句子,同时观察每个词与其它所有词之间的关系。这就像是用放大镜阅读句子,能同时看到每个词的上下文背景。科学家们一直在思考:如果我们教这些机器人进行基础的集合运算——比如合并朋友名单或寻找他们的共同好友——它们是真的能通过逻辑进行“思考”,还是仅仅根据以前见过的模式在进行猜测?这个问题至关重要,因为如果我们想利用这些机器人来构建复杂的知识图谱(例如用于医学或科学领域),它们需要具备推理能力,而不仅仅是重复。

论文的故事:谁能扭转局面?

在这项研究中,研究人员 Da Wu、Jingye Yang 和 Kai Wang 决定对这些不同的机器人大脑进行测试。他们想看看“逆转诅咒”是一个永久性的漏洞,还是仅仅是某些模型构建方式带来的特性,以及这些模型是否真的能处理涉及项目集合的更复杂的逻辑谜题。

镜像测试:逆转诅咒
首先,他们处理了“逆转诅咒”。想象一下,你教机器人“吉米·卡特是第39任总统”。如果你问机器人“谁是第39任总统?”,一个标准的机器人(如 GPT-3)通常会卡壳。它知道这个事实的正向信息,但无法将其翻转过来回答反向问题。研究人员发现,解码器模型(如 GPT 和 Llama)确实深受这种诅咒之苦;它们很难从“A 是 B”推导出“B 是 A”。

然而,编码器模型(BERT)的情况则大不相同。因为 BERT 是双向同时阅读的,所以它不会感到困惑。当研究人员询问 BERT 反向问题时,它的回答正确率高达 99%。事实证明,如果你希望机器人理解一段关系是双向通用的,你需要一个能够观察全局的大脑,而不仅仅是关注过去。

逻辑谜题:混合与匹配集合
接下来,团队转向了一个更难的挑战:集合运算。他们教机器人执行“并集”(将两个朋友列表合并为一个大列表)和“交集”(寻找同时出现在两个列表中的朋友)。

  • 简单级别(两个集合): 当机器人被要求组合或比较仅有的两个名称组(如“超级英雄”和“恐龙”)时,解码器模型(Llama 2 和 3)和编码器模型(BERT)都表现得非常出色。它们几乎每次都能给出正确答案。看起来它们已经掌握了逻辑。
  • 困难级别(三个集合): 随后,研究人员增加了谜题的难度。他们要求机器人同时处理三个组,或者进行混合运算,例如“找出 A 组和 B 组的共同朋友,然后加上 C 组”。

就在这里,魔术表演破功了。虽然机器人在处理简单的两组任务时表现出色,但在涉及三个组时却表现得很糟糕。

  • BERT 的问题: BERT 模型似乎在“作弊”。它并没有真正进行数学计算,而只是在寻找它认识的单词。如果句子中出现了一个它从未见过的名字,它会立即判定“错误”。但如果错误的答案使用了它认识的名字,它就会感到困惑并判定“正确”。它是在记忆词汇,而不是理解逻辑。
  • Llama 的问题: Llama 模型(即解码器模型)也遇到了困难。当被要求寻找三个组中的共同朋友时,它们经常只是列出它们所知道的所有名字,而忽略了谜题的具体规则。它们似乎是在回忆训练期间见过的名字列表,而不是在计算正确的交集。

GPT-4 这个变数
研究人员还测试了最新的闭源模型 GPT-4。这个机器人比其他模型要好得多。它可以正确处理大多数三集合逻辑谜题,通常会将问题分解为较小的步骤来解决。然而,即使是 GPT-4,在集合数量过多(如七个或八个集合)时也会开始出错,这表明即使是最聪明的现有模型,在处理复杂的、多步骤的演绎时也是有极限的。

核心启示

这篇论文的主要教训是,并非所有的 AI 大脑都是以同样的方式构建的,也没有哪种机器人是完美的。如果你需要一个模型来理解反向的关系(例如翻转一个事实),双向模型(如 BERT)是明显的赢家。但如果你需要一个模型来写故事或预测句子中的下一个词,单向模型(如 GPT)仍然是王者。

最重要的是,这项研究表明,虽然这些模型在识别模式和模仿人类语言方面非常出色,但它们并不一定在以人类的方式进行“思考”。当逻辑变得过于复杂时,它们往往会退回到记忆单词而非理解规则的状态。因此,如果你正在构建一个用于创建医学知识图谱或解决难题数学证明的系统,你不能仅仅指望机器人自己去搞定;你必须非常谨慎地设计提问方式,并选择适合工作的机器人类型。机器人正在变得越来越聪明,但它们在真正的逻辑推理方面仍有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →