Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs
本文通过控制词汇重叠、预训练知识和命名实体,研究了 LLaMA 2 和 Flan-T5 是展现了真正的传递推理能力,还是依赖于表层线索,结果表明虽然两种模型都利用了词汇重叠,但 Flan-T5 在应对基于知识的操控时表现出更强的韧性,这暗示了微调在培养逻辑理解方面可能发挥的作用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的领域中,一种被称为“大语言模型”的特定类型计算机程序吸引了全世界的目光。这些系统通过在互联网海量的文本数据上进行训练,能够撰写故事、翻译语言并回答复杂的问题。对于研究这些机器的科学家来说,一个核心问题是:它们是真的理解逻辑,还是仅仅在模仿之前见过的模式?为了测试这一点,研究人员观察了一项被称为“传递性推理”(transitive reasoning)的基础技能。用通俗的话说,这就是将两个独立的信息片段连接起来以得出新结论的能力。例如,如果一个人知道猫是一种动物,并且所有动物都需要食物,那么他们就可以逻辑地推导出猫需要食物,而无需被明确告知这一特定事实。这个过程不仅仅需要记忆,它还需要将事实编织在一起的能力。驱动近期研究的问题是:这些强大的计算机程序是在进行这种“思维编织”,还是通过识别熟悉的词汇并猜测答案来走捷径。
来自赫里奥特-瓦特大学(Heriot-Watt University)和爱丁堡大学的一个研究小组着手调查这一问题。他们专注于两种不同类型的语言模型,一个被称为 LLaMA 2,另一个被称为 Flan-T5,以观察它们如何处理需要连接两个事实的问题。科学家们使用了两个现有的问题集来测试这种思维能力。其中一个被称为 QASC 的集合提出了关于科学的多项选择题,这些题目需要结合两个陈述来找到正确答案。另一个被称为 Bamboogle 的集合包含了一些足够棘手的问题,以至于标准的互联网搜索引擎可能会出错,从而迫使模型依赖自身的处理能力。研究人员想知道,这些模型是在真正进行逻辑推理,还是仅仅在捕捉特定的词汇,比如出现在问题和答案中共同出现的日期或名称。
为了寻找真相,该团队设计了一系列巧妙的实验,系统地改变了提供给模型的各种信息。他们首先检查了在给出事实以及一个清晰的连接示例的情况下,模型是否能够解决问题。在这两种条件下,两个模型都表现良好,但研究人员怀疑这可能太容易了。随后,他们移除了展示如何连接事实的示例,让模型在没有引导的情况下自行解决。结果是具有启发性的。经过专门针对类似推理任务进行训练的 Flan-T5 模型,即使在没有示例的情况下也继续表现得非常好。然而,LLaMA 2 模型在失去这种引导后表现得非常吃力,这表明它在能够遵循某种推理模式之前,高度依赖于看到该模式的出现。
随后,研究人员采取了一种更激进的方法,以观察模型是否真正理解词汇的含义。他们打乱了事实中单词的顺序,将清晰的句子变成了杂乱无章、毫无意义的文本字符串。如果模型是真的在对含义进行推理,那么这种混乱应该会让寻找答案变得不可能。令人惊讶的是,模型的表现几乎没有下降。即使在句子不符合语法逻辑的情况下,它们仍然能够选出正确答案。这表明模型并不是将句子作为连贯的思想来阅读。相反,它们很可能是在扫描与答案相匹配的特定关键词。当研究人员完全移除这些匹配的关键词时,模型的准确率骤降,证实了它们通常只是在匹配单词,而不是进行逻辑推导。
为了排除模型仅仅是从其训练数据中记忆答案的可能性,团队转向了包含模型从未见过的问题的 Bamboogle 数据集。在这里,他们引入了最后一项严苛的测试。他们将人名、地名和日期——即那些经常出现在答案中的特定实体——替换成了无意义的词汇。他们还打乱了事实中单词的顺序。当面对这些由乱码组成的版本时,LLaMA 2 模型几乎完全失败了。如果没有熟悉的名称和日期来引导,它无法找到答案。然而,Flan-T5 模型展现出了不同类型的韧性。虽然它的表现有所下降,但仍显著优于另一个模型。这表明,由于 Flan-T5 经过了专门的推理任务训练,它发展出了一种更稳健的遵循逻辑链条的能力,即使在熟悉的线索被剥离时也是如此。
这项研究得出结论:虽然大语言模型看起来可以进行推理,但它们的成功往往取决于它们被训练的具体方式以及文本中可用的线索。对于那些没有经过专门推理任务微调的模型来说,回答复杂问题的能力似乎高度依赖于识别熟悉的单词和模式,而非真正的逻辑演绎。即使它们看起来在进行逐步思考,也可能只是在寻找正确的关键词。然而,研究表明,当一个模型经过精心训练,使用旨在教导它如何连接事实的数据集时,它可以发展出一种更真实的传递性推理能力。这种能力使其即使在通常的捷径(如可识别的姓名或日期)被移除时,也能处理复杂问题。这些发现提醒人们,推理测试的高分并不总是证明机器理解了逻辑;有时,它只是非常擅长寻找正确的词汇。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。