Unlocking the Working Memory of Large Language Models for Latent Reasoning
本文介绍了记忆推理(RiM),这是一种计算高效的潜在推理方法,它用固定的记忆块替代自回归思维生成,使大语言模型能够利用工作记忆进行内部推理,而无需将中间步骤外化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《解锁大语言模型的工作记忆以进行潜在推理》(RiM)的解释,已用通俗易懂的语言并辅以生动的类比进行翻译。
核心问题:“大声思考”太慢了
想象一下,你正在尝试解决一道复杂的数学题。目前,大多数人工智能模型(大语言模型)被迫进行“大声思考”。为了解决问题,它们必须在给出最终答案之前,用完整的句子写下思维过程的每一个步骤。
- 类比:这就像一名参加考试的学生,被要求写出一篇完整的文章,解释他们进行的每一次计算,然后才能写下最终数字。
- 问题所在:这效率很低。人工智能花费大量时间和计算资源来生成文字(语法、标点、连接词),仅仅是为了到达逻辑核心。这就像开车时,每遇到一个红灯,都必须停下来写一首关于红色的诗,然后才能继续行驶。
人类的解决方案:“内部草稿纸”
人类通常不会这样做。当我们解决难题时,我们会使用工作记忆。我们在脑海中保留数字和逻辑,在内部进行操纵,只说出最终结果。我们不需要把每一步都大声说出来就能做数学题。
这篇论文认为,人工智能也应该能做到同样的事情:拥有一个内部工作空间,可以在其中进行繁重的思考工作,而无需“说出”这些想法。
新方法:内存推理(RiM)
作者们提出了一种名为内存推理(RiM)的方法。他们不再让人工智能生成文字来表达其想法,而是给它一组固定的“记忆块”。
- 类比:想象人工智能得到了一组空白的、神奇的便利贴(即记忆块),直接放在问题旁边。
- 旧方法:人工智能在一张纸上写一个长故事来解决这个问题。
- RiM 方法:人工智能直接将想法写在便利贴上。这些便签很特别;它们不是用来阅读的文字,而是承载着想法的含义。
- 神奇之处:因为这些便签是预先放置且固定的,人工智能可以一次性查看所有便签并处理信息(在单次“前向传播”中),而不是逐个书写。
如何教导人工智能使用它(两阶段训练)
你不能只是给人工智能一本空白笔记本,就指望它知道如何使用。作者们采用了一个两步训练课程,就像教孩子骑自行车时先装辅助轮,然后再拆掉一样。
第一阶段:“辅助轮”阶段
- 目标:教导人工智能,记忆块是用于思考的。
- 运作方式:向人工智能展示问题和记忆块。在每个记忆块之后,老师会问:“推理的下一步是什么?”人工智能必须利用记忆块中的信息来预测下一个书面步骤。
- 结果:人工智能学会了将“想法”存储在记忆块中,因为它知道会立即接受测试。它学会了将这些块转化为一个可工作的空间。
第二阶段:“现实世界”阶段
- 目标:教导人工智能仅使用这些块来解决整个问题。
- 运作方式:老师不再要求中间步骤。现在,在每个记忆块之后,人工智能被问:“最终答案是什么?”
- 结果:人工智能学会了在填满更多记忆块时完善其答案。它停止“大声思考”,开始“在记忆中思考”,利用这些块在每一步都更接近正确答案。
结果:更快且更聪明
该论文使用不同规模的人工智能模型在数学问题(GSM8K 和 GSM-Hard)上测试了这种方法。
- 速度:由于人工智能无需为想法生成文字,因此速度快得多。它一次性处理记忆块。论文指出,RiM 比之前最好的“静默思考”方法快约7 倍,比写出完整推理链的方法快27 倍。
- 准确性:尽管速度更快,但人工智能的得分优于或等于那些写出想法的方法。这证明了人工智能成功学会了将记忆块作为真正的工作空间使用。
- 效率:由于跳过了思考中的“打字”部分,它使用的计算资源更少。
总结
这篇论文提出了一种方法,通过给人工智能固定的记忆块,而不是强迫它写出想法,使其能够“静默思考”。通过分两个阶段训练人工智能(首先使用这些块进行步骤推理,然后使用它们得出最终答案),他们创造了一个系统,其智能程度与当前模型相当,但速度显著更快、效率更高,模仿了人类如何利用工作记忆解决问题,而无需将每个想法都大声说出来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。