Language Models Need Sleep
本文提出了一种面向大语言模型的类睡眠巩固机制,该机制在离线循环过程中定期将近期上下文转化为持久化的快速权重,从而克服注意力扩展的限制,在保持推理延迟的同时显著提升长程任务和深度推理任务的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一位才华横溢的学生正在参加一场非常漫长且复杂的考试。这位学生拥有一种超能力:能够阅读海量的信息。然而,他们有一条严格的规定:在任何时刻,他们只能在“活跃”工作记忆(就像一张便利贴)中保留少量事实。一旦这张便利贴被填满,他们就必须将其擦除,以便为新的事实腾出空间。
问题在于,一旦事实从便利贴上被擦除,普通学生(或标准人工智能)会立即遗忘它们。如果考试要求将测试开头的一个事实与结尾的一个事实联系起来回答问题,学生就会失败,因为第一个事实已经消失了。
本文提出了一种名为"LLM 睡眠”的解决方案。
以下是其工作原理,使用简单的类比来说明:
问题:“即擦即净”的便利贴
当前的 AI 模型(Transformer)擅长回顾最近的文本,但随着文本变长,它们不得不丢弃旧信息以节省空间。这就像一位图书管理员,桌面上只能放 50 本书。一旦第 51 本书到来,他们就必须把第一本书扔进垃圾桶以腾出空间。
如果有人问这位图书管理员:“第一本书里的第一个词是什么?”他们无法回答,因为那本书已经不见了。即使他们拥有“快速记忆”(比如心念),他们也往往无法进行深度思考,以利用那些被丢弃的信息来解决复杂的谜题。
解决方案:“夜间学习”环节
作者建议,当图书管理员的桌面被填满时,不要只是把书扔掉,而是应该进行“睡眠”(暂停行动)。
在“睡眠”期间:
- 没有新书到来:图书管理员停止阅读新的输入。
- 深度复习:图书管理员将桌面上现有的书籍在脑海中反复回顾(递归地)。
- 重写大脑:图书管理员不只是看书,而是利用这段时间重写自己的“内部百科全书”(模型的权重)。他们将从这些书中提炼出的最重要教训转化为长期记忆。
- 清空桌面:一旦内部百科全书更新了新知识,图书管理员就会擦净桌面,准备迎接下一批书籍。
当考试稍后到来时,图书管理员不需要查看桌面上的旧书(因为它们已经不见了)。相反,他们只需打开自己的内部百科全书,其中现在包含了那些旧书的提炼智慧,从而立即回答问题。
为什么“睡眠”有帮助
论文表明,模型花费在“睡眠”(复习并重写其内部百科全书)上的时间越多,它解决难题的能力就越强。
- 简单任务:如果问题很简单(例如“第一个词是什么?”),只需快速一瞥就足够了。
- 困难任务:如果问题很难(例如“如果你沿着这条逻辑路径回溯 10 步,最终会到达哪里?”),模型需要进行深度的心理运算。标准模型试图一次性完成所有运算,结果却失败了。而“睡眠”过的模型则在考试开始前获得了额外的时间来完成这些运算,因此当需要时,它能立即回答困难的问题。
结果
研究人员在三种类型的挑战中测试了这种方法:
- 元胞自动机(“生命游戏”):这是一个需要预测模式在多个步骤中如何变化的谜题。“睡眠”过的模型在预测它们已经“遗忘”的模式的未来步骤方面表现得更好。
- 图检索(“地图”):这是一项需要在错综复杂的连接迷宫中寻找路径的任务。睡眠过的模型能够比非睡眠模型更深入地穿越迷宫。
- 数学问题:在真实的数学应用题中,睡眠时间更长的模型在解决需要多步计算的问题时表现显著更好,即使问题文本过长,无法完全容纳在其活跃记忆中。
权衡
论文指出,这种“睡眠”并不会让模型在“考试”期间(推理阶段)变慢。模型仍然能立即回答问题。“代价”是在训练阶段(模型学习时)支付的。模型必须花费额外的时间“睡眠”和学习,以构建强大的内部百科全书。但回报是,模型能够对那些它无法直接看到的信息进行更深层的推理。
简而言之:这篇论文教导 AI 模型停止试图在一张便利贴上记住所有事情。相反,当便利贴填满时,它们会小睡片刻,将重要信息转移到大脑中,从而使它们能够在稍后解决难题,而无需再次查看原始笔记。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。