想象一下,你有一个才华横溢、超级聪明的学生(一个大型语言模型),他非常擅长解决数学问题。然而,这个学生有一个奇怪的怪癖:他完全不记得自己刚刚学到了什么。
每当你给他一个新问题时,他都会从零开始。即使他思考了几个小时,犯了错,又自我纠正,最后找到了正确答案,一旦他交出解题过程,那整个“思考过程”就会消失。他并不会因为下一个问题而变得更聪明。他就像一个天才,在交作业的一瞬间就忘掉了自己的学习内容。
这篇论文介绍了一个名为 ELM(经验潜记忆,Experiential Latent Memory) 的系统来解决这个问题。这是一种让 AI 记录自己思考过程的方法,使其能够随着时间的推移而变得更好,而无需老师来批改他的作业。
以下是该系统的运作方式,通过简单的概念进行拆解:
1. 问题所在:为什么“读笔记”行不通
研究人员首先尝试了一种简单的方法:上下文学习(In-Context Learning, ICL)。
- 类比: 想象这个学生试图通过阅读自己之前思考过程的转录文本来学习。“上次我解一道几何题时,我写道:‘第一步:寻找角度。第二步:使用公式。’”
- 结果: 这并不奏效。论文发现,仅仅阅读解题过程的“文本”就像是在没有实际下厨的情况下只看食谱。它错失了在模型大脑内部发生的实际思考过程中的“风味”——那些死胡同、信心水平以及从未转化为文字的隐藏逻辑。这种方式太浅显了,无法对付新的、棘手的难题。
2. 解决方案:“闪卡”系统
研究人员并没有让 AI 写下整个故事,而是创建了一个系统,让 AI 为它解决的每个问题制作微小的、不可见的“闪卡”。
- 流程:
- 测试: AI 尝试解决一个数学问题。
- 自检: 由于没有老师,AI 会针对同一个问题生成许多个不同的答案。然后它会观察这些答案并说:“好吧,10 个答案中有 7 个说答案是 42。所以,42 可能是正确的。”这被称为多数投票法(Majority Voting)。它充当了一个自我评分系统。
- 学习: AI 将那个特定的问题及其自我评分后的答案进行训练,生成一张微小的、轻量级的“闪卡”(称为“软提示”,Soft Prompt)。
- 存储: 这张闪卡被存储在一个“记忆池”中。它极其微小(仅为模型大小的 0.001%),因此不会拖慢运行速度。
3. 使用闪卡: “图书管理员”
当一个新的数学问题进来时,系统就像一个图书管理员一样运作:
- 搜索: 它查看新问题并询问:“我们的记忆池里是否有与此类似的闪卡?”
- 检索: 如果它找到了匹配项,它就会取出那张微小的闪卡并将其附加到新问题上。
- 双重检查: AI 会解决两次问题:一次是没有闪卡的情况下(零样本/Zero-Shot),另一次是带有闪卡的情况下。
- 判定: 一个“验证器”(安全卫士)会比较这两个答案。如果带闪卡的版本更好,系统就采用它。如果闪卡让情况变糟了(因为有时自我评分也会出错),验证器会选择原始答案。
4. 为什么这意义重大
- 不会遗忘: 因为 AI 不会重写它的整个大脑(这会导致它忘记旧技能),它只是添加这些微小的、孤立的闪卡。这就像是在不擦除旧章节的情况下,为一本书增加了一个新章节。
- 高效性: 它不需要超级计算机来学习。它可以边学边用,一次处理一个问题,且仅需极少的步骤。
- 优于离线训练: 令人惊讶的是,论文发现,使用这种方法一次学习一个问题,往往比在包含数千个问题的庞大数据集上对整个模型进行大规模训练的效果还要好。看起来,当 AI 专注于每一个具体的经验时,它能更好地掌握推理的“本质”。
总结
可以将 ELM 想象成给一个健忘的天才配备了一个个性化的、自动更新的口袋笔记本。
- 它不是写下问题的整个故事,而是根据所学内容写下一个微小的、不可见的“提示”。
- 它会检查自己的工作,以确保提示是有用的。
- 当新问题到来时,它会检查笔记本中是否有类似的提示。
- 如果提示有帮助,它就使用它;如果提示有害,它就忽略它。
其结果是,一个系统在每次解决问题时都会变得更加聪明,将自己的“思考时间”转化为永久的、可重复使用的知识,而无需任何人类教师。
技术摘要:基于轻量化经验性潜空间记忆的持续自我改进
问题陈述
大型语言模型(LLMs)目前通过扩展推理时计算(例如,思维链、扩展思考)实现了强大的推理能力。然而,这些模型在部署后在本质上是无状态的。它们会丢弃推理过程中生成的丰富且自产的推理轨迹,从而无法积累经验,也无法将计算量转化为可用于未来问题的可复用知识。
现有的解决办法面临显著局限性:
- 无需训练的上下文学习(ICL): 存储原始文本推理轨迹的方法面临“文本瓶颈”。它们存储的是表层输出,而非底层的推理结构或中间状态,导致泛化能力浅薄,且难以在不同任务间有效迁移。
- 离线强化学习(RL): 虽然使用内部奖励(如多数投票法)的无监督强化学习方法展现出潜力,但它们通常运行在离线机制下,需要预先获取完整的测试数据集。此外,它们依赖于全模型更新,这会带来灾难性遗忘、优化不稳定风险,并且随着测试时数据的累积,由于相互干扰的自我监督信号,其扩展性较差。
核心挑战在于实现真正的在线持续自我改进,即让 LLM 在没有外部监督、没有预先访问未来数据、且不遗忘其初始能力的情况下,从流式输入的单个问题中不断学习。
方法论:经验性潜空间记忆 (ELM)
作者提出了 ELM,一种将推理时计算蒸馏为紧凑、模块化潜空间记忆的在线方法。该方法由三个主要部分组成:
1. 记忆创建(逐样本学习)
系统并不更新主模型,而是为遇到的每个问题学习一个轻量级的、特定于实例的记忆。
- 内部奖励信号: 在缺乏地面真值标签的情况下,模型针对给定输入生成多个候选响应(N)。通过多数投票法得出共识答案,将其作为代理标签。
- 训练目标: 模型使用**组相对策略优化(GRPO)**进行训练。优势函数通过在采样输出组内相对于共识答案进行归一化来计算。
- 参数化: 记忆被参数化为一个软提示(Soft Prompt)(即附加在输入前的可训练连续向量序列)。
- 效率: 这些软提示仅占总模型参数的约 ∼0.001%。
- 隔离性: 基础模型保持冻结。每个记忆都使用内部奖励信号独立训练若干梯度步数(例如 10 步)。这种模块化设计防止了样本间的干扰,并避免了灾难性遗忘。
2. 记忆检索
当新的测试样本到达时,系统会从记忆池中检索最相关的记忆。
- 键(Key)的构建: 键可以从软提示嵌入(输入检索)或通过对模型内部键值(KV)投影的激活进行池化(KV 检索)中导出。
- 匹配: 通过计算新输入的查询向量与存储的记忆键之间的余弦相似度来进行检索。
3. 响应路由(验证)
由于记忆是通过自我监督学习的,它们可能存在噪声,偶尔会导致性能下降(将正确的零样本答案变为错误的答案)。
- 双重生成: 对于给定的输入,系统同时生成零样本响应和记忆增强响应。
- 验证: 如果两者一致,则返回该答案。如果两者不一致,则由验证器(过程奖励模型)选择得分较高的响应。这种路由机制确保了可靠性,并减轻了记忆导致的性能退化。
核心贡献
- 潜空间经验性记忆: 引入了一种直接从测试时计算中学习模块化、实例级潜空间表示(软提示)的方法,捕捉的是抽象的推理结构而非表层文本。
- 在线持续协议: 一个严格的在线框架,使模型能够随着经验的积累而持续改进,无需预先访问完整数据集或外部标签。
- 高效性与模块化: 通过将经验隔离在轻量级单元中(∼0.001% 参数),实现了稳定的学习,避免了全模型更新或灾难性遗忘。
- 实证验证: 证明了利用内部奖励从单个样本进行学习可以产生足以媲美甚至超越全数据集离线训练的泛化收益。
实验结果
作者在具有挑战性的数学推理基准测试(MATH500、AMC23、AIME24)上使用 Llama-3.1-8B-Instruct 和 Qwen2.5-Math-7B 对 ELM 进行了评估。
- 性能对比基线:
- ELM 显著优于零样本和原始数据 ICL 基线。
- 在 MATH500 上,ELM(完全在线训练,无预先数据集访问)超越了全数据集离线 GRPO 和 TTRL 基线。
- 在 AMC23 和 AIME24 上,ELM 大幅提升了基础性能(例如,Qwen 在 AMC23 上提升了 12.5 分),通常能达到或超过离线全数据集训练的结果。
- 泛化能力: 实验表明,单个潜空间记忆可以在整个测试集上有效泛化,且软提示在泛化能力上优于基于 LoRA 的参数化方法。
- 跨数据集迁移: 在一个数据集(如 AIME24)上训练的记忆能有效地迁移到另一个数据集(如 AMC23),证明了所学习的表示捕捉到了通用的推理结构。
- 与离线训练的比较: 令人惊讶的是,使用内部奖励在单个样本上进行训练往往比在整个数据集上对全模型进行更新具有更好的泛化效果,这表明在低数据量情形下,全模型更新可能会受到容量失配或干扰的影响。
意义与主张
本文将 ELM 定位为实现具备持续自我改进能力的模型的基础性一步。其重要性在于:
- 弥合差距: 它成功地将瞬态的、昂贵的推理时计算转化为持久的、可复用的知识,且无需外部监督。
- 可扩展性: 通过使用模块化、轻量级的记忆,该方法可以随着经验的累积进行扩展,而不会产生与全模型微调相关的计算开销或稳定性问题。
- 克服局限性: 它通过在潜空间操作解决了 ICL 的“文本瓶颈”,并通过在真实的流式设置下运行,解决了 RL 的“离线约束”。
作者承认了局限性,指出记忆质量存在差异(部分存在噪声),且目前对验证器的依赖是一种必要的缓解措施。他们将未来的工作留给探索记忆组合性、驱逐策略以及识别高质量样本以进行记忆创建的方法。然而,他们断言 ELM 提供了一条可行且高效的路径,使 LLM 能够内化其推理探索过程并稳步提升。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。