← 最新论文
🤖 machine learning

Continual Self-Improvement with Lightweight Experiential Latent Memories

本文提出了一种高效的在线方法,通过轻量级的自监督训练将瞬时推理轨迹转换为紧凑且模块化的潜在记忆,使大语言模型能够在不发生灾难性遗忘的情况下实现持续的自我改进和卓越的推理性能。

原作者: Vaggelis Dorovatas, Nancy Kalaj, Rahaf Aljundi

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Vaggelis Dorovatas, Nancy Kalaj, Rahaf Aljundi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢、超级聪明的学生(一个大型语言模型),他非常擅长解决数学问题。然而,这个学生有一个奇怪的怪癖:他完全不记得自己刚刚学到了什么。

每当你给他一个新问题时,他都会从零开始。即使他思考了几个小时,犯了错,又自我纠正,最后找到了正确答案,一旦他交出解题过程,那整个“思考过程”就会消失。他并不会因为下一个问题而变得更聪明。他就像一个天才,在交作业的一瞬间就忘掉了自己的学习内容。

这篇论文介绍了一个名为 ELM(经验潜记忆,Experiential Latent Memory) 的系统来解决这个问题。这是一种让 AI 记录自己思考过程的方法,使其能够随着时间的推移而变得更好,而无需老师来批改他的作业。

以下是该系统的运作方式,通过简单的概念进行拆解:

1. 问题所在:为什么“读笔记”行不通

研究人员首先尝试了一种简单的方法:上下文学习(In-Context Learning, ICL)

  • 类比: 想象这个学生试图通过阅读自己之前思考过程的转录文本来学习。“上次我解一道几何题时,我写道:‘第一步:寻找角度。第二步:使用公式。’”
  • 结果: 这并不奏效。论文发现,仅仅阅读解题过程的“文本”就像是在没有实际下厨的情况下只看食谱。它错失了在模型大脑内部发生的实际思考过程中的“风味”——那些死胡同、信心水平以及从未转化为文字的隐藏逻辑。这种方式太浅显了,无法对付新的、棘手的难题。

2. 解决方案:“闪卡”系统

研究人员并没有让 AI 写下整个故事,而是创建了一个系统,让 AI 为它解决的每个问题制作微小的、不可见的“闪卡”

  • 流程:
    1. 测试: AI 尝试解决一个数学问题。
    2. 自检: 由于没有老师,AI 会针对同一个问题生成许多个不同的答案。然后它会观察这些答案并说:“好吧,10 个答案中有 7 个说答案是 42。所以,42 可能是正确的。”这被称为多数投票法(Majority Voting)。它充当了一个自我评分系统。
    3. 学习: AI 将那个特定的问题及其自我评分后的答案进行训练,生成一张微小的、轻量级的“闪卡”(称为“软提示”,Soft Prompt)。
    4. 存储: 这张闪卡被存储在一个“记忆池”中。它极其微小(仅为模型大小的 0.001%),因此不会拖慢运行速度。

3. 使用闪卡: “图书管理员”

当一个新的数学问题进来时,系统就像一个图书管理员一样运作:

  1. 搜索: 它查看新问题并询问:“我们的记忆池里是否有与此类似的闪卡?”
  2. 检索: 如果它找到了匹配项,它就会取出那张微小的闪卡并将其附加到新问题上。
  3. 双重检查: AI 会解决两次问题:一次是没有闪卡的情况下(零样本/Zero-Shot),另一次是带有闪卡的情况下。
  4. 判定: 一个“验证器”(安全卫士)会比较这两个答案。如果带闪卡的版本更好,系统就采用它。如果闪卡让情况变糟了(因为有时自我评分也会出错),验证器会选择原始答案。

4. 为什么这意义重大

  • 不会遗忘: 因为 AI 不会重写它的整个大脑(这会导致它忘记旧技能),它只是添加这些微小的、孤立的闪卡。这就像是在不擦除旧章节的情况下,为一本书增加了一个新章节。
  • 高效性: 它不需要超级计算机来学习。它可以边学边用,一次处理一个问题,且仅需极少的步骤。
  • 优于离线训练: 令人惊讶的是,论文发现,使用这种方法一次学习一个问题,往往比在包含数千个问题的庞大数据集上对整个模型进行大规模训练的效果还要好。看起来,当 AI 专注于每一个具体的经验时,它能更好地掌握推理的“本质”。

总结

可以将 ELM 想象成给一个健忘的天才配备了一个个性化的、自动更新的口袋笔记本

  • 它不是写下问题的整个故事,而是根据所学内容写下一个微小的、不可见的“提示”。
  • 它会检查自己的工作,以确保提示是有用的。
  • 当新问题到来时,它会检查笔记本中是否有类似的提示。
  • 如果提示有帮助,它就使用它;如果提示有害,它就忽略它。

其结果是,一个系统在每次解决问题时都会变得更加聪明,将自己的“思考时间”转化为永久的、可重复使用的知识,而无需任何人类教师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →