← 最新论文
💬 NLP

MeMo: Towards Language Models with Associative Memory Mechanisms

本文介绍了 MeMo,一种新颖的语言模型架构,它通过在分层关联记忆中显式地记忆标记序列,从而实现透明度、模型编辑以及遗忘特定文本的能力。

原作者: Fabio Massimo Zanzotto, Elena Sofia Ruzzetti, Giancarlo A. Xompero, Leonardo Ranaldi, Davide Venditti, Federico Ranaldi, Cristina Giannone, Andrea Favalli, Raniero Romagnoli

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Fabio Massimo Zanzotto, Elena Sofia Ruzzetti, Giancarlo A. Xompero, Leonardo Ranaldi, Davide Venditti, Federico Ranaldi, Cristina Giannone, Andrea Favalli, Raniero Romagnoli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人说话。目前我们教它的方式(使用“Transformer”)就像是强迫机器人阅读一整个图书馆的书籍,然后根据它以前可能见过什么的模糊、模糊的感觉来猜测下一个词。它通过调整大脑内部看不见的旋钮来获得正确答案。这很强大,但它是一个“黑盒”——我们并不真正知道机器人在哪里存储了一个特定的事实,而且如果我们想让它忘记某些东西,我们必须重新训练整个大脑。

MeMo 论文提出了一种完全不同的方法。与其让模型基于模糊的感觉进行猜测,MeMo 构建了一个字面意义上的、有组织的档案柜,作为机器人的记忆。

以下是 MeMo 的工作原理,通过简单的概念进行分解:

1. 核心理念:“先记忆,后学习”

目前的模型试图在记忆的同时学习模式。MeMo 颠覆了这一点。它说:“让我们先直接把事实放进抽屉里。”

这就像是图书馆与直觉的区别。

  • 目前的模型: 像是一个读了太多书的人,因为感觉“对了”,所以能猜出故事的结局。他们可能会猜错,或者把来自不同书中的细节混淆在一起。
  • MeMo: 像是一个为每一句话都准备了特定索引卡的图书管理员。如果你问:“‘猫坐在……’ 后面是什么”,图书管理员不会去猜;他们会直接抽出那张写着“垫子”的精确卡片,因为他们把内容记录在那里了。

2. 魔法工具:“相关矩阵记忆”(便利贴系统)

为了让这个档案柜发挥作用,MeMo 使用了一种被称为相关矩阵记忆 (Correlation Matrix Memories, CMM) 的数学技巧。

想象你有一个巨大的白板。

  • 输入(键/Key): 你将一个句子(如“猫坐在”)转化为一种独特的、随机的点阵图案(一个向量)。
  • 输出(值/Value): 你将下一个词(如“垫子”)转化为另一种不同的点阵图案。
  • 存储: 你在白板上画一条线,将“句子模式”与“单词模式”连接起来。

如果你有一百万个句子,你只需在同一个白板上画一百万条线。因为这些模式被设计得非常独特,所以线条不会缠绕在一起。当你想要记忆时,你只需指向“句子模式”,白板上与之相连的“单词模式”就会亮起。

为什么这很酷?

  • 透明性: 你可以观察白板,看清哪句话与哪个词相连。这里没有任何隐藏的秘密。
  • 编辑性: 如果你想让机器人忘记某个特定的句子,你不需要重新训练整个大脑。你只需拿出一块橡皮擦,把白板上的那条线擦掉即可。

3. 短期记忆的问题(单层限制)

在第一个实验中,研究人员构建了一个单层白板。对于短句(如 4 个单词长)它表现得很好。但如果你尝试喂给它一段长段落,线条就会变得过于拥挤,机器人就会开始感到困惑。这就像试图在一张单层便利贴上写完一整部小说。

4. 解决方案:多层塔式结构(MeMo 架构)

为了处理长文本,MeMo 将这些白板堆叠在一起,就像一座多层图书馆

  • 第一层: 记住单词对(例如:“猫” + “坐”)。
  • 第二层: 记住由四个单词组成的组(例如:“猫坐在……”)。
  • 第三层: 记住更长的片段。

当你提出问题时,机器人会检查底层,然后检查下一层,依此类推,结合每一层的线索来找到答案。这使得它能够记住更长的序列而不产生混乱,就像人类利用短期记忆来构建完整句子一样。

5. 实验结果显示

研究人员使用随机的句子和单词测试了这个系统:

  • 容量: 他们发现,给予白板越多的“空间”(参数),它就能容纳越多的句子。这是一个直接的线性关系:更大的白板 = 更多的记忆。
  • 复杂度: 当他们使句子变得更难(加入“诱饵”或看起来相似的干扰词)时,他们发现需要更多的层数(layers)。单层图书馆无法处理这种混乱,但三层图书馆可以。
  • 准确度: 在拥有足够的层数和空间的情况下,该系统可以高精度地记忆超过 25 万个序列,即使在句子非常棘手的情况下也是如此。

总结

MeMo 是一种构建语言模型的新方式,它将记忆视为一个透明的、可编辑的归档系统,而不是一个黑盒式的猜测游戏。

  • 它通过数学连接存储文本。
  • 它通过查找这些连接来检索文本。
  • 它通过简单地擦除连接来遗忘文本。

论文声称,这使得语言模型更加诚实(你可以看到它们知道什么),更容易修复(你可以删除特定的错误记忆),并且能够通过堆叠这些记忆层来处理长文本。作者指出,由于这是一个全新的架构,它目前还不能完美适配大多数 AI 开发者使用的现有软件工具,但其记忆能力本身运作得非常出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →