← 最新论文
🤖 machine learning

Memory as a Markov Matrix: Sample Efficient Knowledge Expansion via Token-to-Dictionary Mapping

本文提出了一种用于大语言模型持续知识扩展的样本高效框架,通过将记忆表示为马尔可夫转移矩阵,并采用结合最小嵌入更新的令牌到词典映射策略,以实现零灾难性遗忘。

原作者: Kaustubh Pethkar, Ziyang Xiong, Zuofeng Shang, Yingcong Li

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaustubh Pethkar, Ziyang Xiong, Zuofeng Shang, Yingcong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)视为一座巨大且高度有序的“故事图书馆”。每当模型读取一个句子时,就像图书管理员看着最后一个词,并猜测下一个词是什么。

通常,如果你想教这位图书管理员一个全新的词(比如一个新的科学术语或俚语),你必须重新训练整座图书馆。但问题在于:当你为了学习新词而重新训练整座图书馆时,图书管理员往往会忘记如何正确讲述旧故事。这被称为“灾难性遗忘”。

本文提出了一种巧妙且低成本的添加新词方法,而不会破坏旧词。以下是使用简单类比进行的分解说明:

1. 图书馆即“交通地图”(马尔可夫思想)

作者将语言模型视为一张交通地图,而非复杂的大脑。

  • 节点:字典中的每个词都是地图上的一个城市。
  • 道路:词与词之间的连接是道路。如果你位于“这”(The)这座城市,就有特定的道路通向“猫”(cat)、“狗”(dog)或“太阳”(sun)。
  • 记忆:模型的“记忆”仅仅是这些道路的地图。它知道“这”通常以某种概率通向“猫”。

2. 问题:添加一座新城市

当你想教模型一个新词(我们称之为"Zorp")时,本质上是在地图上添加一座新城市。

  • 旧方法(全量微调):你试图重绘整张地图以包含"Zorp"。在此过程中,你意外地擦除或改变了旧城市之间的道路。图书管理员忘记了“这”通向“猫”,转而开始说“这”通向"Zorp"。
  • 本文的方法:与其重绘整张地图,你只需为"Zorp"添加一个路标。你只需说:“嘿,如果你看到'Zorp',就把它完全当作‘这’或‘猫’来处理。”

3. 解决方案:“词元到字典”映射

本文提出了一种称为**词元到字典映射(Token-to-Dictionary Mapping)**的策略。

  • 想象你有一个新的、奇怪的词"Zorp"。与其从头开始教模型"Zorp"的含义,你只需告诉模型:“当你看到'Zorp'时,就假装它是‘星星’(Star)这个词。”
  • 模型不需要为"Zorp"学习新的道路。它只需要知道"Zorp"指向与“星星”相同的目的地。
  • 因为模型无需改变现有的道路(旧词之间的转移概率),它永远不会忘记旧故事

4. “样本效率”(为何如此快速)

作者从数学上证明了这种方法极其高效。

  • 类比:如果你想学习一个新词,你不需要重新阅读整座图书馆。你只需要阅读几个关于该新词在句子中如何使用的示例。
  • 数学原理:你所需的示例数量取决于你将新词映射到多少个现有词。如果你将"Zorp"仅映射到 5 个常用词,你只需要极少量的数据就能学会它。你无需担心整座图书馆的规模(可能包含 10 万个词)。

5. 实验:教授数学与假词

研究人员在两种场景下测试了这种方法:

  1. 魔法运算符:他们教模型一个特殊符号(如 ⟨spec⟩),意为“乘法”。
    • 结果:模型非常快地学会了使用该新符号进行乘法运算。
    • 胜利之处:关键在于,模型仍然知道如何进行加法运算。在其他方法中,学习新符号会导致模型忘记如何加法。而这种方法完美地保留了加法技能。
  2. 假词:他们发明了 100 个无意义的词(如"glor"和"zorp"),并将它们放入句子中。
    • 结果:模型学会了正确使用这些假词,同时没有忘记如何说英语。
    • 对比:其他方法(如标准微调或 LoRA)导致模型在学习假词时忘记了英语。而新方法导致了零遗忘

总结

将这种方法想象为在不拆除现有房间墙壁的情况下,为房子添加一个新房间

  • 旧方法:为了添加一个新房间,你重建了整个地基。旧房间因此开裂并倒塌。
  • 新方法:你建造了新房间,并安装了一扇门,直接通向现有的走廊。旧走廊保持原样,新房间完美契合。

本文声称,这是一种经过数学证明的方法,可以用极少量的数据扩展语言模型的词汇量,且完全不会损失其先前的知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →