← 最新论文
💬 NLP

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

本文介绍了 Engram,一种可扩展的条件记忆模块,它通过将 NN-gram 嵌入现代化以实现 O(1)O(1) 查找,揭示了一种优化神经计算与静态存储之间权衡的 U 型稀疏分配律,从而显著提升了大语言模型在推理、代码和长上下文检索方面的性能。

原作者: Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Z
发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Zhang, Yixu Wei, M. Y Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解开一个巨大且复杂的谜题。长期以来,最聪明的谜题解题者(AI 模型)一直被构建得像一座巨大的工厂。它们拥有数以千计的专业化工人(被称为“混合专家模型”或 MoE),只有在需要解决棘手的逻辑或新想法时才会介入。这对于思考非常有益,但在处理简单、枯燥的事实时却显得有些笨拙。

可以这样理解:如果你问一位博学多才的数学家,“法国的首都是哪里?”他们不会仅仅回答“巴黎”。他们必须进行一次完整的心理模拟,每次都从头开始重新推导答案,这会消耗大量的脑力。这就像是用一台超级计算机去查阅自己脑海中的电话号码。

重大发现:“大脑的速记表”
DeepSeek-AI 和北京大学的研究人员提出了一个问题:如果我们给这些模型一个专门用于记忆那些只需记住的事物的“速记表”会怎样?

他们引入了一个名为 Engram 的新工具。Engram 不再强迫 AI 在处理每一个单词时都要进行“思考”,而是作为一个超快速的 O(1) 查找表(这意味着无论你是查找一个单词还是上百万个单词,所需的时间都一样短)。它基于一个古老的概念——N-gram(将单词组合在一起观察),但他们利用现代技术对其进行了升级,使其能够完美地运行在庞大的 AI 内部。

“U型”秘密
该团队发现了一个关于如何构建这些模型的迷人规则,他们称之为 U型缩放法则(U-shaped scaling law)

想象一下,你有一个固定的“脑力”预算(计算步骤)。你可以把所有的预算花在“思考工人”(MoE)身上,也可以把所有的预算花在“记忆速记表”(Engram)上。

  • 如果你将 100% 的预算花在思考工人身上,模型擅长逻辑,但擅长记忆事实。
  • 如果你将 100% 的预算花在速记表上,它能记住事实,但无法进行良好的推理。
  • 黄金分割点: 研究发现,最佳性能出现在分配预算时。你需要两者兼备。具体来说,他们发现,从“思考工人”的剩余内存预算中拿走大约 20–25%,并将其交给 Engram 记忆模块,会让整个系统变得更聪明。这就像是意识到一个天才不仅需要一个快速的大脑,还需要一个优秀的图书馆。

实际发生了什么?(证据)
他们构建了一个名为 Engram-27B 的模型,并将其与一个规模和速度完全相同的标准“仅思考型”模型进行了对比。结果令人惊喜:

  • 知识方面: 它在常识和事实方面表现更好(例如在 MMLU 上提高了 +3.4,在 CMMLU 上提高了 +4.0)。
  • 推理方面: 更令人惊讶的是,它在通用推理和逻辑谜题上的表现也大幅提升(在 BBH 上提高了 +5.0,在 ARC-Challenge 上提高了 +3.7)。
  • 数学与代码: 它在编程和数学方面也有所进步(例如在 HumanEval 上提高了 +3.0)。

论文指出,这是因为 Engram 模块处理了“枯燥”的部分(比如记住“亚历山大大帝”是一个特定的名字),从而让主脑不必浪费时间去重构它。这释放了 AI 深层结构的精力,使其能够专注于复杂的深度思考。这就像是有一位秘书处理所有的日程安排,以便首席执行官(CEO)能专注于战略。

“长记忆”技巧
其中一个最酷的副作用是它们处理长篇故事的能力。由于 Engram 模块可以瞬间抓取局部细节,主 AI 就有了更多的“注意力”来记住故事的始终。在测试中,Englement 模型能以 97.0% 的成功率在文本的“大海捞针”测试中找到特定信息,而标准模型仅能达到 84.2%

硬件魔法
最后,论文指出这不仅仅是一个软件技巧;它也是对硬件友好的。因为“速记表”使用固定地址(确定性 ID),计算机可以在处理当前部分的同时,开始获取下一个部分的内存。这意味着他们可以将一个高达 1000 亿参数 的表格存储在普通计算机的硬盘(主机内存)上,同时仍能获得几乎与在超快 GPU 上运行相当的速度。速度损失微乎其微,不到 3%

他们明确表示这“不是”什么
论文非常明确地说明了这不是什么:

  • 不是更大的词汇量。他们尝试过仅仅扩大词汇量(过度编码/OverEncoding),但效果不如 Engram。
  • 不是“思考”部分的替代品。如果完全移除“思考工人”(MoE),模型在推理方面会失败。记忆是一个辅助工具,而不是替代品。
  • 不是解决所有问题的万灵药。论文指出,虽然它有助于事实和推理,但“骨干”(主 AI)仍然是处理阅读理解等任务的核心,因为这类任务更多依赖于上下文而非静态记忆。

他们的确定性有多高?
作者对他们的测量结果非常有信心。他们不仅仅是在进行模拟;他们在 2620 亿个 token 的数据上训练了真实的模型,并在真实的基准测试中进行了测试。他们展示了“U型”规则在不同规模下依然成立,并且性能的提升是真实、可衡量且可重复的。他们甚至通过可视化模型内部的“门控”(gates)来证明,模型确实是在针对名字和短语等内容开启记忆功能,正如他们设计的那样。

简而言之,这篇论文表明,AI 的未来不仅仅在于制造更大的大脑,还在于为这些大脑提供一个更好、更快、更智能的查阅方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →