Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
本文介绍了 Engram,一种可扩展的条件记忆模块,它通过将 -gram 嵌入现代化以实现 查找,揭示了一种优化神经计算与静态存储之间权衡的 U 型稀疏分配律,从而显著提升了大语言模型在推理、代码和长上下文检索方面的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解开一个巨大且复杂的谜题。长期以来,最聪明的谜题解题者(AI 模型)一直被构建得像一座巨大的工厂。它们拥有数以千计的专业化工人(被称为“混合专家模型”或 MoE),只有在需要解决棘手的逻辑或新想法时才会介入。这对于思考非常有益,但在处理简单、枯燥的事实时却显得有些笨拙。
可以这样理解:如果你问一位博学多才的数学家,“法国的首都是哪里?”他们不会仅仅回答“巴黎”。他们必须进行一次完整的心理模拟,每次都从头开始重新推导答案,这会消耗大量的脑力。这就像是用一台超级计算机去查阅自己脑海中的电话号码。
重大发现:“大脑的速记表”
DeepSeek-AI 和北京大学的研究人员提出了一个问题:如果我们给这些模型一个专门用于记忆那些只需记住的事物的“速记表”会怎样?
他们引入了一个名为 Engram 的新工具。Engram 不再强迫 AI 在处理每一个单词时都要进行“思考”,而是作为一个超快速的 O(1) 查找表(这意味着无论你是查找一个单词还是上百万个单词,所需的时间都一样短)。它基于一个古老的概念——N-gram(将单词组合在一起观察),但他们利用现代技术对其进行了升级,使其能够完美地运行在庞大的 AI 内部。
“U型”秘密
该团队发现了一个关于如何构建这些模型的迷人规则,他们称之为 U型缩放法则(U-shaped scaling law)。
想象一下,你有一个固定的“脑力”预算(计算步骤)。你可以把所有的预算花在“思考工人”(MoE)身上,也可以把所有的预算花在“记忆速记表”(Engram)上。
- 如果你将 100% 的预算花在思考工人身上,模型擅长逻辑,但擅长记忆事实。
- 如果你将 100% 的预算花在速记表上,它能记住事实,但无法进行良好的推理。
- 黄金分割点: 研究发现,最佳性能出现在分配预算时。你需要两者兼备。具体来说,他们发现,从“思考工人”的剩余内存预算中拿走大约 20–25%,并将其交给 Engram 记忆模块,会让整个系统变得更聪明。这就像是意识到一个天才不仅需要一个快速的大脑,还需要一个优秀的图书馆。
实际发生了什么?(证据)
他们构建了一个名为 Engram-27B 的模型,并将其与一个规模和速度完全相同的标准“仅思考型”模型进行了对比。结果令人惊喜:
- 知识方面: 它在常识和事实方面表现更好(例如在 MMLU 上提高了 +3.4,在 CMMLU 上提高了 +4.0)。
- 推理方面: 更令人惊讶的是,它在通用推理和逻辑谜题上的表现也大幅提升(在 BBH 上提高了 +5.0,在 ARC-Challenge 上提高了 +3.7)。
- 数学与代码: 它在编程和数学方面也有所进步(例如在 HumanEval 上提高了 +3.0)。
论文指出,这是因为 Engram 模块处理了“枯燥”的部分(比如记住“亚历山大大帝”是一个特定的名字),从而让主脑不必浪费时间去重构它。这释放了 AI 深层结构的精力,使其能够专注于复杂的深度思考。这就像是有一位秘书处理所有的日程安排,以便首席执行官(CEO)能专注于战略。
“长记忆”技巧
其中一个最酷的副作用是它们处理长篇故事的能力。由于 Engram 模块可以瞬间抓取局部细节,主 AI 就有了更多的“注意力”来记住故事的始终。在测试中,Englement 模型能以 97.0% 的成功率在文本的“大海捞针”测试中找到特定信息,而标准模型仅能达到 84.2%。
硬件魔法
最后,论文指出这不仅仅是一个软件技巧;它也是对硬件友好的。因为“速记表”使用固定地址(确定性 ID),计算机可以在处理当前部分的同时,开始获取下一个部分的内存。这意味着他们可以将一个高达 1000 亿参数 的表格存储在普通计算机的硬盘(主机内存)上,同时仍能获得几乎与在超快 GPU 上运行相当的速度。速度损失微乎其微,不到 3%。
他们明确表示这“不是”什么
论文非常明确地说明了这不是什么:
- 它不是更大的词汇量。他们尝试过仅仅扩大词汇量(过度编码/OverEncoding),但效果不如 Engram。
- 它不是“思考”部分的替代品。如果完全移除“思考工人”(MoE),模型在推理方面会失败。记忆是一个辅助工具,而不是替代品。
- 它不是解决所有问题的万灵药。论文指出,虽然它有助于事实和推理,但“骨干”(主 AI)仍然是处理阅读理解等任务的核心,因为这类任务更多依赖于上下文而非静态记忆。
他们的确定性有多高?
作者对他们的测量结果非常有信心。他们不仅仅是在进行模拟;他们在 2620 亿个 token 的数据上训练了真实的模型,并在真实的基准测试中进行了测试。他们展示了“U型”规则在不同规模下依然成立,并且性能的提升是真实、可衡量且可重复的。他们甚至通过可视化模型内部的“门控”(gates)来证明,模型确实是在针对名字和短语等内容开启记忆功能,正如他们设计的那样。
简而言之,这篇论文表明,AI 的未来不仅仅在于制造更大的大脑,还在于为这些大脑提供一个更好、更快、更智能的查阅方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。