Raven: High-Recall Sequence Modeling with Sparse Memory Routing
Raven 是一种线性时间序列模型,它通过采用稀疏且依赖输入的记忆路由技术,仅更新固定记忆槽中的一个子集,从而改善了长上下文召回能力,有效地平衡了稠密状态空间模型的干扰问题与滑动窗口注意力的硬性驱逐限制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图回忆刚才听到的一个故事,但你的大脑有一个奇怪的规则:每当你听到一个新词,你就必须从头开始重写整个故事,并将这个新词融入到你写过的每一句话中。这就是一些被称为“状态空间模型”(State-Space Models)的计算机程序的工作方式。它们擅长在很长一段时间内保持故事的大致氛围,但因为它们把一切都融合得太彻底了,以至于想要找到某个特定的细节(比如一个名字或一个日期)变得极其困难。另一方面,想象另一种不同类型的记忆,它就像一本拥有固定页数的笔记本。当你填满最后一页时,你就把它撕下来扔掉,然后换上一本新的。这就是“滑动窗口”(Sliding Window)模型的工作方式。它们擅长完美地记住最后几页的内容,但一旦某条信息被挤出了边缘,它就会永远消失。
这就是人工智能领域的科学家们试图解决的大问题:我们如何构建一个能够记住一个故事很长时间,既不会混淆细节,又不会仅仅因为信息太旧就忘记开头的计算机大脑?我们需要一个系统,能够长期保留特定的、重要的事实,同时又能高效地处理新信息。这对于随着 AI 模型变得越来越聪明,需要阅读更长的书籍、分析巨大的文档,并在经过数千个单词后仍能记住对话开始时给出的指令,这一点至关重要。
由此诞生了 Raven,一种由研究人员设计的新型 AI 模型,旨在解决这个精确的记忆难题。把 Raven 的记忆想象成不是一个混乱的重写过程,也不是一个简单的垃圾桶笔记本,而是一个拥有数百个储物柜的高科技更衣室。在旧系统中,每当有新物品到达时,它都会被强行放入每一个储物柜中;或者它会根据到达顺序被塞进储物柜,无论该物品是否重要,都会踢走最旧的物品。Raven 改变了规则。它使用一个聪明的“路由”(router)作为“保安”。当新的信息到达时,保安会观察这条信息是什么,然后决定:“这是一个无聊的事实吗?把它放进一个经常清理的共享储物柜里。这是一个超级重要的秘密吗?把它放进一个特殊的、专门的、谁也不准碰的储物柜里。”
该论文介绍了一个名为 路由槽位记忆(Routing Slot Memories, RSMs) 的框架,它是 Raven 的蓝图。其核心创新在于,Raven 将信息的“写入位置”与“停留时长”分离开来。在之前的模型中,这两者是纠缠在一起的。Raven 使用了一种“稀疏”路由系统,这意味着它每次只更新一小部分选定的储物柜(记忆槽位),而让其余部分完全保持不变。这意义重大,因为它防止了试图同时更新所有内容时产生的“干扰”。如果某个特定的储物柜里存着一个关键密码,Raven 的路由可以选择忽略那个储物柜数百步,让密码安全地待在那里,同时让其余的记忆继续履行职责。
研究人员在一些非常困难的记忆游戏中测试了 Raven。其中之一是“大海捞针”(Needle in a Haystack)测试,即 AI 必须在一个巨大的文档中找到一个特定的句子。在这些测试中,Raven 展示了即使在文档长度是其训练长度的 16 倍 时,它也能找到那根“针”。当 Mamba-2 或滑动窗口注意力(Sliding Window Attention)等其他模型开始失效并遗忘信息时,Raven 仍能保持近乎完美的准确度。例如,在 32,000 个 token 的测试中,Raven 保持了超过 91% 的准确率,而其他模型的表现则显著下降。
真正酷的是,Raven 不需要任何花哨的额外技巧来实现这一点。它不依赖于复杂的卷积(这是其他模型使用的类似于短期记忆过滤器)或特殊的位次标记。它仅仅使用了这种聪明的路由系统。论文指出,通过让模型学会基于“内容”(单词是什么)而非仅仅基于“位置”(单词在句子中的位置)来分配记忆,它创造了一种自然的“专业化”。一些记忆槽位成为了持有检索关键细节的专家,而另一些则负责处理故事的整体流向。
作者发现,这种方法不仅可以独立运作,还可以与其它类型的 AI 架构混合使用。当他们将 Raven 与标准的注意力机制(即目前最流行的 AI 模型所使用的机制)结合时,这种混合系统在长上下文任务上的表现甚至更好,超越了使用滑动窗口注意力的模型或其他线性模型。论文总结道,Raven 成功地弥合了擅长长期持久性的模型与擅长精确召回的模型之间的差距,这表明将记忆分配视为一种刻意的、可学习的选择,是构建更聪明、更高效的 AI 的一条强大路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。