LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining
本文介绍了一种名为 LoKiFormer 的新型大语言模型架构,该架构通过集成用于捕捉局部模式的局部融合注意力(Local Fusion Attention)以及用于显式全局知识检索的解耦知识记忆模块(decoupled Knowledge Memory Module),提升了预训练效率和收敛速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何阅读和写作。这个机器人是一个“大语言模型”(LLM),一种在写故事到解决数学问题等方面都变得极其出色的人工智能类型。但问题在于:教导这些机器人就像是用茶匙去填满一个游泳池。这需要耗费巨大的时间和计算能力,而且机器人有时会对它们正在学习的内容感到困惑。
为了理解其中的原因,请思考人类是如何阅读句子的。我们能瞬间理解相邻的词语通常是相互关联的(比如“热”和“咖啡”),但我们也需要记住多年前学到的事实(比如“咖啡是豆类植物”)。目前的 AI 模型试图通过一种叫做“注意力”(attention)的机制同时处理这两者,这种机制会观察句子中的每一个词来查看它们之间的关系。问题在于,这就像是通过同时盯着页面上的每一个字母来读一本书;这既累人又低效,对于短距离的局部连接而言效率极低。此外,当机器人尝试存储其通用知识(如历史或科学方面的知识)时,它会将这些知识以一种混乱的方式隐藏在脑海深处,导致难以在需要时抓取正确的事实。科学家们希望构建一种能够学习得更快、消耗更少能量,并且能准确知道在哪里寻找信息的机器人。
于是,有了 LoKiFormer——这是一种全新的 AI 大脑设计,它就像是为机器人的阅读眼镜和记忆库进行了一次巧妙的升级。由邱武陈(Qiuwu Chen)和刘子默(Zimo Liu)领导的研究团队注意到,旧有的方式一直在浪费能量。他们提出了两种新工具来修复机器人的学习过程:一个用于处理“局部”事物(紧挨着的词语),另一个用于处理“全局”事物(来自现实世界的宏大事实)。
首先,他们解决了局部问题,使用了名为**局部融合注意力(Local Fusion Attention, LFA)**的技术。想象一下你在阅读一个句子。与其让机器人立即去弄清楚“猫”这个词与段落中所有其他词的关系,LFA 给机器人提供了一副特殊的“局部望远镜”。这对望远镜可以缩放并聚焦在紧挨着的几个词上,并先将它们融合在一起。这就像是机器人在试图理解整个城市之前,先对周围的邻里环境进行了一个快速、简单的总结。这节省了机器人做不必要工作的精力。论文表明,通过增加这个简单的步骤,机器人能更快地理解局部模式,从而在稍后能将脑力集中在更大、更复杂的联系上。
其次,他们通过**知识记忆模块(Knowledge Memory-Module, KMM)**修复了记忆问题。在旧模型中,机器人的知识就像一个图书馆,书本被粘在书架上,并与阅读指令混杂在一起。如果机器人想找关于“物理学”的事实,它必须在整个混乱的图书馆中翻找。LoKi-Former 的 KMM 则像是一个组织严密、贴有标签的分类文件柜,它与阅读指令是分离的。它将事实存储在特定的、可寻址的槽位中。当机器人需要了解关于“化学”的知识时,它可以直奔“化学”抽屉并取出正确的文件,而不会被其他事物分心。这实现了“存储知识”与“使用知识”的分离,使过程更加清晰且灵活。
将这两个工具结合起来的结果令人印象深刻。研究人员训练了他们的新型 LoKiFormer 模型,发现它的学习速度比标准模型快了 1.33 倍。为了让你有直观的感受:如果说标准模型需要经过 10,000 个训练步骤才能达到某种理解水平,那么 LoKiFormer 仅需 7,500 步就能达到同样的水平。这是一个巨大的时间与能量节省。更令人兴奋的是,他们的一个较小版本模型(拥有 70 亿个参数)表现得比其他公司更强大的大型知名模型还要出色,在语言理解、推理甚至编程测试中都击败了对手。
该论文指出,这种新架构不仅让机器人变得更快,还让它在利用已知知识方面变得更聪明。通过将“局部”阅读与“全局”记忆分离,该模型可以更有效地处理复杂任务。研究人员还展示了那个“文件柜”(KMM)在训练过程中实际上是会自动组织的,不同的抽屉会自然而然地成为历史、物理或代数等不同学科的专家。这意味着机器人不仅仅是在死记硬背;它正在学习以一种非常类似于人类获取自身知识的方式来进行信息检索。
简而言之,LoKiFormer 表明,我们并不需要通过把 AI 模型做得更大、更贵来使其变得更好。相反,通过给它们更好的工具来观察细节,以及更整洁的方式来存储宏大事实,我们可以构建出学习更快、成本更低且能更清晰理解世界的 AI。这提醒我们,有时候,构建超级智能机器的最佳方式,是帮助它整理好自己的办公桌。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。