MoNe: Modular Neural Memory for Efficient Long Context Inference
MoNe 是一个轻量级、模块化的神经记忆系统,它通过附加在冻结的 Transformer 上,实现将推理成本与上下文长度解耦,从而在无需重新训练的情况下,实现常数级的查询复杂度并显著降低内存使用量,以实现高效的长上下文推理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能已经达到了能够一次性阅读整本书籍、分析数年的聊天记录或消化庞大法律合同的水平。为了实现这一点,这些系统依赖于一种机制,使它们能够回顾之前处理过的所有内容,从而理解当前的问题。然而,这种能力伴随着沉重的代价。随着文本量的增加,处理这些信息所需的能量和计算机内存不仅是在增长,而是在爆炸式增长。想象一下,试图通过将你现在正在读的每一个单词,与你从开始阅读以来读过的每一个单词进行对比,来阅读一座图书馆。这种所需的努力程度增长得如此之快,以至于对于标准计算机,尤其是手机或笔记本电脑中常见的较小设备来说,处理超过几千个单词的任务很快就会变得不可能。这种局限性迫使当前的系统要么忘记长篇故事的开头,要么依赖外部工具来寻找特定事实,从而往往会错过连接分散细节的宏观图景。
高通人工智能研究中心(Qualcomm AI Research)的一个研究小组开发了一种名为 MoNe 的新方法,它允许人工智能模型在无需重新训练或不会使硬件过载的情况下处理海量信息。MoNe 并不强迫计算机在每次回答问题时都不断地重读整个对话或文档的历史,而是像一个模型在阅读时会随手记录的专用笔记本。该系统将长文本分成小而易于管理的块进行处理。在阅读每个数据块时,它会更新这个内部笔记本,将精华信息提炼成紧凑的形式。一旦整个文本被读完且笔记本填满后,模型就可以仅根据该笔记本的内容来回答问题。至关重要的是,模型永远不需要再次回头查看原始的长文本。这种设计意味着,无论原始文档是一封简短的电子邮件还是一部十万字的巨著,回答问题的成本都保持不变。
研究人员在标准的一套挑战任务上测试了这种方法,这些任务旨在测试模型是否能在大量文本中找到隐藏的特定事实,这项任务通常被称为“大海捞针”。他们还测试了模型提取频繁出现词汇的能力,以及解决需要连接散布在全文中的多个信息片段的问题的能力。当文本长度保持在模型的原始训练限制范围内时,这种新方法表现近乎完美,超越了试图一次性阅读全部内容的标准方法。更令人印象深刻的是,当研究人员将系统推向处理远超模型原始设计长度的文本(高达 128,000 个 token)时,新方法依然能保持高准确度。相比之下,试图一次性读取全文的标准方法随着文本变长而完全失效,准确率降至接近于零。另一种常见的替代方法是尝试搜索相关的文本片段,但在需要整合许多分散事实时也显得力不从心。
这种新方法带来的效率提升是巨大的。在测试的最长文本长度下,研究人员发现,与标准方法相比,他们的方法减少了约 80% 的计算能力需求。它也将峰值内存需求降低了同样的幅度。这是一个关键的改进,因为这意味着强大的长上下文推理技术最终可以在资源有限的设备上运行,而不是需要庞大且昂贵的服务器。该系统通过保持恒定的内存占用量来实现这一点:内部笔记本的大小不会随着文本变长而增长。研究人员证明,该系统可以附加到现有的预训练模型上,而无需改变其核心结构,只需增加少量的额外数据存储。他们还展示了该系统可以通过分段处理文本并逐步更新其内部状态,从而泛化到比训练长度长 32 倍的文本。
虽然目前的实验侧重于使用特定模型规模进行特定的检索任务,但结果为使人工智能更具处理现实世界长篇信息的能力提供了一条可行的路径。该方法不需要从头开始构建全新类型的“计算机大脑”,也不需要模型在海量新数据集上进行重新训练。相反,它引入了一个轻量级的、模块化的插件,能够实时学习压缩信息。这使得系统能够在保持对过去清晰且恒定记忆的同时,降低思考当下的成本。随着人们对能够对数小时对话或数千页文档进行推理的人工智能的需求不断增长,这种方法提供了一种切实可行的方式,让这些系统在理解它们所处的世界的全貌时,依然保持快速、高效且具备能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。