One Vector Is All You Need for O(1) Self-Attention: The Ocean State
本文介绍了“海洋状态”(Ocean State),这是一种通过使用单个持久向量来取代标准自注意力机制的方法,旨在实现 O(1) 的计算与内存复杂度,同时展示了卓越的训练稳定性,且在 1000 万步上下文长度下也未出现遗忘迹象。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能通常依赖于一种被称为“Transformer”的特定类型的计算机程序,它已成为处理文本生成、语言翻译和回答问题等任务的标准。这些程序通过观察一个词序列并决定下一个词是什么来工作。为了准确地做到这一点,程序必须记住它已经看到的词。在当前的设计中,当程序阅读长句子或整本书时,它会保留一份不断增长的已处理词汇列表。这个列表就像一个随每一个新词而扩张的记忆库。虽然这在处理短文本时效果很好,但对于非常长的文本来说,它会变成沉重的负担。计算机必须不断扫描这个不断增长的列表以寻找相关信息,这需要巨大的计算能力和内存。随着文本变长,阅读文本所需的时间和能量增长速度远快于文本本身的长度,最终使得高效处理超长文档变得不可能。
一位名叫 Yu Shuyuan 的研究人员针对这一记忆问题提出了另一种处理方法。该新方法建议不再保留一个不断增长的词汇列表,而是仅保留一个单一的摘要向量,作者称之为“海洋状态”(ocean state)。想象一下,这个状态就像一个单一且稠密的容器,承载着程序目前为止所读到的一切精华。当程序阅读一个新词时,它会更新这个单一的容器以包含新信息,用新鲜的摘要替换旧的摘要。然后,程序使用这个单一的容器来辅助预测下一个词。这种方法改变了问题的基本数学逻辑:处理过程的难度不再随文本长度增加,无论文本变得多长,其投入的精力都保持不变。程序可以阅读一百万个词,而每个词的处理量保持一致,并且无论文本长度如何,它使用的内存始终是固定且微小的。
这项工作的核心思想是一个简单的疑问:如果我们不在使用一个句子的最终摘要后将其丢弃,情况会怎样?在标准程序中,这个摘要被计算出来后就会被丢弃。而新方法保留了它,将其视为一种从一步流向下一步的持久记忆。程序读取当前的词和这个单一的摘要向量,将它们结合起来,并产生一个新的摘要。这个过程在文本中的每一个词上都会重复进行。至关重要的是,程序完全能够自主学习如何读取并更新这个单一的向量。没有人告诉它如何将信息压缩到一个点中;它只是在训练过程中通过设计本身学会了这样做。研究人员发现,这个单一向量的能力惊人。它可以在十百万步的序列中保存信息而不丢失任何内容。在测试中,该程序能够像检索前几步的信息一样准确地召回序列开头特定词汇的信息,没有表现出任何遗忘迹象。
研究人员使用一组大型文本数据,针对这一想法与标准方法进行了对比测试。他们训练了两个版本的模型来预测句子中的下一个词。结果显示,使用单一向量的新方法在表现上始终优于保留增长列表的标准方法。这种优势并非偶然,它出现在包括不同模型规模和不同文本长度在内的多种设置中。事实上,由于新方法非常稳定,它可以处理十百万步的序列而不会出现误差增加的情况,而标准方法甚至在处理不到这个长度的片段时,就会耗尽内存或耗费无法承受的时间。研究人员还测试了一项特定任务,即程序需要在长时间延迟后重复一个词。新方法重现该词时的损失仅为 0.0006,而标准方法则完全失败。
人们对这种压缩记忆的一个担忧是,它可能会随着时间的推移变得难以解读或变得“模糊”,从而失去进行良好预测所需的细节。然而,实验结果却恰恰相反。这个单一向量始终保持清晰锐利,即使在经过数百万步之后仍能检索特定信息。研究人员还探索了如何让这种方法在真实计算机上运行得更快。由于新方法是严格按顺序逐个处理单词,因此与可以同时处理多个单词的标准方法相比,其在单机上的训练速度可能较慢。为了解决这个问题,研究人员开发了一种将工作分配到程序不同层级的方法,从而允许同时处理多个步骤。这种工程上的改进显著减少了训练模型所需的时间,同时保持了同样的高性能。
这项研究证明,利用固定的内存和计算能力来构建一个能够记住海量信息的系统是可能的。研究人员展示了程序如何在没有任何特殊指令的情况下,学会高效地组织这些信息。虽然目前的实验是在特定的数据集和相对较小的模型上进行的,且在现实世界规模下的表现尚未经过测试,但结果表明其底层原理是稳健的。该方法通过重新定义程序处理其内部状态的方式来起作用,将一个被丢弃的摘要转变为一种持久的记忆。这种改变消除了限制人工智能处理文本长度的结构性成本。研究结果表明,通过这种方法,上下文长度的限制可能不再是障碍,使得系统能够以一致的速度和准确度阅读并理解任何规模的文档。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。