DeltaLog: Deferred Materialization of Recurrent States for Linear Attention Decoding
DeltaLog 是一种循环状态解码方案,它通过将完整的状态实例化延迟,转而采用向一个有界日志中追加紧凑更新并定期进行合并的方式,从而加速线性注意力模型,进而显著减少内存流量并提高端到端推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代生成文本的人工智能系统,从聊天机器人到创意写作助手,都依赖于一种被称为自回归解码(autoregressive decoding)的基础过程。在这个过程中,计算机逐一预测句子中的下一个词,并利用已经生成的词来为下一次预测提供信息。多年来,最强大的模型一直使用一种被称为“注意力”(attention)的机制,来决定哪些先前的词对于当前的预测最为重要。虽然这种方法非常有效,但它也产生了一个日益严重的瓶颈:随着对话变得越来越长,系统必须不断存储并检索之前见过的每一个词的不断扩大的列表,这消耗了大量的计算机内存并降低了响应速度。为了解决这个问题,研究人员开发了一类较新的模型,用一个固定大小的摘要或“状态”(state)取代了不断扩大的列表,该状态会随着每个新词的加入而更新。这一改变消除了记住每一个过去标记(token)的需求,但它引入了另一个问题:系统仍然必须在每次添加新词时不断重写整个摘要,从而在计算机内存中造成严重的“交通拥堵”。
中国科学技术大学的研究团队发现,这种不断的重写是一种主要的低效行为,并提出了一个名为 DeltaLog 的解决方案。DeltaLog 不再强迫计算机在每个词之后都重写整个对话摘要,而是允许系统保留一个稳定且完整的摘要版本,并仅仅附加一个描述最近变化的紧凑、小巧的笔记。系统只在积累了一定数量的这些小笔记后,才会偶尔重写一次完整摘要。这种方法就像是保留一本总账和一叠便签纸;与其每发生一笔交易就重写整本账簿,不如只需将交易添加到便签堆中,并仅在便签堆过高时才更新账簿。通过这种方式,研究人员发现他们可以大幅减少计算机需要移动的数据量,而数据移动通常是这个过程中最慢的部分。
研究人员在包括 Gated DeltaNet、Kimi Delta Attention 和 RWKV6 在内的几种不同类型的现代语言模型上测试了这种方法。在实验中,他们测量了计算机生成单个词所需的时间以及涉及的内存流量。他们发现,通过推迟对摘要的完整重写,他们可以将更新模型内存的核心计算速度在高端显卡上提高多达 1.86 倍。更重要的是,他们观察到写入计算机高速内存的数据量下降了多达 7.83 倍。这种流量的减少意义重大,因为在这些类型的模型中,速度往往不是受限于计算机计算的速度,而是受限于其在内存中进出数据的速度。
当研究人员将这种方法集成到一个旨在同时为多用户提供服务的完整系统中时,这些优势转化为了更快的用户端响应时间。在针对包含数百亿参数的大型模型的测试中,该系统生成单词的速度比以前快了 5% 到 20%。这种改进在系统同时处理大量请求时最为明显,而这正是现实应用中的常见场景。研究人员证实,这种提速并没有以牺牲准确性为代价;由修改后的系统生成的文本在数学上与原始系统保持等价,这意味着在提高交付效率的同时,输出质量得到了保留。
这项工作的核心洞察在于,计算机物理存储和更新信息的方式并不总是需要与模型采取的逻辑步骤相匹配。虽然模型在逻辑上随每个词更新其状态,但物理硬件并不需要立即重写整个状态来反映该变化。通过将稳定的历史记录与近期的变化分离,并仅定期进行合并,DeltaLog 减少了“状态更新税”(state-update tax),这是作者用来描述由急切、即时的更新所导致的过度内存流量的术语。这种策略并不改变底层模型或其权重;它只是改变了计算机处理数据的调度方式。结果表明,对于大规模语言模型而言,优化数据的物理移动与改进数学算法本身同样至关重要,这为实现更快、更高效的人工智能提供了一条清晰的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。