Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers
本文介绍了循环潜变量注意力(Looped Latent Attention, LLA),这是一种后训练编解码器,它利用了权重共享 Transformer 中循环索引 KV 缓存的低秩结构,通过 SVD 初始化和蒸馏技术,在保持近乎无损性能的同时,实现了极高的压缩率(高达 32 倍)并显著提升了批处理容量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
AI 大脑中的记忆问题
想象一下,你正在试图教一个机器人写故事。这个机器人的大脑由数百万个微小的开关(参数)组成,这些开关知道词语是如何组合在一起的。但问题在于:为了写一个长篇故事,机器人不能只靠看自己的大脑;它需要一个“草稿本”。每当它写下一个新词时,它都必须记住它刚刚写下的所有内容,以免重复自己或跑题。在人工智能的世界里,这个草稿本被称为 KV 缓存(KV cache)。它是为每一次对话准备的私人笔记本,并且随着机器人每说出一个词,它就会变得越来越大。
现在,想象一种设计得极其高效的特殊机器人。这个机器人没有拥有许多不同房间(层)来处理不同任务的大型大脑,而是只有一个聪明的小房间,它会反复多次地访问这个房间。它重复使用同一套指令,通过循环执行这些指令来进行更深层的思考。这被称为循环 Transformer(Looped Transformer)。这节省了大脑本身的空间,这很棒。但有一个隐蔽的问题:尽管机器人重复使用同一个房间,但它每次循环时仍然会写一张新的草稿本页面。如果机器人循环四次来解决一个数学问题,它最终会为故事中的同一个时刻产生四页独立的笔记。这意味着,“循环”机器人仍然需要大量的内存来运行,这抵消了其高效设计的初衷。科学家们面临的重大问题是:我们能否在不让机器人忘记如何思考的前提下,缩小那个草稿本?
论文的发现:笔记中的秘密捷径
这篇论文引入了一种被称为**循环潜变量注意力(Looped Latent Attention, LLA)**的聪明技巧,来解决那个记忆问题。研究人员发现,机器人的笔记并不像看起来那么混乱。当机器人循环进行思考过程时,它为同一个词编写的笔记并不会发生剧烈的变化;它们遵循一条平滑、可预测的路径,就像一颗在大地缓坡上滚动的弹珠。LLA 不再保存机器人草稿本的每一页,而是仅保存那条路径的一个微小的“摘要”,以及一套只有在机器人真正需要阅读时才如何重建特定页面的指令。
可以这样理解:想象你正在看一部电影,主角正走在一条走廊里。在普通的计算机中,你会记录角色每走一步时的全高清照片。这占用了大量的存储空间。但有了 LLA,你意识到角色只是在走直线。所以,与其保存数千张照片,不如保存一张照片并附上一条简单的笔记,比如:“第 2 步向前移动 1 英寸,第 3 步向前移动 2 英寸。”当计算机需要查看第 3 步时的角色时,它可以使用这条笔记快速画出那张图。这正是论文中所做的工作:它压缩了记忆中的“循环”部分,将四页纸变成了一个单一的、微小的摘要,这个摘要可以瞬间被扩展回完整的页面。
研究人员在多个 AI 模型上测试了这种方法,其中包括一个名为 Ouro-1.4B 的模型。他们发现这种方法效果极佳。事实上,在名为 H200 的强大计算芯片上,他们能够同时在内存中容纳 768 场不同的对话,而以前只能容纳 32 场。这在支持更多人同时使用 AI 方面是一个巨大的飞跃。他们还展示了即使在 AI 解决非常长的、困难的数学问题时,这个技巧依然有效,尽管它需要额外的训练,以确保它在自己编写故事而不是仅仅模仿老师时不会感到困惑。
这篇论文对什么说“不”
了解这种方法不是什么非常重要。研究人员首先测试了一个非常简单的想法:“如果我们直接扔掉前三页笔记,只保留最后一页会怎样?”他们认为也许机器人在经过几次循环后会稳定下来并得出最终答案,因此早期的笔记并不重要。他们尝试了这样做,结果却是一场灾难。AI 完全丧失了做数学的能力,在测试中得分竟然为零。这证明了笔记所走的“路径”是至关重要的;你不能只抓取终点,你需要捕捉整个旅程。
他们还将这种方法与其他缩减内存的方法进行了比较,例如将笔记挤压在一起(量化/quantization),或者在不同的大脑部分之间共享笔记(头轴压缩/head-axis compression)。虽然这些方法也有所帮助,但论文表明,压缩“循环”轴才是真正的秘诀。如果你尝试压缩其他部分而不是循环部分,AI 就会失去推理能力。论文明确指出:循环是记忆中最冗余的部分,也是唯一应该进行压缩的地方。
他们的结论有多可靠?
作者对这些结果非常有信心,因为他们是直接进行测量的。他们不仅仅是在猜测,而是让 AI 在解决数学问题(GSM8K)和编写代码(HumanEval)等真实任务上运行。他们展示了通过 4 倍压缩(使内存缩小 4 倍),AI 的表现几乎与原始未压缩版本一样出色。当他们将其推向 21.3 倍的极端压缩时,AI 仍能处理许多任务,尽管在面对最长、最复杂的推理步骤时开始显得吃力。
他们还在另一种不同类型的 AI 模型 Huginn-3.5B 上测试了该方法,该模型具有不同的脑结构,并且会循环多达 32 次。即便如此,该方法依然奏效,证明了这不仅仅是针对某一个特定机器人的偶然现象。论文指出,这种“低秩轨迹”(notes 的平滑路径)是这些循环型机器人思考方式的一个基本属性。虽然他们已经证明了这在节省内存和增加容量方面的有效性,但他们也指出,为了在非常长的任务上获得最佳表现,AI 需要进行第二轮训练,即在它使用自己的压缩笔记进行练习,而不是仅仅模仿老师。这种“策略内”(on-policy)训练修复了当机器人开始编写自己的故事时产生的微小误差。
简而言之,这篇论文表明,通过意识到其记忆具有特定的重复性,我们可以让循环型 AI 模型变得更加高效。通过存储这种重复性的微小摘要而非完整的笔记,我们可以在单个计算机芯片上容纳数百倍的对话,从而在不需要超昂贵硬件的情况下,让更多人能够使用强大的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。