← 最新论文
💬 NLP

WhiteMatter: All-to-All Cross-Layer Connections via KV Mixing

WhiteMatter 是一种新颖的 Transformer 架构,它通过利用一个路由器将所有层的标记状态混合到一个压缩的 KV 通道集中,从而在自回归解码过程中实现动态、标记自适应的全对全跨层连接,进而提升性能并减少内存占用。

原作者: Wenbo Zhang, Xiang Ren

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenbo Zhang, Xiang Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代生成文本的人工智能依赖于一种被称为 Transformer 的结构,它通过一系列堆叠的层来处理信息。想象一个工厂的流水线,原材料经过第一站,然后是第二站,以此类推,每一站都在对产品进行精炼。在标准设置中,当系统移动到下一段文本时,每个站只能回顾上一层在之前步骤中所做的工作。这意味着,位于堆叠顶端的更深层、更复杂的见解,在处理新信息时,往往无法被底层的早期站点所获取。虽然系统已经创建了丰富的理解历史,但它在如何高效利用这种完整深度方面仍存在困难,从而限制了其追踪长期上下文或解决复杂问题的能力。

南加州大学的研究人员提出了一种名为 WhiteMatter 的新架构来解决这一瓶颈。WhiteMatter 不再将每一层限制在其自身的深度,而是允许系统的每个部分都能访问来自过去每一层的混合摘要信息。该团队构建了一个类似于动态路由器的机制,它将过去单词的所有层级的隐藏状态进行混合,并将其压缩成一组较小的共享通道。当前单词的每一层随后可以从中选择一个通道进行读取。这种设计模仿了人类大脑通过白质纤维连接遥远区域的方式,使得网络的浅层部分能够接收来自过去的深层、经过处理的信息,同时深层部分仍能访问原始的、即时的上下文。

研究人员通过在包含 80 亿个文本标记(tokens)的海量数据集上从头开始训练模型来测试该系统。他们将这种新型 WhiteMatter 模型与同等规模的标准模型以及规模更大的标准模型进行了对比。结果显示,一个拥有 1나十六层的 WhiteMatter 模型表现优于拥有二十四层的标准模型,在预测下一个单词时的错误率显著降低。即使在研究人员将系统所需的内存存储压缩了一半的情况下,这种改进依然实现了,这证明了该模型可以在使用更少内存的同时保持其高性能。研究还表明,该系统可以使用一种特定的迭代方法进行高效训练,这种方法允许计算机一次处理多个单词,而不是被迫像处理此类深层连接时通常要求的那样逐一处理。

核心创新在于系统如何处理过去单词的记忆。在典型设置中,一个单词的记忆是按层存储的,而下一个单词只能访问相同深度的记忆。WhiteMatter 打破了这一规则,它创建了一个基于单词自身内容进行更新的记忆通道池。一个路由器分析过去单词的所有层的隐藏状态,并将它们混合成若干个通道。这些通道的数量是可以调节的;研究人员发现,使用比总层数更少的通道可以减少内存占用,且不会牺牲模型理解复杂文本的能力。这种灵活性使系统更加高效,因为它不需要完整地存储每一层历史的细节,而只需存储最相关的混合信息。

为了在训练阶段实现这一点,研究人员必须克服一个循环依赖问题。因为一个单词的记忆取决于该单词的处理过程,而处理过程又取决于记忆,所以系统无法简单地通过单次传递来计算一切。团队开发了一种称为循环高斯-赛德尔迭代(cyclic Gauss–Seidel iteration)的方法,它对文本进行分组处理。这使得系统能够分阶段更新其理解,使得序列中的后续组可以在同一次传递中立即使用前面组更新后的信息。这种方法被发现比以往需要更多次传递才能达到相同准确度的效率更高,使得训练这种深层互连的模型在标准硬件上变得可行。

实验证实,这种架构不仅提高了生成文本的质量,还增强了模型在各种推理任务上的表现。在标准的语言理解基准测试中,WhiteMatter 模型始终优于与其深度相同的标准模型,甚至超越了规模更大的标准模型。采用半内存配置(即为十六层模型仅使用八个通道)的模型保留了大部分性能增益,同时使用的内存显著少于全缓存。这表明,动态混合所有深度的信息,比单纯增加内存存储的大小更具价值。

研究还探讨了系统在不同训练条件下的表现。研究人员发现,系统在训练期间进行迭代的具体方式对其最终性能有重大影响。使用与最终逐步解码过程高度模拟的调度方案进行训练的模型表现更好且更稳定。然而,即使使用更简单的训练调度,WhiteMatter 模型仍然优于标准模型,这表明架构本身的改变才是性能提升的主要驱动力。研究人员指出,虽然训练过程比标准模型需要更多的计算能力,但在解码过程——即实际生成文本的过程中——速度几乎一致,这使得该系统在实际应用中具有可行性。

在更广泛的人工智能背景下,这项工作解决了深度学习模型在处理信息时的一个基本局限。通过允许每一层访问整个网络历史的综合视图,WhiteMatter 克服了通常困扰深层架构的隔离问题。研究结果表明,这些系统的效率不仅来自于扩大规模或增加深度,更来自于它们如何在内部结构之间连接和共享信息。能够通过压缩过去交互的记忆而不丢失数据的丰富性,为构建更强大、更高效的语言模型提供了一条充满希望的路径。

研究人员总结认为,他们的方法成功整合了深层到浅层的反馈,使得系统能够利用其表示的全部深度。他们证明了这可以在减少内存占用的情况下实现,挑战了“更好的性能需要更多存储”这一假设。虽然训练过程涉及一些额外的复杂性,但在模型实际使用期间获得的准确性和效率增益是巨大的。这项工作提供了一个具体的例子,说明重新思考神经网络不同部分之间的连接可以带来性能的显著提升,为未来人工智能系统的发展提供了一个新的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →