← 最新论文
🤖 machine learning

You Do Not Fully Utilize Transformer's Representation Capacity

本文介绍了层集成记忆(Layer-Integrated Memory, LIMe),这是一种用于 Transformer 的轻量级扩展,它通过利用学习到的路由权重集成来自前序层的表示,来缓解表示坍缩问题,从而在不增加隐藏状态大小的情况下,提升困惑度、任务性能和特征熵。

原作者: Gleb Gerasimov, Yaroslav Aksenov, Nikita Balagansky, Viacheslav Sinii, Daniil Gavrilov

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Gleb Gerasimov, Yaroslav Aksenov, Nikita Balagansky, Viacheslav Sinii, Daniil Gavrilov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能通常依赖于一种被称为“Transformer”的特定计算机程序。这些程序是当今我们使用的许多先进语言工具背后的引擎,能够阅读海量文本并生成类人化的响应。为了理解它们是如何工作的,请想象一位正在处理长篇故事的读者。随着读者从第一句读到最后一句,他们必须追踪每一个细节、每一个角色以及每一个逻辑联系,以理解整个叙事。在标准的 Transformer 中,这种记忆是由一个单一且狭窄的通道处理的,该通道将信息从程序的下一层传递到上一层。每一层都会精炼对文本的理解,并将精炼后的版本向下传递。然而,正如如果太多人试图同时通过一条狭窄的走廊,会导致拥挤并丢失细节一样,这个狭窄的通道可能会迫使程序在处理更长的文本或更深的程序时,模糊不同词汇或想法之间的重要区别。这种被称为“表示坍缩”(representation collapse)的现象意味着——词元(tokens,即文本的基本单位)之间细微但至关重要的差异可能会丢失,从而使模型难以处理复杂的逻辑问题或准确记忆长序列。

来自 T-Tech 的研究人员提出了一种解决这一瓶颈的新方法,引入了一种他们称为“层集成记忆”(Layer-Integrated Memory,简称 LIMe)的方法。这种新设计不再强迫所有信息都挤通过一个单一的、直接的前驱层,而是允许程序的每个部分回溯并直接从它已经处理过的任何先前层中提取信息。想象一下,这相当于给读者在阅读旅程的每个阶段都贴上了一叠便签。当他们遇到一个困难的概念时,他们不再局限于当前手里拿着的那张便签;他们可以回头查看开头、中间或任何位置的便签,选择最相关的细节来帮助他们理解当前的句子。这种方法不需要建造更宽的走廊,也不需要增加存储空间;相反,它只是重新组织了如何访问现有的记忆,使得程序能够从其自身思考过程的早期阶段检索特定的特征。

该团队通过构建能够学习动态路由信息的模型来测试这一想法。他们创建了一个系统,其中每个注意力头(attention head,即程序决定关注哪些单词的部分)都会学习一组权重,本质上是在决定要多大程度上信任来自前一层的层信息,以及多大程度上信任来自第一层或中间任何一层的信息。这个学习过程在训练期间自动完成。研究人员发现,这种灵活性显著提高了模型处理复杂任务的能力。在涉及数学推理和逻辑谜题的测试中,新模型以大幅优势超越了标准版本。例如,在被要求解决具有许多步骤的算术问题时,标准模型往往会随着步骤数量的增加而失败,很可能是因为它们丢失了中间数字。然而,新模型即使在问题变得更加困难时也能保持准确性,这表明它们能更好地保持必要的数值区分。

除了在测试中获得更高的分数外,研究人员还深入观察了模型内部发生了什么。他们发现,标准模型倾向于在向更深层移动的过程中,将不同的单词压缩成几乎相同的表示,从而有效地模糊了它们之间的界限。相比之下,新模型保留了更加丰富多样的表示。承载单词核心含义的内部“值”(value)向量,即使在网络的最深处也保持着独特且多样化的特征。这种细节的保留使模型能够保持不同的推理路径相互独立,这对于需要探索多种可能性或遵循逻辑链的任务至关重要。研究表明,通过允许程序更自由地访问其自身的历史,它可以避免信息过度简化的陷阱。

结果在不同规模和深度的模型中都是一致的。在研究人员构建拥有高达 128 层极其深层网络的实验中,新方法使一个 64 层的模型能够达到甚至超过一个 128 层的标准模型的表现。这表明,信息的流动质量比仅仅在上面堆叠更多层更为重要。研究人员还分析了模型学习到的“路由权重”(routing weights),发现程序系统地利用来自最早层的特征进行长期上下文处理,同时也依赖于相邻层进行短期细节处理。这种模式表明,模型学会了将记忆的负担分布到整个网络中,而不是将其囤积在单一的流中。

虽然这种新方法在计算这些连接时需要少量的额外时间,但与性能和效率的提升相比,这种权衡是微乎其微的。该方法适用于现有硬件,且不需要大规模增加内存,因此是当前系统的实用升级。研究结论指出,标准 Transformer 的局限性不在于缺乏容量,而在于其使用容量的方式存在瓶颈。通过打开层与层之间的信息流,这种新方法释放了更高水平的推理和表示能力,证明了有时最好的前进方式是记住你曾经在哪里停留过。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →