← 最新论文
🤖 machine learning

LT2: Linear-Time Looped Transformers

本文介绍了 LT2,这是一类线性时间循环 Transformer,它用高效的线性或稀疏变体替代了二次注意力机制,证明了循环机制与这些机制的协同作用能够在语言建模任务中实现更优越的性能和可扩展性。

原作者: Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu, Yuanyuan Xu, Jiarui Liu, T. S. Eugene Ng, Hanjie Chen

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu, Yuanyuan Xu, Jiarui Liu, T. S. Eugene Ng, Hanjie Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢但行动缓慢的图书管理员(即 AI 模型),他需要阅读一本非常长的书来回答一个问题。

旧方法:“循环”图书管理员
传统上,为了让图书管理员变得更聪明,我们让他多次阅读同一本书。这被称为“循环 Transformer"。我们不是雇佣更多的图书管理员(这需要花费大量资金/参数),而是让同一位图书管理员反复阅读这本书,每次重读都进一步 refine 他的理解。

  • 问题所在:这位图书管理员使用了一种极其缓慢的方法来记忆所读内容。每翻一页,他都必须从开头重新阅读整本书,才能找到某个特定的词。如果书很长,这个过程就永无止境。论文将这种现象称为“二次复杂度”。这就像试图在干草堆里找一根针,每走一步都要把每一根干草都检查一遍,周而复始。

新方案:LT2(线性时间循环 Transformer)
这篇论文的作者提出了 LT2。他们保留了图书管理员多次阅读(循环)的理念,但赋予了他一种全新的、超快的记忆技巧。

他们用两种更快的记忆方式取代了缓慢的“检查一切”方法:

  1. 线性注意力:图书管理员不再重读整本书,而是保持一份不断更新的摘要笔记。每当他阅读新的一页,只需更新这份笔记。无论书有多长,这都非常迅速。
  2. 稀疏注意力:图书管理员只查看他最近读过的几页,在特定时刻忽略书中的其余部分。

神奇的协同效应:为什么循环能让这些快速方法变得更好
这是论文发现的巧妙之处。通常,这些快速方法存在弱点:

  • 线性注意力很快,但有时会遗忘细节。
  • 稀疏注意力很快,但无法看到书中较远的内容。

但是,当你循环使用它们(让图书管理员多次阅读这本书)时,这些弱点就消失了:

  • 对于线性注意力:每次图书管理员循环回来,他都有机会* refine *他的摘要笔记。这就像先读一遍草稿,再读一遍修正语法,又读一遍修正情节。“循环”将一份简单的笔记转化为深刻、详尽的理解。
  • 对于稀疏注意力:如果图书管理员只看最后 10 页,他就无法看到开头。但如果他循环 4 次,他实际上就能“看到”40 页!“循环”扩展了他的视野,使他能够看清整本书而不会变慢。

两全其美:混合方法
论文还尝试混合这些方法。想象一个由图书管理员组成的团队,其中:

  • 有些人使用快速的“摘要笔记”方法。
  • 有些人使用“只看最近几页”的方法。
  • 少数特殊的图书管理员仅针对最重要的部分,使用旧的、缓慢的“检查一切”方法。

他们发现,一个混合团队效果最佳。通过在“快速”管理员中混入少量“缓慢、谨慎”的管理员,他们既获得了快速方法的速度,又拥有了慢速方法的准确性。

结果:更快、更聪明、更经济
论文在各种任务上测试了这种方法:

  • 速度:他们的新模型阅读和处理文本的速度远快于旧的循环模型,尤其是在处理长文本时。当书籍变得巨大时,它们不会崩溃或耗尽内存。
  • 质量:在回答问题、解决数学问题和记忆事实方面,它们的表现与旧款、较慢的模型一样好(甚至更好)。
  • 效率:它们仅使用一个微小的 14 亿参数模型,就实现了原本需要庞大且昂贵的 40 亿参数模型才能达到的性能,而且速度快得多。

"Ouro"实验
最后,他们展示了你甚至不必从头构建一位新的图书管理员。你可以取一位现有的、缓慢但聪明的图书管理员(预训练模型),并“教导”他掌握新的快速记忆技巧。这种转换后的模型表现优于其他行业标准的小型模型,证明你可以升级旧系统,使其变得闪电般迅速,同时不损失其智能。

总结
论文指出:“我们发现了一种方法,可以让 AI 模型多次阅读内容(从而变得更聪明),而不会因每次都要检查一切而陷入缓慢的泥潭。通过使用更快的记忆技巧并将它们循环结合,我们得到了既极其聪明又极其快速的模型。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →