← 最新论文
🤖 machine learning

Structured Recurrent Mixers for Massively Parallelized Sequence Generation

本文介绍了结构化循环混合器(SRM),这是一种新颖的架构,能够实现并行训练与循环推理之间的代数转换,从而在训练效率、信息容量和推理吞吐量方面优于现有的线性复杂度模型,同时在标准基准测试和强化学习任务中展现出显著的性能提升。

原作者: Benjamin L. Badger

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Benjamin L. Badger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对这篇论文的解读。

核心难题:“流水线”与“图书馆”的对立

想象你正在逐字撰写一个故事。

  • 传统模式(循环模型): 这就像一位作家坐在书桌前。他写下一个词,记住它,再写下一个,如此循环。他在写作过程中记忆故事非常高效(内存占用低),但他一次只能写一个词。如果你需要写 100 个故事,就必须等这位作家写完一个,才能开始下一个。
  • 现代标准(Transformer): 这就像一座巨大的图书馆,你可以一次性查阅故事中的每一个词。这对训练非常有利,因为你可以并行阅读整本书。然而,当需要撰写故事(推理)时,图书馆就会拥堵。为了写出下一个词,图书馆必须重新扫描你迄今为止写下的整本书以寻找上下文。随着故事变长,图书馆变得越来越慢,并且需要巨大的空间(内存)来容纳所有这些书籍。

两难困境: 我们既想要图书馆在训练时的速度,又想要单人在生成文本时的效率。

解决方案:“结构化循环混合器”(SRM)

作者提出了一种名为结构化循环混合器(SRM)的新架构。你可以将 SRM 想象成一只变色龙或一位变形金刚(指超级英雄意义上的变形,而非人工智能意义上的):它能根据正在执行的任务改变形态。

  1. 训练期间(图书馆模式): 当模型学习时,它表现得像那座巨大的图书馆。它一次性审视整个词序列。这使得学习既快速又稳定。
  2. 推理期间(作家模式): 当模型实际生成文本时,它会瞬间切换为那位单人作家。它不需要重新扫描整本书;它只需保留一个微小的、固定大小的“笔记本”(缓存),记录刚刚写下的内容。这使其速度极快,并允许同时处理许多故事。

其中的魔法在于,SRM 背后的数学原理允许它在代数层面上在这两种模式之间切换。这就像拥有一张蓝图,上面写着:“如果我们在建造,就使用这些砖块;如果我们住在里面,就使用这些墙壁”,而无需拆毁建筑并重建它。

为何重要:“批次”与“长度”的权衡

这篇论文对如何扩展人工智能提出了一个关键观察:

  • 扩展长度(故事): 论文认为,试图让这些“单人作家”模型阅读无限长的书籍是一个糟糕的主意。最终,作家的记忆(笔记本)会变得太满,开始遗忘细节。这就像试图在一张纸的笔记本里记住一本 1000 页的小说;你会丢失信息。
  • 扩展批次(人群): 然而,这些模型在同时处理许多不同故事方面极其出色。因为它们不需要为每个故事配备巨大的图书馆,你可以让 100 位作家并行工作,处理 100 个不同的故事,而不会互相绊倒。

类比: 想象一家咖啡店。

  • Transformer 就像拥有一台巨型意式浓缩咖啡机的店铺,冲泡一杯拿铁需要 10 分钟,但如果你有一个巨大的柜台,它可以一次冲泡 100 杯。随着订单变得复杂,机器会变慢。
  • SRM 则像是一家拥有 100 台简单、快速的手动冲泡机的店铺。每位冲泡师都能快速制作一杯咖啡,并在脑海中记住配方。你无法让单台冲泡师完成 100 杯的订单(内存太多),但你可以通过使用 1000 台不同的冲泡机,同时为 1000 位顾客提供服务。

结果:速度与容量

这篇论文测试了这种新架构,发现了一些令人印象深刻的数字:

  • 速度: 在标准硬件上,SRM 生成文本的速度比标准 Transformer快 12 倍
  • 并发能力: 它能处理的并发请求(用户)数量是 Transformer 的170 倍
  • 准确性: 尽管速度如此之快且处理了如此多的请求,它并未丧失智能。在数学测试(GSM8k)中,在给定相同算力的情况下,它实际上比 Transformer 多解决了约**30%**的问题。

“强化学习”的转折

这篇论文还探讨了这如何有助于强化学习(通过试错来教导人工智能)。

想象你在教一只狗捡球。

  • 传统方法: 你让狗出去一次。如果它失败了,你再试一次。
  • SRM 方法: 由于 SRM 速度极快,你可以同时派出50 只狗。你检查哪些狗拿到了球,只奖励获胜者。

论文发现,通过一次性生成大量样本并使用一种特殊的“重采样”技巧(确保你有足够多的“好”样本供学习),SRM 的学习效果远优于那些只尝试几次的模型。

总结

结构化循环混合器(SRM) 是一种新的 AI 设计,它集两者之长:

  1. 它像现代并行计算机一样高效地学习。
  2. 它像简单、低内存占用的作家一样高效地生成文本。
  3. 它专为同时处理大规模人群的用户而构建,随着 AI 从“给出一个宏大答案”转向“提供许多快速答案”,这一点变得越来越重要。

论文得出结论:虽然我们经常试图通过让 AI 阅读更长的书籍来使其变得更聪明,但我们反而应该专注于使其在同时处理许多不同任务时变得更快,而 SRM 正是完成这项工作的完美工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →