← 最新论文
🤖 machine learning

Block-Based Double Decoders

该论文提出了“基于块的双解码器”,这是一种新颖的 Transformer 架构,它通过利用双重因果块状注意力掩码,将仅解码器模型的训练效率与编码器 - 解码器模型的推理效率相结合,从而在显著降低内存和计算成本的同时实现卓越的扩展性能。

原作者: Asher Labovich, Benjamin Bradley, Vanessa Alexander, Chaitanya Harsha

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Asher Labovich, Benjamin Bradley, Vanessa Alexander, Chaitanya Harsha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人写故事。长期以来,主要有两种方法可以实现这一目标,但两者都存在一个重大缺陷。

两种旧方法

  1. “单人表演”(仅解码器): 这就像一个学生读完一本书后立即尝试写出下一句话。他们写作速度非常快,但在写作时必须在大脑中记住迄今为止读过的所有内容。如果故事很长,他们的大脑(内存)就会过载,导致速度变慢。
  2. “双人团队”(编码器 - 解码器): 这就像有一个“读者”和一个“写手”。读者先读完整本书,做笔记,然后将笔记交给写手。这节省了写手的大脑算力,但读者非常挑剔。他们只记录大约 15% 的单词(即“被破坏”的部分),而忽略其余部分。这意味着团队学习缓慢,因为他们忽略了故事的大部分内容。

新方案:基于块的双解码器

本文的作者提出了一种新的团队结构,试图兼得两者的优点。他们称之为基于块的双解码器

以下是其工作原理,使用一个简单的类比:

想象你在阅读一部长篇小说,但不是逐字阅读,而是将其拆分为(如章节或场景)。

  • 上下文解码器(读者): 这部分读取直到某个点之前的整个故事。它就像一个快速阅读者,扫描前几章以理解背景和人物。由于它只读取“过去”,因此无需一次性将整个书的内容保存在内存中。它会生成一个摘要。
  • 生成解码器(写手): 这部分接收来自读者的摘要以及当前的文本块。它负责撰写故事的下一部分。

魔法技巧:“双重因果”块

秘诀在于他们如何分割故事。他们将文本切成块(chunks)。

  • 在单个块内部,写手可以查看该块中的所有单词(就像小组讨论)。
  • 但在查看之前的块时,写手只能查看读者提供的摘要,而不能查看原始单词。

为什么这很重要?

  1. 不再浪费学习机会: 在旧的“双人团队”中,读者忽略了 85% 的单词。在这个新系统中,每一个单词都有机会被学习。模型会对每个 token 进行“评分”,使其学习得更快、更聪明。
  2. 超高效内存: 当机器人实际撰写故事(推理)时,它不需要记住整本书。它只需要记住来自读者的摘要和当前块。这将所需的内存减少了约三分之二。这就像从背包里背着一座图书馆,变成了只带一张索引卡。
  3. 速度: 由于“读者”部分仅在开始时运行一次,然后处于空闲状态,因此“写手”部分要轻量得多,速度也更快。这就像在赛跑开始时使用重型引擎,但在冲刺阶段使用轻量级、空气动力学的车身。

他们发现了什么?

研究人员将这种新架构与旧架构进行了测试。

  • 训练: 新模型的学习效果几乎与“单人表演”(速度的黄金标准)一样好,并且远优于旧的“双人团队”。
  • 写作(推理): 当需要实际生成文本时,新模型表现出色。它使用的计算机内存显著少于旧的“双人团队”,速度也更快,同时依然非常智能。

结论

该论文声称,通过将工作拆分为两个解码器并将文本拆分为块,他们创建了一个能够从每一个单词中学习(不同于旧的高效模型)的模型,但在需要写作时不会因内存问题而受阻(不同于旧的快速模型)。这是一种获得高性能机器人的方法,而无需依赖庞大且昂贵的计算机来运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →