← 最新论文
💬 NLP

Nemotron-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context

Nemotron-TwoTower 引入了一种新颖的分块自回归扩散架构,将上下文处理与去噪解耦为两个专门的塔,在保留其自回归基准 98.7% 质量的同时,实现了 2.42 倍的生成吞吐量提升。

原作者: Fitsum Reda, John Kamalu, Roger Waleffe, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Fitsum Reda, John Kamalu, Roger Waleffe, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图写一个长篇故事,但你有一个严格的规则:你一次只能写一个词,并且必须在前一个词完全写完之前,不能开始写下一个词。这就是大多数当前 AI 语言模型(称为“自回归”模型)的工作方式。这就像一个非常细心、动作缓慢的打字员,从不出错,但完成一个句子需要很长时间。

现在,想象一种新的方法,你可以一次性输入整个句子,观察它,然后同时修正所有单词中的错误。这种方法速度更快,但通常会导致故事的质量下降,因为 AI 在试图同时修正所有内容时会感到困惑。

Nemotron-TwoTower 是一项新发明,它试图实现两全其美:既拥有同时输入所有内容的效率,又拥有那种细心的、一次写一个词的打字员的高质量。

以下是它的工作原理,使用一个简单的类比:

双塔结构:图书管理员与编辑

研究人员构建了一个由两个截然不同的“塔”(AI 的组成部分)组成的系统,它们像一个两人团队一样协作:

  1. 冻结上下文塔(图书管理员):

    • 角色: 这是一个“专家”,它了解目前为止的故事内容。它是一个预训练的 AI,并且是冻结(锁定)状态的。它就像一位严谨的图书管理员,从头到尾逐词阅读故事。
    • 职责: 它不会改变。它只是完整、有序地记录下目前为止写下的所有内容。它会告诉另一个塔:“这是直到目前为止的故事背景信息。”
    • 为什么重要: 因为它是冻结的,它保留了构建它的那个拥有 300 亿参数的大型模型的原始智能和知识。它永远不会遗忘或感到困惑。
  2. 可训练扩散去噪塔(编辑):

    • 角色: 这是一个“快速工作者”。它是一个可以训练的 AI,允许进行改变和学习。
    • 职责: 它不再是一个词一个词地写,而是抓取一个包含 16 个单词(或 Token)的块,这些单词目前是空白的(被遮盖的)。它观察“图书管理员”的笔记,并尝试同时填补这 16 个空格。
    • 过程: 它不会立即做到完美。它先做一个猜测,然后观察自己的猜测和图书管理员的笔记,并进行精炼。它反复进行这个过程(迭代),直到这一块单词变得清晰且符合逻辑。
    • 神奇之处: 因为它可以同时观察这 16 个单词并一起修正它们,所以它比一个一个写要快得多。

它们如何协同工作(流水线)

想象一个工厂的流水线:

  1. 图书管理员阅读提示词和已经写好的单词,建立起故事的完美心理地图。
  2. 编辑抓取一块空白的纸张(长度为 16 个单词)。
  3. 编辑询问图书管理员:“接下来是什么?”图书管理员提供上下文。
  4. 编辑填补 16 个空格,检查自己的工作并修正错误。
  5. 一旦编辑确信这 16 个单词没问题,它们就会被“提交”(定稿)。
  6. 图书管理员将这新增的 16 个单词纳入其心理地图中。
  7. 编辑抓取下一个 16 个单词的空白块,循环往复。

结果:速度 vs. 质量

论文声称该系统实现了“甜点位”(最佳平衡点):

  • 速度: 它比传统的逐词生成法快了 2.42 倍。这就像是从蜗牛变成了短跑运动员。
  • 质量: 它保留了原模型 98.7% 的质量。它并没有为了获得速度而损失太多智能。
  • 效率: 他们用大约 2.1 万亿个单词训练了这个新的“编辑”塔,这只是原始“图书管理员”所用 25 万亿个单词的一小部分。这意味着他们不需要从头开始重新教整个 AI;他们只是教会了“编辑”如何使用“图书管理员”的笔记。

为什么这与以往的尝试不同

以前的尝试试图使用单个大脑来同时完成两项工作:既要记住故事,又要修正单词。论文指出,这就像要求一个人同时成为完美的记忆守护者和快速的编辑——这工作量太大了,结果导致两项工作都做不好。

通过将角色拆分为两个塔(一个冻结,一个可训练),他们让每个部分都去做自己最擅长的事。图书管理员保持完美,而编辑变得快速。

“置信度”技巧

该系统还有一个聪明的特性——“置信度解掩码”(confidence unmasking)。

  • 如果编辑对某个单词非常有信心,它会立即锁定该词。
  • 如果它不确定,它会留下该单词的空白(遮盖),并在下一轮编辑中尝试修复它。
  • 这意味着它不会在已经确定正确的单词上浪费时间重复检查,而是会将额外的时间花在打磨那些棘手的环节上。

总结

Nemotron-TwoTower 是一种让 AI 文本生成速度更快且不降低智能的方法。它通过将“记住故事”(保持缓慢且完美)的任务与“编写下一块内容”(变得快速且具有迭代性)的任务分离来实现。其结果是,该系统编写故事的能力几乎与旧的缓慢方法持平,但速度快了近两倍。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →