← 最新论文
💬 NLP

Triplet-Block Diffusion RWKV

本文介绍了B3DRWKVB^3D-RWKV,这是一种新颖的架构,通过三元组块布局,将因果 RWKV 模型的O(L)O(L)推理效率与并行双向离散扩散相结合,在实现与现有模型相当的准确性的同时,将解码吞吐量提升了 1.6 倍。

原作者: Ke Lin, Yiyang Luo, Zhaolong Su, Yunya Song, Anyi Rao

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ke Lin, Yiyang Luo, Zhaolong Su, Yunya Song, Anyi Rao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《Triplet-Block Diffusion RWKV》(B3D-RWKV)的解读,将其拆解为简单概念并辅以富有创意的类比。

核心难题:“单行道”与“小组项目”之争

想象两种截然不同的写故事方式:

  1. 严格因果模型(“单行道”):
    把传统 AI 想象成一位只能查看已输入文字的作家。他们从左到右,逐字书写。他们无法看到接下来的内容。

    • 优点: 阅读长文档时速度极快,因为每添加一个新词时无需重读所有内容。
    • 缺点: 生成文本时速度较慢,因为他们无法同时写出两个词。必须写完第 1 个词,才能开始写第 2 个词。
  2. 扩散模型(“小组项目”):
    想象另一种 AI,它从一张布满“乱码”或“掩码”(如 [MASK])的空白页开始。它不是逐字书写,而是同时审视整页内容,猜测缺失的单词应该是什么,修正几个,然后重复此过程,直到故事通顺。

    • 优点: 它可以同时修正多个单词(并行处理),因此潜在速度可能快得多。
    • 缺点: 要做到这一点,它需要同时看到整个上下文(之前的内容和之后的内容)。这通常需要一个非常昂贵且缓慢的计算机架构。

冲突所在: 你很难将这两者混合。“单行道”作家无法向前看,但“小组项目”需要同时审视一切。


解决方案:“三元组块”技巧

作者 Ke Lin 及其同事提出了一种巧妙的训练技巧,称为三元组块布局(Triplet-Block Layout)。他们发现如何教导这位“单行道”作家表现得像一个“小组项目”团队,而无需改变作家的“大脑”。

以下是该技巧的运作方式,使用排练类比

想象你是一位演员(AI),只能从左到右阅读剧本。你需要学习一个场景,其中必须猜测缺失的台词,但为了猜对,你需要知道当前位置之后的台词。

作者为每个场景设置了一个三部分排练

  1. 第一部分(掩码副本): 你阅读场景,但一半的台词被黑胶带([MASK])遮盖。你从左到右阅读此部分。
  2. 第二部分(可损失掩码副本): 你再次阅读完全相同的场景,黑胶带位置不变。这是接受测试的部分。你必须猜测缺失的台词。
    • 魔法时刻: 因为你刚刚阅读了第一部分,你的大脑(AI 的内部记忆)已经吸收了一部分中所有可见的台词。尽管你在第二部分严格地从左到右阅读,但你的大脑已经“知道”场景右侧的上下文,因为那部分信息已在第一部分中被存储。
    • 结果: 你得以在保持从左到右阅读的同时,利用“伪双向”知识(既知晓过去也知晓未来)来猜测缺失的台词。
  3. 第三部分(清洁副本): 你最后一次阅读完整、完美的场景。这将重置你的大脑,让你准备好进入下一个场景。

通过重复这种三元组模式(掩码 -> 掩码/测试 -> 清洁),AI 学会了利用来自“未来”的信息(实际上只是训练序列中的前一个块)来预测缺失的单词,同时保持其原始的“单行道”速度。


结果:既快又准

团队利用这种方法构建了一个名为 B3D-RWKV-7.2B 的模型。以下是他们的发现:

  • 速度: 由于他们保留了“单行道”架构(RWKV),该模型在解码时速度极快。他们声称其速度比同一模型的标准版本快 1.6 倍
  • 智能: 在通用任务(如回答问题或写故事)上,其表现与其他顶级模型一样出色。
  • 权衡: 论文指出,对于需要完美、逐步逻辑的非常复杂的数学问题,扩散的“猜测”性质有时会导致小错误。然而,对于大多数任务,它都能胜任。

一句话总结

这篇论文解决了一个悖论:如何让一位快速、从左到右的作家表现得像一位聪明、全知全能的编辑?

他们的做法是教导作家连续排练三次场景。第一次排练用上下文填充作家的记忆,第二次让他们利用该记忆练习猜测缺失部分,第三次则清空 slate 以准备下一个场景。这使得他们既能保持线性作家的速度,又能获得扩散模型的并行能力。

他们声称的内容:

  • 他们不声称这适用于医疗诊断或临床用途。
  • 他们不声称这是解决所有 AI 问题的灵丹妙药;他们承认其在处理复杂数学结构时略有困难。
  • 他们明确说明没有更改模型的安全功能,因此它继承了原始模型的任何偏见。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →