← 最新论文
🤖 AI

Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation

本文介绍了双焦扩散语言模型,特别是 R2LM 架构,该架构通过将因果注意力机制与轻量级的反向 Mamba 侧车相结合,在保持双向上下文的同时实现带有 KV 缓存的并行解码,从而解决了离散扩散模型中生成质量与推理效率之间的权衡问题。

原作者: Yuhang Chen, Xianfeng Wu, Jinhao Duan, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Tianlong Chen

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhang Chen, Xianfeng Wu, Jinhao Duan, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Tianlong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试写一个故事,但你必须一次只能填入一个缺失的词。

旧的方法(自回归/Autoregressive):
把传统的 AI 作家想象成一个非常细心、缓慢的抄写员。为了写出一个句子,它先写第一个词,然后是第二个,接着是第三个。在不知道前两个词的情况下,它无法写出第三个词。这就像一队人传水桶,最后一个人必须等前面的人都传过来了才能拿到水。这种方式很准确,但很慢。

“扩散”(Diffusion)的方法(快速但有缺陷的方法):
为了提高速度,研究人员发明了“扩散”模型。想象一下,你不是一个词一个词地写,而是有一整页文字,大部分单词都被黑墨水(掩码/masks)覆盖了。AI 的任务是同时猜出所有隐藏的词,然后揭开一部分,再猜一次,如此循环往复,直到页面变得清晰。这就像是一个绘画团队在同时处理壁画的不同部分。这要快得多!

大问题:
问题在于,为了准确猜出隐藏的词,AI 需要同时看到整个画面。

  • “双向”(Bidirectional)问题: 如果 AI 同时观察整个画面(左侧和右侧)来猜一个词,它的质量会很高。但这就好像你开车时既要看挡风玻璃,又要不断看后视镜。你无法使用“快车道”(称为 KV 缓存/KV Caching),因为每次向前移动时,你都必须重新扫描整条已经开过的路。当乘客很多时(批处理/batch processing),这会让车变得很慢。
  • “因果”(Causal)问题: 为了使用快车道,AI 只看它已经写出的词(左侧)。它忽略了右侧的一切。这很快,但 AI 对未来的上下文是“盲目”的,因为它不知道句子是如何结尾的,因此经常会犯一些愚蠢的错误。

解决方案:双焦点扩散(“双焦点眼镜”类比)
作者创建了一个名为 Bifocal dLLMs 的新系统。把它想象成戴着一副双焦点眼镜

  1. 主镜片(因果注意力/Causal Attention): AI 戴着它标准的“左眼”镜片。它观察它已经看到的词(左侧)。这使得它能够完美地使用“快车道”(KV 缓存)。它非常高效,并保持了高速度。
  2. 侧镜片(R2LM 侧车/Sidecar): 这是神奇的技巧。在主镜片旁边连接着一个微型、轻量级的“右眼”助手。这个助手是一种特殊的 AI(被称为 Mamba SSM),它会反向运行。它会快速扫描“未来”的词(右侧),并将这些信息压缩成一张小纸条。
  3. 结果: 主 AI 获得了两全其美。它使用左侧的快车道,同时也能通过侧车获得来自右侧信息的“耳语”。它不需要停下来重新扫描整条路,只需瞥一眼那张小纸条即可。

他们是如何测试的:
他们采用了标准的 AI 模型 Qwen3-1.7B,并为其升级了这种“双焦点”功能。他们在海量的文本(600 亿个 token)上对其进行了训练。

结果:

  • 速度: 当同时为许多用户提供服务时(例如繁忙的服务器),他们的新模型比旧的“观察一切”模型快了 2.4 到 12.9 倍。它也比标准的“缓慢抄写员”模型快了 1.9 到 2.9 倍
  • 质量: 尽管速度很快,但它并没有损失准确性。事实上,在大多数测试中,它的表现比标准的“缓慢抄写员”更好,并且通常优于或等于“观察一切”的模型。
  • “插件”功能: 他们展示了你可以拿一个现有的、已完成的 AI 模型,直接“插上”这个侧车镜片,而无需重新训练整个模型。效果出奇地好,证明了这两个部分(主镜片和侧车)可以无缝协作。

总结:
这篇论文介绍了一种让 AI 文本生成既(通过保持“快车道”畅通)又聪明(通过在不减速的情况下窥探未来上下文)的方法。他们称之为“双焦点”(Bifocal),因为就像双焦点眼镜一样,它使用两种不同的机制来清晰地观察全貌,而不会产生通常的权衡取舍。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →