← 最新论文
💬 NLP

TextLDM: Language Modeling with Continuous Latent Diffusion

本文介绍了 TextLDM,这是一种语言建模框架,它通过将离散令牌经由增强表示对齐(REPA)的变分自编码器(VAE)映射为连续潜在变量,从而将视觉扩散 Transformer(DiT)架构适配于文本生成,在实现与 GPT-2 相当的性能的同时,推动了统一多模态扩散模型目标的实现。

原作者: Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何写故事。长期以来,实现这一目标的标准方法就像一台打字机:机器人打出一个字母,然后是下一个,再是下一个,严格地按顺序进行。这被称为“自回归”(AR)建模。它效果不错,但速度很慢,因为它无法一次性写出整句话;它必须像砌砖一样,一块一块地构建。

另一方面,在教机器人绘画时,科学家们最近发现了一种更好的方法。他们不是逐行绘制,而是从一个充满静态噪声(就像电视雪花)的画布开始,然后慢慢“去噪”,直到清晰的图像显现出来。这被称为扩散(Diffusion)。

这篇论文,TextLDM,提出了一个简单的问题:我们能否用同样的“去噪”方法来教机器人写故事,就像我们用来绘画那样?

以下是他们是如何做到的,通过类比来解释:

1. 问题:词语是离散的,噪声是连续的

主要的障碍在于,词语就像乐高积木。你不可能拥有半块积木;它要么存在,要么不存在。但是,用于图像的“去噪”方法处理的是平滑、连续的颜色(就像混合颜料)。

如果你试图将乐高积木直接变成平滑的颜料,结果通常是一团模糊的混乱。之前尝试将此方法应用于文本的尝试之所以失败,是因为它们为词语创建的“平滑版本”过于混乱,导致机器人无法理解如何将其还原为通顺的句子。

2. 解决方案:“翻译器”(TextVAE)

作者构建了一个特殊的翻译器(称为 TextVAE)。

  • 职责:它将由乐高积木(离散词语)组成的句子翻译成平滑、连续的液体(潜在向量)。
  • 技巧:他们发现,仅仅翻译词语是不够的。这种液体需要是“智能”的。因此,他们添加了一位导师(一个冻结的、预训练的语言模型,称为 Qwen3)。
  • 对齐(REPA):想象翻译器是一个学生,而导师是一位大师级教师。学生尝试翻译词语,但教师不断检查:“这种平滑的液体表示是否捕捉到了词语的真实含义,就像我一样?” 这个过程称为表示对齐(REPA),它迫使翻译器创造出一种“液体语言”,其结构完美地适配去噪过程。

3. 生成器:“去噪雕塑家”(TextDiT)

一旦翻译器准备就绪,实际的写作就开始了。

  • 机器人不再逐字打字,而是从一个装满随机噪声的桶开始(就像电视上的雪花)。
  • 它使用一位雕塑家(扩散 Transformer,或 DiT)慢慢剔除噪声,由翻译器制作的“液体语言”引导。
  • 魔法:因为它在这个平滑、连续的空间中工作,机器人可以一次性生成整个故事,而不是一次一个词。

4. 为什么这很重要(结果)

这篇论文在四个不同的写作挑战中测试了这种新方法(从简单的儿童故事到复杂的百科全书条目)。

  • 速度:因为它并行生成整个故事(就像一次性画完整个画布),而不是顺序生成(像打字一样),所以对于长文本来说,它可以更加高效。
  • 质量:新方法(TextLDM)击败了所有之前的“扩散”文本模型。事实上,它的表现与同等规模的顶级“打字机”模型(GPT-2)一样好。
  • 关键洞察:这篇论文证明,用于制作惊人 AI 图像的精确“配方”(平滑翻译 + 智能导师 + 去噪雕塑家)也完美适用于文本,前提是你用正确的对齐方式修复了“翻译器”。

总结

可以这样理解:以前,用 AI 写作就像一次一小块地塑造黏土。这篇论文表明,如果你先将黏土变成一种完美平滑、智能的液体,你就可以一次性倒出整个形状,得到的结果同样出色,但可能更快、更灵活。他们并没有发明新的黏土;他们只是找到了一种在塑造之前更好地将其平滑化的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →