ELF: Embedded Language Flows
原作者: Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He
原作者: Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:嵌入式语言流(ELF)
问题陈述
扩散模型和基于流的模型已确立其在生成连续数据(如图像和视频)方面的最先进地位。然而,将其应用于语言建模(扩散语言模型或 DLM)却面临重大挑战。当前领先的 DLM 主要在离散 token 上运行,因为语言本质上是离散的。尽管存在连续 DLM,但它们往往难以匹敌离散模型的性能。
现有的连续 DLM 通常受限于以下两种情况之一:
- 与离散空间的紧密耦合:许多方法(例如 Diffusion-LM、CDCD)在连续嵌入空间中执行去噪,但依赖每步的离散化损失(例如交叉熵)或约束(例如单纯形投影),将连续轨迹在每一步都绑定回离散 token 空间。这限制了流动力学的灵活性。
- 架构复杂性:其他方法(例如用于语言生成的潜在扩散)在压缩的潜在空间中运行,需要一个单独训练的解码器将连续表示映射回离散 token,从而增加了推理时的开销和复杂性。
本研究解决的核心问题是:连续 DLM 与离散 DLM 之间的性能差距,是源于语言固有的离散性质,还是源于连续公式中次优的算法设计选择。
方法论:嵌入式语言流(ELF)
作者提出了嵌入式语言流(ELF),这是一类基于**流匹配(Flow Matching)**的连续 DLM,其几乎完全在连续嵌入空间内运行,将离散化推迟到最终生成步骤。
核心公式
- 连续嵌入空间:ELF 使用预训练编码器(例如 T5)将离散输入 token s 映射为连续嵌入 x。与需要单独解码器的潜在扩散方法不同,ELF 使用共享权重的网络同时执行去噪和解码。
- 带整流流的流匹配:模型定义了一条从高斯噪声 ϵ 到干净数据 x 的连续流路径,使用线性插值(整流流):zt=tx+(1−t)ϵ,其中 t∈[0,1]。速度场定义为 v=x−ϵ。
- 预测目标(x-预测):ELF 不直接预测速度 v,而是预测干净嵌入 x。这一选择对于高维表示至关重要,并且与最终解码目标自然契合。
- 双模式训练:
- 去噪模式(大多数步骤):网络使用均方误差(MSE)损失,从噪声输入 zt 预测干净嵌入 x。
- 解码模式(最后一步 t=1):网络切换到“解码”模式。它接收干净嵌入的受损版本(以确保非平凡的训练输入),并通过可学习的解嵌入矩阵 W 将其投影,以生成 token logits。此步骤通过 token 级交叉熵(CE)损失进行监督。
- 权重共享:两种模式使用相同的网络参数,条件是一个二进制的“模式”token。
采样与引导
- 采样:ELF 支持确定性 ODE 求解器,以及一种受 SDE 启发的随机采样器,该采样器在每一步重新注入少量噪声以纠正误差。
- 无分类器引导(CFG):由于 ELF 在连续空间中运行,它天然支持 CFG,这是一种在图像生成中广泛使用但在离散 DLM 中探索较少的技术。作者实现了训练时 CFG,并结合自条件(self-conditioning)(使用上一步的预测作为条件),以在不增加推理期间多次前向传播的情况下引导生成质量。
主要贡献
- 极简离散化策略:ELF 证明,通过将去噪轨迹完全保留在连续嵌入空间中,并仅在最后时间步(t=1)应用离散化,连续 DLM 可以非常有效。这避免了先前连续方法所需的约束和每步监督。
- 统一架构:通过利用共享权重的网络同时执行去噪和解码,ELF 消除了对单独解码器的需求,简化了架构,并相比潜在扩散方法减少了推理时的组件。
- 图像领域技术的适配:连续公式使得直接应用图像扩散中的先进技术成为可能,特别是无分类器引导(CFG)和自条件,这些技术显著提高了生成质量和多样性。
- 数据效率:该方法使用比现有基线少得多的训练 token 即可实现强大的性能。
实验结果
作者在无条件生成(OpenWebText)、机器翻译(WMT14 De-En)和摘要(XSum)任务上评估了 ELF。
- 无条件生成:ELF 优于领先的离散 DLM(MDLM、Duo)和并发的连续 DLM(FLM、LangFlow)。
- 质量与步数:与需要 1024 步的基线相比,ELF 以更少的采样步数(例如 32 步)实现了更低的生成困惑度(Gen. PPL)。
- 数据效率:ELF 使用少 10 倍的训练 token(450 亿对比基线的约 5000 亿+)实现了这些结果,且无需蒸馏。
- 扩展性:扩大模型规模(ELF-B、ELF-M、ELF-L)一致地改善了质量 - 多样性前沿。
- 条件生成:ELF 在 WMT14 De-En(BLEU 26.4)和 XSum(ROUGE-1 36.0)上取得了最先进结果,优于参数量相似的自回归和基于扩散的基线。
- 消融研究:
- 嵌入:预训练的上下文嵌入(冻结的 T5)提供了最佳权衡。
- 预测目标:x-预测优于 v-或 ϵ-预测,特别是在高维情况下。
- 采样器:在少步数 regime 中,受 SDE 启发的采样器始终优于 ODE 采样。
- 引导:CFG 有效地在多样性与质量之间进行权衡,中等尺度(例如 2.0–3.0)产生最佳结果。
意义与主张
该论文声称,ELF 为有效的连续 DLM 提供了一条有前景的途径。结果表明,连续 DLM 与离散 DLM 之间的性能差距并非源于语言固有的离散性质,而是源于未被充分探索的算法设计选择。
通过在连续嵌入空间中构建语言生成,采用连续时间流匹配,并将离散化推迟到最后一步,ELF:
- 实现了将图像扩散中的强大技术(如 CFG)直接迁移到语言领域。
- 以更少的采样步数和显著更小的训练预算实现了卓越的生成质量。
- 提供了一种更简单、统一的架构,无需单独的解码器。
作者得出结论,连续 DLM 具有高度竞争力,所提出的方法代表了基于扩散的语言建模的重要进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。