← 最新论文
💬 NLP

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

本文介绍了 Eso-LMs,这是一个新型扩散语言模型家族,它通过使用因果注意力机制融合了自回归与掩码扩散范式,从而实现 KV 缓存与并行生成,进而为无条件生成在速度-质量帕累托前沿面上建立了新的最先进水平。

原作者: Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图写一个故事,但你有两种截然不同的创作方式。

旧方法(自回归模型):
这就像是一个词一个词、从左到右地写句子。你先写“那”,然后思考下一个词是什么,接着写“只”,然后“猫”,以此类推。这种方式非常准确且高质量,但速度很慢,因为在写完前一个词之前,你无法写下一个词。这就像一个人在键盘上打字;他无法同时按下两个键。

“扩散”方法(掩码扩散模型):
现在,想象你有一张空白页,上面的每个词都被一个遮罩(比如“____”)挡住了。你不是一个词一个词地写,而是同时猜出许多个隐藏的词。你可能同时猜出第一个、第三个和第五个词。然后你检查你的猜测,修正错误的词,然后再猜一次。这种方式很快,因为你是同时处理整个页面。然而,由于你在猜测时没有检查之前的工作,你有时会犯错,最终的故事可能不像“旧方法”那样完美。此外,直到目前为止,这种方法一直效率低下,因为每次你做一个猜测,你都必须从头开始重新阅读整个页面,即使是那些你已经解决的部分。

新的解决方案:“异端语言模型”(Eso-LMs)

研究人员创造了一种名为 Eso-LMs(Esoteric Language Models,异端语言模型)的新方法。他们称之为“Esoteric”(异端/深奥),是因为它非常独特,探索了这两种创作方式之间奇特的边界。

把 Eso-LMs 想象成一个混合团队,它结合了两者的优点:

  1. “集体猜测”阶段: 首先,模型表现得像扩散方法。它观察整个页面,并同时猜测一大堆词。这很快,能迅速覆盖大量内容。
  2. “润色”阶段: 一旦这个小组完成了一个良好的开端,模型就会切换到“旧方法”(逐词编写)来填补剩余的空白。

为什么这意义重大?

该论文声称取得了三大突破:

1. “记忆库”(KV 缓存)
在旧的扩散方法中,每当模型猜出一个词时,它都必须从故事开头重新阅读一遍,即使是那些它已经解决的部分。这就像一个学生每想核对一个事实,都要把整本书重新读一遍。
Eso-LMs 引入了一个**“记忆库”**(称为 KV Caching)。一旦一个词被确定下来,模型就会将其保存在记忆中。当它需要猜下一个词时,它只需查看其记忆库,而不是重新阅读整本书。

  • 结果: 对于长篇故事,该模型现在比旧的扩散方法快 14 到 65 倍,比之前的“块”(block)方法快 3 到 4 倍

2. 完美的平衡(“帕累托前沿”)
通常情况下,你必须在速度和质量之间做出选择。如果你想要快,内容就会变得混乱;如果你想要完美,速度就会变慢。
Eso-LMs 创建了一个平滑的滑动比例尺。你可以告诉模型:“我想要 80% 的速度和 20% 的完美度,”或者“我想要 20% 的速度和 80% 的完美度。”

  • 结果: 它创造了新的“最先进水平”(State of the Art)。它不仅仅是处于中间位置;它在所有速度设置下都超越了以往的方法。即使在运行速度极快时,它也不会产生垃圾文本(这是之前的“块”方法存在的问题)。

3. 计算“真实得分”
在机器学习中,很难准确知道一个扩散模型到底有多“好”,因为数学计算通常过于复杂而无法精确求解。
因为 Eso-LMs 使用了一种特定类型的注意力机制(一种模型观察单词的方式),研究人员首次找到了计算该模型精确得分(似然度)的方法。

  • 结果: 这使得更好的训练和测试成为可能,并为使用更高级的技术(如强化学习)来让这些模型变得更聪明打开了大门。

总结

这篇论文提出了一种生成文本的新方法,它结合了同时猜测许多词的速度逐一编写单词的准确性。通过为快速方法添加一个“记忆库”,他们使其变得极其高效,解决了长期以来阻碍扩散模型发展的速度问题。他们之所以称之为“Esoteric”(异端/深奥),是因为它是一种聪明且略显不寻常的结合,将两种不同的哲学巧妙融合在一起,并实现了比两者单独使用都更好的效果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →