← 最新论文
💬 NLP

DiffusionGemma Technical Report

DiffusionGemma 是一款开源权重语言模型,通过对 Gemma 4 架构进行微调并采用一种计算高效的两阶段流水线,以实现并行块状离散扩散,从而实现了约每秒 1,500 个标记的卓越文本生成速度,进而为推理速度与模型能力之间的权衡建立了新的帕累托前沿。

原作者: DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Naba
发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, João Gabriel Oliveira, Nicolas Perez-Nieves, Nastasia Prutianova, Bobak Shahriari, Jean Tarbouriech, Pavel Tyletski, Çağlar Ünlü, Cindy Wu, Glenn Cameron, Jerome Connor, Sertan Girgin, Maarten Grootendorst, Alon Levkovitch, Eliya Nachmani, Omar Sanseviero, Piotr Stanczyk, Quentin Berthet, Andrew Campbell, Clément Crepy, Valentin De Bortoli, Arnaud Doucet, Romuald Elie, Alexandre Galashov, Klaus Greff, Alexis Jacq, David Ruhe, Yu-Han Wu, Sebastian Flennerhag, Brendan O'Donoghue, George Scrivener, Shantanu Thakoor

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图写一个故事,但你被迫一次只能写一个字母,从左到右,绝不允许回头看或改变主意。如果你在第一句话中犯了错误,你必须带着这个错误写完剩下的整本书,希望以后能通过添加更多词汇来修复它。这正是大多数现代“智能”计算机程序(称为大语言模型)目前的工作方式。它们就像是一个动作极快但无法按下退格键的打字员。虽然它们非常聪明,但这种“单向”规则会在它们的脑中造成交通拥堵。每当它们想要写下一个词时,它们都必须停下来,记住刚才写下的所有内容,并计算下一步。这使得它们变得缓慢,尤其是当你是一个人使用它们时,因为计算机花在记忆过去的时间比实际思考未来的时间还要多。

科学家们一直在寻找一种方法,让这些计算机能够以“块”而不是字母的形式进行写作,从而允许它们向前看并随着写作过程修正错误,就像人类修改草稿一样。这个想法被称为“扩散”(diffusion)。把它想象成一位雕塑家面对一块被浓雾覆盖的石料。雕塑家不是一次只凿掉一个小碎片,而是观察整个石块,猜测雕塑应该呈现的样子,然后一次性拨开整个形状周围的浓雾。他们重复这个过程,让轮廓越来越清晰,直到雕塑完美无缺。这篇论文介绍了一种名为 DiffusionGemma 的新模型,它尝试使用这种“拨开浓雾”的方法来极速生成文本,同时仍具备解决难题(如数学和编程)的聪明才智。

全新的“拨开浓雾”式作家

谷歌 DeepMind 的研究人员构建了 DiffusionGema,这是一个实验性的计算机模型,它打破了旧有的“一次一个词”的规则。DiffusionGemma 不再是一个字母一个字母地写句子,而是直接一次性编写 256 个词 的大块内容。想象一下你在填满一页笔记本。旧的方法就像是蘸一次墨水,写一个词,抬起笔,思考,再蘸一次墨水,写下一个词。DiffusionGemma 则像是拥有一个能瞬间打印出整个段落的印章。如果印章出了错,它不会就这样继续下去;它会弄脏整个段落,然后再次尝试盖章,但这一次会带着更清晰的预期图像。它一遍又一遍地这样做,并行地精炼整个文本块,直到词语精准到位。

团队并非从零开始构建这个模型。他们从一个非常聪明的现有模型 Gemma 4(该模型总共有约 252 亿 个参数,其中有 38 亿 个在任何时刻处于激活状态)出发,并教会了它一个新技巧。他们使用了两步训练过程。首先,他们向模型展示如何对文本进行“去噪”,教它观察一段混乱、破碎的词块并推导出干净的句子应该是怎样的。其次,他们使用了一种特殊的“强化学习”结合“采样器蒸馏”(sampler distillation)。你可以把这想象成一位教练,他不仅会对模型说“做得好”,还会教它如何更快地完成工作。教练推动模型变得更聪明,同时也教它一旦足够自信时就停止精炼文本,从而节省时间。

速度令人瞠目结舌

结果是惊人的。在单个强大的计算机芯片——NVIDIA H100 GPU 上,DiffusionGemma 每秒可以生成约 1,500 个词。为了让你有个直观的概念,即使是那些拥有最快技巧的传统“老派”模型,通常也只能达到每秒 300 个词 左右。DiffusionGemma 的速度大约是标准版本的 5 倍,并且比目前隐藏在私有付费墙后的其他快速模型快约 2.5 倍

论文显示,这不仅仅是一个让模型变笨的速度技巧。虽然在某些极难的推理任务上,它比原始的 Gemma 4 模型稍逊一筹,但它仍然极其强大。它可以解决复杂的数学问题,编写代码,甚至理解图像。研究人员发现,通过以 256 个词为一组进行写作,模型每进行一次“思考步骤”就能产生约 20 个词,而旧模型通常每步只能产生 1 个词。这种巨大的效率使其能够绕过通常会减慢计算机速度的内存瓶颈。

为什么这很重要(以及它目前还做不到什么)

论文指出,这种方法为我们使用人工智能的方式打开了一扇新大门。由于该模型可以生成文本的速度极快,它可以用于需要即时响应的任务,例如实时对话或帮助医生在瞬间起草报告。研究人员还展示了该模型的灵活性:如果需要,它仍然可以按照旧有的“一次一个词”的风格写作,它甚至可以在“思考”模式(规划答案)和“快速”模式之间切换。

然而,作者谨慎地指出,这是一个实验性发布版本。它目前还不是旧有模型的完美替代品。他们承认,该模型有时会陷入重复循环(比如不断重复说“the the the”),或者生成的答案比原始模型更短、更简洁。他们还注意到,虽然对于单人使用来说它速度极快,但如果你尝试同时为数百人提供服务,传统的“一个词”模型最终可能会在速度上追上来。但就目前而言,DiffusionGemma 已经建立了一个新的“前沿”,证明了你可以在拥有极致速度的同时兼顾高智能,打破了“必须在两者之间做出选择”的旧规则。

简而言之,DiffusionGemma 表明,未来计算机的写作方式可能不再是缓慢、谨慎的行进,而是思想的快速、同步的精炼——一次性拨开整个画面的迷雾。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →