DiffusionGemma Technical Report
DiffusionGemma 是一款开源权重语言模型,通过对 Gemma 4 架构进行微调并采用一种计算高效的两阶段流水线,以实现并行块状离散扩散,从而实现了约每秒 1,500 个标记的卓越文本生成速度,进而为推理速度与模型能力之间的权衡建立了新的帕累托前沿。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图写一个故事,但你被迫一次只能写一个字母,从左到右,绝不允许回头看或改变主意。如果你在第一句话中犯了错误,你必须带着这个错误写完剩下的整本书,希望以后能通过添加更多词汇来修复它。这正是大多数现代“智能”计算机程序(称为大语言模型)目前的工作方式。它们就像是一个动作极快但无法按下退格键的打字员。虽然它们非常聪明,但这种“单向”规则会在它们的脑中造成交通拥堵。每当它们想要写下一个词时,它们都必须停下来,记住刚才写下的所有内容,并计算下一步。这使得它们变得缓慢,尤其是当你是一个人使用它们时,因为计算机花在记忆过去的时间比实际思考未来的时间还要多。
科学家们一直在寻找一种方法,让这些计算机能够以“块”而不是字母的形式进行写作,从而允许它们向前看并随着写作过程修正错误,就像人类修改草稿一样。这个想法被称为“扩散”(diffusion)。把它想象成一位雕塑家面对一块被浓雾覆盖的石料。雕塑家不是一次只凿掉一个小碎片,而是观察整个石块,猜测雕塑应该呈现的样子,然后一次性拨开整个形状周围的浓雾。他们重复这个过程,让轮廓越来越清晰,直到雕塑完美无缺。这篇论文介绍了一种名为 DiffusionGemma 的新模型,它尝试使用这种“拨开浓雾”的方法来极速生成文本,同时仍具备解决难题(如数学和编程)的聪明才智。
全新的“拨开浓雾”式作家
谷歌 DeepMind 的研究人员构建了 DiffusionGema,这是一个实验性的计算机模型,它打破了旧有的“一次一个词”的规则。DiffusionGemma 不再是一个字母一个字母地写句子,而是直接一次性编写 256 个词 的大块内容。想象一下你在填满一页笔记本。旧的方法就像是蘸一次墨水,写一个词,抬起笔,思考,再蘸一次墨水,写下一个词。DiffusionGemma 则像是拥有一个能瞬间打印出整个段落的印章。如果印章出了错,它不会就这样继续下去;它会弄脏整个段落,然后再次尝试盖章,但这一次会带着更清晰的预期图像。它一遍又一遍地这样做,并行地精炼整个文本块,直到词语精准到位。
团队并非从零开始构建这个模型。他们从一个非常聪明的现有模型 Gemma 4(该模型总共有约 252 亿 个参数,其中有 38 亿 个在任何时刻处于激活状态)出发,并教会了它一个新技巧。他们使用了两步训练过程。首先,他们向模型展示如何对文本进行“去噪”,教它观察一段混乱、破碎的词块并推导出干净的句子应该是怎样的。其次,他们使用了一种特殊的“强化学习”结合“采样器蒸馏”(sampler distillation)。你可以把这想象成一位教练,他不仅会对模型说“做得好”,还会教它如何更快地完成工作。教练推动模型变得更聪明,同时也教它一旦足够自信时就停止精炼文本,从而节省时间。
速度令人瞠目结舌
结果是惊人的。在单个强大的计算机芯片——NVIDIA H100 GPU 上,DiffusionGemma 每秒可以生成约 1,500 个词。为了让你有个直观的概念,即使是那些拥有最快技巧的传统“老派”模型,通常也只能达到每秒 300 个词 左右。DiffusionGemma 的速度大约是标准版本的 5 倍,并且比目前隐藏在私有付费墙后的其他快速模型快约 2.5 倍。
论文显示,这不仅仅是一个让模型变笨的速度技巧。虽然在某些极难的推理任务上,它比原始的 Gemma 4 模型稍逊一筹,但它仍然极其强大。它可以解决复杂的数学问题,编写代码,甚至理解图像。研究人员发现,通过以 256 个词为一组进行写作,模型每进行一次“思考步骤”就能产生约 20 个词,而旧模型通常每步只能产生 1 个词。这种巨大的效率使其能够绕过通常会减慢计算机速度的内存瓶颈。
为什么这很重要(以及它目前还做不到什么)
论文指出,这种方法为我们使用人工智能的方式打开了一扇新大门。由于该模型可以生成文本的速度极快,它可以用于需要即时响应的任务,例如实时对话或帮助医生在瞬间起草报告。研究人员还展示了该模型的灵活性:如果需要,它仍然可以按照旧有的“一次一个词”的风格写作,它甚至可以在“思考”模式(规划答案)和“快速”模式之间切换。
然而,作者谨慎地指出,这是一个实验性发布版本。它目前还不是旧有模型的完美替代品。他们承认,该模型有时会陷入重复循环(比如不断重复说“the the the”),或者生成的答案比原始模型更短、更简洁。他们还注意到,虽然对于单人使用来说它速度极快,但如果你尝试同时为数百人提供服务,传统的“一个词”模型最终可能会在速度上追上来。但就目前而言,DiffusionGemma 已经建立了一个新的“前沿”,证明了你可以在拥有极致速度的同时兼顾高智能,打破了“必须在两者之间做出选择”的旧规则。
简而言之,DiffusionGemma 表明,未来计算机的写作方式可能不再是缓慢、谨慎的行进,而是思想的快速、同步的精炼——一次性拨开整个画面的迷雾。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。