← 最新论文
💻 computer science

Sumi: Open Uniform Diffusion Language Model from Scratch

本文介绍了 Sumi,这是一个从零开始在 1.5 万亿个 token 上进行预训练的完全开源的 7B 参数规模均匀扩散语言模型,它作为研究原生均匀扩散的首个大规模参考基准,并展示了在知识、推理和编程基准测试上的竞争性性能。

原作者: Mengyu Ye, Keito Kudo, Wataru Ikeda, Ryosuke Matsuda, Keisuke Sakaguchi, Jun Suzuki

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengyu Ye, Keito Kudo, Wataru Ikeda, Ryosuke Matsuda, Keisuke Sakaguchi, Jun Suzuki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:一种全新的 AI 写作方式

想象一下你正在尝试写一个故事。

  • 旧方法(自回归模型): 这就像是用钢笔在纸上写字。你写下一个词,再写下一个,接着再下一个。一旦你写下一个词,它就固定下来了。如果你写错了,你必须涂掉它或者重新开始写整页。你无法在不重写后续所有内容的情况下,回头去修改第一个词。
  • 新方法(Sumi / 均匀扩散模型): 想象你在一块已经布满了静态噪声(就像电视雪花点)的画布上画画。你不是逐字书写,而是同时观察整块画布。你可以选择句子中的任何一个词,把它擦掉,然后换成一个更好的词。你可以反复进行这个过程,同时精炼整个故事,直到它变得完美。

这篇论文介绍了 Sumi(在日语中意为“墨水”),这是一个拥有 70 亿参数的 AI 模型,它采用了这种“绘画”方法。这是首次有人从零开始构建如此规模的模型,并使用这种特定的技术,而不是仅仅对旧有的“钢笔写作”模型进行微调。

他们是如何构建它的:“学校”类比

为了训练 Sumi,研究人员并没有只是把随机的网络文本塞给它。他们策划了一套非常特定的“学校课程”。

  1. 教科书(预训练): 他们向模型输入了 1.3 万亿个词。但他们并非随手抓取,而是通过过滤数据来优先考虑高质量、具有教育意义的内容。这就像是给 AI 提供了一个装满教科书、百科全书和代码手册的图书馆,同时过滤掉了大量的闲聊、梗图或低质量博客。
  2. 专业训练(中期训练): 在完成通识教育后,他们给它安排了一场针对三个特定学科的“魔鬼训练营”:编程、数学和逻辑推理。他们在它的饮食中加入了更多的代码和数学题。
  3. 结果: 由于这种“重教育”的饮食结构,Sumi 非常擅长知识、逻辑和编写代码。然而,因为它摄入的“日常对话”或“常识”类食物不够,它在处理日常常识问题(例如“为什么人们下雨时要带伞?”)时表现得有些吃力。

性能表现:这位“画家”有多厉害?

研究人员将 Sumi 与其他著名的 AI 模型(如 Llama 和 Falcon,它们使用传统的“钢笔写作”方法)进行了对比测试。

  • 优势: 在涉及通用知识、推理和编程的测试中,尽管其他模型使用了更多的数据进行训练,Sumi 的表现依然与那些顶尖的“钢笔写作”模型不相上下。
  • 劣势: 在需要“常识”(如理解社交情境)的测试中,Sumi 的得分较低。作者承认,这可能是因为他们的训练数据过于侧重于学科知识,而忽略了日常生活。

“画布”实验:寻找甜点位

论文中最有趣的环节之一是他们如何测试模型的“灵活性”。

  • 画布大小: 在这个 AI 中,你必须在开始生成之前决定句子的长度。这被称为“画布长度”。
  • 发现: 当画布长度正好为 2048 个 token 时,Sumi 的表现最好。
    • 如果画布太短,模型会感到困惑并写出乱码。
    • 如果画布太长,它也会感到困惑。
    • 这就像一位音乐家,如果舞台大小适中,他能完美地演奏一首曲子;但如果舞台太小或太大,他就会失去节奏。

“承诺”之谜:它是如何做决定的?

既然 Sumi 可以随时更改任何单词,你可能会好奇:它是随机猜测,还是有一个计划?

  • 发现: 研究人员发现,Sumi 并没有固定的顺序(比如“从头开始”)。相反,它使用了一套“置信度”系统。
    • 它观察整个句子并说:“我对这个词很有把握,所以我把它锁定。”“我对那个词不太确定,所以我继续完善它。”
    • 这产生了一种自然的顺序:它先锁定容易的部分,把困难的部分留到后面。
  • 并行速度: 因为它会先锁定有把握的词,所以它实际上可以同时写多个词(并行解码)来处理编程任务,这比旧有的“一次一个词”的方法更快。

“自我修正”的迷思

这种“绘画”方法的一个主要承诺是,AI 应该能够轻松修复自己的错误。研究人员通过给予 Sumi 额外的修改时间来测试这一点。

  • 结果: 出人意料的是,这并没有帮助。 即使允许 Sumi 多次修改答案,它也大多只是改了一个词,然后又改回了原来的词。它并没有在生成过程中真正“学会”如何修正错误。它似乎遇到了一个瓶颈,一旦做出了决定,它就不知道如何改进已确定的答案。

总结

Sumi 是一个大胆的实验,它证明了我们可以从零开始,使用“绘画”方法(均匀扩散)而非传统的“写作”方法来构建强大的 AI。

  • 它擅长: 数学、编程和事实知识(因为它刻苦学习)。
  • 它一般: 常识(因为它跳过了“有趣”的部分)。
  • 它很奇怪: 改变主意(它目前还不太擅长自我修正)。

作者发布了该模型、代码以及喂给它的精确配方,希望其他科学家能利用这些资料,研究如何让这种“绘画”方法变得更加出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →