核心理念:一种全新的 AI 写作方式
想象一下你正在尝试写一个故事。
- 旧方法(自回归模型): 这就像是用钢笔在纸上写字。你写下一个词,再写下一个,接着再下一个。一旦你写下一个词,它就固定下来了。如果你写错了,你必须涂掉它或者重新开始写整页。你无法在不重写后续所有内容的情况下,回头去修改第一个词。
- 新方法(Sumi / 均匀扩散模型): 想象你在一块已经布满了静态噪声(就像电视雪花点)的画布上画画。你不是逐字书写,而是同时观察整块画布。你可以选择句子中的任何一个词,把它擦掉,然后换成一个更好的词。你可以反复进行这个过程,同时精炼整个故事,直到它变得完美。
这篇论文介绍了 Sumi(在日语中意为“墨水”),这是一个拥有 70 亿参数的 AI 模型,它采用了这种“绘画”方法。这是首次有人从零开始构建如此规模的模型,并使用这种特定的技术,而不是仅仅对旧有的“钢笔写作”模型进行微调。
他们是如何构建它的:“学校”类比
为了训练 Sumi,研究人员并没有只是把随机的网络文本塞给它。他们策划了一套非常特定的“学校课程”。
- 教科书(预训练): 他们向模型输入了 1.3 万亿个词。但他们并非随手抓取,而是通过过滤数据来优先考虑高质量、具有教育意义的内容。这就像是给 AI 提供了一个装满教科书、百科全书和代码手册的图书馆,同时过滤掉了大量的闲聊、梗图或低质量博客。
- 专业训练(中期训练): 在完成通识教育后,他们给它安排了一场针对三个特定学科的“魔鬼训练营”:编程、数学和逻辑推理。他们在它的饮食中加入了更多的代码和数学题。
- 结果: 由于这种“重教育”的饮食结构,Sumi 非常擅长知识、逻辑和编写代码。然而,因为它摄入的“日常对话”或“常识”类食物不够,它在处理日常常识问题(例如“为什么人们下雨时要带伞?”)时表现得有些吃力。
性能表现:这位“画家”有多厉害?
研究人员将 Sumi 与其他著名的 AI 模型(如 Llama 和 Falcon,它们使用传统的“钢笔写作”方法)进行了对比测试。
- 优势: 在涉及通用知识、推理和编程的测试中,尽管其他模型使用了更多的数据进行训练,Sumi 的表现依然与那些顶尖的“钢笔写作”模型不相上下。
- 劣势: 在需要“常识”(如理解社交情境)的测试中,Sumi 的得分较低。作者承认,这可能是因为他们的训练数据过于侧重于学科知识,而忽略了日常生活。
“画布”实验:寻找甜点位
论文中最有趣的环节之一是他们如何测试模型的“灵活性”。
- 画布大小: 在这个 AI 中,你必须在开始生成之前决定句子的长度。这被称为“画布长度”。
- 发现: 当画布长度正好为 2048 个 token 时,Sumi 的表现最好。
- 如果画布太短,模型会感到困惑并写出乱码。
- 如果画布太长,它也会感到困惑。
- 这就像一位音乐家,如果舞台大小适中,他能完美地演奏一首曲子;但如果舞台太小或太大,他就会失去节奏。
“承诺”之谜:它是如何做决定的?
既然 Sumi 可以随时更改任何单词,你可能会好奇:它是随机猜测,还是有一个计划?
- 发现: 研究人员发现,Sumi 并没有固定的顺序(比如“从头开始”)。相反,它使用了一套“置信度”系统。
- 它观察整个句子并说:“我对这个词很有把握,所以我把它锁定。”“我对那个词不太确定,所以我继续完善它。”
- 这产生了一种自然的顺序:它先锁定容易的部分,把困难的部分留到后面。
- 并行速度: 因为它会先锁定有把握的词,所以它实际上可以同时写多个词(并行解码)来处理编程任务,这比旧有的“一次一个词”的方法更快。
“自我修正”的迷思
这种“绘画”方法的一个主要承诺是,AI 应该能够轻松修复自己的错误。研究人员通过给予 Sumi 额外的修改时间来测试这一点。
- 结果: 出人意料的是,这并没有帮助。 即使允许 Sumi 多次修改答案,它也大多只是改了一个词,然后又改回了原来的词。它并没有在生成过程中真正“学会”如何修正错误。它似乎遇到了一个瓶颈,一旦做出了决定,它就不知道如何改进已确定的答案。
总结
Sumi 是一个大胆的实验,它证明了我们可以从零开始,使用“绘画”方法(均匀扩散)而非传统的“写作”方法来构建强大的 AI。
- 它擅长: 数学、编程和事实知识(因为它刻苦学习)。
- 它一般: 常识(因为它跳过了“有趣”的部分)。
- 它很奇怪: 改变主意(它目前还不太擅长自我修正)。
作者发布了该模型、代码以及喂给它的精确配方,希望其他科学家能利用这些资料,研究如何让这种“绘画”方法变得更加出色。
技术摘要:Sumi —— 从零开始构建的开放式均匀扩散语言模型
问题陈述
尽管扩散模型已成为自回归(AR)语言模型的一个极具前景的替代方案,但在大规模开发**均匀扩散语言模型(UDLM)**方面仍存在显著空白。与不可逆地填充掩码标记的掩码扩散语言模型(MDLM)不同,UDLM 允许在任何步骤更新任何标记,这在理论上能够实现更灵活的生成和自我修正。
然而,目前还没有任何 UDLM 是在大型参数规模(数十亿参数)和大型标记预算(数万亿标记)下从零开始预训练的。现有的规模化 UDLM 要么是针对小规模标记预算训练的计算最优检查点,要么是从预训练的 AR 架构(如 DiffusionGemma)适配而来的。因此,在数据丰富的环境下,原生大规模均匀扩散的行为仍是一个未被探索的领域,缺乏一个清晰的参考基准来研究缩放法则、生成动力学以及相对于成熟的 AR 和 MDLM 基线的权衡。
方法论
模型架构与训练目标
作者引入了 Sumi,一个完全开放的 7B 参数 UDLM。
- 架构: Sumi 使用了一个时间无关的双向 Transformer,包含 36 层、4,096 的隐藏层大小以及 SwiGLU MLP。它采用了分组查询注意力(32 个头,8 个 KV 组)、RMSNorm 以及非对称输入/输出嵌入。为了缓解注意力汇(attention sinks)问题,在注意力机制中应用了 off-by-one softmax。
- 目标: 模型使用**广义插值离散扩散(GIDD)**目标进行训练,特别是在其信噪比(SNR)重参数化形式下。
- 噪声计划: 训练使用纯均匀噪声,其中对数信噪比限制在 λ∈[−9,9]。
- 分词: 使用了 OLMo 3 分词器,词表大小为 100,278。
训练方案
Sumi 在 1.5 万亿个标记上从零开始预训练,使用了 288 块 NVIDIA H100 GPU(总计约 43,308 GPU 小时)。
- 预训练(1.3T 标记): 在序列长度为 1,184、全局批次大小为 4,608 的条件下进行。数据混合比例大幅向教育内容倾斜,这些内容通过由蒸馏后的 Qwen3-32B 分类器生成的教育评分进行过滤和重排序。
- 中段训练(250B 标记): 预训练之后有两个阶段:
- 130B 标记采用原始长度(1,184)。
- 120B 标记采用扩展长度(4,864)。
- 数据混合重心转向代码、数学和推理,其中包含 32.5% 的代码、29.7% 的数学、21.0% 的通用数据和 16.8% 的推理数据。
推理策略
- 画布长度(Canvas Length): 模型在所有评估中使用固定的 2,048 标记画布长度。选择该长度是因为性能在明显变短或变长时会显著下降。
- 采样: 作者探讨了基于置信度的自适应采样与祖先采样(ancestral sampling)的对比。
- 评估协议: 所有评估均使用经过扩散评分修改的
lm-evaluation-harness。对于似然任务,答案之后的位点由随机标记填充;对于生成任务,更新被限制在生成长度内。
核心贡献
- 首个原生大规模 UDLM: Sumi 是第一个在大型参数规模(7B)和大型标记预算(1.5T)下从零开始预训练的 UDLM,为研究原生均匀扩散提供了基准。
- 开放发布: 作者发布了模型权重、检查点以及完整的训练配方,包括在公开语料库上的完整数据混合规格说明。
- 探索性推理探测: 论文展示了关于生成动力学的方向性分析,包括画布长度敏感性、标记承诺顺序、并行解码能力以及自我修正潜力。
结果
基准测试表现
Sumi 在 13 个基准测试(涵盖四个类别)上进行了评估,并与在相当规模标记预算下训练的开源 AR 模型(Falcon-7B, Llama 2-7B, OLMo-7B)进行了对比。
- 通用知识与编程: Sumi 的表现具有竞争力,在相同的协议下,在 MMLU、TruthfulQA、HumanEval 和 MBPP 上取得了最高分。这归功于以教育和代码为主的数据混合。
- 推理与数学: Sumi 在 GSM8K 和 ARC 等任务上与 Llama 2-7B 相当,并优于 Falcon-7B,但在面对更大规模或不同训练方式的模型(如 LLaDA-8B, Llama 3-8B)时仍显落后。
- 常识: Sumi 在常识基准(PIQA, HellaSwag, WinoGrande)上表现显著较差。作者将其归因于教育权重过高的数据混合,这种混合已被观察到会降低常识表现,尽管他们指出该差距可能不仅仅是由数据构成引起的。
推理时观察
- 画布敏感性: 生成的流畅度对画布长度高度敏感。Sumi 在任务相关的区间内(以 2,048 为中心)生成流畅,但在该范围之外(尤其是短画布)性能剧烈下降。
- 承诺顺序(Commitment Order): 虽然训练目标是顺序无关的,但基于置信度的采样诱导了一种自组织的承诺顺序。模型倾向于早期提交确定性的标记,并推迟不确定性的标记,这是一种在祖先采样中不存在的结构。
- 并行解码: 在编程任务(HumanEval, MBPP)上,模型支持适度的并行解码(每步提交最多 4 个标记)且准确率损失极小。然而,多步算术(GSM8K)仍然对顺序敏感,在并行步骤下准确率会立即下降。
- 自我修正: 明确的修订预算(允许额外的去噪过程)并没有产生自我修正。虽然模型会覆盖已提交的标记,但这些编辑主要是“往返”(A→B→A)而非定向改进,最终准确率保持不变。
重要性与声明
论文将 Sumi 定位为研究大规模原生均匀扩散的基础资源。作者强调,他们的推理探测是“方向性的而非结论性的”,旨在激发对 UDLM 中尚不明确方面的未来研究,例如:
- 均匀扩散相对于掩码扩散的内在生成行为。
- 实现自我修正的条件。
- 数据组成对扩散模型特定优势与劣势的影响。
作者明确表示,Somi 是作为预训练基座模型发布的,未经指令微调或安全过滤,旨在支持研究而非直接部署。他们警告称,该模型继承了标准基座语言模型的风险,包括潜在的有害输出和事实错误。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。