BlockGen: Flexible Blockwise Sequence Modeling with Hybrid Samplers
本文介绍了 BlockGen,这是一个灵活的块状序列建模框架,它结合了掩码扩散与均匀态扩散以及受自回归(AR)启发的预测器-校正器采样,旨在证明虽然在少步数块对块生成中均匀扩散优于掩码扩散,但随着采样步数的增加和特定块大小的变化,这种性能差距会缩小或发生反转。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正试图写一个故事,但你有两种不同的写作方式。
旧方法(自回归/Autoregressive): 你一次只写一个词,从左到右。一旦你写下一个词,你就把它固定下来,然后写下一个。这种方法快速且可靠,但如果你在第一句话里犯了错,你无法轻易回头修改,除非重写整个部分。此外,因为你只能一次写一个词,所以完成一个长篇故事需要很长时间。
新方法(扩散/Diffusion): 想象你在一页满是随机乱码(比如“xkq#z@!”)的纸上开始写作。这时有一个聪明的编辑,他会同时观察整页内容,并尝试修正其中一些词,使它们变得有意义。接着他再看一次,再修正一些词。他重复这个过程,慢慢地将乱码变成一个完整的故事。这种方法很好,因为编辑可以观察全局并修正页面上的任何错误。然而,这种“一次性处理”的方法通常比较慢,而且最终生成的文章可能不如旧方法那样完美。
最近,研究人员发现了第三种方法:逐块生成(Block-by-Block)。与其一次写一个词或一次处理整页,不如以小块(比如段落)为单位来编写(或修正)故事。你完成第一段,将其固定下来,然后移动到第二段。这让你既拥有旧方法的效率,又拥有新方法的灵活性。
该论文解决的问题
作者 Justin Deschenaux 和 Caglar Gulcehre 注意到,人们在测试这些“逐块生成”模型时存在两个重大问题:
- “随机猜测”问题: 当模型在某个段落中出错时,旧的修正方法只是随机挑选单词进行修复。这就像老师告诉学生:“去改一下你作文里的一个随机单词”,而不是指出哪一个具体的句子读起来不通顺。
- “一刀切”问题: 之前的研究仅使用一种特定的块大小进行测试(例如,始终一次处理 16 个词)。但也许对于某些任务,4 个词一组的效果更好,而对于另一些任务,32 个词一组的效果更好。此前还没有人尝试过混合使用它们。
解决方案:BlockGen
他们构建了一个名为 BlockGen 的新系统。你可以把它想象成一个超级灵活的作家,可以处理任何长度的段落。
- 混合尺寸: 他们没有只训练模型编写 16 个词的块,而是让它在各种尺寸上进行训练:1 个词、2 个词、4 个词,直到 16 或 32 个词。
- 神奇的技巧: 因为模型学会了处理所有这些不同尺寸的块,它掌握了一个秘密:它既能像旧的“自回归”方式那样完美地写出单个词,也能像修正整个段落那样出色。这使得该模型可以充当自己的“验证器”。
新策略:ARPC(“智能编辑”)
论文介绍了一种称为 ARPC(自回归启发式预测器-修正器)的新型文本生成方式。
其工作原理如下(使用创意类比):
想象你正在使用“逐块生成”法编写一个段落。你先生成整个段落的草稿。
- 第一遍处理: 模型快速写出整个段落。
- “智能检查”: 在你锁定该段落之前,模型会快速审视自己的作品。它会问自己:“如果我采用那种‘一步一个脚印’的可靠写法,我会在这里写下什么词?”
- 修正: 如果模型的这个“逐词编写”的猜测与它刚才写下的内容差异很大,它就知道那个特定的词很可能是错的。它只会重写那些特定的错误单词。
这比旧方法聪明得多,旧方法只会随机选择单词进行重写。这就像是老师说“改一下那个随机的词”,而不是说“把那个动词用错的句子改一下”。
他们的发现
作者在数学题(GSM8K)和通用写作(OpenWebText)上进行了测试。
“掩码(Masked)”与“均匀(Uniform)”之争: 在扩散模型领域,有两种主要的“编辑”类型:
- 掩码型(Masked): 编辑只能用一个特殊的“空白”标记来替换单词。一旦空白被填补,就锁定了。
- 均匀型(Uniform): 编辑可以在任何时候将任何词改为任何其他词。
- 之前的发现: 当同时处理整页内容时,“均匀型”编辑表现更好。
- BlockGen 的发现: 当进行简单的单次处理时,“均匀型”编辑仍然更好。但是,当你使用新的“智能检查”(ARPC)时,“掩码型”编辑在处理高质量任务(如数学)时实际上变得略微更好,因为它更精准。
速度与质量: “智能检查”(ARPC)让模型能够非常接近那些传统的、缓慢的“逐词编写”作者的质量,但由于它是一次处理整个块,所以速度更快。
权衡: 论文承认,训练这种灵活的模型比训练标准模型更昂贵(需要更多的计算能力)。此外,他们的模型目前仍然比现在大型科技公司使用的巨型 AI 模型要小,因此目前还不能声称这适用于所有可能的任务。
总结
论文介绍了 BlockGen,这是一个能够学习以不同尺寸块进行写作的灵活 AI。通过结合这种灵活性与一种利用模型自身知识来寻找并修复特定错误的“智能检查”系统(ARPC),他们创造了一种既比逐词编写更快、又同样准确,且比以往“全盘修正”方法更聪明的方法。他们证明了虽然“均匀型”方法通常很强,但使用这种智能修正方法后,规则发生了变化,使得“掩码型”方法在处理复杂任务时展现出了惊人的竞争力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。