想象一下,你正在尝试教一个机器人阅读和写作。长期以来,标准做法是给机器人一本“词块”(如整个单词或常见音节)字典,并教导它严格从左到右、一次一个词块地进行阅读。这种方法效率很高,但将机器人的理解能力限制在了那些特定的词块上。
最近,研究人员尝试了两种更新、更激进的想法:
- “原始字节”方法:与其给机器人一本词块字典,不如给它原始的字母表(每一个字母和符号)。这就像通过展示字母表中的单个字母,而不是预先制作好的单词,来教机器人阅读。这种方法更具普适性,因为它能阅读任何内容,但句子会变得极其漫长。
- “扩散”方法:与其从左到右阅读,不如教导机器人一次性猜测整句话,按任意顺序填补空白,就像解拼图一样,你可以将碎片放在任何位置。
本文研究了将这两种激进想法结合起来会发生什么:教导机器人使用拼图方法来阅读原始字母。
重大发现:工具的不匹配
研究人员发现,虽然机器人如果按顺序(从左到右)逐个阅读原始字母,最终能够学会阅读,但当它试图像解拼图一样阅读原始字母时,却表现得极其糟糕。
以下是使用简单类比进行的分解:
1. “从左到右”的读者(自回归)
想象你正在一块砖一块砖地砌墙。
- 使用词块(标准方法):你拥有预制的砖块组合(单词)。你只需将它们堆叠起来。这很快。
- 使用原始字母:你必须堆叠单个砖块。这需要更多时间和工作,但由于你是直线构建,你可以轻松看到模式。一旦你砌好一个单词的前几块砖,该单词的其余部分就变得显而易见。机器人学会了根据前一个字母来“预测”下一个字母。
- 结果:尽管起步较慢,机器人最终会赶上来。如果你给它足够的时间和砖块,它就会学会像人类通过拼读字母来学习阅读一样,自行识别单词模式。
2. “拼图”读者(扩散)
想象你正在尝试解一个拼图,但你可以拿起任何一块碎片,并试图同时将其放入板上的任何位置。
- 使用词块(标准方法):拼图碎片很大且独特(比如猫眼的图案)。因为“猫眼”碎片有清晰的形状,所以很容易猜出它应该放在哪里。
- 使用原始字母:拼图碎片是微小的、无意义的尘埃点(单个字母)。单个字母"e"本身并不能告诉你太多信息。
- 问题:在拼图中,你需要上下文才能知道碎片该放在哪里。如果你将碎片随机散落,并要求机器人在没有明确顺序的情况下猜测它们的位置,它就会迷失方向。论文将这种现象称为**“上下文脆弱性”**。
- 当机器人试图猜测单词中间的字母,却不知道前后是什么时,它毫无头绪。
- 与能够建立稳定历史的“从左到右”读者不同,“拼图”读者不断破坏上下文。这就像当你刚写完几个词,就有人不断擦除它们,而你却试图完成句子。
“效率差距”
该论文进行了大规模实验,以观察这些机器人变好需要多少“计算能力”(能量和时间)。
- 从左到右的机器人:使用原始字母学习比使用词块学习需要稍多一点的能量,但随着机器人变得更聪明,这一差距会缩小。最终,它的效率几乎与词块读者相当。
- 拼图机器人:差距巨大且永远不会缩小。要让拼图机器人的表现达到词块读者的水平,你需要给它数百万倍的计算能力。论文指出,虽然从左到右的机器人可能在 1022 次运算的预算下赶上来,但拼图机器人可能需要 1026 次运算才能勉强接近。
为什么会发生这种情况?
研究人员进行了一些侦探式的工作以找出原因。他们发现:
- 原始字母需要“故事”才有意义。 如果没有周围的字母,单个字母是无意义的。
- “从左到右”的方法自然地构建了这种故事,使机器人能够学习到"q"后面通常跟着"u"。
- “拼图”方法破坏了这种故事。通过试图按随机顺序猜测碎片,它破坏了“局部连续性”(即字母按特定顺序相邻排列的事实)。如果没有这种稳定的顺序,无论机器人练习多少次,它都无法理解原始字母的含义。
结论
该论文得出结论,虽然尝试构建一个能阅读原始字母的“通用”机器人是一个很好的想法,但你用来教导它的方法至关重要。
如果你教导它按顺序(从左到右)阅读,它就能高效地学会处理原始字母。但是,如果你试图教导它以随机的“拼图”风格阅读,原始字母对于机器人来说太过脆弱和破碎,使其无法理解。要让拼图方法与原始字母配合工作,我们需要发明全新的方法来帮助机器人记住句子的“故事”,否则它将保持极低的效率。
技术摘要:字节建模中的效率差距
问题陈述
现代大型语言模型(LLM)在历史上一直依赖两种结构先验:子词分词(例如 BPE、WordPiece)和自回归(AR)排序。尽管这些选择行之有效,但它们也带来了特定的局限性:子词分词充当固定的压缩层,可能会阻碍模型对分布外模态的泛化能力;而自回归排序则强制施加单向偏差,可能削弱非序列推理中的前瞻规划能力。
为了绕过这些限制,两种替代范式应运而生:
- 字节级建模:通过在原始 UTF-8 字节上直接操作,绕过静态的、统计推导出的词汇表,从而提供通用性。
- 掩码扩散建模(MDM):通过顺序无关的推理进行并行、非序列生成。
这两种范式的交集代表了一个完全端到端、模态无关的生成原型。然而,移除子词分词和因果排序等结构先验会带来巨大的计算成本。本文解决的核心问题是量化这一成本,并理解数据表示(字节与子词)与建模目标(自回归与掩码扩散)之间的相互作用如何影响扩展效率。
方法论
作者采用计算匹配扩展研究,以隔离建模目标与数据表示之间的相互作用。为了确保基于总浮点运算次数(FLOPs)的公平比较,他们在 48M 到 1.23B 非嵌入参数的参数范围内,利用标准的 Transformer 骨干网络进行了参数扫描。
- 数据与分词:模型在 Slimpajama-627B 数据集上进行预训练。比较了两种输入表示:
- 字节级:原始 UTF-8 字节映射到大小为 V=256 的词汇表。
- BPE 级:标准 Llama 2 分词器,V=32,000。
- 归一化:上下文窗口被归一化,以便在每一步处理相同体积的原始数据(字节模型为 8192 字节,BPE 模型为 1792 个 token)。
- 目标:
- 自回归(AR):标准的因果掩码。
- 掩码扩散(MDM):双向注意力机制,结合连续时间离散扩散框架,训练时使用线性掩码,推理时使用余弦掩码。
- 评估指标:使用**每字节比特数(BPB)**作为统一指标,将预测性能相对于原始数据集大小进行归一化,使其与离散化策略解耦。
- 机制分析:本研究包括受控的排列实验,以调查“上下文脆弱性”。这些实验对序列应用静态排列(全局随机、块间和块内),以衡量破坏局部连续性和全局因果顺序对模型性能和数据压缩性(使用 DEFLATE 和其他算法作为代理)的影响。
主要结果
1. 分化的扩展轨迹
字节建模的性能惩罚并非均匀的;它高度依赖于建模目标。
- 自回归(AR)模型:AR 字节模型起初落后于 BPE 对应模型,但随着规模扩大,逐渐收敛至性能持平。在高计算预算下(F≈1022 FLOPs),差距显著缩小,这表明 AR 模型可以通过其稳定的因果历史来分摊原始字节处理的成本。
- 掩码扩散(MDM)模型:相比之下,字节级 MDM 与 BPE MDM 相比表现出持续且巨大的性能差距。即使增加容量和计算资源,它们也无法缩小这一差距。等 FLOPs 外推表明,虽然 AR 模型在 F≈1.3×1022 时达到持平,但 MDM 可能需要高达 F≈4.2×1026 的预算才能实现类似的持平。
2. 下游任务性能
在零样本推理基准(ARC-Easy、BoolQ 等)上的评估证实了 BPB 趋势:
- AR 字节模型表现出具有竞争力的性能,随着容量增加,其与 BPE 基线的差距逐渐缩小。
- MDM 字节模型陷入停滞。尽管获得了使 AR 模型受益的相同容量增加,MDM 字节模型的性能却出现波动,未能显示出有意义的扩展,始终表现低于其 BPE 对应模型。
3. 机制洞察:上下文脆弱性
该论文确定上下文脆弱性是造成这种差异的根本原因。
- AR 中的涌现分割:对 AR 字节模型预测熵的分析表明,它们自然地学会将高熵区域与子词单元(BPE 边界)的起始位置对齐。稳定的因果历史允许 AR 模型在初始字节建立后,解决词单元内的字节间转换。
- MDM 中的脆弱性:MDM 目标破坏了从原始字节解析语义所需的局部连续性。在没有保证的因果历史或预组合语义单元的情况下,模型必须从碎片化上下文的组合集中解析语义。
- 排列实验:受控实验表明,字节模型对序列完整性的丧失具有独特的敏感性。虽然保留局部连续性(块间排列)有助于恢复,但破坏全局因果顺序(块内排列)会严重影响性能,在某些指标上甚至比全局随机打乱的影响更为严重。这证实了字节级文本扩散存在根本性的结构不匹配:它在没有子词 token 封装且缺乏因果历史稳定锚点的情况下,在细粒度单元上运行。
意义与主张
该论文主张,绕过预建模子词分词的可行性并非普遍适用,而是取决于建模目标。
- 目标依赖的效率:字节建模的计算惩罚对于顺序无关的目标(MDM)要远大于因果目标(AR)。
- 结构不匹配:研究结果表明,扩散的顺序无关性质与细粒度的字节级表示相互作用不佳。缺乏预组合的语义单元以及稳定因果历史的缺失,造成了一种“上下文脆弱性”,阻碍了字节体制下的有效扩展。
- 未来方向:作者总结道,未来旨在结合字节级表示与扩散目标的模态无关设计,必须引入替代性结构偏差(例如分层掩码、最优词汇表或混合骨干网络),以维持可行的扩展轨迹。他们并未声称字节级 MDM 是不可能的,而是指出需要特定的架构调整来克服已识别的效率差距。
这项工作提供了对数据表示与建模目标之间权衡的基础性理解,强调仅仅移除分词器不足以实现高效的并行生成,除非解决数据底层的结构依赖关系。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。