Dynamic Multi-Byte Prediction With Hierarchical Language Models
本文介绍了多字节预测(Multi-Byte Prediction, MBP),这是一种用于字节级层级语言模型的创新技术,通过可变长度的预测窗口和保持因果关系的注意力掩码方案并行生成多个字节,从而在不增加参数量的情况下,实现了性能与吞吐量之间的最优权衡,并加速了推理过程。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够理解并生成人类语言的计算机已成为现代生活的重要组成部分,从写作助手到翻译工具皆是如此。这些系统的核心在于一个根本性的挑战:如何将人类语言和文本的无限多样性分解为机器可以处理的可管理片段。多年来,标准的解决方案是将文本切分为“子词”(subwords),即代表常见发音或词部分的微小字母块。虽然这种方法效率很高,但它存在一个缺陷:在处理罕见词汇、新俚语或具有复杂书写系统的语言时表现不佳,往往会将它们分解成尴尬的碎片。另一种被称为“字节级建模”(byte-level modeling)的方法则完全跳过了这些块,直接处理原始字节——即构成屏幕上每个字符的单个数字构建模块。这种方法具有极高的灵活性,可以处理任何语言或符号,而无需预设假设。然而,这其中有一个代价。由于它一次只处理一个极其微小的部分,其速度明显慢于基于块的方法,从而产生了一个瓶颈,使得生成长篇响应时感觉反应迟钝。
俄亥俄州立大学、佛罗里达大学和华盛顿大学的研究人员提出了一种加速这种逐字节处理过程的方法,且无需牺牲原始方法的灵活性。他们引入了一种称为“动态多字节预测”(dynamic multi-byte prediction)的技术,该技术允许计算机一次预测多个字节,而不仅仅是一个。他们成功的关键在于一种新的组织计算机注意力的方式,他们称之为“潜在因果注意力”(Latent Causal Attention)。简单来说,该系统学会了识别属于彼此的自然“段落”或字节组,就像读者看到的是一个短语而非仅仅是一串单个字母一样。该模型不再将每一个字节视为一个独立的步骤,而是将它们分组为这些学习到的段落,并并行地预测整个组。这与以往试图通过为每个未来的标记(token)添加额外的、独立的预测头来提高速度的方法有显著不同,因为后者会增加模型的规模和复杂度。
研究人员在一个层次化架构上构建了他们的系统,该架构首先将长字节流压缩成更短、更有意义的单元,然后再进行处理。随后,他们修改了模型的解码器(即生成输出的部分),使其使用一个智能的单一预测头。这个预测头配备了一个特殊的规则或“掩码”(mask),使它能够回顾之前的字节组以理解上下文,同时能够同时预测当前组内的所有字节。这种设计确保了模型不会访问未来的信息;它在保持语言逻辑流的同时,获得了巨大的速度优势。团队训练了一个拥有 3.73 亿参数的模型,使用了大量的英文文本数据集,并在四项不同的任务上进行了测试:遵循复杂指令、回答问题、总结新闻文章以及在西班牙语、法语和英语之间进行翻译。
结果显示,这种新方法在速度和准确性之间取得了极佳的平衡。在测试的四项任务中,该方法在三项任务中实现了生成速度与文本质量之间的最佳权衡,表现优于其他试图提高生成速度的方法。在翻译任务中,它的准确度略低于最慢但最精确的方法,但其速度明显更快,为实际应用提供了切实可行的改进。一个关键的发现是,该系统不需要为了改变一次预测的字节数而重新进行训练;研究人员只需在生成过程中调整推测候选者的数量即可。当他们使用验证步骤来双重检查预测结果时,系统在保持高质量的同时,速度提升了近 40%。这表明该方法不仅是一个理论上的改进,更是一个实用的工具,可以集成到现有系统中,在无需重新设计或使用更大、更昂贵模型的情况下实现提速。
研究还探讨了当系统被要求预测超过其严格训练处理范围的字节数时会如何表现。他们发现,模型可以成功预测更长的字节序列,尽管这些长距离预测的准确性取决于具体的任务。对于某些任务,如翻译,模型在一次预测最多七个字节时表现最佳;而对于摘要任务,六个字节则是最佳平衡点。有趣的是,系统很少在生成的第一个步骤就接受完整的预测窗口,因为它需要积累足够的上下文来做出自信的猜测。然而,随着生成的进行,模型经常一次性接受整组字节,这表明它已经学会了识别连贯的文本段落。这种根据文本流调整预测长度的能力,而不是被锁定在固定数量的未来标记上,正是该系统能够在保持高效的同时又不失灵活性的原因。
最终,这项工作证明了先进字节级模型中已存在的层次化结构可以被用来解决长期困扰它们的速率问题。通过将学习到的段落作为生成的单位而非单个字节,研究人员创造了一种既快速又准确的方法。该方法不需要额外的参数,并且使用单一的解码器头,使其成为现有架构的一个轻量级补充。虽然实验是在特定的模型规模上进行的,并主要侧重于英语及英语配对语言,但利用学习到的段落进行并行预测的基本原理似乎是稳健的。研究人员指出,未来的工作需要验证这些收益是否同样适用于更大的模型和更多元化的语言,但目前的发现为如何让语言模型在不损害其理解人类交流细微差别能力的前提下,变得更快、响应更及时,提供了一条清晰的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。