Multi-Bitwidth Quantization for LLMs Using Additive Codebooks
本文介绍了 Drop-by-Drop,一种新颖的训练后量化框架,该框架利用加性码本和 Matryoshka 式监督,使单个 LLM 检查点能够支持自适应、多位宽推理,同时在保持各种模型架构竞争性准确度的同时,实现极低的存储开销。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这里是对论文《使用加性码本进行大语言模型多位宽量化》(引入 Drop-by-Drop 技术)的通俗易懂且富有创意的解释。
核心问题:并非所有尺寸都适用
想象你拥有一座规模宏大、细节极其丰富的知识图书馆(即大语言模型或 LLM)。这座图书馆非常庞大,需要一个巨大的仓库来存放。
- 云端: 如果你在云端的超级计算机上运行这个图书馆,你会有充足的空间。你可以保持每一本书都处于打开状态,阅读最精细的细节。
- 手机: 如果你尝试在智能手机或小型边缘设备上运行同一个图书馆,仓库就太大了。手机的内存(RAM)和电池无法承受如此庞大的体积。
目前的解决方案(“静态”方法):
现在,如果你想在不同设备上使用这个图书馆,你必须制作多个副本:
- 一个用于超级计算机的“豪华版”(高质量,超大体积)。
- 一个用于手机的“口袋版”(压缩后,质量较低)。
- 一个用于平板电脑的“旅行版”(中等大小)。
这是低效的。你必须为同一个图书馆训练、存储并维护三个不同的版本。如果你想从手机切换到平板电脑,你必须更换整个文件。
新的解决方案:“Drop-by-Drop”
作者提出了一种名为 Drop-by-Drop 的新方法。他们不是制作三个不同的图书馆,而是创建了一个单一的图书馆,它可以根据所在的设备神奇地缩小或扩大,而无需重新训练或更换。
不要把这个图书馆看作是一叠书,而要把它看作一个俄罗斯套娃(Matryoshka doll)。
- 外壳: 最小、最基础的版本。它可以装进你的口袋,但只知道最重要的事实。
- 中间层: 如果你打开外壳,你会发现一个稍大一点的娃娃,拥有更多的细节。
- 核心层: 拥有每一个细节的全尺寸娃娃。
通过 Drop-by-Drop,你不需要携带三个不同的娃娃。你只需携带一个。
- 在手机上,你只需使用外壳。
- 在平板电脑上,你打开外壳以使用中间层。
- 在超级计算机上,你完全打开它以使用完整的核心。
它是如何工作的:“加性码本”配方
为了让这种嵌套结构生效,作者使用了一种称为**加性量化(Additive Quantization)**的技术。
想象你正在通过电话向别人描述一幅复杂的画作。
- 标准方法: 你先发送一张低分辨率的照片(模糊的)给手机,再为计算机发送一张高分辨率的照片。这是两个不同的文件。
- Drop-by-Drop 方法: 你先发送一个基础草图。
- 如果听众的屏幕很小,他们就在此停止。他们得到了画作的大致轮廓。
- 如果他们的屏幕更大,你再发送第二层:增加一些线条来定义形状。
- 如果他们的屏幕非常大,你再发送第三层:最后的色彩和细节。
神奇之处在于,第二层和第三层如果没有第一层就毫无意义,但第一层本身就是完美的。这些层是“加性”的——它们相互叠加,共同构建出一幅更清晰的图像。
秘诀:“套娃式”训练
通常,当你训练一个用于压缩数据的 AI 时,它会学习如何制作出最好的最终图像。它并不关心前几层看起来是否糟糕。如果过早停止,图像就会变得一团糟。
作者引入了一种特殊的训练规则,称为套娃监督(Matryoshka Supervision)。
- 类比: 想象一位老师在给学生的作文评分。
- 旧方法: 老师只对最终的 10 页作文进行评分。如果学生只写了 1 页,老师会说:“这简直是垃圾,我没法评分。”
- Drop-by-Drop 方法: 老师会在每一个阶段都进行评分。“好的,第 1 页是一个很好的摘要。第 3 页增加了不错的细节。第 10 页非常完美。”
- 结果: 因为 AI 被训练为确保每一个部分版本(1 层、2 层、3 层)都是准确的,所以当你处于小型设备时,你可以安全地“丢弃”额外的层,剩下的层依然能完美运行。
为什么这很重要(根据论文)
- 一个模型,多种设备: 你只需要存储和下载一个文件。设备会根据其内存决定“拆解”多少内容。
- 无需重新训练: 你不需要为每种手机或平板电脑训练一个新模型。单个模型可以自动适应。
- 平滑过渡: 当你从低功耗设备转向高功耗设备时,质量会平滑提升,而不是在不同且不兼容的模型之间跳跃。
- 理论证明: 论文使用数学(信息论)证明了这种“嵌套”方法对于 LLM 使用的数据类型在理论上是可行的,从而确保通过添加这些层不会损失效率。
总结
Drop-by-Drop 将一个僵化的、一刀切的 AI 模型变成了一个灵活的、“智能”的模型,它可以缩小到装进你的口袋,也可以扩展到填满一台超级计算机,而这一切都源于同一个文件。它通过训练 AI 使其在每一个细节层级都表现出色,而不仅仅是针对最终的最详细版本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。