BCJR-QAT: A Differentiable Relaxation of Trellis-Coded Weight Quantization
本文介绍了 BCJR-QAT,这是一种对格码权重量化的可微分松弛方法,它用温度控制的 BCJR 和积算法替代了不可微分的维特比 argmax,从而实现了端到端的量化感知训练,并在大语言模型上经验性地超越了当前最先进的后训练量化前沿。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一个庞大的图书库(即大型语言模型),你希望将其缩小,以便能放入普通笔记本电脑或手机中。为此,你需要压缩库中的“单词”(即权重)。
本文介绍了一种名为BCJR-QAT的新方法,可将这些图书进一步压缩至每个单词仅2 比特(这就像将一张高清照片压缩成一张微小且颗粒感十足的缩略图)。
以下是他们如何实现这一目标的简略故事,使用了简单的类比:
1. 问题:“单行道”陷阱
此前,缩小这些模型的最佳方法是一种称为QTIP的技术。可以将 QTIP 想象为一位非常聪明的图书管理员,他查看一页文本后说道:“好的,我将用字典中最近的简单短语来替换这个复杂句子。”
然而,这种方法存在局限。一旦图书管理员做出选择,他就无法回头更改决定以使整本书听起来更好。这就像一条“单行道”。如果图书管理员在早期选了一个略有偏差的短语,整本书都会受到影响,而他无法修正,因为该决定是“硬性”且最终的。
为了解决这个问题,研究人员通常使用训练(QAT),让图书管理员练习并调整其选择。但这里有个关键问题:图书管理员的决策过程涉及一个复杂的迷宫(称为“格状图”)。为了找到穿过迷宫的最佳路径,他们使用一种称为Viterbi的规则,这就像是一个“选择绝对最佳选项”的按钮。
问题在于:你无法让计算机通过一个“选择最佳”的按钮来学习,因为该按钮在数学上是一个死胡同。一旦按下该按钮,计算机就不知道如何微调其选择以变得更好;它只会瞬间跳转到最近的选项。这就像试图只允许汽车瞬间跳入下一条车道来驾驶,而无法进行平滑转弯。
2. 解决方案:“软”决策(BCJR)
作者 Venugopalan Iyengar 发明了一种新方法,让图书管理员得以练习。他们引入了一个称为**温度()**的概念,而不是立即强制做出硬性的“选择最佳”决定。
- 高温(热):想象图书管理员非常放松且优柔寡断。他们不是只选择一个短语,而是同时考虑许多短语,并为每个短语分配一个“概率”。这就像在雾天,你能看到多条路径,而不仅仅是一条。这种“软”视角在数学上是平滑的,意味着计算机可以轻松计算出如何微调选择以改善整本书。
- 低温(冷):随着训练结束,图书管理员变得“冷静”且更加果断。雾气散去,他们瞬间锁定到唯一的最佳短语(即硬决策)。
这种方法称为BCJR,它将“单行道”变成了一条平滑、可行驶的道路。计算机现在可以确切地学习如何调整权重,以使整本书听起来更好,而不仅仅是改善单个句子。
3. “过冲”错误
作者发现了这种“温度”工作机制中一个令人惊讶的怪癖。
在传统物理学中,当你试图寻找最佳解决方案时,通常是从非常热(即非常优柔寡断)的状态开始,以探索所有可能性,然后缓慢冷却。
- 本文的发现:对于这种特定类型的压缩,起始“过热”是一场灾难。如果图书管理员在开始时过于优柔寡断,他们就会 wander 进入一个糟糕的街区(一个“更差的 Voronoi 盆地”)并被困在那里。等到他们冷却下来并试图寻找最佳路径时,他们已经迷失在糟糕的区域,无法返回。
- 解决方法:他们发现,从中等温度(不太热,也不太冷)开始效果最好。这就像带着清晰的地图开始徒步,而不是在雾中盲目 wandering。通过跳过“超级热”阶段,他们避免了迷路,并找到了更好的解决方案。
4. 结果:小型计算机的胜利
该团队在两种不同类型的模型上测试了这种方法:
- “代理”测试(OLMoE):他们尝试仅通过观察模型各层重建自身数据的程度来优化压缩(就像检查复印件是否像原件一样)。结果:失败了。模型的表现实际上比旧方法更差。这让他们认识到,仅仅制作“更好的复印件”并不意味着这本书读起来更好。
- “真实”测试(Llama-3.2):他们优化模型以更好地阅读和理解文本(使用一种称为“蒸馏”的方法,即由一个聪明的教师模型指导学生)。结果:成功了!
- 在模型的特定层上,他们的新方法以微小但显著的幅度击败了旧的最佳方法。
- 当他们将此方法应用于多层时,改进以“超加性”的方式累积(整体大于部分之和)。
5. 引擎内部
执行这些数学运算通常非常缓慢,且需要昂贵的超级计算机。作者还构建了一个专门的“引擎”(一个Triton 内核),能够在单个消费级显卡(如 RTX 4080)上极快地运行这些复杂数学运算。他们将其速度提高了6.5 倍,超过了标准方法,证明了这种先进技术无需数据中心即可运行。
总结
本文提出了一种将 AI 模型缩小以适应消费级设备的新方法。
- 技巧:他们用一种“软”的、可学习的决策过程取代了僵硬的、不可学习的决策过程,并使其逐渐硬化。
- 洞察:你不应该让学习过程起始得“太热”(太随机);适度的起始可以防止模型迷失。
- 成果:当正确训练以理解文本(而不仅仅是复制数据)时,该方法产生的结果优于之前的最先进技巧,并且能在普通游戏 PC 上快速运行。
作者已发布其代码和训练好的模型,以便其他人尝试使用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。