← 最新论文
💻 computer science

CLHA: Cross-Layer Hessian Aggregation for Quantizing Weight-Shared Mixture-of-Experts Transformers

本文介绍了 CLHA,一种用于权重共享混合专家(Mixture-of-Experts)Transformer 模型训练后量化的跨层 Hessian 聚合方法,该方法通过结合共享层之间的 Hessian 统计信息来最小化总重构误差,在显著优于现有逐层校准方法的同时,还解决了 Hessian 估计中关键的实现陷阱问题。

原作者: Kunal Dhanda

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Kunal Dhanda

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:缩小一座巨大的图书馆

想象一座巨大的图书馆(大型语言模型),它太大了,无法放进一个小书架。为了让它能放得下,我们需要对书籍进行“压缩”。在人工智能领域,这种压缩被称为量化(Quantization)。这就像是将一张高清照片缩小成一张缩略图。如果你做得不好,图片就会变得模糊且无法辨认。

这篇论文研究的是一种特定类型的图书馆,叫做混合专家模型(Mixture-of-Experts, MoE)。这些图书馆很特别,因为它们不会针对每个问题都阅读所有的书;它们拥有“专家”(专门的区域),只有在需要时才会开启。

最近,工程师们发明了一个聪明的技巧,叫做跨层权重共享(Cross-Layer Weight Sharing, CLWS)。想象一下图书馆里两个不同的楼层(层 A 和 层 B)使用完全相同的一套参考书作为他们的专家。这节省了大量的空间,因为你不需要为同一本书购买两份副本。

问题所在:
当人们试图缩小(量化)这些图书馆时,他们犯了一个错误。他们把共享的书籍视为仅属于第一层的书籍。他们观察了层 A 提出的问题,决定如何缩小这些书,并将这种缩小方案应用到了层 B 的书籍上。

但问题在于:在层 A 提问的人与在层 B 提问的人是不同的。随着你走上楼梯,问题的“氛围”也在发生变化。由于只观察了层 A,这种缩小计划对层 B 来说是错误的,导致图书馆失去了正确回答问题的能力。

解决方案:CLHA(“双重检查”系统)

作者提出了一种名为 CLHA(跨层 Hessian 聚合)的新方法。

类比:裁缝与双胞胎西装
想象一位裁缝正在为一对完全相同的双胞胎制作西装。

  • 旧方法 (PLIC): 裁缝测量了双胞胎 A,剪裁了布料,并假设双胞胎 B 的尺寸完全一样。但双胞胎 B 的姿势略有不同。这套西装完美契合 A,但在 B 身上却显得太紧了。
  • CLHA 方法: 裁缝同时测量了两个双胞胎。他们获取了 A 和 B 的测量数据,并将它们进行平均(给予在房间里出现频率更高的人更多的权重),从而创造出一个能完美适配两个人的“超级西装”版型。

用技术术语来说,论文指出你不应该只看一个层的数据。你必须结合两个层的“敏感度”(数学上称为 Hessian)。这创建了一个组合图谱,能够精确地告诉你如何缩小共享权重,使其在两个楼层都能表现良好。

特殊升级:CLHA-MP

论文还引入了一个“混合精度”版本,称为 CLHA-MP

类比:VIP 休息室
在这些图书馆中,有两种类型的专家:

  1. 路由专家 (Routed Experts): 它们只为特定的、罕见的问题打开大门。
  2. 共享专家 (Shared Experts): 它们是“始终开放”的,处理最常见、日常的问题。

因为“共享专家”被使用的频率更高,所以它们对误差更加敏感。如果过度缩小它们,整个图书馆就会崩溃。

  • 解决方法: CLHA-MP 为这些“始终开放”的专家提供了额外的空间(多出一位精度的比特)。这就像是给 VIP 休息室开了一扇稍宽的门,而保持普通门窄小一样。这微小的额外空间对图书馆的运作效果产生了巨大影响。

隐藏陷阱:“幽灵”钩子

作者还在用于构建这些模型的软件工具(PyTorch)中发现了一个隐蔽的 Bug。
类比: 想象两个人试图同时在同一个笔记本上写字。如果两人都使用没有标签的同一支笔,他们的笔记就会混在一起,你无法分辨谁写了什么。
在代码中,当两个层共享同一个专家时,软件的“前向钩子”(用于追踪活动的工具)会将两个层的数据混合在一起,从而损坏测量结果。作者通过创建一个“层感知”系统解决了这个问题,该系统会为笔记贴上标签,以便裁缝知道准确地分辨出哪个是哪个。

他们证明了什么?

他们在名为 WikiText-2 的数据集上测试了一个小型模型。

  • 在 2-bit 压缩下(极小尺寸): 旧方法 (PLIC) 让模型变得非常困惑(高困惑度/Perplexity)。
  • CLHA 方法: 让模型变得明显更聪明(提升了 4.3% 到 5.4%)。
  • CLHA-MP 方法: 通过给“始终开放”的专家多出一位精度的空间,让模型变得更聪明(提升了 18.6%)。

他们还进行了一项测试,人为加大了两个楼层之间的差异。旧方法的效果随着差异增大而变得越来越差,但新方法保持了稳定,证明了他们的“双重检查”系统在两个楼层差异巨大时是至关重要的。

总结

  • 问题: 在层之间共享权重节省了空间,但标准的压缩工具忽略了第二层,从而导致错误。
  • 修复方案: 结合两个层的数据,以创建一个更好的压缩计划 (CLHA)。
  • 加分项: 给使用频率最高的专家提供一点额外的精度 (CLHA-MP)。
  • 结果: 得到了更聪明、更小的模型,在缩小规模时不会失去其“脑力”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →