← 最新论文
🤖 machine learning

Max-Window Scale Estimation for Near-Lossless HiF8 W8A8 Quantization-Aware Training

本文通过引入最大窗口尺度估计策略和BF16预热调度,识别并解决了HiF8 W8A8量化感知训练中的两种不同失效模式——最大值饱和与灾难性遗忘,从而在OpenPangu-Embedded-1B模型上实现了近乎无损的性能。

原作者: Yingying Cheng, Jinquan Shi, Li Zhou, Zhiyang He, Zhaoyi Sun, Fan Zhang, Jie Sun

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yingying Cheng, Jinquan Shi, Li Zhou, Zhiyang He, Zhaoyi Sun, Fan Zhang, Jie Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位博学多才、阅书无数的图书管理员(即 AI 模型),他花费数年时间将一座庞大的图书馆中的书籍全部熟记于心。现在,你希望将这座巨大的图书馆压缩,使其能装入一个微小的便携式背包(低功耗设备)中,同时不丢失其中的任何故事或事实。这个过程被称为量化(Quantization)

这篇论文描述了一项具体实验,研究人员尝试使用一种名为HiF8(高精度浮点 8 位)的新型紧凑格式来压缩一个拥有 10 亿参数的 AI 模型。可以将 HiF8 想象为一种“智能压缩”,它在压缩其余部分的同时,保留了最关键细节的清晰度。

然而,研究人员发现,仅仅缩小图书馆是不够的。他们发现了两个隐藏的“陷阱”,即使训练过程在纸面上看起来完美无缺,这些陷阱也可能破坏模型的记忆。

以下是他们旅程的简要分解:

两个隐藏的陷阱

1. “盲点”陷阱(Amax 饱和)
想象图书管理员试图将书籍整理到书架上,但他们使用的尺子稍微短了一点。

  • 问题所在:AI 需要知道它所看到的“最响”或“最大”的数字,以此来确定压缩的尺度。研究人员使用了一种称为*延迟张量缩放(Delayed Tensor Scaling, DTS)*的方法。这就像图书管理员看着上一本*书来猜测当前*这本书的大小。
  • 失败之处:如果当前这本书突然变得巨大(数据出现“尖峰”),图书管理员的猜测(基于上一本书)就会太小。这本书会被“截断”或在书架边缘被切掉。
  • 隐蔽性:AI 内部的“记分牌”(训练损失)并没有显示出这种情况的发生。这就像图书管理员说:“我整理得很好!”却在暗中撕掉书页。这种损害直到后来他们在特定测验(如 ARC 或 MMLU)上测试图书管理员的知识时才会显现。

2. “过度热情的学生”陷阱(灾难性遗忘)
想象图书管理员急于从新的一套书中学习新故事,以至于开始擦除记忆中的旧经典以腾出空间。

  • 问题所在:研究人员使用了一个过于激进的“学习率”(学习速度)来训练模型。
  • 失败之处:模型学习新数据的速度太快,以至于完全忘记了其在原始训练期间学到的常识和事实。
  • 隐蔽性:这种情况发生得甚至不需要压缩。如果他们以这种高速度正常训练模型,模型依然会忘记一切。但由于他们同时也对模型进行了压缩,他们便将失败归咎于压缩,而非速度。

解决方案:两部分修复

研究人员进行了八项不同的实验,以找出如何修复这些陷阱。他们发现,只修复其中一个是不够的;必须同时修复两者。

修复方案 #1:“安全网”(最大窗口策略)
为了阻止“盲点”,他们改变了图书管理员猜测书籍大小的方式。

  • 他们不再仅仅查看上一本书,而是告诉图书管理员查看过去 64 本书中最大的那一本
  • 这是一种“保守”的方法。它使书架比严格需要的稍微大一点(略微过度保守),但它保证了没有任何一本书会被截断。这小小的“额外空间”实际上帮助模型保持稳定,起到了温和的正则化作用。

修复方案 #2:“冷静期”(预热与减速学习)
为了阻止“过度热情的学生”,他们改变了训练计划。

  • 预热:在前 500 步中,他们完全不压缩模型。他们让模型以其完整的、高质量的格式(BF16)适应新数据。这让模型在应用“背包”压缩之前,能够稳定到一个稳定的状态。
  • 减速:他们大幅降低了学习速度(降低学习率)。这防止了模型疯狂地用新数据覆盖其旧的、有价值的知识。

结果

当他们结合这两种修复方案时,结果几乎是无损的

  • 压缩后的模型(HiF8)的表现几乎与未压缩的完整尺寸模型完全一致。
  • 在困难测验上的性能下降微乎其微(在大多数情况下小于 0.5%)。
  • 至关重要的是,他们证明了如果只使用“安全网”但保持“过度热情”的速度,模型仍然会失败。同样,如果减慢了速度但保留了“盲点”尺子,也会失败。两个修复方案都是必要的。

无效的方法(及其原因)

  • 仅查看最后一本书:导致书籍被截断。
  • 平滑猜测:试图对过去的书籍取平均值,但在数据发生不可预测的变化时失效。
  • 即时检查当前书籍:这需要第二次查看数据,速度太慢,并且导致书架大小剧烈波动,使模型感到困惑。
  • 高速训练:即使没有压缩,这也导致模型忘记一切。

核心结论

这篇论文告诉我们,在缩小一个智能 AI 模型时,不能仅仅查看“训练分数”来判断其是否有效。你必须小心如何测量数据(以避免截断)以及如何教授它(以避免遗忘)。通过使用针对数据大小的“安全网”和“缓慢而稳定”的学习节奏,你可以将一颗巨大的大脑装入一个微小的背包中,而不会使其失去理智。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →