← 最新论文
💻 computer science

Colinearity Decay: Training Quantization-Friendly ViTs with Outlier Decay

本文介绍了共线性衰减(CD),这是一种非侵入式结构正则化方法,通过惩罚有害的跨矩阵对齐来缓解视觉 Transformer 中的有害激活异常值,从而在保持全精度性能且无需推理时额外开销的同时,显著提升低比特量化精度。

原作者: Jin Tong, Guang Liang, Peilin Sun, Jianxin Wu

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jin Tong, Guang Liang, Peilin Sun, Jianxin Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《共线性衰减:通过异常值衰减训练量化友好的 ViT》的通俗化解读,辅以生动的类比。

宏观图景:在不损失“大脑”的前提下让 AI 更小巧

想象你拥有一位才华横溢、受过高等教育的专家(即视觉 TransformerViT),他能以惊人的准确度识别猫、汽车和花朵。这位专家非常细致,但同时也庞大且雇佣成本高昂。他们需要巨大的办公室(高内存)和大量的电力来运转。

为了让这位专家能负担得起日常使用(例如在手机上或小型摄像头中),我们想要缩小他们的规模。这个过程被称为量化。这就像将一张高分辨率的照片压缩成更小的文件大小。

问题所在:
当你试图缩小这位专家时,你会遇到一个“吵闹的邻居”问题。在专家的“大脑”中,大多数神经元(那些小工人)都很安静,以正常音量工作。但有几个特定的神经元却尖叫得震耳欲聋(这些被称为异常值)。

当你尝试压缩整个系统时,压缩算法必须为这些尖叫的神经元腾出空间。为了容纳它们,它不得不极大地拉伸比例,导致那些安静、正常的神经元被挤压到一个微小且模糊的空间里。结果呢?这位被压缩的专家变得困惑并会犯错,尽管原始版本是完美的。

旧方法 vs. 新方法

旧方法(压制尖叫者):
以前的方法试图通过强迫那些吵闹的神经元闭嘴来解决这个问题。他们在训练过程中添加了一条规则:“如果你太吵,我们将惩罚你。”

  • 缺陷: 这就像告诉合唱团只能耳语。如果你强迫大声的歌手变得太安静,整首歌就会失去力量和情感。这位专家变成了一个“不错”的压缩模型,但却是一个“糟糕”的原始模型。你为了让他们塞进一个小盒子里,牺牲了专家真正的智慧。

新方法(共线性衰减):
这篇论文的作者认为,我们不应该只是让吵闹的神经元保持沉默。相反,我们应该解决他们尖叫的根本原因

他们发现,尖叫的发生是因为一个特定的结构缺陷:两组工人意外地排成了一条直线,放大了彼此信号。

  • 类比: 想象一场接力赛。选手 A 将接力棒传给选手 B。如果选手 A 已经在以最高速度冲刺,而选手 B 恰好站在完美接棒的位置,并且能跑得更快,那么信号就会被放大成尖叫。
  • 论文的洞察: 问题不在于跑得太快,而在于他们的对齐方式创造了一个危险的反馈循环。

解决方案:“共线性衰减”(CD)

作者引入了一种新的训练规则,称为共线性衰减

  1. 修复方法: 他们不再只是大喊“安静点!”,而是轻轻推动第二位选手(下游矩阵),使其稍微偏离与第一位选手的完美对齐。
  2. 工作原理: 他们在训练期间,对这些特定的矩阵对之间的连接施加微小的、不可见的“衰减”(一种轻柔的推动)。这打破了导致信号爆炸的完美对齐。
  3. 结果: 吵闹的神经元依然存在,但它们不再那么了。它们被降低到了“合理”的音量。
    • 原始专家(全精度)依然聪明且准确。
    • 被压缩的专家(量化后)现在可以被缩小,而不会失去理智,因为“尖叫者”不再迫使整个系统拉伸。

为什么这很重要

  • 无额外成本: 作者设计此方法时,确保它不会减慢训练过程,也不需要更大的计算机。这就像在食谱中添加微小的调整,而无需更换新厨房。
  • 优于以往: 在他们的测试中,这种方法使压缩模型比以前的方法显著更聪明,特别是在视频检测等复杂任务中。
  • 非侵入性: 他们不必重建专家的“大脑”或改变游戏规则。他们只是微调了现有部分之间的交流方式。

一句话总结

这篇论文教导我们,为了让 AI 模型更小、更快,我们不应只是强迫它们保持安静;相反,我们应该轻轻解开那些导致它们尖叫的特定连接,使它们在缩小后依然保持聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →