✨ 要点🔬 技术摘要
想象一下,你正试图将一座巨大而复杂的 3D 雕塑(一个巨型 AI 模型)塞进一个微小、扁平的纸板箱(如智能手机或无人机等边缘设备)里。问题在于,这座雕塑太大了,而你通常用来缩小它的工具(标准数学运算)对于这个小箱子来说又太重、太慢。
本文介绍了一种名为ORP (正交残差投影)的新方法来解决这个问题。以下是通过简单类比对其工作原理的解释:
1. 问题: “尺子”坏了
大多数 AI 模型在运行时依赖大量繁重的乘法运算(就像复杂的计算器)。为了让它们能在小型设备上运行,科学家们尝试对其进行“量化”——基本上,就是将数字四舍五入以简化它们。
本文认为,当前简化这些数字的方法(称为2 的幂次 或 PoT)就像使用一把只在 1、2、4、8 和 16 处有刻度的尺子。
缺陷 :如果你试图测量一个位于"3"的位置,你不得不将其四舍五入到 2 或 4。如果你试图测量位于"6"的位置,你会将其四舍五入到 4 或 8。
结果 :在 AI 所处的高维空间中,这会在方向上产生巨大的“间隙”。这就像试图仅用北、东、南、西四个方向来指引指南针。如果你需要指向东北方向,你就不得不猜测,从而导致方向错误。本文将这种情况称为“低角分辨率状态”。AI 失去了方向感,其智能也随之下降。
2. 解决方案: “两步”地图
与其试图将雕塑强行塞进一把单一的、有缺陷的尺子里,ORP 使用了一种巧妙的两步地图。
第一步:主锚点(主基) :它选择断尺上最接近的标准刻度(例如"4")。
第二步:修正(残差) :它意识到,“等等,实际的数字其实是 4.5。”它没有放弃,而是计算出差值 (即“残差”),并找到第二个垂直方向来描述缺失的部分。
神奇之处 :通过结合主锚点和这个第二个“修正”方向,即使仍然使用相同的简单"2 的幂次”规则,它也能以更高的精度描述该数字。
这就像给出方向指引。
旧方法 : “向北走。”(如果你需要向北偏东北走,你可能会错过目的地)。
ORP 方法 : “向北走,然后向东迈一小步。”你仍然只使用了简单的方向,但这种组合能让你更接近目标。
3. 硬件:无需繁重劳动
通常,为了修正这些舍入误差,计算机会使用复杂的数学运算(乘法),这既缓慢又消耗大量电池。
ORP 的诀窍 :因为它使用"2 的幂次”数字,计算机根本不需要进行乘法运算。它只需要移位 (将位向左或向右移动)并相加 。
类比 :想象一家工厂。旧方法使用一台巨大、沉重的起重机(乘法器)来搬运每一个箱子。这既缓慢又占用空间。ORP 用一条简单的传送带和一个推箱子的人(移位和相加)取代了起重机。它更快、能耗更低,并且能放入更小的房间。
4. 结果:快速且准确
作者在两种类型的 AI 上测试了这种方法:
语言模型(LLMs) :如著名的 LLaMA-2。
视觉模型(ViTs) :用于查看图像的 AI。
他们的发现 :
设置速度 :通常,修复这些模型需要数小时的“校准”(训练)。ORP 仅需约15 分钟 即可完成。这就像瞬间解开了一个谜题,而不是花上一整天。
准确性 :即使使用非常低的精度(3 位或 4 位),ORP 也能保持 AI 的智能。它的表现几乎与那些繁重、缓慢的方法一样好,却无需沉重的硬件支持。
硬件速度 :当他们模拟芯片设计时,发现由于去除了沉重的“乘法器”部分,芯片可以在更高的速度(2.85 GHz)下运行,而不会过热或陷入数据拥堵。
总结
ORP 是一种新方法,用于缩小巨型 AI 模型,使其能在小型设备上运行。它不使用繁重、缓慢的数学运算,而是利用一种巧妙的几何技巧,将两个简单的方向结合起来以获得精确的答案。这使得 AI 更快、更节能,且设置速度更快,同时完全不需要复杂的硬件乘法器。
技术摘要:ORPQUANT——用于无乘法器 2 的幂次 Transformer 量化的几何正交残差投影
1. 问题陈述
大型语言模型(LLMs)和视觉 Transformer(ViTs)在边缘设备上的部署受到“乘法器税”的制约——即硬件乘累加(MAC)单元相关的显著能耗、路由复杂性和时序瓶颈。虽然 2 的幂次(PoT)量化通过将乘法替换为位移操作提供了一种硬件高效的替代方案,但它存在一个根本性的几何局限:低角分辨率机制(Low Angular Resolution Regime)。
在 PoT 量化中,离散晶格是非均匀的,由 a r c t a n ( 2 k ) arctan(2^k) a r c t an ( 2 k ) 分布支配。这产生了“角度间隙”,其中量化向量的方向与原始连续向量的方向显著偏离,特别是在高维空间中。与可预测且可校正的标量幅度误差不同,这些角度偏差损害了特征流形的语义完整性,导致在超低比特(sub-4-bit)机制下出现严重的精度下降。现有方法通常依赖于计算成本高昂的基于梯度的优化或运行时将反量化到 MAC 单元,未能完全消除时序瓶颈或解决 PoT 晶格固有的几何错位问题。
2. 方法论:正交残差投影(ORP)
作者提出了ORP ,这是一个算法 - 硬件协同设计框架,将量化重构为双基几何投影。ORP 不是将向量映射到单一的 1D PoT 晶格,而是构建一个 2D 正交子空间,利用严格的位移和加法操作来捕获和校正方向误差。
核心框架
ORP 流水线由三个解耦阶段组成:
流形对齐预处理: 为了减轻激活异常值的影响,权重使用源自校准统计数据的平滑缩放向量进行预处理(例如,CV 任务使用均方根 RMS,LLMs 使用最大绝对值)。这将欧几里得权重空间与经验特征流形对齐,优先处理主导输出稳定性的通道,而无需迭代重加权。
几何离散基搜索:
主投影(b 1 b_1 b 1 ): 将权重投影到非对称 PoT 晶格上(例如,3 位量化下的 { − 1 , − 0.5 , … , 0 , … , 1 } \{-1, -0.5, \dots, 0, \dots, 1\} { − 1 , − 0.5 , … , 0 , … , 1 } ),以确保硬件零跳过所需的绝对零状态。
正交残差提取: 通过 Gram-Schmidt 正交化计算残差向量 r ⊥ r_\perp r ⊥ :r ⊥ = w p r o c − ⟨ w p r o c , b 1 ⟩ ∥ b 1 ∥ 2 b 1 r_\perp = w_{proc} - \frac{\langle w_{proc}, b_1 \rangle}{\|b_1\|^2}b_1 r ⊥ = w p r oc − ∥ b 1 ∥ 2 ⟨ w p r oc , b 1 ⟩ b 1 。
次级基构建(b 2 b_2 b 2 ): 为了捕获丢失的方向信息,ORP 构建一个与 b 1 b_1 b 1 正交的次级离散基 b 2 b_2 b 2 。这是通过步进双交换定理 实现的,该定理通过在微块内应用局部索引置换和符号反转来生成正交向量。该过程是确定性的,并在 O ( N ) O(N) O ( N ) 时间内运行,避免了穷举搜索。
数据驱动的联合尺度优化: 一旦离散基(b 1 , b 2 b_1, b_2 b 1 , b 2 )固定,即可求解连续缩放系数(c 1 , c 2 c_1, c_2 c 1 , c 2 )。该框架提供两种模式:
GEO 模式(几何优化): 一种闭式解,无需校准数据即可最小化欧几里得距离,适用于零样本部署。
REF 模式(激活感知细化): 使用校准输入上的岭回归来优化尺度,补偿特征相关性和空间噪声,同时避免将离散激活噪声嵌入求解器中导致的数值不稳定性。
硬件数据流
最终的推理数据流将线性层 $Y = XW$ 转换为无乘法器操作:Y ^ = ( s x s c 1 ) [ ( X ~ B 1 ) diag ( c ~ 1 ) ] + ( s x s c 2 ) [ ( X ~ B 2 ) diag ( c ~ 2 ) ] \hat{Y} = (s_x s_{c1}) [(\tilde{X}B_1)\text{diag}(\tilde{c}_1)] + (s_x s_{c2}) [(\tilde{X}B_2)\text{diag}(\tilde{c}_2)] Y ^ = ( s x s c 1 ) [( X ~ B 1 ) diag ( c ~ 1 )] + ( s x s c 2 ) [( X ~ B 2 ) diag ( c ~ 2 )] 核心矩阵乘法通过并行位移和加法执行,缩放因子仅在最终累加步骤应用。
3. 主要贡献
几何形式化: 本文形式化了极端 PoT 量化的“低角分辨率机制”,并提出 ORP 作为一种确定性的、O ( N ) O(N) O ( N ) 的闭式解,用于提取正交离散基,无需基于梯度的优化。
校准效率: 通过将随机迭代搜索替换为解析求解器,ORP 将 LLaMA-2-7B 的全模型校准时间从数小时(例如 AWQ、SpinQuant)减少到单个工作站上约15.1 分钟 。
零 MAC 约束下的竞争保真度: ORP 在不依赖非对称缩放或运行时反量化的情况下,实现了跨模态的可靠精度。它在 LLaMA-2-13B(W4/A16)上达到了5.09 的困惑度,在 ViT-Base(W4/A4)上达到了**79.54%**的 Top-1 准确率。
硬件验证: 通过 28nm RTL 综合,作者证明用并行位移 - 加法数据路径替换密集乘法器树,将关键路径延迟降低至0.35 ns ,实现了2.85 GHz 的理论时钟频率,并在 1.8 GHz 下实现了3.33 TOPS/W 的能效。
4. 实验结果
视觉 Transformer(ImageNet-1K): 在 W3/A4 约束下,ORP 在 ViT-B 上实现了 78.49% 的 Top-1 准确率,超过了 APQ-ViT(41.41%)等 4/4 位基线,并在 W3/A6 下接近全精度性能(80.32%)。
LLM 性能(LLaMA-2):
W3/A16: ORP 在 LLaMA-2-7B 上实现了 6.10 的困惑度,优于 AWQ(6.49),并接近 4 位基线(5.66),且无需非对称缩放。
W4/A16: 在 LLaMA-2-13B 上实现了 5.09 的困惑度。
零样本推理: GEO 模式为各种推理任务提供了稳健的基线(例如,3 位下 WinoGrande 达到 67.72%),而 REF 模式提供了进一步的精度提升。
硬件指标: 与 AWQ 基线的 0.90 ns 相比,ORP 加速器的关键路径延迟为 0.35 ns,理论上允许在 28nm 硅片上以 2.85 GHz 运行。
5. 意义与主张
本文声称,ORP 通过将几何原理与硅级时序效率相结合,为在资源受限的边缘设备上敏捷部署大型基础模型提供了一条可行路径。
算法效率: 主要意义在于从计算密集型、迭代的校准转向确定性的解析求解器,实现了快速的现场边缘适配。
硬件协同: 这项工作表明,严格的硬件约束(无乘法器、位移 - 加法)并不必然导致表示保真度的权衡。通过正交残差解决几何“角度间隙”,ORP 实现了与 MAC 密集型基线相媲美的性能。
部署灵活性: 双轨范式(GEO 与 REF)为从业者提供了即时、无数据的零样本推理与数据驱动精度之间的灵活选择,降低了校准偏差的风险。
最终,ORP 表明,极端量化可以在不依赖非对称缩放、运行时反量化或深层乘法器树的情况下有效实现,为高吞吐量边缘智能提供了新的执行范式。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。