想象一下,你拥有一个巨大的、超级聪明的机器人大脑(大语言模型),它几乎无所不知。但问题在于,这个大脑太庞大了,以至于装不下你的口袋,甚至连你的笔记本电脑也装不下。这就像是试图把一座图书馆塞进你的背包里。为了让它变得便携,科学家们通常尝试缩小构成大脑知识的“词汇”(权重),将它们从沉重、详细的书籍变成微小、粗略的素描。
大多数人尝试缩小这些素描的方法只是简单地进行“四舍五入”,比如把精确的测量值 3.14159 变成简单的 “3”。但当你试图把它们缩得太小——比如缩减到只有 2 位(这几乎只剩下“是”或“否”的选择)时——这些素描会变得如此模糊,以至于机器人会忘记如何说话。
核心理念:“无需查表”的地图
这篇论文的作者 Yuantian Shao 及其团队提出了一种全新的缩小大脑的方法,称为 BiSCo-LLM。他们没有使用传统的“四舍五入”法,而是将大脑的知识视为一群指向巨大隐形球体上不同方向的箭头。
这里有几个魔术技巧:
- 没有“小抄”: 通常,为了压缩数据,你需要一张巨大的“小抄”(码本/codebook),上面写着:“如果你看到这种模式,它代表这个特定的东西。” 但小抄本身也会占用空间!BiSCo-LLM 完全扔掉了这张小抄。相反,它只存储箭头的方向(一组简单的 1 和 -1 的字符串)以及一个微小的、聪明的解码器,该解码器知道如何根据这个方向把箭头重新画出来。这就像是给某人一个指南针方向,而不是一张目的地的照片。
- “哎呀”修复器(残差编码): 作者发现,仅仅存储主要方向是不够的。有时候,箭头指向的位置会稍微偏离。因此,他们增加了第二步:一个“残差”阶段,专门用来捕捉第一步漏掉的微小错误。这就像是先画一张人脸的粗略素描,然后请第二位艺术家专门来修饰眼睛和微笑。这个两步走的过程让它们能在同样微小的空间里装入更多的细节。
- “VIP”名单: 他们意识到,大脑的某些部分是非常敏感的。如果你动了它们,整个机器人都会发疯。因此,他们识别出了那 1% 最重要的通道,并给了它们一张特殊的“VIP 通行证”,让它们保持高精度(8-bit),而其余部分则被压缩到极端的 2-bit。这就像是保持汽车引擎处于完美状态,而只是给车身喷了一层单薄的喷漆。
他们排除了什么
论文明确反对仅仅通过扩大“小抄”(码本)的大小来解决问题。他们测试了这个想法,并发现即使你拥有一个包含无数种可能模式的庞大图书馆,机器人的大脑实际上也只会用到其中极小极小的一部分。因此,建立一个更大的图书馆只会浪费空间,而不会帮助机器人思考得更好。他们还表明,仅仅尝试逐层(一个房间一个房间地)修复大脑是行不通的;你必须一次性修复整个区块(类别),然后重新教导整个机器人如何协同工作。
结果如何?
团队在名为 Qwen3-8B 的模型上进行了测试。
- 测试方法: 他们让模型阅读一个故事并预测下一个词(这被称为 WikiText-2 测试)。原始的全尺寸模型得分是 9.73(数值越低越好)。新的压缩模型得分是 10.18。两者非常接近!
- 智力表现: 他们还在七个不同的任务上测试了模型,例如回答问题和解决逻辑谜题。原始模型的平均得分为 69.92%。压缩后的模型平均得分为 68.05%。
- 结论: 作者认为,这种方法在极端压缩的情况下表现得非常好。他们发现,通过使用这种“无需小抄”的球体方法、添加“哎呀”修复步骤并保护 VIP 通道,他们可以在不损失太多脑力的前提下,将模型压缩到极端的 2-bit 大小。
还有哪些未知数?
论文谨慎地指出,这些结果是基于 Qwen3-8B 和 LLaMA-3-8B 的特定测试。虽然数字看起来很棒,但作者提到,他们仍在研究如何为每种类型的模型混合使用这些技术的最佳方式。他们还提到,虽然数学原理可行,但要在手机上实际运行这个机器人,可能需要额外的工程优化,以确保“画出”这些箭头的过程足够快。
简而言之,BiSCo-LLM 表明,如果你不再试图背诵一本巨大的形状字典,而是记住方向并修正微小的错误,你就可以在口袋里装下一个超级大脑,同时又不会让它忘记如何说话。
技术摘要:BiSCo-LLM
问题陈述
大语言模型(LLMs)面临着显著的部署限制,包括太字节(terabyte)级的检查点存储需求、内存带宽限制,以及自回归解码过程中权重加载带来的延迟成本。虽然后训练量化(PTQ)已发展到 4 位和 3 位量化阶段,但将压缩扩展到 2 位或更低水平仍然具有挑战性。现有的标量或分组量化方法在如此低的比特预算下,由于表示能力有限,难以保留权重向量的主导结构。相反,向量量化(VQ)方法提供了更丰富的表示,但通常依赖于显式的码本(codebooks)、索引查找和额外的存储开销,这使得存储统计和部署效率变得复杂。因此,需要一种既能实现极低比特压缩(目标约为 2 位),又无需显式码本,同时能明确计算所有辅助存储组件(解码器、元数据、补偿模块)以提供真实模型大小度量的压缩框架。
方法论
本文提出了 BiSCo-LLM(用于大语言模型压缩的无查找表二进制球面编码),这是一个面向存储感知的极低比特权重压缩流水线。该框架由三个主要部分组成:
无码本二进制球面编码 (BSQ):
BiSCo-LLM 不将权重块映射到码本中的显式质心,而是将局部权重块映射到一个单位超球面上,并将其二值化为紧凑的球面编码。编码器对潜向量 z 进行归一化,并应用符号函数以生成二进制编码 q∈{−1/b,+1/b}b。这消除了存储显式码本条目的需求。重构过程由一个紧凑的神经常规解码器 Dθ 完成。训练目标结合了重构损失、潜变量承诺(latent commitment)和熵正则化,以确保二进制编码空间的有效利用。
第二阶段残差 BSQ:
为了解决简单扩大单阶段二进制编码空间(其中大多数理论上的符号模式并不会被有限的权重块占据)的低效问题,BiSCo-LLM 采用了两阶段方法。第一阶段重构权重块的主导成分。第二阶段专门针对基础编解码器留下的残差误差进行训练。这种方法将额外的比特容量分配给重构误差,而不是扩展主码空间,从而在不增加码本存储的情况下提供了一条实际的率失真(rate–distortion)路径。
类别级恢复蒸馏与敏感性保护:
- 敏感性保护: 意识到极少数通道对量化高度敏感,该方法利用激活统计数据和权重幅值来识别这些通道。一小部分(例如 1%)的敏感通道使用辅助的 8 位量化器进行存储。该路径与主 BSQ 有效载荷分开计算。
- 类别级蒸馏: 为了使压缩后的权重与最终的模型行为保持一致,该流水线按类别(例如所有的
q_proj 层)替换 Transformer 模块。在替换一个类别后,会进行恢复蒸馏步骤,即训练部分压缩后的模型(学生模型)以匹配原始模型(教师模型)。这确保了恢复目标反映了压缩类别与剩余全量模型之间的相互作用,而不仅仅是最小化局部的层级重构误差。
- LoRA 补偿: 在恢复阶段可以应用可选的低秩自适应(LoRA)适配器以进一步减轻误差,其存储成本也会被明确报告。
核心贡献
- BiSCo-LLM 流水线: 一种新型的面向 2 比特的压缩流水线,集成了无码本二进制球面编码、残差编码分配和类别级恢复蒸馏。它在显式的、真实大小的存储预算下对模型进行优化和评估。
- 残差 BSQ 设计: 引入了第二阶段残差编解码器,将额外的比特分配给基础阶段的重构误差。研究表明,这种方法比单纯增加单阶段编码的粒度更有效,因为它能更好地利用可用比特预算来处理可恢复的信息。
- 类别级优化: 一种在 Transformer 模块类别层面运行的训练和恢复策略。该方法减少了局部权重重构与全局模型行为之间的不匹配,其表现优于纯层级重构目标。
- 全面的存储统计: 该框架明确计算了所有存储组件,包括位打包的 BSQ 流、神经解码器参数、可选的 8 位保护载荷、LoRA 适配器和元数据,为与显式 VQ 和基于投影的方法进行公平对比提供了基准。
实验结果
该方法在真实的存储预算下对 Qwen3-8B 模型进行了评估:
- 困惑度(Perplexity): 在 WikiText-2 数据集上,BiSCo-LLM 实现了 10.18 的困惑度,而全精度(FP16/BF16)模型为 9.73。它优于研究中报告的标量基准(如 GPTQ、SpinQuant)和基于向量的基准(如 AQLM、QuIP#、UniSVQ)。
- 下游准确率: 在七项任务评估集(包括 BoolQ、RTE、WinoGrande、ARC、OpenBookQA 和 PIQA)上,压缩模型的平均准确率为 68.05,而全精度基准为 69.92。这代表了约 1.87 个百分点的差距。
- 消融实验:
- 残差编码: 与单阶段配置相比,添加第二阶段残差编解码器能持续提高各模块类别的困惑度。
- 保护通道: 使用 1% 的保护通道路径(以 8 位存储)显著降低了困惑度,特别是对于像
down_proj 这样敏感的类别。
- 解码器架构: 研究发现,紧凑的对称非线性解码器在处理此类任务时优于线性解码器。
- 粒度: 诊断显示,在没有残差阶段的情况下,仅仅扩大二进制编码空间并不能保证性能的单调提升。
意义与主张
本文主张,当残差编码、敏感性感知保护和恢复蒸馏被共同考虑时,无码本球面编码是极低比特(2 位)LLM 压缩的一种可行表示。其意义在于将存储负担从显式向量码本转移到共享的神经解码器上,从而消除了索引查找和大型码本存储的开销。作者强调,只有在整个流水线(包括解码器、残差阶段和补偿模块的成本)都明确计入存储预算时,该方法才能在极低比特预算下保持模型行为。结果表明,这种方法可以在大幅减少存储占用的同时,使模型性能保持在与全精度模型非常接近的范围内,使其适用于具有严格内存和带宽约束的部署场景。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。