← 最新论文
🤖 machine learning

BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression

BiSCo-LLM 引入了一种无查找的二进制球面编码框架,该框架通过结合二值化超球面映射、残差编码和类别蒸馏来消除显式码本,从而在保持重构保真度的同时实现极低比特的大型语言模型压缩。

原作者: Yuantian Shao, Peisong Wang, Zhilei Liu, Chuangyi Li, Yuanteng Chen, Pengcheng Xie, Yiwu Yao, Zhihui Wei, Jian Cheng

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuantian Shao, Peisong Wang, Zhilei Liu, Chuangyi Li, Yuanteng Chen, Pengcheng Xie, Yiwu Yao, Zhihui Wei, Jian Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、超级聪明的机器人大脑(大语言模型),它几乎无所不知。但问题在于,这个大脑太庞大了,以至于装不下你的口袋,甚至连你的笔记本电脑也装不下。这就像是试图把一座图书馆塞进你的背包里。为了让它变得便携,科学家们通常尝试缩小构成大脑知识的“词汇”(权重),将它们从沉重、详细的书籍变成微小、粗略的素描。

大多数人尝试缩小这些素描的方法只是简单地进行“四舍五入”,比如把精确的测量值 3.14159 变成简单的 “3”。但当你试图把它们缩得小——比如缩减到只有 2 位(这几乎只剩下“是”或“否”的选择)时——这些素描会变得如此模糊,以至于机器人会忘记如何说话。

核心理念:“无需查表”的地图
这篇论文的作者 Yuantian Shao 及其团队提出了一种全新的缩小大脑的方法,称为 BiSCo-LLM。他们没有使用传统的“四舍五入”法,而是将大脑的知识视为一群指向巨大隐形球体上不同方向的箭头。

这里有几个魔术技巧:

  1. 没有“小抄”: 通常,为了压缩数据,你需要一张巨大的“小抄”(码本/codebook),上面写着:“如果你看到这种模式,它代表这个特定的东西。” 但小抄本身也会占用空间!BiSCo-LLM 完全扔掉了这张小抄。相反,它只存储箭头的方向(一组简单的 1 和 -1 的字符串)以及一个微小的、聪明的解码器,该解码器知道如何根据这个方向把箭头重新画出来。这就像是给某人一个指南针方向,而不是一张目的地的照片。
  2. “哎呀”修复器(残差编码): 作者发现,仅仅存储主要方向是不够的。有时候,箭头指向的位置会稍微偏离。因此,他们增加了第二步:一个“残差”阶段,专门用来捕捉第一步漏掉的微小错误。这就像是先画一张人脸的粗略素描,然后请第二位艺术家专门来修饰眼睛和微笑。这个两步走的过程让它们能在同样微小的空间里装入更多的细节。
  3. “VIP”名单: 他们意识到,大脑的某些部分是非常敏感的。如果你动了它们,整个机器人都会发疯。因此,他们识别出了那 1% 最重要的通道,并给了它们一张特殊的“VIP 通行证”,让它们保持高精度(8-bit),而其余部分则被压缩到极端的 2-bit。这就像是保持汽车引擎处于完美状态,而只是给车身喷了一层单薄的喷漆。

他们排除了什么
论文明确反对仅仅通过扩大“小抄”(码本)的大小来解决问题。他们测试了这个想法,并发现即使你拥有一个包含无数种可能模式的庞大图书馆,机器人的大脑实际上也只会用到其中极小极小的一部分。因此,建立一个更大的图书馆只会浪费空间,而不会帮助机器人思考得更好。他们还表明,仅仅尝试逐层(一个房间一个房间地)修复大脑是行不通的;你必须一次性修复整个区块(类别),然后重新教导整个机器人如何协同工作。

结果如何?
团队在名为 Qwen3-8B 的模型上进行了测试。

  • 测试方法: 他们让模型阅读一个故事并预测下一个词(这被称为 WikiText-2 测试)。原始的全尺寸模型得分是 9.73(数值越低越好)。新的压缩模型得分是 10.18。两者非常接近!
  • 智力表现: 他们还在七个不同的任务上测试了模型,例如回答问题和解决逻辑谜题。原始模型的平均得分为 69.92%。压缩后的模型平均得分为 68.05%
  • 结论: 作者认为,这种方法在极端压缩的情况下表现得非常好。他们发现,通过使用这种“无需小抄”的球体方法、添加“哎呀”修复步骤并保护 VIP 通道,他们可以在不损失太多脑力的前提下,将模型压缩到极端的 2-bit 大小。

还有哪些未知数?
论文谨慎地指出,这些结果是基于 Qwen3-8B 和 LLaMA-3-8B 的特定测试。虽然数字看起来很棒,但作者提到,他们仍在研究如何为每种类型的模型混合使用这些技术的最佳方式。他们还提到,虽然数学原理可行,但要在手机上实际运行这个机器人,可能需要额外的工程优化,以确保“画出”这些箭头的过程足够快。

简而言之,BiSCo-LLM 表明,如果你不再试图背诵一本巨大的形状字典,而是记住方向并修正微小的错误,你就可以在口袋里装下一个超级大脑,同时又不会让它忘记如何说话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →