← 最新论文
💬 NLP

ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

ORCHead 是一种新颖的激活度量残差修正方法,它通过使用量化低秩核心和组内 INT4 残差来压缩大语言模型输出头,在实现显著存储缩减(3.7–3.9倍)的同时,保持了近乎无损的困惑度并最大限度地降低了对吞吐量的影响。

原作者: Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali Yuksel

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali Yuksel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一座宏大且复杂的图书馆装进一个微小的背包里。这就是从事大语言模型(LLM)工作的工程师们每天面临的挑战——这些模型是聊天机器人和创意写作背后的超智能 AI 大脑。这些模型的构建基于数十亿个被称为“权重”的微小数学开关。为了让它们在普通计算机上运行得更快、更便宜,科学家们使用了一种名为“量化”(quantization)的技巧。你可以把量化想象成将一部高清 4K 电影转换为分辨率较低的 1080p 版本。你会损失一点画质,但文件体积会大幅缩小,使其易于携带。

然而,这里有一个陷阱。虽然工程师们已经非常擅长压缩 AI 的主要“思考”部分(即 Transformer 模块),但他们往往会忽略最后一部分——即实际选择下一个要说的词的部分——而不对其进行压缩。这就像是你把背包里的衣服都压缩成了轻便的款式,却忘了压缩那件厚重、笨重的冬装。这件“外套”被称为 LM-head(语言模型头)。它是一个巨大的、致密的地图,将 AI 的思想与词汇表中的每一个可能的词连接起来。由于它规模巨大且保持着原始的、沉重的格式,它占据了巨大的空间,有时甚至比所有压缩后的衣服加起来还要多。如果你想要真正缩小这些 AI 模型,你就必须想办法折叠这件厚重的外套,而不至于撕裂它。

这正是名为 ARCHead 的新方法大显身手的地方。研究人员意识到,仅仅用标准的“低比特”压缩(比如把一切都变成极小的 4-bit 数字)来挤压这件厚重外套,实在是一种过于粗鲁的做法。这就像是试图把一件精细、复杂的雕塑塞进盒子里,却只是简单地把它砸扁;结果会导致 AI 变得语无伦次并犯下愚蠢的错误。

相反,ARCHead 使用了一种聪明的两步走策略,它更像是一位高级裁缝,而非一把大锤。首先,它会对这件厚重的外套创建一个“骨架”版本——一个捕捉了大致形状的低分辨率草图,仅使用极少的比特。但仅靠草图是不完美的。因此,第二步才是神奇之处:ARChead 添加了一个“修正层”。这不仅仅是随机的噪声;它是一个智能的、低秩的补丁,专门修复 AI 大脑最活跃之处的错误。想象一下,你有一张人脸的粗略草图,你知道哪些特征(比如眼睛或微笑)对于识别这个人最为重要。ARCHead 只在这些重要的特征上添加微小而精确的细节,而忽略不太重要的背景。

结果令人印象深刻。当团队在名为 Qwen3-8B-Base 的模型上测试时,他们发现 ARCHead 可以将这个“外套”所需的存储空间缩小近 4 倍(具体来说,它仅使用了原始沉重版本的约 25.6% 的空间)。更棒的是,AI 的性能几乎没有下降。“困惑度”(perplexity,一个衡量 AI 有多困惑的分数)与原始版本相比保持得非常接近,相对分数为 1.007,而标准压缩方法的分数则要糟糕得多,为 1.15

论文还表明,这种方法表现得像一个完美的“即插即用”替换件。如果你已经拥有使用 AWQ 或 bitsandbytes 等流行工具压缩过的 AI 模型,你可以直接把它们沉重、未压缩的外套换成 ARCHead 的外套,而不会破坏任何东西。它只增加了极少量的额外困惑度(在交叉熵方面约为 0.0060.007),这几乎察觉不到,但却节省了大量的空间。研究人员测量到,这并没有降低 AI 的速度;生成速率几乎保持不变,变化率小于 2%

简而言之,ARCHead 并不试图重新发明轮子或从头开始压缩整个 AI。相反,它解决了其他方法所忽略的、关于那个“剩余”沉重外套的具体且令人头疼的问题。通过使用一种智能的、感知活动的修正系统,它证明了你可以让这些庞大的 AI 模型变得更小、更易于携带,同时又不牺牲对话的质量。这是一个务实的、有节制的进步,表明只要有了正确的折叠技术,即使是我们数字大脑中最笨重的部分,也能轻松装进兜里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →