✨ 要点🔬 技术摘要
想象一下,现代计算机的大脑就像一位庞大且超智能的图书管理员。这位管理员不仅阅读书籍,还会编写书籍、解决数学问题,甚至通过观察图片来讲述故事。为了实现这些功能,它使用了一种特殊的脑部架构,叫做“Transformer”。你可以把 Transformer 想象成一个巨大的工厂,信息在其中的流水线上流动。在流水线的每一个站点,工厂都会进行一次大规模的计算:它将巨大的数字网格相互相乘。这些就是驱动魔法的“矩阵乘法”。问题在于,这些计算极其沉重。它们需要大量的能量和时间,就像试图用一把小勺子去搬运一座沙山一样。随着这些人工智能模型变得越来越聪明、规模越来越大,这座“沙山”也变得越来越高,使得运行它们变得既昂贵又缓慢。科学家们长期以来一直在思考:这位图书管理员在处理每一项任务时,真的用到了那座沙山里的每一粒沙子吗?还是说其中有很多不必要的沙子,我们可以将其扫除而不会被管理员察觉?
这篇论文介绍了一种聪明的全新技巧,叫做减少矩阵乘法(Reduced Matrix Multiplication, RMM) 。RMM 并不是试图永久缩小工厂规模或删除管理员记忆的一部分(因为这可能会导致出错),它更像是一个智能的、即时的过滤器。每当管理员准备进行大规模计算时,RMM 就会暂停并询问:“在这个网格中,哪些特定的数字目前正在承担重任?”然后,它只挑选出最重要的那些数字——比如前 50% 或 70%——并在那一特定时刻忽略其余的部分。这就像一位厨师,在为汤准备蔬菜时,不是要把冰箱里所有的蔬菜都切碎,而是快速品尝一下汤的味道,然后决定只使用当前这种口味所需要的胡萝卜和洋葱。最棒的一点是,管理员不需要重新训练或学习如何这样做;它只是自然地利用了它已经生成的数字。
研究人员在各种各样的人工智能模型上测试了这个想法,范围从拥有 10 亿参数的小型模型到拥有 700 亿参数的巨型模型。他们发现,这些模型具有惊人的灵活性。当他们通过仅保留部分数字来减少计算量时,模型并没有崩溃。事实上,模型规模越大,它似乎就越能容忍在不丧失理智的情况下丢弃掉更多的沙子。例如,那个拥有 700 亿参数的巨型模型在减少 50% 的计算量后,仍然能几乎不减质量地回答问题和编写故事。然而,论文还发现了这些工厂构建方式中的一个有趣的怪癖:“注意力”(Attention)部分(即模型决定关注什么的部分)非常随和,可以轻松应对一半的工作量丢失。但“MLP”部分(即实际处理和转换信息的部分)则要敏感得多;如果你在那里削减过多,模型就会开始踉跄。
团队还展示了这种技巧同样适用于既能看又能说的模型,而不仅仅是纯文本模型。他们甚至开发了专门的软件工具来证明,跳过这些数字在现实生活中确实能让计算机运行得更快,尤其是在句子或故事变得非常长的时候。虽然论文指出这是一种让 AI 变得更便宜、更快速的有效途径,但也提到并没有一个适合所有人的“完美”设置。你必须根据具体的模型和你正在让它做的事情来调整削减的程度。但总的来说,RMM 提供了一种无需训练的新方法,让这些数字巨兽运行得更轻盈,证明了有时,减少数学运算反而能让你思考得同样清晰。
技术摘要:用于 LLM 推理的缩减矩阵乘法 (RMM)
问题陈述 基于 Transformer 的语言模型虽然性能强大,但由于注意力层和前馈(MLP)层中重复的高维矩阵乘法,导致推理成本极高。虽然先前的研究通过结构化剪枝、低秩近似、Token 压缩或 KV 缓存管理来解决推理效率问题,但这些方法通常修改固定的模型结构或缩短输入/缓存。它们并未直接解决在不修改模型权重的情况下,是否可以针对特定输入对每个矩阵乘法内部 的收缩计算进行自适应缩减。现有的激活稀疏性方法(如 TEAL、CATS)跳过了低幅值的激活条目,但其关注点在于稀疏化隐藏状态,而非减少通用矩阵乘法的共享收缩轴。
方法论:缩减矩阵乘法 (RMM) 作者提出了缩减矩阵乘法 (RMM) ,这是一种无需训练、输入自适应的推理方法。RMM 作用于 Transformer 计算的统一形式 $Y = AB,其中 ,其中 ,其中 A代表激活矩阵, 代表激活矩阵, 代表激活矩阵, B$ 代表权重矩阵(或中间表示)。
核心机制: RMM 不计算完整的乘积 $AB,而是根据当前输入的激活幅度,动态选择共享收缩维度 ,而是根据当前输入的激活幅度,动态选择共享收缩维度 ,而是根据当前输入的激活幅度,动态选择共享收缩维度 d的一个索引子集 的一个索引子集 的一个索引子集 I。它计算缩减后的乘积 。它计算缩减后的乘积 。它计算缩减后的乘积 A_{:,I} B_{I,:}$。
选择策略: 该方法采用激活感知维度选择 。对于每个特征维度 j j j ,计算重要性得分 s j = ∥ A : , j ∥ 2 s_j = \|A_{:,j}\|_2 s j = ∥ A : , j ∥ 2 (激活矩阵的列范数)。保留得分最高的 Top-k k k 个索引,其中 k = ⌈ ρ d ⌉ k = \lceil \rho d \rceil k = ⌈ ρ d ⌉ ,ρ \rho ρ 是用户控制的保留比例。
理论基础: 作者证明了通过列范数进行 TopK 选择,在仅已知 A A A 的情况下,对于最小化所有可能权重矩阵 B B B 的最坏情况近似误差是极小极大最优 (minimax optimal) 的。这为使用激活幅度来指导缩减提供了原则性的依据。
应用范围: RMM 应用于:
注意力层: 缩减 Q K ⊤ QK^\top Q K ⊤ (查询-键交互)中的特征维度,以及可选地缩减 $PV$(注意力-值交互)中的 Token 维度。
MLP 和线性投影: 缩减前馈投影($XW$)中的隐藏维度。
实现: 该方法需要计算特征得分并执行 Top-k k k 选择,与它们所取代的稠密矩阵乘法相比,这些操作是非常轻量级的向量运算。为了在实践中实现这些收益,作者实现了自定义的 Triton 内核。
核心贡献
输入自适应缩减: 引入了一种看待推理优化的新视角,即缩减矩阵乘法本身的收缩计算,这与剪枝权重、压缩 Token 或管理缓存不同。
无需训练且可控: 该方法不需要重新训练,并通过一个简单的保留比例 (ρ \rho ρ ) 提供平滑、可预测的精度-效率权衡。
机制洞察: 通过消融实验,论文揭示了 Transformer 中的一种结构不对称性 :
注意力侧计算 (Q、K、V 投影,Q K ⊤ QK^\top Q K ⊤ 、$PV$)具有显著的可缩减性和对激进剪枝的鲁棒性。
MLP 组件 对缩减更为敏感,其中“Up”投影最为敏感,而“Down”投影则相对更具鲁棒性。对整个 MLP 块进行剪枝会导致严重的性能崩溃。
泛化性: 证明了该原理可以从纯文本模型扩展到多模态视觉语言推理(如 Qwen2.5-VL)。
实验结果 作者在涵盖 1B 到 70B 参数规模的模型(包括 LLaMA 3.1/3.2 和 Qwen 系列)以及多样化任务(问答、推理、摘要、长文本、视觉语言)上对 RMM 进行了评估。
相对于静态/随机基准的性能: 在固定的保留比例(例如 ρ = 0.5 \rho=0.5 ρ = 0.5 )下,RMM 始终优于静态剪枝方法(SparseGPT、Wanda、SliceGPT)和随机剪枝。静态方法会遭受不稳定的性能下降,而 RMM 能保持连贯的生成和推理能力。
缩放趋势: 较大的模型通常能容忍更激进的缩减。例如,在大多数基准测试中,LLaMA 3.1 70B 在 ρ = 0.8 \rho=0.8 ρ = 0.8 时仍能保持接近全量模型的性能,而较小的模型性能下降更快,尤其是在 GSM8K 和 HumanEval 等挑战性任务上。
鲁棒性: RMM 在自回归生成和长文本设置(高达 30K tokens)中保持稳定,表现出平滑的退化而非突发性的失败。
运行时效率: 在 NVIDIA A100 GPU 上使用自定义内核进行的基准测试显示,计算量的节省转化为了实际的墙钟时间加速,尤其是在长序列长度下(例如,在 4096 个 token 时实现 1.40 倍加速)。值得注意的是,在 4096 个 token 时,稠密实现会出现显存溢出(OOM),而 RMM 能够完成推理。
兼容性: 该方法兼容 INT8 权重量化,并可扩展至各种视觉语言模型骨干网络。
意义与主张 论文将 RMM 定位为一种可扩展的输入自适应推理时优化 方向。其主要意义在于证明了 Transformer 推理中的冗余并非均匀分布;相反,冗余集中在特定的组件(特别是注意力侧操作)中,并且随输入而变化。通过利用这种结构不对称性和依赖于输入的激活信息,RMM 在无需重新训练或修改结构的情况下实现了可控的效率提升。作者总结道,矩阵乘法层级的自适应缩减是高效 Transformer 推理的一个充满前景的方向,并建议未来的方法应考虑特定组件的冗余模式。
局限性 这项工作专注于无需训练的公式化表达。作者承认尚未探索该设置之外的扩展(例如,将自适应缩减集成到预训练目标中),也未对复杂视觉语言模型中所有组件的冗余模式进行详细研究。此外,虽然自定义内核展示了加速效果,但与所有推理框架及量化后端的完全集成仍是未来的工作。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。