← 最新论文
🤖 machine learning

Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

本文介绍了缩减矩阵乘法(Reduced Matrix Multiplication, RMM),这是一种无需训练、输入自适应的推理方法,通过选择性地保留矩阵乘积中有信息量的切片,降低了基于 Transformer 模型中的计算成本,并在不修改模型权重的情况下,在各种模型规模、任务和模态上实现了可扩展的精度-效率权衡。

原作者: Zixuan Lan, Yanhong Li, Jiawei Zhou

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Zixuan Lan, Yanhong Li, Jiawei Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,现代计算机的大脑就像一位庞大且超智能的图书管理员。这位管理员不仅阅读书籍,还会编写书籍、解决数学问题,甚至通过观察图片来讲述故事。为了实现这些功能,它使用了一种特殊的脑部架构,叫做“Transformer”。你可以把 Transformer 想象成一个巨大的工厂,信息在其中的流水线上流动。在流水线的每一个站点,工厂都会进行一次大规模的计算:它将巨大的数字网格相互相乘。这些就是驱动魔法的“矩阵乘法”。问题在于,这些计算极其沉重。它们需要大量的能量和时间,就像试图用一把小勺子去搬运一座沙山一样。随着这些人工智能模型变得越来越聪明、规模越来越大,这座“沙山”也变得越来越高,使得运行它们变得既昂贵又缓慢。科学家们长期以来一直在思考:这位图书管理员在处理每一项任务时,真的用到了那座沙山里的每一粒沙子吗?还是说其中有很多不必要的沙子,我们可以将其扫除而不会被管理员察觉?

这篇论文介绍了一种聪明的全新技巧,叫做减少矩阵乘法(Reduced Matrix Multiplication, RMM)。RMM 并不是试图永久缩小工厂规模或删除管理员记忆的一部分(因为这可能会导致出错),它更像是一个智能的、即时的过滤器。每当管理员准备进行大规模计算时,RMM 就会暂停并询问:“在这个网格中,哪些特定的数字目前正在承担重任?”然后,它只挑选出最重要的那些数字——比如前 50% 或 70%——并在那一特定时刻忽略其余的部分。这就像一位厨师,在为汤准备蔬菜时,不是要把冰箱里所有的蔬菜都切碎,而是快速品尝一下汤的味道,然后决定只使用当前这种口味所需要的胡萝卜和洋葱。最棒的一点是,管理员不需要重新训练或学习如何这样做;它只是自然地利用了它已经生成的数字。

研究人员在各种各样的人工智能模型上测试了这个想法,范围从拥有 10 亿参数的小型模型到拥有 700 亿参数的巨型模型。他们发现,这些模型具有惊人的灵活性。当他们通过仅保留部分数字来减少计算量时,模型并没有崩溃。事实上,模型规模越大,它似乎就越能容忍在不丧失理智的情况下丢弃掉更多的沙子。例如,那个拥有 700 亿参数的巨型模型在减少 50% 的计算量后,仍然能几乎不减质量地回答问题和编写故事。然而,论文还发现了这些工厂构建方式中的一个有趣的怪癖:“注意力”(Attention)部分(即模型决定关注什么的部分)非常随和,可以轻松应对一半的工作量丢失。但“MLP”部分(即实际处理和转换信息的部分)则要敏感得多;如果你在那里削减过多,模型就会开始踉跄。

团队还展示了这种技巧同样适用于既能看又能说的模型,而不仅仅是纯文本模型。他们甚至开发了专门的软件工具来证明,跳过这些数字在现实生活中确实能让计算机运行得更快,尤其是在句子或故事变得非常长的时候。虽然论文指出这是一种让 AI 变得更便宜、更快速的有效途径,但也提到并没有一个适合所有人的“完美”设置。你必须根据具体的模型和你正在让它做的事情来调整削减的程度。但总的来说,RMM 提供了一种无需训练的新方法,让这些数字巨兽运行得更轻盈,证明了有时,减少数学运算反而能让你思考得同样清晰。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →