← 最新论文
🤖 machine learning

FairyFuse: Multiplication-Free LLM Inference on CPUs via Fused Ternary Kernels

FairyFuse 提出了一种针对 CPU 的乘法-free 大语言模型推理系统,通过利用三值权重将线性层融合为单个 AVX-512 循环,在单颗 Intel Xeon 处理器上实现了比 llama.cpp 快 1.24 倍且精度接近无损的生成速度。

原作者: Fei Zuo, Xiaoyan Xi, Quanyi Zeng, Feiyu Wang, Ho Fai Leung

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Fei Zuo, Xiaoyan Xi, Quanyi Zeng, Feiyu Wang, Ho Fai Leung

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 FairyFuse 的新系统,它能让大型语言模型(LLM)在普通的电脑 CPU 上跑得飞快,而且完全不需要做乘法运算。

为了让你轻松理解,我们可以把大模型推理想象成在一家巨大的图书馆里找书并写读后感。

1. 背景:为什么现在的 CPU 跑不动?

  • 现状:现在的 AI 模型(比如 LLaMA)非常庞大,就像一座拥有几十亿本书的图书馆。
  • 瓶颈:当你问 AI 一个问题时,它需要从内存(书架)里把书(权重数据)取出来,在 CPU(大脑)里进行计算。
  • 问题:对于普通电脑 CPU 来说,“取书”的速度(内存带宽)太慢了,而“读书”的速度(计算能力)其实很快。就像你有一个超级快的厨师,但他每次只能从很远的仓库里拿一点点食材,大部分时间厨师都在空等。
  • 现有的方案:为了减少取书的次数,人们把书的内容“压缩”了(量化),比如把 32 位的数据压缩成 4 位。但这有个缺点:虽然书变薄了,但厨师拿到书后,还是得先把它“展开”成原来的样子,然后再做复杂的乘法计算。这就像把压缩饼干泡开再吃,虽然省了空间,但做饭的步骤没变少。

2. 核心创新:FairyFuse 是怎么做的?

FairyFuse 提出了一种更激进的想法:既然书的内容只有三种状态(+1, 0, -1),我们为什么还要做乘法呢?

比喻一:三原色积木 vs. 复杂的乐高

  • 传统做法:就像用乐高积木搭房子,每一块积木都要精确计算怎么拼接(乘法),非常耗时。
  • FairyFuse 的做法:它把模型压缩成只有三种颜色的积木:
    • 红色 (+1):直接加一块积木。
    • 蓝色 (-1):直接减(拿走)一块积木。
    • 白色 (0):什么都不做。
  • 结果:厨师(CPU)不再需要计算“红色积木乘以 5"这种复杂的乘法,只需要根据颜色直接加或减。这就像从“做数学题”变成了“简单的加减法”,速度快得惊人。

比喻二:八个人一起干活 vs. 一个人干八次活

这篇论文还解决了一个复杂的数学问题(复数线性层)。

  • 以前的做法:要把一个复杂的任务拆成 8 个小任务,让 8 个人(或 8 个步骤)分别去干。每个人都要跑一趟仓库取材料,取 8 次,还要互相等,效率很低。
  • FairyFuse 的做法(融合内核):它把这 8 个小任务合并成一个大任务。
    • 大家只去仓库取一次材料(共享数据)。
    • 大家拿着同一批材料,各自在手里同时处理不同的部分(并行计算)。
    • 最后一次性把结果汇总。
    • 效果:就像把 8 次往返跑变成了 1 次,效率直接翻倍。

3. 惊人的效果:CPU 赢了 GPU?

通常我们认为,AI 跑得快要靠昂贵的显卡(GPU),因为显卡带宽大(仓库离得近,取书快)。但 FairyFuse 发现了一个有趣的现象:

  • 在 GPU 上:因为 GPU 本身取书就很快,把书压缩得再小(从 4 位变 2 位),对速度的提升也不明显。而且,GPU 缺乏处理这种“直接加减”的特殊指令,反而因为要解码变得慢了。
  • 在 CPU 上:CPU 本来取书就慢(瓶颈在内存),现在把书压缩了 16 倍(从 32 位变 2 位),相当于把仓库搬到了厨师手边。再加上“只做加减法”的指令,速度直接提升了近 30 倍!

数据说话:
在普通的 Intel 服务器 CPU 上,FairyFuse 每秒能生成 32.4 个单词,比目前流行的 llama.cpp(使用 4 位量化)快 1.24 倍,而且回答的质量几乎没有损失(几乎和原版一样聪明)。

4. 总结:这意味着什么?

  • 隐私与离线:你不再需要昂贵的显卡或联网的云端服务器,就能在自己的笔记本电脑甚至边缘设备上流畅运行强大的 AI 助手。
  • 省钱:普通 CPU 就能干以前只有高端显卡才能干的活。
  • 核心逻辑:
    1. 极致压缩:把模型变成只有 +1, 0, -1 的“三值”模型。
    2. 去乘法化:用“加”和“减”代替复杂的“乘”。
    3. 融合优化:把 8 个步骤合并成 1 个,减少重复劳动。

一句话总结:
FairyFuse 就像给 AI 换了一双“轻功鞋”,让它不再需要背着沉重的“乘法包袱”,在普通的 CPU 上也能像风一样快,让每个人都能在自己的设备上拥有强大的 AI 助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →