← 最新论文
🔬 condensed matter

A 35B Hybrid-Attention Mixture-of-Experts Model on a 6GB 2011 GPU: Hand-Written 4-bit CUDA Inference for Fermi

本文通过实现一种将权重流式传输至 GPU 进行预填充(prefill),并利用手写的 SSSE3 整数内核进行 CPU 解码的混合执行策略,展示了在 2011 年款 6GB Fermi GPU 上对一个 350 亿参数 Qwen3.6 MoE 模型进行端到端推理的过程,同时记录了性能提升以及在过时硅片上运行前沿级人工智能模型的实际硬件限制。

原作者: A. C. Opus, J. Q. Lu

发布于 2026-06-24✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: A. C. Opus, J. Q. Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座巨大的、极其聪明的图书馆,里面藏着 350 亿本书(这代表一个现代 AI 模型)。现在,想象你想从这座图书馆里读出一个特定的故事,但你却被困在一个只有 14 年历史的小破棚子里,那里只有一个小书桌和一台非常陈旧、缓慢的电脑。

这正是这篇论文所描述的内容。研究人员成功地让一个尖端的 AI 模型运行在一块 2011 年的显卡(GPU)上,这块显卡仅有 6 GB 的显存——大约只有模型本身大小的一半。

以下是他们如何完成这一“不可能”壮举的方法,通过简单的类比来解释:

1. 问题所在:图书馆太大,装不下这个棚子

AI 模型就像一本巨大的百科全书。即使经过压缩(压缩到 4 位精度),它仍需占用约 10.5 GB 的空间。而那台旧电脑的桌面只有 6 GB。

  • 问题: 你无法把整本书都放在桌子上。
  • 旧方法: 现代计算机拥有“Tensor Cores”(专门的计算核心)和快速内存来处理这些任务。而这块 2011 年的显卡则没有这些。这就像试图用一个只能进行加减法的计算器来进行高级数学运算。

2. 解决方案:一场两队协作的接力赛

由于整个模型放不下,研究人员将工作分成了两个团队:GPU 团队(旧显卡)和 CPU 团队(主电脑处理器)。

  • 阶段 1:“预填充”(阅读提示词/Prompt)

    • 类比: 想象你需要阅读一份很长的指令清单才能开始工作。
    • 技巧: GPU 充当一个快速的传送带。它从主电脑的硬盘中抓取一小部分“书籍”(模型权重),将其放在自己的小桌子上,完成该部分的数学运算,然后将其换成下一部分。
    • 结果: 它不是一次性阅读整本书,而是像连续流一样一页一页地阅读。这使得他们处理初始指令的速度比以前快了 34%。
  • 阶段 2:“解码”(编写故事)

    • 类比: 现在 AI 需要逐个单词地编写故事。
    • 问题: 如果让 GPU 来做这件事,它每写一个词都要跑回硬盘去取数据。这就像一个跑步者为了写一个词就冲向图书馆,拿一本书,跑回来,写一个词,然后重复这个过程。这太慢了。
    • 技巧: 他们将这部分工作移交给了主电脑的大脑(CPU)。他们编写了一套定制的、超高效的“手写”代码,将数字视为简单的整数而非复杂的浮点数。
    • 结果: 这让 AI 编写单词的速度比以前快了 3 倍,将缓慢的爬行变成了稳健的慢跑。

3. “魔法”捷径

研究人员不仅拆分了工作,还发明了聪明的捷径,让旧硬件感觉焕然一新。

  • “快照”缓存 (The "Snapshot" Cache):

    • 问题: AI 的“记忆”会随着阅读过程而变化。通常情况下,你无法复用旧的工作,因为记忆状态不同。
    • 解决方法: 他们在特定的检查点对 AI 的记忆进行了“快照”。如果你要求 AI 重复一个它已经听过的故事,它不会重新阅读全文,而是直接跳转到它保存的最后一个快照。
    • 结果: 重复一段长提示词的时间从 78 秒 缩短到了仅 0.5 秒。这就像看电影时直接跳到你已经看过的片段,而不是从头再看一遍。
  • “钉住”内存 (The "Pinned" Memory):

    • 类比: 通常情况下,将数据从硬盘移动到 GPU 就像用一台摇晃的叉车搬运箱子。
    • 解决方法: 他们将这些“箱子”固定在原地(钉住内存),这样叉车就可以平稳地移动它们而不会摇晃。这使移动数据的时间减少了一半。

4. 哪些尝试失败了(“死胡同”)

论文的一部分也是关于“失败”的,这同样重要,因为它告诉了我们障碍在哪里。

  • 尝试用 GPU 进行编写: 他们尝试让 GPU 来编写单词,但旧显卡在移动数据方面实在太慢了。它的速度甚至比 CPU 还慢。
  • 使用所有的电脑线程: 他们尝试使用所有可用的处理线程(比如雇佣 24 个工人而不是 12 个)。这导致了交通拥堵,反而大幅降低了速度。
  • 重写数学内核: 他们尝试以三种不同的方式重写数学内核,但旧硬件根本无法处理所需的特定类型数学运算。

总结

这篇论文并不是为了刷新速度记录。它是一个概念验证,旨在说明:“你不需要一台 2 万美元的超级计算机来运行一个 350 亿参数的 AI。”

通过将旧硬件视为一个谜题,并从零开始构建一个定制引擎(为 14 年前软件开发者就已经放弃的计算机架构编写手写代码),他们证明了只要工程设计足够巧妙,现代 AI 可以在“废旧”硬件上运行。

简而言之: 他们把一个法拉利引擎(AI 模型)安装在了一个 1990 年代的自行车架上(2011 年的 GPU),并通过制造定制的变速器和更换燃料类型,证明了只要有足够的创造力,利用旧技术也能走得非常远。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →