A 35B Hybrid-Attention Mixture-of-Experts Model on a 6GB 2011 GPU: Hand-Written 4-bit CUDA Inference for Fermi
本文通过实现一种将权重流式传输至 GPU 进行预填充(prefill),并利用手写的 SSSE3 整数内核进行 CPU 解码的混合执行策略,展示了在 2011 年款 6GB Fermi GPU 上对一个 350 亿参数 Qwen3.6 MoE 模型进行端到端推理的过程,同时记录了性能提升以及在过时硅片上运行前沿级人工智能模型的实际硬件限制。