← 最新论文
🤖 machine learning

CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning

本文介绍了 CUDA-L2,这是一个利用大语言模型和强化学习来自动优化半精度通用矩阵乘法(HGEMM)算子的系统,通过系统性地探索人类工程师难以实现的规模化配置空间,实现了相对于 torch.matmul、cuBLAS 和 cuBLASLt 等既有基准的显著性能提升。

原作者: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图烤制一个完美的蛋糕。多年来,世界上最优秀的烘焙师(人类专家)一直在为一个被称为“矩阵乘法”的特定类型蛋糕不断改进配方。这种蛋糕是几乎所有现代 AI 大脑中的秘密成分。他们多年来一直致力于让它变得更快,但他们遇到了一个瓶颈:每当蛋糕的大小发生变化时(从一个小纸杯蛋糕到一个巨大的婚礼层级蛋糕),他们都必须从头开始,而且对于一种尺寸有效的技巧在另一种尺寸上往往会失效。这就像试图用一把小勺子去吃一大碗汤;工具根本不匹配。

迎来 CUDA-L2——这是一个由结合了超智能语言模型和一种名为强化学习(RL)的类游戏学习系统的“AI 烘焙师团队”。CUDA-L2 不仅仅是询问人类专家最好的配方是什么,它是在玩一场大规模的“尝试、失败、学习、再尝试”的游戏。

重大发现:AI 烤出的蛋糕更快

本文的主要发现是,CUDA-L2 可以自动设计这些矩阵乘法“配方”(称为内核/kernels),并且烤出的蛋糕比目前现有的最好的人类配方还要

研究人员在 1,000 种不同的蛋糕尺寸(维度 M、N 和 K 的组合,范围从 64 到 16,384)上进行了测试。这些尺寸涵盖了像 Qwen、Llama 和 DeepSeek 这样著名的开源 AI 模型所使用的精确维度。

以下是 AI 烤制速度与当前冠军的对比情况,测量是在 A100 GPU 上进行的:

  • 对比标准工具 (torch.matmul): 在连续烘焙模式(离线模式)下,CUDA-L2 快了 22.0%。在订单随机到达的繁忙厨房(服务器模式)中,它快了 28.7%
  • 对比金标准 (cuBLAS): 即使是对阵 NVIDIA 自家高度优化的库,CUDA-L2 也胜出了。它在连续模式下快了 19.2%,在繁忙的服务器模式下快了 26.0%
  • 对比“自动优化器” (cuBLASLt-AutoTuning): 这是最重要的对比。cuBLASLt-AutoTuning 是一个尝试多达 100 种不同配方以寻找最佳方案的工具。CUDA-L2 仍然在连续模式下领先其 11.4%,并在服务器模式下领先其 15.9%

该论文对这些数字非常有信心,因为它们是通过运行代码数千次直接测量出来的,而不是仅仅通过猜测或模拟。

AI 没有做的事情

了解该系统没有做的事情很重要。论文明确指出,当前版本的 CUDA-L2 仅限于 A100 架构。然而,该框架旨在具有广泛的适用性,团队正积极致力于将其扩展到其他 GPU 架构,包括较旧的 Ampere 芯片(如 RTX 3090),以及较新的 Hopper(如 H100)和 Blackwell(如 B200)芯片。论文还反驳了人类专家已经“解决”了矩阵乘法的观点;事实证明,AI 找到了更好的配方,这证明人类的调优远非完美。

AI 是如何学会烤出更好蛋糕的

AI 不仅仅是在瞎猜;它学会了一些巧妙的技巧,甚至人类专家也可能因为太忙而忽略这些技巧。

  1. 填充蛋糕 (Padding the Cake): 想象你有一个 8,192 英寸宽的蛋糕,但你的烤盘只有在宽度能被 160 整除时才能完美契合。8,192 不能被 160 整除。人类可能会说:“我会用 128 英寸的烤盘,因为它合适。”但 AI 说:“我会添加一点额外的面糊(填充),使蛋糕变成 8,320 英寸宽,这样我就可以使用 160 英寸的烤盘。”这一点点额外的额外工作实际上让整个过程变得更快了。
  2. 乒乓策略 (The Ping-Pong Strategy): 通常情况下,烘焙师先装入原料,混合,然后加载下一批。AI 想出了一个“乒乓”方法:当搅拌机正在处理 A 批次时,助手已经在加载 B 批次的原料了。这意味着搅拌机永远不需要等待。
  3. “交错式”交付 (The "Staggered" Delivery): 有时,AI 意识到同时索要两种原料(A 和 B)会导致厨房交通拥堵。相反,它先索要原料 A,开始混合,然后再索要原料 B。这让厨房保持顺畅运转。
  4. 选择合适的烤盘尺寸: AI 学习到,对于小蛋糕,小烤盘效果最好。但对于巨大的蛋糕,它需要更大的烤盘。它为每一种蛋糕维度都找到了完美的尺寸,而人类要为 1,000 种不同尺寸计算这个任务可能需要一辈子。

“服务器”与“离线”的区别

论文还注意到厨房环境中的一些有趣现象。

  • 离线模式 (Offline Mode): 想象一条工厂流水线,蛋糕一个接一个地连续烘焙,中间不停歇。烤箱保持高温,工人们处于一种节奏之中。在这里,AI 比竞争对手快了 11.4% 到 22.0%
  • 服务器模式 (Server Mode): 想象一家繁忙的餐厅,订单随机到达。在订单之间,烤箱可能会降温,工人们必须重新进入状态。在这种“现实世界”的混乱中,AI 的优势反而扩大了,超过了竞争对手 15.9% 到 28.7%。论文认为这是因为 AI 的配方在处理这些“冷启动”和不可预测的停顿方面表现得更好。

核心结论

论文得出结论,即使对于像矩阵乘法这样最关键、经过高度优化的任务,LLM 引导的强化学习也能通过探索人类无法检查的巨大可能性空间,找到比人类更好的解决方案。虽然这个特定版本的 CUDA-L2 目前仅限于 A100 GPU,但该框架旨在未来扩展到其他芯片。

简而言之:AI 不仅仅是微调了配方;它发现了人类尚未想到的全新的烘焙方式,证明了即使在 GPU 优化这样一个成熟的领域,仍然有很大的提升空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →