← 最新の論文
🤖 machine learning

CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning

本論文は、大規模言語モデルと強化学習を活用して半精度行列積(HGEMM)カーネルを自動的に最適化するシステムであるCUDA-L2を紹介しており、人間によるエンジニアリングでは不可能な規模で構成空間を体系的に探索することにより、torch.matmul、cuBLAS、およびcuBLASLtといった既存のベースラインを大幅に上回る性能向上を実現している。

原著者: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは完璧なケーキを焼こうとしているところだと想像してください。長年、世界最高のベーカー(人間のエキスパート)たちは、「行列積(Matrix Multiplication)」と呼ばれる特定の種類のケーキのレシピを微調整してきました。このケーキは、現代のほぼすべてのAIの脳における秘密の材料です。彼らはこのケーキをより速く作るために長年努力してきましたが、壁にぶつかりました。それは、ケーキのサイズが変わるたびに(小さなカップケーキから巨大なウェディングケーキまで)、ゼロからやり直さなければならないということです。あるサイズでうまくいったトリックが、別のサイズでは通用しないこともよくあります。それはまるで、巨大なスープを食べるのに小さなスプーンを使おうとしているようなものです。道具のサイズが合わないのです。

そこに、言語モデルとビデオゲームのような学習システムである強化学習(RL)を組み合わせた新しいAIベーカーのチーム、CUDA-L2が登場しました。CUDA-L2は、人間に最高のレシピを推測させる代わりに、大規模な「試行、失敗、学習、そして再試行」というゲームをプレイします。

大きな発見:AIはより速いケーキを焼く

この論文の主な発見は、CUDA-L2がこれらの行列積の「レシピ」(カーネルと呼ばれます)を自動的に設計し、現在存在する最高の人間のレシピよりも速くケーキを焼けるということです。

研究者たちは、これを1,000種類の異なるケーキのサイズ(M、N、Kの次元の組み合わせで64から16,384まで)でテストしました。これらのサイズは、Qwen、Llama、DeepSeekといった有名なオープンソースAIモデルで使用される正確な次元をカバーしています。

AIが現在のチャンピオンと比較してどれほど速く焼けるのかを、A100 GPU上で測定した結果は以下の通りです:

  • 標準的なツール (torch.matmul) に対して: 連続的な製菓セッション(オフラインモード)において、CUDA-L2は**22.0%**高速です。忙しい厨房で注文がランダムに入る場合(サーバーモード)は、**28.7%**高速です。
  • ゴールドスタンダード (cuBLAS) に対して: NVIDIA独自の高度に最適化されたライブラリに対しても、CUDA-L2は勝利しました。連続モードで19.2%、サーバーモードで**26.0%**高速です。
  • 「オートオプティマイザー」 (cuBLASLt-AutoTuning) に対して: これが最も重要な比較です。cuBLASLt-AutoTuningは、最適なレシピを見つけるために最大100通りのレシピを試行します。それでもCUDA-L2は、連続モードで11.4%、サーバーモードで**15.9%**上回りました。

この数値は、単に推測したりシミュレーションしたりしたのではなく、コードを数千回実行して直接測定されたものであるため、非常に信頼性が高いものです。

AIが「しなかった」こと

このシステムが「できない」ことも知っておく必要があります。論文では、現在のバージョンのCUDA-L2はA100アーキテクチャに限定されていると明記しています。しかし、このフレームワークは幅広い適用性を考慮して設計されており、チームはRTX 3090のような古いAmpereチップや、より新しいHopper(例:H100)およびBlackwell(例:B200)チップを含む他のGPUアーキテクチャへの拡張に積極的に取り組んでいます。また、論文は、人間が行列積を「解決済み」であるという考えに反論しています。AIがより良いレシピを見つけたという事実は、人間のチューニングがまだ完璧ではないことを証明しています。

AIはいかにしてより良いケーキを焼く方法を学んだか

AIはただ推測したわけではありません。人間がチェックするには忙しすぎて見逃してしまうような、具体的で巧妙なトリックを学びました。

  1. ケーキのパディング(詰め物): 幅が8,192インチのケーキがあるとします。しかし、あなたのケーキ型は幅が160で割り切れる場合にのみ完璧にフィットします。8,192は160で割り切れません。人間なら「128のサイズの型を使おう」と言うかもしれません。しかし、AIは「ケーキを8,320インチにするために、ほんの少し余分な生地(パディング)を加え、160インチの型を使えるようにしよう」と言いました。このわずかな追加作業が、プロセス全体をより速くしたのです。
  2. ピンポン戦略: 通常、ベイカーは材料を投入し、混ぜ、それから次のバッチを投入します。AIは「ピンポン」方式を編み出しました。ミキサーがバッチAを混ぜている間に、助手はすでにバッチBの材料を準備しています。これにより、ミキサーが待機する時間がなくなります。
  3. 「時差」のある配送: 時には、2つの材料(AとB)を同時に要求するとキッチンで渋滞が発生することに、AIは気づきました。代わりに、AIは材料Aを要求して混ぜ始め、その後に材料Bを要求しました。これにより、キッチンがスムーズに動き続けました。
  4. 適切な型の選択: AIは、小さなケーキには小さな型が最適であることを学びました。しかし、巨大なケーキにはもっと大きな型が必要です。AIは、1,000種類の異なるサイズに対して、人間が一生かけて計算するような、あらゆるケーキの次元に対する完璧な型サイズを見つけ出しました。

「サーバー」と「オフライン」の違い

論文はまた、厨房環境についても興味深いことに気づきました。

  • オフラインモード: 工場のラインのように、ケーキが次々と止まることなく焼かれる状況を想像してください。オーブンは熱いまま維持され、作業員はリズムに乗っています。ここでは、AIは競合よりも**11.4%から22.0%**高速でした。
  • サーバーモード: 忙しいレストランのように、注文がランダムなタイミングで入ってくる状況を想像してください。注文の合間にオーブンが冷えたり、作業員が再び動き出すための準備が必要になったりします。この「現実世界の混沌」の中では、AIの優位性はむしろ増大し、競合を**15.9%から28.7%**上回りました。論文は、AIのレシピがこれらの「コールドスタート」や予測不可能な一時停止を処理するのに優れているためだと示唆しています。

結論

論文は、行列積のような極めて重要で高度に最適化されたタスクであっても、LLM主導の強化学習は、人間がチェックするにはあまりにも広大な可能性の空間を探索することで、人間よりも優れた解決策を見つけられると結論付けています。この特定のバージョンのCUDA-L2は現在A100 GPUに限定されていますが、フレームワークは将来的に他のチップへ拡張できるように設計されています。

要約すると、AIは単にレシピを微調整したのではなく、人間が考えてもみなかった全く新しいケーキの焼き方を発見しました。これは、GPU最適化という成熟した分野においても、依然として改善の余地が多分にあることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →