← 最新の論文
💬 NLP

Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference

Ada-MK は、コンパイル時 DAG ベースの探索とメモリ分割を通じてランタイム動的スケジューリングを排除し共有メモリ使用量を削減する新規最適化フレームワークであり、NVIDIA GPU 上の vLLM に対して最大 50.2% のスループット向上を実現する商用オンライン広告システムにおける MegaKernels の初の産業実装を可能にする。

原著者: Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Wenxin Dong, Mingqing Hu, Guanghui Yu, Qiang Fu, Peng Xu, Hui Xu, Yue Xing, Xuewu Jiao, Shuanglong Li, Lin Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大なオンラインストア(検索エンジンや広告プラットフォームなど)のための超高速配送サービスを運営していると想像してください。顧客が質問をするたびに、あなたのシステムは単語ごとに応答を生成する必要があります。大規模言語モデル(LLM)の世界では、これを「推論」と呼びます。

問題は、生成される単語一つ一つについて、コンピューターがグラフィックカード(GPU)に数千もの小さな指示を送らなければならないことです。まるで、配送ドライバーが、たった一文のために、郵便局に立ち寄って荷物を引き取り、倉庫まで運転して荷物を下ろし、戻ってきて、これを数千回繰り返すようなものです。この「立ち止まってから再開する」オーバーヘッドは膨大な時間を浪費します——総移動時間の約 15% が、実際の商品配送ではなく、これらの小さな立ち寄りに費やされているのです。

大きなアイデア:「メガカーネル」
これを解決するため、研究者たちは「メガカーネル」という概念を発明しました。すべての小さなタスクのために郵便局に立ち寄る代わりに、必要なものをすべて出発時に積み込み、経路全体を止まることなく走り抜け、最後にすべてを配達する超効率的な配送トラックを想像してください。それは、それらの小さな立ち寄りを一つ巨大で連続した旅に融合させます。これにより、「立ち止まってから再開する」遅延が排除されます。

しかし、落とし穴があります。この会社(NVIDIA Ada/L20)が使用するトラック(GPU)の特定のタイプは、より新しく高級なトラック(Hopper/Blackwell)に比べて小型で、運転席の収納スペースが少ないのです。

  • 旧ソリューション 1(手動チューニング): 専門家が、この特定の小型キャブ用にカスタムトラックを人手で構築しました。それは高速でしたが、荷物(AI モデル)や道路(ハードウェア)を変更すると、トラックは故障しました。移植性がありませんでした。
  • 旧ソリューション 2(自動チューニング): 彼らは、走行中に荷室を自動的に調整できるトラックを作ろうと試みました。しかし、ドライバーは運転中に常に地図を確認し、「棚は満杯か?立ち寄るべきか?」といった判断を迫られました。これらの絶え間ない判断がトラックを遅らせ、ミリ秒単位での配送が必要な状況では許容できませんでした。

新しいソリューション:Ada-MK
この論文の著者たちは、より小型の「Ada」トラックの問題を解決する新しいシステム「Ada-MK」を作成しました。彼らがどのように行ったかを、単純なアナロジーを用いて説明します。

1. 「スマートな梱包」戦略(適応型共有メモリ)

小型トラックには小さな収納コンパートメント(共有メモリ)があります。詰め込みすぎると、トラックは停止してしまいます。

  • イノベーション: 小さなコンパートメントにスーツケース全体を詰め込もうとする代わりに、彼らはスーツケースを半分に切断しました(K 次元分割)。半分の荷物を積んで配達し、残りの半分を積みます。
  • 結果: これにより、必要なピークストレージが**50%**削減されました。また、一つの荷物を下ろした直後に空いたスペースを再利用して次の荷物を積み込む方法を考案し、トラックがスペースを待って待機することなく、決して無駄な時間を過ごさないようにしました。

2. 「事前に計画されたルート」(オフライン DAG 探索)

従来の「自動チューニング」トラックは、走行中に判断を下すため、渋滞(分岐ペナルティ)を引き起こしました。

  • イノベーション: チームは、トラックがガレージを出る前に、数百万の可能なルートをシミュレーションするために強力なコンピューターを使用しました。彼らは、すべての曲がり角と立ち寄りを詳細な図(DAG)にマッピングしました。
  • 結果: 最良のルートが見つかった後、それを「固化」しました。ドライバーは走行中に考えたり地図を確認したりする必要はなくなりました。事前に計画された経路を完璧に追うだけです。これにより、すべての判断遅延が除去され、走行は驚くほど滑らかで高速になります。

3. 「ハイブリッド車隊」(異種エンジン)

彼らは、旅程の一部(「プリフィル」と呼ばれる、開始時に巨大なバッチの荷物を積み込む段階)については、従来の標準トラックの方が実際には優れていることに気づきました。しかし、最終的な配送(単語ごとの生成、「デコード」と呼ばれる)については、彼らの新しいメガカーネルトラックの方が優れていました。

  • イノベーション: 彼らはハイブリッドシステムを構築しました。開始時の重労働には標準トラックを維持しつつ、最終配送段階では新しいメガカーネルトラックにシームレスに切り替えました。
  • 結果: 両方の長所が得られます。開始時の高速性と、完了時の超低遅延性です。配送ネットワーク全体を再構築する必要はありません。

現実世界への影響
チームは、このシステムを百度の商用オンライン広告システムでテストしました。

  • 速度: 速度が重要なシナリオ(小バッチ、短い応答)において、彼らのシステムは標準的な業界ツールよりも最大23.6%、人気のあるオープンソースツールである vLLM よりも**50.2%**高速でした。
  • 信頼性: さまざまな種類の AI モデルやタスクにおいて一貫して機能しました。
  • 世界初: これが、実在するライブの商用広告システムで「メガカーネル」が初めて成功裏に展開された事例です。

まとめ
この論文は、特定の小型コンピューターチップ上で、AI チャットボットや広告システムを大幅に高速化する手法を説明しています。彼らは、データをより効率的に梱包し、ドライバーが決して考えなくても済むように配送ルート全体を事前に計画し、新しい高速配送方法を既存のツールと組み合わせることでこれを実現しました。その結果、特に多くのユーザーが順番に質問をしている場合、回答を著しく高速に届けるシステムが生まれました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →