← 最新の論文
🤖 machine learning

Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes

本論文は、Apple の MPS バックエンドが自己回帰推論中に予期せぬ非単調なレイテンシスパイクを示すことを明らかにしており、CPU および NVIDIA CUDA システムで観察される滑らかなスケーリングとは対照的に、バックエンドの実行ダイナミクスにより特定の構成においてデコード性能が最大 21 倍まで急激に劣化し得ることを示している。

原著者: Willy Fitra Hendria

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Willy Fitra Hendria

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが車を運転している状況を想像してください。その車は、乗客(トークン)を一人増すごとに、徐々に遅くなっていくはずの高速道路を走っています。AI の世界では、通常はこれがどう機能するものだと考えられています:会話の長さが増すほど、次の単語を生成するのにかかる時間は増えますが、それは滑らかで予測可能な増加であるべきです。

しかし、この論文は、アップルのコンピュータ(特に M シリーズチップを搭載した機種)において、その「高速道路」が奇妙に振る舞うことを発見しました。滑らかな坂の代わりに、突然現れてすぐに消える、巨大で急な段差が運転中に現れるのです。

以下は、日常の比喩を用いたこの論文の発見事項の解説です:

1. 「ゴースト・スピードバンプ」

研究者たちは、アップルのグラフィックスシステム(MPSと呼ばれる)を使ってテキストを生成する際、単語を生成するのにかかる時間が常に一定に増加するわけではないことを発見しました。

  • 通常の期待: AI に 100 語書かせると 1 秒かかる場合、200 語なら 2 秒、300 語なら 3 秒かかります。これは単調スケーリング(滑らかで予測可能な直線)です。
  • アップルの現実: AI が 496 語を 9 秒で書く場合でも、16 語だけ追加(合計 512 語)して書かせると、突然89 秒もかかってしまいます。その後、さらに 16 語だけ追加(合計 528 語)すると、再び高速に戻るのです。
  • 比喩: 理由もなく、道路を走っているときに突然、100 フィートだけ泥沼にハマって這うように遅くなり、その区間を通過した瞬間に再び全速力に戻るようなものです。論文によると、これらの「泥沼」は非常に特定の単語数(512 や 384 など)で発生し、AI を通常より21 倍も遅くすることがあります。

2. 「魔法の記憶箱」(KV キャッシュ)

AI を高速化するために、エンジニアたちはKV キャッシングというトリックを使います。これは「魔法の記憶箱」とも呼べ、AI が会話の文脈をそこに保存することで、新しい単語を書くたびに物語全体を最初から読み直す必要がなくなる仕組みです。

  • 通常: この箱は車の走行を大幅に高速化します。
  • 問題点: この論文は、AI がその「ゴースト・スピードバンプ」(512 語の地点)に到達すると、この魔法の記憶箱が本来あるべきように機能しなくなることを発見しました。
  • 結果: 通常、この箱を使うことで AI は使わない場合の 20 倍速くなります。しかし、「悪い」単語数では、その利点がほぼゼロに縮小します(1.9 倍速いだけ)。箱はそこにあるものの、渋滞に巻き込まれている状態です。

3. ガソリン切れ(メモリ不足)ではない

AI が遅くなると、「ああ、コンピュータのメモリが不足しているんだな」と思うかもしれません。

  • テスト: 研究者たちはコンピュータのメモリ使用量を確認しました。メモリ使用量は風船が膨らむように、滑らかかつ着実に増加していることがわかりました。AI が遅くなった瞬間に、メモリ使用量が急激に跳ね上がったり、落ちたりはしませんでした。
  • 結論: 遅延はコンピュータの容量不足が原因ではありません。「エンジン」(ソフトウェアバックエンド)が、特定の瞬間に非常に非効率なギアチェンジを突然行うことが原因です。ガソリンタンクが満タンであるにもかかわらず、エンジンが数秒間だけ、別のひどい燃料混合物で走ることを突然決めるようなものです。

4. あらゆる場所で発生する(特定の車だけではない)

研究者たちは、異なる種類の AI モデル(GPT-2、BLOOM、OPT)と、異なるアップルコンピュータ(M3 Max と M3 Pro)でこれをテストしました。

  • 発見: 「ゴースト・スピードバンプ」はすべてに現れました。バンプの正確な位置は、車のモデルやエンジンサイズによってわずかに変化しましたが、現象自体は同じでした。
  • 比較: 同じ AI を標準的なコンピュータ(CPU)や NVIDIA グラフィックスカード(CUDA)でテストしたところ、走行は滑らかでした。「凸凹道」は、アップル現在のグラフィックスソフトウェア特有の欠陥です。

5. これがあなたにとってなぜ重要なのか

この論文は、もしあなたが AI を 1 つまたは 2 つの特定の長さ(例:「100 語での速度を見てみよう」)だけでテストした場合、これらの巨大な遅延を完全に見逃してしまう可能性があると警告しています。

  • 罠: AI のベンチマークを行い、500 語では速いように見えても、512 語をチェックしなかった場合、システムは完璧だと考えてしまうかもしれません。しかし、現実には、ユーザーの会話がその特定の長さに達すると、システムは一瞬凍結する可能性があります。
  • 教訓: 「平均」速度を見るだけでは不十分です。すべてのステップを確認する必要があります。なぜなら、アップルチップでは、生成される単語の数によって、速度が突然かつ予測不可能に変化する可能性があるからです。

要約: アップルの AI チップは強力ですが、そのソフトウェアには隠れた欠陥があり、非常に特定の瞬間に、システムが一時的に信じられないほど遅くなり、その後すぐに通常に戻るという現象が起きます。これは十分なメモリが利用可能な場合でも発生し、通常の「高速化のトリック」(KV キャッシングなど)を、その瞬間にははるかに効果の低いものにしてしまいます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →