← 最新の論文
🤖 machine learning

DASH: Faster Shampoo via Batched Block Preconditioning and Efficient Inverse-Root Solvers

本論文は、GPU利用率を向上させるための3Dテンソルスタッキングと、収束品質を維持または向上させつつ最大5.6倍の高速化を実現する新しい逆平方根ソルバー(Newton-DBおよびChebyshev近似)を活用した、Distributed Shampooオプティマイザの著しく高速な実装であるDASHを紹介するものである。

原著者: Ionut-Vlad Modoranu, Philip Zmushko, Erik Schultheis, Mher Safaryan, Dan Alistarh

公開日 2026-06-26
📖 1 分で読めます☕ さくっと読める

原著者: Ionut-Vlad Modoranu, Philip Zmushko, Erik Schultheis, Mher Safaryan, Dan Alistarh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大なロボットに新しい言語を教えようとしていると想像してください。これを行うには、ロボットの脳(パラメータ)を調整してミスを最小限に抑える「オプティマイザー(最適化アルゴリズム)」、つまり賢いコーチが必要です。

長年、最も人気のあるコーチは Adam でした。これは高速ですが、少し「怠慢」です。個々のニューロンがどれだけ変化する必要があるかだけを見て、ニューロンがどのようにチームとして機能しているかを無視してしまうのです。

そこに Shampoo という、より賢いコーチが登場しました。Shampooは、ニューロンを一つずつ見るのではなく、それらがグループとしてどのように相互作用するかを見ます。これにより、学習の質が向上し、後の圧縮も容易になります。しかし、問題があります。Shampooは信じられないほど遅いのです。まるで、完璧な動きを計算することに時間を使いすぎて、ロボットがほとんど練習できないほど時間をかけてしまう天才的なコーチのようなものです。

この論文では、この天才的なコーチを、知性を失うことなく短距離ランナーのようなスピードで走らせる新しいシステム、DASH (Distributed Accelerated SHampoo) を紹介しています。以下に、その仕組みを簡単な比喩を用いて説明します。

1. 「積み重ね」のトリック (バッチ・ブロック・プリコンディショニング)

問題点:
膨大な数の本(データ)を整理しなければならない図書館を想像してください。従来の方法(Distributed Shampoo)では、本を1冊取り出して整理し、元に戻し、次の本を取り出して整理する……という手順でした。たとえ1,000人の作業員(GPU)がいたとしても、前の人が終わるのを待って立っている時間がほとんどでした。これは非効率です。

DASHによる解決策:
DASHはワークフローを変更します。本を1冊ずつ扱う代わりに、それらを整然とした均一な3Dタワー状に積み重ねます。すると、作業員はタワー全体を掴み、中のすべての本を同時に整理できるようになります。

  • 比喩: これは、レジ係が商品を一つずつスキャンするのと、コンベアベルトが箱に入った食料品を丸ごと一瞬でスキャンする機械に流し込むのととの違いのようなものです。
  • 結果: この「積み重ね」により、コンピュータの強力なグラフィックスチップ(GPU)がフル稼働できるようになり、オプティマイザのステップが最大5.6倍速くなります。

2. 「近道」の数学 (効率的な逆平方根ソルバー)

問題点:
Shampooが仕事を遂行するためには、ステップごとに非常に難しい数学のパズルを解かなければなりません。それは、巨大な行列の「逆平方根」を見つけることです。従来の解法は、干し草の山の中から一本一本の草をチェックして針を探すようなものでした(固有値分解と呼ばれる手法)。正確ですが、非常に時間がかかります。

DASHによる解決策:
著者らは、このパズルを解くための2つの新しい「近道」を導入しました。

  • Newton-DB: 答えに近づくたびに推測を更新していく、賢い反復的な手法です。まるで、走行中にルートを再計算するGPSのようなものです。
  • チェビシェフ多項式: 答えを非常に素早く推測する数学的な近似法です。
  • 比喩: 迷路の出口を見つけるためにすべての道を歩いて回る(従来の方法)代わりに、これらの新しい手法は、出口への大まかな方向を示す地図を持っているようなもので、出口に向かって全力疾走することを可能にします。

3. 「定規」の校正 (行列のスケーリング)

問題点:
これらの近道を使う際、数値が大きすぎたり小さすぎたりすると、数学的に不安定になることがあります。従来の手法で使用されていた「定規」(フロベニウスノルム)は長すぎたため、数値を引き伸ばしてしまい、近道による収束に多くのステップを要させていました。それは、小さなアリの長さを測るのに、100フィートもある長いメジャーを使っているようなもので、精度が失われてしまいます。

DASHによる解決策:
著者らは、より良い定規が必要であることに気づきました。彼らは Multi-Power-Iteration と呼ばれる技術を開発しました。

  • 比喩: アリの長さを巨大なメジャーで推測する代わりに、アリにぴったりフィットする高精度なノギスを使用するようなものです。これにより、数学的な収束が速まり、数値エラーによるクラッシュを防ぐことができます。

4. 結果

論文では、大規模言語モデル(9億5,300万パラメータを持つLlama)を用いてDASHをテストしました。

  • スピード: DASHは、トレーニングステップの「思考」部分を、以前の最高バージョンよりも5.6倍速く完了させました。
  • 品質: 非常に高速であるにもかかわらず、DASHで訓練されたモデルは、学習において同等、あるいはわずかに優れた性能を示しました。実際、新しい近道である「Newton-DB」は、テストされたすべての手法の中で最も低いエラー率(パープレキシティ)を記録しました。

まとめ

Shampoo を、ドライバーが景色の良いルートを選びすぎて渋滞に巻き込まれているフェラーリのエンジンだと考えてください。DASH は同じフェラーリのエンジンですが、今では以下のものを備えています。

  1. より広い高速道路(ブロックの積み重ね)により、より速く走行できます。
  2. GPSのショートカット(Newton-DB)により、渋滞を回避できます。
  3. より優れたナビゲーションツール(Multi-Power-Iteration)により、道に迷わないようにします。

その結果、「賢い」オプティマイザであるShampooは、もはや遅すぎて使い物にならないということはなくなり、次世代のAIモデルを訓練するための実用的な選択肢となりました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →