完璧なケーキを焼こうとしているところを想像してみてください。しかし、レシピはありません。味は2つの要素、つまり「小麦粉をどれくらい使うか(ケーキの大きさ)」と「どれくらいの時間焼くか(時間)」によって決まると分かっています。人工知能の世界では、科学者たちは、この「トランスフォーマー」と呼ばれる巨大な脳のようなコンピュータを訓練するための完璧な「レシピ」を見つけようとしています。彼らはこう考えます。「もし、電気代とコンピュータの使用料に使える予算が決まっているなら、小さな脳を作って大量のデータを食べさせるべきか、それとも巨大な脳を作ってほんの少しのデータを与えるべきか?」
これを解明するために、研究者たちは数学を用いる必要があります。彼らは「材料(脳のサイズ)」と「労力(コンピュータの作業量)」を数えます。しかし、ここが厄切なところです。パン屋が「ボウルの重さを含めるのか、小麦粉だけを数えるのか」によって「カップ一杯の小麦粉」の数え方が変わるように、AI科学者も「材料」や「労力」を数える方法が人によって異なります。ある人は脳のすべてのパーツを数え、別の人は主要な思考部分のみを数えます。ある人は生の計算操作を数え、またある人はコンピュータが実際に稼働した秒数を数えます。長年、誰もがこれらの数え方の違いはそれほど重要ではないと考えてきました。なぜなら、彼らが研究している脳があまりにも巨大すぎて、余計な部分が微々たるものだったからです。しかし、もしあなたが巨大なウェディングケーキではなく、小さなカップケーキを焼いているとしたらどうでしょう? 材料の数え方を変えるだけで、レシピが突然変わってしまうのでしょうか?
独立した研究者であるアレクサンダー・メミングによるこの論文は、まさにその問いを投げかけています。著者は推測するのをやめ、測定することに決めました。巨大企業にしか手が届かないような大規模で高価なAIモデルを見る代わりに、メミングは35個の小さく管理可能なAIモデルのグリッドを構築しました。彼はこれらをすべて同じ教育テキストを用いて、同じルールで訓練しましたが、分析の際には「サイズ」と「コスト」の数え方だけを変えて、結果を4つの異なる方法で分析しました。
その発見は、まるで「小さな量を量るときにだけ、キッチンの秤が嘘をついている」ことに気づくようなものです。論文によると、古い単純な数え方(脳の「出力ヘッド」を無視する方法)を使用した場合、数学的な示唆によれば、より精密なカウントが推奨するものよりも約19倍小さいモデルを作るべきだということになります。言い換えれば、どの「定規」を使うかによって、推奨されるレシピは劇的に変わります。モデルがどのように成長すべきかを示す指数(exponent)は、会計方法を変えるだけで0.25から0.42へと変化しました。これは非常に大きな差であり、二人の科学者が全く同じ訓練の実行結果を見ているとしても、使用した数字の定義が異なるだけで、全く異なる「最適」なレシピを発表してしまう可能性があることを示唆しています。
しかし、実際にこれらのモデルを構築している人々にとって、この事態をそれほど恐れる必要はないという「ひねり」があります。紙の上での「レシピ」は非常に異なって見えましたが、出来上がった「ケーキ」の味はほとんど同じだったのです。著者は、最高のパフォーマンスが得られる「谷(最適値の領域)」が非常に平坦であることを発見しました。これは、もし古い単純なカウント方法に基づいた「間違ったレシピ」に従ったとしても、予算をすべて無駄にするわけではないことを意味します。計算資源の約18%を無駄にするかもしれませんが、最終的な結果は依然として可能な限り最高の成果に近いままなのです。論文は、科学者がリンゴとリンゴを比較できるように、数字の報告方法には細心の注意を払う必要があるものの、会計を少し間違えたことによる実質的なコストは驚くほど小さいと結論付けています。「完璧な」レシピは動く標的のようなものですが、「十分に良い」レシピの範囲は、私たちが考えていたよりもずっと広いのです。
技術要約:何が計算量(Compute)を構成するのか? 計算最適化されたTransformer学習における会計慣習の経験的分析
問題提起
Transformerの計算最適化された学習レシピを導出するには、2つの極めて重要でありながら、しばしば暗黙的に扱われる選択肢が存在する。それは、「モデルサイズ」(何がパラメータとしてカウントされるか)と「計算量」(何が学習コストとしてカウントされるか)の定義である。この領域で最も頻繁に引用される2つの研究、Kaplanら [2020] と Hoffmannら [2022] は、異なる選択を行っている。前者は非埋め込み(non-embedding)パラメータのみをカウントしたが、後者は全パラメータをカウントした。両者はともに C≈6ND (N はパラメータ数、D はトークン数)という近似に依拠しており、出力ソフトマックス投影(output softmax projection)やアテンション機構の計算コストを無視している。
これらの近似は、GPT-3やChinchillaのようなフロンティア規模のモデルにおいては有効である(埋め込みおよび出力ヘッドのオーバーヘッドが無視できるため)。しかし、アカデミックな研究や小規模な研究でアクセス可能な小規模スケールにおいては、これらは成立しない。これらのスケールでは、出力投影が学習FLOPsの大部分を消費し、埋め込みパラメータがパラメータ数において支配的になる可能性がある。本論文は次のように問いかける:基礎となる学習実行自体は固定したまま、会計慣習を変更した場合、報告される計算最適化のフロンティア(具体的には N∗∝Ca における指数 a およびトークン対パラメータ比)はどの程度シフトするのか? さらに、不適切な慣習に従った場合に発生する実用的な損失はどの程度か?
手法
著者らは、会計慣習の影響を分離するために、制御された経験的スイープを実施した。
- モデル・ファミリー: 35個のデコーダーのみのTransformerをFineWeb-Edu上で学習させた。モデルは 0.056M から 5.98M の非埋め込みパラメータ (Nne) を持ち、幅 d∈{48,…,288} と、幅に連動した深さ (L=max(2,d/48)) を備えている。
- 語彙と計算量: 埋め込み/出力ヘッドのオーバーヘッドの比率を16倍変化させるため、2つのBPE語彙サイズ (V=2048 および V=8192) で実験を行った。学習計算量は5.8倍の範囲で変化させた。
- コントロール: 先行するスケーリング研究(例:Porianら [2024])で特定された混同要因を排除するため、著者らは独自のスイープによって学習率を較正し、学習長に合わせてコサインスケジュールの設定を一致させ、データの重複を排除し、一貫したオプティマイザとトークナイザを使用した。
- 4つの会計慣習: 同一の35回の実行を、4つの異なるサイズ (N) およびコスト (C) の定義の下で分析した。
- K (Kaplan): N=Nne, C=6NneD。
- H (Hoffmann): N=Ntot (全パラメータ), C=6NtotD。
- F (Exact FLOP): N=Nne, C=Cexact (アテンションの行列積および出力ソフトマックスを含む)。
- W (Wall-clock): N=Nne, C=Csec (測定されたデバイス時間)。
- 分析: 著者らは、データに対して標準的な加法的な損失曲面 (L=E+A/Nα+B/Dβ) を適合させ、各慣習における計算最適化のフロンティアを導出した。また、アーキテクチャのみから計算可能な2つの弾力性(elasticity)に基づき、指数のシフトを予測する閉形式の関係式も導出した。
主な結果
- シフトの大きさ: 同一のデータセットに対して会計慣習を変更したことで、適合された指数 a は 0.25から0.42 の範囲で大きく変動した。示唆されるトークン対パラメータ比は、慣習間で19倍の差が生じた。
- 「ヘッド」の支配: 小規模スケールにおける不一致の主な要因はアテンションではなく、出力ソフトマックス投影である。最小のモデル (d=48,V=8192) では、出力ヘッドが学習FLOPsの83%を消費しており、$6ND$ 近似は真のコストを最大8.5倍過小評価している。
- 予測精度: 2つの弾力性 (κc および γc) から導かれた閉形式の関係式は、数値的な適合において、4つの慣習のうち3つを 0.105 以内の誤差で予測することに成功した。これは、シフトがノイズではなく、会計上の選択による決定論的な算術の結果であることを裏付けている。
- 順序: 慣習の順序は、理論的予測と一致して aH<aK<aF (ここで H は全パラメータ、K は非埋め込みかつ $6ND、F$ は正確なFLOPs)となった。
- 実用的コスト(非対称性): 報告される指数の値や最適比に大きな相違があるにもかかわらず、「誤った」慣習に従うことによる実用的コストは限定的である。IsoFLOPの損失の谷(loss valley)は平坦であるため、不適切な推奨に従ったとしても、計算予算の最大18%(1トークンあたり0.031 nats)を無駄にするだけで済む。3つのFLOPベースの慣習は、計算量等価の観点からは5%以内の差であった。
意義と主張
本論文は、特定の会計慣習(パラメータの定義およびコスト指標)が明示されていない限り、報告された計算最適化の指数は研究間で比較できないと主張している。乖離は、アカデミックなスケーリング実験が通常行われる領域、すなわちオーバーヘッドの比率が無視できない領域で最大となる。
しかし、本論文は指数の絶対値については控えめな姿勢をとっており、それらは普遍的な定数ではなく、特定のデータ、アーキテクチャ、および最適化プロトコルの特性であると述べている。主な貢献は構造的なものである:
- 研究者が慣習間で指数を変換することを可能にする変換ルール(式12)を提供している。
- 研究が $6ND近似を仮定しているかどうかを識別するための∗∗診断ツール∗∗(a+b=1$ かどうかをチェックする)を提供している。
- ブックキーピング(記帳)上の選択が報告される指標に大きな数値的相違を生じさせる一方で、損失の景観(loss landscape)は十分に平坦であり、これらの相違による実用的なペナルティは小さいことを示している。
著者らは、再現性と比較可能性を確保するために、分野全体として会計慣習を明示的に報告すべきであると結論づけているが、推奨されるレシピの軽微な偏差について実務家がパニックに陥る必要はない。なぜなら、「計算最適化の谷」は寛容であるからである。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録