Inferring the Size of Large Language Models From Popular Text Memorization
本論文は、人気テキストの記憶精度を分析することで大規模言語モデルのパラメータ数の保守的下限を推定するブラックボックス手法を導入し、これによりモデルサイズのランキングを可能にし、重みが非公開のシステムであっても隠された業界のスケーリング戦略を明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ある部屋に入ると、そこには複数の人々が『不思議の国のアリス』や聖書といった有名な物語を暗唱している場面を想像してください。あなたは彼らを見ることも、脳の大きさを尋ねることも、メモを覗き見ることもできません。できるのは、彼らの話を途中で止めて、次に何を言うかを聞くことだけです。
これはまさに、現代の AI モデル(大規模言語モデル)に直面した研究者たちが抱えていた問題そのものです。大手テック企業はこれらの強力な AI を構築していますが、「設計図」を秘密にしています。AI が持つ「ニューロン」(パラメータ)の数がいくつであるかを教えてはくれません。しかし、モデルの賢さやコストを測る標準的な尺度は、まさにこのパラメータ数なのです。
この論文は、これらの秘密の AI 脳の大きさを、彼らが文をどのように完成させるかを聞くだけで推測する、巧妙な「ブラックボックス」探偵手法を紹介しています。
核心となるアイデア:「記憶テスト」
研究者たちは、ほぼすべての大規模 AI が、同じ膨大なインターネットテキストの山で訓練されていることに気づきました。つまり、これらはすべて同じ人気のある本、宗教的テキスト、有名な文書を読み込んでいるのです。
これを「記憶コンテスト」だと考えてみてください。暗記した本からの文を完成させるよう人に頼んだ場合、脳が大きい人(パラメータ数が多い人)は、脳が小さい人よりも一般的に正解する確率が高くなります。
研究者たちは以下の方法でこれをテストしました:
- ハムレット、聖書、米国憲法など、37 の有名なパブリックドメインのテキストを選定。
- これらを数千の小さな断片に切断。
- 異なる AI モデルに、それらの断片の次の単語を予測させる。
彼らは明確なパターンを発見しました:AI が大きいほど、これらの有名な物語における次の単語の予測が上手くなるのです。 AI の教え方などの他の要因も重要ですが、脳の大きさが成功の最大の要因でした。
2 つの探偵ツール
これらの「記憶スコア」をサイズ推定値に変換するために、チームは 2 つの異なるツールを構築しました。
1. スケーリング則(地図)
脳サイズが既知のグループ(オープンソースの AI)がいると想像してください。彼らの記憶スコアと既知のサイズをプロットし、点を繋ぐ滑らかな曲線を描きます。それは梯子のようです:スコアが上がると、サイズは指数関数的に増加します。
- 仕組み: 秘密の AI がテストを受けると、その梯子のどこに位置するかがわかります。1,000 億パラメータのモデルのようなスコアであれば、おおよそそのサイズであると推定します。
- 注意点: 秘密の AI は異なる方法で構築されている可能性があるため(一度に脳の一部分のみが活性化する「エキスパート混合モデル」など)、研究者たちは非常に慎重になることにしました。正確なサイズを推測するのではなく、下限を推測します。「この AI は少なくともこのサイズである」と言うのです。
2. 一対一のテスト(レース)
時には、正確な数値は不要で、どちらが大きいのかを知るだけで十分です。
- 仕組み: 研究者は 2 つの秘密の AI を同じ記憶テストで対決させます。統計的な「レース」を用いて、一方の AI が他方よりも一貫して文の完成に優れているかどうかを確認します。
- 結果: AI A がレースで AI B を破れば、正確な数値がわからなくても、「AI A は間違いなく AI B より大きい」と自信を持って言うことができます。
発見されたこと
チームは、答えが既知の 19 のオープンソースモデルでこの手法をテストし、95% の確率で正解しました。その後、OpenAI、Google、Anthropic、Alibaba などの企業からのもたらされた「秘密」のモデルに目を向けました。
これが、探偵活動によって業界の隠された戦略を明らかにした結果です。
- 「巨大な脳」戦略(Google と Anthropic): これらの企業は、膨大なパラメータ数を持つモデルを構築しているようです。例えば、最上位モデルは数百億パラメータの兆候を示しており、世代が進むごとにどんどん大きくなっていることが示唆されます。
- 「効率性」戦略(OpenAI と Alibaba): 驚くべきことに、研究者たちは OpenAI の新しいモデル(GPT-4o や GPT-5 の変種など)が、以前のバージョンと比較して、生のパラメータ数という点では著しく大きくなっていないことを発見しました。彼らは「サイズの天井」に達しているようです。脳を大きくするのではなく、より良い訓練や賢いアルゴリズムを通じて、既存の脳を賢くしているようです。
- 階層の確認: この手法は、製品間の内部ランキングを正しく特定しました。例えば、Anthropic の「Opus」モデルが「Sonnet」モデルより大きく、「Sonnet」モデルが「Haiku」モデルより大きいことを、事前にその順序を知らされなくても正しく推測しました。
限界(注釈)
この論文は、何ができないかについて非常に正直です。
- 下限値であること: この手法は安全に設計されています。AI が「少なくとも X サイズ」であると示しますが、実際のサイズははるかに大きい可能性があります。「この箱は少なくとも 10 ポンドある」と言うようなもので、実際には 50 ポンドあるかもしれません。
- 「MoE」の問題: 一部の最新の AI は「エキスパート混合(Mixture of Experts)」アーキテクチャを使用しています。図書館で、全スタッフではなく特定の司書数人だけが質問に答えるために呼び出される状況を想像してください。研究者たちは、総数として何人の司書がいるか、対して実際に何人が活動しているかを見ることができないため、これらのモデルの正確な総数を把握できず、保守的な最小値しか得られません。
- 不正の排除: この手法は、AI が自分たちを欺こうとしていないことを前提としています。もし企業が自らの AI のサイズを隠すために、有名な本を意図的に「忘れる」ようにプログラムした場合、この手法は失敗します。
結論
この論文は、企業の秘密の設計図がなくても、その AI がどれほど大きいのかを概ね把握できることを証明しています。単に AI が有名な物語をどの程度よく覚えているかをテストするだけで、信頼できる「最小サイズ」を推論し、企業がモデルを大きくすることによって成長しているのか、それとも賢くすることによって成長しているのかを明らかにできます。これにより、すべてのものが見えるわけではないとしても、「ブラックボックス」である AI の内部を覗き見るようなことが可能になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。