← 最新の論文
💬 NLP

Information-Theoretic Limits of Reliability and Scaling in Language Models

本論文は、タスクの曖昧さとトークン間の依存関係に基づき固有の信頼性の天井を定義する情報理論的枠組みを確立することによって、スケーリングのみでは完全な信頼性の達成は不可能であるという仮定に異を唱え、それによって、訓練データとモデル容量の間のボトルネックを特定し、検索拡張や破滅的忘却といった現象を説明する統一されたスケーリング則を導出するものである。

原著者: Subhabrata Majumdar

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Subhabrata Majumdar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに物語を語らせたり、数学の問題を解かせたり、詩を書かせたりする方法を教えようとしていると想像してみてください。もっと多くのコンピューターチップ(脳力)を与え、もっと多くの本(データ)を読み込ませれば、いずれあらゆる分野で完璧になれるのではないかと考えるかもしれません。この考え方は、人工知能(AI)の急速な成長の原動力となってきました。しかし、もし「隠れた天井」があるとしたらどうでしょう? もし、ロボットがいかに賢くなったとしても、どうしても100%正解することが不可能なタスクが存在するとしたら? 本論文は、情報理論という科学の一分野を用いて、この問いを掘り下げます。情報理論とは、メッセージの中にどれだけの「驚き」や「不確実性」が詰め込まれているかを研究する学問だと考えてください。ロボットに「2+2は何?」と尋ねれば、驚きはゼロです。答えは常に4だからです。しかし、「悲しい雲についての詩を書いて」と尋ねれば、そこには巨大な驚きが存在します。なぜなら、唯一の正解というものが存在しないからです。著者たちはこう問いかけています。「ロボットはその驚きのうち、どれほどの部分を解決できるのか? そして、どこで壁にぶつかるのか?」

本論文は、「モデルを大きくすれば、最終的にあらゆるタスクにおいて完璧な信頼性を達成できる」という一般的な通説は、数学的に間違っていると主張しています。著者らは、すべてのタスクには「信頼性の天井」、つまりモデルが到達しうる精度のハードリミットが存在することを示しています。この限界はモデルの大きさによるものではなく、タスクそのものの性質によるものです。数学の問題であれば、天井は空高く(100%の精度が可能)、クリエイティブな執筆であれば、天井はずっと低くなります。なぜなら、「正しい」答えは、ロボットが真に理解することのできない主観的な感情や文化的文脈に依存しているからです。論文は、スケーリング(規模拡大)によってこの天井を越えることはできないと証明しています。

さらに、著者らは、これらのモデルがテキストを生成する方法——連鎖反応のように一語ずつ生成していく方法——が、状況をさらに悪化させていることを発見しました。もしモデルが早い段階で小さなミスを犯すと、そのエラーは雪だるま式に増殖し、物語やコード全体を脱線させてしまいます。彼らは、コーディングのようなタスクは、一つのレンガが外れても全体が崩れない「頑丈なレンガの壁」のようなものである一方、詩を書くような他のタスクは、一つの動きの狂いが全体を崩壊させる「トランプの家」のようなものであることを見出しました。

最後に、本論文は、これらのモデルを成長させるための新しいルールを提示しています。単に問題に対してより多くのデータやコンピューターパワーを投げ込むのではなく、性能は「より希少なリソース」によってボトルネックが決まる、と著者らは示唆しています。もし大量のデータを持っていても脳(モデル)が小さければ、データを増やしても意味はありません。逆に、巨大な脳を持っていてもデータがなければ、脳力を増やしても意味はありません。両者を完璧にバランスさせる必要があります。この新しいルールは、なぜあるタスクではスケーリングによって性能が向上し、他のタスクでは停滞(プラトー)に陥るのかを説明しており、さらには、追加のリソース投入が実際に効果的なのか、それとも単なる時間の無駄なのかを示す数学的な地図を提供しています。

見えない天井

「次の単語を当てるゲーム」をしているところを想像してください。時には、ゲームは簡単です。「太陽は……に昇る」という文章があれば、次の単語はほぼ確実に「東」です。そこには謎はありません。しかし、他の時には、ひねりのある推測ゲームになります。「猫が……の上に座った」という文章の場合、次の単語は「マット」「ラグ」「ソファ」「床」など、どれでもあり得ます。すべて正解ですが、それぞれ感じ方が異なります。

著者らは、「東」のシナリオを**完全検証可能タスク(fully verifiable task)**と呼んでいます。数学の方程式を解いたり、エラーなしで実行されるコードを書いたりする場合のように、答えが質問によって完全に決定されるケースです。ここには隠された情報はありません。「信頼性の天井」は100%です。完璧なモデルがあれば、完璧なスコアが得られます。

しかし、クリエイティブな執筆や人生のアドバイスのように、**検証不可能なタスク(unverifiable tasks)**があります。ここでは、「正しい」答えは、書き手の気分、読者の好み、あるいは文化的瞬間といった、モデルが見ることのできない事柄に依存します。著者らは、この欠落した情報を「潜在的コンテキスト(latent context)」と呼んでいます。このコンテキストは隠されており、かつ主観的なものであるため、どれほどのデータやコンピューターパワーを用いても、モデルを100%信頼できるものにすることは決してできません。天井は低く、それは永続的なものです。正解が意見の問題であるタスクに対して、スケーリングによって完璧に到達することは不可能です。

論文では、これを2種類のギャップに分類しています。第一のものは**解決可能なギャップ(resolvable gap)です。これは、提供することが「可能」な欠落情報です。例えば、特定の人物についての物語を書いているモデルが、その人物の名前を知らない場合、それは解決可能なギャップです。名前を(入力に加えることで)モデルに与えれば、ギャップは埋まり、モデルは向上します。第二のものは主観的なギャップ(subjective gap)**です。これは、固定された値を持たないため、提供することが「不可能」な欠落情報です。タスクが「面白い」ジョークを書くことである場合、ある人にとって面白いことは、別の人にとっては退屈かもしれません。どれほど追加のデータを投入しても、このことは解決できません。論文は、これらのタスクにおいて、モデルには常に恒久的な不確実性の底が存在することを証明しています。

ドミノ効果

さて、モデルが一つのブロックずつ塔を築いているところを想像してください。最初のブロックを置き、次に二番目のブロック、三番目のブロックと置いていきます。これが大規模言語モデル(LLM)の仕組みです。彼らはトークンごとにテキストを生成します。問題は、もしモデルが最初のブロックをわずかに傾けて置いてしまったら、二番目のブロックは傾いた土台の上に置かれなければならないということです。

著者らはこれを**自己回帰的劣化(autoregressive degradation)**と呼んでいます。これは、メッセージが囁きごとに歪んでいく「伝言ゲーム」のようなものです。もしモデルが文章の早い段階で小さなミスを犯せば、そのミスが次の単語のコンテキストを変え、それがまた次の単語のコンテキストを変え、という具合にエラーが蓄積していきます。

しかし、すべての塔が同じように築かれるわけではありません。論文では、**依存カーネル(dependency kernel)**という概念を導入しています。これは、各単語が前の単語にどれほど依存しているかを説明するための、少し専門的な言葉です。

  • 帯状の依存関係(Banded Dependencies / レンガの壁): コーディングや数学を考えてみてください。コードの一行において、次の単語は通常、直前の単語(例えば、開いた括弧に対応する閉じ括弧など)に依存しています。もし間違いを犯しても、その間違いは通常、その狭い範囲に限定されます。残りのコードは依然として意味を成すことができます。ここでの「依存カーネル」は狭く、レンガの壁のようなものです。一つのレンガのミスが、壁全体を崩壊させることはありません。
  • 密な依存関係(Dense Dependencies / トランプの家): 詩やクリエイティブな執筆を考えてみてください。詩において、最初に選んだ単語が、詩全体の韻律(ライム)を決定してしまうことがあります。もし早い段階で間違った単語を選んでしまうと、詩全体のリズムや意味が失われてしまうかもしれません。ここでの「依存カーネル」は密であり、トランプの家のようなものです。最初のカードのミスが、構造全体を台無しにすることがあります。

論文は、密な依存関係を持つタスクにおいて、テキストが長くなるにつれてモデルの性能がはるかに速く劣化することを示しています。初期のたった一つのエラーが、完全な失敗へと連鎖するのです。これが、モデルが短く論理的なタスクには優れている一方で、長くクリエイティブなタスクには苦戦する理由です。

バランスの取り方

最後に、論文はスケーリングに関する問いに取り組んでいます。「モデルを大きくし、より多くのデータを与えれば、性能は向上するのか?」

答えは、**「あなたが何に対して不足しているかによる」**です。

著者らは、単純な数式のような新しい「スケーリング則」を導き出しています。それは、モデルの性能はより希少なリソースによって制限されるというものです。

  • 膨大な量のデータを持っていても、モデルが極めて小さい場合、モデルがそれをすべて学習するには小さすぎるため、データを増やしてもあまり効果はありません。
  • 巨大なモデルを持っていても、データが極めて少ない場合、モデルが学習するための材料がないため、パラメータを増やしても効果はありません。

最も大きな改善が得られる「スイートスポット」は、両者を完璧にバランスさせた時です。これは、研究者がすでに知っていた「Chinchilla(チンチラ)の法則」に似ていますが、本論文は「なぜそれが機能するのか」を説明し、さらに重要な詳細としてmax関数を加えています。これは、片方のリソースが多すぎてもボーナスは得られないことを意味します。もし、モデルが扱える量よりも100倍多いデータを持っていたとしても、その余剰なデータは役に立ちません。データとモデルのサイズを一致させる必要があるのです。

これが未来に意味すること

本論文は、単に「より良いモデルをどう作るか」を教えているのではありません。「何ができないのか」を教えているのです。それは、あらゆることに完璧な「汎用AI」という概念が、一種の神話であることを示唆しています。スケーリングによっても、決して100%の精度には到達できない「低い天井」を持つタスクが存在するのです。

また、なぜ特定のテクニックが有効なのかも説明しています。例えば、モデルが回答する前にデータベースから事実を検索する**検索拡張生成(RAG)**が機能するのは、それが「解決可能なギャップ」を埋めるからです。これは、モデルがより高い天井に到達するために必要な、欠落していたコンテキストを与えるものです。しかし、主観的なタスクについては、たとえRAGを用いたとしても「主観的なギャップ」を埋めることはできません。

さらに、論文は**破滅的忘却(catastrophic forgetting)**についても警告しています。新しいタスクのためにモデルを訓練すると、以前のタスクを「忘れて」しまうことがあります。著者らはこれを、リソースの再配分として説明しています。モデルには限られた「脳力の予算」があります。もし、非常に異なる構造(異なる依存カーネル)を持つ新しいタスクに集中させようとすれば、古い構造を切り捨てなければなりません。それは、新しい言語を学ぼうとする際、フランス語に集中しすぎるとスペイン語の文法規則を忘れ始めてしまうようなものです。

要するに、この論文は、AIがすべての問題を解決する魔法の杖ではないことを伝えています。AIは、特定の限界を持つツールなのです。データや計算量によって解決できる問題もあれば、根本的に曖昧な問題もあります。未来の鍵となるのは、単に「より大きく」することではなく、モデルに何をさせるべきか、そしてリソースをどのようにバランスさせるかについて、より「賢く」なることです。私たちは、不可能に対して完璧を期待することをやめ、それぞれのタスクが持つ自然な天井を尊重したエンジニアリングを開始する必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →