← 最新の論文
🤖 machine learning

Language models suffer from a curse of ambiguity

本論文は、大規模言語モデルにおける「曖昧性の呪い」を特定し理論的に分析しており、曖昧な次トークン分布は、容量要件、埋め込みサイズ、学習ステップの増加、および増幅されたサンプリングノイズによって、正確に学習することが本質的に困難であることを示し、この知見を合成および実世界の実験の両方を通じて検証している。

原著者: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

文章を書き、言葉を発する現代のコンピュータは、ある単純かつ強力なアイデアに基づいています。それは、直前の単語を見て、文の次の単語を予測するというものです。このプロセスは、まるで人が物語を考えている時のように、一度に一単語ずつ行われ、すでに語られた内容に基づいて最も可能性の高い次のステップを選択していきます。長年、エンジニアたちは、これらの機械がいかにして「最も明白な単一の答え」を見つけ出すかを改善することに注力してきました。しかし、これらのシステムがより高度になるにつれ、単一の明白な答えが存在しない状況に対処することをますます求められるようになっています。文が多くの異なる、等しく妥当な結末を迎え得る場合、機械は単にトップの選択肢を選ぶだけでなく、それらすべての可能性に対して自信(確信度)を分散させる方法を学ばなければなりません。この不確実性を理解する能力は、これらの機械が将来のバージョンのための学習データ自体を書き始めるようになる中で、極めて重要になっています。もし、これらが可能性の全範囲を捉えることに失敗すれば、学習の質を低下させるような、狭く反復的なループを生み出すリスクを負うことになります。

スタンフォード大学の研究チームは、このタスクを驚くほど困難にしている根本的な障壁を発見しました。彼らは、状況が曖昧になればなるほど(つまり、もっともらしい次の単語が多く存在するほど)、機械が正しい確率分布を学習することが難しくなることを発見しました。彼らはこれを「曖昧性の呪い(curse of ambiguity)」と呼んでいます。これは、単に機械の動作が少し遅くなったり、より多くのデータを必要としたりするという問題ではありません。この困難さは、これらのモデルを動かしているニューラルネットワークの構造そのものに組み込まれているのです。研究者たちは、正しい答えの数が増えるにつれて、機械は大幅に多くの内部ストレージ容量、より大きな単語の内部表現、そして数学的に正しくなるためのより多くの訓練ステップを必要とすることを示しました。たとえ機械が最終的に学習できたとしても、多くの可能性の中から単一の単語を選び出すプロセスが一種のノイズを生み出し、それが真の言語分布に完璧に一致することを妨げてしまうのです。

なぜこのようなことが起こるのかを理解するために、チームはこの問題を最小単位に分解しました。彼らは、機械の最終的な意思決定レイヤーを、コンテキストを結果の集合へとマッピングする単純な分類器として扱いました。実験において、彼らは正確な「正解(グラウンド・トゥルース)」を知っている合成タスクを作成しました。つまり、特定の数の単語が、与えられたフレーズの後に等しく起こり得るという設定です。その結果、10通りの結果を持つパターンを保存するには、1通りの結果を持つパターンよりも約10倍の容量が必要であることが分かりました。それはまるで、機械が記憶すべきあらゆる選択肢に対して、別々の明確な経路を構築しなければならないかのようです。さらに、機械がこれらのコンテキストを保持するために使用する内部的な「語彙」も、曖昧さに応じてサイズを拡大しなければならないことを発見しました。もし機械が、多くの有効な結末を持つ状況を、小さすぎる表現を用いて表そうとすれば、どれほど訓練を重ねても、それらの選択肢を区別することはできないのです。

この困難は、ストレージの確保だけに留まりません。研究者たちは、機械が時間の経過とともにどのように学習するかについても分析しました。彼らは、状況に多くの可能な結果がある場合、学習プロセスが大幅に遅く始まることを発見しました。多くの選択肢が存在する場合、機械が目にする特定の正しい単語の頻度は低くなるため、内部設定を調整するための信号が弱くなるからです。これは、進展を始めるまでに時間がかかることを意味します。さらに悪いことに、機械が一度に一つのランダムな正しい次の単語のみを目にする実データを用いた訓練を行うと、持続的なエラーが生じます。ターゲットが単一で確実な単語である場合、機械は最終的にそれを完璧に学習できます。しかし、ターゲットが広がりのある多くの単語である場合、各ステップでたった一つの例しか見ることができないというランダム性が、機械が乗り越えることのできないエラーの底(フロア)を作り出します。どれほど長く訓練しても、機械は常にわずかにずれ続け、真の確率の広がりを完全に複製することはできません。

チームは、制御された合成テストだけでなく、現実世界のテキストで訓練された大規模言語モデルを用いても、これらの知見を確認しました。実際のデータに対するモデルのパフォーマンスを分析することで、彼らは同じ兆候を観察しました。コンテキストの曖昧さが増すにつれて、モデルの予測の精度は低下し、本来そこに存在するはずのない単語へと確率質量が漏れ出す傾向がありました。このことは、曖昧性の呪いが、小規模な実験的モデルから今日使用されている巨大な兆・パラメータ規模のシステムに至るまで、これらのシステムに共通する普遍的な特性であることを示唆しています。研究者たちは、この限界は単純なソフトウェア・アップデートで修正できるバグではなく、ネットワークが不確実性を表現する方法における根本的な制約であると主張しています。

この発見は、人工知能の能力に対する私たちの考え方を変えるものです。これは、モデルの規模を拡大することが助けにはなるものの、曖昧性の核心的な問題は解決しないことを示唆しています。最大級のモデルであっても、多くの妥当な結果が存在する状況を完璧にモデル化することには常に苦労し、真実の断片が学習されないまま残されることになります。これには、実用的な影響があります。医療診断や法的推論のように精度が求められる分野において、答えが明確でない場合、モデルの信頼度分布が本質的にノイズを含んでいる可能性があることを、私たちは認識しておかなければなりません。この研究は、いつ機械の出力を信頼すべきか、そしていつその不確実性がデータの不足ではなく、より深い構造的な限界の兆候であるのかを理解するための新しい枠組みを提供しています。結局のところ、この論文は、人間が持つ言語の豊かさと柔軟性、すなわち「多くの異なることを、多くの異なる方法で言える能力」こそが、機械にとって最も学習困難な要素であることを明らかにしているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →