← 最新の論文
💬 NLP

Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

本論文は、大規模言語モデルにおける多様性の崩壊が、デコーディング中の確率分布における順序と形状の較正不備に主に起因し、サンプリングヒューリスティックの限界によるものではないことを特定し、出力の妥当性と多様性の間のトレードオフをもたらしている。

原著者: Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)に物語を語らせたり、詩を書かせたり、ランダムな都市を提案させたりすると想像してみてください。あなたは多様な創造的な回答を期待するでしょう。しかし、実際にはモデルはしばしば型にはまり、同じような決まり文句を繰り返し提示します(「昔々あるところに…」や「チリのバルパライソ」など)。

この論文は、なぜこれが起こるのかを調査します。著者たちは、問題が単にモデルが「退屈」であること、あるいは単語を選ぶための現在のツール(サンプリング手法)が劣っていることだけにあるのではないと主張します。むしろ、問題はモデルが自身の内部の確率マップをどのように組織化しているかという構造そのものにあるのです。彼らはこれを**「較正のボトルネック」**と呼びます。

これを説明するために、モデルを巨大な本棚(すべての可能な次の単語)の前に立つ司書だと想像してください。司書は物語を続けるための次の単語を選ぶ必要があります。

2 つの主要な問題

この論文は、この司書が「較正されていない(現実と整合していない)」ために多様性が崩壊する、2 つの具体的な方法を特定しています。

1. 順序較正:司書は本を整理できない

比喩:
あなたが司書に「良い」本を選んでほしいと頼んだと想像してください。あなたは司書がすべての「良い」本を棚の一番上に、すべての「悪い」本を一番下に配置することを期待します。

  • モデルの行動: 司書はいくつかの良い本を上に置きますが、その真ん中に大量の悪い本を混ぜてしまいます。さらに棚の下の方には、悪い本の中に隠されたさらに多くの良い本があります。
  • 結果: もしあなたが司書に「上位 10 冊だけ出して」と言っても、5 冊の良い本と 5 冊の悪い本が混ざって出てくるかもしれません。「安全のために上位 100 冊出して」と言えば、90 冊の悪い本が混じります。
  • 論文の主張: モデルは順序較正に失敗しています。「有効な(正しい/意味のある)」単語を「無効な( nonsensical な)」単語よりも確実に上位にランク付けすることができません。有効な単語と無効な単語がランキング内で混在しているため、「Top-K」や「Top-P」のようなリストをフィルタリングしようとするあらゆるツールは、恐ろしい選択を強いられます。悪いものを避けるために良いアイデアを切り捨てるか、良いものを救うためにあまりにも多くの悪いアイデアを含めるかの二者択一です。

2. 形状較正:司書は 1 冊の本に執着している

比喩:
次に、司書がうまく良い本と悪い本を分けられたと想像してください。しかし、「良い」山を見ると、司書はたった1 つの特定の本に執着しています。

  • モデルの行動: 司書は 90% の注意を 1 つの特定の「良い」本(例えば「昔々あるところに…」)に集中させます。残りの 99 冊の「良い」本には、ごくわずかな断片しか注意が向けられません。一方、「悪い」本は一番下の非常に細長い尾の部分に散らばっています。
  • 結果: たとえあなたが「温度(Temperature)」を使って(司書にもっとランダムになるよう指示するようなもの)物事に変化をつけようとしても、司書は単に執着の対象を少しずらすだけです。「昔々あるところに…」への執着をやめて「ある世界では…」への執着に切り替えるかもしれませんが、それでも他の 98 の良い選択肢は無視されます。さらに悪いことに、司書をよりランダムにさせることは、稀な「良い」本ではなく、長い尾にある「悪い」本を選ぶことにつながることがよくあります。
  • 論文の主張: モデルは形状較正に失敗しています。確率は少数の特定の有効な選択肢に過度に集中しており、残りの有効な選択肢は注意を奪われています。

ドミノ効果:なぜ 1 つの誤りが災難になるのか

この論文は、これらの問題が物語が長くなるにつれて悪化することを説明しています。

比喩:
あなたが迷路を歩いていると想像してください。

  • ステップ 1: 最初の曲がり角で、正しい道を選ぶ確率が 90% で、行き止まりを選ぶ確率が 10% です。これは大丈夫そうです。
  • ステップ 2: 次の曲がり角でも、再び 90% の確率で正解です。
  • 結果: 20 回も曲がり角を通過しなければならない場合、1 つの行き止まりにも当たらずに全体の道を正しく辿る確率は、ほぼゼロに落ち込みます。

この論文は数学的に証明しています。モデルがすべてのステップで(単語の誤った混合を選んだり、1 つの単語に過度に集中したりする)小さな誤りを犯すため、これらの誤りは累積するということです。モデルが文や段落を完成させる頃には、真に多様で有効な経路を探索している可能性は、指数関数的に微小なものになっています。

彼らは何をしたのか?

研究者たちは単に推測したわけではありません。彼らは「診断ツールキット」を構築しました。

  1. 統制されたテスト: 正しい答えのリストが正確に分かっている単純なタスク(ランダムな数の生成や米国州名の列挙など)をモデルに与えました。
  2. 「神託(Oracle)」テスト: どの単語が有効かを正確に知っている完璧なフィルタを作成しました。この完璧なフィルタを使っても、モデルは「形状」の問題(1 つの単語への執着)のために多様性を発揮することに依然として苦労しました。
  3. 結論: 彼らは 14 種類の異なるモデル(小規模から超巨大まで)をテストしました。その結果、より大きなモデルでも問題は解決しませんでした。 最も賢いモデルであっても、これらの並べ替えと集中の問題を抱えていました。

結論

この論文は、AI における多様性の欠如が単に「選び取る」ツール(温度や Top-K サンプリングなど)のバグではないと結論付けています。それはモデルが自信をどのように分配するかという根本的な欠陥です。

  • モデルは有効な単語を無効な単語の上に確実に並べることができません
  • モデルはすべての有効な単語に均等に注意を配分することができません

モデルが内部の図書館を異なる方法で整理するよう学習するまで、単に設定を微調整するだけでは、真の創造性や多様性を解き放つことはできません。「ボトルネック」は私たちがそれを読み取るために使用するツールではなく、モデル自身の分布にあるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →