人工知能の研究において、研究者たちを長年二分してきた中心的な問いがある。すなわち、機械はすでに見たことのあるパターンの枠を超えて、真に思考することができるのだろうか、という問いである。大規模言語モデルは帰納法の達人であり、膨大なテキストの中にある統計的な傾向を見出すことで、文章の次の単語を予測することを学習している。また、厳格な論理規則に従って結論を導き出す演繹法においても、ますます熟練してきている。しかし、アブダクション(仮説的推論)として知られる第三の推論形式は、依然として謎のままである。それは、一連の観察から、それらを説明するための全く新しい規則や公理へと跳躍する能力であり、最も明白な答えを捨てて、驚くべき、未知の可能性を選択するという精神的な跳躍をしばしば必要とするものである。長年、懐疑派は、これらのモデルはこのような跳躍を行う構造的な能力を欠いており、既知の事項を繰り返すループの中に閉じ込められているのだと主張してきた。一方で、機械が生成した数学的発見を指摘してこれに異を唱える者もいるが、この「跳躍」を定義したり測定したりするための正確な方法がないため、議論は理論の段階で停滞したままとなっていた。
研究チームは、事実がそれを求めている時に、モデルが自身のデフォルトの直感を捨て去ることができるかどうかを確認するために、厳密なテストを構築することで、この不確実性を打破した。彼らは、モデルにゼロから新しい理論を考案させることはしなかった。なぜなら、それは検証不可能だからである。代わりに、彼らはゲームのルールが石に刻まれたように確定している、制御された実験環境を作り出した。部分的な絵と、最も明白な完成方法を排除する厳格な制約リストが与えられるパズルを想像してほしい。研究者たちは、「跳躍」を、標準的で最も論理的な補完が禁止されており、代わりに制約に完璧に適合する新しい隠れた構造を構築しなければならないとモデルが気づいた瞬間として定義した。これを行うために、彼らは、既知のデータに基づいてデータを拡張する際の唯一の最も自然な方法である「カノニカルな補完(標準的な補完)」を特定する数学的枠組みを用いた。そして、その自然な答えが明示的に禁止されている問題を設計し、モデルがデータ自体には示されていない、唯一無二の非自明な解を見つけ出さざるを得ない状況を作り出した。
研究者たちは、単純なパズルから、数百万もの可能な答えを持つ複雑なシナリオまで、9つの異なる認証済み問題を用いてこれをテストし、利用可能な最も高度な4つの言語モデルを用いた。彼らは、モデルが好むように訓練された禁止されたデフォルトの答えに固執した頻度と、制約に従った正しい解決策へと正常に跳躍できた頻度を測定した。結果は驚くべきものであった。モデルが選択を強制されたすべての試行において、モデルが訓練された好ましいデフォルトの答えに戻ったケースは一度もなかった。248回の試行を通じて、モデルは毎回、除外されたデフォルトの答えを放棄し、正しく認証された解決策に到達した。失敗した場合、それはモデルが跳躍を拒否したからではなく、精神的なエネルギーが尽きたか、あるいは計算ミスをしたためであり、以前の誤った答えに戻ることは決してなかった。
この発見は、道が塞がれた時に新しい経路を選択する能力は、これらのモデルのボトルネックではないことを示唆している。モデルは、制約が明確であれば、自身の直感を上書きできることを証明した。研究者たちは、もしモデルが人類の歴史に見られるような創造的な跳躍の能力を本当に欠いているのだとしたら、それは選択肢の間で選ぶ行為にあるのではないと結論づけている。むしろ、困難はより手前の、より混沌としたステップにある可能性が高い。すなわち、跳躍を強いるための制約を生成すること、あるいは、その跳躍を可能にする全く新しい規則の枠組みを発明することである。この研究は、機械の創造性の謎を解明したと主張するものではないが、道が明確に塞がれているとき、これらのモデルは前進するための新しい方法を見つけ出す能力があることを、確固たるものにしたのである。
技術要約:「標準的な完備化が誤っているとき:大規模言語モデルにおけるジャンプの定式化と測定」
問題提起
本論文は、大規模言語モデル(LLM)の能力に関する中心的な論争に取り組んでいる。すなわち、LLMは証拠から新しい公理系へと「仮説的飛躍(アブダクション・リープ)」、すなわち「ジャンプ」を行うことができるのか、それとも構造的にデフォルトの補完を放棄できないのか、という問いである。近年の文献(Zahavy [2026])はLLMにはこの能力が欠けていると主張しているが、これに異を唱える者もいる。この論争を解決する上での核心的な困難は、「ジャンプ」の厳密な定義と、それをテストするための対応する指標が欠如していることにある。著者らは、具体的な研究課題として次を提示する:制約が明示的にデフォルトの補完を排除する場合、モデルは自身のデフォルトの補完を放棄できるか?
手法
著者らは「ジャンプ」を4つのステップのプロセスとして定式化したが、実証的な測定においては、**オーバーライド(上書き)**と呼ばれる第2ステップに焦点を当てている。手法は、カテゴリー論を用いて「標準的な完備化(canonical completion)」を定義し、モデルの挙動をテストするための特定の「ジャンプ・インスタンス」を構築することに基づいている。
デフォルトの定式化(標準的な完備化):
著者らは、部分的なデータに対する「デフォルト」の補完を、データ関手の左および右カン拡張($LanおよびRan$)として特定している。これらの拡張は、制約なしにデータのみから計算可能な、最も簡潔かつ最も寛容な補完を表している。これらは、損失最小化を通じて訓練されたモデルが生成すべき「帰無仮説」として機能する。
ジャンプ・インスタンスの定義:
ジャンプ・インスタンスは、以下の条件を満たす有限の拡張問題として定義される:
- 可解性: 正しい補完が存在すること。
- 非標準性: 正しい補完は(要素の再命名を除いて)一意的であり、$LanおよびRan$ の両方とは異なること。
- 制約による排除: 標準的な完填化($LanおよびRan$)を明示的に排除し、かつ一意の非標準的解を許容する機械的に検証可能な制約集合が存在すること。
- 識別可能性: 解空間が有限かつ計算可能であり、正確な「チャンスレベル(偶然による正解率)」の算出が可能であること。
著者らは、列挙することなく無限の難易度のインスタンスを生成するファミリー定理(定理1)を導入しており、これにより、計算可能な検証可能性を維持したまま、難易度をスケールアップさせることを保証している。
- 測定プロトコル:
- キャリブレーション(較正): モデルが「制約なしのデフォルト」がカン拡張と一致することを確認するために、まずデータの制約なしバージョンでテストを行う。
- コントロール・インスタンス: 制約が標準的な完備化を「選択」するインスタンスを用いて、モデルがタスク形式を解けることを確認する。
- ジャンプ・インスタンス: 制約が標準的な完備化を「排除」するインスタンスを用いてテストを行う。
- 指標: 主要な指標はカン・デフォルト率(式3)であり、これは制約によって偽とされるにもかかわらず、モデルが標準的な完備化を出力してしまう頻度を測定する。ジャンプが成功したとみなされるのは、モデルがデフォルトを放棄し、認証された許容クラスに到達した場合である。
主な貢献
- ジャンプの厳密な定義: 論文は、カテゴリー論的な定義を用いてジャンプ・インスタンスを厳密に定義し、「選択」フェーズ(制約の下で仮説を選択すること)と「生成」フェーズ(制約やフレームワークを作成すること)を区別している。
- 適格性と認証: 著者らは、ジャンプ・インスタンスが適格であること(命題1–3)を証明し、標準的な参照が存在し、許容性がゲージ不変であり、解空間が有限であることを保証している。また、列挙なしに無制限の難易度のインスタンスを認証するためのファミリー定理を導入している。
- 正当性と連鎖の理論: 論文は、内部的正当性(制約下での許容性)と予測的正当性(保持されたグラウンドトゥルースとの一致)を区別している。また、ある段階の出力が次の段階のデータとなる「連鎖されたジャンプ」を定式化し、蓄積された知識が許容集合を拡大することはないこと、および「定着(entrenchment)」(以前は許容されていた補完が後に排除されること)を証明している。
- 帰属可能な失敗分析: プロトコルは、「デフォルトへの固執(ジャンプの不能)」による失敗と、「推論予算の枯渇」または「制約エラー」による失敗を分離している。
実験結果
著者らは、4つのフロンティアモデル(GPT-5.6, Claude Sonnet 5, Gemini 3.1 Pro, DeepSeek V4 Pro)を、9つの認証済みインスタンス(単純な列挙ベースから、探索空間が108に達する複雑なファミリー定理ベースのインスタンスまで)を用いて評価した。
- カン・デフォルト率: すべてのモデルと難易度における248回の制約付き試行全体において、カン・デフォルト率はゼロであった。制約が標準的な完備化を明示的に排除している場合、どのモデルも標準的な完備化に戻ることはなかった。
- ジャンプの成功: 248回の試行中226回において、モデルは認証された正解に到達した。残りの試行における失敗は、デフォルトへの回帰ではなく、推論予算の枯渇または制約エラーに起因すると判断された。
- キャリブレーション: モデルの制約なしのデフォルトは、98%の非切断サンプルにおいてカン拡張と一致しており、指標の妥当性が検証された。
- 難易度のスケーリング: 難易度が上昇した場合(特にm=3において)、一部のモデル(例:DeepSeek V4)でパフォーマンスが低下したが、これは検索の限界や予算の枯渇によるものであり、デフォルトへの回帰によるものではなかった。
意義と主張
本論文は、その定式化の範囲内(アブダクションの「選択」ステップ)において、LLMはジャンプを行うと主張している。結果は、デフォルトを上書きする段階において、ジャンプができないことがボトルネックではないことを示している。
著者らは、自らの主張の範囲を明確に限定している:
- 彼らは、制約の生成や新しい数学的フレームワークの発明(ティア2)をテストしていない。
- 彼らは、身体化されたシミュレーションや前記号的なメカニズムをテストしていない。
- 彼らは、もしジャンプの不能という議論が事実であるならば、それはオーバーライドのステップよりも上流、すなわち制約の生成やフレームワークの発明というフェーズにあると結論付けている。これは、彼らのテストが意図的に排除している部分である。
本論文は、オーバーライドのステップを測定するための「カテゴリー的な計器」を提供することを目指しており、今後の研究は、制約の生成やジャンプの累積(定着)に焦点を当てることで、LLMのアブダクション能力に関する論争を完全に解決できることを示唆している。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録