← 最新の論文
🤖 machine learning

Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

本論文は、チューリング完全なマシンから導出された厳密なベイズ最適標準を用いるベンチマークであるF-ICLを紹介し、大規模言語モデルが高い精度を示しているにもかかわらず、真のアルゴリズム的推論を実行できておらず、代わりに低次の統計量に依存しており、理論的な最適解から大きく逸脱する非単調な更新挙動を示すことを明らかにする。

原著者: Hector Zenil, Luan Ozelim

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Hector Zenil, Luan Ozelim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにパズルを解く方法を教えているところを想像してみてください。あなたはいくつかの例を見せます。「ここに赤いブロックを置くと、あそこに青いブロックが現れます」。次に、次に何が起こるかを予測するようにロボットに求めます。時々、ロボットは正解を導き出しますが、果たしてロボットはパズルのルールについて「考えて」いるのでしょうか、それとも単に言葉の響きから推測しているだけなのでしょうか?これは、現代の「大規模言語モデル(LLM)」、つまり私たちが今日使っている超スマートなAIチャットボットの背後にある大きな謎です。科学者たちはこれを「インコンテキスト学習(in-context learning)」と呼んでいます。プロンプト内のいくつかの例を読むだけで、新しいタスクを学習する能力のことです。問題は、ロボットが本当に推論しているのか、それとも単にパターンマッチングをしているだけなのかを測定するための完璧な「定規」を、私たちはまだ持っていないということです。通常、私たちは一つのロボットを別のロボットや人間に比較することしかできず、「神の視点」による正解が何であるかは分かりません。

これを解決するために、この論文の著者たちは、特別で、極めて小さく、完全に制御された宇宙を作り上げました。彼らはF-ICLというベンチマークを作成しました。これは、特定の種類のバイナリ・パズル(0と1のみを使用するもの)を解くことができる、あらゆる単純なコンピュータ・プログラムを網羅した巨大なライブラリのようなものです。これら15億個もの小さなプログラムすべてをリストアップしたことで、彼らはどんなパズルに対しても数学的に完璧な答えを算出することができます。この完璧な答えは「ベイズ最適(Bayes-optimal)」な解と呼ばれます。これはゴールドスタンダード、つまり、与えられた証拠に基づいて機械がなし得る絶対的な最善の推測です。これにより、ようやく現実のAIモデルをこのゴールドスタンダードと照らし合わせ、モデルがどれほど正確なルートから外れているかを測定できるようになりました。これは、都市の完璧な地図を持ち、GPSアプリが昨日の交通パターンに基づいて推測しているだけなのか、それとも実際に最短ルートを案内しているのかを確認するようなものです。

偉大なる推論の溝

研究者たちは、オープンソースのプロジェクトからトップテックラボの最も高度な「フロンティア」システムに至るまで、105種類もの異なるAIモデルを集め、F-ICLテストにかけました。彼らは、これらのモデルが完璧なベイズ推論者として、新しい証拠が入ってくるたびに論理的に信念を更新できるかどうかを調べようとしました。

ここで驚くべき展開があります。モデルは正しい答えを出すことには長けていますが、完璧な機械のように推論することには極めて劣っています。

いくつかのモデルは最終的な答えを最大92%の確率で正解していましたが、彼らの内部的な「推測分布(どの可能性をどの程度重く見るか)」は、単純なランダムな推測器よりも悪いことが多いことが分かりました。実際、46モデル中45モデルが「キーストローク参照(keystroke reference)」よりも低い性能を示しました。想像してみてください。キーボードをランダムに叩いている猿を。そのランダムな猿は、実は多くの高度なAIモデルよりも、数学的な真実に近い確率分布を生み出していました。モデルは単に少し外れているだけではなく、根底にある論理に対して自信満々に間違っていたのです。

「過剰コミット」のグリッチ

最も遊び心があり、かつ啓示的な発見の一つは、モデルにたった一つの例を与えたときに、モデルがどのように振る舞うかです。完璧な推論者であれば、新しい手がかりを得るたびに少しずつ改善していくはずです。しかし、これらのAIモデルは、いくつかの例を見て良くなっていく前に、最初の例を見た直後に悪化することがよくあります。

これは、もし探偵に犯罪に関する手がかりを一つ見せたとき、慎重に考える代わりに、即座に「犯人はこいつだ!」と叫んで、間違った容疑者に固執してしまうようなものです。いくつかの手がかりをさらに見せて初めて、探偵はゆっくりと後退し、再び証拠を検討し始めます。論文によると、81回のモデル実行のうち69回がこのミスを犯しており、結論を急ぎすぎていました。彼らは全体像を見るのではなく、最初に見えたデータに対して「過剰にコミット(固執)」してしまっているのです。

サイズは論理を解決しない

より大きく、よりスマートなモデルであれば、この問題を解決できると思うかもしれません。論文では、数十億のパラメータ(AIの「脳のサイズ」)を持つ、0.8億から6750億までのモデルをテストしました。結果はどうだったでしょうか?大きなモデルは正しい答えを出すことには長けてなりましたが、推論能力については全く向上しませんでした。

モデルの挙動と完璧な数学的基準との間の溝は、モデルがいかに巨大になっても、全く同じままでした。モデルが10億のパラメータを持っていようと6000億持っていようと、完璧な「ベイズ最適」の論理に一致させることは依然として困難でした。それはまるで、学生にどんどん大きな本棚(より多くのデータ)を与えても、彼らは地図の使い方を学ばず、ただ本のタイトルを暗記するのが上手くなっただけ、という状況に似ています。

「安全性」と「トレーニング」の罠

論文はまた、モデルが「ポストトレーニング(事後学習)」されたとき、つまり人間がモデルをより役に立つように、指示に従うように、あるいは「安全」にするように微調整したときに何が起こるかも調査しました。驚くべきことに、このトレーニングによって推論の溝はより広くなりました。

モデルが「指示に従う」ように、あるいは「考える」ようにチューニングされると、彼らは実際により完璧な論理的基準から遠ざかっていました。モデルに礼儀正しくなることや特定のチャット形式に従うことを教えることは、問題の生の論理構造を無視することを教えているのかもしれません。それは、チェスのプレイヤーに試合後に必ず「グッドゲーム」と言うように教えるようなものです。彼らはより感じの良いプレイヤーになるかもしれませんが、ゲームの実際のルールを忘れてしまうかもしれません。

フロンティアは停滞している

研究者たちはまた、過去2年間にリリースされた、大手テック企業による最新かつ最も高価なモデルについても調査しました。その結果、完璧な論理的基準への忠実度は、全く改善していません。 最新のモデルは、古いモデルと同じくらい、完璧な推論者から遠い状態にあります。実際、テストされた中で最も古いモデル(2024年5月)の方が、最新のモデルよりも論理的基準に対して忠実であり、最新のものはわずかに劣っていました。

「終端処理」の問題

モデルのスコアが低かった具体的な理由の一つは、文の終わりをどのように扱うかでした。完璧な数学的モデルは、0と1のシーケンスがいつ終わるべきかを正確に知っています。しかし、AIモデルはこの処理が非常に苦手でした。彼らは、シーケンスが終わるべきでない時に終わったと判断したり、逆に終わるべき時に継続したりすることがよくありました。この特定のエラーが、ミス全体の約90%を占めていました。それは、モデルが物語を書くことは得意だが、どこに句点を打つべきかを知る能力に欠けているようなものです。

結論

論文は、これらのAIモデルは「パターン補完(pattern completion)」、つまり以前見たものに基づいて最も可能性の高い次の単語を見つけることには非常に長けているものの、真のアルゴリズム的推論を行っているわけではないと結論付けています。彼らはルールのメンタルモデルを構築しているのではなく、単にパターンを繋ぎ合わせているに過ぎません。

著者たちは、他の科学者がテストを続けられるよう、ベンチマークであるF-ICLをオープンツールとして公開しました。彼らは、現在のモデルが「パターンマッチング」の領域、つまりランダムな推測と完璧な論理的推論の間に位置しており、ランダムな推測に近い状態にあることを明らかにしました。モデルがこの溝を埋めない限り、彼らはエッセイを書いたりコードの断片を作成したりすることには長けていても、私たちが期待するような「思考」はできていないのです。この溝は、モデルを大きくしたり、より長くトレーニングしたりすることで解決するものではなく、情報の処理方法における根本的な変化が必要であるようです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →