← 最新の論文
💬 NLP

LLMs Lean on Priors, Not Programming Language Semantics

本論文は、PLSemanticsBenchを導入することで、現代の大型言語モデルが、提供された形式的なプログラム意味論に基づいて体系的に推論を行うのではなく、主に事前学習された語彙的連想に依存していることを実証しており、これは、意味論的な変異、新しい記号、および長い実行トレースに直面した際の性能の急激な低下によって裏付けられている。

原著者: Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric

公開日 2026-06-01
📖 1 分で読めます☕ さくっと読める

原著者: Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問い:LLMは考えているのか、それとも単に推測しているだけなのか?

新しいボードゲームの遊び方を生徒に教えている場面を想像してみてください。あなたはルールブックを渡し、「このゲームでは、6が出たら後ろに下がります」と言います。

ルールを理解している賢い生徒なら、たとえこの特定のゲームを一度もプレイしたことがなくても、6が出た瞬間に即座に後ろへ下がります。

しかし、何千もの「他の」ボードゲームをプレイしてパターンを暗記した生徒は、ためらうかもしれません。「待てよ、モノポリーやクライでは、6が出たら前に進むのが普通だ。普通はそうなるものだから、そのまま前に進もう」と考えるかもしれません。彼らは、今与えられた特定のルールではなく、過去の経験(彼らの「事前知識/プライア」)に頼っているのです。

この論文は、次のような問いを投げかけています。大規模言語モデル(LLM)は、新しいルールに従う「賢い生徒」のように振る舞うのか、それともルールを無視してパターンを暗記する「生徒」のように振る舞うのか?

実験:「魔法の」プログラミング言語

これをテストするために、研究者たちは**C⋆**と呼ばれる、特別な軽量プログラミング言語を作成しました。この言語は、いわば「空白のキャンバス」のようなものです。

そして、以下の3つの異なるシナリオを用いたトリッキーなテストを設定しました。

  1. 標準テスト(Standard Test): モデルにコードと通常のルール(例:+ は足し算を意味する)を与えます。これは、普通のチェスの試合のようなものです。
  2. 入れ替えテスト(KeywordSwap): コードの外見は全く同じに保ちつつ、ルールブック内の記号の意味を入れ替えます。
    • 仕掛け: モデルに対し、「このバージョンでは、+ という記号は引き算を意味します」と伝えます。
    • 目的: もしモデルが真にルールに従っているなら、引き算を行うはずです。もし記憶に頼っているなら、+ は足し算であるという慣習に従って、依然として足し算を行うはずです。
  3. エイリアン・テスト(KeywordObf): すべての馴染みのある記号を、奇妙でエイリアンのような文字(古代の忘れ去られた文字のようなもの)に置き換え、そのエイリアンの記号の意味を定義したルールブックを与えます。
    • 目的: モデルはこれらの記号を見たことがないため、新しいルールブックに完全に依存せざるを得ません。+ が通常何を意味するかという記憶を使って「ズル」をすることはできなくなります。

結果:「パターン暗記者」の勝利(そして敗北)

研究者たちは、利用可能な最もスマートな11のAIモデルをテストしました。結果は以下の通りです。

1. ルールが正常な場合:
モデルたちは素晴らしい成果を出しました!コードの結果を高い精度(最大90%)で予測できました。彼らは天才のように見えました。

2. ルールが入れ替わった場合(「足し算」が「引き算」になったとき):
モデルたちは崩壊しました。精度が40%から60%低下しました。

  • 比喩: これは、100万個のハンバーガーを作ってきたシェフのようなものです。あなたが「今日はハンバーガーを作りますが、バンズ(パン)の代わりにジャガイモを使います」と言ったとします。真のシェフならジャガイモを使うでしょう。しかし、これらのモデルは「ハンバーガー=バンズ」という習慣が強すぎるため、依然としてバンズを使おうとし続けます。彼らは、新しい指示に従うために、自分の「筋肉の記憶(習慣)」を上書きすることができなかったのです。

3. ルールがエイリアンになった場合(KeywordObf):
モデルは入れ替えテストよりもはこちらの方が少し成績が良かったのですが、依然として大きく苦戦しました。彼らは新しいルールブックを完全に信頼することができませんでした。

4. 長期的なプロセス(複雑なループ):
コードが長く複雑になった場合(多くの章やループを持つ物語のような場合)、ほとんどすべてのモデルが失敗しました。最も「賢い」モデルでさえ、長い複雑なシーケンスを正しく実行できたのはわずか**35%**程度でした。彼らは物語の途中で迷子になり、従うべきルールを忘れてしまったのです。

「推論」モデル vs 「非推論」モデル

研究者たちは、「ステップ・バイ・ステップで考える」ように設計されたモデル(「推論」モデルと呼ばれます)についてもテストを行いました。

  • 良いニュース: これらのモデルは、標準的なモデルよりも新しいルールに従う能力が高いことが分かりました。
  • 悪いニュース: ただし、最高の「推論」モデルであっても、ルールが入れ替わると失敗しました。彼らは依然として、以前に見たものに頼りすぎていました。短期的にはルールに従えるかもしれませんが、ルールが奇妙になったりタスクが長くなったりすると、すぐに古い習慣に戻ってしまうのです。

「思考の連鎖(Chain of Thought)」(独り言)

研究者たちは、答えを出す前に自分の思考を声に出して説明させる「思考の連鎖(Chain of Thought)」というテクニックを試しました。

  • 結果: これは「通常のタスク」においてはモデルの性能を向上させました。しかし、ルールが入れ替わった場合(例:+ が引き算を意味する場合)、この「声に出して考える」手法は効果がありませんでした。モデルの内部にある「筋肉の記憶」があまりにも強固であったため、結局、数学的な間違いを犯してしまったのです。

結論

この論文は、現在のAIモデルは、与えられたルールに基づいて真に「推論」しているわけではないと結論付けています。その代わりに、彼らはトレーニングデータで見たものに強く依存する**「統計的な推測者」**なのです。

  • メタファー: 劇の台本を暗記した俳優を想像してください。もしあなたが「今日は即興劇です。ただし、『こんにちは』という言葉は『さようなら』という意味になります」と言ったとしても、彼らはおそらく、慣れている通りに「こんにちは」と言ってしまうでしょう。彼らは新しい意味を処理しているのではなく、記憶の中から最も可能性の高い言葉をただ再生しているだけなのです。

要約すると: もしあなたがAIに対して、全く新しい一連の厳格なルール(新しいプログラミング言語や新しい法的契約など)に従わせたいのであれば、現在のモデルは信頼できません。彼らはあなたの新しいルールを無視し、過去のトレーニングに基づいて「おそらくこう言いたかったのだろう」と彼らが思うことを実行してしまう可能性が高いのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →