← 最新の論文
🤖 machine learning

How Robustly do LLMs Understand Execution Semantics?

本論文は、コード変換や入力摂動に対する頑健性の評価を通じて、オープンソースの推論モデルが安定した性能を示す一方で、最先端の GPT-5.2 は元のタスクで高い精度を達成しても摂動に対して著しく脆弱であることを明らかにし、例外発生時の予測精度の欠陥や摂動評価の重要性を指摘しています。

原著者: Claudio Spiess, Prem Devanbu, Earl T. Barr

公開日 2026-04-21
📖 1 分で読めます☕ さくっと読める

原著者: Claudio Spiess, Prem Devanbu, Earl T. Barr

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「最新の AI(大規模言語モデル)は、本当にコード(プログラミング)の『意味』を理解しているのか、それともただの『暗記』や『パターン当て』に過ぎないのか?」**という疑問に迫った研究です。

研究者たちは、AI がコードを理解しているかどうかを調べるために、**「揺さぶり」**という面白い実験を行いました。

以下に、専門用語を排し、日常の例え話を使って解説します。


🕵️‍♂️ 実験の舞台:「完璧な料理人」のテスト

まず、AI を**「完璧な料理人」**だと想像してください。
この料理人は、レシピ(コード)と材料(入力データ)を見せられれば、どんな料理(出力)ができるかを即座に言い当てます。

従来のテストでは、AI は**「99% の正解率」**という驚異的な成績を残しました。「このレシピで、この材料を使えば、この味になるね!」と、ほぼ間違えません。

しかし、研究者たちは疑問に思いました。
「本当に味を理解しているのか?それとも、単に『A なら B』というパターンを暗記しているだけではないか?」

そこで、彼らは料理人に**「揺さぶり」**を加える実験を始めました。

🌪️ 3 つの「揺さぶり」実験

研究者は、料理人の理解度を試すために、3 つの方法で状況を少し変えてみました。

1. 材料の微妙な変更(入力揺らぎ)

「同じレシピでも、材料の量を少し変えたり、形を変えたりしたらどうなる?」

  • 実験: 材料(入力データ)を少しだけ変えてみました。
  • 結果:
    • オープンソースの AI(DeepSeek-R1 など): 材料が少し変わっても、ある程度落ち着いて答えられました(正解率は 38〜67% 程度)。
    • 最強の AI(GPT-5.2): ここが面白い点です。元のテストでは 99% の正解率だったのに、材料を少し変えただけで正解率が 20% 以上も急落しました。
    • 意味: 「完璧な料理人」は、レシピの**「本質的な意味」ではなく、「特定の材料の並び順」**を暗記していただけだった可能性があります。少しの揺らぎでパニックになったのです。

2. レシピの書き換え(意味を保った変換)

「同じ料理を作るレシピでも、言い回しや手順の順序を変えたらどうなる?」

  • 実験: 料理の味は全く変わらないのに、レシピの文章を書き換えました(例:「まず卵を割る」を「卵を割ってから」に変えるなど)。
  • 結果:
    • 多くの AI は、書き換えられても大丈夫でした。
    • しかし、GPT-5.2はまたしても大きく失敗しました。文章が変わっただけで、料理の味が違うと勘違いしてしまったのです。
    • 意味: 「意味」を理解しているのではなく、「文字の並び」に依存していることがバレてしまいました。

3. 料理の失敗(例外の予測)

「材料が足りなかったり、鍋が焦げたりしたらどうなる?」

  • 実験: 料理が失敗する(エラーが出る)ような材料を与えました。
  • 結果:
    • 多くの AI は、「失敗する」ということ自体を予測するのが苦手でした。
    • 特に**「TypeError(型エラー:数字と文字を足そうとしたなど)」**という、よくある失敗に対して、AI は「失敗する」と言えず、無理やり「美味しい料理ができる」と答えてしまいました(これを「おべんちゃら(Sycophancy)」と呼びます)。
    • 対策: 「失敗する可能性も考えてね」と指示を変えただけで、AI の正解率は劇的に向上しました。これは、AI が「失敗」を無視するよう訓練されていたことを示しています。

📊 意外な発見:「小さくて賢い」AI の勝利

この実験で最も驚いたのは、**「GPT-5 Nano(小さくて効率的なモデル)」**の活躍です。

  • GPT-5.2(最新・最強): 元のテストでは天才的ですが、揺さぶりをかけられるとすぐに崩壊しました。
  • GPT-5 Nano(小型): 元のテストでは少し劣りますが、揺さぶりをかけられても非常に安定していました。

【比喩で言うと】

  • GPT-5.2は、**「暗記が得意な天才学生」**です。試験問題がそのまま出れば満点ですが、問題文が少し変わるとパニックになります。
  • GPT-5 Nanoは、**「基礎がしっかりした堅実な学生」**です。暗記力では劣るかもしれませんが、応用が利いて、どんな問題が出ても落ち着いて解けます。

研究者は、この安定性は「量子化(モデルを圧縮する技術)」が、AI を**「過学習(暗記しすぎ)」から守り、より汎用的な理解を促した**ためではないかと推測しています。

💡 結論:AI はまだ「完全な理解者」ではない

この研究が伝えたかったことはシンプルです。

  1. AI は「暗記」が得意だが、「理解」は苦手: 現在の最先端 AI は、特定のテスト問題には完璧ですが、少し状況が変わると(材料が変わったり、書き方が変わったりすると)、その「理解力」は脆く崩れてしまいます。
  2. エラー(失敗)への対応が弱い: AI は「失敗する」ということを嫌がり、無理やり正解を言おうとする傾向があります。
  3. 評価方法の見直しが必要: 「元のテストで何点取れたか」だけでなく、「揺らぎにどれだけ強い(ロバストな)か」を見る必要があります。

まとめ:
今の AI は、**「教科書通りの問題なら神様」ですが、「実生活の複雑な状況(揺らぎやエラー)」**になると、まだ人間のような「深い理解」には達していない、というのがこの論文の結論です。

私たちが AI にコードを書かせたり、バグを直させたりする際は、「完璧な答え」を盲信するのではなく、**「少し変えても大丈夫か?」**と自分で揺さぶってみて、その強さを確認する必要があるかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →