← 最新の論文
💬 NLP

When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models

本論文は、大規模言語モデルが短い手順タスクでは高い精度を達成する一方で、複雑度が増すにつれて段階的アルゴリズムを忠実に実行する能力が著しく低下することを示す診断ベンチマークを導入し、強力なベンチマーク性能がしばしば指示追従における重大な弱点を覆い隠していることを明らかにする。

原著者: Sailesh Panda, Pritam Kadasi, Abhishek Upperwal, Mayank Singh

公開日 2026-05-04
📖 1 分で読めます☕ さくっと読める

原著者: Sailesh Panda, Pritam Kadasi, Abhishek Upperwal, Mayank Singh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「LLM が手順に従うことをやめる時」という論文の解説を、簡単な言葉と創造的な比喩を用いて以下に示します。

大きなアイデア:「レシピ」テスト

あなたがシェフに、ケーキを焼くための非常に具体的で段階的なレシピを与えたと想像してください。レシピにはこう書かれています。「小麦粉と砂糖を混ぜる。次に卵を加える。次に 10 秒間かき混ぜる。次に焼く。」

あなたはシェフがすべての指示を順番に守ることを期待するかもしれません。しかし、もしシェフが手順に従う代わりに、ケーキが通常どのような味がするかを推測して、結果だけを渡してきたらどうでしょうか?あるいは、途中で 3 つの最後のステップを忘れて、「ケーキはこれです」と言い出したらどうでしょうか?

この論文は巨大な実験キッチンのようなもので、研究者たちは 14 種類の異なる「シェフ」AI モデル(大規模言語モデル)に、これらの具体的なレシピを何千通も与えました。レシピは単純な数学の問題でしたが、長くてトリッキーになるように設計されていました。目的は、AI が難しい数学ができるかどうかを見ることではなく、指示を最初から最後まで忠実に守れるかを見ることでした。

仕組み:「果てしない階段」

研究者たちは、タスクをより難しくするための 2 つの主要な方法を用いた特別なテストを構築しました。

  1. 階段の長さ:彼らは AI に、5 ステップから 95 ステップまでのレシピを与えました。階段を想像してください。5 段の階段は登りやすいですが、95 段の階段は疲れます。
  2. 「振り返り」ルール:あるレシピでは、10 番目のステップが単に 9 番目のステップの結果を使うだけでなく、「過去に戻って 3 番目のステップの結果を使って」と言っていたかもしれません。これは、ハイカーに「一歩前に進み、その後、あなたが通った 3 本目の木に戻り、そこから石を拾ってきなさい」と言うようなものです。これにより、AI は遥か過去の情報を記憶することを強いられます。

彼らが発見したこと:「記憶の欠落」

結果は驚くべきものでした。数学は単純な足し算、引き算、掛け算、割り算だけだったにもかかわらず、レシピが長くなるにつれて AI の性能は次第に悪化しました。

  • 低下:短い 5 ステップのレシピでは、AI は約 61% の確率で正解しましたが、長い 95 ステップのレシピでは、成功率はわずか 20% まで急落しました。
  • 「振り返り」のトラブル:AI が遥か過去のステップ(例えば 3 番目のステップ)を記憶する必要があった場合、その性能はさらに低下しました。まるで AI が物語の中で自分がどこにいるのか混乱したかのようです。

AI が失敗した方法:「不正」をするシェフたち

研究者たちは単に最終的な答えだけを見たのではなく、AI が問題を解決しようとした過程を観察しました。彼らは、AI が実際には作業を行わず、いくつかの面白い方法で「不正」をしたり「手抜き」をしたりしていたことを発見しました。

  1. 「早期終了」(未実行):これが最も一般的な失敗でした。AI はレシピを開始し、いくつかのステップを行いますが、退屈したり混乱したりすると、すべてを完了したふりをして直接終わりに飛びついてしまいます。これは、エッセイの最初の一文を書いた後、中間部分を書かずに結論に飛びつく学生のようなものです。
  2. 「幻覚」されたステップ:時々、AI はレシピに全く含まれていない追加のステップを捏造しました。まるでレシピに書かれていないのに「ユニコーンの粉を振りかける」とシェフが追加するかのようです。
  3. 「自己修正」の罠:時々、AI は答えを間違え、それに気づいて後で修正しようとしますが、修正した頃にはすでに最終結果を台無しにしていました。
  4. 「パターンマッチャー」:数学を実際に行う代わりに、一部の AI は数字の見た目に基づいて答えを推測しているように見え、実際には手順に従っていませんでした。

主な結論

この論文は、AI が「もっともらしい」最終的な答えを提示したからといって、実際に作業を行ったわけではないと結論付けています。

テストを受ける学生を想像してください。正解が出れば、彼らが勉強したと思えるかもしれません。しかし、この論文が示すのは、彼らが実際には問題を段階的に解くのではなく、推測したり、以前のテストの答えを覚えていたりしている場合があるということです。

要約すると:現在の AI モデルは賢く聞こえ、最終結果を提供するのが得意ですが、書かれた通りに長く退屈な指示リストを正確に守る信頼できるロボットのように振る舞うことには苦労します。指示が長くなりすぎたり、過去の情報をあまりにも多く記憶する必要があったりすると、AI は軌道から外れ、ルールに従うことをやめてしまう傾向があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →