← 最新の論文
💬 NLP

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

本論文は、文脈内での文脈自由言語の認識能力をテストすることにより大規模言語モデルの複雑な推論を評価するフレームワーク「RELIC」を導入し、高度なモデルでさえもタスクの難易度に応じて推論計算をスケーリングできず、複雑性が高まるにつれてアルゴリズム的推論から推測へと移行することが多いことを明らかにしている。

原著者: Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、教養豊かなアシスタントを雇ってパズルを解かせると想像してください。あなたは彼らに、新しいルールブック(「文法」)と特定の文(「文字列」)を与えます。あなたの問いは単純です。「この文は、この本の中のルールに従っていますか?」

これがまさに、論文「RELIC」が扱っている内容です。これは、ChatGPT などのツールの背後にある AI の頭脳である大規模言語モデル(LLM)が、その場での新しい指示を与えられた際に、複雑で多段階の問題を実際に「思考」して解く能力をどの程度持っているかをテストする、新しい方法です。

以下に、論文の発見を簡単な比喩を用いて解説します。

1. テスト:「ルールブック・パズル」

研究者たちは、AI が文法探偵のように振る舞うゲームを作成しました。

  • 設定: 彼らは、数千ものユニークで架空のルールブックを生成しました。これらは英語でもスペイン語でもなく、「A の後には必ず B が来る」「C は D に変わる」といったような、抽象的なルールセットです。
  • 課題: AI はルールブックと、ランダムな記号で構成された文(例:t43 t51 t66)を見せられます。そして、「はい(この文はルールに従っている)」か「いいえ(ルールに違反している)」かを答える必要があります。
  • ひねり: ルールブックを大きくし、文を長くすることで、パズルをより困難にします。

2. 期待:「山登り」の比喩

これらのパズルを解くことを、山登りに例えて考えてみましょう。

  • 小さな山(簡単なパズル): ルールブックが小さく、文が短ければ、AI は簡単に頂上まで登ることができます。論理的な地図(アルゴリズム)を使って、すべてのステップを確認するのです。
  • 大きな山(難しいパズル): ルールブックが巨大になり、文が長くなるにつれて、山は険しくなります。これを正しく解くためには、AI はすべての可能性を確認するために、より多くの「精神的エネルギー」(より多くの「思考トークン」)を必要とします。より高い峰に登るには、より大きなバックパックとより多くの水が必要なのと同じです。

3. 発見:「サイレント・クイッティング」

これが、論文の最も驚くべきかつ重要な発見です。研究者たちは、パズルが難しくなるにつれて、AI はより多くの思考力を費やして「より頑張る」だろうと予想していました。

しかし、実際には AI は「サイレント・クイッティング(静かな退職)」を始めました。

  • 比喩: 簡単な数学の問題を解くように頼まれた労働者を想像してください。彼らは電卓を取り出して作業を行います。しかし、巨大で複雑な方程式を与えられたとき、スーパー電卓を取り出してより長く作業する代わりに、彼らは単に推測します。数学を解こうとするのをやめ、直感に基づいて答えを捏造し始めるのです。
  • 証拠:
    • パズルが難しくなると、AI はより多くの思考時間を費やすどころか、実際には少なくなりました。
    • AI は、可能性のツリーを構築するような論理的で段階的な推論をやめ、悪いショートカット(ヒューリスティクス)に頼り始めました。
    • 最も高度な「推論」モデル(深く思考するように設計されたモデル)さえも、これを行いました。彼らは良い計画で始め、圧倒されると、黙って推測に切り替えるのです。

4. 結果:「間違った理由で正解」

論文は、AI が「サイレント・クイッティング」を行うとき、偶然に正解を得ることが多いが、その理由は完全に間違っていると指摘しています。

  • 例: AI は、ルールが実際には長い文を許可しているにもかかわらず、単に「長すぎる」という理由だけで文を拒絶するかもしれません。それは「いいえ」という答えを正しく導き出しましたが、その論理は完全に破綻していました。
  • 問題点: AI の思考過程が見えない場合(多くの商用モデルではこれが事実です)、正解を出したことから賢いと思い込むかもしれません。しかし実際には、それは単なる推測であり、次の難しい問題では失敗するでしょう。

5. 結論:脆い脳

この論文は、現在の AI モデルは脆いと結論付けています。

  • 彼らは、タスクが簡単な場合、その「概念」を理解します。
  • しかし、問題の難易度に合わせた努力を拡大することはできません。
  • 「これは難しい、もっと時間をかける必要がある」と言う信頼できる「内部エンジン」を持っていません。代わりに、諦めて推測するのです。

まとめ

この論文は、AI の推論能力に対するストレステストとしてRELICを紹介しています。それは、今日の最も賢い AI モデルさえも、簡単な宿題は解ける学生だが、難しい試験に直面すると、問題を解こうとするのをやめて、ただランダムにマークシートに穴を開けるようなものだと示しています。彼らは難しいタスクにおいて「サイレント・クイッティング」を行い、実際にルールに従うのではなく、単に推測するだけで済ませるため、複雑な現実世界の推論においては信頼できません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →