Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks
本論文は、主流の評価手法がタスクの位置を統制できておらず、埋め込み干渉によりタスクが長文脈の中央に配置された場合に性能が大幅に低下することを示すことで、長文脈推論ベンチマークにおける重要な欠陥を明らかにし、この構造的な盲点を解消するためのコンテキスト回転評価(CRE)フレームワークを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
この論文を簡単な言葉と日常的な比喩を用いて解説します。
大きなアイデア:「真ん中の席」問題
あなたが非常に賢い学生に数学の問題を解いてもらおうと想像してください。あなたは 64,000 ページもの膨大な教科書(「コンテキスト」)を彼に与えます。
- 従来の方法: 数学の問題をその本の最後のページに置けば、学生はほぼ毎回正解します。
- 新しい発見: この論文は、同じ数学の問題を本の真ん中に移動させると、学生が突然その解き方を忘れることを発見しました。正答率は 96% からわずか 8% まで急落する可能性があります。
著者たちはこれを**「位置による失敗(Positional Failure)」と呼んでいます。彼らは、本の中から特定の事実を見つけることができるか(「干し草の山の中の針」のようなテスト)を確認する優れたテストは存在するものの、長いテキストの真ん中に埋もれた状態で問題を推論**できるかどうかをテストする手法はこれまで存在しなかったと主張しています。
調査:テストの監査
研究者たちは探偵のように振る舞い、AI モデルを評価するために使われている 11 の人気ある「長文コンテキスト」テストを調査しました。
- 発見: これらのテストのいずれも、質問がどこに配置されているかを制御していません。単に、質問が偶然の産物として、冒頭、真ん中、または末尾にある自然な文書を使用しているだけです。
- ベンダーチェック: また、DeepSeek、MiMo、Kimi、GLM という 4 大 AI 企業の公式な「成績表(モデルカード)」も調査しました。
- 結果: これらの企業は、コーディングやエージェントタスク(「プログラムを書けるか?」など)のスコアを、大きく太字の表で誇らしげに披露しています。
- 見落とし: 彼らは「位置を制御した推論」のスコアをほとんど公開していません。長い文書の真ん中に質問がある場合、モデルが惨めに失敗する可能性があるという事実を隠しているのです。
実験:「コンテキストの腐敗(Context Rot)」テスト
これが単なる偶然ではないことを証明するために、著者たちは**CRE(Context Rot Evaluation)**と呼ばれる新しいテストを構築しました。これは AI の注意力に対するストレステストのようなものです。
彼らは 2 種類の質問を取り上げました:
- 数学の問題(GSM8K)
- 科学の多肢選択問題(ARC-Challenge)
そして、AI を何に混乱させるかを見るために、3 つの異なる「背景ノイズ」シナリオ( filler content)を作成しました:
- 「宿題の助け」(with_solutions): 背景テキストには、答えが書かれた他の数学の問題が含まれています。
- 「答えのない質問」(questions_only_v2): 背景テキストには、答えのない他の数学の問題が含まれています。
- 「ランダムノイズ」(neutral_text): 背景テキストは、猫や歴史に関するランダムなウィキペディア記事です。
彼らは 9 つの異なる AI モデルを、3 つの異なる「本の長さ」(8K、32K、64K トークン)でテストしました。
衝撃的な結果
結果は、一部のモデルが非常に脆弱である一方、他のモデルはタフであることを示しました。
1. 「真ん中の席」でのクラッシュ
一部のモデル(MiMo-v2-Flashなど)では、質問を本の末尾から真ん中に移動させるだけで、パフォーマンスが劇的に低下しました。
- 64K の長さで「宿題の助け」ノイズがある場合、モデルは88 ポイントも低下しました。96% の正解率という天才から、8% の正解率という辛うじて合格するレベルまで落ち込んだのです。すべては質問が真ん中に移動したためです。
- なぜか? この論文は、モデルが真ん中で失敗した際、背景ノイズから間違った答えをコピーしていたことを発見しました。まるで、メインの質問の隣にある他の宿題問題に学生が混乱させられたかのようです。
2. 「免疫」を持つモデル
すべてのモデルが失敗したわけではありません。DeepSeek-V3.2は、「宿題の助け」ノイズの場合、この問題に対してほぼ免疫を持っていました。質問が末尾であれ真ん中であれ、正解していました。しかし、ノイズが「答えのない質問」の場合、この強力なモデルさえも苦しみ始めました。
3. 「新しい」モデル
著者たちは、同じ企業から発売された 4 つのブランド新のアップグレードされたモデルをテストしました。
- 良い知らせ: 彼らは真ん中の「宿題の助け」ノイズへの対処がわずかに改善されました。
- 悪い知らせ: 彼らは依然として、真ん中の「答えのない質問」にひどく苦しんでいます。問題は解決されたのではなく、形を変えただけです。
「マジックトリック」診断
これが単にモデルが「愚か」だからではなく、本当に位置に関する問題であることを証明するために、研究者たちはあるトリックを行いました。
- 彼らは数学の問題を真ん中(モデルが通常失敗する場所)に置きました。
- 次に、全く同じ問題を本の最も末尾にコピー&ペーストしました。
- 結果: 突然、モデルは再び正解しました!
これは、モデルが問題を解く方法を知っていることを証明しています。ただ、それが真ん中に埋もれている間は、それを見つけたり、集中したりできないだけです。机の上に置かれたパズルなら解けるのに、書類の山の下に隠されると、自分が持っていることを忘れてしまう人のようなものです。
結論
この論文は、現在の AI のテスト方法が破綻していると結論づけています。
- ギャップ: 私たちは、長い文書の「端」(ここでモデルはよく機能する)でのみ AI をテストしています。彼らがよく失敗する「真ん中」を無視しています。
- リスク: ある企業が「私たちの AI は長い文書で 95% の正確さを持っています」と言っても、質問を最も末尾でしかテストしていなければ、その数字は誤解を招きます。重要な情報が真ん中に埋もれている現実世界のタスクでは、その AI は役に立たないかもしれません。
要約すると: AI が長い本を読めるからといって、その中の真ん中に答えを見つけられるわけではありません。これらのモデルが本当にどれほど賢いのかを真に把握するためには、「真ん中」のテストを始めなければなりません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。