✨ 要約🔬 技術概要
あなたの最もお気に入りのスマートアシスタントが、単なるトリビアbotやコード処理機ではなく、真のマルチタスクの魔術師であるような世界を想像してみてください。急速に進化する人工知能の分野において、研究者たちはデジタル脳が実際にどれほど賢いのかを測るために、「ベンチマーク」と呼ばれるもの、つまり標準化されたテストを絶えず構築しています。長い間、これらのテストは学校の別々の科目のようでした。数学のための試験、歴史のための試験、そしてコーディングのための試験といった具合です。しかし、現実の世界はそんな風には動きません。人間に旅行の計画を立てるよう頼むとき、その人は単に距離を計算するだけではありません。天気をチェックし、レビューを読み、ホテルを予約し、さらには友人に面白いメールを書いたりもします。これらすべてを一度に行うのです。この論文は、「推論チェーン(reasoning chains)」と呼ばれるAI研究の特定の領域に焦点を当てています。そこでの目標は、モデルがボールを落とすことなく、多くの異なる種類のタスクを同時にこなせるかどうかを見極めることです。誰もが気にかけている大きな疑問は、「これらのAIモデルは、現実世界の混沌とした複雑な多段階の問題に対処できるのか、それとも状況が混み合いすぎると混乱して諦めてしまうのか?」という点です。
そこで登場したのが、AIモデルが思考の「リレーレース」を走れるかどうかを試すために設計された、新しく超強力なテスト、Relay-Bench です。このテストの作成者は、モデルに一つの数学の問題を解かせたり一つの詩を書かせたりする代わりに、一つの巨大なプロンプトの中に、数学パズルを解き、ウェブ上で特定の事実を見つけ、少しのコードを書き、そして秘密のメッセージを解読するといった、一連の異なるタスクを繋ぎ合わせています。これは、穴を飛び越え、扉を開けるために謎解きをし、それからボスと戦わなければならないビデオゲームのレベルのようなものです。しかも、リセットボタンを押すことなく。研究者たちはこれら31種類の複雑なチャレンジを構築しました。中には、たった一つの数字を見つけるために小説を読むかのように感じられるほど、長く、偽の情報で溢れかえったものもあります。彼らはさらに「秘密のコード」のレイヤーも加えました。そこでは、指示内のすべての単語が奇妙な3文字のコードに置き換えられており、AIは問題を解き始める前に、まずメッセージを解読しなければなりません。
当時のトップ3のAIモデル(GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.7)をこの試練に走らせたところ、結果は少なからず衝撃的なものでした。最も賢いモデルであるGPT-5.5でさえ、正解率はわずか約**43.3%でした。これは半分にも満たない数値です!他のモデルのスコアはさらに低く、あるモデルに至ってはわずか 16.7%**しか達成できませんでした。この論文は、現在のAIモデルは単一のタスクには非常に長けているものの、複数の異なるスキルを連鎖させるよう求められると、特に指示が混乱していたりタスクが非常に長かったりする場合に、著しく苦戦することを示唆しています。実際、このテストは非常に難しかったため、多くのモデルは単に諦めてしまったり、ループに陥ってレースを完走できなくなったりしました。
また、研究者たちは、これらのモデルが時として「ハルシネーション(幻覚)」を起こすこと、つまり、答えがわからないときに答えを捏造してしまう現象も見出しました。あるモデル、Claude Opus 4.7は非常に慎重であり、エンコードされた質問の多くに対して回答自体を拒否しました。これはおそらく、そのセーフティフィルターが厳格すぎたためでしょう。別のモデルであるGemini 3.1は、より頻繁に推測しようとしましたが、結果として誤答が増えてしまいました。この研究は、現在のAIモデルが、私たちが期待するような万能なエキスパートにはまだ程遠い状態であることを浮き彫りにしています。彼らは、数学のテストでは満点を取れるけれど、数学を解きながら同時に詩を翻訳し、レシピを検索するように頼まれるとパニックに陥ってしまうような、優秀な学生のようなものです。著者らは、AIモデルがこのような「リレーレース」テストを安定してパスできるほど上手くなるには、あと1、2年はかかる可能性があると示唆しており、モデルが賢くなるにつれて、これらに追いつくためにテストはさらに難しくしていく必要があると警告しています。
テクニカル・サマリー:Relay-Bench
問題の定式化
本論文は、大規模言語モデル(LLM)の評価における決定的な欠落、すなわち、単一のプロンプト内で異なるドメインのタスクを完了する能力を測定する、未飽和かつ包括的なテキスト専用ベンチマークの欠如に対処している。最先端のモデルは、多くの単一ドメイン・ベンチマーク(GPQA、MATH-500など)において飽和状態(Pass@1 > 90%)に達し、特化したエージェント・ベンチマークでも高い性能を示しているが、「マルチドメイン推論チェーン」には苦戦している。著者らは、複数のドメインを組み合わせて推論する能力が、「人工汎用知能(AGI)の追求における決定的な障害」であると断じている。
既存のベンチマークは、飽和の問題に直面しているか、非テキスト入力(MMMUなど)に依存しているか、あるいはモデルの性能を不明瞭にする複雑なスコアリング・フレームワークを使用していることが多い。Relay-Benchは、入力モダリティやスコアリング・システムを通じて難易度を上げるのではなく、問題そのものの中に複雑性をレイヤー状に重ねることで難易度を高める、直交的なアプローチとして設計されている。
メソドロジー
ベンチマークの構造
Relay-Benchは31個の問題で構成されており、そのうち30個は汚染を防ぐために保持されたプライベートなテストセットとなっている。各問題は、2つから13つのサブ問題 からなる複合問題 である。
サブ問題: これらは、標準的なQAベンチマークと同様の単一ドメイン・タスク(視覚的推論、コーディング、数学、情報抽出、一般知識、データ分析など)である。
依存関係: サブ問題は依存関係を持って連鎖しており、最終的な回答は前のサブ問題の出力に依存する。依存グラフは非巡回である。
拡張: 難易度を高め、現実世界の「コンテキストの肥大化」をシミュレートするために、問題には2つの特定の拡張が施される。
コンテキストの肥大化: 無関係な「ユーザーの好み」(約7,813文字)がプロンプトに挿入される。
プロンプト・エンコーディング: 単語、記号、数字が3文字のアルファベット文字列に置き換えられる(例:「bottle」 → \to → 「」)。モデルには辞書が提供され、問題を解く前にプロンプトをデコードしなければならない。一部の問題では、10,000回を超える翻訳操作を必要とする。
評価プロトコル
テキスト入力、テキスト出力: 本ベンチマークは、視覚的推論タスク(迷路など)をテキストベースの表現(ASCIIアートなど)に変換することで、視覚入力を回避している。
ツールの許容性: 多くのベンチマークがツールを無効化するのに対し、Relay-Benchは、コード実行やウェブ検索を含むすべての利用可能な機能を明示的に推奨している。
スコアリング: ベンチマークは Pass@1 メトリックを使用する。採点は決定的かつ厳密であり、LLMによる判定や「準正確な」マッチングを用いずに、スクリプトベースの検証を可能にするために、モデルは特定の文字列形式(大文字、記号)を出力するように指示されている。
評価対象モデル: 本論文では、最大限の「思考努力」設定を用いた3つの最先端モデルを評価している。
Claude Opus 4.7 (Max)
Gemini 3.1 Pro (High)
GPT-5.5 (xHigh)
主な貢献
Relay-Bench ベンチマーク: マルチドメイン推論とプロンプト・エンコーディングを組み合わせることで、飽和を回避するように設計された、包括的なテキスト専用ベンチマークの導入。
斬新な難易度メカニズム: プロンプト・エンコーディング(大量の翻訳操作を必要とする)と意図的なコンテキストの肥大化を用いることで、モデルを「消耗」させ、ノイズ下での指示追従の信頼性をテストする。
ツール許容型の評価: ウェブ検索やコード実行などのフルツールアクセスを許可することで、ユーザー体験を反映したフレームワークを提供し、これらの機能を制限するベンチマークとは対照的なものとしている。
採点の厳密性: 再現性を確保するため、確率的またはLLMによる判定を用いたスコアリングから、決定的な完全一致マッチングへの転換を実現した。
結果
パフォーマンス
リーディング・モデル: GPT-5.5 (xHigh) が最高スコアの 43.3% を達成した。
比較スコア:
Gemini 3.1 Pro (High): 40.0%
Claude Opus 4.7 (Max): 16.7%
ベンチマーク比較: すべてのモデルは、他のベンチマークよりも Relay-Bench で著しく低いスコアを記録した。例えば、平均 Relay-Bench スコアは 33.3% であり、Humanity's Last Exam (HLE) の 42.9%、ARC-AGI-2 の 79.3%、τ 2 \tau^2 τ 2 -Bench の 92.7% と比較して低い。
飽和: 本論文は、他のベンチマークが通常2年以内に飽和するのに対し、Relay-Bench は飽和するまでに1〜2年かかる可能性があると示唆している。
エラー分析とハルシネーション
パース可能性: 全90件の回答のうち、パース可能な最終回答を含んでいたのは50件のみであった。
ハルシネーション率:
Claude Opus 4.7 は、ハルシネーション率が最も低かった(誤ったパース可能な回答はわずか1件)が、パース可能な回答の総数も最も少なかった。
GPT-5.5 と Gemini 3.1 Pro は、より高いハルシネーション率を示した。
本論文は、Pass@1 スコアリング・フレームワーク(非回答は不正解となる)が、棄権よりも推測を促すものであると指摘しているが、それでもモデルは大きく異なるハルシネーション挙動を示した。
失敗モード:
モデルは特定のサブ問題を解決できず、停止する代わりに最終的な複合回答を推測してしまうことが頻繁にあった。
Claude Opus 4.7 は、エンコードされた問題のサブセットのすべてに対して回答を停止(拒絶)しており、過度に保守的な安全策を示唆している。
15,000文字を超える問題は著しく困難であり、GPT-5.5 と Gemini 3.1 Pro のみが7つのうち1つの問題を解決した。
コスト分析
総開発コスト: $163.29(テスト実行および質問生成を含む)。
モデルコスト:
GPT-5.5 は、高いトークン使用量にもかかわらず、低いトークン単価により最も安価な評価(合計 $22.44)となった。
Claude Opus 4.7 は、広範な思考プロセスとツールの反復による高い入力トークン使用量(6つの問題で200万トークン以上)により、最も高価($33.76)であった。
Gemini 3.1 Pro は、最も低いトークン価格であったが、入力キャッシュヒット率が非常に低かった(0.6%)ため、GPT-5.5 よりも高いコストが発生した。
効率性: GPT-5.5 は、精度とコストの最適なバランスを提供しており、他のモデルをパレート優位で凌駕している。
意義と主張
本論文は、Relay-Bench が以下の点を通じて、一般的なユーザーにとってより厳格で現実的な LLM 能力の評価を提供すると主張している。
信頼性のテスト: 専門レベルの課題の上に、ジェネラリスト・タスク(指示追従、文字列操作)をレイヤー化することで、複雑で多段階のワークフロー下での信頼性を測定する。
飽和の回避: ドメインを組み合わせ、エンコーディングの複雑さを加えることで、単一ドメインの QA タスクで見られる急速な飽和を回避する。
現実世界の使用状況の反映: ツールを有効にし、「ノイズ」の多いプロンプトをシミュレートすることで、エージェント・ワークフローを展開する際にユーザーが直面する状況を反映している。
著者らは、テストセットのサイズが小さい(30問題)ため、モデルのパフォーマンスに広い信頼区間が生じることを謙虚に認めている。また、ウェブ検索やコード実行への依存がメンテナンス上の課題(リンク切れなど)をもたらすことにも触れており、将来のイテレーションでは、推論能力とツール使用をより明確に分離するために範囲を絞り込む可能性があるとしている。結論として、現在の最先端モデルは有望ではあるものの、信頼性の高いマルチドメインの長い推論チェーンを実行する能力には、依然として大きな課題があるとしている。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×