← 最新の論文
💬 NLP

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Benchは、単一のプロンプト内でコーディング、数学、ウェブ検索といった多様なスキルを統合することを要求する未飽和の複合問題を提示することにより、マルチドメインの推論連鎖における大規模言語モデルを評価するために設計された、包括的なテキストのみのベンチマークであり、主要モデルであるGPT-5.5 (xHigh) は43.3%のスコアを達成しています。

原著者: Liam Swayne

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Liam Swayne

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたの最もお気に入りのスマートアシスタントが、単なるトリビアbotやコード処理機ではなく、真のマルチタスクの魔術師であるような世界を想像してみてください。急速に進化する人工知能の分野において、研究者たちはデジタル脳が実際にどれほど賢いのかを測るために、「ベンチマーク」と呼ばれるもの、つまり標準化されたテストを絶えず構築しています。長い間、これらのテストは学校の別々の科目のようでした。数学のための試験、歴史のための試験、そしてコーディングのための試験といった具合です。しかし、現実の世界はそんな風には動きません。人間に旅行の計画を立てるよう頼むとき、その人は単に距離を計算するだけではありません。天気をチェックし、レビューを読み、ホテルを予約し、さらには友人に面白いメールを書いたりもします。これらすべてを一度に行うのです。この論文は、「推論チェーン(reasoning chains)」と呼ばれるAI研究の特定の領域に焦点を当てています。そこでの目標は、モデルがボールを落とすことなく、多くの異なる種類のタスクを同時にこなせるかどうかを見極めることです。誰もが気にかけている大きな疑問は、「これらのAIモデルは、現実世界の混沌とした複雑な多段階の問題に対処できるのか、それとも状況が混み合いすぎると混乱して諦めてしまうのか?」という点です。

そこで登場したのが、AIモデルが思考の「リレーレース」を走れるかどうかを試すために設計された、新しく超強力なテスト、Relay-Benchです。このテストの作成者は、モデルに一つの数学の問題を解かせたり一つの詩を書かせたりする代わりに、一つの巨大なプロンプトの中に、数学パズルを解き、ウェブ上で特定の事実を見つけ、少しのコードを書き、そして秘密のメッセージを解読するといった、一連の異なるタスクを繋ぎ合わせています。これは、穴を飛び越え、扉を開けるために謎解きをし、それからボスと戦わなければならないビデオゲームのレベルのようなものです。しかも、リセットボタンを押すことなく。研究者たちはこれら31種類の複雑なチャレンジを構築しました。中には、たった一つの数字を見つけるために小説を読むかのように感じられるほど、長く、偽の情報で溢れかえったものもあります。彼らはさらに「秘密のコード」のレイヤーも加えました。そこでは、指示内のすべての単語が奇妙な3文字のコードに置き換えられており、AIは問題を解き始める前に、まずメッセージを解読しなければなりません。

当時のトップ3のAIモデル(GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.7)をこの試練に走らせたところ、結果は少なからず衝撃的なものでした。最も賢いモデルであるGPT-5.5でさえ、正解率はわずか約**43.3%でした。これは半分にも満たない数値です!他のモデルのスコアはさらに低く、あるモデルに至ってはわずか16.7%**しか達成できませんでした。この論文は、現在のAIモデルは単一のタスクには非常に長けているものの、複数の異なるスキルを連鎖させるよう求められると、特に指示が混乱していたりタスクが非常に長かったりする場合に、著しく苦戦することを示唆しています。実際、このテストは非常に難しかったため、多くのモデルは単に諦めてしまったり、ループに陥ってレースを完走できなくなったりしました。

また、研究者たちは、これらのモデルが時として「ハルシネーション(幻覚)」を起こすこと、つまり、答えがわからないときに答えを捏造してしまう現象も見出しました。あるモデル、Claude Opus 4.7は非常に慎重であり、エンコードされた質問の多くに対して回答自体を拒否しました。これはおそらく、そのセーフティフィルターが厳格すぎたためでしょう。別のモデルであるGemini 3.1は、より頻繁に推測しようとしましたが、結果として誤答が増えてしまいました。この研究は、現在のAIモデルが、私たちが期待するような万能なエキスパートにはまだ程遠い状態であることを浮き彫りにしています。彼らは、数学のテストでは満点を取れるけれど、数学を解きながら同時に詩を翻訳し、レシピを検索するように頼まれるとパニックに陥ってしまうような、優秀な学生のようなものです。著者らは、AIモデルがこのような「リレーレース」テストを安定してパスできるほど上手くなるには、あと1、2年はかかる可能性があると示唆しており、モデルが賢くなるにつれて、これらに追いつくためにテストはさらに難しくしていく必要があると警告しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →