← 最新の論文
💬 NLP

Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks

本論文は、6 つの多様な環境にまたがる 828 の実世界のマルチモーダルタスクと、視覚中心のエージェントにおける深層推論を評価するための微細なステップレベル評価枠組みを備えた大規模ベンチマーク「Agent-X」を導入し、現在の最先端モデルが複雑な多段階シナリオにおいて完全な連鎖的成功を達成することに苦慮していることを明らかにする。

原著者: Tajamul Ashraf, Amal Saqib, Hanan Ghani, Muhra AlMahri, Yuhao Li, Noor Ahsan, Umair Nawaz, Jean Lahoud, Hisham Cholakkal, Mubarak Shah, Philip Torr, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman Khan

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Tajamul Ashraf, Amal Saqib, Hanan Ghani, Muhra AlMahri, Yuhao Li, Noor Ahsan, Umair Nawaz, Jean Lahoud, Hisham Cholakkal, Mubarak Shah, Philip Torr, Fahad Shahbaz Khan, Rao Muhammad Anwer, Salman Khan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

超賢いロボットアシスタントを構築したと想像してください。カメラ、脳、そして拡大鏡、電卓、ウェブブラウザなどのガジェットが詰まった工具箱をそのロボットに与えます。そして、「パリへの最安のフライトを見つけ、現地の天気を確認し、傘が必要かどうか教えてくれ」といった、厄介なパズルを解くよう依頼します。

長らく、これらのロボットは、ビデオゲームのレベルのような単純で架空のパズルでテストされてきました。しかし、現実世界は複雑で、動画を含み、ロボットに単一のステップではなく、複数のステップで思考することを要求します。

ここで登場するのがAgent-Xです。この論文は、これらのロボットアシスタントが現実世界でいかに深く思考し、ツールを活用できるかをテストするために設計された、極めて困難な新しい「障害物競走」の創作者だと考えてください。

以下に、彼らが行ったことを日常的な比喩を用いて解説します。

1. 問題:「ビデオゲーム」対「現実世界」

以前のテストは、壁にルールが書かれたビデオゲームのレベルをロボットに与えるようなものでした。「赤い鍵を使って青い扉を開けろ」といった具合です。ロボットは指示に従うだけです。

しかし、現実生活では、誰しもどのツールを使うべきかを教えてくれません。「蛇口の漏れを修理してくれ」と言うだけです。ロボットは自分で考えなければなりません。「レンチが必要か?動画チュートリアルを検索する必要があるか?配管工を呼ぶ必要があるか?」と。

著者らは、現在のロボットは特定のテストの答えを暗記するのは得意だが、未経験の問題を解くよう求められたら凍りついてしまう学生のようなものだと言います。彼らは、思考の複数のステップを連鎖させることに苦しんでいます。

2. 解決策:「Agent-X」障害物競走

チームは、828 の現実世界の課題からなる大規模なコレクションAgent-Xを作成しました。

  • シナリオ: 架空の画像の代わりに、生活の 6 つの異なる「地域」からの実際の写真、動画、スクリーンショットを使用しました。
    • 運転: 車の動画を視聴し、歩行者が横断しようとしているかどうかを判断する。
    • 監視: 防犯カメラの映像を見て、不審な人物を特定する。
    • スポーツ: ゲームの動画を分析して選手数を数えたり、勝者を予測したりする。
    • ウェブブラウジング: どのボタンをクリックすべきか正確に指示されずに、ウェブサイトを移動して特定の情報を検索する。
    • 数学と一般論理: 画像に見られる方程式を解く、または複数の画像を比較する。
  • ひねり: ロボットにはチェックリストが与えられません。画像を見て、何が欠けているかを認識し、工具箱から適切なツールを選び、それを使用し、結果を見て、次に何をすべきか決定する必要があります。

3. 「審判」:ロボットをどのように評価するか

ここが最も重要な部分です。通常、私たちはロボットが最終的な答えを正しく出したかどうかのみをチェックします(教師が数学のテストを採点するようなものです)。

Agent-X はステップバイステップの審判を導入します。最終的な答えだけでなく、生徒の計算用紙も見る教師を想像してください。

  • 適切なツールを選んだか?(例:拡大鏡の代わりに電卓を使ったか?)
  • ツールを正しく使ったか?(例:数字を正しい順序で入力したか?)
  • 論理は妥当か?(例:証拠を確認せずに結論に飛びついたか?)

ロボットが正解を当てたとしても、ハルシネーション(事実を捏造すること)によって到達したか、ステップをスキップした場合は、Agent-X は不合格を与えます。これは、間違った材料を使って美味しいケーキを作ったシェフのようなものです。ケーキは美味しいですが、プロセスに欠陥があります。

4. 結果:ロボットはまだ学習中

著者らは、GPT-4、Gemini、Qwen などの有名モデルを含む、利用可能な 12 の最も賢い AI モデルをテストしました。

判決: 最も「賢い」ロボットでさえも苦しんでいます。

  • スコア: 最上位のモデルでも、最初から最後まで完全に正しいタスクは50% 未満でした。
  • ボトルネック: ロボットは画像を見て、それについて話すことは得意ですが、計画を立てることは非常に苦手です。彼らはしばしば以下のような失敗を犯します。
    • 必要なツールの使用を忘れる。
    • 持っていないツールを使う(存在しないツールをハルシネーションさせる)。
    • 動画を見て、時間の経過とともに何が起こっているかを追跡する際に混乱する。
    • 回答のフォーマットを間違える(フォームを埋める代わりに手紙を書くなど)。

5. 教訓

この論文は、これらの AI エージェントは印象的ではあるものの、まだ完全自律的な労働者として準備が整っていないと結論付けています。彼らは多くの事実を知っているが、どのように仕事を行うかを理解するために絶えず監督を必要とする、優秀なインターンのような存在です。

著者らは、研究者が計画やツール使用を処理する「脳」の特定の部分を修正できるように、これらのロボットがどこで失敗しているかを正確に示す「ストレステスト」として Agent-X を構築しました。彼らは単に「これに答えられますか?」と尋ねているのではなく、「これを通り抜けて考えられますか?」と尋ねています。そして今のところ、答えは「まだ完全にはできていない」です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →