← 最新の論文
🤖 AI

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

本論文は、強化学習、大規模言語モデル、視覚言語モデル、ハイブリッド、および人間のエージェントにおける逐次的意思決定の公平な比較と進展を促すため、多様なモダリティと難易度レベルにわたる 37 の手続き的に生成されたタスクを備えた統一ベンチマーク「Agentick」を導入する。

原著者: Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

公開日 2026-05-11
📖 1 分で読めます☕ さくっと読める

原著者: Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

世界で最も優れた「問題解決者」は誰かを突き止めようとしていると想像してください。そこには、非常に異なる 3 種類の参加者がいます。

  1. 白紙の石板(The Blank Slate): 何も知らず、試行錯誤を通じてすべてを学ばなければならないロボット(歩き方を学ぶ赤ん坊のようなもの)。
  2. 百科事典(The Encyclopedia): ほぼインターネット全体を読み込んだ超優秀なコンピューターだが、現実世界で実際に何かを「行った」経験は一度もない。
  3. ハイブリッド(The Hybrid): 上記の両者の混合。

問題は、これまでこれらを公平に比較できなかったことです。マラソン選手、チェスのグランドマスター、そして水泳選手を全員に「レースを走れ」と命じて比較しようとするようなものです。水泳選手は溺れ、チェスの選手は道に迷ってしまいます。

「Agentick」の登場です。

この論文の著者たちは、Agentickという新しい普遍的なテスト環境を構築しました。これは、あらゆる種類の AI が同じ競技場で競い合えるように設計された、大規模な手続き的に生成された「障害物コース」と考えてください。

障害物コース(ベンチマーク)

Agentick は単一のゲームではなく、迷路、パズル、宝探しなど、難易度が徐々に上がる37 の異なるミニゲームの集合体です。これらのゲームは、以下の 6 つの特定のスキルをテストします。

  • ナビゲーション: 道を見つけることができるか?
  • 計画: 先を見越して考えられるか?
  • 推論: 論理パズルを解けるか?
  • 記憶: 10 手前の出来事を覚えているか?
  • 一般化: 新しいルールに適応できるか?
  • チームワーク: 他者と協力(または対抗)できるか?

普遍の翻訳機(インターフェース)

ここが魔法のトリックです。Agentick はゲームのあらゆる瞬間において、5 つの異なる言語を同時に話します。

  • 「白紙の石板」(強化学習:RL)向け: ピクセル化されたビデオゲーム画面(昔ながらのアーケードゲームのようなもの)を表示します。
  • 「百科事典」(大規模言語モデル:LLMs)向け: 壁を #、空きスペースを . として表す ASCII 文字によるテキストベースの地図、または文章による説明を表示します。
  • 人間向け: 3D スタイルのビューを表示します。

これにより、誰も不利益を被ることはありません。「百科事典」はピクセルの意味を推測する必要がなく、「白紙の石板」はルールを理解するために小説を読む必要もありません。彼らはすべて、世界の状態を全く同じように把握しますが、それぞれが最も得意とする形式でそれを見ます。

結果:誰が勝ったか?

研究者たちは、誰が最も優れたパフォーマンスを発揮したかを確認するために、90,000 回以上のゲームを実行しました。彼らが発見したことを、シンプルな比喩を用いて以下に示します。

  1. 唯一の英雄はいない: 「最高の AI」という存在はありません。それはタスクによります。

    • 白紙の石板(RL)は、計画チームワークにおいて驚異的でした。反復を通じてゲームの正確なメカニズムを学び、卓越した戦術家となりました。
    • 百科事典(LLMs)は、ナビゲーション一般化において優れていました。あまりにも多くの情報を読み込んでいるため、事前に練習する必要なく、新しい迷路での正しい経路を推測することができました。
    • 結論: 最も賢い AI(GPT-5 mini)でさえ、満点の約**30%**しか達成できませんでした。現在の AI が達成できることと、達成すべきことの間には、まだ巨大な隔たりがあります。
  2. 「思考」のトリック: AI にどのように考えさせるかが、AI の大きさよりも重要です。

    • 研究者が LLMs に行動する前に「ステップバイステップで考えよ(Chain-of-Thought という手法)」と指示したところ、そのパフォーマンスは3 倍、あるいは 10 倍に跳ね上がりました。まるで学生に、「推測するだけでなく、まず論理を書き出せ」と指示したようなものです。すると、彼らはパズルを格段にうまく解くようになります。
  3. 短く簡潔な方が優れている: 地図をナビゲートしようとする AI にとって、長い派手な説明よりも**テキストグリッド(ASCII)**の方が効果的でした。

    • 誰かに道案内をする様子を想像してください。「左に壁がある部屋に立っています…」という文章の段落よりも、記号(#=壁、.=道)を使ったシンプルな地図の方が、コンピュータにとって処理しやすいことが多いのです。コンパクトな記号は、空間推論においてより効率的でした。

なぜこれが重要なのか

この論文は、真に有能で自律的なエージェント(単独で行動できるロボットやソフトウェア)を構築するためには、これらの異なる種類の AI を別々の世界として扱うのをやめる必要があると主張しています。Agentick は、各タイプがどこで輝き、どこで失敗するかを把握するための共通の基盤を提供します。

それは、AI の未来が単にモデルを大きくすることや、より長く訓練することにあるのではなく、「白紙の石板」の「実践による学習」と「百科事典」の「世界知識」を組み合わせ、それらから最良の結果を引き出すための適切な「プロンプト(指示)」を使用することにあることを示唆しています。

要約すると: Agentick は、チェス選手、水泳選手、そしてランナーを同じアリーナで公平に裁くことができる最初の審判です。それは、私たちが進歩を遂げた一方で、完璧な自律型エージェントを構築するにはまだ程遠いことを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →