Agentick: A Unified Benchmark for General Sequential Decision-Making Agents
本論文は、強化学習、大規模言語モデル、視覚言語モデル、ハイブリッド、および人間のエージェントにおける逐次的意思決定の公平な比較と進展を促すため、多様なモダリティと難易度レベルにわたる 37 の手続き的に生成されたタスクを備えた統一ベンチマーク「Agentick」を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
世界で最も優れた「問題解決者」は誰かを突き止めようとしていると想像してください。そこには、非常に異なる 3 種類の参加者がいます。
- 白紙の石板(The Blank Slate): 何も知らず、試行錯誤を通じてすべてを学ばなければならないロボット(歩き方を学ぶ赤ん坊のようなもの)。
- 百科事典(The Encyclopedia): ほぼインターネット全体を読み込んだ超優秀なコンピューターだが、現実世界で実際に何かを「行った」経験は一度もない。
- ハイブリッド(The Hybrid): 上記の両者の混合。
問題は、これまでこれらを公平に比較できなかったことです。マラソン選手、チェスのグランドマスター、そして水泳選手を全員に「レースを走れ」と命じて比較しようとするようなものです。水泳選手は溺れ、チェスの選手は道に迷ってしまいます。
「Agentick」の登場です。
この論文の著者たちは、Agentickという新しい普遍的なテスト環境を構築しました。これは、あらゆる種類の AI が同じ競技場で競い合えるように設計された、大規模な手続き的に生成された「障害物コース」と考えてください。
障害物コース(ベンチマーク)
Agentick は単一のゲームではなく、迷路、パズル、宝探しなど、難易度が徐々に上がる37 の異なるミニゲームの集合体です。これらのゲームは、以下の 6 つの特定のスキルをテストします。
- ナビゲーション: 道を見つけることができるか?
- 計画: 先を見越して考えられるか?
- 推論: 論理パズルを解けるか?
- 記憶: 10 手前の出来事を覚えているか?
- 一般化: 新しいルールに適応できるか?
- チームワーク: 他者と協力(または対抗)できるか?
普遍の翻訳機(インターフェース)
ここが魔法のトリックです。Agentick はゲームのあらゆる瞬間において、5 つの異なる言語を同時に話します。
- 「白紙の石板」(強化学習:RL)向け: ピクセル化されたビデオゲーム画面(昔ながらのアーケードゲームのようなもの)を表示します。
- 「百科事典」(大規模言語モデル:LLMs)向け: 壁を
#、空きスペースを.として表す ASCII 文字によるテキストベースの地図、または文章による説明を表示します。 - 人間向け: 3D スタイルのビューを表示します。
これにより、誰も不利益を被ることはありません。「百科事典」はピクセルの意味を推測する必要がなく、「白紙の石板」はルールを理解するために小説を読む必要もありません。彼らはすべて、世界の状態を全く同じように把握しますが、それぞれが最も得意とする形式でそれを見ます。
結果:誰が勝ったか?
研究者たちは、誰が最も優れたパフォーマンスを発揮したかを確認するために、90,000 回以上のゲームを実行しました。彼らが発見したことを、シンプルな比喩を用いて以下に示します。
唯一の英雄はいない: 「最高の AI」という存在はありません。それはタスクによります。
- 白紙の石板(RL)は、計画とチームワークにおいて驚異的でした。反復を通じてゲームの正確なメカニズムを学び、卓越した戦術家となりました。
- 百科事典(LLMs)は、ナビゲーションと一般化において優れていました。あまりにも多くの情報を読み込んでいるため、事前に練習する必要なく、新しい迷路での正しい経路を推測することができました。
- 結論: 最も賢い AI(GPT-5 mini)でさえ、満点の約**30%**しか達成できませんでした。現在の AI が達成できることと、達成すべきことの間には、まだ巨大な隔たりがあります。
「思考」のトリック: AI にどのように考えさせるかが、AI の大きさよりも重要です。
- 研究者が LLMs に行動する前に「ステップバイステップで考えよ(Chain-of-Thought という手法)」と指示したところ、そのパフォーマンスは3 倍、あるいは 10 倍に跳ね上がりました。まるで学生に、「推測するだけでなく、まず論理を書き出せ」と指示したようなものです。すると、彼らはパズルを格段にうまく解くようになります。
短く簡潔な方が優れている: 地図をナビゲートしようとする AI にとって、長い派手な説明よりも**テキストグリッド(ASCII)**の方が効果的でした。
- 誰かに道案内をする様子を想像してください。「左に壁がある部屋に立っています…」という文章の段落よりも、記号(
#=壁、.=道)を使ったシンプルな地図の方が、コンピュータにとって処理しやすいことが多いのです。コンパクトな記号は、空間推論においてより効率的でした。
- 誰かに道案内をする様子を想像してください。「左に壁がある部屋に立っています…」という文章の段落よりも、記号(
なぜこれが重要なのか
この論文は、真に有能で自律的なエージェント(単独で行動できるロボットやソフトウェア)を構築するためには、これらの異なる種類の AI を別々の世界として扱うのをやめる必要があると主張しています。Agentick は、各タイプがどこで輝き、どこで失敗するかを把握するための共通の基盤を提供します。
それは、AI の未来が単にモデルを大きくすることや、より長く訓練することにあるのではなく、「白紙の石板」の「実践による学習」と「百科事典」の「世界知識」を組み合わせ、それらから最良の結果を引き出すための適切な「プロンプト(指示)」を使用することにあることを示唆しています。
要約すると: Agentick は、チェス選手、水泳選手、そしてランナーを同じアリーナで公平に裁くことができる最初の審判です。それは、私たちが進歩を遂げた一方で、完璧な自律型エージェントを構築するにはまだ程遠いことを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。