← 最新の論文
💻 computer science

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojoは、ゲーム『Stardew Valley』に基づき、1,000個の厳選されたタスクを通じて、複雑な生産・生活シミュレーションにおけるオープンエンドなエージェンティック・マルチモーダルLLMを評価する新しいベンチマークであり、GPT-4.1のような最先端のモデルでさえ視覚的理解、推論、および低レベルの操作において著しく苦戦し、成功率がわずか12.7%にとどまることを明らかにしている。

原著者: Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに「人間らしい充実した人生」を送り方を教えようとしていると想像してみてください。単に質問に答えたり、詩を書いたりする方法ではなく、どのように目覚め、仕事に行き、友達を作り、予算を管理し、そして予期せぬ雨への対処をするか――これらすべてを同時に行う方法です。

これこそが、この論文の著者たちが取り組んでいるStarDojoの目的です。彼らは、人工知能(AI)エージェントが、「生産と生活」という、複雑で入り混じった現実を扱えるかどうかを検証するために、人気のあるビデオゲーム『スターデューバレー(Stardew Valley)』を用いたテスト場を構築しました。

以下に、彼らの研究内容を簡単な比喩を用いて解説します。

1. 問題点:「二つのトラック」の乖離

現在のAIベンチマークを、「車を直線に駐車すること(生産)」だけをテストする運転免許試験や、「乗客とチャットすること(社会的相互作用)」だけをテストする試験だと考えてみてください。

  • 現実: 現実の世界では、ただ駐車してチャットするだけでは済みません。食料品店へ車を走らせ(生産)、食べ物を買い、それからレジの人と話す(社会)一方で、時間やお金を管理しなければなりません。
  • 乖離: 既存のテストは、AIがこれらを同時にこなせるかどうかをチェックしていません。それらは通常、あまりにも単純すぎるか、あるいは一方の側面に特化しすぎています。

2. 解決策:StarDojo(「ライフシミュレーター」試験)

著者たちは、StarDojoという新しいベンチマークを作成しました。これは『スターデューバレー』に基づいています。

  • ゲーム: 作物を植えたり、鉱山で岩を掘ったり、洞窟でスライムと戦ったり、村人と交流したりできる、心地よい農場を想像してください。
  • ひねり: 彼らはこのゲームを、AIのための厳格な試験へと変貌させました。人間がプレイする代わりに、AIエージェントに特定のタスクを完了させるようにさせたのです。
  • タスク: 彼らは、「簡単なもの(植物に水をやるなど)」から「難しいもの(隣人との関係を築きながらモンスターと戦い、農園の一シーズン全体の計画を立てるなど)」まで、1,000種類の異なるチャレンジを作成しました。
  • 「ライト」版: テストを容易にするために、基本を網羅した100個の代表的なタスク(StarDojo-Lite)も選定しています。

3. AIとゲームをどのように接続したか

通常、ビデオゲームを操作するにはキーボードとマウスが必要です。しかし、ロボットの脳にキーボードを直接つなぐことは簡単ではありません。

  • 架け橋: 著者たちは、AIがゲームエンジンと直接対話できるようにする特別な「翻訳機」(StarDojoModと呼ばれます)を構築しました。
  • 比喩: AIが人間のように画面を「見て」、ボタンを「押す」のではなく、AIがゲームの内部コンピュータへの直通電話を持っているようなものです。AIは「私のエネルギーレベルは?」と尋ねたり、「私を左に動かして」と言ったりすることができ、ゲームはそれを即座に実行します。これにより、多くのゲームを同時に走らせて、AIを迅速にテストすることが可能になります。

4. 結果:AIは「大人になる」ことに苦戦する

著者たちは、利用可能な最もスマートなAIモデル(GPT-4.1、Claude、Geminiなど)をこの試験でテストしました。その結果は、厳しいものでした。

  • スコア: 最も優れたAIでさえ、タスクのわずか**12.7%**程度しか正解できませんでした。
  • 簡単なこと: AIは、単純で短いタスク(すでに手に持っている道具を手に取るなど)については、まずまずの結果を出しました。
  • 難しいこと: 長い計画を立てたり、マップ内を移動したりする必要があるタスクについては、AIは完全に失敗しました。タスクが数ステップ以上に及ぶと、AIは迷子になるか、自分が何をしていたのかを忘れてしまいました。

5. なぜAIは失敗したのか?(「4つの盲点」)

著者たちはミスを分析し、AIがこの「ライフシミュレーター」を扱えなかった主な理由を4つ発見しました。

  1. 視覚的な盲目(エラーの42%): AIはゲーム画面を見ていますが、何が何であるかを判別できていませんでした。岩を木だと思い込んだり、目の前にドアがあることに気づかなかったりします。それは、曇ったメガネをかけて部屋を歩き回っているようなものです。
  2. 推論の混乱(21%): 正しい情報(「あなたは納屋の近くにいます」というテキストリストなど)を持っていても、AIはテキストを無視して、ぼやけた視覚に頼ってしまい、混乱を招きました。
  3. 短い注意力(21%): AIは先を見越した計画を立てられませんでした。収穫する前に作物を水やりする必要があることを忘れたり、タスクの途中で目標を切り替えたりしてしまいました。
  4. 不器用な手(16%): AIは何をすべきかは分かっていても、「どのように」行うかでミスをしました。道具を間違った方向に使おうとしたり、インベントリから間違ったアイテムを選んだりしました。

6. まとめ

この論文は、AIが質問に答えたりコードを書いたりすることには長けている一方で、現在は**「身体化された生活(embodied living)」**には非常に不向きであることを結論づけています。AIは、時間が経過し、物事が変化するダイナミックな世界において、見る、考える、計画する、そして行動するという要素を組み合わせることに苦労しています。

StarDojoは現在、研究者が使用できるオープンなツールとなっています。それは、AIが、シミュレートされた生活という複雑で、混沌としていて、かつ美しい挑戦に対して、より上手くなるための「ジム」のようなものです。この論文は、明日AIが農場を運営すると約束しているわけではありません。単に、AIがどこでつまずいているのかを明確に示すことで、私たちがどのように学習を助けることができるかを示しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →