← 最新の論文
🤖 AI

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

本論文は、空中3D環境におけるマルチモーダル大規模言語モデルのゼロショット・ミッションレベルの能力を評価するためのベンチマークであるMissionBenchを紹介し、スケーリングによって性能は向上するものの、現在のモデルは、多段階のプランニングと適応的な推論を必要とする複雑で長期的なホライゾンのエンボディド・タスクにおいて、依然として人間から大きく遅れをとっていることを明らかにしている。

原著者: Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

公開日 2026-07-27
📖 1 分で読めます☕ さくっと読める

原著者: Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

最新の、ものすごく賢いロボットに地図とミッションを渡した場面を想像してみてください。「あの赤い車を見つけて、そのナンバープレートを教えて」という指示です。あなたは、ロボットが猛スピードで駆け出し、周囲をスキャンして、答えを持って戻ってくることを期待しています。しかし、ここに落とし穴があります。このロボットは、ドローンを飛ばしたことが一度もありません。ホバリングの仕方や、木を避ける方法、あるいは鳥の視点から看板を読む方法も教わっていないのです。それは、インターネット上のあらゆる情報を学習したことで、「言葉を話し、画像を見ることができる」ようになった存在です。これが「マルチモーダル大規模言語モデル(MLLM)」の世界です。画像を見ることができ、テキストを読むことができるAIの「賢い脳」が、今や物理的な機械を制御することを求められているのです。科学者たちが投げかけている大きな問いは、「これら汎用的な『賢い脳』は、特別な訓練を受けることなく、たった一文の指示を読み取るだけで、ドローンを飛ばし複雑なミッションを遂行できるのか?」ということです。それは、図書館にあるすべての本を読んだ人に、物語を読んだという理由だけで、特定の小惑星に向かって宇宙船を操縦しろと頼むようなものです。

この論文の中で、研究者たちはこれらのAIの脳に究極のテストを課すことにしました。彼らは、ドローンのための巨大でハイテクな遊び場である「MissionBench」というビデオゲームの世界を構築しました。この遊び場には、「この近所をパトロールせよ」から「燃えている船を検査せよ」、「テントの上に荷物を投下せよ」に至るまで、120種類もの異なるミッションが存在します。ひねりを加えるなら、AIエージェント(ドローンのパイロット)には、テキストによる指示と、ドローンの視点からのカメラ映像だけが与えられます。彼らは、どこへ行くべきか、どのように旋回すべきか、どのくらいの速さで飛ぶべきか、そして何を報告すべきかを、自分自身で判断しなければなりません。これはクローズドループ型のゲームです。AIが動き、世界が変化し、AIが新しい視界を得て、次に何をすべきかを決定します。

結果は、「すごい」と「おっと」が入り混じったものでした。研究者たちは、オープンソースのものから最も強力な商用モデルまで、22種類の異なるAIモデルをテストしました。最も優れた性能を示したAIでも、ミッションに成功したのは**35%未満でした。これを比較するために、同じ制限された操作方法で同じゲームを行った人間のパイロットは70%の成功率であり、フルキーボード操作を用いた人間は84%**に達しました。したがって、AIは決して悪くはありませんが、依然として人間に追いつくのに苦労しています。この論文は、単にAIを「大きく」すること(より多くのデータとパラメータを追加すること)が助けになることを示唆しています。最大規模のモデルは小規模なモデルよりも大幅に優れた成績を収めており、生のサイズが彼らに多少の「身体化された」直感を与えていることを示唆しています。しかし、最も賢いAIであっても混乱することがあります。しばしば物に衝突したり、円を描いて飛び続けたり、あるいは目標にまだ数マイルも離れているのに、終わったと思って早々に諦めてしまったりします。

この研究では、AIがなぜ失敗するのかについても調査しました。その結果、単一の写真の中で物体を見つける能力(写真の中の車を見つけるなど)があることは、AIがその車までドローンを飛ばせることを保証するものではないことが分かりました。AIには、単に「見る」こと以上のことが必要です。経路を計画し、高度を調整し、ターゲットを視界に捉え続け、問題が発生した際に適応する必要があります。研究者たちは、AIが「ドリフトと振動」に苦しんでいることが多いことを発見しました。つまり、混乱した蛾のように、行ったり来たりして動けなくなってしまうのです。あるいは、「早期終了」、つまり疲れたり混乱したりしたために、わずか数秒後に勝利を宣言してしまう現象も見られました。

結局のところ、この論文は、汎用AIが特別な訓練なしにドローンを制御することにおいて、着実に進化しているものの、まだ実世界への準備はできていないことを示唆しています。AIができることと、人間ができることの間には、依然として大きな隔たりがあります。著者らは、これらのモデルがより大きく、より賢くなるにつれて、より有能になる可能性がある一方で、早すぎる導入はリスクを伴うと警告しています。今のところ、MissionBenchは一つの現実を突きつける役割を果たしています。世界に関するあらゆる知識を持つ「脳」を持っていることが、自動的にドローンを飛ばせることを意味するわけではないのです。「空の飛び方について読む」ことから「実際に飛ばす」ことへの道のりは、まだまだ長いのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →