← 最新の論文
💻 computer science

Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation

本論文は、最小限のインターフェースを備えた汎用的なエージェント制御を利用するゼロショット・エンボディド・エージェントが、視覚と言語のナビゲーションにおいて最大78%の成功率を達成し、産業規模のポリシーに匹敵することを示すとともに、特定のソフトウェア・ハーネスよりもモデルの選択が性能の主要な推進要因であることを明らかにしている。

原著者: Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

トースターが単にパンを焼くだけでなく、どのスライスを焼くべきかを判断し、キッチンが清潔かどうかを確認し、家を火事にするリスクを回避しながらパンをテーブルまで運ぶ方法まで考えられる世界を想像してみてください。これが**エンボディドAI(身体性AI)**の夢です。つまり、コンピュータに物理的な体(ロボットのようなもの)を与え、現実世界を自律的にナビゲートするための知能を与えることです。長い間、科学者たちは、犬を訓練するように「訓練」する(正解にたどり着くまで同じタスクを何千回も繰り返させる)、あるいは厳格な「台本」を与える(「もしドアが見えたら、それを開ける」といった人間が書いたルールのリストを与える)ことで、これらのロボットを教えようとしてきました。しかし、もし超高性能なコンピュータにカメラといくつかの基本的なボタンを与え、「キッチンを探して」と伝え、あとは自力で解決させることにしたらどうなるでしょうか? それが、この論文が投げかける大きな問いです。特別なロボット専用のトレーニングを受けていない汎用AIが、ハンドルを握って家の中を自走できるのでしょうか?

この研究の背後にある研究者たちは、シミュレーション上の家の中でデジタルロボットを使用して、このアイデアをテストすることに決めました。彼らはナビゲーションに使われる洗練されたツールをすべて取り除きました。マップも、GPSも、あらかじめプログラムされた経路も、特別な「ロボットの脳」のためのトレーニングもありません。その代わりに、彼らはAIに、目の前の景色だけを見る一台のカメラ(人間が覗き穴から覗いているような状態)と、4つの単純なコマンド(前進、左に曲がる、右に曲がる、停止)を与えました。そして、AIに対し、「プールの横を通り過ぎ、バーと椅子の間を通り、角で止まって」といった複雑な音声指示に従うよう求めました。目標は、AIが真の「エージェント(代理人)」、つまり人間の手を借りることなく、観察し、思考し、行動し、そして自らの間違いを修正できる意思決定者として機能できるかどうかを確認することでした。

結果は驚くほど刺激的でしたが、同時に謙虚な教訓も与えてくれました。チームは、これらの「ゼロショット」エージェント(これまでロボットを見たことがない存在)が、実はかなりうまくナビゲートできることを発見しました。fable-5と呼ばれる強力なAIモデルを使用することで、ロボットはマップや特別なトレーニングがないにもかかわらず、標準的なテストにおいて**78%**の確率で目的地に到達することに成功しました。これは、何百万もの事例に基づいて訓練された高価な産業用ロボットの性能に匹敵するものであり、非常に大きな成果です。これは、特別なソフトウェアが周囲にあるのではなく、むしろ「脳」そのものが主要な役割を果たしていることを示唆しています。

しかし、この論文も明確な境界線を引いています。AIは短距離の移動には優れていますが、旅が長くなるとつまずき始めます。もしタスクが多くの部屋を通り抜けたり、5分前にどこにいたかを記憶したりすることを要求する場合、成功率は**26%から39%**の間へと急激に低下します。AIは目にしたすべてのことを記憶しなければならないため混乱し、その「記憶」が容量オーバーになってしまうのです。さらに、研究者がこのAIを実物の物理的なロボット犬に適用しようとしたところ、AIは完璧に推論はできましたが、自分の体がどれだけのスペースを占有しているかを理解していなかったため、壁に衝突し続けました。AIは「どこへ」行くべきかは分かっていましたが、「どのように」ドアを通り抜けるかを知らなかったのです。

結局のところ、この論文は私たちが新しい時代の入り口に立っていることを示唆しています。あらゆるタスクに対して新しい特別なロボットの脳を構築する必要はなく、既存の超高性能なAIに制御権を与え、あとは彼らが自身の記憶を管理し、自身の身体を理解するための適切なツールを与えるだけでよいのかもしれません。それは、あなたのロボットが単に命令に従うだけでなく、自らの冒険を自ら切り拓いていく日のための第一歩なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →