← 最新の論文
🤖 AI

Decoupling Planning and Control for Instructable Agents

本論文では、視覚言語モデルによる高レベルのプランニングと、高速で言語条件付きのワールドモデルコントローラーを組み合わせることで、多様なシングルエージェントおよびマルチエージェント環境において堅牢かつ低遅延なエンボディド制御を実現する、デカップルされたフレームワークであるInstruct-to-Actを導入する。

原著者: Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

公開日 2026-08-28
📖 1 分で読めます☕ さくっと読める

原著者: Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界には、「考えること」と「行うこと」の間に根強い隔たりが存在します。一方には、複雑な指示を読み取り、目標を理解し、それを論理的な手順へと分解できる能力を持つ大規模言語モデルがあります。これらのモデルは、人間が道案内をする時のように、高レベルの推論には非常に優れていますが、現実世界や仮想世界をナビゲートするために必要な、瞬時の物理的動きを行うには、あまりに遅く、不器用すぎることが多々あります。もう一方には、周囲の状況に即座に反応し、スピードと精度を持って動くことができる特化型の制御システムがあります。しかし、それらは抽象的な目標を理解したり、会話に従ったりする能力を欠いています。それらは、走ることは速いが、コーチが具体的な命令を叫ばない限りどこへ行けばよいのか分からない、非常にスキルの高いアスリートのようなものです。ロボットやデジタルエージェントが、複雑で変化する環境において真に有用であるためには、「計画する能力」と「行動する能力」の両方が必要ですが、これら二つの異なる能力を組み合わせることは、歴史的に困難なエンジニアリング上の課題となってきました。

ある研究チームは、「Instruct-to-Act」と呼ばれる新しいシステムによって、この隔たりに対処し、計画の役割と制御の役割を分離することに成功しました。一つの巨大なモデルにすべてを一度に行わせようとするのではなく、彼らは二つの特化したコンポーネント間のパートナーシップを構築しました。一つ目は「プランナー(計画者)」であり、これは学習済みの視覚言語モデルを使用して環境とユーザーの目標を観察し、単純で高レベルな指示を書き出します。二つ目は「コントローラー(制御器)」であり、これは指示を受け取り、それを迅速な物理的アクションのストリームへと変換することに特化して訓練された軽量なシステムです。この革新的な点は、これら二つの部分が独立しながらも同期して動作することにあります。プランナーは時間をかけて考え、推論し、他のエージェントとコミュニケーションを取ることさえできますが、コントローラーはプランナーがすべての思考を終えるのを待つことなく、高速で必要な動きを実行します。この設計により、システムはビデオゲームやシミュレーションの世界において、従来の試みでは到達できなかったレベルのスピードと信頼性をもって、複雑で長期的なタスクを処理することができます。

研究者たちは、古典的なアーケードゲームから、複数のエージェントが協力して取り組む複雑な協調シナリオに至るまで、7つの異なる環境でこのアプローチをテストしました。これらのテストにおいて、プランナーは「脳」として機能し、世界を観察して次に何をすべきかを決定し、コントローラーは「手足」として機能し、リアルタイムで計画を実行します。コントローラーにこれらの指示に従う方法を教えるために、研究者たちは人間のエキスパートによるあらゆる動きのデモンストレーションには頼りませんでした。代わりに、プランナー自身を使ってコントローラーの成功したアクションを振り返り、そこで何が起きていたかの要約を記述させました。このプロセスにより、コントローラーは曖昧な自然言語のコマンドを、精密な低レベルの動きへと翻訳する方法を学ぶことができました。その結果、このシステムは異なるプランナーと組み合わせることができ、再学習を必要としないため、非常に高い柔軟性を備えています。

研究結果は、この役割の分離が極めて効果的であることを示しています。大規模言語モデルから直接アクションを生成しようとする他の手法と比較したところ、彼らのアプローチは大幅に高速かつ正確でした。直接生成を行う手法は、実行が遅すぎたり、直前の状況に対して無関係なアクションを生み出したりして、しばしば躓いていました。対照的に、Instruct-to-Actシステムは、複雑な指示に従いながらも、高い実行速度を維持しました。複数のデジタルキャラクターがパズルを解くために連携しなければならないマルチエージェントのテストでは、システムは言語を通じてコミュニケーションを取り、役割を交渉し、互いの邪魔をすることなく共通の目標を達成することを可能にしました。システムはテストされた7つの環境のうち6つにおいて、既存の最強の手法に対して競争力のあるパフォーマンスを示し、分離されたアプローチが、高レベルの推論と低レイテンシの制御の両方の要求に対処できることを証明しました。

この研究の最も驚くべき側面の一つはその効率性です。コントローラーは小さく特化したモデルであるため、視覚情報を処理してアクションを発行することを毎秒数千回行うことができます。一方で、プランナーはバックグラウンドで動作し、必要に応じて戦略を更新します。これは、システムが大規模言語モデルの遅い処理時間に足を取られることがないことを意味します。研究者たちは、この非同期の設定によって、エージェントを効果的にスケールアップできることを見出しました。協調タスクにエージェントを追加しても、他のマルチエージェントシステムを悩ませるような通信のボトルネックが発生することなく、性能を維持できました。コントローラーは信頼性を保ち、異なるタスクやプランナー間で86%から97%の精度で指示に従い、システムが単に特定のフレーズを暗記するのではなく、言葉の背後にある意図を理解することを学んだことを実証しました。

また、本研究では、指示の質が結果にどのように影響するかについても調査しました。彼らは、指示が異なるプランナーによって生成されたものであっても、あるいは複雑さが異なっていても、コントローラーは適応して良好に機能することを発見しました。これは、システムが単に特定のコマンドセットを記憶しているのではなく、言語を解釈するための堅牢な方法を学習していることを示唆しています。研究者たちは、指示が明確で、直近の状況に基づいている場合にシステムは最もよく機能するが、それでも従来のメソッドよりは曖昧さを扱うことができると指摘しました。計画層と制御層を分離しておくことで、研究者たちは強力であるだけでなく、モジュール性も備えたフレームワークを作り上げ、タスクの特定のニーズに応じて異なるプランナーやコントローラーを入れ替えることを可能にしました。

最終的に、この研究は、現実世界で動作するインテリジェントなエージェントを構築するための実用的な道筋を示しています。思考と行動には異なる速度と異なる種類の知能が必要であることを認めることで、研究者たちは両方の強みを活用するシステムを作り上げました。プランナーはビジョンと戦略を提供し、コントラーはスピードと精度を提供します。このアプローチは、単一のモデルにすべてを行わせようとする落とし穴を回避し、スマートかつ高速なシステムを実現しています。研究が進むにつれ、彼らはこのフレームワークを、人間とロボットの協働や、動的な環境における長期的な計画を必要とするタスクを含む、より複雑なシナリオに適用できると考えています。Instruct-to-Actの成功は、具現化されたAI(Embodied AI)の未来が、より巨大でモノリシックなモデルを構築することではなく、異なるタイプの知能の間で、よりスマートで効率的なパートナーシップを設計することにある可能性を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →