← 最新の論文
🤖 AI

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

本論文は、サイバー・フィジカルなプランニング、適応型メモリ、および視覚的検証を統合した階層的非同期フレームワークであるOmniActを提案し、これにより、非定型な環境において、物理的な失敗に対する効率性と堅牢性を維持しながら、持続的なエンボディド・エージェントが複雑で長期的なタスクを自律的に実行することを可能にする。

原著者: Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

公開日 2026-06-26
📖 1 分で読めます☕ さくっと読める

原著者: Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、人間が常に付き添うことなく、数週間あるいは数ヶ月間、家の中で暮らし、日々の家事を手伝ってくれるロボットを作りたいと考えていると想像してください。これが「エンボディド・エージェント(身体性を持つエージェント)」の目標です。しかし、現在のロボットは「不器用なインターン」のようなものです。一つのことはうまくこなせても、混乱が生じると、一日中ミスを繰り返して台無しにしてしまいます。また、記憶力も最悪です。一時間前に言われたことを忘れてしまうか、あるいは一日のあらゆる瞬間をすべて記憶しようとして、情報過多でフリーズしてしまいます。

この論文は、これらの不器用なインターンを、信頼できる長期的な家庭管理者に変えるために設計された新しいフレームドワーク「OmniAct」を紹介しています。OmniActを、単一の超高性能な脳としてではなく、高度に効率化された「マネジメント・チーム」として考えてください。そこでは、3つの専門的な役割が連携して働いています。

3つの専門的な役割

1. マスター・プランナー(「プロジェクト・マネージャー」)
ほとんどのロボットは、「デジタル」なタスク(オンラインで食事を注文したり、スマートライトを点けたりすること)と、「物理的」なタスク(コップを手に取ったり、椅子を動かしたりすること)を、全く別の仕事として扱ってしまうため、苦戦します。

  • 例え: IT部門と建設現場のスタッフに同時に指示を出せないマネージャーを想像してみてください。そのマネージャーは、メモを書き、ITオフィスまで歩いて行き、返事をもらい、また戻ってきてから建設現場の人に話さなければなりません。これでは時間がかかり、ミスも起きやすくなります。
  • OmniActの解決策: プランナーは統一された言語を話します。それは、「スマートライトをつける」(デジタル)と「本を手に取る」(物理)といったコマンドを、一つのスムーズな流れの中にシームレスに混ぜ合わせることができます。単に推測するのではなく、大きな複雑なリクエスト(例:「何か軽食を持ってきて」)を、明確で実行可能な小さなステップのリストへと分解します。

2. スマート・メモリー(「ファイリング・システムを持つ司書」)
もしロボットに、これまで話したすべてのことを覚えておくよう頼んだら、最終的に容量不足に陥るか、もはや重要ではなくなった古い指示によって混乱してしまうでしょう。

  • 例え: 10時間の会話の内容を、話されたすべての言葉の書き起こしを読み返すことで思い出そうとしている状況を想像してみてください。ノイズの中に迷い込んでしまうでしょう。より良い方法は、会話の「章(チャプター)」だけを書き留める司書を持つことです。
  • OmniActの解決策: OmniActは、すべての生のビデオフレームや言葉を保存する代わりに、「イベント・バウンダリー圧縮(境界圧縮)」を使用します。タスクの完了や部屋の移動といった「章の区切り」を待ち、そこで何が起きたかを簡潔で整ったノートへと要約します。これにより、たとえ数日間稼働した後でも、重要な長期的なルール(例:「砂糖は嫌いです」)を忘れることなく、ロボットのメモリを軽量かつ高速に保つことができます。

3. セーフティ・モニター(「スポッター/見守り役」)
現在のロボットは、多くの場合「オープンループ(開ループ)」で動作しています。つまり、タスクを開始したら、あとはうまくいくことを祈るだけです。もしコップを落としても、彼らはそれが起きたことに気づかず、次のステップに進もうとして、事態をさらに悪化させます。

  • 例え: 目隠しをした人が部屋を横切ろうとしているようなものです。もし躓いたとしても、自分が転んだことに気づかないため、そのままよろめきながら進み続けてしまいます。
  • OmniActの解決策: このシステムには「ビジュアル・プリエンプション・エンジン(視覚的先制エンジン)」が備わっています。ロボットが作業している間、別の「スポッター(カメラとAI)」が定期的にチェックを行います。もしスポッターが、ロボットがコップを落としたり、行き詰まったりしているのを見つけると、即座に「ストップ!」と叫び、プランナーを起こしてミスを修正させます。これにより、災難を単なる「寄り道」へと変えることができます。

実世界でのパフォーマンス

研究者たちは、2種類の異なるロボット(テーブルの上にある人間の腕のようなロボットアームと、部屋を動き回ることができるルンバのような移動式ロボット)を用いてOmniActをテストしました。彼らは、物理的な動作とデジタルツール(窓を開けるかどうかを決めるために天気アプリをチェックするなど)を組み合わせた、40種類の困難な長期的タスクを与えました。

  • 高い成功率: OmniActは、従来の手法よりもはるかに高い頻度でタスクを完了しました。他のロボットが失敗する場合、通常は完全に失敗してしまいますが、OmniActはミスから回復して継続することができました。
  • 効率的なメモリ: 他のシステムは、膨大なデータ(10万語以上の履歴)を保存する必要があり、それが動作を遅らせていましたが、OmniActはタスクの期間に関わらず、グラフ上の直線のように低く安定したメモリ使用量を維持しました。
  • 小型モデルの強化: 最も驚くべき発見の一つは、OmniActを使えば、中規模のAIモデル(より安価でパワーの低いもの)を使って、最も高価で最高級のプロプライエタリ・モデルと同等の性能を発揮できるということでした。これは、優れた「構造(3つの役割によるチーム)」を持つことが、単に「より大きな脳」を持つことよりも重要である場合が多いことを証明しています。

結論

OmniActは、私たちと共に暮らし、現実世界の混沌に対処できるロボットを作るためには、一つの巨大で完璧な脳は必要ないということを示しています。代わりに、計画、記憶、安全確認を分離した「階層的なチーム」が必要です。これらの専門化されたパーツを互いに連携させることで、ロボットは回復力と効率性を備え、人間の介入なしに複雑で長期的な仕事をこなすことが可能になるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →