← 最新の論文
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLAは、ナビゲーションとマニピュレーションを共通のアクションヘッドを持つ単一のアーキテクチャへと統合し、マルチステージのプログレッシブな学習戦略を用いることで、汎用的なロボットエージェントの開発を推進するために、シミュレーションおよび実世界の環境の両方において最先端の性能を達成する統一されたフレームワークを導入します。

原著者: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたにはロボットの助手がいるとします。これまでは、このロボットを作ることは、2人の別々の専門家を雇うようなものでした。一人は「歩行(ナビゲーション)」のエキスパートですが、手先の使い方は全くダメな人。もう一人は「シェフ(マニピュレーション)」の達人ですが、材料を取りに部屋を横切って歩くことができない人です。もしあなたがロボットに「キッチンへ歩いて行き、カップを電子レンジに入れる」という指示を出したい場合、これら2つの異なる「脳」や、2つの別々のモデルを切り替えなければなりませんでした。

この論文は、OneVLAを紹介しています。これは、歩行と手先の使い方の両方に自然と長けている、いわば「十徳ナイフ」のような従業員を一人雇うようなものです。

その仕組みを簡単に解説します:

1. 「ユニバーサル・リモコン」(統合アクションヘッド)

ほとんどのロボットは、仕事ごとに異なる「リモコン」を持っています。あるリモコンには、前進したり左に曲がったりするためのボタンがあります。別のリモコンには、ロボットのアームを上下させたり、ひねったりするためのスライダーがあります。

OneVLAは、単一のユニバーサル・リモコンを作成しました。

  • それは、歩行用のボタンとアーム用のスライダーを、一つの長いコントロール・ストリップ(操作帯)にまとめます。
  • ロボットが「ドアへ行け」という指示を受け取ると、ストリップ上の「歩行ボタン」だけを押します。
  • ロボットが「カップを手に取れ」という指示を受け取ると、「アームのスライダー」だけを動かします。
  • 魔法のポイント: ロボットは脳やリモコンを入れ替える必要はありません。タスクに基づいて、リモコンのどの部分を使うべきかを理解しているだけなのです。

2. 「3段階のトレーニングキャンプ」(マルチステージ戦略)

ロボットをいきなり複雑な世界に放り込んでも、すぐにすべてを理解できるとは限りません。著者らは、生徒が学校を進級していくように、OneVLAを3つの特定のフェーズで訓練しました。

  • ステージ1:手使いの学習。 まず、ロボットにロボットアームを使って物を掴み、持ち上げ、置く方法を教えました。また、画像を見てそれを説明する方法も教えました(これにより、世界を理解できるようになります)。
  • ステージ2:歩行の学習。 次に、ナビゲーションのデータを追加しました。これで、ロボットは地点Aから地点Bへ移動する方法を学びます。ステージ1ですでに「見る」ことと「考える」ことを学んでいるため、より速く、より賢く歩行を学習できます。
  • ステージ3:思考の言語化(Chain-of-Thought)の学習。 最後に、ロボットに自分の思考プロセスを「声に出して」伝える方法を教えました。動く前に、ロボットは自分自身にこう言います。「私は廊下にいます。キッチンに行くために右に曲がる必要があります」。このステップにより、ロボットは「何を見ているか」「何をすべきか」「どう動くべきか」の間の点と点を結びつけることができます。

3. 結果:2つのスキル、1つの脳

この論文は、これら2つのスキルを一緒に訓練することで、実際にお互いを高め合えることを主張しています。

  • 例え話: バスケットボールもするサッカー選手を想像してみてください。バスケットボールのドリブルを学ぶこと(マニピュレーション)は、足さばきやバランス感覚を向上させ、それがサッカー場での走行(ナビゲーション)に役立つかもしれません。
  • 証明: テストにおいて、この単一のロボット(OneVLA)は、歩行のみに特化したロボットや、手先の使いのみに特化したロボットよりも優れた成績を収めました。また、両方をこなそうとしながらも、依然としてタスクごとに別々の「モード」や設定を必要とする他の「ハイブリッド」ロボットよりも優れていました。

まとめ

OneVLAは、歩いたり、何かを掴んだりする際に、再プログラミングを必要としない新しいタイプのロボットの脳です。言語を理解し、世界を視覚化し、足と手の両方を制御するために、一つの統合されたシステムを使用します。著者らは、これらのスキルを一緒に教えることが、個別に教えるよりもロボットをより賢くすることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →