Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
Dynin-Roboticsは、言語、視覚、および行動を離散的なトークンとして扱い、目標予測、ダイナミクスモデリング、および行動生成を共同で学習することで、共有された軌跡モデリングとテスト時スケーリングを通じて複数のベンチマークで競争力のある性能を達成する、オムニモーダルな統合拡散モデルを導入しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットは、人間と同じように世界を理解することに長い間苦労してきました。機械は腕を特定の座標に動かすようプログラムすることはできますが、「パッケージを切るためのものを手渡して」といった曖昧な指示を理解する必要がある場面では、しばしば失敗します。これを解決するために、研究者たちは言語、視覚、そして物理的な動きを単一の「脳」へと結びつけるシステムを構築しています。ビジョン・ランゲージ・アクション(視覚・言語・行動)モデルとして知られるこれらのシステムは、単に物体が何であるかだけでなく、それがどのように振る舞い、どのように操作されるべきかを学習しようとしています。これまでの課題は、ほとんどの現在のアプローチがこれらのスキルを別々に扱っていたことです。システムのひとつの部分は言葉を理解し、別の部分は画像を認識し、また別の部分は運動コマンドを計算するという具合です。この分離により、現実の世界が変化したり、指示が予想外の言い回しで提示されたりすると、ロボットは混乱してしまうことがよくありました。
ソウル大学の研究チームは、これらの分離されたスキルを一つのまとまったモデルへと統合する「Dynin-Robotics」と呼ばれる新しいアプローチを導入しました。ロボットの脳に異なるタスク用の異なるモジュールを構築する代わりに、彼らは一度に複数の方法で未来を予測することを学ぶ単一のシステムを作り上げました。想像してみてください。タスクを与えられたとき、単に次の動きを計算するだけでなく、その動きの後にシーンがどのようになるか、最終的なゴール状態はどうあるべきか、そしてそのタスクを言葉でどのように説明すべきかを想像できるロボットを。これらすべての予測を同時に処理するように単一のモデルを訓練することで、研究者たちは、たとえ指示が訓練時とは異なる言い回しであっても、ロボットが指示に従う能力が大幅に向上することを発見しました。
このシステムの核となるのは、「マスク付き拡散(masked diffusion)」と呼ばれる手法です。簡単に言えば、これはモデルに対して、タスクのビデオ、書かれた指示、そしてロボットの動きといった情報のシーケンスを見せるものの、そのシーケンスの一部を隠したり「マスク」したりする学習プロセスです。モデルの役割は、見える部分を見て、隠された部分がどうあるべきかを推測することです。例えば、コップの画像と「コップを持ち上げる」という言葉は見えているが、動きのデータが隠されている場合、モデルは正しい動作を予測しなければなりません。別のシナリオでは、動きと指示は見えているが、手の中にあるコップの最終的な姿が隠されている場合、モデルは結果を予測しなければなりません。130万件以上のロボットの軌跡を含む膨大なデータセットを用いて、これらの異なる種類の「推測ゲーム」を練習することで、モデルは言語、視覚、そして行動がいかに結びついているかについての深い理解を学習します。
このアプローチをユニークにしているのは、同じモデルが瞬時にこれらの異なる役割を切り替えられる点です。モデルは、次に取るべき行動を決定する「ポリシー(方策)」として、あるいは、アクションの後にカメラが何を見るかを予測する「ワールドモデル」として、あるいは、最終的な成功状態を可視化する「ゴール予測器」として、さらには、ロボットが作業しているビデオから元の指示を再構成する「教師」として機能することができます。この柔軟性により、システムは自身の予測を利用してパフォーマンスを向上させることができます。例えば、ロボットは腕を動かすことを決定する前に、まずゴール状態がどのようなものかを予測できます。そして、その予測されたゴールをガイドとして使い、アクションプランを洗練させます。このように先を見通し、リアルタイムで計画を調整するプロセスによって、花を花瓶に挿したり、ブロックを特定の順序で積み重ねたりといった、精密な整合性を必要とする複雑なタスクをこなすことができます。
研究者たちは、他の主要なロボットモデルと比較してどの程度の性能を発揮するかを確認するために、さまざまなベンチマークでこのシステムをテストしました。標準的なシミュレーションタスクにおいて、このモデルは98.1%の成功率を達成し、この分野のトップパフォーマーの一角に食い込みました。より重要なことに、指示がより間接的または抽象的に変更されたタスクにおいて、システムは顕著な適応能力を示しました。ある実験セットでは、モデルは「アップルを手に取って」という直接的なコマンドではなく、「自然に甘くてジューシーなもの」といった記述に基づいて果物を選ばなければならないタスクでテストされました。他のモデルはこうした言語の変化に苦戦しましたが、Dynin-Roboticsは高い成功率を維持し、特定のフレーズを単に暗記したのではなく、タスクの根本的な概念を学習したことを証明しました。
このシステムは実世界でも効果的であることが証明されました。研究者たちは、Franka Research 3として知られる物理的なロボットアームにこのモデルを配備しました。果物を拾う、色付きのキューブを仕分ける、そしてそれらを特定の順序で積み重ねるといった一連の実世界テストにおいて、ロボットは4つの操作条件下で平均78.4%の成功率を達成しました。このパフォーマンスは、ユーザーが指定した色の順序でキューブを積み重ねるといった、一連のステップに従う必要があるタスクにおいて特に強力でした。ゴールと中間ステップを可視化する能力により、ロボットはミスをした場合にコースを修正することができ、これはより単純なシステムでは欠落していることが多い機能です。
ロボットを制御する能力を超えて、このモデルは記述を理解し生成するという驚くべき能力も示しました。ロボットがタスクを実行しているビデオを見せられると、システムは「取る」「置く」「折る」といった動詞を用い、物体の色や位置を特定しながら、何が起きているかを正確に説明することができました。逆に、タスクの記述を与えられると、最終的なシーンがどのように見えるかの視覚的な予測を生成することができました。これらの能力は、モデルが単なる運動制御を超えた、物理的世界に関する豊かで内部的な表現を構築していることを示唆しています。
このシステムをリアルタイムで使用できるほど高速にするために、研究者たちはモデルを実行するための特殊な手法も開発しました。モデルは推測を反復的に洗練させることで機能するため、もしすべてのステップを一つずつ処理しなければならないとすれば、動作は遅くなります。チームは、モデルが複数のステップの動きを同時に予測し、確定できる技術を作成しました。この最適化により、ロボットの意思決定プロセスは標準的な手法と比較して約30倍高速化され、物理的なロボットのスピードに追いつくことができるハードウェア上で複雑なモデルを実行することが可能になりました。
この研究の成果は、ロボット学習を統一された予測問題として扱うことが強力な戦略であることを示唆しています。言語を理解し、視覚的な変化を予測し、行動を生成する能力を単一のフレームワークに組み合わせることで、研究者たちは以前のモデルよりも堅牢で適応性の高いシステムを作り上げました。Dynin-Roboticsの成功は、ロボットが未来を想像し、タスクの文脈を理解することができれば、現実世界の予測不可能な性質に対処する能力が格段に高まることを示しています。より長く複雑な一連の動作へとこれらの能力を拡張することなど、まだ取り組むべき課題は残っていますが、このアプローチは、真に環境を理解し相互作用できるロボットへの有望な道筋を提示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。