RIO: Flexible Real-Time Robot I/O for Cross-Embodiment Robot Learning
本論文は、多様なハードウェアプラットフォームにわたる制御とデータ処理のための柔軟かつ軽量なコンポーネントを提供することで、断片化したロボットインフラを克服し、最先端のビジョン・言語・アクションモデルの効率的なクロス・エンボディメント訓練と展開を可能にするオープンソースのPythonフレームワークであるRIOを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにシャツを畳んだり、お椀をこすったりといった家事を教えることを想像してみてください。ロボティクスの世界では、これは現在、世界中のあらゆる言語をすべて子供に教えるようなものですが、ある重要な違いがあります。ロボット(異なる「身体」や「実体」)に切り替えるたびに、そのロボットと対話する方法を完全に再学習しなければならないのです。
ある企業のロボットアームと、別の企業のカメラを持っている場合、それらを連携させるコードは往々にしてカスタム命令の乱雑な集まりになります。別のロボットアームに切り替えたい場合、単に部品を交換するだけでは済みません。多くの場合、ロボット全体の「脳」をゼロから書き直す必要があります。これにより、科学者間での進歩の共有は信じられないほど困難で遅々として進まないものになっています。
そこで登場するのが RIO(Robot I/O)です。
RIOは、ロボットのための万能翻訳機であり、モジュール式の「プラグ&プレイ」システムだと考えてください。これは軽量なソフトウェアツールキットであり、研究者がコードを毎回書き直すことなく、異なるロボット部品を自由に組み合わせて使用できるようにします。
いくつかの簡単な比喩を用いて、その仕組みを説明します。
1. 「レゴ」アプローチ(柔軟性)
レゴブロックの箱を持っていると想像してください。その中には、ロボットアーム、グリッパー(手)、カメラ、そして人間がロボットを動かすために使用するテレオペレーションコントローラーなどのブロックがあります。
- RIO がない場合: ブロックを超強力な永久接着剤でくっつける必要があります。アームを変更したい場合、全体をバラして最初からやり直さなければなりません。
- RIO を使う場合: ブロックには標準的なコネクタが付いています。「Franka アーム」を「Robotiq グリッパー」に、あるいは「VR ヘッドセット」を「ヒューマノイドロボット」に、設定ファイルを変更するだけでスナップ接続できます。中核となるロジック(ロボットに何をするか指示する「脳」)は全く同じまま、変化するだけなのは「身体」です。
2. 「万能電源タップ」アプローチ(ミドルウェア)
ロボットは互いに光速で通信する必要があります。通常、異なる部品は異なる「言語」(プロトコル)で話します。
- RIO の解決策: これはスマートな電源タップや万能アダプターのように機能します。ロボットのハードウェアとソフトウェアの間に位置します。高速な共有メモリ接続(同じ部屋で直接囁き合う二人のようなもの)を使用している場合でも、ネットワーク接続(インターネット越しに話すようなもの)を使用している場合でも、RIO は自動的に翻訳を処理します。つまり、通信方法を変更しても、ロボットのコードを変更する必要はありません。
3. 「テレオペレーション」のリモコン
ロボットを教えるために、人間はしばしばそれを「テレオペレーション」します。つまり、コントローラーを装着し、自分の手でロボットを動かすのです。
- RIO は、シンプルなキーボードやゲームパッドから、Apple Vision Pro などのハイテク VR ヘッドセット、人間の動きを模倣する専用ロボットアームに至るまで、膨大な種類のコントローラーをサポートしています。
- 論文では、コントローラーとロボットの身体を交換するだけで、単一のロボットアーム、二腕ロボット、あるいは歩き回るフルサイズのヒューマノイドロボットを、同じソフトウェアで制御できることが示されています。
4. 「スマート配送ドライバー」アプローチ(推論)
ロボットが訓練されると、(カップを掴むなど)意思決定を行い、移動する必要があります。これを「推論」と呼びます。
- RIO は高速に設計されています。「考えること」(AI モデルの実行)と「行うこと」(モーターへのコマンド送信)を分離しています。
- 論文では、RIO を人気のある別のシステムであるLeRobotと比較しています。その結果、カメラからロボットの手にコマンドを伝達する速度において、RIO は LeRobot よりもはるかに高速であることが判明しました。
- LeRobot: 約581 ミリ秒(ロボット速度からすれば長い時間)。
- RIO: わずか130 ミリ秒。
- 比喩: LeRobot が郵便で手紙を送るようなものなら、RIO はテキストメッセージを送るようなものです。この速度は、トウモロコシの皮を剥ぐことやボールを投げるなど、一瞬の遅延が失敗につながる動的なタスクにおいて不可欠です。
彼らは実際に何をしたのか?
著者たちは単にツールを構築しただけでなく、実世界でそれをテストしました。彼らは RIO を用いて以下のことを行いました。
- 人間がロボットを操作して家事(シャツを畳む、お椀をこする、箱を拾うなど)を実行するデータを収集しました。
- このデータを用いて、π0.5やGR00Tなどの高度な AI モデルを訓練しました。
- これらの訓練済みモデルを、3 つの非常に異なるタイプのロボットにデプロイしました。
- 単一腕ロボット(標準的な工場用アームなど)。
- 二腕ロボット(二つの腕を持つロボット)。
- ヒューマノイド(人間のように見え、歩くロボット)。
彼らは、これらのロボットが服を畳んだり、物体を拾ったり、さらには歩いたりすることに成功しました。これにより、同じソフトウェアスタックが全く異なるハードウェアを駆動できることが実証されました。
結論
この論文は、ロボット学習における最大のボトルネックは、単にデータが不足していることや AI モデルが劣っていることではなく、インフラにあると主張しています。科学者たちは現在、新しいロボットごとにカスタムな「配線」を構築することに、あまりにも多くの時間を浪費しています。
RIOは、この「配線」を一度きりで提供する無料のオープンソースツールです。これにより、ロボティクスコミュニティは車輪の再発明を止め、ロボットがどのような外見を持とうとも、より複雑で有用なことを教えることに焦点を当てることが可能になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。