RLDX-1 Technical Report
本論文は、多様なモダリティと特化されたシステム設計を統合し、複雑で接触を伴う動的な実世界の器用な操作タスクにおいて既存のビジョン・言語・アクションモデルを大幅に凌駕する、マルチストリームアクショントランスフォーマー(MSAT)アーキテクチャに基づく汎用ロボティクスポリシー「RLDX-1」を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが、指示を読み、画像を見て、非常に優れた能力を持つロボットを構築したと想像してください。それは「カップ」が何か、「注ぐ」とはどういう意味かを理解し、それについて流暢に話すことができます。これは、理論的には博士号を持っているが、現実世界での経験が全くないロボットのようなものです。もし、コンベアベルト上を動くボールをキャッチするように頼んだり、割らずに電球をねじ込むように頼んだりすると、運動、記憶、あるいは触覚を理解していないため、ロボットは固まってしまうかもしれません。
この論文は、この問題を解決するために設計された新しいロボットの「脳」であるRLDX-1を紹介しています。RLDX-1 を単なる賢い読者ではなく、既存の知能に 3 つの新しいスーパーパワーを組み合わせた熟練職人として考えてください。
1. スーパーパワー:運動、記憶、触覚
- 運動認識(「大道芸人」):
ほとんどのロボットは静止画を見て次に何をすべきか推測します。しかし、現実世界は動いています。もし箱がコンベアベルトの上を滑っているなら、静止画は役に立ちません。RLDX-1 は、ボールを見るだけでなく、空中を飛ぶボールの動画全体を見ている大道芸人のようなものです。速度と方向を理解しているため、他のロボットが見逃す動く物体をキャッチすることができます。 - 長期記憶(「シャーロック・ホームズ」):
一部のタスクには時間がかかります。人間が 3 つのカップのいずれかの下に立方体を隠し、立ち去ってからロボットにそれを見つけるよう頼む、貝殻ゲームを想像してください。「短期記憶」しかないロボットはカップを見ますが、人間がどのカップに触れたかを忘れます。RLDX-1 は数秒前や数分前に何があったかの「ノート」を保持します。出来事の順序を記憶しているため、過去を振り返る必要があるパズルを解くことができます。 - 物理的感知(「優しい手」):
視覚は優れていますが、ソケットの内部を見ることも、壊れやすい卵をどのくらい強く握っているかを感じることもできません。RLDX-1 はセンサーを通じて「感じることができます」。関節内のトルク(ねじり力)と、皮膚からの触覚信号を読み取ります。これは、プラグがソケットに収まった瞬間や、卵が割れそうになった瞬間を正確に判断し、即座に握力を調整する、目隠しをした人のようなものです。
2. 訓練:どのように学んだか
ロボットにこれらのスキルを教えるには、いくつかの動画を見せるだけでは不十分です。RLDX-1 は3 段階の訓練キャンプを経験しました。
- 第 1 段階:ゼネラリスト(事前学習):
腕、手、ヒューマノイドなど、さまざまなロボットが単純なことをする何百万もの動画を見ました。これにより、世界がどのように機能するかについての広範な理解を得ました。 - 第 2 段階:スペシャリスト(中間学習):
ここで、新しいスーパーパワーを学びました。「運動」、「記憶」、「触覚」のモジュールに特化して練習しました。そのために、研究者たちは巧妙なトリックを使用しました。AI 動画生成器を使って、存在しないキッチンでロボットがスープを注ぐなど、数千もの新しい稀なシナリオを作成し、数学を用いてロボットが何をすべきだったかを計算しました。これにより、実世界データが不足している部分を埋めました。 - 第 3 段階:洗練(事後学習):
最後に、特定の現実世界のタスクで練習し、自分の間違いから学びました。カップを拾うのに失敗したら、もう一度試しました。これは即座にフィードバックを与えてパフォーマンスを向上させるコーチのような役割を果たす強化学習手法を用いて行われました。
3. 速度:高速トラックでの走行
最も賢い脳でも、遅すぎれば無意味です。ロボットが考えるのに 0.1 秒かかる場合、行動する頃には世界が変わっているかもしれません。この論文は、RLDX-1 が標準的なシステムよりも1.6 倍高速に動作するように最適化されたことを説明しています。
- 比喩: 標準的な処理は、地図を確認するためにすべての信号で止まる配送ドライバーを想像してください。RLDX-1 は、ルート全体を事前にマッピングし、どの信号がいつ青になるかを正確に知っており、止まらずに走り抜けるドライバーのようなものです。これにより、高速で動く組立ラインであってもリアルタイムで反応することができます。
4. 結果:結果がすべてを語る
研究者たちは、RLDX-1 を他のトップクラスのロボット脳( や GR00T N1.6 など)と、2 つの方法で比較テストしました。
- シミュレーション内(ビデオゲーム):
RLDX-1 は、複雑なキッチンタスクや動く物体の課題において、他のロボットを一貫して凌駕しました。 - 現実世界(テスト):
- コンベアベルト: 物体が高速で移動している場合、RLDX-1 は**87.5%**の成功率を達成しましたが、次に良いロボットはほぼ 70% の失敗率でした。
- 貝殻ゲーム: 記憶に基づいて隠された物体を見つけるよう求められた場合、RLDX-1 は**91.7%**の正解率でした。他のロボットはランダムに推測し、正解率は約 30% でした。
- 電球: 点灯するまで電球をねじ込むよう求められた場合、RLDX-1 は人間のトレーナーが実演できる回数よりも少ない試行でそれを習得しました。
まとめ
RLDX-1 は、単に「見て理解する」ことを超え、器用に行動するロボットポリシーです。強力な視覚脳を運動、記憶、触覚のための専門モジュールと組み合わせ、実世界データと AI 生成データの巨大な混合で訓練することで、以前のロボットが苦労していた複雑で動的かつ繊細なタスクにおいて、人間のようなスキルを達成します。これは、混乱し、動き回り、触覚的な現実世界で真に私たちと共に働けるロボットへの重要な一歩です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。