RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
RynnValueは、時間的距離を教師あり学習のターゲットとして用いることで数百万の指示条件付きクリップへとスケールアップし、評価において選好ベースの手法を凌駕するとともに、明示的な報酬や進行状況のアノテーションを必要とせずに実世界のポリシー成功率を大幅に向上させる、オープンソースのロボット・バリュー基盤モデルである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに料理の仕方を教えようとしている場面を想像してみてください。レシピを与える代わりに、ただ「上手くやって!」と言って、あとはロボットが自分で理解することを期待するのです。これは、エンジニアが機械に物理的な世界での動きや相互作用を教えようとする科学の一分野、「ロボット学習」の世界です。最大の障害は、通常ロボットの「脳」(動く能力)ではなく、「報酬」です。AIの世界において、「報酬」とは、ロボットに対して「よくできました!」と言ったり、「次はこうしてみて」と伝えたりする、スコアカードやハイタッチのようなものです。問題は、あらゆる動作に対して完璧なスコアカードを与えることは非常に困難であるということです。スコアカードが曖昧すぎると、ロボットは混乱します。逆に、特定のタスクに特化しすぎると、ロボットは新しいことを何も学べなくなります。科学者たちは、人間がすべての試行に対して手動で採点する必要のない、「汎用的な」スコアカードを作ろうとしてきましたが、その方法を見つけるのに苦戦してきました。
ここで、「RynnValue」と呼ばれる新しいアイデアが登場します。これは、ロボットのパフォーマンスを採点するための新しい方法だと考えてください。「ゴールまであとどれくらいですか?」(ゴールがタスクごとに異なる場合、測定が難しいため)と聞く代わりに、RynnValueは「完了するまであとどのくらいの時間が残っていますか?」と問いかけます。これは、ロボットの道のりをカウントダウンタイマーのように扱うものです。ゴールから遠いときはタイマーが高く、ゴールに近づくとタイマーは低くなります。この論文の魔法は、このタイマーを作るために、人間がボタンを押して「よくできました」と言う必要はないことを示した点にあります。単に時計を見ればよいのです。もしロボットが料理をしているビデオが10分から始まり、0分で終わるなら、コンピュータは自動的に、5分の時点ではロボットには残り5分あるということを理解できます。このシンプルなトリックにより、誰かが手動で採点することなく、コンピュータは数千時間のビデオから学習することができるのです。
問題点:「進捗」の罠
長い間、科学者たちは「進捗(プログレス)」を測定することでロボットを教えようとしてきました。例えば、ブロックを積み上げるロボットを想像してください。進捗モデルは、ロボットが10%完了したのか、50%完了したのか、あるいは90%完了したのかを推測しようとします。しかし、ここに落とし穴があります。「50%完了」という状態は、ブロックを積み上げる場合と、水を注ぐ場合では全く見た目が異なります。あるロボットは高さの面で半分まで進んでいるかもしれませんが、別のロボットは時間の面で半分まで進んでいるかもしれません。これにより、多くの異なることをできるロボットを訓練するのは非常に難しくなります。なぜなら、「進捗」の定義はタスクが変わるたびに変わってしまうからです。それは、最終的な答えが何であるかを一度も教えないまま、生徒に「あと半分だよ!」と言って数学を教えているようなものです。
この論文の著者たちは、この「進捗」というアプローチは行き止まりであると主張しています。彼らは、ロボットがどれくらい進んだかを推測しようとするのをやめ、「完了するまでの時間をカウントダウンする」べきだと述べています。彼らはこれを「時間的距離(temporal distance)」と呼んでいます。それは「コスト・トゥ・ゴー(残りコスト)」、つまりシンプルに「完了まであとどのくらいの時間があるか?」ということです。
解決策:RynnValueと魔法の時計
AlibabaのDAMO AcademyとHupan Labのチームは、「RynnValue」と呼ばれるモデルを構築しました。RynnValueは、進捗率を推測する代わりに、ロボットのビデオとテキスト指示(例:「カップをテーブルの上に置いて」)を見て、タスクが終了するまでに正確に何秒残っているかを予測します。
巧妙な点は、彼らがすべてのビデオに対して「残り5秒」と人間が書き込む必要がなかったことです。彼らはビデオファイルに既についている「タイムスタンプ」を利用しただけです。もしビデオが0:00に始まり、ロボットが0:10に終了する場合、コンピュータは0:05の時点で、ロボットには5秒残っていることがわかります。つまり、人間が手動で採点することなく、300万個のクリップを含む7,000時間以上の膨大なロボットビデオのライブラリを用いて、モデルを訓練することができたのです。これは、先生が文章を読み上げるたびに採点するのではなく、字幕付きの映画を何千本も観せることで、生徒に読書を教えるようなものです。
巧妙なトリック(とその阻止法)
「もしロボットが単に時計を見ているだけなら、それはショートカット(近道)を利用しているのではないか?」と思うかもしれません。科学者たちもこの点を懸念していました。もしビデオを順番通りに見せると、ロボットがショートカットを学習してしまう可能性があることを知っていたからです。「あ、ビデオの3フレーム目はいつも半分まで進んでいる状態だ!」とか、「もしビデオが10秒間のものなら、真ん中は常に残り5秒だ!」といった具合に。そうなると、ロボットは実際のロボットの腕を見ることなく、ビデオの位置に基づいて推測するようになってしまいます。
これを防ぐために、彼らはトレーニングにいくつかの「混沌(カオス)」を取り入れました。
- ランダムサンプリング: ビデオを一直線に見せるのではなく、ビデオからランダムな瞬間を選びました。これにより、ロボットがフレームの順序に基づいて時間を推測できないようにしました。
- シャッフル: 時にはビデオを逆再生したり、バラバラの順序で見せたりしました。もしロボットが「開始」の状態よりも前に「終了」の状態を見た場合、その「終了」の状態が実際には時間的に「より遠い」ものであると認識しなければなりません。これにより、ロボットは単なる画像の順序ではなく、実際にロボットの姿を注視せざるを得なくなりました。
- 隔離: 現在のフレームを推測する際に、次のフレームの答えを覗き見ることができないようにしました。各瞬間を独立して解決しなければならないようにしたのです。
結果:本当に機能するのか?
チームは、RynnValueを、一度も見せたことのない様々なロボットやタスクでテストしました。結果は驚くほど良好でした。
- ランキングタスク: ロボットの試行を「最高」から「最低」へとランク付けするよう求められた際、RynnValueは0.675のスコアを獲得しました。これは、人間がビデオを手動で採点していた従来の最高モデル(スコア0.655)よりも優れた結果でした。
- 実世界のロボット: 彼らはこのモデルを使い、パンをバスケットに入れたり、ヘラでステーキを動かしたりといった難しいタスクを実世界のロボットに教えました。
- RynnValueを使用した場合、オンライン学習(動きながらの学習)において、ロボットの成功率は72.5%に達しました。
- 旧来の最良の手法を用いた場合、成功率は52.5%にとどまりました。
- オフライン学習(過去の動きのデータベースからの学習)において、RynnValueは成功率を63.8%から82.5%へと向上させました。
なぜこれが重要なのか
この論文の最も刺激的な点は、ロボットを教えるために、必ずしも完璧な採点を行う必要はないことを示唆している点です。単に「いつ終わったか」を知っていればよいのです。単純で自動的な「時計」としての時間を用いることで、RynnValueはロボットの報酬に対する普遍的な言語を作り出します。それは、二本の腕を持つロボットでも、車輪を持つロボットでも、あるいは手を持つロボットでも、仕事が終わったことが分かれば、同様に機能します。
著者たちは、これがすべてのロボットの問題を即座に解決する魔法の杖ではないことも慎重に述べています。精密な位置合わせが必要な非常に難しいタスク(箱を引き出しに入れるなど)では、視覚的な手がかりが紛らわしいため、モデルが依然として苦戦することがあると指摘しています。しかし全体として、彼らは「時間的距離」が、ロボットを教えるための強力でスケーラブルな方法であることを証明しました。それは、「良い動きとは何か?」という混沌とした難しい問題を、「あとどのくらいの時間が残っているか?」というシンプルで解決可能な問題へと変えるのです。
要するに、RynnValueはロボットに成績表を与えるのではなく、ストップウォッチを与えているようなものです。それは、ロボット学習の混沌とした世界をシンプルなカウントダウンへと変え、そしてそれは、従来の方法よりも上手くいっているようです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。