← 最新の論文
🤖 machine learning

RoboTTT: Context Scaling for Robot Policies

本論文は、テスト時トレーニング(Test-Time Training)を統合することで視覚運動コンテキストを8,000タイムステップまで拡張し、推論レイテンシを増加させることなく履歴を高速な重み(fast weights)へと圧縮することにより、ワンショット・イミテーション、オンザフライでの改善、および長期ホライゾン・タスクにおける著しく優れた性能を可能にするロボット・ポリシー・フレームワークであるRoboTTTを提案している。

原著者: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが、信じられないほど有能だが極端に近視眼的なシェフであるような世界を想像してみてください。彼らは、指示さえあれば、ニンジンを刻んだりバーガーをひっくり返したりすることは完璧にこなせます。しかし、複雑なケーキを一から作るように頼むと、2番目のステップに到達するまでに最初のステップを忘れてしまうことがよくあります。これが、現代のロボットの背後にあるスマートな脳である「ロボット基盤モデル」の現状です。彼らは通常、動作を行う直前に見た最後のものだけを見ているので、まるで足元の床だけを見て迷路を進もうとしているようなものです。これは単純なタスクには機能しますが、おもちゃの車を組み立てたり回路基板を修理したりするように、長い一連の出来事を記憶する必要がある場合には無残に失敗します。科学者たちは長い間、こう考えてきました。「もしロボットが、単に直前の1秒間を見るだけでなく、自分が今行ったすべてのことを記憶し、その長い記憶を使って、即座に学習し適応できたらどうなるだろうか?」と。

NVIDIA、スタンフォード大学、テキサス大学オースティン校の研究者によって開発された新しいロボットの脳、RoboTTTが登場しました。RoboTTTを、単に長いステップのリストを「記憶する」ロボットではなく、魔法のような「自己更新型のノート」を持つロボットだと考えてみてください。従来のロボットは、一度作られたら変わることのない静的な脳を持っていますが、RoboTTTには特別な「高速重み(fast weight)」システムがあります。ロボットが何か新しいものを見たり、動きを作ったりするたびに、自分の内部的な配線をわずかに書き換え、現在の状況をより良く理解できるように、即座にノートに小さなメモを書き留める様子を想像してください。これは、ロボットが作業をしている最中であっても、リアルタイムで行われます。この「ノート」を膨大な履歴(最大8,000タイムステップ、つまり高速での連続的な動作で約5分間に相当)を保持できるようにスケールアップすることで、RoboTTTは以前のロボットには夢にも思わなかったスーパーパワーを解き放ちます。それは、人間がタスクを行うのを一度見るだけで、その特定のセットアップに関する事前のトレーニングなしに、それを完璧にコピーできる能力です。また、人間がぶつかったり部品を落としたりした場合でも、自身の最近の履歴を振り返って何が間違っていたのかを判断することで、即座にミスを修正することもできます。

研究者たちは、ロボットにこのロングコンテキスト(長文脈)記憶を与えることは、単なる小さなアップグレードではなく、ゲームチェンジャーであることを発見しました。テストにおいて、RoboTTTは5分間を要する複雑な10段階の組み立てタスクを完了することができました。これは、短い記憶しか持たない最高レベルの他のロボットモデルですら決して完了できなかったタスクです。標準的なロボットは最初の数ステップで失敗しましたが、RoboTTTは、一度も見たことがない人間のビデオを模倣する「ワンショット模倣試行」において、10回中6回の成功を収めました。また、外部からの衝撃に対しては、最高の短記憶ロボットの成功率が**53%**であったのに対し、**83%**の成功率で回復しました。論文は、単にロボットの記憶を長くすることが新しいスマート化の方法であり、記憶が数秒から4分以上に増えるにつれて着実な改善が見られることを示唆しています。

RoboTTTが繰り出す最もクールなトリックの一つは、「DAgger蒸留(DAgger Distillation)」と呼ばれるものです。自転車に乗る練習をしている生徒を想像してください。もし生徒が転んだら、親が彼を捕まえ、軌道に戻るように誘導するかもしれません。通常のロボットは、その転倒を単に忘れて、また同じ間違いを繰り返しながら再び乗ろうとするだけかもしれません。しかし、RoboTTOは、その転倒と修正を一つの物語として扱います。それは、(転倒という)ミスを、(親の助けという)修正と共に振り返ることで、「このように傾いたら、あのようにハンドルを切る必要がある」と内部の「ノート」を更新し、学習します。これにより、人間が再び教える必要なく、即座に自身のパフォーマンスを向上させることができます。研究によれば、この手法を用いることで、ロボットは使用しないモデルよりも**36%**優れた回復を実現しました。

また、論文ではロボットの記憶を修正するための一般的なアイデアをいくつか否定しています。例えば、過去の画像を単に長いビデオフィードのようにロボットの脳に貼り付けることは、うまくいきません。それはむしろロボットを混乱させ、パフォーマンスを低下させます。同様に、標準的な「リカレント(再帰的)」な記憶(単に状態を更新する単純なループのようなもの)も十分ではありません。研究者たちは、鍵となるのは記憶の「更新方法」であることを見出しました。それは、単に静的な状態をシフトさせるのではなく、人間が経験から学ぶのと同様のプロセス(勾配降下法)を用いて、自身のパラメータを変化させる柔軟で非線形なシステムである必要があります。

結局のところ、RoboTTTは、ロボットの知能の未来が、単にロボットの脳を静的な意味で大きくしたり賢くしたりすることではなく、作業中に継続的に学習し適応する能力を与えることにある可能性を示唆しています。コンテキストを8,000タイムステップまでスケールアップさせることで、研究者たちは、ロボットがより堅牢になり、長く複雑なタスクを処理でき、さらには一度の人間によるデモンストレーションから学習できることを示しました。論文は、これらのモデルのトレーニングにはコストがかかり、あらゆる失敗に対処できるわけではないと注記していますが、その結果は、「ロングコンテキスト」がロボットの知能をスケールさせるための強力な新しい軸であり、不器用で近視眼的な機械を、適応力のある長期的な問題解決者に変えるものであることを強く示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →