Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
本論文は、明示的な推論アプローチと比較して推論遅延を最大 90% 削減し、効率的かつリアルタイムな具身制御を実現するために、マルチモーダルなチェーン・オブ・ thought 推論を連続的な潜在表現に内蔵する統一フレームワークである潜在推論 VLA(LaRA-VLA)を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにサンドイッチの作り方を教える場面を想像してください。
従来の方法(明示的な思考連鎖):
現在、ほとんどの高度なロボットの頭脳は、行動を起こす前に日記にすべての思考を一つずつ書き出さなければならない生徒のように機能します。
- ロボットは見る:「サンドイッチが必要だ。」
- ロボットは考える(声に出して):「よし、まずパンを見つけなければならない。左にパンの塊がある。次にナイフを掴む必要がある。右にナイフがある。腕をゆっくり動かさなければ…」
- ロボットは行動する: この段落全体を書き終えて初めて、腕を動かす。
問題点: これは信じられないほど遅い。ロボットが「日記の記述」を終える頃には、サンドイッチはすでに冷たくなっているか、パンを掴むチャンスを逃している。また、言葉(離散トークン)で書くことは、滑らかな連続曲線で腕を動かす必要があるロボットにとっては少しぎこちない。1 インチずつしか動けないようにして車を運転しようとするようなものだ。
新しい方法(LaRA-VLA):
この論文は、LaRA-VLA(潜在推論 VLA)を紹介する。これは、ロボットに何も書き留めることなく頭の中で考えるように教えるようなものだ。
長い文章を吐き出す代わりに、ロボットは自分の推論をコンパクトで連続的な「感覚」や「雰囲気」(潜在表現)として内部化させる。
- ロボットは見る:「サンドイッチが必要だ。」
- ロボットは考える(静かに): パンの場所、ナイフ、そして腕が通るべき経路を、単一の滑らかな精神的スナップショットとして即座に処理する。
- ロボットは行動する: 即座に動く。
3 段階のトレーニングキャンプ(カリキュラム学習)
この論文は、ロボットにいきなり「静かに考えろ」と言ってもうまくいかないことを説明している。3 つの段階を持つトレーニングキャンプが必要だ。
第 1 段階:「解を示せ」フェーズ。
ロボットは自分の思考(テキスト)を書き出し、次の画像がどう見えるかを予測することを強制される。「カップを左に動かしている」と明示的に述べることで、ゲームのルールを学ぶ。第 2 段階:「ささやき」フェーズ。
訓練者は、ロボットが書いた文章を「ささやき」(潜在トークン)に置き換え始める。最初は、ロボットは文章の半分を書き、残りをささやく。次第に、書く量は減り、ささやく量が増える。複雑な思考を小さく効率的な精神的パッケージに圧縮することを学ぶ。第 3 段階:「静寂の達人」フェーズ。
ロボットはもはや何も書き出さず、声に出してささやきもしない。推論を完全に内部化している。場面を見て、頭の中で「ささやき」を処理し、即座に行動を実行する。
なぜこれが優れているのか?
- 速度: ロボットが日記の記述を入力する時間を浪費しないため、90% 速く反応できる。論文によれば、思考時間は 7 秒以上からわずか0.13 秒(135 ミリ秒)に短縮される。これはリアルタイム制御に十分な速さだ。
- 滑らかさ: ロボットが「離散的な言葉」ではなく「連続的な感覚」で考えるため、その動きは滑らかになり、物理世界が実際に機能する仕組みに合致する。
- 堅牢性: 論文は、ぼやけたカメラ映像やノイズの多い映像(霧の窓越しに見ているようなもの)でロボットをテストした。「静かな思考者」(LaRA-VLA)は、「日記書き」よりもはるかにうまく混乱に対処し、その内部的な精神モデルがより安定していることを示唆している。
結果
テストにおいて、この新しい方法はほぼすべてのトップクラスのロボットモデルを凌駕した。果物の選別やボウルの積み重ねなど、長く複雑なタスクにおいて優れており、かつはるかに高速に遂行した。
要約すると: LaRA-VLA は、ロボットがタスクを遂行する際に「話しながら」進むのをやめ、「感じながら」進むように教える。その結果、天才的な計画立案者でありながら、稲妻のように速い作業者となるロボットが実現する。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。