← 最新の論文
💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

本論文は、自由形式の思考連鎖(chain-of-thought)生成を、構造化された知覚的証拠とエージェンティックなツール利用に基づくインコンテキスト・ポストトレーニングに置き換えることで、Vision-Language-Actionモデルを強化するフレームワークである**In-Context VLA**を導入し、それによって優れた低レベル制御とシミュレーションおよび実世界の操作タスクにおける最先端の性能を実現する、グラウンデッドな言語消費を可能にするものである。

原著者: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにサンドイッチを作ったり、散らかった部屋を片付けたりといった家事のやり方を教えているところを想像してみてください。長い間、科学者たちは人間が作業をしているビデオを見せて、「見た通りに正確にコピーしなさい」とロボットに教えることで、これらの機械を教えようとしてきました。これは単純なタスクにはうまくいきますが、まるで、たった一つの硬直した文章だけを暗記することで新しい言語を学ぼうとしているようなものです。もしロボットに「赤いマグカップを手に取って」と言った後に、「あのクリムゾン色のカップを掴んで」と言ったら、ロボットは混乱してしまうかもしれません。なぜなら、ロボットは学習中に聞いた特定の音を一致させることしか学んでおらず、言葉の背後にある「意味」を理解することを学んでいなかったからです。

これを解決するために、研究者たちは最近、ロボットに「思考」のステップを与えることを試みました。これは、人間が行動する前に自分自身に語りかけることに似ています。彼らは、ロボットがまず「よし、カップはテーブルの上にあり、私は手を左に動かす必要がある」といった計画を書き出し、それから行動することを期待しました。これは「思考の連鎖(Chain-of-Thought)」と呼ばれます。しかし、ここにひねりがあります。ロボットの場合、動く前に喋りすぎると、かえって仕事の精度が下がってしまうのです。それは、道路についての小説を書いている間に車を運転しようとするようなものです。文章を書き終える頃には、曲がるべき角を通り過ぎてしまっています。ロボットは、実際に物体を掴む代わりに、自分の思考をナレーションすることに陥ってしまい、実際に見ているのではなく推測しているために、物の位置について事実を捏造してしまうことがよくあります。

この論文は、VLA-Talkerと呼ばれる新しいロボットの教え方を紹介しています。ロボットに自分の思考を書き込ませる代わりに、研究者たちはロボットに、観察と報告を行うための「スマートな助手」を与えました。これは、超強力なメガネと、気の利いた副操縦士を備えたロボットのようなものです。ロボットがスプーンがどこにあるかを知る必要があるとき、ロボットは推測したりパラグラフを書き出したりはしません。その代わりに、特殊なツール(深度カメラや物体検出器など)を使用する副操縦士に即座に問いかけ、「スプーンはあなたの手の右側に42ピクセル、少し低い位置にあります」という答えをもらいます。ロボットはその明確で事実に基づいた報告を読み取り、即座に行動に移します。

研究者たちは、この手法がゲームチェンジャーであることを発見しました。ロボットに、自ら混乱した独り言を「生成」させるのではなく、ツールからの明確で根拠のある言語を「消費」させることで、ロボットはより速く、より正確になります。テストにおいて、このアプローチは単に優れていただけでなく、ロボットが動く前にエッセイを書くことで時間を浪費しなくなったため、従来の「思考」メソッドよりも4.6倍近く高速でした。彼らは複雑なコンピュータシミュレーション、さらには実物の人間型のロボットを用いてテストを行い、他のロボットが苦戦するタスクをこの手法が一貫して解決できることを証明しました。これは、時には、誰か他の人の話を聞くことが最善の思考方法であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →