← 最新の論文
🤖 AI

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

CoTinyVLAは、モデルサイズを拡大するのではなく、二重ビューの時間的入力、階層的な思考の連鎖(Chain-of-Thought)蒸留、およびパラフレーズ拡張を含む構造化された教師あり学習技術を活用することで、LIBERO-Plusベンチマークにおいて最先端の堅牢性を達成した、10億パラメータ未満のVision-Language-Actionモデルである。

原著者: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

公開日 2026-07-29
📖 1 分で読めます☕ さくっと読める

原著者: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが単に硬直したコードに従うだけの無機質な機械ではなく、私たちの言葉を理解し、目的を達成するために自分の腕をどう動かせばよいかを自ら考え出せる、助けとなるコンパニオンである世界を想像してみてください。これは「エンボディドAI(身体性AI)」と呼ばれる分野の夢です。そこでは、コンピュータがカメラを通じて世界を見、人間の言語を理解し、それら2つを物理的な動作へと翻訳することを学びます。長い間、最も賢いロボットには、膨大な数の「ニューロン」を持つ巨大なコンピュータモデル(脳)が必要でした。これらの巨大なモデルは、巨大で高価なサーバーを必要とするスーパーコンピュータのようなものであり、家の中を転がったりキッチンで手伝いをしたりできる小さなロボットの中に収めることは不可能でした。研究者たちが問い続けてきた大きな疑問は、「同じくらい賢く信頼できるロボットを、バックパックに収まるほど小さく作れるか?」ということでした。

この論文は、CoTinyVLAという新しいロボットの脳を紹介しています。これは、現在の分野をリードしている巨大で重厚なモデルを凌駕しながら、わずかなメモリしか使用しない、非常に効率的で小さなロボットの脳だと考えてください。研究者たちは単に脳を縮小しただけではありません。彼らは、より優れた「考え方」をロボットに教え込みました。あらゆる状況を丸暗記しようとする代わりに、ロボットに推論のための「カンニングペーパー」を与えたのです。彼らは、大きなタスクを単純な計画(ToDoリストのようなもの)に分解し、動き出す前に各ステップを一つずつ考えるように教えました。また、特別な一対の目も与えました。一つは部屋全体を見るための遠くからの目、もう一つは手が触れているものを正確に見るための手首の目です。そして、動きを理解するために、過去数秒間の短い動画を見るように教えました。その結果、0.9ビリオン(9億)パラメータを持つこのロボットモデルは、8倍のサイズを持つモデルよりも、複雑で乱雑な現実世界の状況をうまく扱うことができるようになりました。

問題点:大きな脳、小さなロボット

長年、指示に従うための最高のロボットは、巨大で重い戦車のようなものでした。「青いカップを手に取ってテーブルの上に置いて」といった命令を理解するために、これらのロボットは30億から70億のパラメータを持つ巨大なコンピュータモデルを使用します。これらのモデルは非常に賢いのですが、非常に巨大です。実行するだけで約20GBのコンピュータメモリを必要とします。それは、フルライブラリをバックパックに詰め込もうとするようなもので、モバイルロボットや支援機器に搭載されている小型のバッテリー駆動コンピュータには到底収まりません。

研究者たちは知りたかったのです。これほど賢くなるために、本当にこれほど巨大な脳が必要なのでしょうか? それとも、現実世界の予期せぬ混乱に対処できる、同じくらい優れた、小さくて効率的なロボットを作ることができるのでしょうか?

解決策:大きな戦略を持つ小さな脳

チームは、わずか0.9ビリオンのパラメータを持つロボットの脳、CoTinyVLAを構築しました。この小さなモデルを巨人たちと同じくらい強くするために、彼らは単に大量のデータを流し込んだのではなく、学習の方法と注意を向ける対象を変えました。彼らは、ロボットにより良く考えさせるために、「構造化された監督(structured supervision)」と呼ぶ3つの主要なトリックを使用しました。

1. 「二つの目」の時間旅行
ボールを捕ろうとしている場面を想像してください。もしボールの写真を1枚しか見ていなければ、それが自分に向かってきているのか、遠ざかっているのか分かりません。動きを理解するには、短い動画を見る必要があります。
CoTinyVLAは、2つの異なる「目」で同時に世界を見るように教えられます。

  • 三人称の目: どこに何があるかを見るために、部屋全体を見渡すカメラ。
  • 手首の目: ロボットの手が何を触っているかを正確に見るための、グリッパー(掴む部分)にあるカメラ。
    単に現在の瞬間を見るだけでなく、ロボットは直近16フレーム(各目から8フレームずつ)の短い「映画」を観ます。これにより、ロボットは時間と動きの感覚を得ることができ、物体がどれくらいの速さで動き、どこへ向かっているのかを理解するのに役立ちます。

2. 「計画と思考」のカンニングペーパー
これが最も重要なトリックです。ロボットは動く前に、物語を書くことを教えられます。

  • 計画(The Plan): タスクの開始時に、ロボットはハイレベルな「ToDoリスト」(例:「まず、カップを掴む。次に、持ち上げる。最後に、テーブルの上に置く」)を書きます。この計画はタスク全体を通して変わりません。
  • 思考(The Think): 小さな動きを行うたびに、ロボットは今何をしているかについての短いメモを書きます(例:「私はグリッパーを閉じている」「私はカップを持ち上げている」)。
    ロボットは、より大きく賢いロボット(350億パラメータの「教師」)が同じタスクを解決する様子を観察することで、これを学びます。小さなロボットは、教師の思考プロセスを模倣します。これにより、小さなロボットは単に「何を」するのかだけでなく、「なぜ」それを行っているのかを理解できるようになります。

3. 「言い換え」ゲーム
ロボットは、同じことを違う言い方で言われると混乱することがよくあります。もしロボットが「カップを手に取って」というフレーズだけで訓練されていたら、「マグカップを掴んで」と言われただけで行き詰まってしまうかもしれません。
これを修正するために、研究者たちは40種類の基本指示を用いて、それらを800種類の異なるバージョンへと拡張してロボットを訓練しました。言葉を入れ替えたり(「取る」を「掴む」や「持ち上げる」に変えるなど)、対象物の説明を変えたり(「黒いボウル」を「暗い色のボウル」にするなど)、さらには「~していただけますか?」といった丁寧な表現を加えたりしました。これにより、ロボットは特定の単語だけでなく、コマンドの「意味」を理解するように学習しました。

結果:小さな存在が大きな勝利を収める

研究者たちは、ロボットが世界の変化にどれだけ対応できるかをテストするために設計された、厳しいテストスイートであるLIBERO-Plusを用いてCoTinyVLAをテストしました。このテストには、ロボットが変則的な状況に直面する1万以上のシナリオが含まれています。例えば、ロボットが奇妙な位置からスタートしたり、照明が変わったり、背景が異なったり、あるいは指示の言い回しが独特であったりする場合です。

結果は驚くべきものでした。0.9ビリオンのパラメータしか持たないCoTinyVolaは、4つの主要なテストカテゴリすべてにおいて、最強の70億パラメータのモデルを打ち破りました。

  • 空間(Spatial): 成功率90.8%(巨大なモデルを4.7ポイント上回る)。
  • 物体(Object): 成功率87.3%(巨大なモデルを2.8ポイント上回る)。
  • 目標(Goal): 成功率86.6%(巨大なモデルを15.9ポイントも大幅に上回る)。
  • 長期(Long): 成功率80.7%(巨大なモデルを3.0ポイント上回る)。

最大の勝利は「目標(Goal)」カテゴリであり、この小さなロボットは、最高の巨大ロボットよりも16ポイント近く高い成績を収めました。これは、CoTinyVLAが、多くの実世界のロボットに搭載可能な、わずか2.25 GiBのメモリを使用するコンピュータで動作していることを考えると、特に素晴らしい成果です。

なぜこれが重要なのか

この論文は、スマートなロボットを作るために必ずしも巨大な脳は必要ないということを示しています。小さなロボットに、構造化された方法で「考える」こと(計画を立て、ステップを確認すること)を教え、適切な視覚および言語トレーニングを与えることで、そのロボットははるかに大きなモデルよりも、複雑で予測不可能な現実世界をうまく扱うことができるのです。

研究者たちはまた、「計画」という思考プロセスが極めて重要であることも発見しました。もしロボットから計画を書く能力を取り除くと、成功率は40から45ポイント低下します。これは、ロボットが単に推測しているのではなく、実際に計画を用いて行動を導いていることを証明しています。

要約すると、CoTinyVLAは、適切な教育方法を用いれば、小さく効率的なロボットが巨大なスーパーコンピュータと同じくらい有能になれることを証明しており、私たちの家庭や職場に役立つインテリジェントなロボットが登場することへの一歩を確実に踏み出しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →