← 最新の論文
💻 computer science

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

本論文は、推論と行動を単一のモデルで統合し、タスク実行中に必要に応じて適応的に推論モードと行動モードを切り替えることで、長期的な計画やエラー回復、複雑な操作タスクを可能にする新しい統一型ビジョン・言語・アクションモデル「OneTwoVLA」を提案するものです。

原著者: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

公開日 2026-03-03
📖 1 分で読めます☕ さくっと読める

原著者: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「OneTwoVLA(ワン・ツー・VLA)」**という、新しいタイプのロボット用 AI について紹介しています。

一言で言うと、**「考えながら動き、動きながら考えることができる、とても賢いロボットの頭脳」**を作ったという話です。

従来のロボットは「頭(思考)」と「手(動作)」が別々で、うまく連携できていないことが多かったです。この論文は、その問題を解決する画期的なアプローチを提案しています。

わかりやすくするために、いくつかの比喩を使って説明しましょう。

1. 従来のロボット vs 新しいロボット(OneTwoVLA)

【従来のロボット:二人組のチーム】
昔のロボットは、**「頭の良い指揮官(システム 2)」と「手先の器用な作業員(システム 1)」**の二人組で動いていました。

  • 指揮官は「お皿を持ってきて」と言います。
  • 作業員はそれを見てお皿を掴みます。
  • 問題点: 指揮官が「お皿を持ってきて」と言っても、作業員が「でも、お皿が壊れてるよ!」と気づいていても、指揮官にはその情報が届きません。また、指揮官が考えるのに時間がかかると、作業員は「えっ、今どうすればいいの?」と待たされすぎて、動きが遅くなったり、古い指示のまま間違ったことをしたりします。

【新しいロボット:OneTwoVLA(一人の天才)】
OneTwoVLA は、**「指揮官と作業員が一人の人間に融合した」**ような存在です。

  • このロボットは、「考えるモード(システム 2)」と「動くモード(システム 1)」を、状況に応じて自分で切り替えることができます。
  • 例え話: 料理をしているとき、包丁で野菜を切るような単純な作業は「動くモード」でサクサク進めます。でも、「あ、火が強すぎるかも?」「お肉が焦げそう!」と気づいた瞬間、一瞬だけ「考えるモード」に切り替えて「どうしよう、水をかけようか?」と判断し、その判断に基づいてまた「動くモード」に戻ります。
  • メリット: 無駄な思考を省きつつ、重要な瞬間だけ深く考えるので、**「速く、かつ賢く」**動けます。

2. 具体的に何ができるの?(4 つのすごい能力)

このロボットは、以下のような難しいタスクを得意としています。

  • 🍳 長期的な計画(例:鍋料理を作る)
    • 「お肉を茹でて、野菜を足して、最後に器に盛る」という長い手順を、一つずつ間違えずに実行できます。途中で「お肉が落ちた!」と気づけば、すぐに「拾い直そう」と計画を修正します。
  • 🚑 失敗からの回復(例:コップを落とした時)
    • もしコップをこぼしてしまったら、ロボットは「あ、こぼしちゃった。拭こう」と自分で判断し、新しい手順(拭く動作)を即座に考え出して実行します。
  • 🗣️ 自然な会話(例:注文の変更)
    • 「オレンジのウォッカで」と言われていたのに、途中で人間が「あ、レモン味に変えて!」と言ったら、ロボットは「わかった、オレンジを置いてレモンを取ろう」と即座に反応して行動を変えます。
  • 🔍 目で見えるものを理解する(例:「あの赤い丸いもの」)
    • 「赤くて丸いもの」や「本を読むのに使うもの」といった、名前を言わずに特徴で指示されても、正しくそれを見つけます。これは、インターネット上の膨大な知識(本や写真のデータ)をロボットが学習しているおかげです。

3. どうやってこんなに賢くしたの?(データ合成の魔法)

ロボットを賢くするには、人間がロボットに教えてあげる「練習データ」が必要ですが、それには時間とコストがかかります。そこで、この論文のチームは**「AI によるデータ合成」**という魔法を使いました。

  • 魔法のレシピ:
    1. AI に「テーブルの上にリンゴと本があるような風景を描いて」と頼む。
    2. AI がその画像を生成する。
    3. さらに別の AI に「この画像を見て、リンゴを拾うための手順と、その時の思考(『リンゴは赤くて、右側にある』など)を書いて」と頼む。
  • これを 1 万 6000 回も自動で行い、**「思考付きの練習問題」**を大量に作りました。
  • この「思考付きデータ」と「実際のロボットの実践データ」を一緒に学習させることで、ロボットは**「なぜその動きをするのか」**を理解するようになり、未知の場面でも柔軟に対応できるようになりました。

まとめ

この論文は、**「ロボットに『考える力』と『動く力』を一つにまとめて、状況に応じて賢く使い分けさせる」**という新しい仕組みを提案しました。

まるで、**「料理中にレシピを見ながら、もし焦げそうなら火を止めることを即座に考え、その通りに手を動かすプロのシェフ」**のようなロボットを作ったのです。

これにより、ロボットは工場だけでなく、私たちの家庭で、複雑な家事や、人間との自然なやり取りができるようになる未来が近づいたと言えます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →