Vero: An Open RL Recipe for General Visual Reasoning
この論文は、60 種類のデータセットから構築された 60 万サンプルの大規模 RL データセットとタスク別報酬設計を用いて、プロプライエタリなデータに依存せず多様な視覚推論タスクで最先端の性能を達成するオープンな視覚言語モデル「Vero」を提案し、広範なデータカバレッジが RL スケーリングの鍵であることを実証しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
Vero: 視覚の「天才」を作るための、オープンなレシピ
この論文は、**「Vero(ヴェロ)」**という新しい人工知能(AI)の家族について紹介しています。Vero は、写真やグラフ、図表、科学の教科書など、あらゆる「目に見えるもの」を理解し、論理的に考えることができるよう訓練された AI です。
これまでの最高峰の AI は、企業秘密(ブラックボックス)として守られており、どのように作られたか、どんなデータで学んだかは誰も知りませんでした。しかし、Vero は**「すべてを公開したレシピ」**で作られた最初の強力なモデルです。
これをわかりやすく、3 つの物語(メタファー)で説明しましょう。
1. 料理のレシピ:「万能シェフ」の育て方
Imagine you want to train a chef who can cook anything: sushi, pizza, French cuisine, and even complex molecular gastronomy.
(Imagine you want to train a chef who can cook anything: sushi, pizza, French cuisine, and even complex molecular gastronomy.)
これまでの方法(ブラックボックス):
有名なレストランのシェフが「私の料理は最高だ」と言いますが、レシピは秘密です。彼らが使った食材(データ)も、調味料の配合(アルゴリズム)も、誰にもわかりません。だから、他の人が同じように美味しい料理を作るのは不可能です。Vero の方法(オープンレシピ):
この研究チームは、**「Vero-600K」**という巨大な「食材の箱」を作りました。- 60 万個の食材: 59 種類の異なる料理(データセット)から集められました。
- 6 つの料理ジャンル:
- STEM(科学・数学): 複雑な計算や図形の問題。
- チャート・OCR: グラフや表から情報を読み取る。
- 空間・アクション: 「右の棚の赤い箱を取って」といった物理的な指示。
- 知識・認識: 「これは何という鳥?」といった一般的な知識。
- 位置・検索: 「画像の中の犬を探して」といった特定の場所を見つける。
- キャプション・指示: 画像に合う文章を書いたり、細かい指示に従ったりする。
彼らは、これら 6 つのジャンルを**「均等な割合」**で混ぜ合わせました。
- 重要な発見: もし「数学」だけを極端に練習させると、その AI は数学は得意になりますが、他のこと(例えば絵を描くこと)ができなくなったり、逆に悪くなったりしました。
- Vero の戦略: 「偏食」をさせず、**「バランスの取れた食事」**をさせることで、どんな問題にも対応できる「万能シェフ」に育て上げました。
2. 学校での勉強:「特化型」vs「総合型」
AI を学生だと想像してください。
特化型の学生(これまでの AI):
「数学オリンピック」の選手は、数学のテストでは満点ですが、国語の作文や体育の授業ではボロボロです。特定の分野だけ勉強しすぎると、他の分野の能力が落ちてしまう(これを「負の転移」と呼びます)ことがわかりました。- 例: 数学を勉強させすぎると、AI は「絵の説明」をするのが下手になり、短くて冷たい答えしか出せなくなりました。
Vero の学生:
6 つの異なる科目(数学、国語、体育、理科など)を同時に勉強させました。- 結果: 数学のテストでもトップクラスになりながら、国語の作文も上手になり、体育もできました。
- 驚異的な成績: 既存の「思考型 AI(Qwen3-VL-Thinking)」という強力なライバルに対し、Vero は 30 個のテストのうち 23〜24 個で勝利しました。しかも、Vero は「思考用データ」という特別な教科書を使わず、ただ「バランスの良い教科書」だけで勝ったのです。
3. 思考の癖:「脳」の使い方が違う
AI が答えを出すとき、頭の中でどんな思考プロセス(CoT: Chain of Thought)を回しているか分析しました。
- 数学(STEM)の癖:
「あ、待てよ。この計算は違うかも…」と**後戻り(バックトラック)**を繰り返す、慎重な思考スタイルになります。 - 地図や動作(Spatial)の癖:
「ここだ、ここだ」と視覚的に探査し、迷わずにゴールを目指す、直感的な思考スタイルになります。 - Vero のすごいところ:
単一の分野だけを勉強した AI は、その「思考の癖」に固執してしまいます。しかし、Vero は**「状況に合わせて思考のスタイルを切り替える」**ことを学びました。- 数学の問題が出れば「慎重に後戻りする脳」を使う。
- 地図の問題が出れば「素早く探す脳」を使う。
- 会話の課題が出れば「柔らかく話す脳」を使う。
このように、**「多様な経験(データ)」**が、AI に「状況に応じた柔軟な思考」をもたらしたのです。
まとめ:なぜこれが重要なのか?
この研究が示した最大のメッセージは、**「AI を強くするのは、複雑なアルゴリズムよりも『多様なデータ』と『バランスの取れた学習』だ」**ということです。
- オープンソースの勝利: 企業秘密に頼らず、誰でも使えるデータとコードを公開することで、科学全体が前に進みます。
- バランスの重要性: 特定の分野に偏らず、広く浅く(そして深く)学ぶことが、真の「一般知能」への近道です。
Vero は、AI が「特定の分野の専門家」から「何でもできる賢いパートナー」へと進化するための、新しい道しるべとなったのです。
「Vero」は、AI に「偏食」をさせず、「バランスの取れた食事」を与えることで、視覚的な世界を何でも理解できる「万能の頭脳」を作った、オープンなレシピなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。