← 最新の論文
💬 NLP

Vero: An Open RL Recipe for General Visual Reasoning

この論文は、60 種類のデータセットから構築された 60 万サンプルの大規模 RL データセットとタスク別報酬設計を用いて、プロプライエタリなデータに依存せず多様な視覚推論タスクで最先端の性能を達成するオープンな視覚言語モデル「Vero」を提案し、広範なデータカバレッジが RL スケーリングの鍵であることを実証しています。

原著者: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

公開日 2026-04-07
📖 1 分で読めます☕ さくっと読める

原著者: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

Vero: 視覚の「天才」を作るための、オープンなレシピ

この論文は、**「Vero(ヴェロ)」**という新しい人工知能(AI)の家族について紹介しています。Vero は、写真やグラフ、図表、科学の教科書など、あらゆる「目に見えるもの」を理解し、論理的に考えることができるよう訓練された AI です。

これまでの最高峰の AI は、企業秘密(ブラックボックス)として守られており、どのように作られたか、どんなデータで学んだかは誰も知りませんでした。しかし、Vero は**「すべてを公開したレシピ」**で作られた最初の強力なモデルです。

これをわかりやすく、3 つの物語(メタファー)で説明しましょう。


1. 料理のレシピ:「万能シェフ」の育て方

Imagine you want to train a chef who can cook anything: sushi, pizza, French cuisine, and even complex molecular gastronomy.
(Imagine you want to train a chef who can cook anything: sushi, pizza, French cuisine, and even complex molecular gastronomy.)

  • これまでの方法(ブラックボックス):
    有名なレストランのシェフが「私の料理は最高だ」と言いますが、レシピは秘密です。彼らが使った食材(データ)も、調味料の配合(アルゴリズム)も、誰にもわかりません。だから、他の人が同じように美味しい料理を作るのは不可能です。

  • Vero の方法(オープンレシピ):
    この研究チームは、**「Vero-600K」**という巨大な「食材の箱」を作りました。

    • 60 万個の食材: 59 種類の異なる料理(データセット)から集められました。
    • 6 つの料理ジャンル:
      1. STEM(科学・数学): 複雑な計算や図形の問題。
      2. チャート・OCR: グラフや表から情報を読み取る。
      3. 空間・アクション: 「右の棚の赤い箱を取って」といった物理的な指示。
      4. 知識・認識: 「これは何という鳥?」といった一般的な知識。
      5. 位置・検索: 「画像の中の犬を探して」といった特定の場所を見つける。
      6. キャプション・指示: 画像に合う文章を書いたり、細かい指示に従ったりする。

    彼らは、これら 6 つのジャンルを**「均等な割合」**で混ぜ合わせました。

    • 重要な発見: もし「数学」だけを極端に練習させると、その AI は数学は得意になりますが、他のこと(例えば絵を描くこと)ができなくなったり、逆に悪くなったりしました。
    • Vero の戦略: 「偏食」をさせず、**「バランスの取れた食事」**をさせることで、どんな問題にも対応できる「万能シェフ」に育て上げました。

2. 学校での勉強:「特化型」vs「総合型」

AI を学生だと想像してください。

  • 特化型の学生(これまでの AI):
    「数学オリンピック」の選手は、数学のテストでは満点ですが、国語の作文や体育の授業ではボロボロです。特定の分野だけ勉強しすぎると、他の分野の能力が落ちてしまう(これを「負の転移」と呼びます)ことがわかりました。

    • 例: 数学を勉強させすぎると、AI は「絵の説明」をするのが下手になり、短くて冷たい答えしか出せなくなりました。
  • Vero の学生:
    6 つの異なる科目(数学、国語、体育、理科など)を同時に勉強させました。

    • 結果: 数学のテストでもトップクラスになりながら、国語の作文も上手になり、体育もできました。
    • 驚異的な成績: 既存の「思考型 AI(Qwen3-VL-Thinking)」という強力なライバルに対し、Vero は 30 個のテストのうち 23〜24 個で勝利しました。しかも、Vero は「思考用データ」という特別な教科書を使わず、ただ「バランスの良い教科書」だけで勝ったのです。

3. 思考の癖:「脳」の使い方が違う

AI が答えを出すとき、頭の中でどんな思考プロセス(CoT: Chain of Thought)を回しているか分析しました。

  • 数学(STEM)の癖:
    「あ、待てよ。この計算は違うかも…」と**後戻り(バックトラック)**を繰り返す、慎重な思考スタイルになります。
  • 地図や動作(Spatial)の癖:
    「ここだ、ここだ」と視覚的に探査し、迷わずにゴールを目指す、直感的な思考スタイルになります。
  • Vero のすごいところ:
    単一の分野だけを勉強した AI は、その「思考の癖」に固執してしまいます。しかし、Vero は**「状況に合わせて思考のスタイルを切り替える」**ことを学びました。
    • 数学の問題が出れば「慎重に後戻りする脳」を使う。
    • 地図の問題が出れば「素早く探す脳」を使う。
    • 会話の課題が出れば「柔らかく話す脳」を使う。

このように、**「多様な経験(データ)」**が、AI に「状況に応じた柔軟な思考」をもたらしたのです。


まとめ:なぜこれが重要なのか?

この研究が示した最大のメッセージは、**「AI を強くするのは、複雑なアルゴリズムよりも『多様なデータ』と『バランスの取れた学習』だ」**ということです。

  • オープンソースの勝利: 企業秘密に頼らず、誰でも使えるデータとコードを公開することで、科学全体が前に進みます。
  • バランスの重要性: 特定の分野に偏らず、広く浅く(そして深く)学ぶことが、真の「一般知能」への近道です。

Vero は、AI が「特定の分野の専門家」から「何でもできる賢いパートナー」へと進化するための、新しい道しるべとなったのです。

「Vero」は、AI に「偏食」をさせず、「バランスの取れた食事」を与えることで、視覚的な世界を何でも理解できる「万能の頭脳」を作った、オープンなレシピなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →