← 最新の論文
💻 computer science

All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

本論文は、強化学習(GRPO)が視覚言語モデルの推論能力を高める一方で多様性の崩壊を引き起こす課題を指摘し、複数の解に対する発散的思考を促進する「Multi-Group Policy Optimization(MUPO)」を提案することで、この問題を解決しベンチマーク性能の向上を実現したことを報告しています。

原著者: Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang

公開日 2026-04-02
📖 1 分で読めます☕ さくっと読める

原著者: Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、AI(特に画像を見て言葉を話す「視覚言語モデル」)の「考え方の癖」について面白い発見をした研究です。

一言で言うと、**「AI に『正解』だけを目指させると、考え方が狭くなって失敗する。でも、あえて『いろんな考え方を試させる』と、もっと賢くなれる」**というお話です。

以下に、難しい専門用語を使わず、身近な例え話で解説します。


1. 発見:「真面目な優等生」と「自由な探検家」の違い

研究者たちは、AI の「強化学習(正解を目指して自分で学習させる技術)」を使ったモデルと、それを始める前の「ベースモデル」を比較しました。

  • 強化学習モデル(GRPO)=「真面目な優等生」

    • 特徴: 一度の試行では、非常に深く、論理的に考えます。
    • 弱点: 一度「この方法が正解だ」と決めると、その方法しか考えなくなります。例えば、「足し算で解ける」と思ったら、足し算しかやらず、他の方法(引き算や推測)を試しません。
    • 結果: 簡単な問題は完璧ですが、その「決まった方法」が通用しない難しい問題に出会うと、全く手がつかなくなって失敗します
  • ベースモデル(学習前)=「自由な探検家」

    • 特徴: 一つの考え方は少し荒削りですが、「あれも試してみよう、これも試してみよう」と多様なアプローチを取ります
    • 強み: 「足し算」がダメなら「引き算」や「推測」を試すので、一度の正解率は低くても、何回か試せば正解にたどり着く確率が高いです。

【例え話】
数学の問題を解くとき、

  • 優等生は「公式 A を使って解こう」と決めたら、公式 A だけで必死に計算し続けます。公式 A が使えない問題だと、途方に暮れてしまいます。
  • 探検家は「公式 A でダメなら、図を描いてみよう。それでもダメなら、当て推量で答えを逆算してみよう」と、次々と違う方法を試します

2. 問題点:「多様性の崩壊( Diversity Collapse)」

実は、強化学習(GRPO)という技術には大きな落とし穴がありました。

学習の初期段階で、AI は「一番効率的な方法」を見つけると、すぐにその方法に固執してしまい、他の可能性をすべて捨ててしまいます
これを論文では**「多様性の崩壊」**と呼んでいます。

  • イメージ: 迷路を解くとき、AI は「この道が近そうだ」と思ったら、その道だけを何千回も繰り返して練習します。でも、もしその道が壁になっていたら、「他の道があるかもしれない」という発想自体を失ってしまい、永遠に出口を見つけられなくなります。

3. 解決策:MUPO(ムポ)という新しい技術

そこで、著者たちは**「MUPO(Multi-Group Policy Optimization)」**という新しい方法を提案しました。

「MUPO」の仕組み:チームに分けて競争させる

AI に「1 つの正解」を探させるのではなく、**「3 つの異なるチーム」**に分けて考えさせます。

  1. チーム分け: 1 回の試行で出た答えを、似たような考え方のグループ(チーム)に分けます。
  2. チーム内競争: 各チームの中では「正解に近い方」を褒めます(これまでは全体で一番良いものだけを選んでいました)。
  3. チーム間競争(重要): **「他のチームとは違う考え方をしているか?」**を評価します。
    • もしチーム A が「足し算」ばかり考えていて、チーム B が「図を描く」方法を考えたら、**「素晴らしい!違う角度を見つけたね!」**と両方を褒めます。
    • 逆に、みんなが同じ「足し算」しか考えていなければ、それは「面白くない」として評価を下げます。

【例え話】
会社で新商品のアイデアを出す会議を想像してください。

  • これまでの方法: 「一番売れそうなアイデア」だけを選び、それを徹底的に磨き上げます。でも、そのアイデアが失敗したら、会社は破綻します。
  • MUPO の方法: 3 つの部署(チーム)に分けます。
    • A 部署は「高級路線」
    • B 部署は「安価路線」
    • C 部署は「奇抜な路線」
    • 各部署は自分の路線を磨きつつ、**「他の部署とは全然違うアイデアを出せたらボーナス」**というルールにします。
    • 結果、**「高級路線がダメでも、安価路線がヒットする」**など、リスクを分散して、より多くの正解(ヒット商品)を見つけられるようになります。

4. 結果:どう変わった?

この MUPO という方法を取り入れた AI(MUPO-Thinker)は、以下のような成果を上げました。

  • 正解率の向上: 数学や論理パズルのテストで、従来の最強の AI よりも高い正解率を記録しました。
  • テスト時の強さ: 「1 回で正解」だけでなく、「何回か試して正解を見つける」能力が劇的に向上しました。
  • 失敗からの回復: 難しい問題でも、一つの方法がダメなら、別の方法を素早く切り替えて正解にたどり着けるようになりました。

まとめ

この論文が伝えているのは、**「AI を賢くするには、正解に近づくことだけを考えさせるのではなく、あえて『いろんな考え方を試す』ことを奨励する必要がある」**ということです。

人間が問題を解決する際、一度の思考で正解が出ないときは、視点を変えたり、別の方法を試したりしますよね。MUPO は、AI にその**「人間の多様な思考の広がり」**を取り戻させ、より賢く、柔軟な AI を作ろうという画期的なアイデアなのです。

「すべての道はローマに通ず」(All Roads Lead to Rome)というタイトル通り、正解への道は一つだけではありません。AI にも「いろんな道」を探させることで、より素晴らしい答えが見つかるという、とても素敵な研究でした。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →