← 最新の論文
🤖 AI

GRIT: Teaching MLLMs to Think with Images

本論文は、自然言語と明示的なバウンディングボックス座標を交互に配置することで視覚的に根拠のある推論連鎖を生成することを可能にする強化学習ベースの手法 GRIT を提案し、注釈付きの推論や局所化ラベルを必要とすることなく高いデータ効率を達成する。

原著者: Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いロボットにパズルの解き方を教える場面を想像してください。通常、このロボットに画像に関する質問をすると、言葉だけで答えようとし、「鳥が見えます」と言うかもしれませんが、実際にはその鳥を指差すことはしません。暗い部屋で場所を言葉だけで説明し、相手がどこを見ているか推測してくれるのを待つようなものです。

論文「GRIT: Teaching MLLMs to Think with Images(GRIT:画像を用いた思考を MLLM に教える)」は、これらのロボット(マルチモーダル大規模言語モデル、または MLLM と呼ばれる)に、異なる思考方法を教える新しい手法を紹介しています。以下に、簡単な比喩を用いて解説します。

1. 問題点:「盲目」の思考者

現在の AI モデルは話すことは得意ですが、画像を見ると、純粋なテキストで「思考」することが多いです。正解を推測することはできても、それを導き出すためにどこを見たのかを示すことはできません。まるで、証拠を示したり指紋を指差したりすることなく、容疑者の名前を推測するだけで事件を解決しようとする探偵のようです。これにより、その推論は信頼しにくく、時には不正確になります。

2. 解決策:「指差す」習慣(GRIT)

著者たちは、GRIT(Grounded Reasoning with Images and Text:画像とテキストを用いた根拠ある推論)と呼ばれる手法を開発しました。言葉だけで話すのではなく、AI に思考しながら指差すことを教えるのです。

  • 比喩: AI を、学生に地図を説明する教師だと想像してください。「宝はあそこにある」と言うだけでなく、教師は地図上のその場所を四角で囲み、「私はここ [四角を描く] を見ており、岩が見えるので、宝はきっとその隣にあるはずだ」と言います。
  • 仕組み: AI は、通常の文章とバウンディングボックス(画像の特定の部分を四角で囲む座標)を混ぜた思考の連鎖を生成します。文字通り、問題を解決するために使用している画像の部分を指差すのです。

3. 秘密の武器:試行錯誤による学習(GRPO-GR)

通常、AI にこれほど複雑なことを教えるには、人間がすべての手順を書き起こし、すべての四角を描いた数千の例が必要です。まるで、ロボット用の教科書を書くために教師チームを雇うようなものです。

この論文は、画期的な成果を主張しています:GRIT は、ほとんど例を必要としません。

  • 比喩: 教科書を読む代わりに、AI はビデオゲームをする子供のように学習します。画像と質問を与えると、答えようとします。最終的な答えが正しく、ルール(四角を描くなど)に従っていれば、「高得点」(報酬)がもらえます。失敗すれば低得点です。
  • 魔法: 研究者たちは、AI を訓練するために20 の例(20 問の練習問題のようなもの)しか使いませんでした。AI は「高得点を取るには、話しながら画像を指差す必要がある」というパターンを自分で見つけ出しました。これをGRPO-GRと呼び、正解を出すことと、正しい「指差し」形式を使うことの両方を報酬とする特別な訓練方法です。

4. 結果:より賢く、より正直に

訓練されたこれらのロボットをテストしたところ:

  • 数学や数え上げが得意になりました: 「巣の中に何個の卵がありますか?」と尋ねると、ロボットは単に数字を推測するのではなく、卵を指差し、思考の中で一つずつ数え、それから答えを提示しました。
  • 2 つのスキルが統合されました: 以前は、AI は話すこと(推論)か、指差すこと(グラウンディング)のどちらかは得意でしたが、同時に両方を行うことはできませんでした。GRIT は、両方を同時に実行することを教えました。
  • 信頼性が高まりました: AI は証拠を指差さなければならないため、嘘をつくのが難しくなりました。もし特定の場所を指差して「猫が見えます」と言っても、そこに猫がいない場合、システムは何かおかしいと判断します。

5. 発見したこと(と発見しなかったこと)

  • データ効率: 膨大なデータライブラリは不要であることが証明されました。ロボットにこの新しい「指差し」習慣を教えるには、20 の例だけで十分でした。
  • 注意: AI が特定の場所を指差す(四角を描く)と、次の思考において実際にその画像部分により注意を払うようになります。指差す行為自体が、ロボットの目を集中させる助けになるのです。
  • 限界: 論文は、データを増やすことが役立つ一方で、限界効用逓減の点があることを指摘しています。ロボットがまだ見たことのないものに対してさらに良くなるためには、単に同じデータを増やすだけでなく、データの多様性が必要となります。

まとめ:
GRIT は、AI ロボットに話しながら画像を指差すことを強制することで、「目を使って思考する」ことを教える新しい訓練方法です。これは、ほとんどデータ(わずか 20 の例)でこの複雑なスキルを教えるという点、そして AI の推論を透明で信頼できるものにするという点で、大きな飛躍です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →