← 最新の論文
💻 computer science

LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

本論文は、静的な埋め込みではなく潜在的な視覚的思考とアテンションの軌跡を整合させることにより、マルチモーダル蒸留における知覚のギャップを埋め、コンパクトなモデルが大規模なプロプライエタリ・システムに匹敵する優れた視覚的推論性能を実現することを可能にするフレームワークであるLaViTを紹介している。

原著者: Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

公開日 2026-08-12
📖 1 分で読めます☕ さくっと読める

原著者: Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットにミステリーの解き方を教えていると想像してください。人工知能の世界には、「マルチモーダル大規模言語モデル(MLLM)」と呼ばれる特別な種類のロボットがあります。これらは、テキスト(手がかり)を読み、同時に犯罪現場の写真(画像)を見ることができる、超スマートな探偵のようなものです。長い間、これらのロボットは見たものを描写することには長けていましたが、「推論」――つまり、なぜそれが起きたのかを考えたり、トリッキーなパズルを解いたりすることとなると、しばしば行き詰まっていました。彼らは画像を見て、それ以上見るのをやめてしまい、自分が本から学んだ知識に基づいて答えを推測してしまうのです。それは、泥の足跡を目にしたのに、それを無視して直感だけで犯人を推測してしまう探偵のようなものです。

最近、科学者たちは「潜在的推論(latent reasoning)」と呼ばれる新しいトリックを発見しました。思考の全ステップを言葉として書き出す(長い日記をつけるような)代わりに、これらのロボットは、脳内の目に見えない連続的な「ささやき」へと思考を圧縮し始めました。これはより速く、効率的です。しかし、問題があります。科学者が、より大きな、より賢いモデルから小さな、より安価なロボットに学習させるプロセス(「蒸留」と呼ばれます)を試みたとき、奇妙なことが起こりました。小さなロボットは正しい言葉を言うことは覚えたのですが、実は画像の正しい部分を見ていなかったのです。彼らは単に、教師の声を模倣していただけで、視覚的な手がかりを理解していませんでした。それは、答えの鍵を暗記してテストで高得点を取るものの、レッスン自体は理解していない学生のようなものです。


「見ているようで見ていない」という大いなる不具合

LaViTの開発者たちは、「知覚のギャップ(Perception Gap)」と呼ぶ奇妙な現象に気づきました。想像してみてください。あなたには熟練のシェフ(「教師」モデル)と、若い弟子(「生徒」モデル)がいます。弟子はシェフが複雑な料理を作る様子を見守ります。もし、弟子にレシピを書き留めるよう頼むだけなら、彼らは「小麦粉を2カップ加え、3分間混ぜる」といった完璧な文章を書けるかもしれません。しかし、実際に料理をするよう頼んだら、彼らはシェフの手を実際には見ていなかったために、小麦粉を床にぶちまけてしまうかもしれません。彼らはテキストを暗記しただけで、決して観察していなかったのです。

AIの世界において、研究者たちは、小さなモデルに大きなモデルの回答をコピーするように訓練すると、小さなモデルが「テキストの模倣」に長けてしまうことを発見しました。彼らは「A地点の方が近い」といった正しい答えを出すことができますが、彼らの内部の「目」(視覚的注意)は、画像の全く無関係な部分を見ていました。彼らは視覚的な証拠を観察するのではなく、一般的なフレーズに基づいた推測、つまり言語のテクニックに頼っていたのです。それは、レッスンを理解せずに解答集を暗記してテストをパスしている学生のようなものです。

解決策:LaViT(潜在的視覚的思考)

これを修正するために、チームはLaViTという新しいトレーニングフレームワークを作成しました。これは、生徒ロボットに、言葉を発する前に視覚的に「考える」ことを強制するものです。単に最終的な答えをコピーさせるのではなく、LaViTは生徒に、まず一連の目に見えない「思考トークン」を生成させます。これらのトークンを、ロボットが「よし、決定を下す前に、ここの影とあそこの角度を見なければならない」と自分自身に語りかける、心のスケッチや静かな内なる独白だと考えてください。

LaViTの魔法は、主に2つのトリックにあります:

  1. 「内なる目」の整合性: このシステムは、単に生徒の最終回答が教師と一致するかどうかをチェックするだけではありません。生徒の「視線」をチェックします。生徒が、教師の視覚的な注意マップ(教師の目が画像の上を辿った特定の経路)を再構成することを強制します。もし教師が奥行きを判断するために影を見たのであれば、生徒も言葉を発する前であっても、必ずその影を見なければなりません。
  2. 「感覚ゲーティング」カリキュラム: これは最も遊び心のある部分です。想像してみてください、あなたが誰かに自転車の乗り方を教えているとします。もしすぐに道路を見せてしまったら、彼らはただ滑走してしまい、バランスの取り方を学ばないかもしれません。逆に完全に目隠しをしてしまったら、彼らは衝突します。LaViTは「カリキュラム感覚ゲーティング(Curriculum Sensory Gating)」メカニズムを使用します。トレーニングの開始時には、生徒の画像への直接的な視界を部分的に遮断します。これにより、生徒が物事を理解するために、それらの目に見えない「思考トークン」に完全に依存するように強制します。生徒が上達するにつれて、「目隠し」はゆっくりと解かれ、再び画像を見ることができるようになりますが、この時、彼らはすでに内部で視覚的な手がかりを処理する方法を学んでいます。これにより、ロボットがテキストに基づいて推測するという「楽な道」へ逃げることを防ぎます。

彼らが発見したこと

結果は驚くほど強力でした。研究者たちは、彼らの新しい30億パラメータモデル(比較的小さくコンパクトなもの)を、より大きなモデルや、利用可能な最も高度なプロプライエタリ・モデルと比較しました。

  • 「小さな巨人」: LaViTで訓練された彼らの小さな3Bモデルは、より大きな7Bモデルを凌駕し、いくつかの複雑な視覚的推論タスクにおいて有名なGPT-4oさえも打ち負かしました。例えば、「相対的奥行き(どちらの物体が近いかを判断する)」というタスクにおいて、LaViTは**78.23%を記録しましたが、GPT-4oは64.52%**でした。
  • 「幻覚」の修正: この手法なしでは、モデルが注意深く見すぎていない場合に「幻覚(ハルシネーション)」(作り話)を起こしやすいことが研究で示されました。LaViTはこれを大幅に減少させ、微細な知覚テストのパフォーマンスを最大**+16.94%**向上させました。
  • 安定性: 研究者たちはまた、LaViTは単に教師をコピーしただけでなく、実際により安定したことも発見しました。巨大な教師モデルは、似たような画像に対して視線が「ふらつく(揺れる)」ことがありましたが、LaViTの生徒は、背景のノイズを無視して重要な詳細に集中するという、レーザーのような精密なフォーカスを学習しました。

なぜこれが重要なのか

この論文は、AIを賢くする秘訣は、単にモデルを大きくしたり、より多くのデータを投入したりすることではないことを示唆しています。それは、AIに「どのように見るか」を教えることです。AIの内部的な「視覚的思考」を最終的な言葉と一致させることで、LaViTは、単に何を言うべきかを推測するのではなく、見たものを真に理解するモデルを作り上げます。それは、地図を暗記するロボットと、地形を実際にナビゲートする方法を学ぶロボットの違いです。著者らは、このアプローチが強力なAIを構築するためのより効率的な方法になり得ることを提案しており、よく訓練された小さな脳は、しばしば注意散漫な大きな脳よりも優れた性能を発揮できることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →