See2Think: Do Multimodal Models Really Use Intermediate Visual States?
本論文は、1,200サンプルのベンチマークとVisual Action-of-Thoughtプロトコルからなる統一的な評価フレームワークであるSee2Thinkを紹介し、マルチモーダルモデルが中間的な視覚状態に対して行動依存性を示す一方で、その推論精度はレンダリングの忠実度によって大きく制約され、モデルや環境によって著しく変動することを明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
難しいパズルを解こうとしている場面を想像してみてください。ただ絵を見るだけでなく、鉛筆を手に取り、線を引いたり、手がかりを丸で囲ったり、紙の上に自分の思考をスケッチしたりできるとしたらどうでしょう。これが、**マルチモーダル大規模言語モデル(Multimodal Large Language Models)**の世界です。これらは、テキストを読み、画像を「見る」ことができる超スマートなコンピュータプログラムです。しばらくの間、これらのモデルは、ステップを書き出すという「思考の連鎖(Chain-of-Thought)」と呼ばれるテクニックによって、「声に出して考える」能力を高めてきました。しかし、3D空間や複雑な幾何学を含む多くのパズルは、言葉だけで解くには困難です。人間は思考を助けるために自然と図を描きます。そこで科学者たちは疑問に思いました。「これらのAIモデルは、中間的な図やスケッチを実際に使って問題を解いているのだろうか、それとも単にふりをしているだけなのだろうか?」
これが、研究者たちが問いかけている大きな問題です。もしAIが「これを理解するためにここに線を引く必要がある」と言ったとき、そのAIは本当にその新しい図を使って答えを見つけ出しているのでしょうか? それとも、図を無視して答えを推測しているだけなのでしょうか? これは、ある生徒が数学の問題を解く際に、実際に計算用紙を使っているのか、それとも単に意味のない落書きをして、最終的な答えが魔法によって導かれるのを待っているだけなのか、と問うようなものです。モデルが作成した視覚的ツールを真に活用していないのであれば、それらを賢くするためにつくる機能は時間の無駄である可能性があるため、この理解は極めて重要です。
ここで、AIの推論に対する探偵のような役割を果たす新しい研究、See2Thinkが登場します。研究者たちは、2D幾何学や化学図式から、3Dロボットシーン、現実世界の物理問題に至るまで、1,200種類もの異なるパズルを含む、See2ThinkBenchと呼ばれる巨大なテスト環境を構築しました。彼らは単にモデルに答えを求めるのではなく、Visual Action-of-Thought (VAoT) と呼ばれる特別なプロトコルを設定しました。これは、AIがターン制のゲームを行うようなものです。まず考え、次に「描く」こと(特定の角度を強調したり、一部をクロップしたりするなど)を決定し、次に別のツールが実際にそれを描き、最後にAIがその新しい図を見て思考を継続するという仕組みです。
チームは、このゲームをどのように扱うかを調べるために、4つの強力なAIモデルをテストしました。その結果、「万能な勝者」は存在しないことが分かりました。言葉だけで考える(描画なし)方がうまくいくこともあれば、実際に描画されたものを見ることが役立つこともありました。しかし、ここにはひねりがあります。モデルは、何を描くべきか(正しい手がかりを選ぶこと)については驚くほど優れていましたが、その図を正しく「使う」ことにはしばしば失敗したのです。実際、この研究では、最大のボトルネックは正しいアクションを選択することではなく、図自体の「忠実性(faith-fullness)」、つまりツールがAIの指示通りに描いたかどうかであったことが判明しました。
おそらく最も興味深い発見は、研究者がモデルに仕掛けた「トリック」から得られました。彼らは、見た目はAIが求めた通りだが、実際には間違っていたり誤解を招いたりする「破損した」図を意図的に与えました。これが起こると、モデルのパフォーマンスは著しく低下し、特に3Dシーンでは精度が10パーセント以上低下しました。このことは、モデルがたとえその状態が壊れていたとしても、目に見える視覚的状態に純粋に依存していたことを証明しています。しかし、この研究は、モデルが図に「依存」しているからといって、その図が答えを得るための「助け」になったとは限らないことも示唆しています。モデルは視覚的なフィードバックにあまりにも依存していたため、たとえ悪い図であっても、それが原因で混乱して失敗してしまうことがありました。これは、「視覚的状態を使うこと」と「それによって恩恵を受けること」は全く別物であることを示しています。
要するに、この論文は、AIモデルが視覚的推論の「概念」には長けてきているものの、自らのスケッチを実行し、それを信頼するという泥臭い現実にはまだ苦戦していることを明らかにしています。彼らは、図のどの部分を見るべきかは正確に分かっていても、自分で作った新しいスケッチを実際に読み取る際に迷子になってしまう学生のようなものです。研究者たちは、最終的な答えを見るだけでなく、プロセス全体を診断する必要があると結論付けています。つまり、図が関連していたか、正しく描かれたか、そしてモデルがそれを思考に実際に使用したかどうかをチェックすることです。これらのボトルネックを解決しない限り、「画像を使って考えること」は、まだ真の超能力というよりは、一種のパフォーマンスに過ぎないのかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。