LaViSA: A Language and Vision Structural Ambiguity Benchmark
本論文は、構造的曖昧さを解消するビジョン・ランゲージモデルの能力を評価するために、7つのカテゴリにわたる曖昧な文章とそれに対応する曖昧さを解消する画像で構成されたベンチマークであるLaViSAを導入し、現在のモデルはある程度の能力を示しているものの、特定の曖昧さの型や微細な視覚的区別においては依然として苦戦していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
馬と鳥の写真を見ているところを想像してください。誰かがあなたに、「馬と、空を飛んでいる鳥」と書かれたメモを渡しました。
さて、立ち止まって考えてみてください。それは実際には何を意味しているのでしょうか?
- 解釈A: 馬も飛んでおり、鳥も飛んでいる。
- 解釈B: 馬は地上に立っており、鳥だけが飛んでいる。
これは、言語学者が**構造的曖昧性(structural ambiguity)**と呼ぶものです。この文章には2つの有効な解釈があり、もっと多くの手がかりがない限り、どちらが正しいのかを知ることはできません。人間はこの能力に長けています。もし写真の中で馬が地面にいるのを見れば、私たちの脳は即座に「解釈B」を選択します。
では、AIにはそれができるのでしょうか?これこそが、この論文**「LaViSA」**が答えを出そうとしている問いです。
問題点:AIの「盲点」
著者たちは、LaViSA(Language and Vision Structural Ambiguity:言語と視覚の構造的曖昧性)と呼ばれる新しいテストを作成しました。これは、AIモデルが目と耳を同時に鍛えるための「ジム」のようなものです。
このジムでは、AIに以下のものが与えられます:
- 巧妙な文章(例:先ほどの馬と鳥の例)。
- 意味を明確にするための写真。
- その文章が「どのような意味になり得るか」を示す選択肢のリスト。
AIの任務は、写真を見て、文章を読み、正しい意味を選択することです。それは、写真だけが唯一の手がかりとなる「ストーリー推測ゲーム」のようなものです。
実験:誰がテストに合格したのか?
研究者たちは、最新のGPTやGeminiのような非常に賢く高価な「プロプライエタリ(独占的)」なモデルから、無料のオープンソースモデルまで、多種多様なAIモデルをテストしました。
その結果、以下のようなことが分かりました(簡単な比喩を用いて説明します):
- 「賢い」モデル(プロプライエタリ): これらのモデルは、猛勉強した学生のようです。彼らは概して非常によくできました。例えば、文章が「何がどこに付いているか」に関するもの(例:「少年が笛で少女を呼ぶ」)であった場合、彼らは写真を見るだけで、少年が笛を持っているのか、あるいは少女が持っているのかを判別できました。
- 「苦戦する」モデル(オープンソース): 一部の小さなオープンソースモデルは、十分に勉強不足の学生のようでした。彼らは、写真が実写ではなくカートゥーン(漫画)である場合、多くの場合、ランダムに推測するか、混乱してしまいました。
- 「思考する」モデル: 研究者たちは、回答する前に「考える」ように設計されたモデル(自分の解答プロセスを書き出す学生のようなモデル)もテストしました。驚いたことに、これらは必ずしも標準的なモデルよりも優れた結果を出したわけではありませんでした。時には、考えすぎることでかえって誤った道へ導かれてしまうこともありました。
大発見:AIが躓く場所
AIモデルは進化していますが、依然として大きな盲点を持っています。論文によると、AIは「物体」を特定することには長けていますが、「関係性」を理解することには極めて弱いことが分かりました。
女の子、ノートパソコン、ペン、そして本があるシーンを想像してください。
- 文章: 「女の子は、ノートパソコン、またはペンと本を持っている。」
- 罠: 写真では、女の子はペンと本を持っています。ノートパソコンはすぐ近くの棚の上に置いてあります。
- AIのミス: ノートパソコンが「視覚的に存在している(そこに映っている)」ため、AIは気を取られてしまいます。「あ、ノートパソコンが写真の中に映っている。だから、女の子はそれを手に持っているに違いない!」と考えてしまうのです。AIは、「持つ」という行為が、単に「近くにある」ことではなく、特定の動作であることを理解できていません。
論文では、これを**連体修飾の範囲(Conjunction Scope)および省略(Ellipsis)**に関する苦戦と呼んでいます。
- 連体修飾の範囲: 「または(or)」や「と(and)」が含まれるとき、AIはどのアイテムがどの動作に属しているのかを判断できません。
- 省略: もし文章が「ライオンが鶏を食べる。また、猫も」であった場合、AIは、猫も鶏を食べているのか、それとも猫も食べられているのかを判断するのに苦労します。AIは視覚的な詳細に迷い込み、文法を見失ってしまうのです。
結論
この論文は、視覚的なシーンはAIが言語を理解するのを助ける強力なツールであると結論付けています。写真が明確であれば、AIはそのパズルを解くことができます。
しかし、AIは依然として、ランドマーク(名所)は認識できるものの、現地の文化を理解していない観光客のような状態です。彼らは写真の中の物体は見えますが、それらを文章の正しい「ストーリー」へと結びつけることに失敗することがよくあります。「その物体がそこにあるからといって、文章が記述している動作を行っているとは限らない」ということを、彼らは理解できていないのです。
著者たちは、AIモデルがまさにどこで失敗しているのかを示すためにこのベンチマークを構築しました。これにより、将来の研究者が、AIに表面的な画像以上の深い部分を見るように教えることができるようになるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。