Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs
本論文は、視覚的に根拠付けられ、かつポリシーに整合した選好データを合成することで、視覚言語モデルにおけるハルシネーションを大幅に軽減し、一般的な視覚能力を向上させつつ、ハルシネーション・ベンチマークにおいて新たな最先端の性能を達成する2段階のフレームワークであるViPSyを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
視覚言語モデル(VLM)を、目隠しをされた非常に賢く博識な美術評論家だと想像してみてください。その評論家には、友人が絵の内容を説明してくれています。しかし問題は、この評論家は美術史に関する知識に夢中になりすぎて、実際の絵には描かれていないものまで描写してしまうことがある点です。例えば、「庭園には通常、鷲がいるものだ」という学習データに基づき、静かな庭の絵に対して「黄金の鷲がいる」と主張してしまうようなことです。これを**ハルシネーション(幻覚)**と呼びます。
この論文では、これを解決するための新しい手法であるViPSy(Vision-driven Preference Synthesis:視覚駆動型選好合成)を紹介しています。ViPSyを、評論家に自分の想像力ではなく、実際の絵をしっかりと見るように教え込むための、巧妙なトレーニングキャンプだと考えてください。
ViPSyの仕組みを、2つのシンプルな段階に分けて解説します。
ステージ1:「現実の確認」(自己キャプションによる意味論的合成)
写真の中に正確に何があるかを知りたいけれど、自分の記憶が正しいか自信がない状況を想像してください。
- 記述: まず、AIは元の写真を見て、その詳細な説明(キャプションのようなもの)を書きます。
- 再想像: 次に、その記述をもとに、別のAI(テキストから画像を生成するAI)に対し、その言葉だけに基づいて新しい絵を描くよう指示します。
- 比較: これを数回繰り返し、元の写真に基づいた、少しずつ異なるいくつかの「再想像図」を作成します。
- 共通項の発見: システムは、元の写真とこれらの新しい図画を比較します。そしてこう問いかけます。「元の写真に写っており、かつ、ほとんどすべての新しい図画にも登場するオブジェクトは何だろうか?」
- もし元の写真に赤いトラックがあり、記述に基づいた新しい図画にも一貫して赤いトラックが描かれていれば、それは確かな事実です。
- もし元の写真には木があるのに、新しい図画ではその木が忘れられたり、変わってしまったりする場合、システムはその詳細が不確かなものであると判断します。
このステージの結果として得られるのが**「視覚的キュー(Visual Cue)」**です。これは、画像の中に存在する、疑いようのない、極めて確実なオブジェクトの「信頼できるチェックリスト」(例:「赤いトラック」「木」「青い空」)だと考えてください。これにより、推測の余地が排除されます。
ステージ2:「ガイド付き練習」(キュー条件付き自己蒸留)
今やAIには、この信頼できるチェックリストがあります。そこで、AIは再び写真の記述に戻ります。
- 練習走行: AIは再び写真を説明しようと試みますが、今度はこの「視覚的キュー」のチェックリストを念頭に置くことが強制されます。これは、評論家に対して「必ず赤いトラックと木に触れ、余計なことは作り出すな」と指示するようなものです。
- 選択肢の生成: AIはこのガイダンスに従って、いくつかの異なる記述を生成します。非常に正確なものもあれば、依然としてミスをして、存在しないオブジェクト(例えば、実際にはない「青い車」など)を付け加えてしまうものもあります。
- 審判: 超高性能な「審判」AIが、これらすべての選択肢を精査します。審判は元の写真と比較し、以下を選別します。
- 勝者: チェックリストを厳守し、写真の内容を完璧に捉えた記述。
- 敗者: ハルシネーションを起こし、事実ではないことを作り出した記述。
最終レッスン(選好アライメント)
システムは、これらの「勝者 vs 敗者」のペアを取り出し、メインのAIモデルにこう教えます。「次からは、敗者のようではなく、勝者のように話しなさい」。
こうすることで、AIは自身の内部的なバイアス(そこに何があるべきかという「思い込み」)よりも、視覚的な証拠(チェックリスト)を信頼することを学びます。
なぜ従来の手法よりも優れているのか?
この論文は、従来の手法には主に2つの欠点があると主張しています。
- 「編集」手法: 一部の手法は、誤った回答を取り上げ、それを手動で正しいものへと修正します。論文によれば、これは教師が生徒のエッセイを書き直しているようなものであり、生徒は自分自身で正しく書く方法を学べず、最終的な結果も不自然なものになってしまいます。
- 「ランダムな推測」手法: 他の手法は、単にAIに何度も推測させ、その中から最良のものを選ぶというものです。論文によれば、これではAIが画像を注意深く見るのではなく、依然として自身の想像力に頼ってしまうため、失敗することが多いといいます。
ViPSyが特別なのは、AI自身の「想像力」(自然な話し方)を利用しながらも、厳格な視覚的チェックリストによってそれを導いている点です。これにより、AIが自然な口調を保ちながら、真実を語るようにさせています。
結果
論文によれば、この手法を用いることで、AIは物事を捏造しない能力が大幅に向上したとのことです。
- あるテストではハルシネーション(オブジェクトの捏造)を約35%、別のテストでは**24%**減少させ、これまでのあらゆる手法を上回りました。
- また、複雑なシーンの理解やオブジェクトの認識といった一般的なタスクにおいても精度が向上しており、AIに「見たままを話す」よう強制することが、単に口を慎ませるだけでなく、その「目」をより鋭くさせたことを証明しています。
要約すると、ViPSyは、記述、再描画、そして比較という巧妙なループを用いることで、AIに「推測するのをやめて、しっかり見る」ことを教えるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。