Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
本論文は、非意味的トークンからの注意の再分配、空間的歪みを防ぐためのKVキャッシュ特徴量の整合、および言語的事前分布に対抗するための対照的デコーディングの適用を通じて、追加の学習や大幅な実行時のオーバーヘッドなしに、大規模視覚言語モデルにおけるハルシネーションを軽減する学習不要のフレームワークであるSaliency-Driven Perceptual Realignment(SDPR)を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
急速に進化する人工知能の世界において、視覚と聴覚を同時に扱うことができる新世代のシステムが登場しました。これらの大規模視覚言語モデルは、デジタルな観察者として機能し、写真を注視してその中で起きていることを説明したり、シーンに関する質問に答えたりすることができます。彼らは視覚的な世界と言語を結びつけることを学び、ピクセルと単語の間の架け橋を築きました。しかし、流暢でしばしばもっともらしい文章を生成する驚異的な能力にもかかわらず、これらのシステムには、根強く、かつ苛立たしい欠陥が存在します。それは、彼らが頻繁に「嘘をつく」ことです。画像には青い凧が写っているのに、自信満々に赤い風船を持っている人物を描写したり、存在しない詳細を捏造したりすることがあります。この「ハルシネーション(幻覚)」と呼ばれる誤った情報を生成する傾向は、モデルが今まさに見ているものよりも、以前に読んだ内容に深く依存していることに起因しています。視覚的な証拠が不明瞭であったり複雑であったりする場合、システムはしばしば自身の内部にある言語パターンのライブラリに基づいた推測へと陥り、正しく聞こえるものの、事実としては間違った回答を生み出してしまうのです。この信頼性の欠如は、正確さが不可欠な実世界の状況において、これらの強力なツールを信頼することを妨げています。
西安電子科技大学と清華大学の研究者たちは、この視覚的な混乱の根本原因を特定し、モデルが答える前に「明確に見る」ための手法を開発しました。彼らの研究は、問題が単なる知識の不足ではなく、モデルが思考する一瞬の間に、見たものをどのように処理し記憶するかという点にあることを明らかにしました。チームは、モデルが画像を分析する際、その注意(アテンション)が重要でない背景の詳細によってしばしば乗っ取られ、画像の最も重要な部分を無視してしまうことを発見しました。さらに、モデルが単語を一つずつ生成し始めるにつれ、視覚的なシーンに対する記憶が劣化し、歪み、問いかけられている特定の質問との結びつきが弱まってしまうのです。これを修正するために、研究者たちは「サリエンシー駆動型知覚再整列(Saliency-Driven Perceptual Realignment)」と呼ばれる、学習を必要としないフレームワークを導入しました。このアプローチは、巨大なAIモデルをゼロから再学習させる必要はなく、代わりに思考プロセス中のガイドとして機能し、モデルの焦点と記憶を優しく修正することで、画像の視覚的な現実にしっかりと根ざした状態を維持させます。
修正プロセスの第一段階は、モデルが最初に画像を見る瞬間に対応しています。研究者たちは、モデルの内部のアテンション機構が、しばしば「シンク・トークン(sink tokens)」、つまり、意図せず過剰な注目を集めてしまう無意味な背景要素に捕まってしまうことを発見しました。騒がしい部屋で会話を聞こうとしている人を想像してみてください。もしその人の注意が、うるさくて無関係な音によって乗っ取られてしまったら、重要な言葉を聞き逃してしまうでしょう。同様に、モデルはこれらの背景による妨害によって、人物の顔や特定の物体といった重要な視覚的手がかりが掻き消されてしまう状態にありました。新しい手法はこの乗っ取りが発生していることを検出し、モデルのアテンションを再分配することで、ノイズから注意を引き離し、画像の意味のある部分へと引き戻します。これを行うことで、モデルは以前に無視していた抑制された視覚的証拠を回復し、話し始める前にシーンをより正確に捉えることができるようになります。
モデルがより明確な視界を得た後、二番目の課題は、回答の生成を開始する際に発生します。モデルは、新しい単語を書くたびに参照するために、画像のメモリ(記憶)を保持します。しかし、研究者たちは、このメモリが時間の経過とともに歪んでいくことを観察しました。モデルは画像と質問を特定の順序で処理するため、視覚的な詳細のメモリが、質問に対する実際の重要性ではなく、シーケンス内での位置に紐付けられてしまうのです。それはまるで、ある特定の物体がシーケンスの早い段階で見られたために重要であることをモデルが忘れ、一方で、後の重要度の低い詳細がメモリの中で過度に目立つようになるかのようです。これに対抗するため、新しいフレームワークはこの内部メモリを再整列させます。現在の質問に実際に深く関連している画像の部分を強調する信号を注入することで、モデルのメモリがプロセス全体を通じて、無関係な詳細へと漂うことなく、正しい視覚的証拠に焦力的であり続けるようにします。
最後に、明確な視界と優れたメモリを持っていたとしても、モデルは依然として、既存の言語習慣に頼ってしまう誘惑に直面します。時には、画像に基づけば答えは「はい」であるはずなのに、モデルの内部的な言語パターンが、それが学習データの中で一般的なフレーズであるために、強く「いいえ」を示唆してしまうことがあります。これを防ぐために、研究者たちは、モデルの視覚に基づく予測と、自身の言語習慣から構築されたリファレンス(参照)を比較する最終チェックを追加しました。もし両者が一致しない場合、システムは言語ベースの推測を積極的に抑制し、モデルに視覚的証拠に従うよう強制します。この対照的なプロセスにより、最終的な回答が、モデルが期待する姿ではなく、実際に画像の中に存在する内容によって導かれることが保証されます。
この三部構成の戦略を適用した結果は極めて重要です。様々な異なる大規模視覚言語モデルを用いてテストを行った際、この手法は一貫してハルシネーションを減少させ、回答の正確性を向上させました。モデルが物体を正しく識別する頻度を測定する特定のテストでは、この新しいアプローチは最大で7ポイント近い改善を示し、ハルシネーションの詳細が発生する頻度を測るテストでは、エラーを3分の1以上減少させました。決定的なのは、これらすべてが、高価な再学習や追加のデータを必要とせず、モデルが作業中にどのように注意を払い、情報を記憶するかを調整するだけで達成されたという点です。初期の注視から最終的な文章に至るまで、視覚的な認識の劣化を体系的に対処することで、この研究は、これらの強力なAIシステムをより信頼性の高いものにし、それが見ていることについて真実を語るための堅牢な方法を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。