VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
本論文は、質問に関連する視覚的証拠を明示的に収集し、局在化と推論の共同最適化を向上させるための新しいRS-GRPOアルゴリズムを採用することで、マルチイメージ推論における視覚的ハルシネーションを軽減するエビデンス誘導型フレームワークであるEVisRAGを提案しており、視覚的質問応答のベンチマークにおいて大幅な性能向上を実現している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは一つの手がかりではなく、三つの異なる新聞、写真、地図が混ざり合った、めちゃくちゃな束を渡された状態で、あるミステリーを解こうとしているところだと想像してください。あなたのポケットには、テキストを読み、画像を見ることができる「Vision-Language Model(VLM)」という名前の、非常に賢い探偵(コンピュータプログラム)が入っています。この探偵は質問に答えるのが得意なのですが、大量の画像に直面すると、時々混乱してしまうことがあります。例えば、実際には犬であるものを猫だと主張したり、二つの異なるページから事実を混ぜ合わせてしまったりと、見ていない詳細をでっち上げることがあります。これは「視覚的ハルシネーション(幻覚)」と呼ばれます。
これらの探偵を助けるために、科学者たちは「Visual Retrieval-Augmented Generation(VRAG)」と呼ばれるシステムを開発しました。これは、探偵に図書カードを渡すようなものだと考えてください。質問を受けると、システムはライブラリから最も関連性の高いページを即座に引き出し、探偵に手渡します。適切な証拠が目の前にある状態にすれば、探偵は推測したり、作り話をしたりする必要がなくなるという考えです。しかし、たとえ正しいページを手渡されたとしても、探偵はノイズの中から自分が必要とする正確な文章や画像を見つけ出すのに苦労したり、無関係な詳細に気を取られて、依然として作り話をしたりすることがよくあります。では、どうすれば探偵に、すべてのページを注意深くスキャンし、実際に見た事実だけを書き留め、そして推測することなく謎を解く、真の捜査官になってもらえるのでしょうか?
これこそが、「VisRAG2.0」(具体的にはEVisRAGフレームワーク)という論文が解決しようとしている問題です。中国の大学の研究チームである著者らは、これらのAI探偵がハルシネーションを起こすのをやめ、実際の証拠に基づいて推論するように訓練するための新しい方法を提案しています。彼らは、従来の手法は、探偵に紙の束を渡して「とにかく自分で何とかしろ!」と言っているようなものであり、それがしばしば混乱を招いていることを見出しました。代わりに、EVisRAGはモデルに対し、**観察(Observe)、記録(Record)、推理(Reason)**という厳格な3ステップに従う、細心の注意を払う探偵として振る舞うことを強制します。
まず、モデルは検索された画像を見ながら、ページごとに何が見えるかを明示的に述べます。次に、モデルは「証拠ログ」を作成し、各画像から特定の事実を書き出し、極めて重要な点として、画像に有用な情報が含まれていない場合はその旨を記します。最後に、モデルはその書き留めたログのみを使用して問題を解決します。モデルが実際にこの振る舞いを学習できるようにするために、研究者たちはRS-GRPO(Reward-Scoped Group Relative Policy Optimization)と呼ばれる新しい訓練手法を考案しました。これは、最終的な答えに対して単に成績をつけるのではなく、「正しい画像を見たか?」というスコアと、「事実を正しく書き留めたか?」という別のスコアを個別に与える、非常に厳しいコーチのようなものだと考えてください。これにより、モデルが運良く正解を当てただけで高い評価を得てしまうことを防ぎ、証拠を先に見つけることを確実に学習させることができます。
この新しいアプローチの結果は非常に印象的です。様々な視覚的質問回答ベンチマーク(チャート、文書、スライドの読み取りなど)でテストされた際、EVisRAGモデルは、標準的な「バックボーン」モデルを平均して約**19%**上回る精度を一貫して示しました。さらに重要なことに、モデルが事実を捏造する回数を大幅に減少させました。ある特定のテストでは、標準的なモデルはチャートを見て、間違った国の人口が多いと自信満々に答えてしまう(数字をハルシネーションさせた)ことがありますが、EVisRAGはチャートを見て、正しい数字を証拠ログに書き込み、そして正しく推論して答えを導き出します。
また、この論文は、単にモデルに「長く考えさせる」ことや、より複雑なエージェントをシステムに追加することが最善の解決策であるという考えに異を唱えています。むしろ、構造化され、証拠に基づいたアプローチと、彼らの特定の訓練手法(RS-GRPO)を組み合わせることがより効果的であることを示しています。報酬の範囲を限定する(適切なタイミングで適切な行動に対してのみクレジットを与える)ことで、モデルがより安定し、信頼性が高まることを実証しました。この論文は、これがAIに関するあらゆる問題を解決すると主張しているわけではありませんが、実験結果は、この手法が視覚的AIシステムをより信頼でき、正確で、複数の画像を見ている時に作り事をする傾向を減らすための大きな一歩であることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。