← 最新の論文
💻 computer science

SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification

SAVAA は、トークンレベルの幻覚リスクを推定し、生成中に視覚的注意増幅係数を適応的に調整するために視覚的グラウンディングエントロピーを導入することで、固定された増幅戦略の限界を克服し、大規模視覚言語モデルにおける幻覚を軽減するトレーニング不要なフレームワークである。

原著者: Jiacheng Zhang, Feng Liu, Chao Du, Tianyu Pang

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Jiacheng Zhang, Feng Liu, Chao Du, Tianyu Pang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いロボットアシスタント(大規模視覚言語モデル、または LVLM)が写真を眺め、それをあなたに説明していると想像してください。時々、このロボットは少し自信過剰になり、でたらめを言い始めます。例えば、実際には写真に犬がいないにもかかわらず、「写真の中に犬がいる」と言うかもしれません。これをハルシネーション(幻覚)と呼びます。

ロボットがこのようなことをする理由は、世界が通常どのように聞こえるかという「記憶」(言語的事前分布)に頼りすぎており、その瞬間に写真で実際に何が見えているかに対しては十分に依存していないからです。

旧来の方法:「万能型」の音量ノブ

最近、研究者たちはこの問題を解決するために、ロボットの視覚的注意の「音量」を上げる試みを行いました。ロボットには「写真を見る」ための音量ノブと、「自分の思考を聞く」ための別の音量ノブがあると想像してください。

従来の手法は固定式の音量ノブを使用していました。ロボットが書くすべての単語に対して、単に「写真を見る」音量を同じ量だけ上げます。

  • 問題点: これは、同じ音量設定で静かなささやきと大きな叫び声を聞き分けようとするようなものです。
    • 時にはロボットが嘘を止めるために写真をもっと熱心に見る必要があるのに、固定された音量が低すぎます(過小増幅)。
    • 別の時には、ロボットはすでに詳しく見ていますが、音量が高すぎるため、凝視しすぎて実際には存在しないものを「見て」しまい始めます(過大増幅)。

この論文では、これを**「二重の失敗パターン」**と呼んでいます:固定設定は、時には弱すぎて、時には強すぎるのです。

新しい解決策:SAVAA(賢く適応するパイロット)

著者たちは、SAVAA(段階的適応視覚注意増幅)と呼ばれる新しい手法を提案しています。固定されたノブの代わりに、SAVAA は単語ごとにリアルタイムで制御を調整する賢いパイロットのように機能します。

以下に、その仕組みをステップごとに説明します。

1. 「リスクレーダー」(視覚的グラウンディングエントロピー)

ロボットが次の単語を書く前に、SAVAA はロボットが嘘をつこうとしているかどうかを確認するために「リスクレーダー」をチェックします。これには視覚的グラウンディングエントロピー(VGE)という特別なツールが使用されます。

  • 仕組み: 2 つの質問を投げかけます。
    1. ロボットは不確実ですか?(高い不確実性=リスク)。
    2. ロボットはこの単語のために写真を見ていますか?(ロボットが自信を持っていても、写真がその単語を支持していない場合、それは大きなリスクです)。
  • アナロジー: ロボットがビーチを説明していると想像してください。「砂」と言えば、写真がそれを支持するため、リスクは低いです。しかし、「雪」と言えば(写真が明らかにビーチである場合)、ロボットが単語「雪」に対して非常に自信を持っていても、リスクは高くなります。

2. 「動的な音量ノブ」

リスクレーダーに基づいて、SAVAA は次の単語に対する「写真を見る」音量を調整します。

  • 高リスク: ロボットが何かリスクのあることを言いかけるとき、SAVAA は視覚的注意を最大限に上げます。これにより、ロボットは話す前に写真を詳しく見ることを強制されます。
  • 低リスク: ロボットが安全で、写真がその単語を明確に支持している場合、SAVAA は音量を下げます。これにより、ロボットが「過度に熱心」になり、新しい詳細を捏造することを防ぎます。

3. 古い思考のための「ミュートボタン」

時には、完璧な視覚的焦点を持っていても、ロボットは依然として内部的な「物語作り」の習慣に頼りすぎてしまいます。これを修正するために、SAVAA はテキスト注意抑制機能を追加します。

  • アナロジー: ロボットが写真を説明しようとしているが、背景でラジオが物語を流し続けていて、気が散り続けていると想像してください。SAVAA はラジオ(テキスト入力)を優しくミュートし、ロボットが写真に純粋に集中できるようにします。これにより、ロボットが写真の中にあるからではなく、物語の中で「聞こえが良い」からといって文を終わらせることを防ぎます。

なぜこれが重要なのか

この論文では、LLaVA、Qwen、InternVL という 3 つの異なる賢いロボット(LLM)で、ロボットが画像を説明する必要があるさまざまなテストを用いて、この手法をテストしました。

  • 結果: 従来の「固定音量」方式と比較して、SAVAA は捏造された詳細(ハルシネーション)の数を大幅に削減しました。
  • 効率性: ロボットの再訓練を行ったり、実行速度を遅くしたりすることなく、これらすべてを実現します。ロボットが思考している間、単に注意のノブを微調整するだけです。

まとめ

旧来の方法は、直線道路でも曲がりくねった山道でも、アクセルを 50% 押しっぱなしにするドライバーのようなものです。カーブで減速しなかったり、坂道で加速しすぎたりしなかったため、衝突(ハルシネーション)する可能性があります。

SAVAAは、道路、速度、条件を絶えず確認し、すべての曲がり角ごとにアクセルとブレーキを完璧に調整するドライバーです。これにより、ロボットは見たものだけを、それ以上でもそれ以下でもなく、正確に説明することが保証されます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →