Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time
本論文は、層別関連性伝播を用いてキー・ベクトル表現を動的に調整し、テキスト事前知識よりも知覚入力への依存度を高めることで、マルチモーダル大規模言語モデルにおける幻覚を軽減する、学習不要の推論時フレームワークである LIME を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢く多才なロボットアシスタントがいると想像してください。このロボットは、写真を見たり、音を聞いたり、テキストを読んだりすることを同時にこなすことができます。それは写真を見たり録音を聞いたりして、何が起きているかを正確に教えてくれる探偵の役割を担うはずです。
しかし、このロボットには悪い癖があります:自分自身に嘘をつくことです。
時々、あなたは空の公園の写真を見せますが、ロボットは自信満々に「犬がボール遊びをしているのが見えます!」と言います。あるいは、無音の録音を再生すると、「猫が鳴いているのが聞こえます!」と主張します。これをハルシネーション(幻覚)と呼びます。ロボットは物語を読んだり物事について話したりすることに慣れすぎており、実際にそこにあるものを見るのではなく、通常何が起きるかに基づいて推測し始めてしまうのです。
問題:ロボットが「テキスト偏重」であること
この論文の著者たちは、ロボットがなぜこのような行動をとるのかを突き止めました。彼らは、ロボットが判断を下す際、その「テキスト脳」(言葉や物語に関する知識)にあまりにも耳を貸しすぎており、ほとんど「目」や「耳」(実際の画像や音)には注意を払っていないことを発見しました。
これは、テストを受ける学生に例えることができます。その学生は一生懸命勉強し、教科書を丸暗記しています。しかし、先生が写真を見せ、「この写真には何が写っていますか?」と尋ねると、その学生は写真を見ずに、教科書から頭に浮かんだ最初のことを書き記してしまいます。証拠を見ていないため、その学生は「ハルシネーション」を起こしているのです。
解決策:LIME(学習推論時モダリティ強化)
研究者たちは、LIMEと呼ばれる解決策を開発しました。素晴らしい点は、ロボットを再教育したり、その脳(コード)を変更したりする必要がなかったことです。代わりに、質問に答える瞬間に「促し」を与えました。
LIME がどのように機能するかを、簡単な比喩を使って説明します。
「スポットライト」の比喩
ロボットが懐中電灯を持った暗い部屋にいると想像してください。
- LIME なしの場合:ロボットは懐中電灯の光を主に本のかさ(テキスト)に当てます。部屋にある実際の物体(画像や音)は無視します。そして、本に基づいて部屋に何があるかを推測します。
- LIME ありの場合:研究者たちは、ロボットがどこを見ているかを検知するスマートセンサーを取り付けました。ロボットが画像を無視し始めると、LIME は懐中電灯の光を優しく画像の方へ戻します。これにより、ロボットは「待て、話す前に画像をもう一度見よう」と言わなければならなくなります。
技術的な仕組み(簡略化)
ロボットは単語を一つずつ答えます。次の単語を選ぶ直前、LIME は介入して以下のように問いかけます。
- 「この単語を決めるのに、画像はどの程度役立ちましたか?」
- 「テキストはどの程度役立ちましたか?」
画像が十分に役立っていなかった場合、LIME はロボットの内部記憶(特に脳内の「キー」と「バリュー」部分)に微小で一時的な調整を加え、画像の重要性を高めるようにします。これは一瞬で行われ、次の単語のためにリセットされます。まるで、選手がスイングする直前にコーチが「ボールを見ろ!」と囁くようなものです。
試した結果はどうでしたか?
研究者たちはこの手法をさまざまなタスクでテストしました。
- 視覚:ロボットに写真を見せ、「スポーツボールはありますか?」や「この画像を説明してください」と尋ねました。
- 音声:音を再生し、「猫の鳴き声が聞こえますか?」と尋ねました。
結果:
- 嘘の減少:ロボットは存在しない物体をでっち上げなくなりました。ボールがない場合、「はい」と推測する代わりに「いいえ」と答えました。
- 焦点の改善:ロボットが何かについて話したとき、それは実際に画像の正しい部分や音の正しい瞬間を見ていました。
- 再教育不要:ロボットを再教育するために数ヶ月を費やす必要はありませんでした。彼らは、ロボットが回答している間の思考プロセスを変更しただけです。
トレードオフ
一つだけ注意点があります。LIME はロボットが言うすべての単語ごとにこの追加の「スポットライト調整」を一時停止して行う必要があるため、回答を得るまでに少し時間がかかります。まるで、非常に賢いアシスタントが、すべての文の前に自分の作業を再確認するため、わずかに遅くなるようなものです。しかし、速度よりも正確さが重要な状況では、これは大きな勝利です。
まとめ
この論文は、AI モデルが言葉の記憶に頼りすぎており、実際に見ているものや聞いているものへの依存度が不足しているため、しばしば嘘をつくことを示しています。新しい手法であるLIMEは、AI が話す直前に証拠(画像や音)に注意を払うよう強制するリアルタイムのコーチとして機能し、AI を最初から再訓練することなく、はるかに誠実で正確な回答をもたらします。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。