← 最新の論文
💻 computer science

MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

本論文は、大規模視覚言語モデルにおける幻覚を軽減するための軽量フレームワークであるMHSAを提案し、これは単純なMLPを訓練して修正されたクロスモーダル注意パターンを生成することで、基盤モデルのパラメータを変更することなく、さまざまなデータセットにわたって幻覚の低減を実現する。

原著者: Wei Ding, Yilin Li, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Wei Ding, Yilin Li, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、教養豊かな司書(AI)が、一枚の写真を見てその写真に関する物語を語ってくれると想像してください。この司書は驚くほど才能に恵まれていますが、悪い癖があります。興奮したり自信過剰になったりすると、実際には写真に存在しない細部を捏造し始めてしまうのです。例えば、実際には自転車など一切ない静かな公園の写真なのに、「赤い自転車が見えます」と言うかもしれません。これをハルシネーション(幻覚)と呼びます。

ご提示いただいた論文は、この問題を解決するために、司書を解雇したり、最初から再訓練したりすることなく機能する新しいツール、MHSA(Steered Attention によるハルシネーションの軽減)を紹介しています。

以下に、MHSA の仕組みを簡単な比喩を用いて説明します。

1. 問題:司書の「視線」

司書が質問に答えるために写真を見る際、一度に全体を見るわけではありません。何を言うかを決めるために、画像の特定の部分に「視線」(アテンションと呼ばれる)を集中させます。

  • 問題点:司書がハルシネーションを起こすとき、その視線はしばしば「ふらつき」があったり、間違ったものを見ていたりします。例えば、「犬が見えます」と言う場合、実際の犬に焦点を当てるのではなく、犬のように見える草地の一片に視線が漂っている可能性があります。
  • 以前の試み:この論文以前、研究者たちは司書が嘘をついているときに検知する「警備員」(検出器)を構築できました。しかし、その警備員は「おい、ハルシネーションを起こしているぞ!」と言うことしかできず、リアルタイムで司書の視線を修正することはできませんでした。他の方法は、硬直的なルールを使って司書をより強く見るように強制しようとしましたが、これらは壊れたハンドルで車を操ろうとするようなもので、硬すぎて適応できませんでした。

2. 解決策:「ハンドル」(MHSA)

MHSA は、司書の視線に取り付けられた賢く軽量なハンドルのように機能します。司書を置き換えるのではなく、視線が迷い始めるときに、それを正しい方向へ優しく導くだけです。

以下がステップバイステップのプロセスです。

  • ステップ 1:チェック(警備員):司書が最終的な回答を出す前に、小さな事前学習済みの「警備員」(DHCP という以前の研究に基づく)が司書の現在の視線を素早くスキャンします。「司書は正しいものを見ているのか、それとも捏造しているのか?」と問いかけます。
  • ステップ 2:導き(ジェネレーター):警備員が「はい、ハルシネーションを起こしています」と言ったら、小さな高速なコンピュータプログラム(ジェネレーターと呼ばれる単純な 3 層の「脳」)が作動します。
    • このジェネレーターを修正コーチと考えてください。司書のふらつく視線を見て、わずかな調整を計算します。
    • 物語全体を書き換えるのではなく、視線をわずかにずらすだけで、写真にある実際の物体に視線が着くようにします。
  • ステップ 3:修正:司書の視線が新しい正しい場所へ「操舵」され、司書は実際に今見ているものに基づいて回答します。

3. なぜこれが特別なのか

この論文は、このアプローチの 3 つの主な利点を強調しています。

  • 軽量である(「アドオン」アプローチ):巨大で高価な図書館の建物(大規模 AI モデル)を持っていると想像してください。それを壊して再建する必要はありません。MHSA は入口に設置される小さなポータブルなキオスクのようなものです。視線を修正する小さな単純なヘルパーを訓練するだけで、巨大な図書館はそのままにします。これにより、莫大な時間と費用を節約できます。
  • 推測するのではなく、学習する:古い方法は固定されたルール(「常に中心を見る」など)を使用していました。MHSA は異なります。「悪い視線」と「良い視線」の数千の例を見て、視線を修正する方法を学習します。司書が今まさに犯している特定のミスに適応します。
  • 「はい/いいえ」にも「物語」にも機能する
    • 識別タスク:「飛行機はありますか?」と尋ねた場合、MHSA は飛行機がないときに「いいえ」と正しく答えるのを助けます。
    • 生成タスク:司書に写真についての物語を書くよう頼んだ場合、MHSA は物語を単語ごとに書き進める間に、存在しないもの(例えば「缶詰」など)を捏造するのを防ぎます。

4. 結果

研究者たちは、Qwen、InternVL、LLaVA などの AI モデルといった、さまざまな種類の賢い司書に対してこの「ハンドル」をテストしました。

  • 結果:司書たちの誤りは大幅に減少しました。存在しない物体を捏造することをやめ、以前は見逃していた物体に気づき始めました。
  • トレードオフ:このシステムは非常に効率的で、問題を検出したときのみ視線を「操舵」するため、遅延はごくわずか(通常の速度の約 0.4 倍)です。ほとんどの場合、司書はすでに正しい場所を見ているため、ハンドルはアイドル状態のままです。

まとめ

要約すると、MHSAは、AI のためのリアルタイムの視線修正器として機能する、賢く低コストなアドオンです。AI に最初からすべてを学習させるのではなく、AI が空想にふけり始めるときに、その注意を現実に優しく導くことで、AI を大規模な見直しなしに、より信頼性が高く、信頼できるものに変えます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →