← 最新の論文
💬 NLP

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

SIRA は、後続の層におけるマスクド・アテンションを用いて同一トランスフォーマー内で言語事前分布優勢の対照的仮定参照を生成することにより、大規模視覚言語モデルにおける幻覚を軽減するトレーニング不要の内部対照的デコーディング枠組みであり、記述的カバレッジを維持しつつ外部ツールや追加のフォワードパスへの依存を低減する。

原著者: Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが今さっき見せた画像を説明しようとしている、非常に賢く読書家なアシスタント(大規模視覚言語モデル)を想像してみてください。ときどき、このアシスタントは実際にそこにあるものではなく、自分が「見ている」と思っていることに対して、少し過剰な自信を持ってしまうことがあります。画像が実際には単に自転車の可能性のあるぼやけた形なのに、「赤い自転車が見えます」と言ったり、自転車についての物語をあまりにも多く読んでいるため、脳が空白を埋めてしまい、詳細を捏造したりすることがあります。これをハルシネーション(幻覚)と呼びます。

この論文は、アシスタントを再訓練したり、作業を二重チェックするために第二の人を雇ったりすることなく、このハルシネーションを食い止めるための巧妙な新手法SIRAを紹介しています。

従来の手法の問題点

以前、アシスタントが嘘をつくのを防ぐために、研究者たちは以下のような手法を試みました:

  1. アシスタントに元の画像を見せる。
  2. 次に、同じ画像のぼやけたり歪んだりしたバージョンを見せる。
  3. 二つの回答を比較する。画像がぼやけたときにアシスタントが話を変えるなら、おそらく推測していたのかもしれない。

欠点:これは、誰かに絵画の説明を求めた後、同じ絵画を説明する際に「霧のかかった眼鏡」をかけている状態で説明を求めたようなものです。「霧のかかった眼鏡」バージョンは公平な比較ではありません。なぜなら、眼鏡自体が画像を歪めてしまうからです。これは不条理で、画像を二度見る必要があるため時間がかかり、歪みが新たな誤りを生む可能性があります。

SIRA の解決策:「共有プレフィックス」

SIRA は異なるアプローチを取ります。画像をいじるのではなく、アシスタントがまだ思考している最中に、その内部思考プロセスを操作します。

アシスタントの脳を、画像と質問を処理する多くのステーション(層)を持つ工場の組立ラインだと考えてみてください。

  1. 共有の始まり:アシスタントはまず画像と質問を一緒に見て、工場の初期ステーションでシーンの確かな理解を構築します。これが「共有プレフィックス」です。SIRA は、両バージョンのアシスタントがこの初期理解で一致することを保証します。
  2. 分岐点:初期理解が形成された後、SIRA はプロセスを同じ脳内で並行して走る二つのトラックに分割します:
    • トラック A(完全な視界):アシスタントは文を完成させる際、画像の詳細を見続けながら進みます。
    • トラック B(「盲目」の視界):アシスタントは全く同じ出発点から進みますが、後続のステーションでは、特定の画像詳細に対して目隠しをされます。彼らは、すでに書き始めた文と一般的な知識にのみ頼ることができます。

嘘を修正する方法

ここで SIRA は、文を書き進める各ステップで二つのトラックを比較します:

  • アシスタントが「が見えます」と言い、トラック A(犬を見ている)とトラック B(目隠し)の両方が高い確信度で「犬」と言う場合、SIRA はこれがおそらく一般的な言語に基づく推測(犬が物語によく登場するからなど)であると判断します。目隠しバージョンが画像を必要とせずにそれを言ったため、「犬」のスコアを低下させます。
  • アシスタントが「紫色の象が見えます」と言い、トラック A は(それを見ているため)「紫色の象」と言う一方、トラック B は(見られないため)「ありえない、それは物語にない」と言う場合、SIRA はこの主張が画像だけが理由であると認識します。その結果、「紫色の象」のスコアを引き上げます。

なぜ優れているのか

  • 追加ステップなし:画像を二度見る必要はありません。内部思考プロセスを分割するだけで、すべてを一度に行います。
  • 不条理な歪みなし:画像をぼかす必要はありません。思考プロセスのバージョンの一つに対して視覚入力を一時的に「オフ」にするだけで、残りのコンテキストは完全に整ったまま保たれます。
  • 訓練不要:既存のモデルですぐに機能します。モデルに新しいことを教える必要はありません。

結果

テストにおいて、SIRA は写真に存在しない物体(写真にない「バナナ」など)を捏造することをアシスタントに成功させ止めつつ、実際のものを正確に説明させることができました。これは、モデル自身の脳内で即座に発生する組み込みの「現実確認」のようなもので、彼らが言うことが単に期待されるものではなく、実際に見ているものによって支えられていることを保証します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →