← 最新の論文
🤖 AI

Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models

本論文は、プリフィル残差更新から導出された適応的かつ証拠に基づく視覚的アンカーをデコーディングプロセスに注入することで大規模視覚言語モデルにおけるハルシネーションを軽減し、さまざまなアーキテクチャにわたって高いスループットを維持しながらハルシネーション発生率を大幅に低減する、低オーバーヘッドのフレームワークであるRUDDERを提案する。

原著者: Zhengtao Zou, Ya Gao, Jiarui Guan, Bin Li, Pekka Marttinen

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Zhengtao Zou, Ya Gao, Jiarui Guan, Bin Li, Pekka Marttinen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いロボットアシスタントを想像してみてください。このロボットは画像を見て、それを声に出して説明します。このロボットは優れていますが、少し奇妙な癖があります。自分の「単語の連想」に自信を持ちすぎると、時折、事実を捏造してしまうのです。

例えば、机の上に本がある画像を見せると、ロボットは「机の上に本とコップがあります」と言うかもしれません。画像にコップは存在しないのに、ロボットは「本」と「コップ」が物語の中でよく一緒に登場することを知っているため、コップを幻視(想像)してしまうのです。

これは、ロボットが話し続けるにつれて、実際の画像の記憶が薄れていくために起こります。まるで、ロボットの内部の声が大きくなる一方で、背景で流れていた音楽が静かになっていくようなものです。

この論文は、ロボットを遅くすることなくこの問題を解決する新しい手法「RUDDER」を紹介しています。その仕組みを、簡単な比喩を使って説明します。

1. 問題:薄れゆく錨

ロボットが見ている画像を、現実へと繋ぎ止めるだと考えてください。

  • 問題点: ロボットが話し始めると、この錨は引きずり離されてしまいます。ロボットは画像を見なくなる代わりに、そこに「あるべきだ」と思うものに基づいて推測し始めるのです。
  • 従来の解決策: 以前の手法は、ロボットを停止させ、画像を再読み込みして、やり直すことでこの問題を解決しようとしました。これは、学生にエッセイを書くのをやめさせ、図書館に戻って本を再読し、それから続けるよう命じるようなものです。機能はしますが、非常に時間がかかり、遅い方法です。

2. 解決策:RUDDER(「視覚的錨」システム)

RUDDERは、ロボットを停止させたり画像を再読み込みしたりすることなく、錨をロボットの手に結びつけたままにする巧妙な方法です。これは 2 つのステップで行われます。

ステップ A: 「スナップショット」(CARD)

ロボットが話し始める前に、画像の最も重要な詳細を素早く、一度だけ「スナップショット」します。

  • 比喩: ロボットが画像のメンタルフォトを撮り、画像に何が正確に含まれているかを要約する、単一の強力な文を書き留めると想像してください。これをCARD(文脈的活性化残差方向)と呼びます。
  • 特別性: これは、画像がロボットの記憶にまだ鮮明に残っている間に情報を捉えます。後で新しい写真を撮る必要はありません。コンパスのようにこの「証拠の方向」を保持するだけで十分なのです。

ステップ B: 「スマートゲート」(ベータゲート)

さて、ロボットが単語ごとに話し始めるにつれて、そのコンパスをいつ使うべきかを知る必要があります。

  • 従来の手法の問題点: ロボットが話すたびにコンパスを見るよう強制すると、文法や接続詞(「the」や「and」など)について話しているときに混乱する可能性があります。
  • RUDDER の解決策: RUDDER は、信頼できる信号機のような役割を果たすベータゲートを使用します。
    • 青信号: ロボットが画像と一致するもの(例:「赤い車」)について話している場合、ゲートは青に変わります。「素晴らしい、順調だ!コンパスに従い続けろ」と言います。
    • 赤信号: ロボットが画像と一致しないものについて話している場合、または単に文法語句を使っている場合、ゲートは赤に変わります。「待て!ここで画像の詳細を無理に押し付けるな。ただ自然に文の流れを続けろ」と言います。

3. なぜこれが重要なのか

この論文は、RUDDER を効率化の「魔法のトリック」として主張しています。

  • 追加ステップなし: 画像を再読み込みする(遅い)他の手法とは異なり、RUDDER はすべてを単一のパスで実行します。これは、10 歩歩くたびに地図を見て停止するのではなく、歩きながらコンパスを持っているようなものです。
  • 速度: ロボットを元の速度の 96% に保ち、ほぼ以前と同じ速さを維持します。
  • 精度: 多くの異なる種類のロボット(モデル)において、(偽のコップのような)物体を捏造するのを成功裡に防ぎ、これらの誤りを平均して約 24% 削減します。

まとめ

要約すると、RUDDERはロボットにコンパス(視覚的証拠)と、いつコンパスを見るべきで、いつ単に話し続けるべきかを正確に指示するスマートな信号機(ゲート)を与えます。これにより、ロボットは遅くも不器用になることなく、自分が何を見ているかについて正直であり続けることができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →