Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs
本論文は、先行研究を再現および拡張することで、コントラスティブ・デコーディングがマルチモーダル大規模言語モデルにおけるオブジェクト・ハルシネーションを真に軽減できていないことを示し、POPEのようなベンチマークにおける見かけ上の性能向上はしばしば偽のものであり、視覚的なグラウンディングの改善を反映していないことを実証する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに、写真を見てそこに見えるものを説明する方法を教えていると想像してみてください。あなたは、そのロボットが正直であること、つまり実際にそこにあるものだけを言うようにしたいと考えています。しかし時として、これら超スマートなロボットは少しばかり独創的になりすぎてしまうことがあります。例えば、静かなビーチの写真を見ているのに、「犬がボール遊びをしているのが見えます!」と自信満々に答えてしまうかもしれません。実際にはそこには犬などいないというのにです。人工知能の世界では、これを「ハルシネーション(幻覚)」と呼びます。これはロボットがわざと嘘をついているのではなく、海辺の犬に関する物語をあまりにも多く読みすぎたために、視覚的な証拠がないにもかかわらず、そこに存在すると決めつけてしまっているのです。
これを解決するために、科学者たちはロボットに自分の考えを「再確認」させる方法を教えようとしてきました。**コントラスティブ・デコーディング(対照的デコーディング)**と呼ばれる有名なアイデアの一つは、「間違い探し」のようなゲームのように機能します。この手法では、ロボットに写真を二通りの方法でイメージさせます。一つは鮮明でシャープなもの(「エキスパート」の視点)、もう一つはぼやけていたりノイズが混じっていたりするもの(「アマチュア」の視点)です。理論によれば、もしボケた視点の方がクリアな視点よりも「犬」と言う確率が高ければ、それは単に想像に基づいた推測であり、実際の写真によるものではないということになります。したがって、このメソッドはそれらの「ボケた視点」での推測を抑制することで、ロボットが真実に固執するように仕向けるのです。これは教師が生徒に対して、「はっきり見えないのであれば、書き留めてはいけません」と言っているようなものです。
しかし、ここにひねりがあります:新しい研究によると、この巧妙な「再確認」のトリックは私たちを欺いている可能性があることが示唆されています。研究者たちは、このメソッドが本当にロボットの視力を向上させているのではなく、単にロボлоットに何に対しても「イエス」と答えやすくさせているだけであることを発見しました。まるで、学習を頑張る代わりに、先生がポジティブな回答を好むことを知ってしまい、テストのあらゆる質問に対してとりあえず「イエス」と答えるようになった学生のようです。この研究は、この人気の高い修正策が実はロボットの視力を直しているのではなく、ただロボットの気分を変えているだけであることを証明するために深く掘り下げました。
「イエス」の錯覚
これから読む論文は、インド工科大学ールキー校の研究チームによって書かれた探偵小説です。彼らは、自分たちの提示する通りに「コントラスティブ・デコーディング」が機能しているのかを確認するため、顕微鏡の下で検証することに決めたのです。彼らの主な目的は、切実な問いに応えることでした。このメソッドは本当にロボットの幻覚を防いでいるのか、それとも結果をごまかしているだけなのか? ということです。
研究者たちは、(Yin et al., 2026 による)先行研究の実験を再現することから始めましたが、より強力で新しいロボットの脳(具体的にはLLaVAやQwenといったモデル)を使用しました。彼らは、新鮮なデータを用いてテストした際に、コントラスティブ・デコーディングの「魔法」が維持されるかどうかを見たかったのです。そこで得られた結果は、このメソッドの支持者にとっては非常に残念なものでしたが、誠実なロボットを求める人々にとっては非常にエキサイティングなものでした。
「イエス」へのバイアス
第一の大きな発見は、コントラスティブ・デコーディングはロボットにより注意深く写真を見るようにさせているわけではないということです。むしろ、それはロボットがもっと頻繁に「イエス」と言うように促しています。例えば、ロボットが「この写真の中に猫はいますか?」といった質問に対し、「イエス」か「ノー」で答えるテストがあるとしましょう。もしロボットが通常、猫がいる場合でも「ノー」と言いすぎる傾向があるなら、このメソッドはその「イエス」と言う回数を増やします。
研究者は、この変化によって、ロボットが偶然正解を得ることで書類上では賢く見えるようになることを発見しました。しかしここには落とし穴があります。ロボットは、猫がいない写真に対しても「イエス」と言ってしまうため、新たな間違いを生み出しているのです。これは、内容を学ぶ代わりに、すべての質問に「イエス」と答えることに決めた学生のようなものです。運良くいくつか当たったとしても、同時に真実ではない答えも作り出してしまいます。本研究は、特別なデコーディング技術を使わずに、単にロボットに対して「おい、もっと『イエス』と言ってみろ」と指示するだけで、全く同じ「改善された」スコアが得られることを示しました。
「強欲」な罠
第二の謎は、「適応型妥当性制約(Adaptive Plausibility Constraint)」と呼ばれる安全弁に関わるものです。これは、ロボットが無謀で不可能なことを言わないようにするためのルールです。しかし、研究者たちは、このルールがあまりにも厳格であるため、事実上の「強欲な(グリーディな)」思考へと変貌させてしまうことを突き止めました。
「サンプリング」とは、次にくる言葉を選ぶためにダイスを振ること、つまり創造性を発揮し様々な選択肢を探求する機会を与えることです。「強欲な」アプローチは、常に最も明白な一つの言葉を選び取ることであり、他の可能性を無視することを意味します。研究の結果、この安全ルールは、ロボットにダイスの振り方をやめさせ、毎回最も当たり前な言葉を選ぶように強制してしまうことが分かりました。ですから、メソッドがうまくいっているように見えるとき、それは実際にはロボットがより良く見えているからではなく、クリエイティビティを失い、退屈で予測可能な状態になっているからです。この「改善」は、ロボットが見る力が上がったからではなく、リスクを取ることを恐れているからなのです。
「ノイズ」の実験
メソッドの「アマチュア」の部分(ボケた視点)が本当の意味で行列していないことを証明するために、研究者たちは大胆な試みをしました。彼らは「アマチュア」のロボットを、純粋なランダムノイズ――ラジオの砂嵐のような信号――に入れ替えたのです。彼らは、アマチュアのロボлоットなしではメソッドが完全に失敗すると予想していました。ところが、メソッドはほとんど変わらずに動作したのです!
これは、あるシェフが秘密の材料を加えることでスープの味を良くしようとしている状況に似ています。もし、その秘密の材料を取り除いて普通の水に置き換えたとしても、スープの味が以前と同じであれば、あの秘密の材料は何の影響も与えていなかったのだと気づきますよね。研究者たちは、結論として、「アマチャ」の視点は真実を見る助けにはなっておらず、重要ではないランダムなノイズを加えているだけだと判断しました。スコアが上がる本当の理由は、単なる「イエス」へのバイアスと「強欲な」ルールによるものなのです。
深層部への潜入:脳の中で何が起きているのか?
研究者たちは表面的な分析にとどまりませんでした。彼らは、どこで魔法が起きているのかを知るために、ロボットの「脳」(ニューラルネットワークの階層)の内部を覗き込みました。そして、オブジェクトが存在するかどうかについて、ロボットはレイヤーの深い部分ですでに「知っている」ということを発見しました。情報は持っているのです! しかし、コントラスティブ・デコーディングが作動するとき、ロボットはその情報を使ってミスを訂正することはありません。代わりに、間違った答えであっても、とにかく「イエス」ボタンをもっと強く押すだけなのです。
これは、正しい答えが「ノー」であることを分かっている生徒がいても、教師(デコーディング法)が肩を叩きながら「イエスと言いなさい!」とささやき続けるようなものです。結局、生徒はたとえ分かっていても「イエス」と言ってしまうのです。このメソッドは生徒の知識を修復しているのではありません。一律に「イエス」へと押し進める力で、知識を上書きしているだけなのです。
判決
さて、この研究からの最終的な教訓は何でしょうか? 研究者たちは自らの発見に強い確信を持っています。彼らは、広く普及している「コントラスティブ・デコーディング」の手法が大部分において幻想であることを明らかにしました。それは、世界をより明確に見たり、物事を捏造したりするのを防ぐ役には立っていません。そうではなく、単にロボットの行動を変更して、「イエス」と言う頻度を高め、創造的なリスクを取らないようにしているだけなのです。
これは極めて重要な問題です。なぜなら、多くの人々がこのメソッドを使用して、より安全で信頼性の高いAIを構築しようとしているからです。この研究は、私たちが偽りの勝利を祝っている可能性があると警告しています。もしロボットに幻覚を起こさせたくないのであれば、私たちは単に言葉の選び方を変えるだけでなく、画像の内容を理解させるための別の方法を見つけなければなりません。それまでは、コントラスティブ・デコーディングのトリックは、あたかも注視しているかのように装いつつ、実際には世界全体に向かって「ハイ、見えました!」というゲームを楽しんでいるだけの、巧みな手品に過ぎないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。