← 最新の論文
💬 NLP

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

本論文は、視覚的アンカー、オンライン補正メカニズム、および好みのチューニングを通じてテキストと画像のクロスアテンションのダイナミクスを整合させることにより、マルチモーダル大規模言語モデルにおけるハルシネーションを軽減する、アテンションベースのフレームワークであるADAPTを紹介しており、一般的な能力を維持しつつ大幅なハルシネーションの削減を実現している。

原著者: Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

公開日 2026-07-01
📖 1 分で読めます☕ さくっと読める

原著者: Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

マルチモーダル大規模言語モデル(MLLM)を、非常に賢く博識なツアーガイドだと想像してみてください。そのガイドには、一枚の写真が手渡されました。彼らの仕事は、その写真を正確に説明することです。しかし、このガイドには悪い癖があります。話しているうちに、意識が「漂い」始めてしまうのです。ガイドは、写真に実際に何があるかではなく、自分の一般知識に基づいて「そこにあるはずのもの」に頼り始めてしまいます。これを**ハルシネーション(幻覚)**と呼びます(例えば、写真には青い車しか写っていないのに、「赤い自転車」などと作り上げてしまうことです)。

論文ADAPTは、なぜこのようなことが起こるのかを調査し、ガイドが写真に集中し続けられるようにするための3つの解決策を提示しています。

問題点:「漂う視線」

研究者たちは、モデルの「目」(内部のクロスアテンション)は最初は強力であるものの、説明が長くなるにつれて疲れ、混乱してしまうことを発見しました。

  • 初期段階: モデルはまさに正しい場所(例:写真の中の飛行機)を正確に見つめています。
  • 後半段階: 視線が「ぼやけて」きます。画像の間違った隅を見つめてしまったり、あるいは画像を見ること自体をやめてしまい、直前に自分が言った言葉に基づいて推測したりするようになります。
  • 結果: モデルは視覚的な証拠を確認しなくなるため、物事を捏造し始めます。

これは、テストを受けている学生のようなものです。最初は教科書(画像)を見て答えを出します。しかし、途中で疲れてきて、本を見るのをやめ、授業で覚えたこと(言語的バイアス)に基づいて推測し始めます。その時に間違いが生じるのです。

解決策:ADAPT

著者らは、モデルの「視線」を安定させるために、ADAPT(Attention Dynamics Alignment with Preference Tuning)と呼ばれるシステムを構築しました。彼らは、モデルの視線を固定するために3つの独創的なツールを使用しています。

1. 「黄金のアンカー」(視覚的強化)

モデルが長い説明を書き始める前に、システムは写真を素早く、初期段階でスキャンして、最も重要で疑いようのない事実を見つけ出します。

  • 比喩: ツアーガイドが話し始める前に、**ハイライター(蛍光ペン)**を渡される場面を想像してください。ガイドは写真を素早くスキャンし、主要な被写体(例:「これは白い飛行機である」)をハイライトします。
  • 修正: このハイライトされた領域が「黄金のアンカー」となります。これは、「何があっても、これは飛行機であることを忘れるな」と伝える、安定した参照点となります。システムはこのアンカーを整理し、バイアス(例:内容に関わらず常に画像の左側を見てしまうといった癖)を取り除きます。

2. 「スポットライトの監督官」(アテンション監視推論)

モデルが話している間、この監督官はモデルの「視線」をリアルタイムで監視します。

  • 比喩: ガイドの隣に立っている厳しい教師を想像してください。ガイドの目が「黄金のアンカー」から外れたり、何もない空間をじっと見つめたりするたびに、教師は優しく肩を叩いて注意を促します。
  • 修正: もしモデルの注意力が逸れたり「焦点がぼやけたり」した場合、システムは即座にモデルの注意を画像の関連部分へと押し戻します。これはモデルに全く同じ言葉を強制するのではなく、言葉を発する前に、正しい証拠を「見る」ことを強制するものです。

3. 「目隠しトレーニング」(視覚アテンション・ガイダンスDPO)

これは、モデルが推測するよりも、写真を見ることを選択するように学習させるトレーニングステップです。

  • 比喩: モデルは2つのシナリオで訓練されます:
    1. シナリオA(正しい方法): モデルは「黄金のアンカー」がハイライトされた写真を見て、正しい答えを出します。
    2. シナリオB(悪い方法): モデルは空白でノイズの混じった画面(「目隠し」)を見て、答えを推測しようとします。
  • 修正: システムはモデルにこう教えます。「もし空白の画面を見ているなら、自信を持つべきではない。もし実際の写真を見ているなら、自信を持つべきである」。これにより、モデルは単に物事を捏造するのではなく、視覚的な証拠に依存するように訓練されます。

結果

研究者たちがこのシステムをさまざまなAIモデルでテストしたところ、以下の結果が得られました:

  • ハルシネーションの減少: モデルが作り上げる偽のディテールが40〜60%減少しました。
  • 知能の維持: モデルは会話能力や理解力といった一般的な能力を失うことなく、単に画像に関する事実に忠実になる能力が大幅に向上しました。
  • 効率性: このシステムは迅速に動作し、プロセスに追加される時間はごくわずかです。

まとめ

要約すると、ADAPTは、AIモデルが話しているうちに「気が散り」、推測を始めてしまうという事実を認識しています。これを解決するために、システムは安定した参照点(アンカー)を与え、さまよう視線を捕らえるためのリアルタイムの監督官を用意し、想像よりも見たものを重視するための特別なトレーニングを行います。その結果、目の前の写真について真実を語るAIが実現しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →