← 最新の論文
💬 NLP

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

本論文は、視覚的な好みの信号を明示的に活用することで、マルチモーダル大規模言語モデルの視覚的不感性を解決し、言語能力を維持しつつ、幻覚を大幅に減少させマルチモーダルなアライメントを向上させる新しいフレームワークである、Perception-Enhanced Alignment Direct Preference Optimization (PEA-DPO) を導入するものである。

原著者: Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

公開日 2026-08-21
📖 1 分で読めます☕ さくっと読める

原著者: Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能が急速に進化する世界において、画像を見ながら同時に話すことができる新世代のシステムが登場しました。これらのマルチモーダル大規模言語モデルは、画像を見てそこに見えるものを説明したり、写真に関する質問に答えたりするように訓練されています。これらの機械が真に有用かつ安全であるためには、人間の価値観と一致している必要があり、つまり、その回答が正確で、役に立ち、提示された視覚的な現実に根ざしている必要があります。これらのシステムを教える上での大きな課題は、そこに存在しない物体や動作を自信満々に説明してしまう「ハルシネーション(幻覚)」を起こす傾向でした。これを修正するために、研究者たちは「直接選好最適化(direct preference optimization)」と呼ばれる手法に目をつけました。これは、一つの「良い回答」と一つの「悪い回答」のペアをモデルに示し、なぜ最初の回答の方が優れているのかを学習させる手法です。このアプローチはテキストのみのモデルには驚異的な効果をもたらしましたが、画像も処理するシステムに適用したところ、明確な写真と、最も重要な詳細が隠されてしまった写真との違いを真に「見る」ことを妨げる、隠れた欠陥が発見されました。

中国科学技術大学とシンガポール国立大学の研究チームは、この特定の弱点を特定し、それを治療するための新しいフレームワークを開発しました。彼らは、標準的な学習方法が、画像を単なる背景、つまり会話のための静的な設定として扱っており、モデルが依拠すべきべき主要な情報の源として扱っていないことを発見しました。このため、モデルは視覚的な感受性を欠いてしまったのです。実験において、研究者たちは、これらのモデルが、ピクニックをしている人々の写真と読書をしている人々の写真の違いを判別できないことを示しました。たとえ一方の視覚的証拠が完全に除去されていたとしても、モデルはほぼ同一の応答を生成し、重要な視覚的手がかりが欠落していることに気づけませんでした。また、一つの画像内の特定の物体を区別することも苦手であり、例えば、トイレブラシを一般的な道具と混同するなど、物体を定義する決定的な視覚的手がかりに十分な注意を払っていませんでした。

これを解決するために、研究者たちは「知覚強化アライメント(Perception-Enhanced Alignment)」と呼ぶ手法を考案しました。単にモデルにどちらのテキスト回答が良いかを選ばせるのではなく、モデルに視覚的なコンテキストそのものに注意を払わせるように、学習プロセスを再設計しました。まず、鮮明な画像を取り込み、ランダムな部分をマスクアウト(隠蔽)した一連の改変バージョンを作成することから始めました。別途用意した非常に高感度な視覚システムを用いて、どの改変バージョンが最も決定的な情報を失ったかを特定し、質問に正しく答えるために必要な主要な詳細が欠落した「拒絶されるべき」画像を作成しました。次に、この情報の欠落した画像と、元の完全な画像をペアにしました。学習中、モデルには同じ質問と同じテキスト回答が提示されますが、完全な画像と不完全な画像が順番に示されます。モデルは、完全な視覚的証拠がある場合にはその回答を強く好むべきであり、重要な視覚的コンテキストがなくなった場合にはその回答の信頼性が低いと認識すべきであることを教え込まれました。

この二段構えのアプローチにより、モデルは二つのことを同時に学びました。第一に、以前と同様に、優れたテキストの応答と劣ったテキストの応答を区別することを学びました。第二に、より重要なこととして、視覚的な証拠が主張を裏付けるのに不十分である場合に、それを認識することを学びました。研究者たちは、この新しい手法を、70億パラメータと130億パラメータの2種類のサイズの画像・テキストモデルでテストしました。結果は驚くべきものでした。モデルがどれほど作り話をするかを測定するために設計された標準的なテストにおいて、この新手法はハルシネーションを大幅に減少させました。小規模なモデルでは、ある主要なベンチマークにおいて、捏造された詳細の割合が3分の1近く減少し、別のベンチマークでは90%以上減少しました。大規模なモデルも同様の改善を示し、多くの場合、既存の最先端の商用システムさえも凌駕しました。モデルは、一般的な知識に基づいて推測するのではなく、本のタイトルや特定の道具を正確に特定するなど、写真の中に実際に何があるのかを正確に記述することが非常に上手くなりました。

研究者たちはまた、この視覚的な正確さへの新たな焦点が、他のタスクにおける性能を低下させていないかどうかも確認しました。その結果、モデルは指示に従う能力や一般的な質問に答える能力を維持しており、場合によっては、これらの一般的なタスクにおけるパフォーマンスがわずかに向上したことも分かりました。唯一の顕著なトレードオフは、モデルがより保守的になったことです。つまり、確信が持てないときに推測することを避け、その結果、提供される詳細の総量は少なくなることがありましたが、提供される詳細の信頼性は格段に高まりました。視覚的な証拠をテキストと同じくらい重視するようにモデルを明示的に教えることで、研究者たちは、単に写真を見るだけでなく、真に「見る」人工知能を構築することが可能であることを証明しました。この研究は、機械が視覚的世界を理解するための信頼できるパートナーとなるためには、欠落した情報の重みを感じ取れるように訓練されなければならず、それによって、彼らの自信が常に目の前にあるものの明晰さと一致するようにしなければならないことを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →