← 最新の論文
🤖 machine learning

On the modality gap and the contrastive loss in multi-modal representation learning

本論文は、CLIP型の対照学習におけるモダリティ・ギャップを、独立したエンコーダを用いたInfoNCE目的関数の低温度における失敗として特定し、検索精度を損なうことなくゼロショット分類性能を向上させつつ、このギャップを解消する、モダリティ内ネガティブを取り入れた修正された損失関数であるxNCEを提案する。

原著者: Fabian Mager, Hiba Nassar, Lars Kai Hansen

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Fabian Mager, Hiba Nassar, Lars Kai Hansen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、一方は「画像」の言葉しか話せず、もう一方は「言葉」の言葉しか話せない、二人の親友がいると想像してみてください。あなたは、彼らが互いを完璧に理解できるように、同じ部屋(共有されたデジタル空間)で一緒に過ごさせたいと考えています。これが、CLIPのようなAIモデルが試みていることです。つまり、画像とその説明を一致させる方法を学習するのです。

しかし、奇妙なことがあります。訓練が終わった後でも、この二人の友人はしばしば部屋の反対側の隅に立っています。彼らは互いに会話することはできますが、決して混ざり合うことはありません。画像埋め込みは一つのクラスターに集まり、テキスト埋め込みは別のクラスターに集まります。これは「モダリティ・ギャップ(様態の隔たり)」と呼ばれます。

長い間、科学者たちは、この分離は彼らが異なる個性(ランダムな初期化)を持っていたからか、あるいは異なる近所から来た(異なるデータ)からだと考えてきました。しかし、Fabian Mager、Hiba Nassar、Lars Kai Hansenによるこの論文は、こう言っています。「ちょっと待ってください。それは違います。」

真の犯人:下手な「ホット・ポテト」ゲーム

著者らは、自分たちの主張を証明するために巧妙な実験を行いました。彼らは二人の同一の双子(全く同じ初期重みを持つ二つの独立したエンコーダー)を取り、それらに、わずかに加工を加えた(回転やズームなど)全く同じ画像を入力しました。完璧な世界であれば、これら二人の双子は同一の出力を生成するはずです。

しかし、標準的な訓練手法(InfoNCEと呼ばれる)を用い、非常に特定のセッティング(AIを非常に神経質にする「低い温度設定」)を使用した場合、双子は依然として離れていきました。片方の双子が「画像」を話し始め、もう片方が「テキスト」を話し始めたのです。たとえ彼らが同じものを見ていたとしても!

これは、ギャップの原因がデータや出発点ではないことを証明しています。むしろ、この論文は、InfoNCEの数式自体にバグがあると主張しています。

このように考えてみてください。訓練というゲームは、AIに対してこう命じます。「一致するペア(画像+テキスト)を極限まで近づけ、一致しないペアはすべて極限まで遠ざけよ」。

  • バグ: 一致しないペアを「遠ざける」ために、AIは怠惰なショートカットを見つけ出します。それは、「画像」のグループ全体を部屋の片側に押しやり、「テキスト」のグループ全体を反対側に押しやるという方法です。これは「それらを離しておけ」というルールを満たしてはいますが、実際には二つのグループを混ぜ合わせることを学習していません。論文ではこれを「モード失敗(mode-failure)」と呼んでいます。AIは、自分がうまくやっていると思えるローカルミニマム(局所解)を見つけたのですが、実際には単に二つのグループを別々の隅に隠しているだけなのです。

これは、AIが非常に厳格に設定されている(低い温度設定)場合に特有の現象です。もしAIの設定をより寛容(高い温度)にすれば、グループは混ざり合いますが、そうなるとAIは異なる物体を識別する能力を忘れ、後で物事を認識する能力を台無しにしてしまいます。

解決策:xNCE(ミクソロジスト/調合師)

著者らは、xNCEと呼ばれるシンプルな修正案を提案しています。

再び、訓練のゲームを想像してください。古いバージョンでは、AIが「一致しない」画像と「一致しない」テキストを遠ざけようとする際、AIはただそれらを反対側の隅へと押しやっていました。
新しいxNCEバージョンでは、ゲームのルールが変わります。「テキストを画像から遠ざけるだけでなく、テキストを『他のテキスト』から遠ざけ、画像を『他の画像』からも遠ざけなければならない」。

「負例(AIが一致させるべきではないもの)」を混ぜ合わせることで(両方のグループから来るようにすることで)、AIは隅に隠れることをやめざるを得なくなります。AIは、特定のマッチングを近くに保ちつつ、グループを混ぜ合わせた状態に保つ方法を学ばなければならなくなるのです。

ラボでは何が起きたのか?

著者らはこれらを二つの対象でテストしました。

  1. MNIST(手書き数字): 二つのエンコーダーを、あたかも二つの異なる「モダリティ」であるかのように扱いました。
    • 結果: 古い手法を用いた低い温度設定では、二つのグループは完全に分離していました(分離可能性100%)。しかし、xNCEを用いると、その厳しい温度設定においても、ギャップは劇的に縮小しました。
  2. COCO(画像とキャプション): これが現実世界のテストです。
    • ギャップ: 標準的な手法では大きなギャップ(距離0.88)が残りました。新しい手法は、わずかな混合(tiny mix)でギャップを0.12に、さらに重い混合(heavy mix)では0.05まで縮小させました。
    • トレードオフ: 著者らはスイートスポットを見つけました。負例をほんの少し(1%から5%)混ぜるだけで、AIの「正しい画像を見つける能力(検索性能)」を損なうことなく、ギャップをほぼ完全に閉じることができました。
    • ボーナス: 最も重要なことに、この新しい手法は、教えられていないものに対するAIの推論能力(ゼロショット分類)を向上させました。4つの異なるテストにおいて、新手法は旧手法を上回りました。例えば、CIFAR-100のテストでは、精度が4.2パーセントポイント向上しました。

この論文が「言っていない」こと

この論文が主張していないことを知っておくことは重要です:

  • 「高い温度設定こそが答えである」とは言っていません。実際、グループを混ぜるために温度を上げると、AIの特定の物体を認識する能力が破壊される(ImageNetの精度が51.9%から15.5%に低下する)ことを論文は示しています。
  • 「追加の正則化(AIに一様性を強制すること)が最善の解決策である」とも言っていません。著者らは正則化されたバージョンをテストしましたが、彼らの混合手法ほどゼロショット性能を向上させることはできませんでした。
  • これが「あらゆる問題に対する魔法の杖である」とも主張していません。論文は、極端な精密さ(例:正確な第1候補を見つけること)を必要とするタスクでは、混ぜる量を非常に少なく(1-5%)すべきであり、より一般的な理解を必要とするタスクでは、もっと多く混ぜてもよい、ということを示唆しています。

結論

この論文は、「モダリティ・ギャップ」は自然界の謎ではなく、標準的な訓練レシピにおけるバグであることを示唆しています。訓練ゲームの中で「負例」を単純に混ぜ合わせることで、著者らは、AIが単に別々の隅に隠れるのではなく、実際に共通の言語を学ぶことを強制する手法(xNCE)を作り出しました。これは、AIが詳細を見分けるための「厳格で神経質な」設定を維持したまま、AIをより賢く、より統一されたものにし、新しいものを推論する能力を高める、小さな、しかし強力な調整なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →