← 最新の論文
🤖 machine learning

Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers

本論文は、対照的学習で事前訓練された視覚言語モデルが、下流タスクの性能を損なうことなく安全に剪定可能な、共有された多モーダルノイズの広範かつ不変な部分空間を内包していることを明らかにし、それによってその潜在表現構造に関する新たなメカニズム的洞察を提供する。

原著者: Jakub Grzywaczewski, Dawid Płudowski, Przemysław Biecek

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Jakub Grzywaczewski, Dawid Płudowski, Przemysław Biecek

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

超賢いロボットアシスタント(CLIP のようなもの)を想像してみてください。このロボットは画像と言語の両方を理解するように訓練されています。「犬の画像を見せて」と頼めば、瞬時に見つけてくれます。完璧に見えるでしょう。しかし、この論文は、このロボットが実際には仕事をするのに必要ない、重くて無用のジャンクでいっぱいのバックパックを背負っているのだと主張しています。

以下は、研究者たちが発見した内容を、簡単なアナロジーを用いて解説したものです。

1. 信号の中の「雑音」

ロボットの脳を、世界を聴き取る 768 個の異なるチャンネル(次元)を持つ巨大なラジオ受信機だと考えてください。

  • 良いチャンネル: これらのチャンネルのほとんどは、「信号」——つまり画像や言葉の実際の意味(「犬」、「教会」、「幸せ」など)——にチューニングされています。
  • 悪いチャンネル: 研究者たちは、これらのチャンネルの約 164 個が単に「雑音」を放送していることを発見しました。これはランダムなノイズではなく、ロボットが見るすべての画像とすべての言葉に、内容に関係なく現れる、特定の共有された種類の雑音です。

2. 「ゴースト」パターン

最も驚くべき点は、この「雑音」が異なるグループ間で同一であるということです。

  • アナロジー: シベリアンハスキーの写真を一枚、教会の建物の写真をもう一枚撮ったと想像してください。これらに共通点は全くありません。しかし、両方の画像に対するロボットの記憶の「ジャンク」部分を見ると、そのジャンクはほぼ完全に同じように見えます(91% の重複)。
  • 発見: ロボットには、目にするすべてに押印される「ゴースト」パターンが存在します。これは、レンズにシミがついたプリンターのようなものです。レシピであれ手紙であれ、印刷されるすべてのドキュメントに、その同じシミが隅に現れるのです。研究者たちは、このシミが非常に一貫しているため、それを完全にマッピングできることを発見しました。

3. 「ジャンク引き出し」実験

研究者たちは、この「ジャンク引き出し」(164 次元のノイズ)を単に捨て去った場合に何が起こるかテストすることにしました。

  • 結果: 彼らはロボットからその 164 個のチャンネルを取り除き、いつものタスク(写真の中の動物を識別したり、言葉と画像を一致させたりするなど)をさせるよう求めました。
  • 驚き: ロボットは悪化しませんでした。実際、言葉と画像を一致させる能力はわずかに向上しました。まるで岩でいっぱいのバックパックを走っている人から取り除いたようなもので、遅くなるどころか、重荷から解放されたため、実際には速く走れるようになったのです。

4. なぜこれが起こるのか?

この論文は、この「ノイズ」がコードのバグではなく、ロボットが構築された方法の副作用であると示唆しています。

  • アナロジー: 自動車を製造する工場を想像してください。エンジニアは非常に効率的に組み立てラインを設計したため、車は素晴らしい出来栄えですが、機械の振動が偶然、すべての車のドアに小さくて無用の傷を刻みつけてしまいます。その傷は車が走るのを妨げるものではありませんが、すべての車に存在します。
  • 研究者たちは、この「傷」(ノイズ)が、特定のデータセットの単なる間違いではなく、アーキテクチャの根本的な部分であることを発見しました。

まとめ

この論文は、CLIP のような現代の AI モデルが、画像やテキストの実際の意味とは何の関係もない膨大な量の「共有ノイズ」(一部のバージョンでは約 164 次元)を背負っているとしています。

  • 良い知らせ: このノイズを取り除いても、AI の性能を損なうことなく行えます。
  • 全体像: AI の「脳のスペース」の巨大な部分が、実際には有用な知識ではなく、この反復的で意味のないパターンを保存しているに過ぎません。これを掃除することで、AI はわずかに効率的かつ正確になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →