← 最新の論文
💬 NLP

Ethology of Latent Spaces

本研究は、行動学的視点を用いることで、視覚言語モデルにおける潜在空間は中立的なものではなく、学習データに起因する明確な「アルゴリズム的スコピック・レジーム(視覚的体制)」を呈しており、それが芸術に対する相違し、しばしば矛盾する政治的および文化的解釈を生み出していることを実証し、デジタル美術史においてこれらのモデルがどのように使用されているかに対する批判的な再評価を必要としていることを示す。

原著者: Philippe Boisnard

公開日 2026-02-06
📖 1 分で読めます☕ さくっと読める

原著者: Philippe Boisnard

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、3人の異なる美術批評家を想像してみてください。彼らは皆、15世紀から1900年代までの301点の絵画と彫刻のコレクションを同じように見ています。彼らが目にしているものに対して一致した意見を持つことを、あなた方も期待するでしょう。しかし、この研究における「批評家」は人間ではありません。彼らは3つの異なるAIモデル(OpenAI CLIP、OpenCLIP/LAION、およびSigLIP)です。

この論文は、これらのAIモデルは中立で白紙の状態ではないと主張しています。むしろ、それぞれが、与えられた特定のデータと構築方法によって形作られた、独自の「個性」や世界の捉え方を既に持っています。著者はこれを**「潜在空間の行動学(ethology of latent spaces)」**と呼んでいます。これは、生物学者が野生動物の行動を研究するように、これらのAIの「脳」の「振る舞い」を研究することに他なりません。

以下に、簡単な比喩を用いてこの論文の主要なポイントを解説します。

1. 「見えないメガネ」の比喩

これらのAIモデルを、見えないメガネをかけていると考えてください。

  • 数学的側面: コンピュータ内部では、AIは画像を巨大な多次元空間における数値の雲(ベクトル)として捉えています。
  • 意味論的側面: 私たちがAIに「この画像は政治的ですか?」と尋ねるとき、AIは政治について「考えて」いるわけではありません。代わりに、自身の数値の雲を見つめ、その画像の数値がどの「政治的」な数値に近いかを確認しているのです。
  • ひねり: 論文は、それぞれのモデルがかけている「メガネ」が異なることを示しています。あるモデルは白黒写真を見て「暗く、陰鬱だ」と判断するかもしれませんが、別のモデルはそれを「コントラストが高く、ドラマチックだ」と判断するかもしれません。それは、それぞれの学習方法の違いによるものです。

2. 3つの異なる「個性」

この研究は3つの特定のモデルを比較し、それらがまるで3人の全く異なる人物のように振る舞うことを明らかにしました。

  • OpenAI CLIP(美術館のキュレーター): このモデルは、厳選されたプライベートなデータセットで学習されました。これは伝統的な美術史家のようです。このモデルは、「政治」を有名な制度化された芸術運動(キュビスムやダダイズムなど)の中にのみ見出す傾向があります。例えばアフリカの仮面を見せても、それを「政治的」ではなく「芸術」や「文化」として捉えます。
  • OpenCLIP/LAION(インターネットのスクローラー): このモデルは、インターネット全体からスクレイピングされた、膨大で混沌としたデータの塊で学習されました。これは混沌としたインターネットユーザーのように振る舞います。あらゆるものに「政治」を見出しますが、それはしばしば無秩序でノイズ混じりの方法で行われます。例えば、ある絵画がそれ自体で植民地主義に関するものでなくても、ウェブ上の類似画像のキャプションに「植民地」という言葉が含まれていたという理由だけで、その絵画を「植民地的なもの」とラベル付けすることがあります。
  • SigLIP(批判理論家): このモデルは異なる技術的アーキテクチャを使用しています。これは鋭い現代の批評家のように振る舞います。このモデルは、ほぼあらゆるものに「政治」を見出します。例えば、アフリカの仮面を(他のモデルが非政治的であるとする一方で)非常に「政治的」である(59%の確率で)とラベル付けします。このモデルは、非西洋の芸術は本質的に政治的闘争に結びついている一方で、西洋の芸術は「中立」である、ということを学習したようです。

3. 「ネオンサイン」の混乱

論文は、AIが物理的な物体と言葉の違いによって混乱する素晴らしい例を挙げています。

  • テスト: 研究者たちは、モデルに「明るさ」によって画像をランク付けさせました。
  • 結果: OpenAI CLIPは、ジョセフ・コスースのネオンアート(しばしば黒い背景に対して撮影されるもの)を、コレクションの中で最も「明るい」ものの一つとしてランク付けしました。
  • 理由: AIはピクセルを「見て」いませんでした。学習データ内の「ネオン」という言葉を見つけ、その「ネオン」という単語を「明るい光」という概念に関連付けたのです。AIはラベル現実を混同してしまいました。
  • SigLIPは、しかし、実際にピクセルを観察し、暗い写真は暗いものであると正しく識別しました。

4. 「創発的バイアス」対「統計的バイアス」

通常、AIのバイアスについて語るとき、私たちは「統計的バイアス」(例:女性の写真が十分にデータセットに含まれていない)を思い浮かべます。

  • 論文の新しいアイデア: この研究は**「創発的バイアス(Emergent Bias)」**を導入しています。これは、化学反応のように、どこからともなく「現れる」バイアスです。それは生のデータに直接含まれているのではなく、AIが言葉と画像の間の点と点を結びつける複雑なプロセスから生まれます。
  • 比喩: レシピを想像してください。塩を入れ忘れたら料理は味が薄くなります(統計的バイアス)。しかし、小麦粉、砂糖、酵母を特定の方法で混ぜ合わせると、パンが膨らみます(創発的特性)。AIの「政治的」な見解は、この膨らむパンのようなものです。それはボウルの中に直接入れられたものではありませんが、材料(データ)が混ぜ合わされた結果として立ち上がってきたものなのです。

5. 「三つの眼差し」(どのように見るか)

著者は、モデルが世界をどのように「見ているか」を記述するために、美術史のメタファーを使用しています。

  • エントロピー的な眼差し(LAION): インターネット上のあらゆる情報を拾い上げる、混沌としたノイズ混じりの眼差しであり、ウェブ検索に見られるステレオタイプをしばしば強化します。
  • 制度的な眼差し(OpenAI): 確立された西洋美術史のルールを強化する、制御された美術館のような眼差しです。
  • 記号論的な眼差し(SigLIP): あらゆるものに深い批判的な意味を見出そうとする理論的な眼差しであり、人間が単なる形として見ている場所にさえ、政治的な解釈を強いることがあります。

結論

この論文は、AIは美術史における中立的なツールではないと結論付けています。
もしあなたがAIを使って芸術を分析するなら、あなたは単に「コンピュータの意見」を得ているのではありません。あなたは、そのモデルの学習データが持つ、特定の隠された「個性」を得ているのです。

  • モデルAを使えば、芸術を「中立的で審美的なもの」として見るかもしれません。
  • モデルBを使えば、同じ芸術を「深く政治的で植民地的なもの」として見るかもしれません。

著者は、AIが持つ独自の目に見えないルールやバイアスを理解せずに、芸術の解釈をAIに「委任」することはできないと警告しています。その理解なしには、異なるモデルを互いに比較検討しない限り、AIが見ているものの「真実」を知ることはできません。AIが見ているものの「真実」は、そのAIがどのような「メガネ」をかけているかに完全に依存しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →