On the Separation of Human and AI-Generated Images in CLIP Embedding Space
本論文は、CLIP埋め込み空間内における人間が描いた絵画とAIが生成した絵画の未解明な自発的分離を調査し、解釈可能性およびインバージョン技術を通じて、この区別が明白な視覚的特徴ではなく、微細で知覚不可能なマルチスケールの画像構造に依存していることを明らかにし、それによって人工的な視覚知覚と人間の視覚知覚との間の根本的な相違を浮き彫りにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代の人工知能の世界において、コンピュータはかつては人間の知覚のみに属していた方法で、画像を見たり理解したりすることを学習してきました。この能力の中核にあるのは、CLIPとして知られる強力なシステムであり、これは画像と言葉を結びつけるように訓練されたツールです。CLIPは、目にするすべての画像を、広大な多次元空間における独自の数学的な点へと変換することでこれを行います。この空間では、見た目が似ているものやテーマを共有している画像は近くに配置され、それらが異なるものは離れていきます。長年、研究者たちはこのシステムを利用して、コンピュータが物体を認識したり、写真を分類したり、さらには新しい芸術を生み出したりするのを助けてきました。しかし、これらのデジタルマップの中に、奇妙で説明のつかない謎が生じています。システムに人間が手で描いた絵画と人工知能によって生成された画像を混ぜて見せると、これら2つのグループは自然に明確なクラスターへと分離してしまうのです。これは、両者を区別するための特別な訓練なしに起こる現象であり、この分離は単にシステムがデータを整理する方法の一つの特徴なのです。科学者たちを困惑させている問いは、この分離が存在するかどうかではなく、なぜそれが起こるのか、そしてコンピュータが人間が見落としているかもしれないどのような具体的な視覚的手がかりを用いているのかという点です。
ボローニャ大学のある研究者は、偽物の芸術を見つけ出すためのより優れた検出器を作るためではなく、その分裂の背後にある目に見えない論理を理解するために、このパズルを解こうと試みました。彼らはまず、この分離が現実的かつ強固なものであることを確認することから始めました。コンピュータが、画像のファイル形式や色の有無、あるいは細部の鮮明さといった、明白な違いに反応しているだけではないかを検証したのです。その結果、たとえ色彩豊かな絵画を白黒にしたり、画像サイズを極めて小さくぼやけた正方形に縮小したりしても、コンピュータは依然として人間による画像と人工的な画像を別々のグループに保持し続けることがわかりました。これにより、システムが単にピクセルノイズやカラーパレットのような単純な事象を察知しているという考えは否定されました。信号はより深く、画像自体の複雑な構造の中に隠れていたのです。
この隠れた信号を見つけ出すために、研究者は、人間が理解できるツールを用いてコンピュータの心の不可視の領域をマッピングしようとする地図製作者のように振る舞いました。彼らはまず、平均的な明るさや色の分布を確認するといった最も単純な測定から始めましたが、これらの基本的な統計量では分離を説明できませんでした。次に、エッジやグラデーションが画像全体にどのように配置されているかを探るため、テクスチャや形状を分析するより洗練されたツールへと移行しました。彼らは、コンピュータが孤立した箇所やAI生成器によって残された特定のアーティファクトを見ているのではないことを発見しました。代わりに、コンピュータは画像全体に広がるパターン、つまり、さまざまなスケールで同時に存在する一種の統計的なリズムに反応していたのです。
このパターンを明らかにするための最も成功したツールは、スキャタリング変換と呼ばれる手法でした。これは、ズームインやズームアウトを繰り返しながら画像のテクスチャがどのように変化するかを測定し、微細なディテールと大きな形状との関係を捉える方法だと考えてください。研究者がこの手法を適用したところ、AI生成の絵画は人間による絵画よりも一貫して強い反応を示すことがわかりました。人工的な画像は、異なるレベルの詳細間の、より強烈で構造化された相互作用を持っていました。コンピュータは本質的に、AI画像が構築される際の、一種の統計的な「大きさ(ラウドネス)」を感知しており、その性質は画像を間近で見ても遠くから見ても一貫していました。
しかし、物語は完全な説明とともに終わったわけではありません。スキャタリング法は分離の大部分を説明できましたが、すべてを説明することはできませんでした。そこで研究者は、人間の知覚の限界をテストするために、驚くべき実験を行いました。彼らはコンピュータ自身の内部論理を用いて、絵画に対して、人間側のマップからAI側のマップへと移動させるのに十分な、極めて微細でほとんど目に見えない変化を加えたのです。人間の目には、その絵画は変化の前と後で全く同じに見えました。その違いはあまりに微細で、感知できないほどでした。しかし、コンピュータにとって、その画像は劇的な変貌を遂げたことになったのです。これは深い断絶を明らかにしました。コンピュータは、私たちの目や脳が登録することのない、微細な統計的規則性に依存しており、人間にはほとんど見えない視覚的証拠に対して敏感であるということです。
これらの知見は、人工知能と人間の視覚が共に同じ傑作を見つめていたとしても、両者が根本的に異なるものを見ている可能性があることを示唆しています。コンピュータは単に人間の好みを模倣しているのではなく、人間による検査では不可能な、安定したマルチスケールの統計的パターンを優先するという、異なるルールに基づいて動作しているのです。これはコンピュータが間違っているという意味ではありませんが、機械と人間が同じ審美眼を共有しているという私たちの仮定はおそらく誤りであるということを意味しています。コンピュータの精神における人間とAIの芸術の分離は、単なるグリッチや単純なエラーではなく、異なる見方の窓であり、人工的なシステムが視覚的世界を処理する際の、独特でしばしば隠された方法を浮き彫りにしているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。