Learning visual representations for compositional analysis of artworks and photographs
本論文は、知覚的グルーピングに基づく人間から着想を得た解釈可能なアプローチと、構成的分析のためのファインチューニングされた基盤モデルを比較し、後者が十分なデータを用いて優れた性能を達成する一方で、前者はエンコーダを凍結した際に、より優れた解釈性と汎化性能を備えつつ競争力のある結果を提供することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ある絵画や写真を見つめていると想像してみてください。あなたの脳は、単に色の平坦な壁を見ているのではありません。脳は瞬時にそのシーンを一つの物語へと整理しています。物事をグループ化し、人が木に対してどのように立っているかに注目し、バランスや緊張感を感じ取ります。この視覚における「物語を紡ぐ」部分は、「構図(コンポジション)」と呼ばれます。それは、画像に美しさやドラマチックさ、あるいは「しっくりくる」感覚を与える秘密のソースです。長い間、コンピュータはこの理解が極めて苦手でした。コンピュータは画像の中に「何があるか」(犬、車、夕日など)を認識することには長けていますが、それらが意味を生み出すために「どのように配置されているか」を理解することには苦労してきました。この論文は、その溝を掘り下げ、大きな問いを投げかけます。コンピュータに芸術家のように「見る」ことを教えるには、人間の脳のように考える脳を構築する必要があるのか、それとも、ただ超スマートなコンピュータに十分な数の例を与え続ければ、自力で解明できるのか、という問いです。
研究者のファテメ・ベラド、ティネ・トゥイテラーズ、ヨハン・ワゲマンス(ベルギーのルーヴェン・カトリック大学)は、コンピュータに構図を教えるための二つの全く異なる方法をテストすることにしました。これは、パズルを解く方法を学生に教えることに似ています。
二つのアプローチ
最初のアプローチは「人間スタイル」の手法です。画像をぼやけたピクセルの塊として見るのではなく、この手法は画像を、空、山、人物といった、明確で意味のある塊へと分解しようとします。これは「オブジェクト中心学習(Object-Centric Learning)」と呼ばれる特殊な技術を用いて、これらの塊を自動的に見つけ出します。これは、「この塊は人間、あの塊はボート」と分類するスマートな仕分け器のようなものです。そして、「グラフ・アテンション・ネットワーク(Graph Attention Network)」を使用して、これらの塊の間に目に見えない線を引き、それらが互いにどのように関係しているかを分析します。それは、まるで現場検証を行う探偵が、「銃が被害者の近くにある」ことや「窓がテーブルの上にある」ことを記録していくようなものです。この手法は透明性を重視しており、コンピュータが画像のどの部分を見て、それらをどのように結びつけているのかを、私たちは正確に把握することができます。
第二のアプローチは「ビッグデータ」の手法です。これは、すでに数百万枚の画像を見ている大規模な学習済みAIモデル(基盤モデルと呼ばれます)を使用します。研究者たちは、これらの巨人を特定の写真や絵画のデータセットに対して単に「ファインチューニング(微調整)」し、十分な練習を積ませることで、コンピュータが自力で構図のルールを学んでくれることを期待します。これは、美術史に関するあらゆる本がある図書館に学生を放り込み、「自分でなんとかしろ」と命じるようなものです。非常に強力ですが、これは「ブラックボックス」でもあります。つまり、コンピュータがどのように意思決定を下しているのか、私たちは本当の仕組みを知ることはできず、コンピュータは画像の「配置」を理解しているのではなく、単にそこに「何があるか」(例:これは猫だ)を認識することに頼っている可能性があります。
研究の結果
チームは、二つの大きな課題――写真の「スタイル」(「中央配置」や「対角線配置」など)の予測と、画像の構成の良さをスコア化すること――を用いて両方の手法をテストしました。また、コンピュータが画像の最も重要な部分(サリエンス/顕著性)を見つけられるか、そしてレイアウトに基づいて類似の画像を見つけられるかも確認しました。
ここにひねりがあります。それは、どれだけのデータを持っているかによって決まります。
研究者が大規模なAIモデルを凍結させた状態(新しいことを学習させない状態)で、「人間スタイル」の手法を用いた場合、それは驚くほど優れた結果を出しました。オブジェクトをグループ化し、その関係性を理解することができ、しばしば凍結された大規模モデルを上回りました。最も素晴らしい点は、なぜその決定を下したのかを理解しやすいことです。コンピュータが構築した「グラフ」のつながりを、文字通り目にすることができるのです。
しかし、十分なデータがあり、大規模な基盤モデルを完全に「ファインチューニング」できた場合、それらの巨人がリードを取りました。彼らは、スコアやカテゴリの予測において大幅に向上しました。しかし、落とし穴がありました。大規模モデルは解釈性が低く(理解が難しく)、写真から絵画へと異なる種類の画像に切り替える際に苦戦したのです。彼らは「配置」(例:猫が三角形の形の中に座っている)よりも、むしろ「物体」の認識(例:これは猫だ)に強く依存しているようでした。
結論
この論文は、もし大量のラベル付きデータがあり、単に最高のスコアが欲しいのであれば、「ビッグデータ」のアプローチが勝利すると示唆しています。しかし、効率的で、様々な種類の芸術(写真から絵画まで)に対応でき、かつ、なぜその画像が構成として優れていると判断したのかを説明できるシステムが必要であれば、「人間スタイル」のアプローチが勝者となります。
興味深いことに、研究者たちは「人間スタイル」の手法が、画像の最も重要な部分を特定することに優れていることを見出しました。グラフ内の接続関係を見ることで、「この人物はあらゆるものと繋がっているため、最も重要な部分である」と指摘することができ、これは人間の目が実際にどこを見ているかとよく一致していました。大規模モデルは強力ではありますが、この点においては少し不透明でした。
結局のところ、この論文はどちらか一方が絶対的な勝者であると宣言しているわけではありません。むしろ、大規模なAIモデルは、十分なデータを与えられれば信じられないほど強力である一方で、人間が自然に行うように、視覚的要素をグループ化し関連付ける仕組みを構築することには、依然として独自の価値があることを示しています。それは、芸術を理解するためには、時として芸術家の「見方」を理解する必要があるということを思い出させてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。