← 最新の論文
💬 NLP

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

本研究は、マルチモーダル大規模言語モデルが、ゼロショット設定において人間の評価と実質的に一致する形で視覚的創造性を効果的に評価できること、そして、そのステップ・バイ・ステップの推論は、スコアリングの精度を向上させることはないものの、評価プロセスに対する解釈可能な洞察を提供することを実証している。

原著者: William Orwig, Roger E. Beaty

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: William Orwig, Roger E. Beaty

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、芸術の授業を受けたこともなく、人間が絵を採点する様子を見たこともなく、「創造性」とはどのようなものかという教えも受けていない、巨大で超スマートな芸術批評家を手にしています。そして、ただ一枚の絵を渡して、「この絵の創造性を1から5のスケールで評価してください」と頼むのです。

これが、この論文がやっていることの本質です。研究者たちは、6つの異なる高度なAIモデル(これらを「デジタルの審判」と考えてください)に、まさにそれを実行させました。彼らは、これらのAIが、特別な訓練や練習なしに、人間が画像の創造性をどのように評価するかを推測できるかどうかを知りたかったのです。

以下は、その発見の内容を分かりやすく分解した物語です。

1. 「ゼロショット」のマジック

通常、AIに芸術を採点させるには、何千もの「良い」絵や「悪い」絵の例と、それに対する人間のスコアを見せて教える必要があります。それは、学生に採点済みの試験の束を見せて教えているようなものです。

しかし、研究者たちは異なる方法を試しました。それがゼロショットです。彼らはAIに、ただ画像と、「これを1から5で評価してください」という単純な指示を与えただけでした。例示も、トレーニングもありません。それは、見たこともない絵を評価するために、街角の通りすがりの人に頼むようなものです。

結果: 驚いたことに、AIの審判たちはかなり上手でした。彼らの評価は、人間の評価と非常によく一致していました。

  • AI生成画像(コンピューターによって作られた洗練された画像)については、AIの審判と人間は非常に強く一致しました。
  • 手書きのスケッチ(人間によるラフで乱雑な図)については、一致は見られるものの、少し弱まりました。

2. 「洗練 vs ラフ」のバイアス

研究者たちは、AIの審判たちが、高精細な写真を好み、鉛筆のスケッチを嫌う批評家のような、面白い性格の癖を持っていることに気づきました。

  • 「洗練」へのバイアス: 滑らかでコンピューター生成された画像を見るとき、AIの審判たちは寛大すぎました。彼らは人間よりも高いスコアを与えていました。
  • 「ラフ」へのバイアス: シンプルな手書きのスケッチを見るとき、AIの審判たちは厳しすぎました。彼らは人間よりも低いスコアを与えていました。

AIの審判たちは、密かに「精巧で」「複雑な」画像を好んでいるようです。もし図形に多くの線や詳細が含まれていれば、人間が単に「描き込みすぎ」だと感じても、AIはそれを創造的だと考えます。AIモデルは「詳細さ」と「創造性」を混同しているようでした。

3. 「思考プロセス」(思考の連鎖)

これらのAIモデルの中には、最終的なスコアを出す前に、自分の「思考プロセス」を書き出すという特別な機能を持つものがあります。これは、数学のテストで解法を書き出す生徒のようなものです。

研究者たちは、AIがスコアを決めるためにどのように内部で考えているのかを探るべく、その思考プロセスを覗き見ました。すると、AIは一貫した4ステップのレシピに従っていることが分かりました。

  1. 知覚: 「猫と木が見える。」(そこに何があるかを記述する)。
  2. 独創性: 「これは奇妙で新しい!」(それが独特であるかどうかを判断する)。
  3. 品質: 「線が滑らかで美しい。」(どれほど上手く描かれているかを判断する)。
  4. 正当化: 「だから、4を与える。」(数字を選ぶ)。

大きな驚き: 研究者たちは、もしAIがこれらのステップを「考え」、書き出す時間を取れば、人間のスコアにより一致するようになるだろうと考えていました。しかし、そうはなりませんでした。 「考える」ことは、スコアの正確性を向上させませんでした。しかし、それは研究者たちに対し、なぜAIがそのスコアを出したのかという「窓」を提供してくれました。それは、AIが単に「独創性(どれほど奇妙か)」だけでなく、「品質(どれほど美しいか)」に注目していたことを示しており、これがAI生成の洗練された画像をAIが好んだ理由を説明しています。

4. AIは対象が何かを知る必要があるのか?

研究者たちは、「もしAIが、描かれている犬を猫だと勘違いしたら、その創造性スコアは下がるのだろうか?」と考えました。

答え: 実は、そうでもありません。
たとえAIが描かれているものを誤認したり、あるいは人間同士でも何であるかについて意見が一致しないほど抽象的な図であったとしても、AIの創造性スコアは人間のスコアとよく一致していました。このことは、AIが単に「これは犬か? はい/いいえ」というチェックリストを確認しているのではないことを示唆しています。AIは、対象が正確に何かを知っていなくても、画像の「雰囲気(バイブス)」、構成、そして奇妙さに注目しているのです。

まとめ

この論文は、事前のトレーニングなしに、これらの大規模で汎用的なAIモデルを「創造性の審判」として使用できることを示しています。彼らは驚くほど優秀ですが、バイアスを持っています。彼らは複雑で詳細な画像を好み、シンプルでラフなスケッチを嫌います。

彼らの「思考プロセス」を見ることで、私たちは彼らがどこで正しく、どこで間違っているのかを正確に知ることができます。それは、たとえ好みが私たちとは少し違っていても、その理由を説明できる批評家を持っているようなものです。研究者たちは、誰でも自分の画像でこの「AI審判」を試せる無料のアプリまで作成しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →