Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity
本論文は、大規模言語モデル(LLM)が新規性などの内在的な性質については人間の創造性評価と一致する一方で、モデル固有のより狭い基準への依存や文脈情報に対する感受性の低さゆえに大きく乖離しており、特定のLLM評価器の選択が創造性評価における重大な決定となることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、巨大で騒々しいアートギャラリーの中にいると想像してみてください。そこでは誰もが、どの絵画が「創造的」であるかを推測しようとしています。絵の具や筆致だけを見ている人もいれば、誰が描いたのか、いくらで売られているのか、あるいは今それが流行っているのかを見ている人もいます。長い間、このギャラリーにおける審判は人間だけでした。しかし今、新しい種類の審判が登場しました。大規模言語モデル(LLM)です。LLMを、人間が書いたほぼすべての本、記事、ウェブサイトを読み込んだ超スマートなロボットだと考えてください。人間が何を語ってきたかを熟知しているため、私たちはそれが人間と同じように創造性を判断できるのではないかと期待しました。しかし、ここに謎があります。ロボットは時として私たちに同意しますが、時として全く別の絵を見ているかのように見えるのです。科学者たちは、いつロボットは私たちのように考え、いつ自分自身の思考の中に迷い込んでしまうのかを知りたがっています。この論文は、私たちの創造性コンテストの勝者を選ぶために、これらのデジタルな審判を信頼できるかどうかを確認するために、この問いに切り込みます。
研究者たちは、これらのロボット審判が正確にどのようなルールに従っているのかを突き止めようとしました。彼らは単に「これは創造的ですか?」と聞いたのではありません。代わりに、人間が通常注目する26の異なる要素(例えば「それは新しいか?」「それは有用か?」「それは有名か?」など)の重要性をランク付けするようロボットに求めました。彼らは最も人気のある6つのLLM(GPT、G grok、DeepSeek、ERNIE、Claude、Gemini)をテストし、その回答を実際の人間の意見と比較しました。
ここで、彼らが見つけた大きな驚きがあります。ロボットたちは皆同じように考えているわけではなく、また、私たちと全く同じように考えているわけでもありませんでした。人間は、アイデアそのものと、その周囲の世界(評判や市場のトレンドなど)の両方を見ることで、広い網を投じて創造的なアイデアを捉えますが、ロボットは主にアイデアそのものだけを見ています。具体的には、ロボットは**斬新さ(ノベルティ)**に執着しています。もしアイデアが新しく、奇妙で、あるいは予想外であれば、ロボлоットはそれを好みます。また、それが楽しく、あるいは芸術的であることも好みます。しかし、「文脈的」な手がかり(有名なブランドからの製品であるか、大衆向けのヒット作であるか、あるいはファッションであるかなど)に関しては、ロボットは基本的にそれらを無視します。人間にとって、有名なブランドはアイデアをより創造的に見せる要因になりますが、ロボットにとって、それは単なるノイズに過ぎません。
この研究はまた、すべてのロボットが同じように作られているわけではないことも明らかにしました。GPTやGrokのようなモデルは「より広い網」を持っています。彼らは人間が重視する26の基準の多くを見ており、その判断は人間の意見とよく一致します。一方で、ClaudeやGeminiのようなモデルは「より狭い網」を持っています。彼らは核となるアイデアに厳格に固執し、それ以外のほとんどを無視します。これは、もしあなたが「狭い」ロボットに創造的なアイデアの判定を依頼した場合、そのロボットが人間が気にする社会的・市場的な文脈を無視してしまうため、人間の考えとは食い違う可能性があることを意味します。
これを証明するために、研究者たちはさらに2つのテストを行いました。最初のテストでは、人間とロボットに1,100以上のアイデアを判定させました。その結果、「広い網」を持つロボットの方が、「狭い網」を持つものよりも人間のスコアとよく一致することが分かりました。2番目のテストでは、人間とロボットに全く同じ製品説明を見せましたが、一部の製品については、その製品のブランドや市場での成功に関する一文を付け加えました。人間たちの評価は、その追加の文脈を見たときに跳ね上がりました。彼らはそのおかげで、その製品がより創造的であると考えたのです。ところが、ロボットはどうだったでしょうか? 彼らの評価はほとんど変わりませんでした。彼らは、人間を揺さぶるような社会的ヒントに対して完全に盲目だったのです。
では、これは将来にとって何を意味するのでしょうか? これは、すべてのAI審判を同じものとして扱ってはならないことを示唆しています。もしあなたが、アイデアが真に独創的で新鮮であることを知りたいのであれば、ロボットは素晴らしい助けになるでしょう。しかし、もしそのアイデアが現実世界で成功するか、ブランドに適合するか、あるいは人々の話題になるかどうかを知りたいのであれば、ロボットは本質を見失う可能性があります。この論文は、適切なAI審判を選ぶことは極めて重要であることを示唆しています。モデルによって適用されるルールが異なるため、彼らが選ぶ勝者は異なるからです。私たちは、ロボットが全体像を見ていると仮定しないよう注意する必要があります。なぜなら、ロボットはしばしば、非常に特定的で狭いレンズを通して物事を見ているからです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。