Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations
本論文は、多様な領域における4つの一般的な創造性評価指標を批判的に分析し、それらが顕著な不一致、領域固有の限界、および人間の判断との乖離を有していることを明らかにし、それによって、より強固で汎用性の高いフレームワークへの緊急の必要性を強調するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、世界で最も独創的な作家、問題解決者、そして科学者を見つけ出そうとしているスカウトだと想像してください。目の前には膨大な数の応募書類の山がありますが、あなたには「天才的なもの」と「退屈なもの」を素早く仕分けするための方法が必要です。手作業で全てを読むにはあまりにも多すぎるため、あなたは4つの異なる自動化ツール(指標)を使って、あなたに仕分けをさせようと決めました。
この論文は、実質的にそれら4つのツールに対する「通知表」です。著者たちは、これらのツールが本当に機能するかどうかをテストしましたが、悪いニュースは、それらはすべて極めて信頼性に欠けるということです。
以下は、テストされた4つのツールと、なぜそれらが失敗したのかについての内訳です。分かりやすい比喩を用いて説明します。
テストされた4つのツール
1. 「コピペ」検出器(創造性指数 / Creativity Index)
- 仕組み: このツールはインターネットをスキャンし、ある文章が以前に書かれたことがあるかどうかを調べます。もしフレーズがユニークで、その膨大なデータベースの中に現れなければ、高い「創造性」スコアを与えます。
- 問題点: これは、シェフがどれほど独創的かを、「他の誰も買ったことがない食材をどれだけ使ったか」という点だけで判断するようなものです。
- **クリエイティブ・ライティング(創作)**においては、ユニークな言葉選びが新鮮な物語を意味することがあるため、うまく機能しました。
- 問題解決や科学においては、惨めに失敗しました。素晴らしい新しい科学的アイデアであっても、非常に一般的で標準的な言葉(例えば「実験」や「データ」など)を使うことがあります。このツールは、それを「退屈だ」と判断してしまいます。逆に、作家が単に格好良く見せるために奇妙で難解な言葉を使った場合、このツールはそれを「天才的だ」と判断してしまいます。これは「語彙の多様性」を測っているのであって、「アイデアの斬新さ」を測っているわけではありません。
2. 「驚きメーター」(パープレキシティ / Perplexity)
- 仕組み: このツールは、コンピュータが文中の次の単語に対してどれくらい「驚く」かを予測します。テキストが非常に予測可能であれば、スコアは低くなります。テキストが奇妙で予想外であれば、スコアは高くなります。つまり、「創造性 = 驚き」という考え方です。
- 問題点: これは、コメディアンを「観客がどれだけ困惑して息を呑んだか」という回数だけで評価するようなものです。
- 時として、テキストのスコアが高くなる(非常に驚きがある)理由は、それが創造的だからではなく、単に文法的にめちゃくちゃだったり、意味不明だったりするためです。
- 時として、真に素晴らしく明快なアイデアは、非常にスムーズで読みやすく書かれています。そのため、ツールは低いスコアを与えてしまいます。
- 著者らは、「創造的なテキスト」と「創造的でないテキスト」が全く同じスコアになることを発見しました。これでは、両者を区別するツールとしては役に立ちません。
3. 「文章構造スキャナー」(構文テンプレート / Syntactic Templates)
- 仕組み: このツールは、文章の骨組み(例:「[名詞] が [形容詞] な [名詞] を [動詞] する」)を調べます。書き手が同じ文章パターンを何度も繰り返し使っていないかをチェックします。
- 問題点: これは、画家の筆致(筆の運び)の形だけを見て、その人が描いている絵そのものを無視して評価するようなものです。
- クリエイティブ・ライティングにおいては、AIがしばしば反復的で定型的な文章構造(例:「英雄の旅は……から始まった」など)を使用することを、このツールは捉えることができました。
- しかし、科学や問題解決においては、専門家は明快さと正確さを保つために、標準的で定型的な言語を使用する必要がある場合があります。このツールは、彼らが文法のルールに従っていることを「創造性がない」と判断し、罰を与えてしまいました。
4. 「AI審判」(LLM-as-a-Judge)
- 仕組み: これは、人間の教師と同じように、別のAIを使って作品を読み、成績をつける手法です。
- 問題点: これは、生徒に別の生徒の宿題を採点させるようなものです。彼らは一貫性がなく、簡単に騙されます。
- 押し付けがましさ(Squeezable): 質問を少し変えるだけで(例:「これは創造的ですか?」と聞くか、「これは創造的ではありませんか?」と聞くか)、AIは考えを完全に変えてしまいます。
- 偏り(Biased): AIは、実際の質に関わらず、一方の側(例:常に「いいえ、これは創造的ではありません」と言う)に偏る傾向があります。
- 信頼性の低さ(Unreliable): 同じエッセイに対して3回採点を求めたとき、AIが自分自身の回答と一致したのはわずか40%でした。それは基本的に推測しているに過ぎません。
全体像
著者らは、これらのツールを3種類の異なる創造性に適用しました:
- クリエイティブ・ライティング(物語、詩)。
- 問題解決(日常的な道具の奇妙な使い方を見つけること)。
- 研究の着想(新しい科学的理論を考案すること)。
結果: 単一のツールがこれら3つすべてに対応できることはありませんでした。あるツールが創造的な物語を見つけるのには優れていても、創造的な科学的アイデアを見つけるのは苦手でした。時には、全く同じテキストに対して、ツール同士が意見を食い違うことさえありました。
結論
本論文は、我々は現在、創造性を自動的に測定する信頼できる方法を持っていないと結論付けています。
- 現在のツールは、主に言葉の選択、文章の長さ、あるいはテキストがどれほど「奇妙」に見えるかといった、表面的な要素を測定しています。
- それらは、テキストの背後にある実際のアイデアや概念を捉えることに失敗しています。
- コンピュータが数値に基づいて何かを「創造的だ」と言ったとしても、それが人間と一致するとは限りません。
著者らは、実質的にこう言っています。「私たちは、これらの単純な数学的トリックに頼るのをやめるべきです。人間(あるいは機械)の創造性を判断できると信頼できるレベルに達するには、単なる『言葉』ではなく、『アイデア』を理解するより優れたシステムを構築する必要があります。」
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。