CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity
本論文は、拡散的思考、クリエイティブ・ライティング、および論理的推論における8つのタスクを3つの次元(質、新規性、多様性)を用いて評価する、スケーラブルでクロスドメインな評価フレームワークであるCreativityPrismを導入し、最先端のモデルは執筆や推論においては優れているものの、拡散的思考においては有意な優位性を示さず、また性能が異なる創造的次元間で一般化することは稀であることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大な、テキスト生成器(大規模言語モデル、LLM)の魔法の図書館を想像してみてください。誰もがこう問いかけています。「これらの機械は、本当に『創造的』なのだろうか?」
問題は、「創造性」という概念が非常に捉えどころのないものであることです。ある時は面白い物語を書くことを意味し、ある時は数学の問題を奇妙な方法で解くことを意味し、またある時は紙クリップの新しい使い道を思いつくことを意味します。この論文が登場するまで、研究者たちは、異なる仕事に対して異なる定規を使って創造性を測定しようとしたり、人間がすべての回答を一つずつ採点するという、時間がかかりコストの高い方法をとったりしていました。
「CreativityPrism(クリエイティビティ・プリズム)」の登場。
CreativityPrismを、光のビーム(AIの出力)を通すための、最新鋭の高機能なプリズムだと考えてください。単なる白い塊を見るのではなく、このプリズムは光を3つの明確な色に分かれ、機械の創造性の真の姿を明らかにします。
創造性の3つの色
著者らは、機械が本当に創造的であるかどうかを理解するためには、3つの特定の側面から測定しなければならないと主張しています。
- 品質(「それは機能するか?」の色): これは基礎です。もし機械が支離滅裂な物語を書いたり、数学の問題を間違えて解いたりするなら、そのアイデアがいかに「新しい」ものであっても意味がありません。それはただのノイズです。品質は、出力が実際にタスクを遂行できているかを測定します。
- 新規性(「どれくらい奇妙か?」の色): これは、答えがいかに平凡なものから逸脱しているかを測定します。その機械は、人間がこれまで見たこともないような解決策を思いついたのでしょうか? それとも、学習データにあるものをただコピーしただけなのでしょうか?
- 多様性(「どれほど多くの選択肢があるか?」の色): これは幅広さを測定します。もし機械に10個のアイデアを求めたとき、それらは10個の全く異なるアイデアでしょうか、それとも単に少しずつ異なるだけの10個のバリエーションに過ぎないのでしょうか?
比喩: あるシェフを想像してください。
- 品質: 料理がおいしく、焦げていないこと。
- 新規性: シェフが誰も試したことのない味の組み合わせ(例:チョコレートとピクルス)を発明すること。
- 多様性: シェフが10種類の異なるデザートを作れること。単にチョコレートケーキのバリエーションを10通り作るのではなく。
- CreativityPrism はこれら3つすべてをチェックします。100通りの異なる焦げたチョコレートケーキを作るシェフは、多様性は高いですが、品質と新規性は低くなります。
大規模なテスト:キッチンにいる17人のシェフ
著者らは、現在利用可能な最もスマートなAIモデルのうち17個(OpenAI、Google、Anthropic、DeepSeekなどの企業のもの)を取り上げ、3つの領域にわたる8つの異なるチャレンジにかけました。
- 拡散的思考: 「代替用途テスト」(例:「レンガを使って壁を作る以外に、何ができるか?」)のようなもの。
- クリエイティブ・ライティング: プロンプトに基づいた物語や詩の執筆。
- 論理的推論: 厳格で奇妙な制約の下での数学問題の解決やコードの記述。
彼らが発見したこと(プロットの急展開)
1. 「巨大 vs 小さなモデル」のギャップ
巨大で高価なAIモデル(「フロンティア」モデル)は、一般的にクリエイティブ・ライティングと論理的推論において優れています。彼らは複雑なレシピに従い、美しいメニューを書くことができる熟練のシェフのようなものです。しかし、拡散的思考(突飛で無関係なアイデアを生み出すこと)に関しては、超高価なモデルと小規模なオープンソースモデルとの間の差はほとんどなくなります。大きなモデルは、小さなモデルよりも「枠にとらわれずに考える」ことが必ずしも得意なわけではありません。
2. 「スペシャリスト」の問題
ここで最も驚くべき発見があります。あるタイプの創造性に長けていることは、別のタイプにも長けていることを意味しないということです。
- あるモデルは、小説を書くこと(高い品質)には驚異的に優れているかもしれませんが、スプーンの奇妙な新しい使い道を思いつくこと(低い新規性)は苦手かもしれません。
- あるモデルは、1,000個の異なる答えを生成できますが(高い多様性)、そのどれもが実際には新しかったり有用であったりはしません(低い新規性)。
著者らは、「新規性」が最も混沌とした次元であることを発見しました。数学の問題において「新しい」ものであることが、物語において「新しい」ものであることを保証するわけではありません。それらは全く異なるスキルなのです。
3. 「審判」による解決策
人間がすべてのテストを採点するには時間がかかりすぎるため、著者らは巧妙なトリックを使いました。他のAIを使って回答を採点させたのです。しかし、彼らはAIを盲目的に信頼したわけではありません。AIの「審判」が実際に人間と一致しているかどうかを確認するために、まず人間の専門家に少数のサンプルを採点させました。これは、厨房全体の料理を採点する前に、ヘッドシェフがいくつかの料理を試食して、副シェフが正しく採点しているかを確認するようなものです。
結論
CreativityPrismは、「このAIは創造的だ」という一つの曖昧な表現で済ませることをやめさせる新しいツールです。代わりに、こう教えてくれます。「このAIは良い物語を書くことには長けているが、数学を創造的に解くことはそこそこであり、突飛で無関係なアイデアを生み出すことはあまり得意ではない」と。
これは、創造性が単一のスーパーパワーではなく、必ずしも共に移動するわけではない、さまざまなスキルの集合体であることを証明しています。真に創造的な機械を構築するためには、単に偶然すべてがうまくいくことを期待するのではなく、これら異なる「色の」創造性に特化して訓練する必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。