Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers
本論文は、執筆、発散思考、科学的アイデア創出における大規模言語モデル(LLM)の性能を予測するための既存の人間の創造性テストを体系的に評価し、それらの妥当性が限定的であることを明らかにするとともに、収束思考と発散思考の両方を同時に評価することで科学的アイデア創出を予測可能にする最初の堅牢な指標として、発散遠隔連合テスト(DRAT)を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。非常に賢いロボット(大規模言語モデル、または LLM)の巨大な図書館があると。あなたは、どれが真に「創造的」なのかを知りたいのです。しかし、機械における創造性をどのように測定するのでしょうか?
長らく、科学者たちはこれらのロボットを評価するために、人間に対して行ってきたのと同じテストを使おうとしてきました。これは、魚の登木能力を測定しようとするようなものです。なぜなら、登木能力がどれほど優れているかを知りたいからですが、魚は木に登ることはできないのです。この論文は、これらの古いテストの一部はそれなりに機能するものの、特に科学的なアイデアに関しては、全体像を伝えるのにしばしば失敗すると主張しています。
以下は、研究者たちが発見した内容と、それを解決するために構築したものの簡単な解説です。
1. 問題:誤った定規の使用
研究者たちは、人間が受ける「創造性テスト」の 2 つの主要なタイプを検討しました。
- 発散思考: 質問に対して、多数の 異なる奇妙な答えを思い浮かべるよう人に求めること(例:「互いに全く異なる 10 のものをリストアップせよ」)。
- 収束思考: 3 つの無関係なものを結びつける唯一の 正しい答えを見つけるよう人に求めること(例:「コテージ」「スイス」「ケーキ」→「チーズ」)。
チームは、これらの人間用テストを用いて数十の AI モデルをテストしました。そして、いくつかの驚くべき発見をしました。
- 「賢さ」の罠: 創造性を測定しているように見える多くのテストは、実際にはロボットがどれほど「賢く」知識があるかを測定しているだけでした。ロボットが数学や読解に優れていれば、実際に創造的でなくても、これらのテストで高得点を取るようになります。これは、数学のテストで学生を評価し、高得点を取ったからといってそれを「創造性テスト」と呼ぶようなものです。
- 「科学的」な盲点: 最も衝撃的な発見は、既存の人間のテストのどれ一つとして、AI が優れた科学的アイデアを生み出せるかどうかを確実に予測できなかったことです。物語を書くのが得意なロボットや、無関係な単語をリストアップするのが得意なロボットであっても、新しい科学理論を発明するのは苦手かもしれません。古い定規では、この仕事には適していなかったのです。
- より新しいモデルのパラドックス: AI モデルが新しくなり、より強力になるにつれて、実際には発散思考(独創的で奇妙なアイデアを思い浮かべる能力)が悪化しました。彼らはより硬直化し、画一的になりました。まるで、新しいレシピを発明するシェフではなく、同じクッキーを繰り返し製造する工場のようでした。
2. 解決策:新しいハイブリッドテスト(DRAT)
古いテストが科学的創造性の予測に失敗したため、著者たちは**発散遠隔連想テスト(DRAT)**と呼ばれる新しいテストを考案しました。
古いテストを 2 つの別々の道具だと考えてみてください。
- 道具 A(発散): 物を粉砕して、いくつの異なる部品が得られるかを見るための金槌。
- 道具 B(収束): 物を締め付けて、完璧な適合を見つけるためのドライバー。
科学的創造性の問題は、同時に両方が必要だということです。新しい何かを見つけるためにアイデアを粉砕する必要があり、その後、それらが実際に意味を持ち、問題に適合するか確認するために、それらを結合する必要があります。
DRAT の仕組み:
AI に「心拍」「パイプライン」「トポロジー」のような、非常に異なる 3 つの「アンカー」単語を与えると想像してください。
- 課題: AI は、互いにすべて異なる10 の単語を生成しなければなりません(発散)。
- 条件: しかし、その 10 の単語のそれぞれが、3 つのアンカー単語のすべてと比喩的に結びつくことができなければなりません(収束)。
これは、詩人に 10 の全く異なる詩を書くよう求めながら、すべての詩が特定の複雑な機械についてのものであるように秘密裡に仕向けるようなものです。AI がこれを行えれば、それは同時に野性的かつ論理的に思考できることを証明します。
3. 結果
彼らがこの新しい DRAT ツールをテストしたとき、以下のことがわかりました。
- 機能しました! これは、どの AI モデルが科学的アイデアを生み出すのに優れているかを成功裏に予測できた最初のテストでした。
- 単なる部分の総和ではありませんでした: 研究者たちは、古い「粉砕」テストと古い「締め付け」テストを組み合わせれば機能するかどうかを試みました。しかし、機能しませんでした。新しい DRAT ツールは、2 つの古いツールが単独では行うことのできない特別なことを成し遂げました。科学的創造性を測定するには、野生的でありながら論理的である能力を同時にテストしなければならないことが証明されました。
重要な結論
この論文は、AI の創造性を評価するために、古い人間用テストをそのまま使ってはならないと結論付けています。
- AI が物語を書くのが得意かどうかを知りたい場合は、「発散連想タスク」(奇妙な単語リスト)を使用してください。
- AI が発散思考(多くの選択肢をリストアップする)が得意かどうかを知りたい場合は、「条件付き発散連想タスク」を使用してください。
- しかし、AI が新しい科学を発明できるかどうかを知りたい場合は、新しいDRATテストが必要です。なぜなら、それは機械が同時に野生的な想像力と論理的な結びつきを持てるかどうかをチェックするからです。
要約すれば:ロボットの科学的な天才を測定するには、火を操りながら(発散)、綱渡りをさせる(収束)ようなテストが必要です。古いテストは、そのどちらか一方だけを要求していました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。