Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models
本論文は、適切性を無視することによる大規模言語モデル評価における拡散連合課題(DAT)の限界を批判し、真の創造性とノイズをより良く区別するために人間の創造性理論に基づいた新しい条件付き拡散連合課題(CDAT)を提案し、そして高度なモデルが学習とアライメントによってしばしば新規性を適切性と引き換えに犠牲にしていることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、あるグループの人々(この場合はコンピュータプログラム)がどれほど創造的であるかを判断しようとしていると想像してください。あなたは彼らに簡単な課題を与えます。「互いにできるだけ異なる10個の単語を挙げなさい」。
これは**「発散的連想タスク(DAT)」**と呼ばれるものです。もしあなたが「リンゴ」「車」「雲」「靴」と言えば、それらの単語の意味は互いに大きく離れているため、高いスコアが得られます。しかし、もし「リンゴ」「バナナ」「チェリー」「ブドウ」と言えば、それらはすべて単なる果物であるため、低いスコアになります。
この論文の研究者たちはこう問いかけました。「これは人工知能(AI)にとって公平なテストなのだろうか?」
問題点:「ランダム・ノイズ」の罠
著者らは、私たちが現在AIの創造性をテストする方法における重大な欠陥を発見しました。単にAIに対して「異なれ」と命じるだけでは、AIは**「ランダムであること」**によってズルができるということを突き止めたのです。
これは、「サイモンセイズ(命令に従え)」というゲームのようなものです。「異なれ」というルールだけがある場合、目をつぶってページ上の単語をランダムに指差す人が、実は優秀な詩人よりも高いスコアを獲得してしまう可能性があります。AIは意味をなさない単語を並べ、それらが偶然遠い意味を持っているだけで、結果として高いスコアを出せてしまいます。つまり、AIは単にデタラメな言葉を吐き出しているだけで、それらは互いに関連性を持っていません。
この論文の実験では、2種類の「ズルをする者」をテストしました。
- ランダム・チーター(ランダムな不正者):辞書からランダムに10個の単語を選ぶだけのコンピュータプログラム。
- 「ゲーム最適化」チーター:AIに対して、「意味は無視して、とにかくこのテストで最高得点が出るような単語を選べ」と特別に指示されたもの。
衝撃的な結果: これら2種類の「ズルをする者」は、最も高度でスマートなAIモデルよりも高いスコアを記録しました。これは、従来のテスト(DAT)は実際に創造性を測定しているのではなく、単にどれだけランダムになれるか、あるいはどれだけシステムを出し抜くのが上手いかを測定しているに過ぎないことを意味しています。
解決策:「コンテクスト(文脈)」を用いたテスト(CDAT)
これを修正するために、研究者たちはCDAT(条件付き発散的連想タスク)と呼ばれる新しいテストを考案しました。
比喩:
従来のテストは、誰かに「ランダムなものを10個挙げなさい」と頼むようなものでした。
新しいテストは、**「『猫』に関連する、異なる10個のものを挙げなさい」**と頼むようなものです。
これにより、AIは同時に2つのことを行う必要があります。
- 適切であること:単語は必ず手がかり(例:「ヒゲ」「肉球」「レーザーポインター」)に関連していなければなりません。もし「トースター」や「火山」と言えば、失敗です。
- 多様であること:単語は依然として互いに異なっていなければなりません。「猫」「子猫」「ネコ」はすべて関連していますが、あまりに似通っています。「猫」「魚」「犬」の方がより優れています。
この新しいテストは、真の創造性(ユニークでありながら、意味が通じること)と、ランダムなノイズ(ユニークだが意味不明であること)を切り分けます。
彼らが発見したこと
彼らがこの新しいテストを実行したところ、結果は一変しました。
- 「賢い」AIは守りに入りすぎた:最も高度で大規模なAIモデル(役に立ち、ルールに従うように訓練されたモデル)は、安全な方を選ぶ傾向がありました。彼らは非常に適切な回答を出しましたが、少し退屈で、あまり創造的ではありませんでした。彼らは教科書を完璧に理解しているが、枠にとらわれて考えることを恐れている学生のようでした。
- 「小さな」AIの方が創造的だった:驚くべきことに、より規模が小さく、あまり「高度ではない」モデルの方が、創造性において高いスコアを獲得することがよくありました。彼らはリスクを冒し、トピックから外れることなく、よりユニークで多様なアイデアを生み出すことができました。
著者らは、AIモデルが大きくなり、「より安全」で「より役に立つ」ように訓練されるにつれて、創造的な輝きを少しずつ失っていく可能性があると示唆しています。彼らは正解であることに集中しすぎて、面白くなることができなくなっているのです。
まとめ
この論文は、創造性を測定するために単にAIに「異なれ」と命じることはできないと結論付けています。特定のコンテクスト(文脈)の中で異なれと命じなければなりません。
- 旧来の方法:「ランダムになれ!」(AIはデタラメな内容でズルをする)。
- 新しい方法:「創造的であれ、かつ意味の通るものにせよ!」(AIはユニークであることと、有用であることのバランスを取らなければならない)。
この新しい手法は、どのAIモデルが本当に創造的なのか、そしてどのモデルが単に指示に従ったりランダムに推測したりするのが上手いだけなのかを、より明確に描き出してくれるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。