Are LLMs becoming similarly creative? Evidence from three years of models
本論文は、大規模言語モデルの3年間にわたるリリースを分析し、オープンエンドな創造的タスクにおける出力の多様性が統計的に有意に減少していることを見出しており、これは人間とAIの共創的な作業における人間の主体性を減退させかねない均質化への傾向を示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:「LLMは同様に創造的になっているのか? 3年間のモデルによるエビデンス」
問題提起
多くのベンチマークは、検証可能な回答を持つタスクにおける大規模言語モデル(LLM)の性能を追跡しているが、創造性、独創性、および多様性が極めて重要となるオープンエンドなタスクに関する縦断的なデータは不足している。既存の研究は、LLMが個々には創造的に見えることがあっても、集団としては同質性を呈することが多く、異なるモデル間や時期間で出力が互いに類似することを示唆している。しかし、この同質性が発展中の技術による一時的なアーティファクト(人工物)なのか、あるいは統計的言語モデルとしての避けられない特徴なのかは不明である。現在のベンチマーク(例:MMLU、HELM)は、検証可能な回答を持つ明示的な基準に焦点を当てており、時間の経過に伴う創造的な出力の多様性や独創性の傾向を捉えることができていない。
手法
著者らは、以下の4つのステップを用いたプロセスを通じて、LLMの出力多様性に関する予備的な時間的分析を行った:
- プロンプトの選択: 創造的行動を引き出すために、2つの補完的なオープンエンド・プロンプトセットを選択した:
- 転用テスト(AUT): 発散的思考の標準的な心理学的アセスメントであり、モデルに対して一般的な物体に対する非典型的な用途を生成させる。
- Infinity-Chat100: 創造的なコンテンツ生成、ブレインストーミング、アイデア出しを含む6つのカテゴリーにわたる、100個の実世界のオープンエンドなユーザークエリのコレクション。
- データ収集: 2023年3月から2026年7月までにリリースされた68のモデル(12の主要なモデルプロバイダーによる、クローズドウェイトモデル33種とオープンウェイトモデル34種)に対してプロンプトを実行した。すべての生成において、確率的サンプリングを保持するために、temperature(温度)とtop-pを1.0とした。
- 意味的埋め込み(Semantic Embedding): レスポンスは、sentence-transformerモデルである
all-MiniLM-L6-v2を用いて埋め込みを行った。AUTについては、単一の物体に対するすべての用途を単一のベクトルとして埋め込み、Infinity-Chatについては、各レスポンスを個別に埋め込んだ。 - 回帰分析: 研究では、クロスファミリー・モデルペア(異なるプロバイダーのモデル)間の埋め込みのコサイン距離を計算し、意味的な分岐を測定した。これらのペアは、リリース日に基づいて9つの時間的ビンにグループ化された。不均衡なファミリー構成によるバイアスを軽減するため、著者らはファミリーバランスを取ったリサンプリングを1,000回行い、傾きの推定値の分布を生成した。最小二乗法(OLS)回帰を行い、平均コサイン距離をビン指数に対して実行した。
主な貢献
- 縦断的フレームワーク: 本論文は、モデルの挙動の静的なスナップショットを超えて、時間の経過に伴うLLMの創造的な出力の進化を追跡するための、初のフレームワークを提供する。
- デュアルタスク分析: 制御された心理学的タスク(AUT)と実世界のユーザークエリ(Infinity-Chat100)を組み合わせることで、構造化された文脈と非構造化された文脈の両方で創造性を評価する。
- 収束の定量的エビデンス: 本研究は、LLMの出力が時間の経過とともにますます類似してきているという経験的な証拠を提供しており、「新しいモデルは本質的に優れた創造的多様性を提供する」という仮定に異を唱えている。
結果
分析の結果、3年間の観察期間において、モデルの出力多様性が統計的に有意に減少していることが明らかになった:
- 傾向: AUTとInfinity-Chatの両方のデータセットにおいて、クロスファミリーのコサイン距離は時間の経過とともに一貫した負の傾斜を示しており、これは意味的な類似性(同質性)が増加していることを示している。
- 規模: 低下は転用テスト(AUT)において最も顕著であり、平均的なクロスファミリー距離は、最も早いリリースビンの約0.50から、最新のビンでは0.40を下回るまで低下した。Infinity-Chatのデータセットは、約0.34から約0.32へと、緩やかではあるが一貫した低下を示した。
- 堅牢性: 1,000回のすべてのリサンプリング・イテレーションにおいて、両方のデータセットで負の傾斜が生成され、この傾向が異なるファミリーのモデルの組み合わせに対しても堅牢であることを裏付けた。
意義と主張
本論文は、LLMがオープンエンドな回答を必要とするタスクにおいて創造性が低下していると断じ、モデル間の創造的な実質の収束を示唆している。著者らは、もしこの傾向が続くならば、「LLMによる同質化は、人間とAIの共創作業における人間の主体性を漸次的に減退させる可能性がある」と主張している。
本研究は、これらの知見を、人間の創造プロセスにおけるLLMの役割を慎重に検討することを求める予備的な分析として位置づけている。また、「AI創造性のパラドックス」に注目している。すなわち、モデルは個々には創造的に見えるかもしれないが、その集合的な出力は多様性を失いつつあり、それがユーザーが遭遇するアイデアの範囲を制限し、ダウンストリームの人間による創造性に悪影響を及ぼす可能性があるということである。著者らは、自らの研究が予備的なものであることを明示し、収束を駆動している根本的なメカニズム(共有された学習データや蒸留など)や具体的な要因を調査するための今後の研究を呼びかけている。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。