AGC-Bench: Measuring Artificial General Creativity
本論文は、人工汎用創造性の統一的な尺度を確立する包括的なベンチマークおよび評価フレームワークであるAGC-Benchを紹介し、それが一般知能とは異なる単一の創造性因子を明らかにするとともに、トップクラスの人間によるクリエイターが依然として現在の最先端のLLMを凌駕していることを示すものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、人々の「創造性」を測るために設計された、巨大なテストのライブラリを持っていると想像してください。あるテストはレンガの新しい使い道を思いつくよう求め、あるテストは面白いジョークを書くよう求め、また別のテストは科学的なパズルを解くよう求めます。長い間、研究者たちは議論してきました。創造性とは、あらゆる分野で優れた成果を出すための一つの大きな「スーパーパワー」なのか(数学が得意なら物理も得意になるようなものか)、それとも、詩には長けているがエンジニアリングには全く向かないといった、個別のスキルの集合体なのか、ということを。
現在、私たちは物語を書き、問題を解決し、ジョークを飛ばすことができる人工知能(AI)モデルを持っています。しかし、AIの創造性が一般的なスーパーパワーなのか、それとも単なる一連の孤立したテクニックに過ぎないのかを測定する方法はこれまでありませんでした。
この論文は、AIのための巨大な新しい「創造性のジム」であるAGC-Benchを紹介しています。彼らが何を行い、何を見出したのかを、簡単に説明します。
1. 究極の創造性ジムの構築
研究者たちは、単に新しいテストを一つ作ったわけではありません。彼らは司書であり、探偵であるかのように振る舞いました。彼らは3,000以上の学術論文をスキャンし、AI向けに作られたあらゆる創造性テストを見つけ出しました。その膨大な論文の山から、彼らは78の異なるテスト(「ブレインストーミング」テスト、「ストーリーテリング」テスト、「ユーモア」テストなど)を選び出し、それらすべてを一斉に実行するための統一されたシステムを構築しました。
これは、アスリートの能力を同じ基準で測定するために、トレッドミル、ウェイトラック、クライミングウォール、そしてスイミングプールを備えた、単一のジムを建設するようなものです。彼らは83種類の異なるAIモデルをこのジムでテストしました。
2. 「審判」の問題と新しいレフェリー
AIに別のAIのジョークや物語を採点させると、そのAI審判にはバイアスが生じることがあります。厳しすぎたり、逆に甘すぎたりすることがあるのです。それは、特定のチームを愛し、他のチームを嫌うレフェリーがいるようなものです。
これを解決するために、研究者たちは**「審判応答理論(Judge Response Theory)」**と呼ばれる巧妙なトリックを使用しました。彼らは3つの異なる「スーパーAI」レフェリーにすべての回答を採点させました。そして、数学を用いて、どのレフェリーが「厳しいコーチ」で、どのレフェリーが「寛大なコーチ」であるかを特定しました。彼らはスコアを調整し、全員が公平に判定されるようにしました。最終的に、彼らはこの公平なパネルを模倣する、完璧なレフェリーとなる新しいオープンソースのAI(AGC-Judgeと呼ばれます)を訓練しました。これにより、高価な3つのスーパーAIを用意しなくても、誰もが後でこれを利用できるようになります。
3. 大きな発見:創造性は一つのものか、それとも多くのものか?
これがこの論文のメインとなる問いです。彼らはこう尋ねました。「もしAIが物語を書くのが得意なら、そのAIは自動的に科学的な問題を解くことも得意になるのだろうか?」
答え: はい、大部分においてそうです。
スコアを分析した結果、AIにおける創造性は、一つの強力なエンジンとして機能していることがわかりました。彼らはこれを**「C因子」**(人間における一般知能の「g因子」のようなもの)と呼んでいます。
- 比喩: 創造性を懐中電灯だと想像してください。もしAIが高い「C」を持っていれば、それが詩を書くことであれ、ジョークを作ることであれ、あらゆるテストに対して明るく光を放ちます。
- 統計: この単一の「C因子」が、モデル間の差異の**81.5%**を説明していました。あるAIがひとつの創造的なタスクでどれほど優れているかを知れば、そのAIが他のほぼすべての創造的タスクでどのように振る舞うかを予測できるのです。
ただし、人間が数学者よりも優れた作家である可能性があるのと同様に、トップクラスのAIモデルにもわずかな「好み」は存在します。ユーモアに少し長けているモデルもあれば、科学的なアイデアに少し長けているモデルもいます。しかし、全体的な「創造的エンジン」は同じなのです。
4. AIの創造性は単なる「推論」の仮の姿か?
一部の人々は、「AIは創造的になっているのではなく、単に論理や事実に非常に長けているだけではないか」と考えました。
研究者たちは、モデルに「創造的であれ」と指示する場合と、「論理的であれ」と指示する場合を比較することで、これをテストしました。
- 結果: AIに「創造的であれ」と伝えることは、「推論脳を使え」と伝えるよりも、スコアを大幅に向上させました。これは、このテストが論理ではなく、実際に創造性を測定していることを証明しています。
5. 人間 vs AI:どちらがより柔軟か?
彼らはAIの結果を、同じテストを受けた実在の人間グループと比較しました。
- 発見: 人間は非常に「専門化」されています。詩を書くことに長けた人間は、エンジニアリングのパズルを解くのが苦手かもしれません。人間の創造性は、異なるバケツに分かれています。
- AIの違い: AIは驚くほど「一般的」です。あることに長けているAIは、通常、あらゆることに長けています。AIは人間よりも専門化されていません。
- 勝者: AIの方が柔軟ではありますが、その場にいる最高の人間は、最も困難なタスクにおいて最高のAIを上回りました。トップの人間は、トップのAIよりもわずかにリードしており、AIは急速に追い上げています。
まとめ
この論文は、AIの創造性を測定するための、巨大で公平かつ標準化された遊び場を構築しました。彼らは、AIの創造性が、さまざまな種類の創造的タスクにおけるパフォーマンスを支える、単一の、一般的な能力(まるでスーパーバッテリーのようなもの)であることを発見しました。それは、バラバラのスキルの集まりではありません。最高のAIは最高の人間にはるかに近いレベルにありますが、トップの人間は依然として王座を守っており、人間の創造性は、AIの「万能型(ジャック・オブ・オール・トレード)」のアプローチと比較して、より専門化されているのです。
彼らは、他の人々がこれらのモデルをテストし改善し続けられるよう、すべてのツール、データ、そして「公平なレフェリー」となるAIを公開しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。