← 最新の論文
💬 NLP

Automated Creativity Evaluation of Language Models Across Open-Ended Tasks

本論文は、発散的な新規性を測定するための意味論的エントロピーと、収束的なタスク遂行度を評価するための検索ベースのマルチエージェント・ジャッジを組み合わせることで、オープンエンドなタスクにおける大規模言語モデルの創造性を定量化する、スケーラブルでドメインに依存しないフレームワークを導入するものである。

原著者: Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan

公開日 2026-06-11
📖 1 分で読めます☕ さくっと読める

原著者: Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、新しいAIのライター、発明家、問題解決者たちの「創造性」を判定しようとしているタレントスカウトだと想像してください。かつて、創造性を判定することは、定規で絵画を採点しようとするようなものでした。それは混沌としており、あらゆる作品に対して人間の専門家を必要とし、特定の種類の芸術にしか通用しませんでした。

この論文は、パズルを解くことから物語を書くことまで、あらゆる種類のオープンエンドなタスクに適用できる、新しい自動化された「創造性スコアカード」を紹介しています。著者たちは、創造性を2つの異なる「スーパーパワー」に分解し、それぞれを別々に測定しています。それが、拡散的思考(多くの異なるアイデアを夢見る能力)と、収束的思考(最高のアイデアを選び出し、それを機能させる能力)です。

このシステムがどのように機能するかを、簡単な比喩を用いて説明します。

1. 「夢を見る」ことを測る(拡散的創造性)

問題点: AIが単に同じアイデアを言葉を変えて繰り返しているだけなのか、それとも本当に新しい領域を探索しているのか、どうすればわかるでしょうか?
従来の方法: 単語数を数えたり、文章の表面的な見た目が異なっているかを確認したりすることでした。これは、料理人が「スープ」という言葉をどれほど多様な言葉で表現しているかで、そのシェフの腕前を判断するようなものです。たとえ、どれほど言葉が変わっても、味はすべて同じであっても。
新しい方法(セマンティック・エントロピー): 著者たちは、**セマンティック・エントロピー(意味論的エントロピー)**という概念を用いています。

  • 比喩: あなたがAIに「どうやって川を渡りますか?」と尋ねたとします。
    • 創造性の低いAIは、「橋を架ける」「橋を作る」「橋を建設する」と言うかもしれません。これらは見た目は異なりますが、意味は全く同じです。「エントロピー(多様性)」は低いです。
    • 創造性の高いAIは、「橋を架ける」「ドローンを飛ばす」「蔓を縛り合わせる」「水が凍るのを待つ」と言うかもしれません。これらは真に異なる経路です。「エントロピー」は高いのです。
  • 結果: この手法は「バラエティ計」として機能します。表面的な言葉の変化を無視し、AIがいかに多くの「異なる概念的な方向」を探索しているかを測定します。このメーターは、従来のメソッドよりも、人間が「創造的である」と考える感覚にずっと近いことがこの論文で示されました。

2. 「実行する」ことを測る(収束的創造性)

問題点: 突飛なアイデアを生み出すことは簡単ですが、それらのアイデアが実際に問題を解決できるかどうかを確認するのは困難です。AIは、川を渡るために「ドラゴンを飛ばす」といった提案をするかもしれません。これは創造的ではありますが、役に立ちません。
従来の方法: 単一のAI判定器や人間が回答を読み取る方法でした。これは時間がかかり、コストがかかり、スケールさせるのが困難でした。
新しい方法(検索ベースのマルチエージェント・チーム): 著者たちは、専門化されたAI「判定員」のチームを構築しましたが、コストと時間を節明するために工夫を加えました。

  • 比喩: 安全管理官、実現可能性の専門家、ストーリー批評家といった専門家パネルがプロジェクトをレビューしていると考えてください。
    • 従来の方法: 彼らが発言するたびに、会話の最初からの履歴のすべてを読み直します。これは、全員が発言する前に、直前の100ページのメモを読み返している会議のようなものです。非常に膨大になり、コストもかかります。
    • 新しい方法: このチームは「スマートなファイリングシステム」を使用します。すべてを読み直す代わりに、現在議論されている特定のポイントに関連するメモだけを取り出します。
  • 結果: この「検索ベース」のアプローチにより、人間の専門家と同等の精度を維持しながら、計算コストを63%削減しました。これにより、AIが単にデタラメを夢見ているのではなく、実際にタスクの要件を満たしていることを保証します。

3. 大きな発見:2つの異なるスキル

この論文の最も驚くべき発見は、これら2つのスキル――「夢を見ること」と「実行すること」――は、自動的には共に成長しないということです。

  • 比喩: 車を想像してください。目的地に完璧に到達できる非常に強力なエンジン(収束的/タスク遂行能力)を持つことができますが、だからといって、そのドライバーがオフロードの道を探検するのが上手いとは限りません(拡散的/創造性)。
  • 発見: AIモデルが指示に従う能力(収束的)が大きくなり、賢くなるにつれて、必ずしも新しいアイデアを探索する能力(拡散的)が向上するわけではありません。実際、最大級の、最も「正しい」モデルは、より小さなモデルよりも探索範囲が狭くなることがあります。論文は、現在のトレーニングがAIを「正しい」ことには長けているが、必ずしも「より創造的」にはしていないことを示唆しています。

4. システムのテスト

著者たちは、このフレームワークを3つの全く異なる「遊び場」でテストしました。

  1. MacGyver(マクガイバー): 身近な道具を使って物理的な問題を解決する(例:「靴下を使って漏水を直すには?」)。
  2. HypoGen: 新しい科学的研究のアイデアを考案する。
  3. BookMIA: 特定の始まりと終わりを指定して、クリエイティブな物語を書く。

これら3つのケースすべてにおいて、彼らのシステムは、AIのアイデアがいかに「広い」か、そして最終的な解決策がいかに「良い」かを測定することに成功し、異なる種類の創造性においても機能することを証明しました。

まとめ

この論文は、創造性のための普遍的で自動化された定規を提供しています。それは、多くのユニークなアイデアを生み出す能力と、問題を正しく解決する能力を切り離して評価します。AIは問題を解決することには長けてきていますが、自動的に想像力が豊かになっているわけではないことを示しており、その特定の「創造的な火花」を測定し、促進するための新しいツールが必要であることを明らかにしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →