← 最新の論文
🤖 machine learning

Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs

本論文は、生成AIにおけるモデル起因の変動をプロンプト起因の影響から分離し、テキスト・トゥ・イメージ、画像キャプショニング、およびLLMタスクにおける多様性のより正確な評価とガイダンスを可能にする、新たな多様性指標であるConditional-VendiおよびConditional-RKEを導入するものである。

原著者: Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia

公開日 2026-06-10
📖 1 分で読めます☕ さくっと読める

原著者: Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、注文(プロンプト)を受け取り、料理(画像、動画、または物語)を作り出すハイテク・キッチンを経営するシェフを想像してください。長年、批評家たちは、以下の2つの点のみでこのシェフを評価してきました。

  1. 忠実度(Fidelity): その料理は注文通りか?(例:「スパイシー・タコス」と頼んだとき、それは本当にタコスに見えるか?)
  2. 無条件の多様性(Unconditional Variety): もし注文なしでシェフに自由に料理を作らせた場合、どれほど多くの異なる料理を作れるか?

しかし、パズルの欠けているピースがありました。それは、**「シェフが注文に対して、どれだけの多様性を上乗せしているか?」**という点です。

もし「赤い車」と頼んだとき、シェフはいつもありきたりな赤いセダンしか作らないのでしょうか? それとも、赤いコンバーチブル、赤いスポーツカー、赤いトラック、赤いヴィンテージ・クーペといった具合に、あなたを驚かせてくれるのでしょうか? 既存のツールでは、「シェフが退屈なのか」それとも「顧客が非常に具体的な注文を出したのか」を区別することができませんでした。

この論文は、そのような特定の種類の創造性を測定するための新しい方法、すなわち**「条件付きVendiスコア(Conditional Vendi Score)」「条件付きRKE(Conditional RKE)」**を紹介しています。

コアとなる問題:「プロンプト」対「シェフ」

著者らは、現在の多様性スコアが、2つの異なる種類の多様性を混同していると説明しています。

  • プロンプト誘発型多様性(Prompt-Induced Diversity): これは、顧客が注文を変えることによって生じる多様性です。「犬」、「猫」、「鳥」と順番に頼めば、出力は変わります。これはシェフの創造性ではなく、単にあなたがメニューを変えただけです。
  • モデル誘発型多様性(Model-Induced Diversity):これは、同じ注文を与えられたときに、シェフが加える多様性です。「犬」と10回頼んだとき、シェフは10種類の異なる犬種を作るのでしょうか、それとも10個の同一のコピーを作るのでしょうか?

比喩:
フォトブースを想像してみてください。

  • シナリオA: あなたが「犬」、「猫」、「馬」の写真を頼みます。ブースは3枚の全く異なる写真を出します。古いスコアはこう言います。「わあ、このブースはものすごく多様だ!」
  • シナリオB: あなたが「犬」の写真を10回頼みます。ブースは10種類の異なる犬種の写真を出す。古いスコアは、シナリオAにおける「馬」と比較して、これらの写真はすべて「犬」であるため、「多様性はあまり高くない」と言うかもしれません。

著者らは、シナリオBこそが、AIの真の魔法が宿る場所であると主張しています。彼らは、**「プロンプトが同じままでも、AIがどれだけ出力を変化させるか」**を測定したいと考えているのです。

解決策:「プロンプトを意識した」スコア

この論文は、2つの新しいスコア、**「Conditional-Vendi」「Conditional-RKE」**を提案しています。

これらのスコアは、「プロンプト誘発型」のノイズを無視し、「モデル誘発型」のシグナルのみを測定する特別なフィルターのようなものです。

  • 仕組み: すべての画像をまとめて見るのではなく、数学的に、それぞれの特定のプロンプト・カテゴリ内での違いを調べます。本質的には、「『犬』の写真をすべてグループ化したとき、それらは互いにどれほど異なっているか? 『猫』の写真をグループ化したとき、それらはどう違うか?」と問いかけるのです。そして、その結果を平均化します。
  • 結果: このスコアは、シナリオBのシェフ(10種類の異なる犬を作る)の方が、シナリオAのシェフ(1匹の犬、1匹の猫、1匹の馬を作る)よりも創造的であると正しく識別します。なぜなら、シナ Bのシェフは、特定の要求に対して独自の趣向を加えているからです。

「スピードバンプ(段差)」と「ショートカット」

この新しいスコアの計算は、数学的に非常に重い処理です。著者らは、非常に大規模なデータセット(例えば25,000枚の画像)の場合、計算が「次元の呪い」に陥ることを発見しました。それは、ビーチの大きさを測るために、砂の一粒一粒を数えようとするようなものです。時間がかかりすぎ、正確性を保つために膨大なデータを必要とします。

修正策: 彼らは**「切り捨てられた(Truncated)」**バージョンを導入しました。

  • 比喩: 砂の一粒一粒を数える代わりに、上位10,000個の大きな粒だけを数えます。これら上位の粒が、ビーチの「重み」と多様性の99%を代表していることに気づくはずです。
  • 利点: この「Truncated Conditional-Vendi」は高速で、実用的な使用において十分に正確であり、大規模なデータセットで停滞することはありません。

実証実験

著者らは、実在のAIモデルを用いてこれらの新しいスコアをテストしました。

  1. テキスト・トゥ・イメージ(DALL-E 3やStable Diffusionなど): プロンプトが曖昧な場合(例:「動物」)、AIは膨大な種類の動物を生み出し、スコアが上昇することを示しました。逆にプロンプトが具体的(例:「ゴールデンレトリバー」)になると、AIは特定の要求によって制約を受けるため、スコアは低く留まりました。これは、スコアがプロンプトの多様性ではなく、AI自身の内部的な自由度を実際に測定していることを証明しています。
  2. テキスト・トゥ・ビデオおよびLLM: 彼らはビデオ生成器や言語モデル(Llamaなど)でもテストを行いました。言語モデルの「温度(ランダム性)」を上げると、スコアが上昇することを発見し、物語がより多様になっていることを正しく示しました。
  3. AIの誘導: 彼らはこのスコアを単にAIを判定するために使うだけでなく、AIを操るためにも使いました。「生成中にこのスコアを最大化するように試みろ」とAIに指示することで、テキストプロンプトとの繋がりを失うことなく、より多様な画像を生成するようにAIを強制することができました。

まとめ

要するに、この論文は私たちに新しい「定規」を与えてくれました。以前は、AIが指示に従う能力や、放っておいた時のランダム性しか測ることができませんでした。しかし今、私たちは**「指示に従いながら、AIがいかに創造的であるか」**を測る定規を手に入れました。それは、ユーザーのプロンプトによるノイズと、機械の想像力による真のシグナルを分離してくれるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →