← Derniers articles
🤖 machine learning

Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs

Cet article présente Conditional-Vendi et Conditional-RKE, de nouvelles métriques de diversité qui isolent la variabilité induite par le modèle des effets induits par le prompt dans l'IA générative, permettant une évaluation et un guidage plus précis de la diversité dans les tâches de texte-vers-image, de légendage d'images et de LLM.

Auteurs originaux : Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia

Publié 2026-06-10
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un chef dirigeant une cuisine de haute technologie qui reçoit des commandes (prompts) et prépare des plats (images, vidéos ou histoires). Pendant des années, les critiques n'ont jugé ces chefs que sur deux critères :

  1. La fidélité : Le plat ressemble-t-il à la commande ? (par exemple, si vous avez demandé un « taco épicé », est-ce qu'il ressemble à un taco ?)
  2. La variété inconditionnelle : Si vous laissez simplement le chef cuisiner sans commandes, combien de plats différents peut-il préparer ?

Mais il manquait une pièce du puzzle : Quelle part de variété le chef ajoute-t-il en plus de la commande ?

Si vous demandez une « voiture rouge », le chef ne fabrique-t-il qu'une générique berline rouge ? Ou bien vous surprend-t-il avec une décapotable rouge, une voiture de sport rouge, un camion rouge et un coupé vintage rouge ? Les outils existants ne pouvaient pas faire la différence entre « le chef est ennuyeux » et « le client a donné une commande très spécifique ».

Ce document présente une nouvelle façon de mesurer ce type spécifique de créativité, appelée le Score de Vendi Conditionnel et le RKE Conditionnel.

Le problème central : Le « Prompt » vs Le « Chef »

Les auteurs expliquent que les scores de diversité actuels confondent deux sources de variété différentes :

  • Diversité induite par le prompt : C'est la variété causée par le client qui change sa commande. Si vous demandez un « chien », puis un « chat », puis un « oiseau », l'output change. Ce n'est pas la créativité du chef ; c'est simplement vous qui changez le menu.
  • Diversité induite par le modèle : C'est la variété que le chef ajoute lorsque vous donnez la même commande. Si vous demandez un « chien » dix fois, le chef fabrique-t-il dix races différentes, ou dix copies identiques ?

L'analogie :
Imaginez un photomaton.

  • Scénario A : Vous demandez une photo d'un « chien », puis d'un « chat », puis d'un « cheval ». Le photomaton vous donne trois photos très différentes. Les anciens scores disent : « Wow, ce photomaton est super diversifié ! »
  • Scénario B : Vous demandez une photo d'un « chien » dix fois. Le photomaton vous donne dix races de chiens différentes. Les anciens scores pourraient dire : « Bof, pas très diversifié », car les images se ressemblent toutes par rapport au « cheval » du Scénario A.

Les auteurs soutiennent que c'est le Scénario B qui est l'endroit où réside la véritable magie de l'IA. Ils veulent mesurer comment l'IA varie ses sorties même lorsque le prompt reste le même.

La solution : Un score « sensible au prompt »

Le papier propose deux nouveaux scores : le Vendi-Conditionnel et le RKE-Conditionnel.

Considérez ces scores comme un filtre spécial qui ignore le « bruit induit par le prompt » et ne mesure que le « signal induit par le modèle ».

  • Comment ça marche : Au lieu de regarder toutes les images ensemble, le calcul examine à quel point les images sont différentes au sein de chaque catégorie de prompt spécifique. Il demande essentiellement : « Si nous regroupons toutes les photos de "chiens" ensemble, à quel point sont-elles différentes les unes des autres ? Si nous regroupons toutes les photos de "chats", comment sont-elles différentes ? » Puis, il fait la moyenne de tout cela.
  • Le résultat : Ce score identifie correctement que le chef du Scénario B (faisant 10 chiens différents) est en fait plus créatif que le chef du Scénario A (faisant 1 chien, 1 chat, 1 cheval), car le chef de B ajoute sa propre touche à la requête spécifique.

Le « Dos d'âne » et le raccourci

Calculer ce nouveau score est mathématiquement lourd. Les auteurs ont découvert que pour de très grands ensembles de données (comme 25 000 images), le calcul se retrouve bloqué dans une « malédiction de la dimensionnalité » — c'est comme essayer de compter chaque grain de sable sur une plage pour mesurer la taille de la plage. Cela prend trop de temps et nécessite trop de données pour être précis.

La correction : Ils ont introduit une version « Tronquée ».

  • Analogie : Au lieu de compter chaque grain de sable, vous ne comptez que les 10 000 plus gros grains. Vous réalisez que ces grains principaux représentent 99 % du « poids » et de la variété de la plage.
  • Bénéfice : Ce « Vendi-Conditionnel Tronqué » est rapide, suffisamment précis pour une utilisation réelle, et ne se retrouve pas bloqué sur des jeux de données massifs.

Mise à l'épreuve

Les auteurs ont testé leurs nouveaux scores sur de vrais modèles d'IA :

  1. Text-to-Image (comme DALL-E 3 ou Stable Diffusion) : Ils ont montré que lorsque les prompts étaient vagues (ex: « un animal »), l'IA produisait une immense variété d'animaux, et le score augmentait. Lorsque les prompts étaient spécifiques (ex: « un golden retriever »), le score restait plus bas car l'IA était contrainte par la requête spécifique. Cela a prouvé que le score mesure réellement la liberté interne de l'IA, et non simplement la variété du prompt.
  2. Text-to-Video et LLM : Ils ont testé cela sur des générateurs de vidéos et des modèles de langage (comme Llama). Ils ont constaté qu'en augmentant la « température » (le caractère aléatoire) du modèle de langage, le score augmentait, indiquant correctement que les histoires devenaient plus diverses.
  3. Guider l'IA : Ils n'ont pas seulement utilisé le score pour juger l'IA ; ils l'ont utilisé pour la diriger. En disant à l'IA : « Essaie de maximiser ce score pendant que tu génères », ils ont pu forcer l'IA à produire des images plus diverses sans perdre le lien avec le prompt textuel.

Résumé

En bref, ce papier nous donne une nouvelle règle de mesure. Avant, nous ne pouvions mesurer que la capacité d'une IA à suivre des instructions ou son degré d'aléatoire lorsqu'elle était laissée seule. Désormais, nous avons une règle qui mesure à quel point l'IA est créative tout en suivant les instructions. Elle sépare le bruit du prompt de l'utilisateur du véritable signal de l'imagination de la machine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →