Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs
Dit artikel introduceert Conditional-Vendi en Conditional-RKE, nieuwe diversiteitsmetrieken die model-geïnduceerde variabiliteit isoleren van prompt-geïnduceerde effecten in generatieve AI, wat een nauwkeurigere evaluatie en sturing van diversiteit mogelijk maakt in tekst-naar-beeld, beeld-beschrijving en LLM-taken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een chef-kok bent die een high-tech keuken runt die bestellingen (prompts) aanneemt en gerechten (afbeeldingen, video's of verhalen) bereidt. Jarenlang hebben critici deze chefs alleen beoordeeld op twee dingen:
- Getrouwheid (Fidelity): Leek het gerecht op de bestelling? (bijv. Als je om een "pittige taco" vroeg, leek het dan op een taco?)
- Onvoorwaardelijke Variëteit (Unconditional Variety): Als je de chef gewoon laat koken zonder bestellingen, hoeveel verschillende gerechten kan hij maken?
Maar er ontbrak een essentieel puzzelstukje: Hoeveel variëteit voegt de chef toe bovenop de bestelling?
Als je om een "rode auto" vraagt, maakt de chef dan altijd een generieke rode sedan? Of verrast hij je met een rode cabriolet, een rode sportwagen, een rode truck en een rode vintage coupé? Bestaande tools konden het verschil niet zien tussen "de chef is saai" en "de klant gaf een zeer specifieke opdracht".
Dit artikel introduceert een nieuwe manier om die specifieke vorm van creativiteit te meten, genaamd de Conditional Vendi Score en Conditional RKE.
Het kernprobleem: De "Prompt" versus de "Chef"
De auteurs leggen uit dat huidige diversiteitsscores twee verschillende bronnen van variatie door elkaar halen:
- Prompt-geïnduceerde Diversiteit: Dit is de variatie veroorzaakt door de klant die de bestelling verandert. Als je om een "hond", dan een "kat", dan een "vogel" vraact, verandert de output. Dat is niet de creativiteit van de chef; dat is simpelweg jij die het menu aanpast.
- Model-geïnduceerde Diversiteit: Dit is de variatie die de chef toevoegt wanneer je hem dezelfde bestelling geeft. Als je tien keer om een "hond" vraagt, maakt de chef dan tien verschillende rassen, of tien identieke kopieën?
De Analogie:
Stel je een fotohokje voor.
- Scenario A: Je vraagt om een foto van een "hond", dan een "kat", dan een "paard". Het hokje geeft je drie heel verschillende foto's. Oude scores zeggen: "Wauw, dat hokje is super divers!"
- Scenario B: Je vraagt tien keer om een foto van een "hond". Het hokje geeft je tien verschillende hondenrassen. Oude scores zouden kunnen zeggen: "Meh, niet erg divers," omdat de foto's allemaal op "honden" lijken vergeleken met de "paard" in Scenario A.
De auteurs stellen dat Scenario B juist is waar de echte magie van de AI ligt. Ze willen meten hoeveel variatie de AI toevoegt zelfs wanneer de prompt hetzelfde blijft.
De Oplossing: Een "Prompt-bewuste" Score
Het artikel stelt twee nieuwe scores voor: Conditional-Vendi en Conditional-RKE.
Beschouw deze scores als een speciale filter die de "Prompt-geïnduceerde" ruis negeert en alleen het "Model-geïnduceerde" signaal meet.
- Hoe het werkt: In plaats van naar alle foto's samen te kijken, kijkt de wiskunde naar hoe verschillend de foto's zijn binnen elke specifieke prompt-categorie. Het vraagt in feite: "Als we alle 'hond'-foto's bij elkaar groeperen, hoe verschillend zijn ze van elkaar? Als we alle 'kat'-foto's groeperen, hoe verschillend zijn zij van elkaar?" Vervolgens middelt het dat resultaat.
- Het Resultaat: Deze score identificeert correct dat de chef in Scenario B (die 10 verschillende honden maakt) creatiever is dan de chef in Scenario A (die 1 hond, 1 kat, 1 paard maakt), omdat de chef in B zijn eigen flair toevoegt aan het specifieke verzoek.
De "Drempel" en de Afkorting
Het berekenen van deze nieuwe score is wiskundig zwaar. De auteurs ontdekten dat voor zeer grote datasets (zoals 25.000 afbeeldingen), de berekening vastloopt in een "vloek van dimensionaliteit" — het is alsof je elk korreltje zand probeert te tellen om de omvang van het strand te meten. Het duurt te lang en heeft te veel data nodig om accuraat te zijn.
De Oplossing: Ze hebben een "Getrunceerde" (Truncated) versie geïntroduceerd.
- Analogie: In plaats van elk korreltje zand te tellen, tel je alleen de bovenste 10.000 grootste korrels. Je merkt dat deze topkorrels 99% van het "gewicht" en de variëteit van het strand vertegenwoordigen.
- Voordeel: Deze "Truncated Conditional-Vendi" is snel, accuraat genoeg voor echt gebruik en loopt niet vast op enorme datasets.
De Test
De auteurs hebben hun nieuwe scores getest op echte AI-modellen:
- Tekst-naar-Beeld (zoals DALL-E 3 of Stable Diffusion): Ze lieten zien dat wanneer prompts vaag waren (bijv. "een dier"), de AI een enorme variëteit aan dieren produceerde, en de score steeg. Wanneer prompts specifiek waren (bijv. "een golden retriever"), bleef de score lager omdat de AI werd beperkt door het specifieke verzoek. Dit bewees dat de score daadwerkelijk de interne vrijheid van de AI meet, en niet alleen de variëteit van de prompt.
- Tekst-naar-Video & LLM's: Ze testten het op videogeneratoren en taalmodellen (zoals Llama). Ze ontdekten dat naarmate ze de "temperatuur" (willekeur) van het taalmodel verhoogden, de score omhoog ging, wat correct aangaf dat de verhalen diverser werden.
- De AI Sturen: Ze gebruikten de score niet alleen om de AI te beoordelen; ze gebruikten het ook om de AI te sturen. Door de AI de opdracht te geven: "Probeer deze score te maximaliseren terwijl je genereert," konden ze de AI dwingen om meer diverse afbeeldingen te produceren zonder de verbinding met de tekstuele prompt te verliezen.
Samenvatting
Kortom, dit artikel geeft ons een nieuwe liniaal. Voorheen konden we alleen meten hoe goed een AI instructies opvolgde of hoe willekeurig hij was als hij alleen gelaten werd. Nu hebben we een liniaal die meet hoe creatief de AI is terwijl hij instructies opvolgt. Het scheidt de ruis van de prompt van de gebruiker van het ware signaal van de verbeeldingskracht van de machine.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.