PromptSplit: Revealing Prompt-Level Disagreement in Generative Models
Oorspronkelijke auteurs: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
Oorspronkelijke auteurs: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: PromptSplit
Probleemstelling
Prompt-gestuurde generatieve AI-modellen (zowel voor visie als taal) zijn geprolifereerd, maar systematische methoden om hun gedrag te vergelijken ten opzichte van specifieke input-prompts blijven beperkt. Bestaande evaluatiemetrieken, zoals FID, Inception Score en CLIP-Score, bieden geaggregeerde kwaliteitsindicatoren die het modelgedrag comprimeren tot enkelvoudige scalaire waarden. Deze metrieken verhullen vaak prompt-afhankelijke discrepanties. Bijvoorbeeld, twee modellen kunnen hoogwaardige afbeeldingen genereren voor een gegeven prompt, maar significant divergeren in de inhoud of stijl van de output op basis van specifieke prompt-categorieën (bijv. het ene model genereert consequent mannelijke figuren terwijl het andere vrouwelijke figuren genereert voor de prompt "een persoon"). Huidige spectrale en distributionele vergelijkingsmethoden opereren doorgaans in een prompt-vrije setting, waarbij ze over prompts marginaliseren en er niet in slagen de specifieke input-categorieën te isoleren die verantwoordelijk zijn voor het divergente gedrag.
Methodologie
De auteurs stellen PromptSplit voor, een prompt-bewust, ongesuperviseerd spectraal framework ontworpen om prompt-afhankelijke onenigheid tussen twee generatieve modellen te detecteren en te analyseren.
1. Gezamenlijke Prompt-Output Representatie
PromptSplit construeert een gezamenlijke representatie door tensorproduct-embeddings te vormen van de prompt-kenmerken (ϕT) en output-kenmerken (ϕX of ϕY). Voor een prompt t en output x is de gezamenlijke feature gedefinieerd als:
ϕ⊗(t,x)=ϕT(t)⊗ϕX(x)
Dit induceert een productkernel k⊗([t,x],[t′,x′])=kT(t,t′)⋅kX(x,x′), wat multiplicatieve interacties tussen de input- en outputruimtes vastlegt.
2. Kernel Covariantie Verschil
Voor twee datasets DX (van model X) en DY (van model Y), berekent de methode empirische gezamenlijke kernel covariantie-operatoren C^T⊗X en C^T⊗Y. De kern van de analyse is de covariantie-verschil-operator:
Λ^X,Y∣T=C^T⊗X−ηC^T⊗Y
waarbij η een hyperparameter is. De voornaamste eigenvectoren van deze operator onthullen de richtingen in de gezamenlijke ruimte waar de twee modellen de meest significante gedragsverschillen vertonen.
3. Kernel Trick en Spectrale Analyse
Directe eigendecompositie van de hoog-dimensionale covariantie-operator is computationeel onhaalbaar. De auteurs passen de kernel trick toe om een blok-kernelmatrix KX,ηY∣T van grootte (n+m)×(n+m) te formuleren, die dezelfde niet-nul eigenwaarden deelt als de hoog-dimensionale operator. De eigenvectoren van deze blokmatrix komen overeen met de onenigheidsmodi in de gezamenlijke ruimte.
4. Schaalbare Random Projectie
Om grootschalige datasets aan te pakken (waarbij n,m de tienduizenden overschrijden), gebruikt PromptSplit een random-projectie benadering. De gezamenlijke tensor-features worden geprojecteerd naar een lagere dimensie r met behulp van Gaussische random matrices. Dit reduceert de computationele complexiteit van de spectrale decompositie van O((n+m)3) naar O((n+m)r2+r3).
- Theoretische Garantie: Het paper bewijst dat de verwachte afwijking van de eigenspace-schatting van het vol-dimensionale resultaat begrensd is door O(1/r2), wat garandeert dat de benadering de onenigheidsrichtingen met een hoge waarschijnlijkheid behoudt.
Belangrijkste Bijdragen
- Prompt-niveau Vergelijking Formulering: Het werk formuleert modelvergelijking als een gezamenlijk prompt-output spectraal probleem, waarmee men verder gaat dan geaggregeerde metrieken om specifieke prompt-categorieën te identificeren die divergent modelgedrag veroorzaken.
- PromptSplit Framework: Introductie van een kernel-gebaseerd framework dat prompts en outputs koppelt via tensorproduct-embeddings om het eigenspectrum van gezamenlijke kernel covariantie-verschillen te analyseren.
- Schaalbare Benadering: Ontwikkeling van een random-projectiemethode die de analyse van grote datasets mogelijk maakt met een theoretische foutmarge van O(1/r2), waardoor de methode praktisch bruikbaar is voor de evaluatie van real-world generatieve modellen.
- Interpreteerbaarheid: De methode biedt interpreteerbare "modi" van onenigheid, die specifieke prompt-clusters expliciet koppelen aan de aard van de output-divergentie.
Experimentele Resultaten
De auteurs evalueerden PromptSplit in text-to-image (T2I) en text-to-text (LLM) settings:
- Synthetische Validatie: In gecontroleerde settings (bijv. MNIST-M met bekende kleur/grijswaarden prompt-mismatches), identificeerde PromptSplit succesvol de grondwaarheid prompt-categorieën die verantwoordelijk waren voor de onenigheid.
- Text-to-Image Modellen: Vergelijkingen tussen Stable Diffusion XL, PixArt-Σ en Kandinsky onthulden prompt-afhankelijke divergenties in stijl, compositie en alignment. Bijvoorbeeld, de methode identificeerde specifieke beroepsgebonden prompts (bijv. "verpleegkundige", "timmerman") waar modellen significant verschillende visuele representaties produceerden.
- Large Language Models (LLMs): Vergelijkingen tussen Qwen 3 en Gemma 3 op de NQ-Open dataset identificeerden onderscheidende clusters van vragen (bijv. over Amerikaanse presidenten of acteurs) waarbij de modellen divergente antwoorden genereerden.
- Guidance Toepassing: De auteurs demonstreerden het gebruik van PromptSplit om het latente diffusieproces te sturen, waarbij ze erin slaagden de distributie van gegenereerde afbeeldingen uit te lijnen met een referentie-dataset (bijv. specifieke schilderstijlen) door de onenigheidsgradiënt in het samplingproces te integreren.
Betekenis en Claims
Het paper claimt dat PromptSplit een geprincipeerd, interpreteerbaar instrument biedt voor het detecteren van waar en hoe generatieve modellen van mening verschillen, waarmee een gat wordt opgevuld dat wordt achtergelaten door geaggregeerde kwaliteitsmetrieken. Door expliciet de gezamenlijke prompt-output ruimte te modelleren, isoleert het de specifieke input-categorieën die het gedragsverschil drijven.
De auteurs positioneren PromptSplit als een embedding-gebaseerde, second-order spectrale methode. Ze merken bescheiden op dat hoewel het ontwerp schaalbaarheid en interpreteerbaarheid mogelijk maakt, het niet beogen alle hogere-orde aspecten van conditioneel generatief gedrag te karakteriseren. Het werk wordt gepresenteerd als een stap naar een meer fijnmazige, prompt-geconditioneerde evaluatie van het groeiende ecosysteem van generatieve AI-modellen. De implementatie is publiekelijk beschikbaar gesteld om verder onderzoek in dit domein te faciliteren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.
Ontvang wekelijks de beste AI papers.
Vertrouwd door onderzoekers van Stanford, Cambridge en de Franse Academie van Wetenschappen.
Check je inbox om je aanmelding te bevestigen.
Er ging iets mis. Opnieuw proberen?
Geen spam, altijd opzegbaar.