Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation
Dit artikel introduceert Qwen-Image-Bench, een maker-centrische benchmark die samen met professionele kunstenaars is ontworpen en tekst-naar-afbeelding-modellen evalueert via een hiërarchische taxonomie van 56 verifieerbare criteria op het gebied van realistische getrouwheid en creatieve generatie, waarbij gebruik wordt gemaakt van een gespecialiseerd beoordelingsmodel om fijnmazige diagnoses te leveren die de prestaties van de huidige staat van de techniek beter onderscheiden dan bestaande benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een nieuwe generatie AI-kunstenaars probeert te beoordelen. Lange tijd waren de tests als een basis kunstles: "Heeft de AI een kat getekend toen je om een kat vroeg? Is de afbeelding duidelijk? Ziet het er leuk uit?"
Maar nu zijn AI-kunstenaars zo goed geworden in het tekenen van simpele katten, dat deze oude tests niet meer het verschil kunnen zien tussen een "goede" kunstenaar en een "meester"-kunstenaar. Ze krijgen allemaal een "A", waardoor je niet kunt zien wie echt de beste is. Bovendien gaven de oude tests er niet om of de kat er in de echte wereld bij hoorde of dat de AI daadwerkelijk een videogame-personage kon ontwerpen.
Dit artikel introduceert Qwen-Image-Bench, een gloednieuwe, ultra-strenge "Artistieke Olympiade" die specifiek is ontworpen om professioneel niveau van creativiteit te testen, en niet alleen basis tekenvaardigheden.
Hier is hoe ze het hebben opgebouwd en wat ze hebben gevonden, eenvoudig uitgelegd:
1. Het Nieuwe Regelboek: Een Drielagige Piramide
In plaats van een simpele checklist, bouwden de onderzoekers een drielaagige piramide van regels, ontworpen door werkende professionele kunstenaars (schilders, regisseurs, ontwerpers) in plaats van alleen maar informaticus.
- Laag 1 (De Grote Zuilen): Ze behielden de oude basis (Kwaliteit, Esthetiek en "Heeft het geluisterd naar mij?"), maar voegden twee enorme nieuwe zuilen toe die belangrijk zijn voor echte makers:
- Realiteitsgetrouwheid (Real-world Fidelity): Maakt de fysica zin? Is de culturele context correct? (bijv. Als je vra_ om een middeleeuwse ridder, ziet het harnas er dan historisch accuraat uit?)
- Creatieve Generatie (Creative Generation): Kan de AI daadwerkelijk iets nieuws en nuttigs creëren? (bijv. Het ontwerpen van een logo, het schrijven van een stripboekscript of het maken van een game-asset).
- Laag 2 (De Vaardigheden): Deze grote zuilen zijn onderverdeeld in 23 specifieke vaardigheden, zoals "Visueel Verhalenvertellen" of "Wereldkennis".
- Laag 3 (De Details): Ten slotte zoomden ze in op 56 minuscule, specifieke details (rubrieken). Dit is het "microscoop"-niveau. Het controleert zaken als "Is het lettertype leesbaar?" of "Zien de handen er correct uit terwijl ze het object aanraken?".
De Analogie: Denk aan de oude tests als vragen: "Is de taart eetbaar?" De nieuwe test vraagt: "Is de taart eetbaar, smaakt het alsof het door een professionele bakkerij is gemaakt, is de decoratie structureel gezond, en heeft de bakker het specifieke recept voor een glutenvrije bruidstaart gevolgd?"
2. De "Super-Rechter" (Q-Judger)
Normaal gesproken, om deze afbeeldingen te beoordelen, huren mensen ofwel mensen in (duur en traag) of vragen ze een andere AI om ze te beoordelen (wat riskant is omdat de beoordelende AI bevooroordeeld of lui kan zijn).
Het team creëerde een Unified Judge Model genaamd Q-Judger.
- Hoe het werkt: Ze trainden deze AI op meer dan 130.000 afbeeldingen die zijn beoordeeld door 80 echte menselijke experts van kunstacademies.
- Het Proces: Elke afbeelding werd bekeken door ten minste drie verschillende experts die niet wisten welke AI de afbeelding had gemaakt (blind testen).
- Het Resultaat: Q-Judger geeft niet alleen een enkele score zoals "8/10". Het geeft een gedetailleerd rapportcijfer voor alle 56 minuscule details. Het kan je precies vertellen waar een AI faalde: "Goed in het tekenen van de lucht, maar faalde bij de handen."
3. De Test: 1.000 Real-world Prompts
Ze vroegen niet alleen om "een kat". Ze creëerden 1.000 complexe prompts in zowel Engels als Chinees.
- Sommige waren kort, sommige waren zeer lang en gedetailleerd.
- Ze dekten real-life scenario's af: "Ontwerp een receptenboekpagina voor pittig varkensvlees," "Maak een storyboard voor een filmscène," of "Teken een mode-outfit voor een specifiek personage."
- Dit zorgt ervoor dat de test controleert of de AI de rommelige, ingewikkelde verzoeken kan afhandelen die echte mensen daadwerkelijk doen.
4. De Resultaten: Wie Won en Wie Strijdde?
Ze testten 18 van de beste AI-modellen ter wereld. Hier is wat de "Artistieke Olympiade" onthulde:
De Winnaar: GPT Image 2 won de gouden medaille en scoorde het hoogst over de hele linie. Het was het enige model dat geen duidelijke zwakke plekken had.
Het "Plafond"-probleem: De meest schokkende bevinding was een groep van vijf specifieke taken waarbij elk enkel model (zelfs de winnaar) erg laag scoorde (onder de 44 van de 100).
- Deze taken waren: Fysieke Logica (zwaartekracht, hoe objecten vallen), Anatomische Getrouwheid (menselijke/dierlijke lichaamsstructuur), Dieren, Objecten (3D-structuur) en Contactinteractie (hoe dingen elkaar raken).
- De Metafoor: Huidige AI-modellen zijn als fotorealistische schilders die de echte wereld nooit hebben gezien. Ze kunnen de look van een boom perfect kopiëren, maar ze begrijpen niet hoe een boom groeit, hoe takken verbonden zijn, of hoe een vogel erop landt. Ze zitten vast in de "Perceptie"-fase (het kopiëren van wat ze zien) maar hebben de "Cognitie"-fase (begrijpen hoe de wereld werkt) nog niet bereikt.
De "Creatieve" Kloof: Het grootste verschil tussen de topmodellen en de lagere modellen lag niet in de basis tekenkwaliteit (iedereen is daar nu al goed in). Het verschil zat in Creatieve Generatie en Realiteitsgetrouwheid. De topmodellen konden daadwerkelijk dingen ontwerpen en complexe logica begrijpen; de lagere modellen maakten alleen maar mooie plaatjes die niet helemaal logisch waren.
Samenvatting
Qwen-Image-Bench is een nieuwe, professionele meetlat voor het meten van AI-kunst. Het bewees dat hoewel AI erg goed is geworden in het maken van "mooie plaatjes", het nog steeds moeite heeft met het begrijpen van de logica van de echte wereld en met het fungeren als een echte creatieve partner. Het artikel concludeert dat om naar het volgende niveau te gaan, AI moet stoppen met alleen visuele patronen te kopiëren en moet leren hoe de "regels" van hoe de wereld echt werkt, werken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.