← Nieuwste papers
💻 computer science

WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models

WorldJen introduceert een end-to-end meerdimensionale benchmark voor generatieve videomodellen die gebrekkige binaire VQA vervangt door VLM-evaluaties op basis van een hoge-resolutie Likert-schaal, waarbij door middel van adversariaal samengestelde prompts en een robuust drie-traps beoordelingssysteem een perfecte afstemming wordt bereikt met menselijke voorkeurshetelingen.

Oorspronkelijke auteurs: Karthik Inbasekar, Guy Rom, Omer Shlomovits

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Karthik Inbasekar, Guy Rom, Omer Shlomovits

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de hoofdscheidsrechter bent bij een enorme, hoog-risico kookwedstrijd. Maar in plaats van eten te proeven, bekijk je video's die gegenereerd zijn door kunstmatige intelligentie. Jouw taak is om te beslissen welke AI-chef de beste is.

Lange tijd gebruikten de juryleden de verkeerde hulpmiddelen. Ze hadden een liniaal om te meten hoe "pixel-perfect" de afbeelding was (zoals het controleren of de zoutkorrels de juiste grootte hadden) of een frequentie-analysator om te zien of de kleuren overeenkwamen met een referentieafbeelding. Maar deze tools misten het grote plaatje: Heeft de chef echt een maaltijd bereid? Maakten de ingrediënten zin? Kookte de soep over? Of maakte de chef gewoon een wazige, wiskundig perfecte rommeltje dat er helemaal niet uitzag als eten?

Andere recente pogingen probeerden de juryleden simpele "Ja of Nee"-vragen te stellen, zoals "Is de fysica correct?". Maar mensen (en AI-juryleden) neigen naar "Ja" te zeggen, tenzij de video volledig kapot is. Dit maakte het onmogelijk om het verschil te maken tussen een "goede" video en een "geweldige" video.

Maak kennis met WORLDJEN. Denk hierbij aan een gloednieuw, ultra-geavanceerd beoordelingssysteem dat is ontworpen om deze problemen op te lossen. Hier is hoe het werkt, opgesplitst in eenvoudige stappen:

1. Het Menu: Gecureerde Prompts

In plaats van de AI te vragen "maak een video van een kat", creëerden de onderzoekers een specifiek menu van 3.754 complexe "recepten" (prompts). Dit zijn geen simpele verzoeken; ze zijn ontworpen om de AI tegelijkertijd op 16 verschillende vaardigheden te testen, zoals:

  • Beweging: Beweegt het personage soepel, of trilt het?
  • Fysica: Als een bal wordt gegooid, valt hij dan zoals de zwaartekracht voorschrijft?
  • Logica: Als een persoon achter een boom loopt, verdwijnt en verschijnt hij dan correct?
  • Esthetiek: Is de belichting en kleur mooi?

2. De Menselijke Proeverij (De Ground Truth)

Voordat ze een computer vertrouwden om te beoordelen, hadden de onderzoekers een "gouden standaard" nodig. Ze huurden 7 menselijke experts in om 300 video's te bekijken (gegenereerd door 6 verschillende top-tier AI-modellen) en te stemmen welke beter was.

  • Het Resultaat: De mensen waren het eens over een duidelijke "Drie-Tier" rangschikking.
    • Top Tier: Twee modellen (Veo 3.1 en Kling) waren duidelijk de beste.
    • Mid Tier: Drie modellen waren goed, maar statistisch niet van elkaar te onderscheiden.
    • Bottom Tier: Eén model zat duidelijk achterop.
      Deze menselijke rangschikking is de "waarheid" waartegen alles andere wordt gemeten.

3. De AI-Jury (De VLM)

Nu stelden de onderzoekers de vraag: "Kan een AI-jury (een Vision-Language Model) deze taak net zo goed uitvoeren als een mens?"
Ze vroegen de AI niet zomaar "Is dit goed?". In plaats daarvan gaven ze de AI een Likert-schaalvragenlijst (een beoordelingssysteem van 1 tot 5, zoals een Yelp-beoordeling) voor elke afzonderlijke video.

  • De Truc: De AI-jury bekijkt de video in zijn volledige, native resolutie (niet verkleind tot een miniatur). Hij stelt zichzelf 10 specifieke vragen per video over specifieke details (bijv. "Flikkerde de hand van het personage?" of "Bewoog de schaduw correct?").
  • De Score: Hij geeft een score voor elke vraag, en deze worden gecombineerd tot een uiteindelijke rangschikking.

4. De Grote Onthulling

Toen de rangschikkingen van de AI-jury werden vergeleken met de Menselijke Proeverij, waren de resultaten schokkend: Ze kwamen perfect overeen.

  • De AI identificeerde correct de Top Tier, de Mid Tier en de Bottom Tier.
  • Hij was het 100% van de tijd eens met de mensen over de volgorde van de modellen.
  • Dit bewijst dat de AI-jury een betrouwbare, goedkope en snelle vervanging kan zijn voor dure menselijke juryleden.

5. Waarom Het Beter Is Dan De Oude Manier (VBench)

Het artikel vergelijkt WORLDJEN met een bestaand systeem genaamd VBench.

  • VBench is als een jurylid dat door een sleutelgat knijpt (lage resolutie) en alleen controleert of de kleuren ongeveer goed zijn. Het geeft vaak iedereen een "perfecte" score omdat de verschillen te klein zijn om te zien.
  • WORLDJEN is als een jurylid met een vergrootglas die de hele video bekijkt. Het vindt de kleine barstjes in de fysica en de subtiele glitches die VBench mist.
  • Het Resultaat: VBench faalde om de modellen correct te rangschikken in vergelijking met mensen, terwijl WORLDJEN het goed deed.

6. De "Fysica-Gap" Ontdekking

Een van de meest interessante bevindingen van dit nieuwe systeem is een "Fysica-Gap".
Zelfs de beste AI-modellen ter wereld zijn nog steeds vreselijk in het begrijpen van basisfysica.

  • De Metafoor: Stel je voor dat de AI-chefs geweldig zijn in het presenteren van het eten (het mooi maken) en het arrangeren van de tafel (compositie). Maar als je ze vraagt het eten daadwerkelijk te koken (een bal laten stuiteren of water laten stromen), falen ze vaak.
  • Het artikel vond dat zelfs de topmodellen slecht scoorden op "Fysieke Mechanica" en "Inertiaal Consistentie". Ze zien er goed uit, maar ze gehoorzamen nog niet helemaal aan de wetten van het universum.

Samenvatting

WORLDJEN is een nieuwe, slimmere manier om AI-videogenerators te testen. Het gebruikt complexe "recepten" om de AI uit te dagen, laat mensen de standaard bepalen en bewijst vervolgens dat een slimme AI-jury net zo goed kan beoordelen als een mens. Het laat zien dat hoewel AI-video's er geweldig uitzien, ze nog steeds moeite hebben om te begrijpen hoe de echte wereld fysiek werkt.

Wat het artikel NIET beweert:

  • Het beweert niet dat dit systeem klaar is voor medische diagnose of klinisch gebruik.
  • Het beweert niet dat dit morgen direct zal veranderen hoe films in Hollywood worden gemaakt.
  • Het beweert niet dat de AI-jury's perfect zijn in elke mogelijke situatie, alleen dat ze overeenkomen met menselijke rangschikkingen op deze specifieke set tests.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →