← Nieuwste papers
💻 computer science

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

Het artikel introduceert JudgeFit, een iteratief framework dat gepersonaliseerde evaluatietaxonomieën construeert voor individuele vision-language modellen om de fysieke consistentie in videogeneratie beter te beoordelen, waarbij een verbetering van 32% ten opzichte van globale schema's wordt aangetoofend terwijl model-specifieke blinde vlekken worden onthuld.

Oorspronkelijke auteurs: Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

Gepubliceerd 2026-06-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een talentenjacht organiseert voor videogeneratoren. Je hebt 16 verschillende juryleden (AI-modellen) om te helpen beslissen welke video's fysiek realistisch zijn en welke er vreemd uitzien.

Het probleem is dat elk jurylid de wereld anders ziet.

De Oude Manier: Eén maat voor iedereen (De "Slechte" Liniaal)

Traditioneel gaven onderzoekers elk jurylid exact dezelfde checklist om de video's te beoordelen. Het was alsof je een timmerman, een chef en een muzikant dezelfde liniaal gaf en hen vroeg om een taart te meten.

  • De timmerman keek misschien alleen naar de hoogte.
  • De chef keek misschien alleen naar de textuur.
  • De muzikant wist misschien niet eens wat hij met de liniaal aan moest.

In het paper ontdekten ze dat wanneer ze een "globale" checklist gebruikten (een vaste set regels zoals "zwaartekracht", "botsingen" en "verlichting"), de meeste AI-juryleden drie kwart van de lijst negeerden. Ze concentreerden zich gewoon op één ding (meestal "mechanica") en gaven de rest een nul. Het was alsof je een kleurenblinde persoon vroeg om een schilderij te beoordelen op basis van een lijst met 10 verschillende kleuren; ze kiezen gewoon de ene kleur die ze kunnen zien en negeren de rest.

De Nieuwe Oplossing: JUDGEFIT (De "Maatkundige")

De auteurs creëerden een nieuw systeem genaamd JUDGEFIT. In plaats van elk jurylid dezelfde liniaal op te leggen, bouwt JUDGEFIT een aangepaste liniaal voor elk specifiek jurylid, gebaseerd op waar dat specifieke jurylid daadwerkelijk goed in is.

Zo werkt het, stap voor stap:

Stap 1: De "Seed" (De Jury vragen om te praten)

Eerst laten ze een kleine set video's zien aan een AI-jurylid en vragen: "Wat ziet er hier fout uit? Vertel het me gewoon in je eigen woorden."

  • Als de rechter zegt: "De bal zweefde als een ballon," noteert het systeem "zweven" als een regel.
  • Als de rechter nooit over "schaduwen" spreekt, weet het systeem dat dit jurylid blind is voor schaduwen, dus zet het geen "schaduwen" op hun aangepaste checklist.
  • De Analogie: Het is als het vragen aan een nieuwe werknemer: "Welke fouten merk jij op?" en vervolgens een functieomschrijving opstellen op basis van alleen de fouten die zij daadwerkelijk opmerken.

Stap 2: De "Refine" (De Coach en de Speler)

Nu laten ze het jurylid aan het werk gaan met deze nieuwe aangepaste checklist. Maar hier is de truc:

  • De Speler (De Video AI): Scoort de video's op basis van de aangepaste checklist. Het weet niet wat het "juiste" antwoord is; het volgt gewoon de regels.
  • De Coach (Een aparte AI Editor): Kijkt naar de scores van de Speler en vergelijkt deze met wat mensen vonden.
    • Als de Speler zegt dat een video perfect is, maar mensen het verschrikkelijk vonden: Zegt de Coach: "Je hebt iets gemist! Laten we een nieuwe regel aan je checklist toevoegen."
    • Als de Speler twee dingen controleert die hetzelfde betekenen: Zegt de Coach: "Je doet dubbel werk. Laten we deze regels samenvoegen."
    • Als de Speler iets controleert dat niet overeenkomt met de menselijke mening: Zegt de Coach: "Stop met het controleren van dat; het verwarreert je score."

Dit gebeurt in een lus. De Coach past de checklist aan, de Speler probeert het opnieuw, en ze blijven doorgaan totdat de scores van de Speler zo nauw mogelijk overeenkomen met de meningen van de mensen.

De Resultaten: Waarom het ertoe doet

Het paper testte dit op 16 verschillende AI-modellen (van kleine open-source modellen tot enorme gesloten bronnen).

  • De Winst: Voor elk enkel jurylid werkte de aangepaste checklist beter dan de standaard "één maat voor iedereen" checklist. Gemiddeld werden de scores 32% nauwkeuriger in het voorspellen van wat mensen zouden vinden.
  • De Verrassing: Ze ontdekten dat zelfs de "slimste" AI-juryleden blinde vlekken hebben. De een kan geweldig zijn in het opsporen van zwaartekrachtfouten, maar verschrikkelijk in het opsporen van reflectiefouten. Een ander kan precies het tegenovergestelde zijn. Het oude systeem behandelde hen allemaal als "goed" of "slecht" in algemene zin, maar JUDGEFIT onthulde hun specifieke sterktes en zwaktes.

De Kernboodschap

Het paper betoogt dat we niet elke AI-jurylid dezelfde regels moeten opleggen. Net zoals je geen hengel gebruikt om een auto te repareren, moet je een AI ook niet dwingen om video's te beoordelen met regels die hij niet kan waarnemen.

JUDGEFIT is een methode die elke AI vraagt: "Wat kun jij zien?" en vervolgens een uniek, op maat gemaakt beoordelingssysteem voor hen bouwt. Dit maakt de AI een veel betere, meer betrouwbare rechter van de fysieke realiteit in video's.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →