← Nieuwste papers
🤖 AI

ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

Dit paper introduceert ViGoR-Bench, een unificerend benchmarkkader dat de beperkingen van hedendaagse visuele generatieve modellen in logisch redeneren blootlegt door een dubbeltrack-evaluatie van proces en resultaat te combineren met een grondig, mensgericht oordeel.

Oorspronkelijke auteurs: Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu, Xiaojiang Peng, Lin Ma, Xiaoming Wei, Xiu Li

Gepubliceerd 2026-03-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu, Xiaojiang Peng, Lin Ma, Xiaoming Wei, Xiu Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

ViGoR-Bench: De "Logische Woestijn" van Kunstmatige Intelligentie

Stel je voor dat je een kunstenaar hebt die foto's kan maken die zo realistisch zijn, dat je ze niet van de werkelijkheid kunt onderscheiden. Hij kan een zonsondergang schilderen die je bijna kunt ruiken, of een portret van een lachend kind dat je hart doet smelten. Maar vraag hem nu om een simpele taak: "Zorg dat de bal onder de tafel blijft liggen, niet erboven." Of: "Teken een brug die niet instort als er een auto overheen rijdt."

Plotseling valt de kunstenaar in een logische woestijn. Hij kan het plaatje nog zo mooi maken, maar de wetten van de fysica en de logica begrijpt hij niet. Hij "weet" niet hoe de wereld werkt, hij "gokt" alleen maar hoe het eruit zou moeten zien.

Dit is precies het probleem dat het nieuwe onderzoek ViGoR-Bench aanpakt. Hier is de uitleg in simpele taal:

1. Het Probleem: De "Schijn van Prestatie"

Tot nu toe keken we naar AI-modellen door een vergrootglas dat alleen de kwaliteit van de afbeelding beoordeelde.

  • De oude manier: "Is de foto scherp? Lijkt de tekst op de juiste plek? Ziet het er mooi uit?"
  • Het probleem: Een AI kan een foto maken van een auto die op het dak rijdt, en die foto kan er perfect uitzien. Maar in de echte wereld is dat onmogelijk. De AI heeft de "logica" van de auto niet begrepen, hij heeft alleen de "pixel-puzzel" opgelost.

De onderzoekers noemen dit een "prestatie-mirage". Het lijkt alsof de AI slim is, maar onder de oppervlakte is het een lege woestijn zonder inzicht.

2. De Oplossing: ViGoR-Bench (De "Stresstest")

Om deze mirage te doorbreken, hebben de onderzoekers ViGoR-Bench bedacht. Dit is geen gewone toets, maar een grote, uitgebreide stresstest voor visuele AI.

Stel je ViGoR-Bench voor als een gymnastiekwedstrijd voor robots:

  • Oude test: "Kijk hoe mooi je kunt springen." (Alleen de landing telt).
  • ViGoR-test: "Laat zien hoe je springt, leg uit waarom je zo springt, en zorg dat je niet tegen de muur aan vliegt."

Deze test kijkt niet alleen naar het eindresultaat, maar ook naar hoe de AI erbij komt.

3. De Vier Innovaties (De Regels van de Test)

ViGoR-Bench is uniek omdat het vier nieuwe regels introduceert:

  1. Alles in één keer (Holistic Coverage):
    De test is niet beperkt tot alleen foto's of alleen video's. Het is een multimodale marathon. De AI moet zowel foto's bewerken als video's maken, en alles daartussenin. Het is alsof je een atleet test die zowel kan zwemmen, hardlopen en fietsen, in plaats van alleen hardlopen.

  2. Twee sporen (Dual-Track):
    De jury kijkt naar twee dingen:

    • Het Einddoel: Is de oplossing goed? (De "Wat").
    • Het Proces: Heeft de AI de juiste stappen gezet? (De "Hoe").
    • Voorbeeld: Als een AI een brug bouwt, telt het niet alleen of de brug staat. De AI moet ook laten zien dat hij eerst de fundering heeft gelegd. Als hij de brug "magisch" laat verschijnen zonder fundering, faalt hij, zelfs als de brug er mooi uitziet.
  3. Een eerlijke jury (Evidence-Grounded Judge):
    Vroeger keken andere AI's naar het werk van de test-AI. Dat is alsof je een speler laat oordelen over een andere speler. ViGoR gebruikt een slimme, bewijsgebaseerde jury (een geavanceerde AI) die kijkt naar feiten en logica, niet alleen naar "wat er mooi uitziet". Deze jury is zo goed getraind dat ze bijna net zo oordeelt als een menselijke expert.

  4. Een diagnose (Granular Analysis):
    In plaats van alleen een cijfer te geven (bijv. "6/10"), geeft ViGoR een medisch rapport. Het zegt precies waar de AI faalt: "Je bent goed in kleuren, maar je begrijpt niet hoe zwaartekracht werkt" of "Je kunt goed tellen, maar je raakt de ruimte kwijt".

4. Wat Vonden Ze? (De Uitslag)

Toen ze meer dan 20 van de slimste AI-modellen ter wereld (zoals Sora, GPT-4o, en andere nieuwe modellen) deze test lieten doen, kwamen ze tot een verrassende conclusie:

  • De "Illusie van Redenering": Veel video-modellen lijken heel logisch te denken. Ze maken prachtige video's van water dat stroomt of mensen die lopen. Maar als je ze vraagt om een specifieke fysieke regel te volgen (bijv. "een bal die van een trap valt"), falen ze vaak. Ze simuleren logica, maar ze begrijpen het niet echt.
  • De "Denk- maar niet-tekent" paradox: Sommige modellen kunnen een heel goed stappenplan bedenken (ze "denken" goed), maar als ze het daadwerkelijk moeten tekenen of bouwen, maken ze fouten. Ze weten wat ze moeten doen, maar hun handen (de generatie) zijn niet slim genoeg.
  • De winnaars: De dure, gesloten modellen (zoals die van Google en OpenAI) doen het over het algemeen beter dan de open-source modellen, maar zelfs de besten maken nog veel fouten in complexe puzzels.

5. De Toekomst: Hoe maak je ze slimmer?

De onderzoekers hebben ook getest hoe je AI's kunt trainen om beter te worden. Ze ontdekten iets interessants:

  • Als je een AI traint op moeilijke, complexe puzzels (zoals een heel groot doolhof), wordt hij automatisch beter in makkelijke puzzels.
  • Het is alsof je een student laat studeren voor een doctoraat in wiskunde; als hij dat haalt, is de middelbare schoolwiskunde voor hem een fluitje van een cent.
  • Beloningstraining (RL) werkt beter dan gewoon oefenen. Als je de AI beloning geeft voor het oplossen van het probleem (en niet alleen voor het maken van een mooi plaatje), wordt hij echt slimmer in redeneren.

Conclusie

ViGoR-Bench is een wake-up call voor de wereld van kunstmatige intelligentie. Het zegt: "Stop met alleen kijken naar hoe mooi de foto's zijn. Laten we kijken of de AI de wereld echt begrijpt."

Het is een stap in de richting van AI's die niet alleen kunnen creëren, maar ook kunnen redeneren. Zodat ze niet alleen mooie plaatjes maken, maar ook echte problemen kunnen oplossen, van het ontwerpen van veilige bruggen tot het simuleren van complexe wetenschappelijke experimenten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →