← Nieuwste papers
💻 computer science

GenExam: A Multidisciplinary Text-to-Image Exam

GenExam is het eerste multidisciplinaire benchmark voor tekst-naar-beeldmodellen dat examenvragen gebruikt om de integratie van begrip, redenering en generatie te evalueren, waarbij tests aantonen dat open-source modellen aanzienlijk achterblijven bij gesloten systemen.

Oorspronkelijke auteurs: Zhaokai Wang, Penghao Yin, Xiangyu Zhao, Changyao Tian, Yu Qiao, Wenhai Wang, Jifeng Dai, Gen Luo

Gepubliceerd 2026-03-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhaokai Wang, Penghao Yin, Xiangyu Zhao, Changyao Tian, Yu Qiao, Wenhai Wang, Jifeng Dai, Gen Luo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

GenExam: De "Eindexamen" voor AI die Tekeningen moet Maken

Stel je voor dat je een kunstenaar bent die niet alleen mooie schilderijen moet maken, maar ook wiskundige grafieken, chemische reactieschema's of historische kaarten moet tekenen op basis van een zeer specifieke opdracht. En stel je voor dat je niet gewoon een "mooi" plaatje mag maken, maar dat elke lijn, elk woord en elke pijl exact klopt, anders haal je het examen niet.

Dat is precies wat GenExam is: het eerste "eindexamen" voor kunstmatige intelligentie (AI) dat ze test op het maken van teksten naar afbeeldingen, maar dan met de strenge regels van een universitair examen.

Hier is hoe het werkt, vertaald in begrijpelijke taal:

1. Het Probleem: AI is goed in "schoon", maar slecht in "precies"

Tot nu toe zijn AI-modellen (zoals die van Google of OpenAI) heel goed in het maken van prachtige, realistische foto's van een hond of een zonsondergang. Maar als je ze vraagt om een diagram te tekenen voor een scheikunde-examen, gaan ze vaak de mist in. Ze maken een plaatje dat er uitziet als een molecuul, maar de atomen staan op de verkeerde plekken of de bindingen zijn fout.

Het is alsof je iemand vraagt om een plattegrond van je huis te tekenen. De AI tekent een huis dat er mooi uitziet, maar de slaapkamer zit op de plek van de garage en de trap leidt naar het plafond. Voor een kunstenaar is dat prima, maar voor een ingenieur of een student is het een complete mislukking.

2. De Oplossing: GenExam (Het Eindexamen)

De onderzoekers hebben GenExam bedacht. Dit is geen simpele test, maar een verzameling van 1.000 echte examenvragen uit 10 verschillende vakken: van wiskunde en natuurkunde tot muziekgeschiedenis en economie.

  • De Opdracht: De AI krijgt een vraag als: "Teken een ongerichte graaf met 7 punten (A t/m G) en verbind ze met lijnen met specifieke gewichten..."
  • Het Antwoord: Er is een perfecte "voorbeeldantwoord" (de grondwaarheid) waar de AI tegen wordt vergeleken.
  • De Beoordeling: Dit is het slimme deel. De AI wordt niet beoordeeld op "is het mooi?". Nee, het wordt beoordeeld op precisie.
    • Voorbeeld: Als de AI een chemische formule tekent, telt de computer: "Heeft het molecuul precies 6 koolstofatomen? Ja/Nee. Zijn de bindingen correct? Ja/Nee."
    • Het is alsof een leraar een examen nakijkt met een rood potlood: elk foutje kost punten.

3. De Resultaten: Een enorme kloof

De onderzoekers hebben 17 verschillende AI-modellen op dit examen laten proberen. Het resultaat? Een schokkende kloof tussen de "beste" modellen en de rest.

  • De Top (Gesloten Modellen): De allerbeste, dure modellen (zoals Nano Banana Pro van Google) haalden een score van ongeveer 73%. Ze konden de meeste vragen goed beantwoorden, maar maakten nog steeds kleine foutjes.
  • De Rest (Open Source & Andere Modellen): De meeste andere modellen, zelfs de nieuwste, haalden vaak minder dan 5% of zelfs 0%. Ze konden de complexe instructies niet volgen. Ze tekenden bijvoorbeeld een grafiek met de verkeerde assen, of schreven woorden die als "krabbel" leken in plaats van leesbare tekst.

De Metafoor:
Stel je voor dat je een groep mensen vraagt om een complexe machine te bouwen uit een handleiding.

  • De topmodellen zijn als ervaren ingenieurs: ze bouwen de machine, maar soms zit er een schroefje los.
  • De open-source modellen zijn als mensen die de handleiding lezen, maar dan een poppetje van klei maken dat er op lijkt als een machine, maar niet werkt. Ze begrijpen de theorie, maar kunnen het niet vertalen naar de juiste vorm.

4. Waarom is dit belangrijk?

GenExam laat zien dat AI nog niet "slim" genoeg is om echt complexe taken te combineren. Om een goed diagram te tekenen, moet de AI:

  1. Begrijpen wat er gevraagd wordt (Wiskunde/Logica).
  2. Redeneren hoe de onderdelen samenhangen (Fysica/Chemie).
  3. Maken (Tekenen) zonder fouten.

Huidige AI's zijn goed in het maken, maar slecht in het combineren van logica en precisie. GenExam is dus een meetlat om te zien hoe dicht we bij "Algemene Kunstmatige Intelligentie" (AGI) komen: een AI die net zo slim is als een menselijke expert.

Conclusie

GenExam is als een strenge leraar die zegt: "Mooi plaatje is niet genoeg. Als je een kaart van Europa tekent, moet de grens tussen Frankrijk en Duitsel op de juiste plek staan, anders haal je het niet."

Het bewijst dat er nog een lange weg te gaan is voordat AI echt expertniveau bereikt in het maken van technische en wetenschappelijke afbeeldingen. Het is een uitdaging, maar ook een blauwdruk voor hoe we AI in de toekomst beter kunnen maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →