← Nieuwste papers
💻 computer science

AGC-Bench: Measuring Artificial General Creativity

Dit artikel introduceert AGC-Bench, een uitgebreide benchmark en evaluatiekader dat een verenigde maatstaf voor kunstmatige algemene creativiteit vaststelt, waarbij wordt aangetoond dat er een afzonderlijke creativiteitsfactor bestaat die verschilt van algemene intelligentie, terwijl tegelijkertijd wordt aangetoond dat de beste menselijke makers nog steeds beter presteren dan de huidige grensverleggende LLM's.

Oorspronkelijke auteurs: Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. DiStefano, Sherin Muckatira, Claire E. Stevenson, Mikhail Gronas, Anna Rumshisky

Gepubliceerd 2026-07-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. DiStefano, Sherin Muckatira, Claire E. Stevenson, Mikhail Gronas, Anna Rumshisky

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische bibliotheek hebt met tests die ontworpen zijn om te zien hoe "creatief" verschillende mensen zijn. Sommige tests vragen je om nieuwe toepassingen voor een baksteen te bedenken, andere vragen je om een grappige grap te schrijven, en sommige vragen je om een wetenschappelijk puzzel op te lossen. Lange tijd hebben onderzoekers gedebatteerd: is creativiteit één grote superkracht die je helpt om goed te presteren bij al deze dingen (zoals hoe goed zijn in wiskunde je kan helpen bij natuurkunde), of is het een verzameling van afzonderlijke vaardigheden waarbij je een geweldige dichter kunt zijn maar verschrikkelijk in techniek?

Nu hebben we Artificial Intelligence (AI) modellen die verhalen kunnen schrijven, problemen kunnen oplossen en grappen kunnen vertellen. Maar we hadden geen manier om te meten of de creativiteit van een AI een algemene superkracht is of gewoon een reeks geïsoleerde trucjes.

Dit artikel introduceert AGC-Bench, een enorme nieuwe "creativiteitsgym" voor AI. Dit is wat ze hebben gedaan en gevonden, eenvoudig uitgelegd:

1. De ultieme creativiteitsgym bouwen

De onderzoekers hebben niet zomaar één nieuwe test gemaakt. In plaats daarvan gedroegen ze zich als bibliothecarissen en detectives. Ze hebben meer dan 3.000 wetenschappelijke artikelen gescand om elke enkele creativiteitstest te vinden die ooit voor AI is gemaakt. Uit die berg artikelen hebben ze 78 verschillende tests gekozen (zoals een "brainstorm"-test, een "verhalenvertel"-test en een "humor"-test) en een uniform systeem gebouwd om ze allemaal tegelijk te draaien.

Denk aan het bouwen van een enkele sportschool die een loopband, een gewichtrekken, een klimwand en een zwembad heeft, die allemaal gekalibreerd zijn om dezelfde atleet te meten. Ze hebben 83 verschillende AI-modellen getest in deze sportschool.

2. Het "rechter"-probleem en de nieuwe scheidsrechter

Wanneer je een AI vraagt om de grap of het verhaal van een andere AI te beoordelen, kan de AI-rechter bevooroordeeld zijn—soms te streng, soms te makkelijk. Het is alsof je een scheidsrechter hebt die van het ene team houdt en het andere team haat.

Om dit op te lossen, gebruikten de onderzoekers een slimme truc genaamd Judge Response Theory. Ze lieten drie verschillende "super-AI" rechters elk antwoord beoordelen. Vervolgens gebruikten ze wiskunde om te bepalen welke rechter de "strenge coach" was en welke de "milde coach". Ze pasten de scores aan zodat iedereen eerlijk werd beoordeeld. Ten slotte trainden ze een nieuwe, open-source AI (genaamd AGC-Judge) om als een perfecte scheidsrechter te fungeren die dit eerlijke panel nabootst, zodat iedereen het later kan gebruiken zonder drie dure super-AI's nodig te hebben.

3. De grote ontdekking: Is creativiteit één ding of vele?

Dit is de hoofdvraag van het artikel. Ze vroegen zich af: Als een AI goed is in het schrijven van verhalen, is het dan automatisch ook goed in het oplossen van wetenschappelijke problemen?

Het antwoord: Ja, grotendeels.
Wanneer ze de scores analyseerden, ontdekten ze dat creativiteit in AI werkt als één enkele, krachtige motor. Ze noemen dit de "C-factor" (zoals de "g-factor" voor algemene intelligentie bij mensen).

  • De metafoor: Stel je creativiteit voor als een zaklamp. Als een AI een heldere zaklamp heeft (hoge "C"), schijnt deze fel op alle de verschillende tests, of het nu gaat om het schrijven van een gedicht of het maken van een grap.
  • De statistiek: Deze enkele "C-factor" verklaarde 81,5% van de verschillen tussen de modellen. Als je weet hoe goed een AI presteert op één creatieve taak, kun je voorspellen hoe goed hij op bijna elke andere creatieve taak zal presteren.

Echter, net zoals een mens een betere schrijver kan zijn dan een wiskundige, hebben de beste AI-modellen nog steeds lichte voorkeuren. Sommigen waren iets beter in humor, terwijl anderen iets beter waren in wetenschappelijke ideeën, maar de algemene "creatieve motor" was hetzelfde.

4. Is AI-creativiteit slechts vermomde "redenering"?

Sommige mensen dachten: "Misschien is de AI niet creatief; het is gewoon heel goed in logica en feiten."
De onderzoekers testten dit door de modellen te vragen om "creatief te zijn" versus "logisch te zijn".

  • Het resultaat: De AI de opdracht geven om "creatief te zijn" gaf een veel grotere boost aan hun scores dan de opdracht om "hun redeneerbrein te gebruiken". Dit bewijst dat de test daadwerkelijk creativiteit meet, en niet alleen logica.

5. Mensen vs. AI: Wie is flexibeler?

Ze vergeleken de AI-resultaten met een groep echte mensen die dezelfde tests maakten.

  • De bevinding: Mensen zijn zeer "gespecialiseerd". Een mens die geweldig is in het schrijven van poëzie, is misschien niet geweldig in het oplossen van technische puzzels. Hun creativiteit is verdeeld in verschillende bakjes.
  • Het AI-verschil: AI is verrassend "algemeen". Een AI die goed is in één ding, is meestal goed in alles. Het is minder gespecialiseerd dan een mens.
  • De winnaar: Hoewel AI flexibeler is, versloeg de beste mens in de kamer nog steeds de beste AI op de moeilijkste taken. De topmens was iets voorop de top-AI, maar de AI haalt snel in.

Samenvatting

Het artikel bouwde een enorme, eerlijke en gestandaardiseerde speeltuin om AI-creativiteit te meten. Ze ontdekten dat AI-creativiteit een enkele, algemene vaardigheid is (zoals een superbatterij) die de prestaties over alle soorten creatieve taken aandrijft, in plaats van een verzameling van verschillende vaardigheden. Hoewel de beste AI ongelooflijk dicht bij de beste mens staat, houdt de topmens nog steeds de kroon, en is menselijke creativiteit meer gespecialiseerd (goed in sommige dingen, slecht in andere) vergeleken met de "alleskunner"-aanpak van de AI.

Ze hebben al hun tools, data en de "eerlijke rechter"-AI beschikbaar gesteld aan het publiek, zodat anderen deze modellen kunnen blijven testen en verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →