Automated Creativity Evaluation of Language Models Across Open-Ended Tasks
Dit artikel introduceert een schaalbaar, domein-agnostisch framework dat de creativiteit van grote taalmodellen over open eind taken heen kwantificeert door semantische entropie voor het meten van divergente nieuwheid te combineren met een op retrieval gebaseerde multi-agent beoordelaar voor het beoordelen van convergente taakvervulling.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een talent scout bent die probeert te beoordelen hoe "creatief" een groep nieuwe AI-schrijvers, uitvinders en probleemoplossers is. In het verleden was het beoordelen van creativiteit alsof je een schilderij probeerde te meten met een liniaal: het was rommelig, vereiste een menselijke expert voor elk afzonderlijk stuk, en werkte alleen voor specifieke soorten kunst.
Dit artikel introduceert een nieuwe, geautomatiseerde "Creativiteitsscorekaart" die werkt voor elk soort open eind taken, van het oplossen van een puzzel tot het schrijven van een verhaal. De auteurs breken creativiteit af in twee verschillende superkrachten en meten deze apart: Divergent Denken (het vermogen om veel verschillende ideeën te bedenken) en Convergent Denken (het vermogen om het beste idee te kiezen en het werkend te krijgen).
Zo werkt hun systeem, met eenvoudige analogieën:
1. Het meten van "Dromen" (Divergente Creativiteit)
Het Probleem: Hoe weet je of een AI niet gewoon hetzelfde idee in andere woorden herhaalt, maar echt nieuw terrein verkent?
De Oude Manier: Het tellen van woorden of controleren of zinnen er aan de oppervlakte verschillend uitzien. Dit is als het beoordelen van een chef-kok op basis van hoeveel verschillende woorden hij gebruikt om "soep" te beschrijven, zelfs als ze allemaal hetzelfde smaken.
De Nieuwe Manier (Semantische Entropie): De auteurs gebruiken een concept genaamd Semantische Entropie.
- De Analogie: Stel dat je een AI vraagt: "Hoe kan ik een rivier oversteken?"
- Een AI met lage creativiteit zegt misschien: "Bouw een brug," "Maak een brug," "Construeer een brug." Deze zien er verschillend uit, maar betekenen exact hetzelfde. De "entropie" (variatie) is laag.
- Een AI met hoge creativiteit zegt misschien: "Bouw een brug," "Vlieg met een drone," "Knoop lianen aan elkaar," "Wacht tot het water bevriest." Dit zijn echt verschillende paden. De "entropie" is hoog.
- Het Resultaat: Deze methode werkt als een "variatie-meter". Het negeert oppervlakkige woordveranderingen en meet hoeveel verschillende conceptuele richtingen de AI verkent. Het onderzoek toonde aan dat deze meter veel beter overeenkomt met wat mensen als "creatief" beschouwen dan eerdere methoden.
2. Het meten van "Doen" (Convergente Creativiteit)
Het Probleem: Wilde ideeën genereren is makkelijk; zorgen dat die ideeën ook daadwerkelijk het probleem oplossen is moeilijk. Een AI kan voorstellen om "met een draak te vliegen" om een rivier over te steken, wat creatief is maar nutteloos.
De Oude Manier: Een enkele AI-beoordelaar of een mens gebruiken om het antwoord te lezen. Dit is traag, duur en moeilijk op te schalen.
De Nieuwe Manier (Het Retrieval-gebaseerde Multi-Agent Team): De auteurs hebben een team van gespecialiseerde AI-"rechters" gebouwd die samenwerken, maar met een twist om geld en tijd te besparen.
- De Analogie: Stel je een panel van experts voor (een Veiligheidsfunctionaris, een Haalbaarheidsexpert en een Verhaalcriticus) die een project beoordelen.
- Oude Methode: Elke keer als ze spreken, lezen ze de volledige geschiedenis van het gesprek vanaf het begin. Dit is als een vergadering waarbij iedereen de laatste 100 pagina's aan aantekeningen opnieuw leest voordat hij spreekt. Dat wordt enorm groot en duur.
- Nieuwe Methode: Het team gebruikt een "slim archiefsysteem". In plaats van alles opnieuw te lezen, halen ze alleen de specifieke aantekeningen op die relevant zijn voor het punt dat op dat moment wordt besproken.
- Het Resultaat: Deze "Retrieval-gebaseerde" aanpak verlaagt de rekenkosten met 63%, terwijl het even nauwkeurig blijft als menselijke experts. Het zorgt ervoor dat de AI niet alleen maar onzin verzint, maar ook daadwerkelijk aan de vereisten van de taak voldoet.
3. De Grote Ontdekking: Twee Verschillende Vaardigheden
De meest verrassende bevinding van het paper is dat deze twee vaardigheden — Dromen en Doen — niet automatisch samen groeien.
- De Analogie: Denk aan een auto. Je kunt een zeer krachtige motor hebben (Convergent/Taakuitvoering) die je perfect op de bestemming brengt, maar dat betekent niet dat de bestuurder goed is in het verkennen van off-road paden (Divergent/Creativiteit).
- De Bevinding: Naarmate AI-modellen groter en slimmer worden in het opvolgen van instructies (Convergent), worden ze niet noodzakelijkerwijs beter in het verkennen van wilde, nieuwe ideeën (Divergent). Sterker nog, de grootste, meest "correcte" modellen verkennen soms minder dan kleinere modellen. Het paper suggereert dat de huidige training AI's beter maakt in "correct" zijn, maar niet noodzakelijkerwijs creatiever.
4. Het Systeem Testen
De auteurs hebben dit framework getest op drie zeer verschillende "speeltuinen":
- MacGyver: Fysieke problemen oplossen met alledaagse voorwerpen (bijv. "Hoe repareer je een lek met een sok?").
- HypoGen: Nieuwe wetenschappelijke onderzoeksideeën bedenken.
- BookMIA: Creatieve verhalen schrijven met specifieke begin- en eindpunten.
In alle drie de gevallen slaagde hun systeem erin om te meten hoe "breed" de ideeën van de AI waren en hoe "goed" de uiteindelijke oplossingen waren, wat bewees dat het werkt voor verschillende soorten creativiteit.
Samenvatting
Dit paper biedt een universele, geautomatiseerde liniaal voor creativiteit. Het scheidt het vermogen om veel unieke ideeën te genereren van het vermogen om het probleem correct op te lossen. Het laat zien dat hoewel AI steeds beter wordt in het oplossen van problemen, het niet automatisch ook creatiever wordt, en dat we nieuwe instrumenten nodig hebben om die specifieke "creatieve vonk" te meten en te stimuleren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.