← Nieuwste papers
💬 NLP

Evaluating the Creativity of LLMs in Persian Literary Text Generation

Deze studie evalueert het vermogen van grote taalmodellen om creatieve Perzische literaire teksten te genereren door een dataset te analyseren op originaliteit, vlotheid, flexibiliteit en uitwerking, waarbij gebruik wordt gemaakt van een gevalideerde LLM-jury voor beoordeling en een analyse van literaire stijlmiddelen.

Oorspronkelijke auteurs: Armin Tourajmehr, Mohammad Reza Modarres, Yadollah Yaghoobzadeh

Gepubliceerd 2026-02-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Armin Tourajmehr, Mohammad Reza Modarres, Yadollah Yaghoobzadeh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep digitale kunstenaars hebt die je vraagt om gedichten te schrijven in het Perzisch, een taal met een rijke, eeuwenoude literaire traditie. De vraag is: kunnen deze kunstmatige intelligenties (LLMs) echt creatief zijn, of zijn ze gewoon slimme kopieerapparaten die herhalen wat ze al hebben gelezen?

Dit artikel van onderzoekers uit Iran en de Universiteit van Teheran is als een groot proefexamen voor deze digitale kunstenaars. Hier is wat ze hebben gedaan, vertaald in alledaags taalgebruik:

1. Het Ontbrekende Puzzelstukje

Tot nu toe hebben we vooral gekeken of computers creatief zijn in het Engels. Het is alsof we alleen hebben getest of een chef-kok goed kan koken met Italiaanse ingrediënten, maar we hebben nooit gekeken of hij ook een perfecte Perzische pilau kan maken. Perzische literatuur is heel specifiek: het zit vol met mooie metaforen, vergelijkingen en diepe gevoelens. De onderzoekers wilden weten: kunnen deze AI's dieper graven dan alleen oppervlakkige zinnen?

2. De "Creativiteits-Test" (Het TTCT)

Om dit te meten, hebben ze een bestaande test voor menselijke creativiteit (de Torrance-test) aangepast. In plaats van te vragen "noem zoveel mogelijk dingen die je kunt doen met een baksteen", vroegen ze de AI's om zinnen te schrijven over thema's als liefde, hoop, verdriet en het Perzische Nieuwjaar (Nowruz).

Ze keken naar vier dingen, alsof ze een schilderij beoordelen:

  • Originaliteit: Is het een cliché ("liefde is een roos") of iets nieuws en verrassends?
  • Vloeiendheid: Klinkt het natuurlijk in het Perzisch, of klinkt het als een robot die woorden uit een lijst plukt?
  • Flexibiliteit: Kijkt de zin het onderwerp vanuit een nieuw perspectief?
  • Uitwerking: Is de zin rijk aan details en beeldspraak, of is het een droge zin?

3. De "Menselijke Jury" en de "Digitale Scheidsrechter"

Omdat creativiteit lastig te meten is, hebben ze eerst echte mensen ingeschakeld om 100 zinnen te beoordelen. Daarna hebben ze gekeken welke AI het beste kon oordelen over de creativiteit van andere AI's.
Het resultaat? Claude 3.7 Sonnet bleek de beste "digitale scheidsrechter". Deze AI oordeelde bijna hetzelfde als de menselijke jury. Andere modellen (zoals GPT-4o) waren soms te streng of te mild, alsof ze een beetje partijdig waren.

4. De Resultaten: Wie is de Beste Kunstenaar?

Ze hebben zes verschillende AI-modellen getest. Hier zijn de opvallendste bevindingen:

  • De "Denker" (DeepSeek-R1): Dit model deed het verrassend goed, vooral in het uitwerken van details en het bieden van verschillende perspectieven. Het lijkt erop dat omdat dit model eerst "nadenkt" voordat het antwoordt (een soort interne monoloog), het diepere, rijkere zinnen produceert. Het is alsof het eerst een schets maakt voordat het begint met schilderen.
  • De "Grammatica-meester" (GPT-4.1): Deze AI schreef zinnen die grammaticaal perfect waren en heel natuurlijk klinken. Maar ze waren vaak iets te veilig en voorspelbaar. Het miste soms die "vonk" van originaliteit.
  • De "Avonturier" (Qwen2.5): Deze probeerde het meest originele en ongewone te doen, maar soms liep de vloeiendheid eronder. Het was alsof iemand een heel creatief gedicht schrijft, maar de zinnen zijn soms wat hakkerig of moeilijk te begrijpen.

5. Het Geheim van de Woorden

De onderzoekers keken ook naar welke woorden de AI's het vaakst gebruikten.

  • Mensen gebruikten een breed scala aan beelden: de lucht, een blik, de horizon.
  • AI's leken vaak vast te zitten in dezelfde patronen. Ze gebruikten heel vaak woorden als "hoop", "licht", "donker" en "hart". Het was alsof ze allemaal uit dezelfde kleine doos met verfkwasten kwamen, terwijl mensen een heel palet hadden.
  • Interessant genoeg gebruikten de "denkende" modellen (zoals DeepSeek-R1) iets meer unieke woorden, zoals "zonsopgang", wat suggereert dat het nadenken helpt om uit de standaardpatronen te breken.

6. De Metafoor van de "Rhetorische Wapens"

Perzische literatuur staat bekend om het gebruik van specifieke stijlmiddelen: vergelijkingen, metaforen, overdrijvingen en tegenstellingen.

  • Mensen mixen deze middelen op een natuurlijke manier.
  • AI's bleken vaak te veel te vertrouwen op één ding: vergelijkingen (bijvoorbeeld: "liefde is als een bloem"). Ze gebruikten te weinig van de andere, complexere middelen. Het was alsof ze alleen maar met hamers werkten, terwijl ze ook schroevendraaiers en tangen nodig hadden.

Conclusie: Slim, maar nog geen Poëet

De boodschap van dit onderzoek is hoopvol, maar realistisch. Deze AI's zijn uitstekende gereedschappen om Perzische teksten te genereren. Ze kunnen prachtige, vloeiende zinnen schrijven. Maar ze zijn nog geen echte kunstenaars. Ze missen de diepgang, de onverwachte wendingen en de culturele nuance die een menselijke dichter van nature heeft.

Het is alsof je een robot hebt die perfect kan kopiëren en samenvatten, maar die nog moet leren voelen waarom een bepaalde zin je hart doet snellen. De onderzoekers zeggen: "We hebben de basis gelegd, maar er is nog veel werk te doen om AI's echt creatief te maken in talen die rijk zijn aan cultuur."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →