More Aligned, Less Diverse? Analyzing the Grammar and Lexicon of Two Generations of LLMs
Deze studie vergelijkt twee generaties LLM's met door mensen geschreven nieuwsberichten aan de hand van HPSG-formalisme en diversiteitsmaten, waarbij blijkt dat terwijl menselijk schrijven stabiel blijft, nieuwere instructie-geoptimaliseerde modellen aanzienlijk minder syntactische en lexicaal diversiteit vertonen, wat wijst op een mogelijke verenging van het expressieve spectrum ondanks verbeterde coherentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een muziekcriticus bent die twee bands vergelijkt: The Humans (professionele journalisten) en The Robots (kunstmatige intelligentie). Je wilt zien hoe hun muziek in de loop van de tijd is veranderd.
Dit artikel is als een diepgaande analyse van de bladmuziek van deze twee groepen. In plaats van alleen naar de melodie (de woorden) te luisteren, keken de onderzoekers naar de grammatica (de akkoorden en structuur) en de woordenschat (de specifieke instrumenten die werden gebruikt) om te zien of de robots meer op mensen gaan lijken of of ze iets heel anders worden.
Hier is de opsplitsing van hun bevindingen in eenvoudige bewoordingen:
1. De Opzet: Twee Tijden, Twee Bands
De onderzoekers vergeleken twee verschillende tijdperken:
- The Humans: Ze keken naar nieuwsartikelen uit The New York Times die in 2023 en 2025 waren geschreven.
- The Robots: Ze vergeleken twee generaties AI-modellen:
- Oudere Robots (2023): Dit waren de "basis"-modellen. Denk aan hen als rauwe, ongetrainde muzikanten die gewoon spelen wat hen in de zin komt.
- Nieuwere Robots (2025): Dit zijn de "instructie-geoptimaliseerde" modellen. Denk aan hen als muzikanten die een strikt reglement hebben gekregen en een coach die hen precies vertelt hoe ze zich moeten gedragen, wat ze moeten zeggen en hoe ze "behulpzaam" moeten zijn.
2. De Grote Ontdekking: "Meer Gecoördineerd, Minder Divers"
De belangrijkste bevinding is een beetje verrassend. Je zou kunnen verwachten dat naarmate AI slimmer wordt en meer "gecoördineerd" met menselijke instructies, het meer zal gaan klinken als een menselijke schrijver.
De Realiteit: De nieuwere AI-modellen klinken eigenlijk minder als mensen en minder als hun eigen oudere versies.
- The Humans: Professionele journalisten zijn niet veel veranderd. Hun schrijfstijl, zinsbouw en woordkeuze zijn de laatste twee jaar stabiel en divers gebleven. Ze zijn als een jazzband die blijft improviseren met nieuwe ideeën.
- De Oudere Robots: Deze modellen waren eigenlijk behoorlijk divers. Ze gebruikten een breed scala aan zinsstructuren en woorden, soms zelfs gevarieerder dan de mensen wat betreft woordenschat.
- De Nieuwere Robots: Deze modellen zijn saai consistent geworden. Ze hebben hun "smaak" verloren.
- Syntactische Diversiteit (Structuur): Ze gebruiken minder soorten zinsstructuren.
- Lexicale Diversiteit (Woorden): Ze gebruiken een veel smallere reeks woorden. Ze vermijden specifieke namen, data en unieke details.
3. Het Effect van de "Veiligheidsfilter"
Waarom zijn de robots veranderd? Het artikel suggereert dat dit komt door Instructie-Optimalisatie.
Stel je voor dat de oudere robots wilde schilders waren die overal verf op gooiden. De nieuwere robots zijn schilders die te horen hebben gekregen: "Maak geen fouten, hallucineer niet en houd je aan de feiten."
Om deze regels te volgen, zijn de nieuwere AI-modellen gaan spelen op veilig.
- Ze hielden op met het gebruik van specifieke namen (zoals "Washington" of "Senator Ben Cardin") omdat ze de feiten niet verkeerd wilden hebben.
- Ze hielden op met het gebruik van complexe zinsstructuren die misschien riskant zouden zijn.
- In plaats daarvan zijn ze gaan werken met lange, veilige, repetitieve zinnen die makkelijk te begrijpen zijn, maar die de "vonk" van menselijk schrijven missen.
4. Het "Makkelijk Te Lezen" Paradox
Hier is een vreemde draai: De nieuwere AI-modellen schrijven langere zinnen dan mensen, maar die zinnen zijn makkelijker voor een computer om te analyseren.
- De Analogie: Stel je voor dat een menselijke schrijver een complex, kronkelend kasteel bouwt met verborgen deuren en geheime gangen. Het is mooi, maar moeilijk om in kaart te brengen.
- De nieuwere AI bouwt een zeer lange, rechte gang zonder deuren. Het is langer dan het kasteel van de mens, maar het is ongelooflijk makkelijk om doorheen te lopen omdat het zo voorspelbaar is.
De onderzoekers ontdekten dat de nieuwere AI-tekst zo regelmatig en formulematig is dat een computergrammaticachecker deze bijna perfect kan verwerken (99% succes), terwijl menselijk schrijven iets chaotischer is en moeilijker te ontleden (94-95% succes).
5. De Conclusie
Het artikel concludeert dat nieuwere AI-modellen, hoewel ze beter zijn geworden in het volgen van instructies en het klinken als "behulpzaam", creativiteit en variatie hebben ingeruild voor veiligheid en voorspelbaarheid.
Ze zijn geen "gemiddelde" schrijvers meer; ze worden "veilige" schrijvers. Ze hebben hun expressieve bereik zo sterk ingeperkt dat ze nu minder divers zijn dan zowel menselijke journalisten als de oudere, minder getrainde AI-modellen.
Kortom: De robots werden beter in het volgen van de regels, maar daarbij vergaten ze hoe ze interessant moesten zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.