← Nieuwste papers
💬 NLP

Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation

Deze studie toont aan dat kleine, betekenisbehoudende lexicaal en syntactische variaties in prompts de prestaties en ranglijsten van grote taalmodellen aanzienlijk destabiliseren, wat wijst op een overmatige afhankelijkheid van oppervlakkige patronen in plaats van diepgaand linguïstisch begrip.

Oorspronkelijke auteurs: Bogdan Kostić, Conor Fallon, Julian Risch, Alexander Löser

Gepubliceerd 2026-02-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Bogdan Kostić, Conor Fallon, Julian Risch, Alexander Löser

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Waarom slimme AI's soms dom doen als je de woorden verandert

Stel je voor dat je een groep van 23 super-slimme robots (Large Language Models of LLM's) hebt die allemaal een examen moeten doen. Ze krijgen vragen over geschiedenis, medische richtlijnen en tekstbegrip. Normaal gesproken kijken we naar hun cijfers om te zien wie de slimste is. Maar deze onderzoekers vroegen zich af: "Wat gebeurt er als we de vragen net iets anders formuleren, maar de betekenis precies hetzelfde houden?"

Het antwoord is verrassend en een beetje zorgwekkend. Hier is wat ze ontdekten, vertaald naar alledaagse taal:

1. De "Synoniem-Schok" (Woorden zijn belangrijker dan zinsbouw)

Stel je voor dat je een robot vraagt: "Wie bedacht de theorie dat sommige behoeften belangrijker zijn dan andere?"
De robot geeft het juiste antwoord.

Maar als je de vraag verandert in: "Wie bedacht het concept dat sommige motieven cruciaal zijn voor het bestaan?" (alleen synoniemen gebruikt, de zinstructuur hetzelfde), dan haalt dezelfde robot ineens een veel lager cijfer.

  • De ontdekking: De robots zijn extreem gevoelig voor woorden. Als je een woord vervangt door een synoniem, raken ze in paniek en maken ze fouten.
  • De metafoor: Het is alsof de robots niet echt lezen en begrijpen, maar eerder een enorm woordenboek met patronen uit hun hoofd hebben geleerd. Ze kijken naar de "huid" van de zin (de specifieke woorden) in plaats van naar de "ziel" (de betekenis). Als je de huid verandert, denken ze dat het een heel andere vraag is.

2. De "Zinsbouw-Zoektocht" (Grammatica is minder belangrijk)

Vervolgens veranderden ze de volgorde of de grammaticale structuur van de zinnen, maar hielden ze de woorden hetzelfde.
Bijvoorbeeld: "Abraham Maslow bedacht de theorie..." veranderd in "De theorie werd bedacht door Abraham Maslow..."

  • De ontdekking: Hier viel het veel minder tegen. De robots konden deze veranderingen veel beter aan. Soms werd hun score zelfs iets beter!
  • De les: Het maakt voor deze AI's minder uit of je een zin actief of passief maakt, zolang de "magische sleutelwoorden" maar hetzelfde blijven.

3. De "Lijst met Winnaars" is broos

In de tech-wereld hebben we vaak "leaderboards" (ranglijsten) waar we zien welke AI het beste is. Deze lijst lijkt heel stabiel.
Maar de onderzoekers ontdekten dat als je de vragen net iets anders stelt (met synoniemen), de volgorde op de lijst volledig kan veranderen.

  • De metafoor: Het is alsof je een marathon hebt, en de winnaar is de snelste. Maar als je de renners een paar meter verderop op de startlijn zet (een kleine verandering in de vraag), is ineens iemand anders de winnaar.
  • Het probleem: Dit betekent dat de lijst die we nu gebruiken om te kiezen welke AI we moeten kopen, misschien niet zo betrouwbaar is als we denken. Een AI die "nummer 1" staat, is misschien gewoon de beste in het raden van de specifieke woorden in de test, niet de slimste in het algemeen.

4. "Groter" betekent niet "Sterker"

We denken vaak: "Hoe groter de AI (hoe meer 'hersencellen' of parameters), hoe slimmer en stabieler hij is."
De onderzoekers zeggen: Nee, dat klopt niet altijd.

  • De ontdekking: Soms zijn de enorme AI's juist kwetsbaarder dan de kleine versies. Op sommige taken (zoals geschiedenisvragen) werden de grote AI's juist slechter als de woorden veranderden. Op andere taken (zoals medische vragen) waren ze juist beter.
  • De les: Grootte is geen garantie voor betrouwbaarheid. Het hangt er helemaal van af wat de AI precies moet doen.

Wat betekent dit voor ons?

Deze studie is een wake-up call. Het laat zien dat deze slimme machines nog niet echt "begrijpen" wat ze zeggen, maar vooral oppervlakkige patronen volgen.

  • Voor de toekomst: We moeten stoppen met alleen kijken naar één cijfer op een lijst. We moeten AI's testen op hun stabiliteit: kunnen ze dezelfde goede antwoorden geven, ook als we de vraag net iets anders formuleren?
  • De boodschap: Als je een AI wilt gebruiken voor belangrijke dingen (zoals medische adviezen of juridische zaken), moet je eerst controleren of hij niet "in de war raakt" van een paar veranderde woorden.

Kortom: De robots zijn slim, maar ze zijn nogal oppervlakkig. Ze letten meer op de kleding van de zin dan op de persoon erachter.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →