← Nieuwste papers
💻 computer science

Three Lenses on Linguistic Knowledge in Pretrained Transformers: A Phenomenon-Centered Review

Deze review synthetiseert bewijs vanuit representatieve, gedragsmatige en mechanistische perspectieven op onderwerp-werkwoordovereenkomst, negatie en compositionele generalisatie in voorgetrainde Transformers om onderscheidende patronen van convergentie en fragmentatie te onthullen, waarbij uiteindelijk een toegankelijkheids- en bruikbaarheidsdiagnostiek wordt voorgesteld om huidige beperkingen te verduidelijken en toekomstig onderzoek over verschillende niveaus te sturen.

Oorspronkelijke auteurs: Yizhe Wang, Zhenhua Ling

Gepubliceerd 2026-09-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yizhe Wang, Zhenhua Ling

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Taal is een systeem van regels dat ons in staat stelt om eenvoudige ideeën te nemen en ze te combineren tot oneindig nieuwe gedachten. Decennialang hebben wetenschappers zich afgevraagd of de enorme computerprogramma's die nu vloeiende tekst schrijven en complexe vragen beantwoorden, deze regels werkelijk hebben geleerd, of dat ze slechts patronen nabootsen die ze eerder hebben gezien. Deze programma's, bekend als voorgetrainde taalmodellen, zijn getraind op enorme hoeveelheden menselijke teksten. Ze kunnen zinnen produceren die perfect natuurlijk klinken, wat veel mensen doet aannemen dat ze grammatica en betekenis begrijpen zoals mensen dat doen. Het produceren van de juiste woorden is echter niet hetzelfde als weten waarom die woorden bij elkaar horen. Een programma kan een zin per ongeluk of door een methode te gebruiken die een snelle route biedt goed krijgen, zonder de onderliggende logica daadwerkelijk te begrijpen. Om dit mysterie op te lossen, hebben onderzoekers drie verschillende manieren ontwikkeld om in deze modellen te kijken: controleren welke informatie in hun interne geheugen is opgeslagen, testen wat ze daadwerkelijk in hun output produceren, en de specifieke paden traceren die ervoor zorgen dat ze een beslissing nemen.

Een nieuwe review door onderzoekers Yizhe Wang en Zhenhua Ling brengt deze drie manieren van kijken samen om te zien of ze hetzelfde verhaal vertellen. De auteurs richtten zich op drie specifieke gebieden van taal die essentieel zijn voor het begrijpen van hoe deze modellen werken: hoe werkwoorden overeenstemmen met hun onderwerpen, hoe het woord "niet" de betekenis van een zin verandert, en hoe de modellen bekende onderdelen combineren om nieuwe, complexe ideeën te creëren. Door honderden studies te verzamelen en te vergelijken die deze drie methoden gebruikten, ontdekten de onderzoekers dat het antwoord volledig afhangt van welk deel van de taal je vraagt. Soms komt de bewijsvoering van alle drie de methoden perfect overeen; andere keren vertellen de methoden tegenstrijdige verhalen, wat gaten onthult in wat de modellen daadwerkelijk weten.

Het duidelijkste succesverhaal dat de onderzoekers vonden, betreft de onderwerp-werkwoordovereenkomst, de regel dat een enkelvoudig onderwerp een enkelvoudig werkwoord nodig heeft, zoals "the cat runs", terwijl een meervoudig onderwerp een meervoudig werkwoord nodig heeft, zoals "the cats run". Op dit gebied komen de drie verschillende manieren van naar de modellen kijken overeen. Wanneer onderzoekers in de interne toestanden van het model keken, konden ze een duidelijk signaal vinden voor of een zelfstandig naamwoord enkelvoud of meervoud was. Wanneer ze de output van het model testten, koos het bijna altijd de juiste werkwoordsvorm. Het belangrijkste is dat wanneer onderzoekers ingrepen om dat interne signaal te veranderen, het gedrag van het model op een voorspelbare manier veranderde, waardoor het gedwongen werd de verkeerde vorm van het werkwoord te kiezen. Deze convergentie suggereert dat deze modellen voor eenvoudige grammaticale regels de relatie daadwerkelijk hebben geleerd en deze gebruiken om beslissingen te nemen.

Het beeld wordt veel ingewikkelder bij het kijken naar negatie, of hoe de modellen omgaan met het woord "niet". Hier komen de drie lenzen niet overeen. De interne controles laten zien dat de modellen de aanwezigheid van het woord "niet" kunnen detecteren en ongeveer begrijpen waar het in een zin van toepassing is. Echter, wanneer de modellen worden gevraagd om tekst te produceren of vragen te beantwoorden op basis van een ontkennende zin, falen ze vaak in het toepassen van de juiste betekenis. Ze kunnen het woord "niet" wel zien, maar handelen nog steeds alsof de zin positief is. De onderzoekers ontdekten dat hoewel de modellen de marker kunnen herkennen, ze deze niet betrouwbaar gebruiken om de waarheid van de bewering om te draaien. Het is alsof het model het bordje ziet, maar de instructie die het geeft niet opvolgt. Deze mismatch betekent dat de modellen weliswaar over de stukjes informatie beschikken, maar deze niet consistent gebruiken om de volledige betekenis te begrijpen.

Het derde gebied, dat het combineren van verschillende onderdelen van taal om nieuwe betekenissen te creëren, vertoont de meeste verwarring. Dit is het vermogen om bekende woorden en regels te nemen en deze toe te passen op situaties die het model nog nooit eerder heeft gezien. Het bewijs is hier gefragmenteerd. Sommige studies laten zien dat de modellen eenvoudige combinaties kunnen afhanden, vooral wanneer onderzoekers aanwijzingen geven of de taak opdelen in kleinere stappen. Andere studies laten zien dat wanneer de modellen aan zichzelf worden overgelaten om complexe ketens van redeneren uit te werken, ze vaak falen. Het probleem is dat de verschillende studies niet naar hetzelfde kijken. Sommige testen of het model een patroon kan herkennen, terwijl andere testen of het een nieuw idee vanuit het niets kan opbouwen. Omdat de onderzoekers geen enkele, consistente manier konden vinden om dit vermogen over alle studies heen te meten, konden zij niet concluderen of de modellen werkelijk over een algemene vaardigheid beschikken om ideeën te combineren of dat ze slechts goed zijn in specifieelijke, nauwe trucjes.

De auteurs van de review suggereren dat deze verschillende uitkomsten voorkomen omdat sommige taalkenmerken gemakkelijker te isoleren en te gebruiken zijn dan andere. Voor de onderwerp-werkwoordovereenkomst is de functie eenvoudig en geïsoleerd, waardoor het model deze kan vinden en gebruiken. Voor negatie kan het model de marker wel vinden, maar worstelt het met het gebruiken ervan om de hele betekenis te veranderen. Voor complexe combinaties is de functie zo verspreid en moeilijk te definiëren dat het model het zelfs niet duidelijk kan isoleren. De onderzoekers concluderen dat we er niet vanuit kunnen gaan dat deze modellen taal in een algemene zin kennen. In plaats daarvan is hun kennis specifiek voor de taak. Ze zijn uitstekend in sommige zaken, zoals het matchen van werkwoorden, maar inconsistent in andere, zoals het begrijpen van negatie, en ze zijn nog onbewezen bij de meest complexe taak van het creëren van nieuwe ideeën uit oude onderdelen. Deze bevinding verandert hoe we deze systemen moeten evalueren: we kunnen niet alleen kijken of ze het juiste antwoord geven, maar we moeten ook controleren of ze de juiste logica gebruiken om daar te komen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →