← Nieuwste papers
💬 NLP

Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion

Dit artikel toont aan dat lexicale perturbaties het redeneervermogen van LLM's ernstig verslechteren door de tokenisatie te fragmenteren en de aandacht in transformer-lagen af te leiden, een gekoppeld effect dat herstelstrategieën tijdens de inferentie ineffectief maakt omdat ze er niet in slagen om gelijktijdig zowel de gecorrumpeerde inhoud als de aandachtstoewijzing te herstellen.

Oorspronkelijke auteurs: Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

Gepubliceerd 2026-08-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiaqian Zhu, Yang Zhang, Junhua Ding, Xiaowei Yu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn de motoren achter een nieuwe generatie kunstmatige intelligentie, in staat om complexe instructies te lezen, wiskundige problemen op te lossen en gesprekken te voeren die opmerkelijk menselijk aanvoelen. Deze systemen werken door tekst op te delen in kleine stukjes die tokens worden genoemd, die fungeren als bouwstenen voor het model om betekenis te begrijpen. Wanneer een mens een zin leest met een typefout, slaat het brein de fout moeiteloos over en begrijpt de beoogde boodschap. Jarenlang namen onderzoekers aan dat deze krachtige computermodellen dezelfde veerkracht deelden, in de veronderstelling dat kleine spelfouten of onhandige formuleringen hun vermogen om te redeneren niet significant zouden verstoren. De vraag hoe fragiel deze systemen werkelijk zijn wanneer ze worden geconfronteerd met realistische, alledaagse fouten, is grotendeels onbeantwoord gebleven, wat een kloof heeft achtergelaten tussen hun indrukwekkende prestaties op schone data en hun betrouwbaarheid in de rommelige echte wereld.

Een recente studie probeerde deze kloof te dichten door te testen hoe vier verschillende grote taalmodellen omgaan met drie specifieke soorten tekstcorruptie. De onderzoekers namen standaard redeneertaken, zoals het beantwoorden van vragen over natuurkunde of het oplossen van wiskundige problemen met meerdere stappen, en introduceerden realistische fouten. Ze simuleerden snelle typfouten waarbij een toets naast de beoogde toets wordt geraakt, het verwisselen van naburige letters binnen een woord, en het toevoegen van gespreksvullers zoals "eh" of "weet je wel" om de zinnen te verlengen. Het doel was om te zien of de modellen nog steeds het juiste antwoord konden vinden wanneer de tekst er licht beschadigd uitzag, en om precies te begrijpen waarom ze zouden falen.

De resultaten toonden een scherpe en verrassende kloof in hoe de modellen reageerden. Wanneer de onderzoekers gespreksvullers toevoegden, presteerden de modellen bijna exact hetzelfde als op schone tekst, ook al werden de zinnen langer. Echter, wanneer ze karakterfouten introduceerden zoals typefouten of verwisselde letters, stortte de nauwkeurigheid van de modellen in. Deze daling was het meest ernstig bij taken die vereisten dat er meerstaps wiskundig werd gerekend, waarbij een enkele typefout de oorzaak kon zijn dat het model volledig uit koers raakte. De studie toonde aan dat het falen niet werd veroorzaakt door de extra lengte van de tekst, maar door de specifieke manier waarop de computer de woorden in stukjes opdeelt. Wanneer een woord verkeerd gespeld is, kan het interne woordenboek van de computer het niet meer herkennen als een enkele eenheid. In plaats daarvan splitst het het woord in vreemde, onbekende fragmenten.

De onderzoekers herleidden de oorzaak van dit falen aan een fenomeen dat zij aandachtafleiding noemen. In een functionerend model richt het systeem zijn computationele energie op de belangrijkste delen van een zin, zoals de getallen in een wiskundig probleem of de kernfeiten in een verhaal. Wanneer een woord wordt gefragmenteerd in vreemde stukjes, werken deze fragmenten als een magneet die de focus van het model wegtrekt van de belangrijke bewijslast en naar de beschadigde delen van de tekst. Het model eindigt met het staren naar de typefout in plaats van naar de oplossing. Deze afleiding is het meest schadelijk in de middelste en laatste stadia van de verwerking van het model, waar het probeert informatie te combineren om een antwoord te vormen. De studie bevestigde dat het de fragmentatie van het woord is, en niet de lengte van de zin, die tot dit verlies van focus leidt.

Om te begrijpen waarom dit zo moeilijk te herstellen is, voerden de onderzoekers een reeks experimenten uit waarbij ze probeerden het probleem in isolatie te repareren. Ze probeerden de focus van het model te herstellen naar de juiste delen van de zin terwijl de typefouten aanwezig bleven, en ze probeerden de typefouten te herstellen terwijl de focus van het model verward bleef. Geen van beide benaderingen werkte goed op zichzelf. Sterker nog, het herstellen van de focus terwijl de tekst beschadigd bleef, zorgde er zelfs voor dat het model slechter presteerde, omdat het nu intens naar de verkeerde informatie keek. De studie vond dat de schade aan de tekst en de afleiding van het model diep met elkaar verbonden zijn; ze kunnen niet van elkaar gescheiden worden. Het model vertrouwt op de specifieke vorm van de woorden om de invoer te begrijpen, en wanneer die vorm wordt doorbroken, wordt de aandacht van het model er eveneens mee meegezogen.

Deze koppeling verklaart waarom veelvoorkomende strategieën om de prestaties te verbeteren, zoals het vragen aan het model om stap voor stap na te denken of het gebruik van een spellingscontrole vóór de hoofdtaak, vaak falen om de verloren nauwkeurigheid terug te winnen. Deze methoden proberen meestal slechts één kant van het probleem op te lossen, ofwel de tekst, ofwel de focus, terwijl de andere kant beschadigd blijft. De onderzoekers ontdekten ook dat de ernst van het falen afhangt van het soort informatie dat gecorrumpeerd is. Als een typefout een getal in een wiskundig probleem raakt, is het model bijna zeker van falen, omdat dat getal niet uit de omliggende context kan worden afgeleid. Als een typefout een algemeen woord raakt, kan het model mogelijk nog herstellen. Dit suggereert dat de meest kritieke fouten diegene zijn die unieke, onvervangbare stukken informatie vernietigen.

Uiteindelijk concludeert de studie dat de kwetsbaarheid van deze modellen ligt in hoe ze tekst representeren aan het begin van hun verwerking. Zod_t een woord is opgebroken in onbekende fragmenten, is de schade effectief onomkeerbaar zonder toegang tot de originele, correcte tekst. De onderzoekers ontdekten dat zelfs een krachtig reparatiemodel de fouten niet betrouwbaar kon herstellen, omdat de gecorrumpeerde tekst vaak geen aanwijzingen bevatte over wat het oorspronkelijke woord had moeten zijn. Dit betekent dat het bouwen van werkelijk robuuste kunstmatige intelligentie vereist dat de tekst wordt beschermd voordat deze het model binnengaat, in plaats van te proberen het achteraf te repareren. De bevindingen suggereren dat toekomstige verbeteringen zich moeten richten op het flexibeler maken van het initiële begrip van de tekst door het systeem, zodat het betekenis kan herkennen zelfs wanneer de oppervlakkige vorm licht beschadigd is, in plaats van te vertrouwen op perfecte spelling om te kunnen functioneren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →