← Nieuwste papers
💻 computer science

Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbations

Dit onderzoek toont aan dat grote taalmodellen kwetsbaar zijn voor betekenisbehoudende perturbaties, en introduceert het Mechanistic Perturbation Diagnostics (MPD)-framework om de onderliggende mechanische oorzaken van deze fouten te analyseren en te classificeren in lokale, gedistribueerde en verweven typen met verschillende herstelpotentialen.

Oorspronkelijke auteurs: Shou-Tzu Han, Rodrigue Rizk, KC Santosh

Gepubliceerd 2026-04-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shou-Tzu Han, Rodrigue Rizk, KC Santosh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🧠 De Broze Breinen van AI: Waarom slimme modellen soms dom doen

Stel je voor dat je een zeer slimme student hebt die wiskundepuzzels oplost. Hij kan de moeilijkste sommen van de wereld maken. Maar als je de naam van een personage in de som verandert (bijvoorbeeld "Jan" wordt "Piet") of schrijft "5 dollar" in plaats van "$5", raakt hij in paniek en geeft hij een volledig fout antwoord.

Dat is precies wat dit onderzoek laat zien: Grote Taalmodellen (LLMs) zijn verrassend kwetsbaar. Ze lijken slim, maar ze begrijpen de betekenis niet echt; ze kijken alleen naar oppervlakkige details.

De onderzoekers van de Universiteit van South Dakota hebben drie populaire AI-modellen onder de loep genomen: Mistral, Llama-3 en Qwen. Ze gaven hen 677 wiskundeproblemen, maar verstoorden ze op twee manieren:

  1. Naamvervanging: "Anna heeft 3 appels" werd "Bob heeft 3 appels".
  2. Getal-hervormulering: "$5" werd "5 dollar" of "60%" werd "60 procent".

Het resultaat? De AI's gaven in 29% tot 45% van de gevallen een fout antwoord, alleen omdat de woorden anders geschreven waren. Alsof een mens een som niet meer kan oplossen als je de cijfers in het Latijn schrijft in plaats van in Arabische cijfers.


🔍 De "Mechanische Autopsie": Hoe kijken we in hun hoofd?

Omdat het niet genoeg is om te zeggen "het werkt niet", wilden de onderzoekers weten waarom het misgaat. Ze gebruikten een nieuw gereedschapskistje genaamd MPD (Mechanistic Perturbation Diagnostics).

Je kunt je dit voorstellen als een röntgenfoto of een zwartdoos-analyse van de AI. Ze keken niet alleen naar het antwoord, maar naar wat er in de "hersenen" (de lagen van het model) gebeurde terwijl de AI dacht.

Ze gebruikten vier slimme technieken:

  1. Logit Lens (De Voorspellingsspiegel): Kijkt in elke stap van het denkproces wat de AI denkt. Ze zagen dat bij fouten de AI veel eerder begint te twijfelen dan bij goede antwoorden.
  2. Activerings Patching (De Hersentransplantatie): Stel je voor dat de AI een fout maakt. De onderzoekers namen de "gedachten" van een goede oplossing en plakten die op de plek waar de fout ontstond.
    • Bij Llama-3: Dit werkte perfect! Alsof je een kapotte bout in een machine vervangt en de machine weer draait. De fout zat op één specifieke plek.
    • Bij Mistral en Qwen: Dit werkte niet. Alsof de machine overal tegelijk lek is; als je één bout vastdraait, loopt het nog steeds leeg.
  3. Onderdelen Verwijderen (Component Ablation): Ze schakelden specifieke onderdelen (zoals de "aandacht" of de "rekenmodule") uit om te zien wie de schuldige was.
  4. CAI (De Golfgolf-meting): Een nieuwe manier om te meten hoe een kleine fout in het begin van de zin steeds groter wordt naarmate de AI verder denkt. Het is alsof een klein steentje in een rivier eerst een plasje maakt, maar na een paar meter een enorme vloedgolf veroorzaakt.

🏗️ Drie Soorten "Breinbrekers"

De onderzoekers ontdekten dat niet alle AI's op dezelfde manier falen. Ze stelden een nieuwe indeling op, vergelijkbaar met hoe je auto's kunt indelen op basis van hun defecten:

  1. De "Lokale" Breker (Llama-3):

    • Vergelijking: Een auto met een kapotte koplamp.
    • Wat er gebeurt: De fout zit op één specifieke plek in het denkproces. Als je die plek repareert (door de "gedachte" te vervangen), werkt de auto weer.
    • Resultaat: Ze konden 71% van de fouten repareren.
  2. De "Verspreide" Breker (Mistral):

    • Vergelijking: Een auto waar het hele frame door roest is aangetast.
    • Wat er gebeurt: De fout zit verspreid over het hele systeem. Er is geen enkele plek om te plakken. Het is alsof de hele motor te veel trilt.
    • Resultaat: Ze konden bijna niets repareren (slechts 5%).
  3. De "Verstripte" Breker (Qwen):

    • Vergelijking: Een auto waar de motor en de wielen door elkaar zijn gehaald.
    • Wat er gebeurt: De fout zit niet in de "aandacht" (zoals bij de andere twee), maar in de rekenmodule (MLP). Alles is zo met elkaar verweven dat je niets kunt aanraken zonder alles te verstoren.
    • Resultaat: Ze konden niets repareren (0%).

🛠️ Kunnen we het repareren?

De onderzoekers probeerden de fouten te fixen met twee methoden:

  • Stuurvectoren: Een soort "navigatiecorrectie" die de AI een duw in de goede richting geeft zonder te leren.
  • Lagen Fijnafstemmen: Het trainen van slechts een klein deel van de AI.

De les:

  • Bij de Lokale breker (Llama-3) werkte het goed. Je kunt de fout "repareren" en de AI wordt weer betrouwbaar.
  • Bij de Verspreide en Verstripte brekers werkte het nauwelijks. Je kunt een auto met roest of een verkeerd gemonteerde motor niet fixen door alleen de koplamp te vervangen.

💡 De Grote Conclusie

Deze studie laat zien dat AI's die goed scoren op tests, niet per se "slim" zijn in de menselijke zin. Ze zijn vaak heel kwetsbaar voor kleine veranderingen in de manier waarop een vraag wordt gesteld.

  • Sommige modellen (zoals Llama-3) hebben een kwetsbaar punt dat we kunnen vinden en repareren.
  • Andere modellen (zoals Mistral en Qwen) hebben een fundamenteel gebrek aan robuustheid dat veel moeilijker op te lossen is.

Het is een waarschuwing: we moeten niet blindelings vertrouwen op de hoge scores van AI. We moeten begrijpen hoe ze denken, zodat we weten wanneer ze in de war raken door een simpele naamverandering of een andere schrijfwijze van een getal.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →