← Nieuwste papers
💬 NLP

How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

Dit artikel identificeert en karakteriseert twee onderscheidende token-niveau redeneerfoutmodi in taalmodellen—committed failure, gekenmerkt door vroege padvergrendeling, en persistent onzekerheid, gekenmerkt door accumulerende twijfel—en demonstreert dat deze signaturen reproduceerbaar zijn over diverse configuraties en de optimalisatie van detectiestrategieën voor fouten, zoals self-consistency, kunnen sturen.

Oorspronkelijke auteurs: Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer

Gepubliceerd 2026-06-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective een mysterie ziet oplossen. Soms maakt de detective vroeg in het proces een fout, zet hij vast op de verkeerde verdachte, en brengt hij de rest van de film door met vol vertrouwen te beargumenteren waarom die verdachte schuldig is, ook al is hij onschuldig. Andere keren is de detective de hele tijd echt in de war, bladert hij door aanwijzingen en is hij onzeker over het antwoord tot het allerlaatste moment.

Dit artikel gaat over het uitzoeken welk soort fout een Large Language Model (LLM) maakt door simpelweg te kijken naar hoe het "denkt" (de chain of thought) terwijl het zijn antwoord schrijft. De onderzoekers ontdekten dat modellen niet op slechts één manier falen; ze falen in twee verschillende patronen, en het herkennen van het patroon bepaalt hoe we de fout moeten proberen te vangen.

Hier is een uitsplitsing van hun bevindingen met behulp van eenvoudige analogieën:

1. De twee soorten fouten

De onderzoekers ontdekten dat wanneer een model een fout maakt, dit meestal op twee manieren gebeurt:

Type A: De "Vroege Toezegging" (De Koppige Detective)

  • Wat er gebeurt: Het model kiest heel vroeg in zijn redenering een foutief pad. Zodra het dat pad heeft gekozen, zit het "vast". Het stopt met het verkennen van andere mogelijkheden en blijft simpelweg meer zinnen schrijven om dat foute idee te ondersteunen.
  • Het kenmerk: Als je kijkt naar de "onzekerheid" (hoe onzeker het model zich voelt) terwijl het schrijft, zie je een piek in het begin, waarna deze daalt. Het model wordt te snel te zelfverzekerd.
  • De les: Je hoeft niet te wachten tot het hele verhaal af is om te weten dat het fout is. Sterker nog, het lezen van het einde van het verhaal kan je zelfs in de war brengen, omdat het model zo zelfverzekerd is over zijn foute antwoord dat het er goed uitziet. Het beste moment om deze fout op te merken, is direct nadat het model zijn eerste grote fout maakt.

Type B: "Aanhoudende Onzekerheid" (De Verwarde Detective)

  • Wat er gebeurt: Het model kiest nooit echt een kant. Het dwaalt door de redenering en is de hele tijd onzeker over het antwoord. Het blijft van gedachten veranderen of twijfelen tot het allerlaatste woord.
  • Het kenmerk: De onzekerheid van het model blijft hoog of bouwt langzaam op van begin tot eind. Het legt zich nooit vast op één enkel pad.
  • De les: Je moet het hele verhaal lezen om te weten of het is misgegaan. Als je halverwege stopt, denk je misschien dat het gewoon voorzichtig is. De fout wordt pas duidelijk wanneer je het hele rommelige spoor van gedachten ziet.

2. Hoe ze dit ontdekten (De "Onzekerheidsmeter")

De onderzoekers hadden geen toegang nodig tot de binnenkant van het brein van het model (wat voor veel populaire AI-modellen onmogelijk is). In plaats daarvan keken ze naar de log probabilities — een technische manier om te zeggen: "hoe zeker het model was over elk woord dat het typde."

Ze beschouwden de redenering van het model als een film. Ze volgden de "onzekerheidsmeter" terwijl de meter omhoog en omlaag tikte terwijl het model woord voor woord typte.

  • Voor Type A toonde de meter een duidelijke piek in het begin, waarna deze afvlakte.
  • Voor Type B bleef de meter stijgen of bleef deze hoog tot het einde.

Ze testten dit op 23 verschillende combinaties van AI-modellen en taken (zoals wiskunde, programmeren en wetenschap). In 20 van de 23 gevallen hield hun theorie perfect stand. Ze konden het verschil zien tussen een "koppige" fout en een "verwarde" fout, enkel door naar deze patronen te kijken.

3. Waarom dit ertoe doet: De "Tweede Mening"-strategie

Het paper onderzocht ook een veelgebruikte truc genaamd Self-Consistency. Dit houdt in dat je dezelfde vraag 10 keer aan de AI stelt en het antwoord neemt dat het vaakst voorkomt.

  • Voor het "Koppige" Model (Type A): Het 10 keer stellen van dezelfde vraag is nutteloos. Als het model koppig is, zal het 10 keer achter elkaar hetzelfde foute antwoord geven. De "meerderheidsstem" zal het foute antwoord alleen maar bevestigen. In dit geval is het kijken naar de onzekerheid van een enkel antwoord eigenlijk beter dan het meerdere malen vragen.
  • Voor het "Verwarde" Model (Type B): Het 10 keer stellen van de vraag is zeer nuttig. Omdat het model echt onzeker is, zal het elke keer andere antwoorden geven. Het feit dat het het niet met zichzelf eens kan worden, is een enorme rode vlag.

De Kernboodschap

Het paper betoogt dat we geen "one-size-fits-all" benadering moeten gebruiken om AI-fouten te vangen.

  • Als de AI vroeg in een fout idee vastloopt, moeten we het snel onderscheppen door naar de betrouwbaarheidsniveaus in een vroeg stadium te kijken, en moeten we niet de moeite nemen om om een tweede mening te vragen (omdat het de fout gewoon zal herhalen).
  • Als de AI echt in de war is, moeten we het zijn denkproces laten voltooien en dan om meerdere meningen vragen om te zien of het met zichzelf tot overeenstemming kan komen.

Door te begrijpen hoe de AI faalt, kunnen we de juiste tool kiezen om de fout te vangen, wat tijd bespaart en de betrouwbaarheid verbetert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →