← Nieuwste papers
💬 NLP

When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation

Deze empirische studie van 68 experimentele cellen over tien grote taalmodellen toont aan dat betekenisdragende verstoringen de redenering en de uiteindelijke antwoorden van agenten aanzienlijk meer verstoren dan presentatiegebonden ruis van vergelijkbare ernst, een bevinding die gevalideerd is op een apart gehouden model en wordt toegeschreven aan een "stealth-divergentie"-mechanisme waarbij semantische ruis afwijkingen veroorzaakt in tussenliggende redeneerstappen in plaats van in initiële acties.

Oorspronkelijke auteurs: Liyun Zhang, Jiayi Guo

Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Liyun Zhang, Jiayi Guo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, prestatiegerichte student (een AI-agent) hebt die complexe wiskundige en logische problemen oplost door hardop met zichzelf te praten. Deze student schrijft elke stap van hun denkproces op voordat ze het definitieve antwoord geven. Dit wordt "Chain of Thought" (denkketen) genoemd.

De onderzoekers in dit artikel wilden weten: Maakt het uit hoe je de student een vraag stelt?

Specifiek testten ze twee soorten "ruis" of wijzigingen aan de vraag:

  1. De "Betekenis"-wijziging: De vraag herschrijven met synoniemen of parafraseren (bijvoorbeeld "Hoeveel appels?" veranderen in "Wat is het totale aantal fruit?"). De betekenis blijft hetzelfde, maar de woorden zijn anders.
  2. De "Presentatie"-wijziging: De volgorde van woorden door elkaar halen, het lettertype veranderen, willekeurige afleidende zinnen toevoegen, of de opmaak verstoren. De betekenis blijft hetzelfde, maar de uitstraling is anders.

De Grote Ontdekking: De "Stille Corruptie"

De onderzoekers vonden een verrassende kloof. Wanneer ze de woorden veranderden (Betekenis-wijziging), was de student veel waarschijnlijker om aan het einde het verkeerde antwoord te geven, zelfs al betekende de vraag hetzelfde. Wanneer ze alleen het formaat veranderden (Presentatie-wijziging), was de student veel waarschijnlijker om het goed te doen.

Het is alsof de student zeer gevoelig is voor wat je zegt, maar niet zo gevoelig voor hoe je het zegt.

Hoe Ze Het Testten

Ze deden niet zomaar een gok; ze voerden een enorm experiment uit:

  • De Klas: Ze gebruikten 10 verschillende "studenten" (AI-modellen) uit 7 verschillende families (zoals Llama, Qwen, Mistral, enz.).
  • De Huiswerkopdracht: Ze gaven hen 3 verschillende soorten toetsen (Wiskunde, Logica en Lezen en Begrijpen).
  • Het Volume: Ze namen 1.530 oorspronkelijke vragen en creëerden ongeveer 11.000 variaties daarvan.
  • De Stress-test: Ze zorgden ervoor dat de "Betekenis"-wijzigingen en "Presentatie"-wijzigingen even moeilijk waren om mee om te gaan (zodat ze ze eerlijk konden vergelijken).

Het Resultaat: Gemiddeld veroorzaakten de "Betekenis"-wijzigingen dat de AI 20% vaker faalde dan de "Presentatie"-wijzigingen. Dit gebeurde in 64 van de 68 verschillende testsituaties.

Het Mysterie van de "Stille Divergentie"

Hier komt het meest interessante deel. De onderzoekers keken naar de stap-voor-stap notities van de student (de "trace") om te zien wanneer de fout gebeurde.

Ze verwachtten dat als je de betekenis van de vraag veranderde, de student direct in de war zou raken en direct zou beginnen met het schrijven van onzin.

  • Wat ze in plaats daarvan vonden: De student begon correct! De allereerste stap van hun denken was identiek voor beide soorten wijzigingen.
  • De Twist: Vanaf Stap 2 begonnen de interne gedachten van de student uit elkaar te drijven. De "Betekenis"-wijzigingen veroorzaakten een "stille corruptie". De student bleef schrijven, maar hun interne logica werd langzaam verward, wat leidde tot een verkeerd antwoord aan het einde.
  • De Metafoor: Stel je twee auto's voor die dezelfde weg afleggen.
    • Presentatieruis: De verkeersborden staan ondersteboven of de verf schilfert af. De bestuurder merkt het direct op, stopt en corrigeert hun koers.
    • Betekenisruis: De verkeersborden zien er perfect uit, maar de kaart in het hoofd van de bestuurder heeft een klein, onzichtbaar vlekje. De bestuurder begint prima te rijden, maar bij de tweede bocht gaan ze subtiel de verkeerde kant op, en aan het einde zijn ze verdwaald. Ze beseften nooit dat ze van koers waren geraakt totdat het te laat was.

Wat Ze Niet Vonden (De Terugtrekkingen)

Wetenschap gaat over eerlijkheid, en de auteurs gaven toe dat ze het bij twee dingen die ze dachten te weten, mis hadden:

  1. Ze dachten dat de "Betekenis"-wijzigingen de student sneller in de war zouden brengen (bij Stap 1). Ze hadden het mis; de verwarring begon bij Stap 2.
  2. Ze dachten dat de student minder vaak zou proberen hun eigen fouten te "repareren" bij "Betekenis"-wijzigingen. Ze hadden het mis; het reparatiepercentage was hetzelfde.

Ze ontdekten ook dat deze kloof tussen "Betekenis versus Presentatie" niet voor elke AI hetzelfde is. Als je de tool verwisselt die wordt gebruikt om de vragen te genereren, verandert de rangschikking van welke AI "gevoeligst" is. Je kunt dus niet zeggen "AI-model X is altijd 20% slechter dan Model Y" zonder precies te weten hoe de test was opgezet.

De Conclusie

Dit artikel is een meetstudie. Het bewijst dat AI-agenten verrassend breekbaar zijn wanneer je een vraag parafraseert, zelfs als de betekenis hetzelfde blijft. Ze breken niet direct; ze breken langzaam en stil, beginnend bij de tweede stap van hun denkproces.

De auteurs hebben al hun data en tools vrijgegeven zodat andere onderzoekers hun werk kunnen controleren, maar ze waarschuwen dat dit een diagnosehulpmiddel is voor onderzoekers, nog geen magische schakelaar om AI in de echte wereld te repareren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →