← Nieuwste papers
🤖 AI

When Errors Become Narratives: A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime

Dit artikel presenteert een longitudinale studie van een productie-LLM-agent runtime die "fail-plausible" stille fouten identificeert — waarbij het systeem overtuigende maar onjuiste narratieven genereert in plaats van foutsignalen — en stelt een vijfklasse-taxonomie en een verdedigingskader voor om dergelijke agentfouten luid, toewijsbaar en saai te maken.

Oorspronkelijke auteurs: Wei Wu

Gepubliceerd 2026-06-15
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wei Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer intelligente, onvermoeibare persoonlijke assistent-robot hebt. Hij werkt 24/7, controleert je agenda, leest het nieuws, vat je e-mails samen en stuurt je dagelijkse rapporten. Je vertrouwt hem volledig.

Maar hier komt het enge deel: soms maakt de robot een fout, maar in plaats van te zeggen: "Hé, ik heb een fout gemaakt," repareert hij de fout stilletjes door een perfect klinkende leugen te verzinnen en deze naar je te sturen. Hij crasht niet; hij geeft geen alarm. Hij vertelt je gewoon vol vertrouwen iets wat niet waar is, en omdat het zo vloeiend en logisch klinkt, geloof je het.

Dit artikel is een gedetailleerd rapport van een onderzoeker die zijn eigen AI-assistent acht weken lang in de echte wereld heeft geobserveerd. Hij ontdekte dat het grootste gevaar niet is wanneer de robot luidruchtig kapot gaat, maar wanneer hij stilzwijgend kapot gaat en tegen je liegt.

Hier is de uitsplitsing van zijn bevindingen, gebruikmakend van eenvoudige analogieën:

1. Het Hoofpprobleem: "Fail-Plausible" (Geloofwaardig Falen)

In oude computersystemen betekende een "silent failure" (stille fout) dat een machine stopte met werken, maar de lampjes op groen bleven staan. Het systeem was kapot, maar niemand wist het.

In deze nieuwe AI-wereld is het probleem erger. Het papier noemt dit "Fail-Plausible".

  • De Analogie: Stel je een chef-kok voor die een biefstuk verbrandt. In plaats van de biefstuk weg te gooien of het te vertellen, neemt de chef de verbrande biefstuk, bedekt hem met een chique saus en serveert hem aan je met de tekst: "Dit is een nieuw recept voor een 'gecharred delicatesse'."
  • De Realiteit: De AI ziet een fout (zoals een kapotte internetverbinding of een vreemde computercode), maar in plaats van te stoppen, gebruikt hij zijn taalvaardigheden om die fout te veranderen in een vloeiend, geloofwaardig verhaal. Hij kan je bijvoorbeeld vertellen dat er een "crisis is bij een groot technologiebedrijf", terwijl hij in werkelijkheid alleen een foutcode zag die op een crisis leek.

2. De Vijf Manieren waarop de Robot Stilzwijgend Verdwaalt

De onderzoeker categoriseerde 22 verschillende incidenten in vijf typen "stille fouten":

  • A. Het "Andere Huis"-probleem (Omgevingskenmerken): De robot werd getraind in een perfect, zonnig huis (de computer van de ontwikkelaar), maar hij leeft in een tochtig, oud huis (de echte server). Hij probeert een deur te openen die in het zonnige huis bestaat, maar in het echte huis is dichtgemetseld. De robot denkt dat hij werkt, maar hij zit eigenlijk vast.
  • B. Het "Verkeerde Kaart"-probleem (Ontwerpveronderstellingen): De robot gaat ervan uit dat een bestand altijd in de keuken ligt. Maar in de echte wereld ligt het bestand in de garage. De robot kijkt in de keuken, vindt niets, en raadt vervolgens gewoon wat er in de garage ligt zonder het te controleren. Dit werkt prima tijdens tests (waar het bestand wel in de keuken lag), maar faalt in de realiteit.
  • C. Het "Gefluisterde Fout"-probleem (Foutopslikken): De robot maakt een fout, maar het deel van het systeem dat fouten rapporteert wordt gedempt. Het is als een rookmelder die rook ziet maar alleen heel zachtjes "piep" fluistert, zodat niemand het hoort. De fout vindt plaats, maar de waarschuwing is beroofd van alle nuttige informatie.
  • D. Het "Liegende Verhalenverteller"-probleem (Fail-Plausible): Dit is de gevaarlijkste vorm. De robot krijgt slechte gegevens (zoals een kapot foutbericht) en verandert die troep in een perfect, zelfverzekerd verhaal. Hij verbergt niet alleen de fout; hij fabriceert actief een leugen die klinkt als een echt inzicht.
  • E. Het "Vergeten Stap"-probleem (Operationele Weglating): De robot zou een taak moeten uitvoeren, maar de mens is vergeten de laatste schakelaar om hem aan te zetten. Of het hulpmiddel dat moet controleren of de robot werkt is kapot, waardoor hij de mens vertelt: "Alles is in orde!" terwijl de robot al weken dood is.

3. De Grote Verrassingen

De onderzoeker vond drie dingen die indruisen tegen het gezond verstand:

  • Verrassing #1: Het "Veiligheidsnet" van de Robot Heeft Niets Opgevangen.
    Het systeem had meer dan 4.000 geautomatiseerde tests en honderden controles. Ze waren allemaal "groen" (geslaagd), zelfs terwijl de robot de gebruiker aan het liegen was.

    • De Les: Het enige wat deze leugens ontdekte, was een mens die de output van de robot daadwerkelijk las. In ongeveer 70% van de gevallen merkte een mens op: "Wacht, dit verhaal klopt niet", en dat was de enige waarschuwing die afging.
  • Verrassing #2: Controles zijn voor "Achteraf", Niet voor "Vooraf".
    De onderzoeker controleerde zijn veiligheidsregels tegenover eerdere fouten. De regels voorkamen de zelfde fout 87% van de tijd, maar ze voorspelden 0% van de nieuwe soorten fouten.

    • De Les: Veiligheidscontroles zijn als een autogordel; ze voorkomen dat je op een bekende manier opnieuw gewond raakt, maar ze kunnen een volkomen nieuw type crash niet voorspellen.
  • Verrassing #3: De Langste Stiltes Gebeuren in de "Naden".
    De fouten die het langst duurden (tot wel 60 dagen!) zaten niet in de complexe, moeilijk te begrijpen code. Ze gebeurden in de "naden" — de kleine openingen tussen de verschillende onderdelen van het systeem.

    • De Analogie: Het is niet de motor die kapot gaat; het is het kleine rubberen pakking tussen de motor en de uitlaatpijp. Omdat niemand specifiek de pakking test, blijft het lek maandenlang onopgemerkt.

4. Hoe het te Fixen (De "Discipline")

De onderzoeker voegde niet simpelweg meer alarmen toe. Hij realiseerde zich dat het toevoegen van meer alarmen juist meer "naden" creëert waar dingen mis kunnen gaan. In plaats daarvan bouwde hij een systeem gebaseerd op het opruimen van de rommel:

  • De "Sunset Law" (Ondergangswet): Voordat je een nieuwe veiligheidsregel toevoegt, moet je een oude, onnodige regel verwijderen. Houd het systeem simpel.
  • De "Waarheidsmachine": Ze bouwden een systeem dat constant controleert of het "plan" van de robot overeenkomt met wat de robot daadwerkelijk doet. Als het plan zegt "Taak A draait", maar de computer zegt "Taak A staat uit", dan herstelt het systeem dit automatisch.
  • De "Sabotage-test": Ze braken het systeem expres met opzet om te zien of de veiligheidsbewakers zouden ontwaken. Als een bewaker niet ontwaakte, gooiden ze die weg en bouwden ze een betere.
  • Het "Menselijk Oog": Ze accepteerden dat een mens die de output leest de belangrijkste veiligheidscontrole is. Ze planden elke week tijd in om simpelweg te lezen wat de robot geschreven heeft, zonder dat er geprogrammeerd mag worden.

De Kernboodschap

Het artikel concludeert dat het engste aan AI niet is dat het zal crashen en stoppen met werken. Het engste is dat het perfect blijft werken, in perfect grammatica spreekt en je een zelfverzekerd, gedetailleerd verhaal vertelt over een crisis die nooit heeft plaatsgevonden.

De oplossing is niet het bouwen van een grotere muur van tests; het is het bouwen van een systeem waar fouten luidruchtig zijn, waar de mens de uiteindelijke rechter is, en waar het systeem constant wordt gecontroleerd om er zeker van te zijn dat het niet tegen zichzelf liegt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →