← Nieuwste papers
🤖 AI

FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search

Het artikel stelt FALAT voor, een diagnostisch framework dat de fouttoerekening in LLM-agenttrajecten verbetert door het probleem te formuleren als een afhankelijkheidsgestuurde zoektocht om fout-introducerende stappen te onderscheiden van stappen die louter eerdere fouten voortplanten, waardoor het bestaande baselines overtreft in het identificeren van verantwoordelijke agenten en beslissende foutstappen.

Oorspronkelijke auteurs: Md Nakhla Rafi, Md Ahasanuzzaman, Dong Jae Kim, Zhijie Wang, Tse-Hsun Chen

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Md Nakhla Rafi, Md Ahasanuzzaman, Dong Jae Kim, Zhijie Wang, Tse-Hsun Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team hebt van hoogintelligente robots die samenwerken om een complexe puzzel op te lossen, zoals het schrijven van software of het plannen van een reis. Ze praten met elkaar, gebruiken hulpmiddelen en nemen beslissingen in een lange keten van gebeurtenissen. We noemen deze keten een "traject".

Soms faalt het team. Het eindresultaat is fout. Maar omdat de keten zo lang is en de robots zo pratig zijn, is het ontzettend moeilijk om te achterhalen wie de fout heeft gemaakt en wanneer het gebeurde.

Dit is het probleem: Als Robot A een kleine fout maakt in een vroeg stadium, kan Robot B iets doen dat volkomen logisch lijkt gebaseerd op die fout. Robot C kan vervolgens weer iets doen dat ook logisch lijkt, maar eigenlijk fout is omdat het gebouwd is op de fout van Robot B. Tegen de tijd dat je bij het einde bent, is de hele boel kapot, terwijl elke stap logisch leek op het moment zelf. Het is als een spelletje "telefoontje" waarbij de boodschap vervormd raakt, maar iedereen ervan overtuigd is dat hij het correct heeft gehoord.

De Oplossing: FALAT (Het Detective-framework)

De auteurs hebben een tool ontwikkeld genaamd FALAT om als een detective te fungeren voor deze robotteams. In plaats van alleen naar de uiteindelijke puinhoop te kijken en te gokken, gebruikt FALAT een slim vierstappenproces om de bronoorzaak te vinden.

Zo werkt FALAT, met eenvoudige analogieën:

1. Het "Ideale Script" (Het construeren van de zoekruimte)

Voordat FALAT naar de rommelige realiteit kijkt, schrijft het een "Ideaal Script" van hoe de taak had moeten verlopen. Het kent het doel, de regels en wat een goede robot zou doen.

  • Analogie: Stel je een filmregisseur voor die precies weet hoe de filmscène zou moeten uitspelen. Wanneer de acteurs de mist in gaan, kijkt de regisseur niet alleen naar de chaos; ze vergelijkt de werkelijke opname met het script om te zien waar de acteurs van het pad zijn afgeweken.
  • Waarom het belangrijk is: Als je alleen naar de eigen redenering van de robots kijkt, kun je misleid worden omdat ze allemaal dezelfde fout rationaliseren. FALAT gebruikt een extern perspectief (het script) om objectief te blijven.

2. De "Zoomlens" (Hiërarchische representatie)

De geschiedenis van de robot kan honderden stappen lang zijn. Het lezen van elk woord is traag en verwarrend. FALAT zoomt eerst uit en zoomt dan pas in.

  • Analogie: Denk aan het kijken naar een bos. Eerst kijk je naar het hele bos vanuit een helikopter om te zien welk gebied er ziek uitziet (Hoog niveau). Daarna zoom je in om te zien welke groep bomen wordt aangetast (Midden niveau). Ten slotte loop je erheen om de specifieke bladeren op de grond te inspecteren (Laag niveau).
  • Waarom het belangrijk is: Dit voorkomt dat FALAT verdwaalt in de details. Het verkleint de zoektocht eerst tot de verdachte "buurten".

3. De "Ketting van Bewaring" (Getypeerde afhankelijkheden)

Dit is het belangrijkste onderdeel. FALAT wijst niet simpelweg de laatste persoon die sprak de schuld toe. Het spoort de afhankelijkheden op (wie vertrouwde op wie).

  • Analogie: Stel je een estafette voor waarbij iemand de stok laat vallen.
    • De Bron: De hardloper die hem liet vallen.
    • De Verspreider: De volgende hardloper die de stok oppakte en verder rende, ook al was deze gebroken.
    • Het Symptoom: De hardloper bij de finishlijn die te laat over de streep kwam.
    • FALAT gebruikt speciale labels (zoals "vervolgstap", "correctie" of "doodlopend") om onderscheid te maken tussen de persoon die de stok liet vallen en de mensen die de gebroken stok alleen maar meedroegen. Het negeert de mensen die alleen maar herhaalden wat er al gezegd was of die het eindresultaat niet echt beïnvloedden.

4. De "Wat als"-test (Verificatie)

Zodra FALAT een verdachte heeft, arresteert het deze niet zomaar. Het voert een simulatie uit.

  • Analogie: De detective vraagt: "Als we in het verleden terug zouden gaan en alleen deze ene stap zouden repareren, zou de hele film dan goed aflopen?"
    • Als het repareren van Stap 3 het eindresultaat perfect maakt, dan is Stap 3 de Beslissende Stap.
    • Als het repareren van Stap 3 de film nog steeds laat mislukken, dan was Stap 3 niet de echte boosdoener; de fout gebeurde eerder.

Werkt het?

De auteurs hebben FALAT getest op een benchmark genaamd "Who & When", die veel voorbeelden bevat van falende robotteams.

  • Het Resultaat: FALAT was veel beter in het vinden van de exacte stap waar de fout begon vergeleken met andere methoden.
  • De Cijfers: Op lastige, handmatig gemaakte mislukkingsverhalen vond FALAT de juiste stap ongeveer 29% van de tijd, terwijl de op één na beste methode slechts ongeveer 17% haalde. Op eenvoudigere, door computers gegenereerde verhalen had het een score van 46%.
  • De Conclusie: Hoewel 29% laag klinkt, is dit in dit vakgebied van "een naald in een hooiberg zoeken" een enorme verbetering. Het bewijst dat je niet simpelweg een slimme AI kunt vragen om te "raden" wie de fout heeft gemaakt; je hebt een gestructureerde manier nodig om afhankelijkheden te traceren en "wat als"-scenario's te testen.

Samenvatting

FALAT is een diagnostisch hulpmiddel dat stopt met het geven van de schuld aan de laatste persoon in de keten. In plaats daarvan:

  1. Weet het hoe dingen zouden moeten werken.
  2. Zoomt het in op verdachte gebieden.
  3. Sporeert het de informatiestroom op om onderscheid te maken tussen de oorspronkelijke fout en de gevolgen.
  4. Test het of het redden van die ene stap de dag zou redden.

Het verandert een rommelige, verwarrende mislukking in een logisch onderzoek.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →