← Nieuwste papers
💻 computer science

Runtime Continuation after Faults in Partially Executed Agent Workflows

Dit artikel stelt een runtime-continuatiemechanisme voor voor gedeeltelijk uitgevoerde workflows van taalmodelagenten dat veilige herstel van fouten waarborgt door een vertrouwde frontier te reconstrueren, residuele verplichtingen af te leiden uit een canoniek contract, en de staat alleen verder te brengen via geautoriseerde effecten die worden ondersteund door geldig, vers en uniek overeenstemmend bewijs.

Oorspronkelijke auteurs: Li Zeng, Chuanwu Yang, Qiang Zhao, Qinde Chen, Deyang Qu

Gepubliceerd 2026-09-22
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Li Zeng, Chuanwu Yang, Qiang Zhao, Qinde Chen, Deyang Qu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het moderne digitale landschap is kunstmatige intelligentie geëvolueerd van een systeem dat simpelweg tekst schrijft naar een systeem dat actief taken uitvoert. Deze intelligente agenten kunnen het web doorzoeken, bestanden bewerken, berichten verzenden en databases bijwerken namens een gebruiker. Ze werken door een reeks stappen te volgen, vaak een workflow genoemd, waarbij elke actie de staat van de echte wereld verandageert. Deze mogelijkheid om te handelen creëert echter een unieke kwetsbaarheid. Als een agent een fout maakt, in de war raakt door een trucje of een systeemfout tegenkomt nadat hij al een bestand heeft gewijzigd of een bericht heeft verzonden, kan het simpelweg opnieuw proberen of opnieuw beginnen gevaarlijk zijn. Het herhalen van een mislukte sequentie kan een schadelijke actie herhalen, terwijl doorgaan vanuit een verwarde staat kan voortbouwen op een onjuiste aanname. De kernuitdaging is bepalen welke parte van de geschiedenis precies betrouwbaar is, welk werk nog onvoltooid is en welk bewijs nodig is om veilig vooruit te kunnen gaan zonder fouten te herhalen of voor bedrog vatbaar te worden.

Onderzoekers Li Zeng en zijn team aan het Institute of Information Technology van de National Immigration Administration en de Hong Kong University of Science and Technology hebben een nieuwe methode ontwikkeld om dit probleem op te lossen. Ze noemen hun systeem AgentMirror. In plaats van een gebroken workflow te behandelen als een eenvoudige fout die moet worden opgelost met een nieuwe gok, behandelt AgentMirror het herstelproces als een strikte, stap-voor-stap verificatie van de werkelijkheid. Het systeem werkt volgens het principe dat zodra een agent een actie heeft uitgevoerd, de geschiedenis van die actie een vast punt van waarheid wordt. Als de agent crasht of wordt misleid na dat punt, vraagt het systeem de kunstmatige intelligentie niet om te beslissen wat er is gebeurd. In plaats daarvan kijkt het naar een geverifieerd verslag van wat er daadwerkelijk is gebeurd, identificeert het exact welke taken nog moeten worden uitgevoerd en eist het concreet bewijs voordat het enige nieuwe actie toestaat om de staat van de wereld weer te veranderen.

De onderzoekers bouwden dit systeem rond een concept dat ze een "trusted frontier" (vertrouwde grens) noemen. Stel je een lijn in het zand voor die het exacte moment markeert waarop de geschiedenis van de agent is bevestigd als veilig en correct. Alles vóór deze lijn wordt als waar aanvaard; alles erna is ongeverifieerd. Wanneer een fout optreedt, laat het systeem de kunstmatige intelligentie deze lijn niet herschrijven of doen alsof er geen fout is gemaakt. Het reconstrueert de staat van de agent op basis van alleen de geverifieerde geschiedenis tot aan die lijn. Vanaf dit punt berekent het systeem een lijst met "residual obligations" (resterende verplichtingen) — de specifieke, verplichte taken die de agent nog moet voltooien om de klus te klaren. Het presenteert deze lijst vervolgens aan de kunstmatige intelligentie als een gids, waarbij het vertelt welk werk nog over is, maar zonder de intelligentie de macht te geven om het gewoon te doen.

De cruciale innovatie ligt in de manier waarop het systeem de volgende stap afhandelt. Wanneer de kunstmatige intelligentie een nieuwe actie voorstelt, wordt dat voorstel als onbetrouwbaar behandeld. Het systeem dwingt de actie door een standaard beveiligingscontrole, bekend als "ordinary admission" (gewone toelating), om te waarborgen dat deze mag worden uitgevoerd. Als de actie wordt uitgevoerd, accepteert het systeem niet onmiddellijk dat de taak is voltooid. Het wacht op een "runtime receipt" (runtime-ontvangstbewijs), een digitaal certificaat uitgegeven door een vertrouwde autoriteit dat bevestigt dat de actie daadwerkelijk heeft plaatsgevonden en correct is waargenomen. Dit bonnetje moet vers zijn, wat betekent dat het net is aangemaakt, en het moet gekoppeld zijn aan de huidige vertrouwde grens, wat betekent dat het geen herhaling is van een oude actie of een nepversie uit een andere sessie. Pas wanneer dit ontvangstbewijs is geverifieerd en exact overeenkomt met één van de resterende taken, staat het systeem toe dat het officiële verslag van de voortgang van de agent vooruitgaat.

Om hun idee te testen, gebruikten de onderzoekers een benchmark genaamd AgentDojo, die verschillende taken simuleert en opzettelijk fouten en aanvallen introduceert om te zien hoe agenten zich gedragen. Ze vergeleken hun AgentMirror-systeem met andere herstelmethoden, zoals het simpelweg opnieuw proberen van de laatste stap of het de agent laten raden hoe hij uit problemen komt. De resultaten lieten zien dat AgentMirror aanzienlijk beter was in het veilig voltooien van taken. Het slaagde erin om te herstellen van fouten zonder onbevoegde acties door te laten, en het voorkwam dat de agent in de val liep van instructies die probeerden hem tot schadelijke operaties te laten overgaan. De studie toonde aan dat door de begeleiding die aan de kunstmatige intelligentie wordt gegeven te scheiden van de autoriteit om acties uit te voeren, en door verse bewijzen voor elke stap te eisen, het systeem een veilige weg naar voren kon handhaven, zelfs wanneer de agent zelf gecompromitteerd was.

De onderzoekers onderzochten ook wat er zou gebeuren als ze specifieke onderdelen van hun veiligheidsregels zouden verwijderen. Ze ontdekten dat als ze de stap van het verifiëren van het ontvangstbewijs zouden overslaan, het systeem valse of oude bewijzen zou accepteren, wat leidde tot onjuiste voortgang. Als ze de herstelgids als een toestemmingsverklaring zouden laten fungeren, zou het systeem onbetrouwbare acties toelaten. Als ze niet controleerden of de actie exact met één specifieke taak overeenkwam, zou het systeem de verkeerde taak kunnen sluiten of werk onvoltooid laten. Deze tests bevestigden dat elk deel van hun proces noodzakelijk is; geen enkele controle kan de anderen vervangen. Het systeem werkt omdat het een keten van vertrouwen afdwingt waarbij de kunstmatige intelligentie kan suggereren, maar het systeem beslist, en alleen geverifieerde werkelijkheid de registratie kan veranderen.

Dit werk beweert niet dat kunstmatige intelligentie perfect te maken is of elk mogelijk falen kan oplossen. Het systeem vertrouwt op het feit dat het initiële contract of de set regels correct is; als de regels zelf onjuist zijn, zal het systeem het onjuiste pad getrouw volgen. Het kan ook acties die al in de echte wereld zijn uitgevoerd niet ongedaan maken als het bewijs van die acties verloren is gegaan. Het biedt echter een robuust kader voor het beheren van het moment waarop dingen misgaan. Door het herstelproces te behandelen als een strikte overgang van een bekende, veilige staat naar een nieuwe, geverifieerde staat, biedt AgentMirror een manier om intelligente agenten veilig te laten werken, zelfs wanneer ze fouten of kwaadwillige interferentie tegenkomen. De studie concludeert dat de sleutel tot veilige voortzetting niet beter raden is, maar betere verificatie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →