← Nieuwste papers
🤖 machine learning

Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers

Dit artikel introduceert een machine-controleerbaar "Resume Contract" om de semantiek van workflow-persistentie formeel te definiëren en te verifiëren, waarbij wordt onthuld dat belangrijke frameworks zoals LangGraph en CrewAI kritieke eigenschappen zoals effect exactly-once en checkpoint-geldigheid schenden, terwijl een geverifieerde referentie-implementatie (REMIT) wordt voorgesteld en gevalideerd die conformiteit garandeert door middel van een nieuwe cross-process consumptiepoort.

Oorspronkelijke auteurs: Sajjad Khan

Gepubliceerd 2026-08-05
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sajjad Khan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Digitale Amnesie van AI-agenten

Stel je voor dat je een robot bouwt die complexe taken kan uitvoeren, zoals het plannen van een reis of het schrijven van een verhaal. Soms moet deze robot pauzeren om jou een vraag te stellen, zoals: "Moet ik de vlucht boeken?" of "Vind je deze plotwending leuk?" Dit wordt een "interrupt" (onderbreking) genoemd. Als de robot crasht, de stroom verliest of wordt onderbroken, moet hij een manier hebben om zich precies te herinneren waar hij gebleven was, zodat hij precies kan hervatten waar hij gestopt was. Dit wordt "persistence" (persistentie) genoemd.

In de wereld van de informatica, specifelijk in het vakgebied van AI-workflows, is er een groeiend probleem. We hebben veel verschillende "robotbreinen" (frameworks) gebouwd die kunnen pauzeren en hervatten. Echter, deze robots zijn slecht in het onthouden van wat ze al hebben gedaan. Als een robot een taak voltooit, zijn voortgang opslaat en vervolgens opnieuw opstart, zou een goed functionerende robot moeten zeggen: "Dat heb ik al gedaan, laten we verdergaan." Maar een verwarde robot kan zeggen: "Ik weet niet meer dat ik dit gedaan heb!" en de taak opnieuw uitvoeren. Als die taak het versturen van een e-mail of het afrekenen met een creditcard was, is het twee keer uitvoeren ervan een ramp. Dit artikel onderzoekt of onze huidige AI-robots daadwerkelijk verward zijn, of dat ze alleen maar doen alsof ze slim zijn.


De Grote "Resume" Verwarring

Dit artikel is als een detectiveverhaal, maar in plaats van een moord op te lossen, lost de auteur, Sajjad Khan, een mysterie van digitale amnesie op. Het mysterie is: Wanneer een AI-agent pauzeert en dan hervat, herinnert hij zich dan wat hij al heeft gedaan, of doet hij het per ongeluk opnieuw?

De auteur ontdekte dat de vijf meest populaire AI-frameworks die er nu zijn, allemaal volgens verschillende, tegenstrijdige regelboeken spelen. Het is alsof je vijf verschillende videogames hebt, en in de ene zorgt het indrukken van "Continue" ervoor dat je het level dat je net hebt uitgespeeld overslaat, terwijl het in een andere dwingt je om de baas opnieuw te bevechten. Erger nog, sommige van deze games vertellen je niet eens welke regel ze gebruiken.

De Zes Regels van een Goede Resume

Om uit te zoeken wie eerlijk speelt, heeft de auteur een "Resume Contract" uitgevonden. Beschouw dit als een regelboek voor hoe een robot zich moet gedragen wanneer hij wakker wordt uit een dutje. Het contract heeft zes hoofdregels:

  1. Prefix Continuation: Wanneer je wakker wordt, moet je precies beginnen waar je gebleven was, niet vanaf het begin van de film.
  2. Effect Exactly-Once: Als je al een e-mail hebt verzonden of een kaart hebt afgerekend, mag je dat nooit meer doen. Slechts één keer.
  3. Fork Determinism: Als je besluit je pad te splitsen (zoals kiezen tussen "Ga Links" versus "Ga Rechts"), moet de robot onthouden welke weg je hebt gekozen. Als je twee keer "Links" zegt, mag hij niet doen alsof je de tweede keer "Rechts" zei.
  4. Checkpoint Validity: Het geheugenlogboek van de robot moet schoon zijn. Hij mag geen "rommel" of defecte gegevens opslaan die hem later laten crashen.
  5. Consume-Once: Als een mens een antwoord geeft (zoals "Ja, boek de vlucht"), moet de robot dat antwoord slechts één keer gebruiken. Hij mag datzelfde "Ja" niet per ongeluk gebruiken om twee vluchten te boeken.
  6. Recovery Determinism: Als twee robots wakker worden met exact hetzelfde geheugenlogboek, moeten zij exact dezelfde beslissingen nemen.

Het Onderzoek: Wie Faalde?

De auteur bouwde een superprecieze, robotvrije testmachine (een "harness") om vijf populaire AI-frameworks te testen. Er waren geen menselijke hersenen of AI-modellen bij de test betrokken, alleen pure code. De resultages waren schokkend: Geen twee frameworks gedroegen zich op dezelfde manier.

  • LangGraph: Dit framework is als een robot die zijn eigen huiswerk vergeet. Wanneer het crasht en herstart, doet het werk opnieuw dat het al had voltooid (schending van "Effect Exactly-Once"). Het heeft ook een glitch waarbij, als je van gedachten verandert (een "fork"), het je nieuwe keuze negeert en de oude herhaalt.
  • CrewAI: Deze is nog chaotischer. Het beweert voltooid werk over te slaan, maar wanneer het herstart, voert het alles toch weer opnieuw uit. Het is als een chef die zegt: "Ik heb de uien al gesneden," maar ze dan toch opnieuw snijdt, waardoor tijd en ingrediënten verspild worden.
  • LlamaIndex Workflows: Dit framework is eerlijk over zijn verwarring. Het geeft toe: "Hé, als je pauzeert, doe ik misschien het werk opnieuw voordat de pauze plaatsvindt." Het is geen bug, maar een gedocumenteerde feature, maar het is nog steeds riskant voor zaken zoals betalingen.
  • pydantic-graph: Deze robot is zo fragiel dat als hij halverwege een taak crasht, hij weigert überhaupt wakker te worden. Het is als een auto die niet start als je de motor uitzet terwijl hij in de versnelling staat.
  • AutoGen: Dit is de enige die luidkeels zegt: "Hé, je probeerde een kapot save-bestand te laden!" en weigert te draaien. Het is de strenge leraar die je niet langs de validatiecontroles laat komen.

De "Dubbele Boeking" Ramp

Een van de gevaarlijkste bevindingen ging over Consume-Once. Stel je een "parkeerplaats" voor waar een mens een antwoord geeft. Als twee mensen tegelijkertijd proberen een antwoord te geven (gelijktijdig/concurrent), laten de huidige systemen beiden op die plek parkeren. De robot denkt dan dat hij twee antwoorden heeft ontvangen en voert de taak twee keer uit.
De auteur testte dit met 16 "racers" die tegelijkertijd probeerden te antwoorden. In 36 van de 40 tests faalde het systeem volledig, waardoor alle 16 racers de actie triggerden. Het is als een ticketautomaat waar 16 mensen tegelijkertijd een ticket kopen, en het systeem laat ze allemaal binnen.

Het Bewijs en de Oplossing

De auteur gokte niet alleen; hij gebruikte een wiskundig hulpmiddel genaamd TLA+ om miljoenen scenario's te simuleren en te bewijzen dat deze fouten echt waren en niet slechts pech. Hij gebruikte ook een formele verificatietool genaamd Verus om een "perfecte" robotmotor genaamd REMIT te bouwen.

REMIT is een referentie-engine die de regels perfect volgt. Het lost het "fork"-probleem op door precies te onthouden welke weg je hebt gekozen, en het lost het "double-booking"-probleem op door het antwoord te vergrendelen zodat slechts één persoon het kan geven. De auteur liet zien dat wanneer je REMIT gebruikt, de robot correct handelt, zelfs wanneer 64 verschillende threads tegelijkertijd met hem communiceren.

De Les

De grote les hier is dat alleen omdat een AI-framework beweert dat het "checkpointing" heeft (het vermogen om op te slaan en te hervatten), het nog niet betekent dat het veilig is om te gebruiken voor belangrijke zaken zoals geld of het versturen van berichten. Momenteel is de "resume"-knop op veel AI-tools kapot op manieren die dubbele afschrijvingen of gegevensverlies kunnen veroorzaken.

Het artikel bewijst dat we een standaard regelboek nodig hebben (het Resume Contract) zodat ontwikkelaars precies weten wat hun AI zal doen wanneer hij wakker wordt. Tot die tijd, als je een AI bouwt die taken in de echte wereld uitvoert, kun je niet simpelweg vertrouwen op het framework om te onthouden wat het heeft gedaan — je moet je eigen vangnet bouwen. De auteur heeft zelfs een gratis tool (REMIT) uitgebracht die ontwikkelaars kunnen gebruiken om hun systemen te patchen en veilig te maken, waarmee bewezen wordt dat een perfect, regelvolgend resume mogelijk is, ook al doen de huidige populaire tools dat nog niet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →