← Nieuwste papers
💻 computer science

Agentproof: Static Verification of Agent Workflow Graphs

Dit paper introduceert Agentproof, een systeem dat statische verificatie mogelijk maakt voor workflowgrafieken van vier populaire agent-frameworks door structurele fouten en tijdsgebonden veiligheidsbeleid automatisch te detecteren via een uniek abstract model en een DSL-gebaseerde aanpak.

Oorspronkelijke auteurs: Melwin Xavier, Vaisakh M A, Melveena Jolly, Midhun Xavier

Gepubliceerd 2026-03-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Melwin Xavier, Vaisakh M A, Melveena Jolly, Midhun Xavier

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🚦 Agentproof: De Vliegsimulator voor AI-robots

Stel je voor dat je een team van slimme robots (AI-agenten) bouwt die taken voor je uitvoeren, zoals het beantwoorden van e-mails, het boeken van vluchten of het controleren van bankrekeningen. Deze robots zijn niet alleen slim; ze werken volgens een stroomschema (een workflow). Ze weten: "Als de klant boos is, ga naar de manager. Als de klant blij is, stuur een bedankje."

Het probleem? Soms maken de bouwers van deze robots een fout in het stroomschema. Ze vergeten een lijntje te trekken, of ze laten een pad open dat rechtstreeks naar een gevaarlijke knop leidt.

Agentproof is een nieuw systeem dat als een vliegsimulator werkt voordat de robot ooit de lucht in gaat. Het kijkt naar het stroomschema en zegt: "Hé, als deze robot deze route neemt, blijft hij vastzitten in een doodlopende straat!" of "Wacht, deze robot mag die bankrekening niet controleren zonder dat een mens eerst ja zegt."


🏗️ Hoe werkt het? (De drie stappen)

Het paper beschrijft een systeem dat drie dingen doet, net zoals een super-veiligheidscontroleur:

1. De Vertaler (Extractie)

Er zijn veel verschillende talen waarin robots hun plannen kunnen schrijven (zoals LangGraph, CrewAI, AutoGen). Agentproof is als een veeltalige tolk. Het leest het plan van de robot, ongeacht welke taal of software de bouwer heeft gebruikt, en zet het om in één standaard "blauwdruk".

  • Vergelijking: Het is alsof je een recept in Frans, Duits en Italiaans krijgt, en de tolk ze allemaal omzet naar één standaard kookboek zodat je ze kunt vergelijken.

2. De Bouwinspecteur (Structurele Checks)

Nu Agentproof de blauwdruk heeft, loopt hij er met een meetlat overheen. Hij zoekt naar zes soorten bouwfouten:

  • Doodlopende straten: Is er een punt waar de robot vastloopt en nergens meer naartoe kan? (Bijvoorbeeld: een e-mail wordt geschreven, maar er is geen knop om hem te versturen).
  • Onbereikbare doelen: Zijn er bestemmingen die de robot nooit kan bereiken?
  • De "Menselijke Controle"-check: Als de robot een gevaarlijke actie moet doen (zoals geld overmaken), is er dan een knop waar een echt mens eerst "Goedkeuren" moet klikken? Als die knop ontbreekt, slaat Agentproof alarm.

3. De Regelschepper (Tijdelijke Politie)

Soms gaat het niet om de weg, maar om de volgorde. Agentproof kan regels opstellen zoals: "Je mag pas verwijderen als je eerst gearchiveerd hebt."

  • Het systeem vertaalt deze regels naar een automatische poortwachter (een automaat). Deze poortwachter kijkt naar elke stap die de robot zet. Als de robot de verkeerde volgorde kiest, blokkeert de poort.

🕵️‍♂️ Waarom is dit zo belangrijk? (Het probleem met de huidige methoden)

Vroeger keken we pas naar fouten tijdens het werk (runtime).

  • Vergelijking: Stel je voor dat je een auto bouwt en pas test of de remmen werken als je al met 100 km/uur de weg oprijdt. Als de remmen stuk zijn, is het al te laat.

Agentproof doet het voordat de robot start (static verification).

  • Vergelijking: Het is als het testen van de auto in een gesloten testbaan voordat hij de weg op gaat. Je ziet direct: "Oh, deze remleiding loopt dood." Je hoeft niet te wachten tot een ongeluk gebeurt.

Het grote voordeel:
Veel fouten in robot-plannen zijn "onzichtbaar" totdat ze gebeuren. Als een robot een pad neemt dat zelden wordt gebruikt (bijvoorbeeld: "Als de klant een rare vraag stelt, ga dan naar een gevaarlijke knop"), dan ziet een menselijke tester dat misschien nooit. Agentproof kijkt naar alle mogelijke paden tegelijk en vindt de fouten die verborgen liggen.


📊 Wat hebben ze ontdekt?

De onderzoekers hebben 18 voorbeelddossiers getest (een mix van goede en opzettelijk slechte plannen).

  • 27% van de plannen had een bouwfout (zoals een doodlopende weg).
  • 55% van de plannen miste een menselijke controle waar dat nodig was.

Dit betekent dat als je AI-agenten bouwt zonder deze tool, je waarschijnlijk onbewust robots maakt die vastlopen of gevaarlijke dingen doen zonder dat iemand het merkt.

🛡️ Conclusie: Twee lagen van veiligheid

Agentproof vervangt niet de veiligheidscontrole tijdens het werk (zoals filters die giftige teksten blokkeren). Het is een extra laag.

  • Laag 1 (Agentproof): Kijkt naar het ontwerp. "Is de route veilig?"
  • Laag 2 (Runtime Guardrails): Kijkt naar de actie. "Is wat de robot nu zegt veilig?"

Samen zorgen ze ervoor dat je AI-robots niet alleen slim zijn, maar ook veilig en betrouwbaar werken. Agentproof is dus de architect die de blauwdruk controleert voordat de eerste baksteen wordt gelegd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →