← Nieuwste papers
💻 computer science

Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives

Dit artikel onthult een kritiek handhavingsgat in zes belangrijke LLM-agent frameworks waarbij controleprimitieven zoals goedkeuringspoorten en timeouts er niet in slagen bijwerkingen te voorkomen tijdens pauzes of annuleringen, en stelt SOUNDGATE voor, een mechanisch geverifieerde, hoogwaardige Rust-gebaseerde poort die volledige bemiddeling van alle bijwerkingen garandeert over diverse frameworks heen.

Oorspronkelijke auteurs: Sajjad Khan

Gepubliceerd 2026-07-20
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sajjad Khan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je computer niet alleen opdrachten opvolgt, maar ook eigen plannen begint te maken. Dit is het domein van AI-agenten: slimme programma's die e-mails kunnen lezen, vluchten kunnen boeken of zelfs geld kunnen overboeken. Maar omdat deze agenten krachtig zijn, hebben we een manier nodig om ze te stoppen als ze in de war raken of iets gevaarlijks gaan doen. Dit is waar Human-in-the-Loop (HITL) om de hoek komt kijken. Zie het als een "pauzeknop" die de AI dwingt om een mens te vragen: "Hé, ik ga deze e-mail versturen. Is dat oké?" De mens zegt "Ja" of "Nee", en de AI wacht op dat antwoord voordat er iets onomkeerbaars gebeurt.

Voor dit veiligheidssysteem te laten werken, gaat iedereen uit van een simpele regel: Stop betekent Stop. Als de AI op de pauzeknop drukt, gebeurt er niets totdat de mens reageert. Het is als een verkeerslicht dat op rood springt; alle auto's moeten stoppen, en geen enkele auto mag stiekem door het kruispunt rijden terwijl het licht op rood staat. Als het licht rood is, is het kruispunt leeg. Dit paper onderzoekt of de softwareframeworks (de "verkeersregelaars" voor deze AI-agenten) deze belofte daadwerkelijk nakomen. De onderzoekers wilden weten: wanneer de AI pauzeert om toestemming te vragen, staat de rest van het systeem dan echt bevroren, of gebeurt er op de achtergrond stiekem toch nog van alles?


De Grote "Sibling Leak"

De onderzoekers, onder leiding van Sajjad Khan, ontdekten dat de belofte "Stop betekent Stop" in bijna elk belangrijke AI-framework dat zij testten, wordt gebroken. Ze vonden een sluipende bug die ze de "Sibling Leak" noemen.

Stel je voor dat een AI-agent een drukke keuken is. De chef (de AI) bereidt twee gerechten tegelijkertijd voor: Gerecht A is een pittige curry die toestemming van de eigenaar nodig heeft voordat hij geserveerd mag worden, en Gerecht B is een eenvoudige salade. De chef stopt om de eigenaar naar de curry te vragen. In een perfecte keuken bevriest de hele keuken totdat de eigenaar "Ga door" zegt. Maar in de keukens die deze onderzoekers testten, bevroor de keuken niet. Terwijl de chef wachtte op het antwoord van de eigenaar over de curry, werd de salade (Gerecht B) nog steeds gehakt, opgediend en geserveerd aan de klant.

Nog erger nog: als de eigenaar naar de curry keek en zei: "Nee, serveer dat niet," en de chef probeerde te stoppen, was het al te laat. De salade was al geserveerd. Het "stop"-commando bevroor alleen de specifieke tak van het brein van de chef die over de curry nadacht, maar de andere takken draaiden gewoon door.

Het team testte zes verschillende frameworks (de softwarepakketten die ontwikkelaars gebruiken om deze agenten te bouwen) en vond dit lek in vijf ervan. Het kwam voor bij verschillende soorten computersystemen en programmeertalen. Het was niet slechts één fout stukje code; het was een patroon dat keer op keer terugkwam.

De Andere Glitches

De "Sibling Leak" was niet het enige probleem. De onderzoekers vonden drie andere manieren waarop de veiligheidsremmen faalden:

  1. De Replay Double-Count: Als het systeem pauzeerde en daarna weer startte, gebeurde het soms dat dezelfde taak per ongeluk twee keer werd uitgevoerd, zoals twee keer een creditcard afrekenen omdat het systeem dacht dat de eerste keer niet telde.
  2. De Cancellation Orphan: Als een mens tegen de AI zei "Stop!" terwijl deze midden in een lange taak zat, zei de AI "Oké, ik stop," maar de taak werd op de achtergrond toch voltooid, als een hardloper die de fluit hoort maar toch doorrent naar de finishlijn.
  3. De Timeout Zombie: Als een taak te lang duurde en het systeem zei "De tijd is om!", werd de taak na de deadline toch nog voltooid, als een zombie die door blijft lopen nadat de zon is opgekomen.

Gebeurt dit Werkelijk?

Je zou kunnen denken: "Nou, misschien doet AI gewoon niet vaak twee dingen tegelijk." De onderzoekers controleerden dit ook. Ze ontdekten dat hoewel AI-agenten in normale situaties meestal de dingen één voor één doen, ze wel eens proberen om meerdere dingen tegelijk te doen, vooral wanneer de taak complex is of wanneer iemand de AI probeert te misleiden.

In hun tests ontdekten ze dat frontier AI-modellen (de slimste die momenteel beschikbaar zijn) deze "sibling"-situaties ongeveer 14% van de tijd per ongeluk creëerden bij bepaalde taken. De cruciale bevinding gaat echter over wat er gebeurt wanneer ze proberen twee dingen tegelijk te doen. In een live-test met echte AI-modellen en echte software, wanneer de AI een plan genereerde dat probeerde twee dingen gelijktijdig te doen terwijl er gewacht werd op een mens, faalde het systeem 100% van de tijd. Van de 1.200 totale runs resulteerden 215 in een "lek" waarbij een actie plaatsvond terwijl het systeem gepauzeerd was. De fout was niet dat de AI altijd probeerde twee dingen tegelijk te doen; de fout was dat wanneer ze dat wel deden, de veiligheidspoort volledig nutteloos was.

De Oplossing: De Bouncer bij de Deur

Hoe los je dus een keuken op waar de chef blijft rondbrengen terwijl hij wacht op toestemming? Je kunt de chef niet simpelweg vertellen om "beter te zijn", want de keuken is juist zo gebouwd dat er zaken parallel kunnen gebeuren. In plaats daarvan bouwden de onderzoekers een nieuw soort veiligheidsbewaker genaamd SOUNDGATE.

Zie SOUNDGATE als een bouncer die bij de voordeur van de keuken staat.

  • De Oude Manier: De chef (de AI) loopt gewoon de deur uit met het eten. Als de eigenaar "Stop" zegt, is de chef misschien al te ver weg om het te horen.
  • De SOUNDGATE-Manier: Elk gerecht (elke actie) moet bij de bouncer stoppen voordat het de keuken verlaat. De bouncer houdt een lijst bij van wat is toegestaan.
    • Als de eigenaar zegt "Wacht", houdt de bouncer het eten vast.
    • Als de eigenaar zegt "Nee", gooit de bouncer het eten weg.
    • Als de eigenaar zegt "Ja", laat de bouncer het eruit.
    • Als de chef probeert voor de tweede keer te ontsnappen (een replay), controleert de bouncer de lijst en zegt: "Dit heb je al gedaan," en stopt hem.
    • Als de chef probeert te vertrekken nadat het "Stop"-commando is gegeven, blokkeert de bouncer de deur.

De onderzoekers bouwden deze bouncer met behulp van een zeer strikte, wiskundig geverifieerde taal genaamd Rust. Ze bewezen met computerlogica dat de bouncer geen enkele fout kan maken. Ze testten het op alle zes de frameworks, en het werkte perfect. Wanneer ze SOUNDGATE gebruikten, gebeurde er nul lekken. De bouncer hield de lijn elke keer stand.

Waarom Dit Belangrijk Is

Het paper beweert niet dat AI gevaarlijk is of dat we het niet meer moeten gebruiken. In plaats daarvan laat het zien dat de veiligheidstools die we momenteel gebruiken een verborgen gat hebben. Het is alsoid een autogordel die er geweldig uitziet, maar die niet echt vergrendelt wanneer je een ongeluk krijgt.

De onderzoekers ontdekten dat hoewel het gat bestaat, het vaak "latent" is — wat betekent dat het er wel is, maar we het niet altijd zien omdat AI meestal langzaam en één voor één te werk gaat. Echter, naarmate AI sneller wordt en complexere, meerstaps-taken gaat uitvoeren, of als iemand de AI probeert te misleiden, wordt dat gat een enorme kloof.

Het goede nieuws is dat de oplossing simpel is en niet vereist dat je de hele keuken herbouwt. Je voegt gewoon de bouncer (SOUNDGATE) toe bij de deur. Het is een kleine toevoeging die het hele systeem weer veilig maakt, waardoor gewaarborgd wordt dat wanneer een mens "Stop" zegt, de machine ook daadwerkelijk stopt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →