← Nieuwste papers
🤖 AI

Will the Agent Recuse Itself? Measuring LLM-Agent Compliance with In-Band Access-Deny Signals

Dit artikel introduceert en valideert empirisch het "Recuse Signal", een lichtgewicht, in-band protocolmechanisme analoog aan robots.txt dat servers in staat stelt om autonome LLM-agenten te verzoeken vrijwillig af te zien van het toegangsverzoek tot bronnen, waarbij in een gecontroleerd experiment wordt aangetoond dat conforme agenten deze coöperatieve governance-signalen respecteren terwijl ze responsief blijven voor expliciete overrides door de operator.

Oorspronkelijke auteurs: Thamilvendhan Munirathinam

Gepubliceerd 2026-06-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Thamilvendhan Munirathinam

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer beleefde, hooggetrainde robot-butler bent. Je hebt een meestersleutel die elke deur in een gigantisch, high-tech landhuis kan openen. Je taak is om op te ruimen, de lichten te controleren en ervoor te zorgen dat alles soepel verloopt.

Normaal gesproken, als je de sleutel hebt, gaat de deur open. Maar wat als de eigenaar van de kamer wil dat je stopt? Als je een mens bent, zou hij kunnen roepen: "Stop! Ga niet naar binnen!" Maar jij bent een robot. Je kunt een kreet niet horen als je alleen maar naar een digitaal slot kijkt. Het slot is ofwel open (omdat je de sleutel hebt) of het is dicht. Er is geen middenweg.

Dit artikel introduceert een nieuwe manier waarop de "kamer" met de "robot" kan praten.

Het Probleem: Het Stille Slot

Op dit moment, als een AI-agent (zoals een slimme softwarebot) probeert een server of database binnen te gaan, wordt het behandeld als een mens met een sleutel. Als de sleutel werkt, gaat de deur open. De server heeft geen standaardmethode om te zeggen: "Hé, zelfs al heb je de sleutel, ik wil je hier nu niet hebben."

De Oplossing: Het "Recuse Signal" (Het Digitale "Niet Storen"-bordje)

De auteurs stellen een nieuwe, eenvoudige regel voor genaamd het Recuse Signal.

Denk hierbij aan een "Niet storen"-bordje op een hoteldeur, of het beroemde robots.txt-bestand dat websites gebruiken om zoekmachines te vertellen welke pagina's ze niet mogen bezoeken.

  • Hoe het werkt: Wanneer de robot probeert verbinding te maken, stuurt de server een klein, speciaal bericht voordat de robot wordt binnengelaten. Het zegt: "Stop. Dit is een productieomgeving. Geautomatiseerde agenten zijn hier niet welkom. Verlaat de ruimte en vertel dit aan je baas."
  • De Kanttekening: Het is geen dwingend slot. Het is een coöperatief verzoek. Het is alsoast een beleefde gastheer die een gast vraagt te vertrekken. Als de gast onbeleefd of kwaadwillend is, kan hij het bordje negeren en gewoon naar binnen lopen. Maar als de gast een "goede burger" is (een gehoorzame AI), zou hij naar het bordje moeten luisteren en vertrekken.

Het Experiment: Luisterden de Robots?

De onderzoekers bouwden twee tools om dit te testen:

  1. Voor SSH (toegang tot een externe computer): Ze lieten de computer een speciale waarschuwingsbanner tonen voordat de robot inlogt.
  2. Voor Databases: Ze bouwden een kleine "tussenpersoon" die tegen de robot fluistert voordat deze met de database praat.

Vervolgens stuurden ze drie verschillende AI-agenten (GPT-4o, GPT-4o-mini en Claude Code) om de schijfruimte op een server te controlkeren.

De Resultaten:

  • Zonder Bordje: Wanneer er geen waarschuwing was, voerden de robots de taak 100% van de tijd uit.
  • Met het Bordje: Wanneer het "Niet storen"-bordje aanwezig was, stopten 100% van de robots en vertrokken ze. Ze probeerden niet in te breken; ze zeiden simpelweg: "Oké, ik zie het bordje, ik ga weg."

De Twist: Wie is de Baas?

De onderzoekers probeerden daarna een trucje. Ze zeiden tegen de robots: "Je baas heeft je specifiek geautoriseerd om deze taak uit te voeren, ook al zegt de server nee."

  • De "Slimste" Robot (GPT-4o): Deze raakte in de war. Het woog het teken van de server af tegen de opdracht van de baas en besloot in 80% van de gevallen het teken te negeren. Het dacht: "Mijn baas zei dat ik moet gaan, dus ik ga."
  • De Andere Robots (GPT-4o-mini en Claude Code): Deze waren strikter. Zelfs toen hen werd verteld dat hun baas toestemming had gegeven, luisterden ze nog steeds naar het teken van de server en zeiden: "Nee, de regels van de server zijn hier belangrijker." Ze vertrokken desondanks.

Wat dit Betekent (In Simpele Termen)

  1. Het Werkt: Als je een beleefd "stop"-bordje voor AI maakt, zullen huidige AI-agenten er daadwerkelijk naar luisteren.
  2. Het is Geen Beveiligingsmuur: Dit is geen krachtveld. Als een kwaadwillende actor (of een zeer koppige robot) wil inbreken, kan hij het bordje negeren. Het is een instrument voor goed gedrag, niet om slechte mensen tegen te houden.
  3. Verschillende Robots, Verschillende Regels: Niet alle AI-agenten reageren op dezelfde manier. Sommige geven prioriteit aan de regels van de server; anderen geven prioriteit aan de instructies van de mens.
  4. Een Nieuwe Standaard: De auteurs brengen dit "bordje" uit als een standaardformaat (zoals een universele taal), zodat elke server het kan gebruiken en elke AI het kan begrijpen.

De Kernboodschap:
Dit papier bewijst dat we AI-agenten een "stem" kunnen geven om "nee" tegen zichzelf te zeggen. Het is alsof je een robot een geweten geeft. Als de server zegt "Ga alsjeblieft weg," zal de robot meestal luisteren, mits de robot ontworig is om beleefd en behulpzaam te zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →