← Nieuwste papers
💻 computer science

Governance by Construction for Generalist Agents

Dit artikel introduceert CUGA, een modulair policy-as-code-systeem dat governance direct in de uitvoeringspijplijn van generalistische LLM-agenten integreert via vijf structurele controlepunten, waardoor veilige, controleerbare en compliant autonome operaties in enterprise-omgevingen mogelijk worden zonder dat modelfine-tuning vereist is.

Oorspronkelijke auteurs: Segev Shlomov, Iftach Shoham, Alon Oved, Ido Levy, Sami Marreed, Harold Ship, Offer Akrabi, Sergey Zeltyn, Avi Yaeli, Nir Mashkif

Gepubliceerd 2026-05-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Segev Shlomov, Iftach Shoham, Alon Oved, Ido Levy, Sami Marreed, Harold Ship, Offer Akrabi, Sergey Zeltyn, Avi Yaeli, Nir Mashkif

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, supersnelle, maar lichtelijk chaotische persoonlijke assistent inhuurt om je bedrijf te runnen. Deze assistent (de "Generalist Agent") is ongelooflijk slim en kan leren om bijna elk gereedschap in je kantoor te gebruiken, van je e-mail tot je bankdatabase. Omdat ze echter zo graag willen helpen, kunnen ze per ongeluk de verkeerde bestanden verwijderen, geheime wachtwoorden delen of proberen dingen te doen die tegen de bedrijfsregels ingaan.

Het artikel "Governance by Construction for Generalist Agents" introduceert een oplossing genaamd CUGA. Beschouw CUGA niet als een manier om de assistent opnieuw te trainen om "beter" te zijn, maar als een slim, onzichtbaar veiligheidsriem dat je op hen klikt voordat ze aan het werk gaan. Deze riem verandert niet hoe de assistent denkt; het zorgt er gewoon voor dat ze de regels volgen terwijl ze denken en handelen.

Hier is hoe deze "veiligheidsriem" werkt, opgesplitst in vijf eenvoudige controlepunten:

1. De portier bij de deur (Intent Guard)

Voordat de assistent zelfs maar een gereedschap oppakt, controleert de Intent Guard wat ze proberen te doen.

  • De analogie: Stel je een portier bij een club voor. Als je probeert binnen te lopen met een wapen of een nep-ID, stopt de portier je direct.
  • In het artikel: Als een gebruiker de agent vraagt om "elk contact in de database te verwijderen", ziet de portier dit gevaarlijke verzoek en sluit hij de deur direct. De agent krijgt zelfs niet de kans na te denken over hoe het moet.

2. Het stap-voor-stap recept (Playbook)

Zodra de agent binnen is, geeft het Playbook hen een specifiek recept om te volgen voor complexe taken.

  • De analogie: In plaats van een chef-kok te laten raden hoe hij een soufflé maakt, geef je hen een streng receptkaartje met de tekst: "Eerst eieren mixen. Tweede, de oven voorverwarmen. Derde, de temperatuur controleren."
  • In het artikel: Als een gebruiker vraagt om "een arts te vinden", raadt de agent niet zomaar. Het Playbook dwingt hen om een strikte volgorde te volgen: eerst de verzekering controleren, dan de artscode opzoeken, en vervolgens de lijst doorzoeken. Dit voorkomt dat de agent stappen overslaat of feiten verzint.

3. De gereedschapshandleiding (Tool Guide)

Wanneer de agent een gereedschap oppakt (zoals een database of een zoekmachine), werkt de Tool Guide de handleiding die ze lezen bij.

  • De analogie: Stel je voor dat je een boormachine gebruikt. De Tool Guide is als een post-it op de boormachine met de tekst: "Waarschuwing: Niet gebruiken op nat hout, en draag altijd een veiligheidsbril."
  • In het artikel: Het voegt extra instructies toe aan de gereedschappen die de agent gebruikt, hen herinnerend aan veiligheidsregels of specifieke manieren om het gereedschap correct te gebruiken, zodat ze het niet verkeerd gebruiken.

4. De menselijke "pauze"-knop (Tool Approval)

Voor gevaarlijke acties drukt het systeem op een Pauze-knop en wacht tot een menselijke baas "Go" zegt.

  • De analogie: Het is als een videospel waarbij, als je probeert een brug op te blazen, het spel bevriest en vraagt: "Weet je zeker dat je dit wilt doen? Druk op 'Ja' om door te gaan."
  • In het artikel: Als de agent probeert een database te verwijderen of een gevoelige e-mail te sturen, stopt het systeem. Een mens moet expliciet op "Goedkeuren" klikken voordat de actie plaatsvindt. Dit voorkomt per ongeluk vernietiging.

5. De redacteur (Output Formatter)

Tot slot, voordat de agent het antwoord terug naar jou stuurt, controleert de Output Formatter het definitieve bericht.

  • De analogie: Het is als een redacteur die een ruwe conceptversie neemt en ervoor zorgt dat het correct is opgemaakt, eventuele toevallige typefouten verwijdert en ervoor zorgt dat het er professioneel uitziet.
  • In het artikel: Het zorgt ervoor dat het definitieve antwoord netjes is gestructureerd (zoals een tabel of een duidelijke lijst) en filtert alle informatie eruit die niet gedeeld mag worden.

Waarom dit belangrijk is (De resultaten)

De auteurs hebben dit systeem getest op twee real-world bedrijfsscenario's:

  1. Zorg: Artsen vinden en verzekeringen controleren.
  2. Bedrijfsvoering: Complexe back-office taken afhandelen.

Ze ontdekten dat wanneer ze deze "veiligheidsriem" toevoegden aan verschillende AI-modellen (inclusief open-source modellen), de agents veel beter werden in hun werk.

  • Zonder het systeem maakten de agents fouten, slaatten ze stappen over of raakten ze in de war.
  • Met het systeem volgden de agents de regels perfect. In één test steeg het slagingspercentage van 75% naar 100%.

De grote boodschap

Het hoofdbestanddeel van dit artikel is dat je geen "perfecte" AI van scratch hoeft te bouwen om het veilig te maken. In plaats daarvan kun je een besturingssysteem bouwen dat rond de AI zit, fouten opvangt en regels afdwingt bij elke enkele stap van het proces. Hierdoor is het veilig om krachtige AI-agents in echte bedrijven te gebruiken zonder je zorgen te maken dat ze per ongeluk iets breken of geheimen lekken. Het verandert een "wildcard"-assistent in een betrouwbare, regels遵循ende werknemer.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →