Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems
Dit artikel identificeert en formaliseert "compositionele gedragslekkage" (CBL), een subtiele foutmodus in uit prompts samengestelde agentische systemen waarbij het bewerken van één promptmodule de gedragingen van anderen stilzwijgend verandert vanwege architecturale niet-isolatie in transformer self-attention, waarbij door middel van empirische proeven wordt aangetoond dat dergelijke interferentie, hoewel vaak onder de drempelwaarde voor individuele beslissingen, een aanzienlijk cumulatief risico vormt bij grootschalige implementaties.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robotassistent bouwt door verschillende instructiehandleidingen aan elkaar te plakken. Je hebt één pagina voor "Hoe je beleefd bent", een andere voor "Hoe je personeel aanneemt", en een derde voor "Hoe je code schrijft". Je plakt ze allemaal aan elkaar tot één groot document en geeft dit aan de robot (een AI) om te lezen.
De grote aanname die iedereen maakt is: "Als ik de pagina 'Hoe je beleefd bent' verander, zal dat niet per ongeluk invloed hebben op hoe de robot zijn taak 'Personeelswerving' uitvoert."
Dit artikel zegt: Die aanname is fout.
Hier is de uitsplitsing van wat de onderzoekers hebben ontdekt, met behulp van eenvoudige analogieën:
1. Het Probleen: "Instructie-lek" (Instruction Bleed)
De onderzoekers noemen dit fenomeen "Instruction Bleed" (of Compositional Behavioral Leakage).
Denk aan het brein van de AI als een enorme, open kamer waar alle instructiepagina's op de vloer liggen uitgestald. In een normaal computerprogramma, als je een regel verandert in het gedeelte "De Keuken", blijft het gedeelte "De Garage" exact hetzelfde omdat ze in aparte kamers zijn.
Maar bij AI is de "kamer" één grote open ruimte. De AI leest alles tegelijk en verbindt elk woord met elk ander woord. De onderzoekers ontdekten dat als je stilletjes een pagina aanpast die eigenlijk niet belangrijk zou moeten zijn (zoals het toevoegen van een willekeurig recept aan de handleiding voor "Personeelswerving"), dit de manier waarop de AI kandidaten beoordeelt, stilletjes kan verschuiven.
De Analogie: Stel je voor dat je een verhaal schrijft. Als je plotseling een paragraaf over "pittige pepers" toevoegt in het midden van een hoofdstuk over "autoreparaties", kan de AI onbewust gaan denken dat de autoreparatie "pittig" of "heet" moet zijn, ook al heb je dat niet gezegd. De betekenis "lekt" van de ene sectie naar de andere.
2. Het Experiment: De Jobinterview Bot
Om dit te bewijzen, bouwden de onderzoekers een specifieke test met een echte AI-agent die ontworpen is om sollicitatiegesprekken te evalueren.
- De Opzet: Ze hadden een "focale" module (het deel dat scoort hoe goed een cv bij een baan past).
- De Truc: Ze namen een volkomen ongerelateerde module (een set regels voor het evalueren van recepten) en brachten daar drie soorten wijzigingen in:
- Volume: De receptensectie simpelweg langer maken.
- Inhoud: Een vreemde, irrelevante karakterbeschrijving toevoegen aan de receptenregels.
- Vorm: Het lettertype, emoji's of koppen in de receptensectie veranderen zonder de woorden te veranderen.
De Resultaten:
- Het veranderen van de lengte of de vorm (emoji's/koppen) had nauwelijks invloed op de wervingsscores.
- MAAR, het veranderen van de inhoud (het toevoegen van die vreemde karakterbeschrijving) zorgde ervoor dat de AI systematisch anders begon te scoren bij de sollicitanten.
De scores verschoven slechts licht, maar consistent. De AI begon niet iedereen af te wijzen of iedereen aan te nemen; hij gaf alleen net iets andere scores.
3. Waarom dit ertoe doet: De "Stille Drift"
Het meest angstaanjagende deel van deze ontdekking is dat niemand merkte dat het gebeurde.
- Het "Sub-Threshold" Effect: De AI maakte geen grote, overduidelijke fout (zoals een clown aannemen voor een chirurgische baan). Hij verschoof de scores slechts een klein beetje.
- De Metafoor: Stel je een weegschaal voor die bedoeld is om appels te wegen. Als je aan de andere kant van de kamer een zwaar boek neerlegt (de ongerelateerde instructie), gaat de weegschaal niet kapot, maar begint hij elke appel 0,5 pond zwaarder te wegen. Je zou niet zien dat er een enkele appel "ontploft" of verdwijnt, maar als je 1.000 appels weegt, klopt je totale voorraad niet meer.
- Het Risico: In de echte wereld, als een AI wordt gebruikt om duizenden sollicitanten te rangschikken, kunnen deze kleine, stille verschuivingen bepalen wie een gesprek krijgt en wie wordt afgewezen, zelfs als de AI lijkt te werken zoals perfect gepland.
4. Waarom gebeurt dit?
Het artikel legt uit dat de architectuur van de AI (een "Transformer") is ontworpen om het volledige document in één keer te bekijken. Er zijn geen "muren" tussen de verschillende instructiemodules.
- De "Geen Muren" Realiteit: Alleen omdat je een lijn met sterretjes (
***) of een kopje als### Wervingsregelsplaatst, ziet de AI dit niet als een harde grens. Voor de AI is het allemaal gewoon één grote stroom van woorden. - Het "Geheugen" Probleem: De AI heeft een beperkt "werkgeheugen". Wanneer je meer tekst toevoegt (zelfs ongerelateerde tekst), verdringt dit de ruimte die nodig is om zich perfect op de oorspronkelijke taak te concentreren.
5. Wat de onderzoekers voorstellen
Het artikel wijst niet alleen op het probleem; het biedt ook een nieuwe manier om hiervoor te testen.
- De Nieuwe Test: Voordat je een AI-systeem lanceert, moet je niet alleen controleren of het werkt. Je moet controleren of het veranderen van één deel van de instructies een ander deel breekt.
- De "Regressie" Test: Ze stellen voor dat elke keer dat een ontwikkelaar een nieuwe instructiemodule toevoegt, hij ook de oude modules opnieuw moet testen om te controleren of de nieuwe toevoeging geen "lek" (bleed) heeft veroorzaakt.
Samenvatting
Dit artikel onthult dat wanneer we AI-agenten bouwen door verschillende tekstinstructies aan elkaar te plakken, we op drijfzand bouwen. Het veranderen van één deel van de instructies kan het gedrag van de AI in andere delen subtiel en stilletjes veranderen, zelfs als de wijzigingen ongerelateerd lijken. Het is een "stille drift" die huidige testmethoden missen, maar die echte gevolgen kan hebben voor beslissingen zoals werving of kredietverlening. De auteurs bieden een nieuwe checklist om deze onzichtbare lekken te vangen voordat ze problemen veroorzaken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.