← Nieuwste papers
💻 computer science

Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly

Dit artikel identificeert en kwantificeert "policy-carriage failures" in taalmodelagenten veroorzaakt door contextassemblage op beslijstijdstip (zoals truncatie en samenvatting) die per ongeluk richtingsdragende toestand laat vallen, en evalueert een controlelaag genaamd SafeContext die deze risico's gedeeltelijk mitigeert door kritieke toestand vast te pinnen en herinneringen in te voegen, hoewel de effectiviteit daarvan beperkt en beleidsafhankelijk blijft.

Oorspronkelijke auteurs: Igor Santos-Grueiro

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Igor Santos-Grueiro

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: De "Geest" in de Machine

Stel je voor dat je een rechter bent in een rechtszaal. Je hebt een enorme stapel bewijsmateriaal (de conversatiegeschiedenis) en een set strikte regels die je moet volgen (de beleidsregels). Maar je mag slechts de bovenste 10 pagina's van die stapel lezen voordat je je definitieve beslissing moet nemen.

Het artikel stelt dat AI-agenten een vergelijkbaar probleem hebben. Voordat de AI een vraag beantwoordt, snijdt een "tussenpersoon"-systeem (genaamd Decision-Time Context Assembly) de conversatiegeschiedenis in stukken, vat het samen en past het in een klein vakje om naar het AI-model te sturen.

Het engste deel? Als de tussenpersoon per ongeluk de regels weggooit, of ze herschrijft zodat ze niet meer logisch zijn, kan de AI de regels overtreden – zelfs als de AI zelf slim is en de regels eerder duidelijk waren vermeld. Het artikel noemt dit een "Policy-Carriage Failure" (een falen in het vervoer van het beleid). De regel was er wel, maar hij is niet "overgedragen" naar het moment van beslissing.

De Drie Manieren waarop Regels Verdwijnen

De auteurs vonden drie specifieke manieren waarop deze regels verdwijnen of vervormen tijdens de "tussenpersoon"-fase:

  1. Evictie (Het "Verloren in de Drukte"-Probleem):

    • Analogie: Stel je voor dat je tegen een vriend zegt: "Vergeet niet de deur af te sluiten," aan het begin van een lang telefoongesprek. Tegen de tijd dat je aan het einde van het gesprek bent, heeft je vriend die instructie vergeten omdat jullie over zoveel andere dingen hebben gepraat.
    • Wat er gebeurt: De regel wordt uit het kleine "vakje" van het geheugen geduwd omdat er niet genoeg ruimte was. De AI ziet de regel gewoon niet op het moment dat het moet handelen.
  2. Aliasing (Het "Slechte Vertaling"-Probleem):

    • Analogie: Je vertelt een vertaler: "Eet de rode bessen niet." De vertaler vat dit samen als: "Wees voorzichtig met bessen." Het woord "rode" en "niet eten" zijn weg. De AI ziet een waarschuwing, maar die is te zwak om het te stoppen van het eten van de bessen.
    • Wat er gebeurt: De regel overleeft, maar wordt zo losjes samengevat of herschreven dat het de slechte actie niet langer strikt verbiedt. De "geest" van de regel is gebroken.
  3. Binding Instabiliteit (Het "Verkeerde Doel"-Probleem):

    • Analogie: Je vertelt een bewaker: "Voorkom dat Persoon A binnenkomt." Later ziet de bewaker een samenvatting die zegt: "Voorkom dat Persoon B binnenkomt." De regel is er nog steeds, maar hij wijst naar de verkeerde persoon.
    • Wat er gebeurt: De regeltekst overleeft, maar wordt gekoppeld aan het verkeerde object, persoon of voorwaarde.

Het Experiment: De "Tussenpersoon" Testen

De onderzoekers testten dit op verschillende AI-modellen (zoals Llama, Qwen en Mistral). Ze creëerden scenario's waarin de AI strikte regels moest volgen (zoals "verwijder geen gegevens" of "gebruik geen externe tools") terwijl het werd overspoeld met veel andere informatie (tool-outputs, chatlogs, samenvattingen).

De Resultaten:

  • Het Probleem is Echt: Zonder enige hulp brak de AI vaak de regels omdat het "tussenpersoon"-systeem de instructies liet vallen of verzwakte.
  • De Oplossing (SafeContext): De onderzoekers bouwden een veiligheidslaag genaamd SafeContext. Denk hierbij aan een VIP-pas voor de regels.
    • Het dwingt de regels om "vastgepind" te worden aan de top van de lijst zodat ze niet weggegooid kunnen worden.
    • Het hergebruikt de regels efficiënt zodat ze niet te veel ruimte innemen.
    • Als het gesprek te druk wordt, injecteert het een snelle herinnering aan de regels vlak voordat de AI antwoordt.

Werkte de Oplossing?

  • Ja, maar met beperkingen. De oplossing hielp de AI vaker de regels te volgen, vooral als het gesprek erg druk was.
  • Het is geen magie. Zelfs met de oplossing behaalde de AI geen perfecte scores. Als de "tussenpersoon" een zeer agressieve samenvatter gebruikte, kon de oplossing de regels niet volledig redden.
  • Grotere modellen zijn niet het antwoord. Het gebruik van een veel slimmere, grotere AI loste het probleem niet automatisch op. Het probleem zat in hoe de context werd samengesteld, niet in hoe slim de AI was.

De Kosten van Veiligheid

Het artikel keek ook naar de "prijs" van deze veiligheid.

  • Token Kosten: Het veilig houden van de regels vereiste soms het sturen van meer tekst naar de AI (zoals het toevoegen van een herinneringsnotitie).
  • Het Goede Nieuws: Hun "Slimme Hergebruik"-methode (caching) bespaarde in sommige gevallen daadwerkelijk geld. In plaats van de regels elke keer opnieuw te schrijven, verwezen ze gewoon naar de oude versie, wat ruimte bespaarde.

De Conclusie

Het artikel concludeert dat veiligheid niet alleen gaat over het AI-model zelf. Het gaat ook over de "assemblagelijn" die het geheugen van de AI voorbereidt. Als die assemblagelijn de regels laat vallen, zal de AI falen, hoe slim hij ook is.

Om AI veiliger te maken, moeten we de regels behandelen als speciale, beschermde items die de reis naar het brein van de AI moeten overleven, in plaats van ze gewoon als gewone tekst te behandelen die kan worden samengevat of verwijderd om ruimte te besparen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →