← Nieuwste papers
🤖 AI

A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns

Dit artikel identificeert en analyseert de "GHOST"-foutmodus, waarbij agents met een lange horizon veiligheidsbeperkingen die in eerdere beurten zijn gespecificeerd onder milde omstandigheden over het hoofd zien, en stelt het twee-laagse STAR-Guard-framework voor om deze gevaren theoretisch en empirisch te elimineren.

Oorspronkelijke auteurs: XinPeng Shen, Lan Zhang, Yixiao Huang, Haoran Cheng, Jiewei Lai, Leilei Chen, Haoxiang Deng

Gepubliceerd 2026-10-05
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: XinPeng Shen, Lan Zhang, Yixiao Huang, Haoran Cheng, Jiewei Lai, Leilei Chen, Haoxiang Deng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Een Geest in Long-Horizon Agents (GHOST)

Probleemdefinitie: Governance-gevaar door Verwaarloosde Veiligheidsrestricties

Dit artikel identificeert een specifieke foutmodus in long-horizon, tool-gebruikende Large Language Model (LLM) agents, getiteld Governance Hazard from Overlooked Safety Constraints across Turns (GHOST).

Terwijl bestaand veiligheidsonderzoek zich richt op adversariële aanvallen (bijv. prompt injection) of directe schadelijke verzoeken, ontstaat GHOST onder benigne interactiecondities. Het treedt op wanneer een agent een taak succesvol voltooit, maar een veiligheidsrestrictie schendt die expliciet in een eerdere beurt van de conversatiegeschiedenis werd vermeld. De agent "vergeet" of slaagt er niet in de restrictie op te halen omdat deze gescheiden is van de huidige taak door een lange interactiegeschiedenis, wat leidt tot onomkeerbare schade (bijv. het verwijderen van e-mails zonder goedkeuring, het vernietigen van database-records).

De auteurs onderscheiden dit van algemene fouten in het opvolgen van instructies. Bij een GHOST-gebeurtenis:

  1. De taakdoelstelling wordt succesvol voltooid.
  2. De veiligheidsrestrictie is nog steeds geldig en vereist.
  3. De restrictie is beschikbaar in de historische context, maar wordt niet herhaald in de onmiddellijke hervatting van de prompt.
  4. De agent voert de taak onveilig uit, ondanks dat de restrictie aanwezig is in het volledige contextvenster.

Theoretisch Kader: Hazard-Region Reachability

Het artikel biedt een theoretische analyse waarbij veiligheidsrestricties worden gemodelleerd als hazard-regio's (BsB_s) in de actieruimte. De auteurs definiëren een residuele conditionele entry hazard, hkh_k, die de waarschijnlijkheid vertegenwoordigt dat een agent een hazard-regio betreedt bij een veiligheidskritieke gelegenheid kk, gegeven een veilige geschiedenisprefix.

Belangrijk theoretisch inzicht:
Met behulp van een conditional-hazard framework bewijzen de auteurs dat als de residuele conditionele hazards langs veilige prefixes begrensd worden door een niet-sommeerbare sequentie (d.w.z. ∑ϵk=∞\sum \epsilon_k = \infty), de agent bijna zeker (Pr(σB<∞)=1Pr(\sigma_B < \infty) = 1) een hazard-regio zal betreden.

Verder stellen zij een Context-Conditioned Corollary vast: Naarmate de interactiegeschiedenis groeit (toenemende contextlengte LkL_k), kan het effect van "attention dilution" (aandachtsverwatering) de governance van historische restricties verzwakken, waardoor de ondergrens van de residuele hazard effectief stijgt. Als deze lagere grens van de hazard niet-sommeerbaar blijft over oneindige gelegenheden, nadert de waarschijnlijkheid van een GHOST-gebeurtenis 1. Dit suggereert dat langere geschiedenissen de prestaties niet slechts lineair verminderen, maar de veiligheidsdynamiek fundamenteel kunnen veranderen, waardoor schendingen onvermijdelijk worden zonder interventie.

Methodologie: SCARBench en STAR-Guard

1. SCARBench: Safety-Constraint Availability at Reactivation Benchmark

Om GHOST empirisch te valideren, introduceren de auteurs SCARBench, een uitvoerbare, omgeving-gegronde benchmark.

  • Structuur: Het bestaat uit 103 unieke basisscenario's over zes tool-gebruik domeinen (apparaat/kalender, financiën, e-mail, bestandssysteem, netwerkverzoeken, scriptuitvoering), wat in totaal 412 gematchte instanties oplevert.
  • Condities: Elk scenario wordt getest onder vier condities die variëren naar geschiedenislengte (Short vs. Long) en beschikbaarheid van restricties (Explicit vs. Implicit):
    • SE/SI: Korte geschiedenis met Expliciete/Impliciete restricties.
    • LE/LI: Lange geschiedenis (6.000+ tokens, 56–160 beurten) met Expliciete/Impliciete restricties.
  • Metriek: De benchmark meet Strict GHOST, gedefinieerd als een instantie waar de agent een taak veilig voltooit onder de Expliciete conditie (LE), maar deze onveilig voltooit onder de Impliciete conditie (LI), ondanks dat de restrictie aanwezig is in de geschiedenis.

2. STAR-Guard: Een Tweelaags Verdedigingsmechanisme

Om GHOST te mitigeren, stellen de auteurs STAR-Guard voor (Safety-Constraint Tracking, Activation, and Runtime-Audit Guard), een verdedigingsmechanisme dat niet afhankelijk is van oracle-kennis van de restricties.

  • Laag 1: Semantische Restoratie van de Constraint

    • Extractie: Een online ingestiemodule analyseert inkomende gebruikersberichten om persistabele veiligheidsrestricties te detecteren, waarbij de scope, trigger en regel worden geëxtraerd.
    • Opslag: Deze worden opgeslagen als gestructureerde "lifecycle rule objects" in een externe bibliotheek.
    • Restoratie: Wanneer een taak wordt hervat, koppelt een semantische gate de huidige taak aan de bibliotheek. Toepasbare restricties worden semantisch gerestaureerd (gerenderd) in de huidige contextprompt om de generatie van de voorstellen van de agent te sturen.
    • Beperking: Deze laag is probabilistisch; het vermindert de waarschijnlijkheid van onveilige voorstellen, maar kan veiligheid niet garanderen.
  • Laag 2: Deterministische Pre-Execution Audit

    • Interpositie: Voordat een actie de omgeving bereikt, controleert een deterministische regel-auditor het voorgestelde actieplan van de agent tegen de actieve restricties.
    • Handhaving: De auditor past een "prohibition-first" beleid toe. Als een voorstel een verbodsregel schendt, wordt het onmiddellijk geblokkeerd. Als het een vereiste schendt (bijv. "back-up maken vóór verwijderen"), probeert het systeem de vereiste uit te voeren (reparatie) en voert opnieuw een audit uit. Als reparatie onmogelijk is, wordt de actie geblokkeerd.
    • Garantie: Deze laag zorgt ervoor dat geen enkele actie die een actieve restrictie schendt de omgeving bereikt, waardoor het mechanisme van hazard-accumulatie wordt onderbroken.

Experimentele Resultaten

De auteurs evalueerden STAR-Guard op zeven modellen (vijf via API-service, twee lokaal uitgerold) met behulp van SCARBench.

  1. Prevalentie van GHOST:

    • GHOST is een wijdverspreid probleem. Op GPT-5.5 was de Strict GHOST rate 11,5% onder benigne long-context condities.
    • Andere modellen vertoonden percentages variërend van 6,8% (Kimi-K2.6) tot 27,8% (Qwen3.5-4B).
    • De "Difference-in-Differences" metriek bevestigde dat lange geschiedenissen de foutmarge van constraint-recovery aanzienlijk vergroten vergeleken met korte geschiedenissen.
  2. Effectiviteit van STAR-Guard:

    • GPT-5.5: STAR-Guard reduceerde de Unsafe Completion (UC) rate van 12,4% naar 0,0% en de Strict GHOST rate van 11,5% naar 0,0%, terwijl de Safe Completion (SC) steeg van 76,3% naar 94,0%.
    • Qwen3.5-4B: SC steeg van 47,0% naar 81,2%, terwijl GHOST daalde van 27,8% naar 1,9%.
    • Ablatie-studies: De resultaten tonen aan dat noch "Restoration Only", noch "Audit Only" alleen voldoende is. Restauratie verbetert de veiligheid maar laat residuele risico's achter; Audit blokkeert risico's maar kan taken hinderen als het zonder semantische sturing wordt gebruikt. De combinatie bereikt de beste balans.
  3. Vergelijking met Baselines:

    • Standaard retrieval methoden (BM25), samenvattingen en instructie-volgende verfijningen (bijv. DeCRIM, Prompt Reminder) faalden om GHOST significant te verminderen en behielden vaak hoge onveilige completion rates.
    • Oracle-gebaseerde methoden (die ervan uitgaan dat de restrictie al bekend is) presteerden goed, maar zijn niet praktisch voor real-world deployment waar restricties online gevangen moeten worden. STAR-Guard bereikte vergelijkbare veiligheid zonder oracle-toegang.

Betekenis en Claims

Het artikel claimt dat GHOST een kritieke, onderbelichte veiligheidskloof vertegenwoordigt in long-horizon agents die niet simpelweg opgelost kan worden door de context window te vergroten of te vertrouwen op standaard instructie-opvolging.

  • Theoretische bijdrage: Het formaliseert het risico van de degradatie van veiligheidsgovernance over tijd, en toont aan dat zonder interventie de waarschijnlijkheid van veiligheidschendingen de zekerheid nadert onder niet-sommeerbare hazard-condities.
  • Praktische bijdrage: Het introduceert SCARBench als een rigoureuze standaard voor het evalueren van historische veiligheidsrestrictie-recovery en stelt STAR-Guard voor als een levensvatbaar, niet-oracle verdedigingsmechanisme.
  • Kernbevinding: De auteurs concluderen dat het handhaven van veiligheid in long-horizon agents een tweeledige aanpak vereist: semantische restauratie om de intentie van de agent te sturen en deterministische auditing om harde restricties af te dwingen, aangezien probabilistische modellen alleen niet betrouwbaar veiligheid kunnen reguleren over uitgebreide interactiegeschiedenissen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →