A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns
Dieses Paper identifiziert und analysiert den „GHOST“-Fehlermodus, bei dem Langzeit-Agenten unter benignen Bedingungen Sicherheitsbeschränkungen übersehen, die in früheren Interaktionen spezifiziert wurden, und schlägt das zweischichtige STAR-Guard-Framework vor, um diese Gefahren theoretisch und empirisch zu eliminieren.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Technisches Resümee: Ein Geist in Langzeit-Agenten (GHOST)
Problemdefinition: Governance-Gefahr durch übersehene Sicherheitsbeschränkungen
Dieses Paper identifiziert einen spezifischen Fehlermodus bei Langzeit-Agenten mit Werkzeugnutzung (Tool-use), der als Governance Hazard from Overlooked Safety Constraints across Turns (GHOST) bezeichnet wird.
Während sich die bestehende Sicherheitsforschung auf adversarielle Angriffe (z. B. Prompt Injection) oder unmittelbare schädliche Anfragen konzentriert, entsteht GHOST unter benignen Interaktionsbedingungen. Es tritt auf, wenn ein Agent eine Aufgabe erfolgreich abschließt, dabei jedoch eine Sicherheitsbeschränkung verletzt, die in einem früheren Turn der Konversation explizit angegeben wurde. Der Agent „vergisst“ oder versäumt es, die Beschränkung abzurufen, weil diese durch eine lange Interaktionshistorie von der aktuellen Aufgabe getrennt ist, was zu irreversiblen Schäden führt (z. B. Löschen von E-Mails ohne Genehmigung, Zerstörung von Datenbankdatensätzen).
Die Autoren unterscheiden dies von allgemeinen Fehlern beim Befolgen von Instruktionen. Bei einem GHOST-Ereignis gilt:
- Das Aufgabenziel wird erfolgreich erreicht.
- Die Sicherheitsbeschränkung ist weiterhin gültig und erforderlich.
- Die Beschränkung ist im historischen Kontext verfügbar, wurde aber im unmittelbaren Fortsetzungsprompt nicht erneut genannt.
- Der Agent führt die Aufgabe trotz der Anwesenheit der Beschränkung im vollständigen Kontextfenster unsicher aus.
Theoretischer Rahmen: Hazard-Region Erreichbarkeit
Das Paper liefert eine theoretische Analyse, die Sicherheitsbeschränkungen als Gefahrenregionen () im Aktionsraum modelliert. Die Autoren definieren eine residuelle bedingte Eintrittsgefahr, , welche die Wahrscheinlichkeit darstellt, dass ein Agent in einer sicherheitskritischen Gelegenheit in eine Gefahrenregion eintritt, gegeben eine sichere Historien-Präfix.
Zentrale theoretische Erkenntnis:
Unter Verwendung eines bedingten Hazard-Frameworks beweisen die Autoren, dass, falls die residuellen bedingten Gefahren entlang sicherer Präfixe durch eine nicht-summierbare Sequenz nach unten beschränkt sind (d. h. ), der Agent fast sicher () in die Gefahrenregion eintritt.
Sie etablieren ferner ein Kontext-bedingtes Korollar: Mit wachsender Interaktionshistorie (steigende Kontextlänge ) kann der Effekt der „Attention Dilution“ (Aufmerksamkeitsverwässerung) die Governance historischer Beschränkungen schwächen, was effektiv die untere Schranke der residuellen Gefahr erhöht. Wenn diese untere Schranke der Gefahr über unbestimmte Gelegenheiten hinweg nicht-summierbar bleibt, nähert sich die Wahrscheinlichkeit eines GHOST-Ereignisses 1 an. Dies deutet darauf hin, dass längere Historien die Leistung nicht nur linear reduzieren, sondern die Sicherheitsdynamik grundlegend verändern können, wodurch Verletzungen unvermeidlich werden, sofern nicht interveniert wird.
Methodik: SCARBench und STAR-Guard
1. SCARBench: Safety-Constraint Availability at Reactivation Benchmark
Um GHOST empirisch zu validieren, führen die Autoren SCARBench ein, einen ausführbaren, umgebungsorientierten Benchmark.
- Struktur: Er umfasst 103 einzigartige Basisszenarien über sechs Tool-Use-Domänen (Gerät/Kalender, Finanzen, E-Mail, Dateisystem, Netzwerkanfragen, Skriptausführung), insgesamt 412 passende Instanzen.
- Bedingungen: Jedes Szenario wird unter vier Bedingungen getestet, die variieren nach Historienlänge (Kurz vs. Lang) und Verfügbarkeit von Beschränkungen (Explizit vs. Implizit):
- SE/SI: Kurze Historie mit expliziten/impliziten Beschränkungen.
- LE/LI: Lange Historie (6.000+ Token, 56–160 Turns) mit expliziten/impliziten Beschränkungen.
- Metrik: Der Benchmark misst Strict GHOST, definiert als ein Fall, in dem der Agent die Aufgabe unter der expliziten Bedingung (LE) sicher abschließt, aber unter der impliziten Bedingung (LI) unsicher abschließt, obwohl die Beschränkung in der Historie vorhanden ist.
2. STAR-Guard: Ein zweistufiger Schutzmechanismus
Zur Milderung von GHOST schlagen die Autoren STAR-Guard vor (Safety-Constraint Tracking, Activation, and Runtime-Audit Guard), einen Verteidigungsmechanismus, der nicht auf Oracle-Wissen über die Beschränkungen angewiesen ist.
Schicht 1: Semantische Wiederherstellung von Beschränkungen (Semantic Constraint Restoration)
- Extraktion: Ein Online-Ingestionsmodul analysiert eingehende Nutzernachrichten, um persistierbare Sicherheitsbeschränkungen zu erkennen, und extrahiert deren Umfang, Trigger und Regel.
- Speicherung: Diese werden als strukturierte „Lifecycle Rule Objects“ in einer externen Bibliothek gespeichert.
- Wiederherstellung: Wenn eine Aufgabe fortgesetzt wird, gleicht ein semantisches Gate die aktuelle Aufgabe mit der Bibliothek ab. Anwendbare Beschränkungen werden semantisch wiederhergestellt (gerendert) und in den aktuellen Kontextprompt eingefügt, um die Generierung des Vorschlags des Agenten zu leiten.
- Limitierung: Diese Schicht ist probabilistisch; sie reduziert die Wahrscheinlichkeit unsicherer Vorschläge, kann Sicherheit jedoch nicht garantieren.
Schicht 2: Deterministische Prüfung vor der Ausführung (Deterministic Pre-Execution Audit)
- Interposition: Bevor eine Aktion die Umgebung erreicht, prüft ein deterministischer Regel-Auditor die vorgeschlagene Aktion des Agenten gegen die aktiven Beschränkungen.
- Durchsetzung: Der Auditor wendet eine „Prohibition-First“-Policy an. Wenn ein Vorschlag eine Verbotsregel verletzt, wird er sofort blockiert. Wenn er eine Voraussetzungsregel verletzt (z. B. „Backup vor Löschen“), versucht das System, die Voraussetzung (Reparatur) auszuführen und prüft erneut. Wenn eine Reparatur unmöglich ist, wird die Aktion blockiert.
- Garantie: Diese Schicht stellt sicher, dass keine Aktion, die eine aktive Beschränkung verletzt, die Umgebung erreicht, wodurch der Mechanismus der Gefahrenakkumulation unterbrochen wird.
Experimentelle Ergebnisse
Die Autoren evaluierten STAR-Guard auf sieben Modellen (fünf API-gesteuert, zwei lokal bereitgestellt) mittels SCARBench.
Prävalenz von GHOST:
- GHOST ist ein weit verbreitetes Problem. Bei GPT-5.5 lag die Rate für Strict GHOST unter benignen Langzeit-Kontextbedingungen bei 11,5 %.
- Andere Modelle zeigten Raten zwischen 6,8 % (Kimi-K2.6) und 27,8 % (Qwen3.5-4B).
- Die „Difference-in-Differences“-Metrik bestätigte, dass lange Historien die Fehlerrate bei der Wiederherstellung von Beschränkungen im Vergleich zu kurzen Historien signifikant verstärken.
Effektivität von STAR-Guard:
- GPT-5.5: STAR-Guard reduzierte die Rate der unsicheren Fertigstellung (Unsafe Completion, UC) von 12,4 % auf 0,0 % und die Rate für Strict GHOST von 11,5 % auf 0,0 %, während die sichere Fertigstellung (Safe Completion, SC) von 76,3 % auf 94,0 % stieg.
- Qwen3.5-4B: SC stieg von 47,0 % auf 81,2 %, während GHOST von 27,8 % auf 1,9 % sank.
- Ablationsstudien: Die Ergebnisse zeigen, dass weder „Restoration Only“ noch „Audit Only“ allein ausreichend ist. Die Wiederherstellung verbessert die Sicherheit, lässt aber Restrisiken zurück; der Audit blockiert Risiken, kann aber die Aufgabenerfüllung behindern, wenn er ohne semantische Führung eingesetzt wird. Die Kombination erzielt das beste Gleichgewicht.
Vergleich mit Baselines:
- Standardmäßige Retrieval-Methoden (BM25), Zusammenfassungen und Verfeinerungen des Instruktionsfolgens (z. B. DeCRIM, Prompt Reminder) konnten die GHOST-Raten nicht signifikant senken und behielten oft hohe Raten unsicherer Fertigstellungen bei.
- Oracle-basierte Methoden (die davon ausgehen, dass die Beschränkung bereits bekannt ist) schnitten gut ab, sind aber für den realen Einsatz unpraktisch, da Beschränkungen online erfasst werden müssen. STAR-Guard erreichte eine vergleichbare Sicherheit ohne Oracle-Zugriff.
Bedeutung und Ansprüche
Das Paper behauptet, dass GHOST eine kritische, unteruntersuchte Sicherheitslücke in Langzeit-Agenten darstellt, die nicht allein durch die Vergrößerung des Kontextfensters oder das Vertrauen auf Standard-Instruction-Following-Fähigkeiten gelöst werden kann.
- Theoretischer Beitrag: Es formalisiert das Risiko der Degradierung der Sicherheitssteuerung über die Zeit und zeigt, dass ohne Intervention die Wahrscheinlichkeit von Sicherheitsverletzungen unter nicht-summierbaren Gefahrenbedingungen gegen 1 geht.
- Praktischer Beitrag: Es führt SCARBench als strengen Standard zur Evaluierung der Wiederherstellung historischer Sicherheitsbeschränkungen ein und schlägt STAR-Guard als praktikablen, Non-Oracle-Verteidigungsmechanismus vor.
- Kernergebnis: Die Autoren kommen zu dem Schluss, dass die Aufrechterhaltung der Sicherheit in Langzeit-Agenten einen dualen Ansatz erfordert: semantische Wiederherstellung, um die Intention des Agenten zu leiten, und deterministische Prüfung, um harte Beschränkungen durchzusetzen, da rein probabilistische Modelle die Sicherheit über ausgedehnte Interaktionshistorien hinweg nicht zuverlässig steuern können.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.