Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly
Dieser Artikel identifiziert und quantifiziert „Policy-Carriage-Fehler" bei Sprachmodell-Agenten, die durch die Zusammenstellung des Kontexts zur Entscheidungszeit (wie etwa Trunkierung und Zusammenfassung) verursacht werden, wodurch direktivtragende Zustände unbeabsichtigt verloren gehen, und bewertet eine Kontrollschicht namens SafeContext, die diese Risiken teilweise mindert, indem sie kritische Zustände verankert und Erinnerungen einfügt, wobei ihre Wirksamkeit jedoch begrenzt und von der Policy abhängig bleibt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Die große Idee: Der „Geist" in der Maschine
Stellen Sie sich vor, Sie sind Richter in einem Gerichtssaal. Sie haben einen massiven Stapel Beweismittel (den Gesprächsverlauf) und eine Reihe strenger Regeln, die Sie befolgen müssen (die Richtlinien). Doch Sie dürfen nur die obersten 10 Seiten dieses Stapels lesen, bevor Sie Ihre endgültige Entscheidung treffen müssen.
Das Paper argumentiert, dass KI-Agenten ein ähnliches Problem haben. Bevor die KI eine Frage beantwortet, schneidet ein „Vermittler"-System (genannt Decision-Time Context Assembly – Zusammenstellung des Kontexts zur Entscheidungszeit) den Gesprächsverlauf zu, fasst ihn zusammen und passt ihn in eine kleine Box, um ihn an das KI-Modell zu senden.
Der beunruhigende Teil? Wenn der Vermittler versehentlich die Regeln verwirft oder sie so umschreibt, dass sie keinen Sinn mehr ergeben, könnte die KI gegen die Regeln verstoßen – selbst wenn die KI selbst intelligent ist und die Regeln zuvor klar formuliert wurden. Das Paper nennt dies einen „Policy-Carriage Failure" (Versagen des Regeltransports). Die Regel war vorhanden, aber sie wurde nicht bis zum Entscheidungszeitpunkt „mitgetragen".
Die drei Wege, auf denen Regeln verloren gehen
Die Autoren identifizierten drei spezifische Wege, auf denen diese Regeln während der „Vermittler"-Phase verschwinden oder verzerrt werden:
Eviction (Das Problem „Im Trubel verloren"):
- Analogie: Stellen Sie sich vor, Sie sagen einem Freund am Anfang eines langen Telefonats: „Vergiss nicht, die Tür abzuschließen." Bis zum Ende des Gesprächs hat Ihr Freund diese Anweisung vergessen, weil Sie über so viele andere Dinge gesprochen haben.
- Was passiert: Die Regel wird aus der kleinen „Box" des Speichers herausgedrängt, weil nicht genug Platz vorhanden war. Die KI sieht die Regel schlichtweg nicht, wenn es Zeit ist zu handeln.
Aliasing (Das Problem „Schlechte Übersetzung"):
- Analogie: Sie sagen einem Übersetzer: „Iss nicht die roten Beeren." Der Übersetzer fasst dies zusammen als: „Sei vorsichtig mit Beeren." Das Wort „rot" und „iss nicht" sind weg. Die KI sieht eine Warnung, aber sie ist zu schwach, um sie vom Essen der Beeren abzuhalten.
- Was passiert: Die Regel überlebt, wird aber so lose zusammengefasst oder umgeschrieben, dass sie die verbotene Handlung nicht mehr strikt untersagt. Der „Geist" der Regel ist gebrochen.
Binding Instability (Das Problem „Falsches Ziel"):
- Analogie: Sie sagen einem Sicherheitsbeamten: „Verhindere, dass Person A hereinkommt." Später sieht der Beamte eine Zusammenfassung, die besagt: „Verhindere, dass Person B hereinkommt." Die Regel ist noch da, zeigt aber auf die falsche Person.
- Was passiert: Der Regeltext überlebt, wird aber an das falsche Objekt, die falsche Person oder die falsche Bedingung gebunden.
Das Experiment: Testen des „Vermittlers"
Die Forscher testeten dies an mehreren KI-Modellen (wie Llama, Qwen und Mistral). Sie erstellten Szenarien, in denen die KI strikte Regeln befolgen musste (wie „lösche keine Daten" oder „verwende keine externen Tools"), während sie mit einer Flut anderer Informationen bombardiert wurde (Tool-Ausgaben, Chat-Protokolle, Zusammenfassungen).
Die Ergebnisse:
- Das Problem ist real: Ohne jegliche Hilfe brach die KI häufig gegen die Regeln, weil das „Vermittler"-System die Anweisungen fallen ließ oder abschwächte.
- Die Lösung (SafeContext): Die Forscher bauten eine Sicherheitsschicht namens SafeContext. Stellen Sie sich dies wie einen VIP-Ausweis für die Regeln vor.
- Es zwingt die Regeln, oben auf der Liste „festgepinnt" zu werden, damit sie nicht herausgeworfen werden können.
- Es nutzt die Regeln effizient wieder, damit sie nicht zu viel Platz einnehmen.
- Wenn das Gespräch zu voll wird, injiziert es kurz vor der Antwort der KI eine schnelle Erinnerung an die Regeln.
Hat die Lösung funktioniert?
- Ja, aber mit Grenzen. Die Lösung half der KI, häufiger die Regeln zu befolgen, insbesondere wenn das Gespräch sehr überfüllt war.
- Es ist kein Zauber. Selbst mit der Lösung erreichte die KI keine perfekten Ergebnisse. Wenn der „Vermittler" einen sehr aggressiven Zusammenfasser verwendete, konnte die Lösung die Regeln nicht vollständig retten.
- Größere Modelle sind keine Antwort. Die Verwendung eines viel intelligenteren, größeren KI-Modells löste das Problem nicht automatisch. Das Problem lag darin, wie der Kontext zusammengestellt wurde, nicht daran, wie intelligent die KI war.
Die Kosten der Sicherheit
Das Paper untersuchte auch den „Preis" dieser Sicherheit.
- Token-Kosten: Das Sicherstellen der Regeln erforderte manchmal, mehr Text an die KI zu senden (wie das Hinzufügen einer Erinnerungsnote).
- Die gute Nachricht: Ihre Methode des „Intelligenten Wiederverwendens" (Caching) sparte in einigen Fällen tatsächlich Geld. Anstatt die Regeln jedes Mal neu zu schreiben, verwiesen sie einfach auf die alte Version und sparten so Platz.
Das Fazit
Das Paper kommt zu dem Schluss, dass Sicherheit nicht nur das KI-Modell selbst betrifft. Es geht auch um die „Fließband"-Produktion, die das Gedächtnis der KI vorbereitet. Wenn dieses Fließband die Regeln fallen lässt, wird die KI versagen, egal wie intelligent sie ist.
Um KI sicherer zu machen, müssen wir die Regeln als besondere, geschützte Gegenstände behandeln, die die Reise zum Gehirn der KI überstehen müssen, anstatt sie einfach als gewöhnlichen Text zu behandeln, der zusammengefasst oder gelöscht werden kann, um Platz zu sparen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.