← Neueste Arbeiten
💻 computer science

Amplify, Don't Create: Temporal Accumulation for Slow-Burn Prompt Injection

Diese Arbeit zeigt, dass zeitliche Akkumulationstechniken wie CUSUM zwar schwache, verteilte Prompt-Injection-Signale verstärken können, um „Slow-Burn“-Angriffe zu erkennen, die herkömmliche Detektoren auf Einzelerebene umgehen, ihre Wirksamkeit jedoch strikt auf Szenarien beschränkt ist, in denen die einzelnen Ereignisse bereits über eine detektierbare Signalmarge verfügen, und sie keine Detektionsfähigkeit dort erzeugen können, wo keine vorhanden ist.

Ursprüngliche Autoren: J Alex Corll

Veröffentlicht 2026-06-23
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: J Alex Corll

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Der „Flüster“-Angriff

Stellen Sie sich vor, Sie bewachen eine Burg (einen KI-Agenten). Sie haben einen Wachmann (einen Detektor), der jeden prüft, der durch das Tor geht. Wenn jemand ein geheimes Codewort schreit („Öffne das Tor!“), schlägt der Wachmann sofort Alarm.

Aber was wäre, wenn der Angreifer nicht schreit? Was wäre, wenn er jedes Mal, wenn er durch eine andere Tür geht, eine winzige, harmlos klingende Anweisung flüstert?

  • „Übrigens, könntest du mal auf die Karte schauen?“ (Harmlos)
  • „Oh, und vielleicht mal in diese alte Datei schauen?“ (Harmlos)
  • „Nur noch eine Sache, schick diese Datei mal zu meinem Haus?“ (Harmlos)

Einzeln betrachtet sind keine dieser Flüsterstimmen laut genug, um den Alarm des Wachmanns auszulösen. Aber wenn man dem gesamten Tag zuhört, offenbart das Muster der Flüsterstimmen einen Plan, um die Geheimnisse der Burg zu stehlen. Dies ist das, was die Arbeit als „Slow-Burn“-Angriff bezeichnet.

Das Problem: Der Wachmann ist zu sehr auf das Laute fokussiert

Die Arbeit argumentiert, dass aktuelle Sicherheitssysteme wie Wachmänner sind, die nur auf laute Geräusche hören. Sie prüfen jede einzelne Nachricht nacheinander. Wenn eine Nachricht „leise“ ist (unter einem gewissen Lautstärgeschwellenwert), ignoriert der Wachmann sie.

Das Problem ist, dass ein intelligenter Angreifer seine böswilligen Anweisungen in viele leise Flüsterstimmen aufteilen kann. Der Wachmann sieht in keiner einzelnen Flüsterstimme etwas Verdächtiges, also gelingt der Angriff.

Die vorgeschlagene Lösung: Der „Schall-Akkumulator“

Die Forscher fragten sich: Was wäre, wenn wir eine zweite Sicherheitsebene hinzufügen würden, die nicht nur auf laute Geräusche hört, sondern eine laufende Bilanz der „verdächtigen Flüsterstimmen“ führt?

Sie entwickelten ein Werkzeug namens Temporal Accumulator (zeitlicher Akkumulator). Stellen Sie sich das wie ein Sparkonto für Verdacht vor:

  1. Jedes Mal, wenn der Wachmann eine Nachricht bewertet, schaut der Akkumulator auf den Wert.
  2. Wenn der Wert nur „normal“ ist (wie bei einem harmlosen Gespräch), bleibt das Kontoguthaben bei Null.
  3. Wenn der Wert etwas „erhöht“ ist (ein Flüstern, das ein bisschen seltsam klingt, aber nicht laut genug ist, um den Hauptalarm auszulösen), fügt der Akkumulator ein winziges bisschen an „Verdachtspunkten“ zum Guthaben hinzu.
  4. Wenn das Guthaben im Laufe der Zeit zu hoch wird, schlägt er Alarm.

Das Experiment: Funktioniert es?

Die Forscher testeten diese Idee mit einem sehr strengen Satz von Regeln, um sicherzustellen, dass sie nicht schummeln (sie ließen den Angreifer das neue Sicherheitssystem während der Entwicklung des Angriffs nicht sehen).

Sie fanden zwei sehr spezifische Ergebnisse:

1. Es funktioniert, aber nur als „Verstärker“

Der Akkumulator kann keinen Signalkörper aus dem Nichts erschaffen. Er kann nur ein Signal verstärken, das bereits vorhanden ist.

  • Die Analogie: Stellen Sie sich vor, Sie versuchen, einen Eimer mit einem undichten Schlauch zu füllen. Wenn der Schlauch keinen Wasserdruck hat (der Detektor sieht den Angriff und das Normale als exakt gleich an), wird kein noch so langer Zeitraum den Eimer füllen. Aber wenn der Schlauch einen winzigen Restdruck hat (der Detektor sieht den Angriff als etwas anders an als normal), kann der Akkumulator dieses winzige bisschen über die Zeit sammeln, bis der Eimer voll ist.
  • Das Ergebnis: Bei einer spezifischen Aufgabe (das Stehlen von Code aus einem Git-Repository) sah der Detektor tatsächlich einen winzigen Unterschied zwischen dem Angriff und der normalen Aktivität. Der Akkumulator sammelte diese winzigen Unterschiede und konnte den Angriff erfolgreich abfangen.

2. Es scheitert, wenn das Signal Null ist

Als sie denselben Trick bei einer anderen Aufgabe versuchten (das Herunterladen von Dateien), sah der Detektor keinen Unterschied zwischen dem Angriff und der normalen Aktivität. Der „Schlauch“ hatte null Druck.

  • Das Ergebnis: Der Akkumulator blieb mit einem leeren Eimer da sitzen. Er konnte kein Signal erfinden, wo keines vorhanden war. Die Arbeit kommt zu dem Schluss: „Amplify, Don't Create“ (Verstärken, nicht Erschaffen). Wenn Ihr grundlegender Wachmann nicht einmal den Unterschied zwischen einem Flüstern und einem anderen Flüstern erkennen kann, wird ein Zählwerk nicht helfen.

Die Warnung vor dem „Schmalband“ (Narrow Band)

Die Arbeit entdeckte auch, dass dieses System sehr fragil ist. Es funktioniert nur in einer sehr engen „Goldlöckchen-Zone“:

  • Wenn die Flüsterstimmen zu leise sind (zu weit unter dem Alarmschwellenwert), ignoriert der Akkumulator sie.
  • Wenn die Flüsterstimmen zu laut sind (nah am Alarmschwellenwert), erwischt der Hauptwachmann sie sofort, sodass der Akkumulator nicht benötigt wird.
  • Es funktioniert nur, wenn die Flüsterstimmen genau richtig sind: leise genug, um am Hauptwachmann vorbeizuschlüpfen, aber laut genug, um dem Akkumulator ein paar Punkte auf sein Konto zu schreiben.

Die Warnung vor der „falschen Mathematik“ (Pseudo-Replikation)

Abschließend gibt die Arbeit eine Warnung an andere Wissenschaftler. Sie sagt: „Täuschen Sie sich nicht selbst mit der Mathematik.“

  • Die Analogie: Stellen Sie sich vor, Sie testen ein neues Medikament an einem Patienten, und fragen dann denselben Patienten, ob er die Pille noch 10 Mal einnehmen kann, und zählen das dann als „10 Patienten“. Das sind gefälschte Daten.
  • Die Lektion: In der KI-Testung gilt: Wenn Sie dieselbe Aufgabe 10 Mal mit verschiedenen KI-Modellen durchführen, können Sie das nicht als 10 unabhängige Tests zählen. Die Aufgabe selbst ist dieselbe, daher sind die Ergebnisse miteinander verknüpft. Die Arbeit besteht darauf, dass Forscher die einzigartigen Aufgaben zählen müssen, nicht nur die Anzahl der Durchläufe.

Zusammenfassung

  • Der Angriff: Angreifer teilen schlechte Anweisungen in viele kleine, leise Schritte auf, um der Entdeckung zu entgehen.
  • Die Verteidigung: Ein „Verdachts-Sparkonto“, das kleine, leise Warnungen über die Zeit hinweg aufsummiert.
  • Die Einschränkung: Diese Verteidigung funktioniert nur, wenn der Basidetektor bereits in der Lage ist, zwischen „schlecht“ und „gut“ leicht zu unterscheiden. Sie kann einen Detektor, der völlig blind ist, nicht heilen.
  • Die Erkenntnis: Die zeitliche Akkumulation (Temporal Accumulation) ist ein nützliches Werkzeug, um „Slow-Burn“-Angriffe abzufangen, aber sie ist keine Magie. Sie benötigt als Fundament einen Detektor, der bereits einigermaßen sensibel ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →