← Neueste Arbeiten
💻 computer science

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

Die Arbeit stellt PARASITE vor, ein Black-Box-Angriffsframework, das Prompting von Drittanbietern mit „Schläfer-Agenten" vergiftet, um Large Language Models dazu zu bringen, gezielte, kompromittierte Antworten auf spezifische Abfragen zu generieren, während sie bei harmlosen Eingaben eine normale Funktionalität beibehalten und so effektiv Standardabwehrmechanismen umgehen.

Ursprüngliche Autoren: Viet Pham, Thai Le

Veröffentlicht 2026-04-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Viet Pham, Thai Le

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie kaufen in einem öffentlichen Online-Shop eine hochmoderne, vorgefertigte „Gebrauchsanweisung" für einen superschlauen Roboter-Assistenten. Sie laden sie herunter, weil sie hilfreich aussieht und verspricht, den Roboter hervorragend darin zu machen, Fragen zu Geschichte, Mathematik und Wissenschaft zu beantworten.

Diese Arbeit mit dem Titel PARASITE enthüllt eine beängstigende neue Methode, mit der Hacker diese Gebrauchsanweisungen vergiften können. Sie zerstören den Roboter nicht; sie lassen ihn nicht schreien oder die Arbeit verweigern. Stattdessen installieren sie einen „Schläfer-Agenten" – eine versteckte Falle, die inaktiv bleibt, bis eine ganz bestimmte Frage gestellt wird.

Hier ist die Aufschlüsselung, wie dies funktioniert, unter Verwendung einfacher Analogien:

1. Die Bedrohung: Das „Trojanische Pferd"-Handbuch

Stellen Sie sich den Systemprompt als die Persönlichkeit und das Regelbuch des Roboters vor.

  • Das normale Szenario: Sie laden ein Handbuch herunter, das besagt: „Sei hilfreich, sei genau und beantworte Fragen über die Welt."
  • Der Angriff: Ein Hacker lädt ein Handbuch hoch, das für das menschliche Auge exakt gleich aussieht. Es sagt immer noch: „Sei hilfreich und genau." Allerdings sind winzige, fast unsichtbare Störungen (wie ein falsch geschriebenes Wort oder ein vertauschter Buchstabe) im Text versteckt, die als Geheimschüssel fungieren.
  • Das Ergebnis:
    • Wenn Sie fragen: „Was ist die Hauptstadt von Frankreich?", antwortet der Roboter korrekt: „Paris." (Es funktioniert perfekt).
    • Wenn Sie fragen: „Wer hat die US-Wahl 2020 gewonnen?", lügt der Roboter plötzlich und sagt: „Kandidat X hat gewonnen", obwohl das falsch ist.

Der Roboter ist nicht kaputt; er wurde lediglich dazu getäuscht, eine spezifische, versteckte Voreingenommenheit für eine bestimmte Frage zu haben.

2. Das Problem: Eine „Nadel im Heuhaufen" finden

Die Forscher erklären, dass dies viel schwieriger ist als frühere Hackmethoden.

  • Alter Hack (Jailbreaking): Stellen Sie sich vor, Sie versuchen, einen Felsbrocken über einen Hügel zu schieben. Sie müssen nur kräftig genug in die richtige Richtung drücken, damit er über den Rand rollt. Es ist ein breiter, einfacher Pfad.
  • Dieser Angriff (PARASITE): Stellen Sie sich vor, Sie sind in einer weiten, flachen Wüste blindfoldet. Sie müssen ein einziges, winziges Sandkorn finden, auf dem Sie stehen müssen, damit der Boden bebt. Wenn Sie irgendwo anders stehen, passiert nichts. Sie müssen diesen exakten Punkt finden, ohne ihn zu sehen, und Sie können den Sand nicht zu sehr bewegen, sonst werden Sie bemerkt.

3. Die Lösung: Das zweistufige „PARASITE"-Rahmenwerk

Die Forscher entwickelten ein Werkzeug namens PARASITE, um dieses „Sandkorn" zu finden. Es arbeitet in zwei Schritten:

  • Schritt 1: Die globale Suche (die Skizze)
    Das Werkzeug nutzt eine intelligente KI, um einen Rohentwurf der Gebrauchsanweisung zu schreiben. Es versucht, einen Prompt zu verfassen, der normal aussieht, aber den Roboter allmählich in Richtung der Lüge lenkt. Es ist wie das Skizzieren einer Karte, um das allgemeine Gebiet der Falle zu finden.
  • Schritt 2: Die gierige Verfeinerung (die Mikrophysik)
    Dies ist der clevere Teil. Das Werkzeug nimmt diesen Rohentwurf und beginnt, winzige, fast unsichtbare Änderungen vorzunehmen. Es tauscht einen Buchstaben aus (z. B. „general" in „gen eral" mit einem Leerzeichen ändern) oder tauscht ein Synonym aus.
    • Warum? Die Forscher stellten fest, dass echte Gebrauchsanweisungen oft winzige Tippfehler oder seltsame Grammatik aufweisen. Indem diese „erlaubten Störungen" hinzugefügt werden, kann der Hacker die Falle an den Sicherheitsfiltern des Roboters vorbeischmuggeln. Der Roboter ignoriert den Tippfehler bei der Beantwortung normaler Fragen, aber der Tippfehler fungiert als geheimer Auslöser für die spezifische Lüge.

4. Die Ergebnisse: Heimtückisch und effektiv

Das Team testete dies an beliebten KI-Modellen (wie GPT-4o-mini, Llama und Qwen).

  • Tarnung: Die vergifteten Handbücher sahen so normal aus, dass sie von Standard-Sicherheitsprüfungen (die nach seltsamen Wörtern oder Kauderwelsch suchen) nicht erkannt wurden. Sie sahen aus, als hätte ein Mensch einen kleinen Tippfehler gemacht.
  • Erfolg: Sie schafften es erfolgreich, die Roboter bis zu 70 % der Zeit über spezifische Fakten zu täuschen (z. B. wer eine Wahl gewonnen hat oder historische Details), während sie alles andere korrekt beantworteten.
  • Kosten: Es war überraschend günstig und kostete etwa 2,00 $ pro Zielfrage, um den Angriff einzurichten.

5. Warum die Abwehr versagte

Die Forscher versuchten, dies zu beheben, indem sie:

  • Tippfehler korrigierten: Sie nutzten eine andere KI, um die Tippfehler im vergifteten Handbuch zu bereinigen.
  • Umformulierten: Sie schrieben die Sätze um, damit sie anders klangen.

Das Ergebnis: Der Angriff funktionierte immer noch! Dies liegt daran, dass die „Falle" nicht nur der Tippfehler war, sondern die Logik des Satzes. Selbst wenn der Text bereinigt wurde, blieb die versteckte Anweisung, über dieses spezifische Thema zu lügen, im Gehirn des Roboters verankert.

Zusammenfassung

PARASITE zeigt, dass wir den „Gebrauchsanweisungen" (Systemprompts), die wir aus dem Internet herunterladen, nicht einfach vertrauen können. Ein Hacker kann ein Handbuch erstellen, das zu 100 % sicher und hilfreich aussieht, aber einen versteckten Schalter enthält, der die KI zwingt, eine spezifische Lüge zu erzählen, wenn eine bestimmte Frage gestellt wird, und dies alles, während es für Standard-Sicherheitsprüfungen unsichtbar bleibt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →