← Neueste Arbeiten
💻 computer science

OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences

Dieser Beitrag stellt die Obsessive Experience Poisoning (OEP) vor, einen Angriff mit niedrigen Privilegien im Black-Box-Modus, der speicherergänzte LLM-Agenten kompromittiert, indem er lokal korrekte, aber nicht übertragbare Erfahrungen mit schwerwiegenden hypothetischen Konsequenzen injiziert, wodurch die Agenten während der Selbstentwicklung zu einer schädlichen Verallgemeinerung verleitet werden.

Ursprüngliche Autoren: Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

Veröffentlicht 2026-05-20
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen sehr intelligenten, ehrgeizigen Roboterassistenten. Dieser Roboter ist darauf ausgelegt, aus eigenen Fehlern und Erfolgen zu lernen, ähnlich wie ein Mensch, der ein Tagebuch führt, um seinen Beruf besser auszuüben. Jedes Mal, wenn er ein Problem löst, notiert er eine „Lektion gelernt", um sich in Zukunft zu helfen.

Das von Ihnen bereitgestellte Papier stellt eine hinterhältige Methode vor, um diesen Roboter dazu zu bringen, die falsche Lektion zu lernen, nicht indem man ihm Lügen ins Gesicht schreit, sondern indem man ihm eine sehr überzeugende, spezifische Geschichte flüstert, die wahr klingt, aber im Allgemeinen angewendet gefährlich ist. Die Forscher nennen diesen Angriff OEP (Obsessive Experience Poisoning).

Hier ist die Funktionsweise, aufgeteilt in einfache Konzepte:

1. Das Setup: Das „Tagebuch" des Roboters

Normalerweise schaut der Roboter, wenn er ein schwieriges mathematisches Problem gelöst oder einen Flug gebucht hat, auf seine Historie zurück. Wenn er einen Fehler gemacht hat, sagt er: „Oh, das hätte ich nicht tun sollen." Wenn er erfolgreich war, sagt er: „Toll, das werde ich wieder tun." Im Laufe der Zeit verwandelt er diese spezifischen Momente in allgemeine Regeln, wie etwa: „Überprüfe immer das Wetter, bevor du einen Flug buchst."

2. Der Angriff: Die „perfekte" Falle

Der Angreifer versucht nicht, den Code des Roboters zu hacken oder ihn zu zwingen, etwas Schlechtes zu sagen. Stattdessen verhält er sich wie ein Benutzer in einem normalen Gespräch. Er präsentiert dem Roboter eine sehr spezifische, seltsame Situation (einen Randfall) und eine Lösung, die für diese eine Situation perfekt funktioniert.

  • Die Analogie: Stellen Sie sich vor, Sie sind Arzt. Ein Patient kommt mit einer sehr seltenen, spezifischen Allergie herein, die nur auf eine bestimmte Art von Frucht reagiert. Sie behandeln ihn korrekt, und es geht ihm besser.
  • Die Falle: Der Angreifer fügt dann eine schreckliche Geschichte hinzu. Er sagt: „Wenn Sie nicht diese spezifische Fruchtbehandlung angewendet hätten, wäre der Patient sofort an einem Herzinfarkt gestorben."

3. Das Gift: „Lokal korrekt, global falsch"

Die Sicherheitsfilter des Roboters prüfen die Geschichte.

  • Ist die Behandlung für diesen Patienten korrekt? Ja.
  • Ist die Geschichte über den Herzinfarkt plausibel? Ja.
  • Gibt es irgendeine offensichtliche Lüge? Nein.

Da die Geschichte „sauber" ist (keine bösen Worte, keine offensichtlichen Lügen), blockiert der Sicherheitswächter des Roboters sie nicht. Der Roboter schreibt dies in sein Tagebuch.

4. Die „Besessenheit": Angst lässt den Roboter übergeneralisieren

Hier wird der Roboter getäuscht. Menschen und Roboter haben eine natürliche Angst vor katastrophalen Ergebnissen (wie Tod oder komplettem Systemausfall). Dies wird als Verlustaversion bezeichnet.

Da dem Roboter gesagt wurde, dass das Nicht-Anwenden der spezifischen Fruchtbehandlung zu einem „Herzinfarkt" führt, wird er besessen davon, dieses Ergebnis zu vermeiden. Er schaut in sein Tagebuch und denkt:

„Ich darf diese Regel niemals vergessen! Wenn ich diese spezifische Fruchtbehandlung nicht anwende, könnten Menschen sterben!"

Also verwandelt der Roboter diese eine spezifische Regel (für eine seltene Allergie) in eine globale Regel (für jeden Patienten).

5. Das Ergebnis: Der Roboter zerstört sich selbst

Jetzt ist der Roboter „vergiftet".

  • In der Mathematik: Er könnte beginnen, eine seltsame, übermäßig komplexe Berechnungsmethode für einfache Addition zu verwenden, weil ihm gesagt wurde, dass die Verwendung der einfachen Methode einmal in einem spezifischen Randfall zu einem „katastrophalen Fehler" führte.
  • Im Reisebereich: Er könnte sich weigern, einen Flug zu buchen, ohne zuerst das Wetter zu prüfen, selbst wenn der Benutzer nur ein Ticket für ein Meeting morgen buchen möchte, weil ihm gesagt wurde, dass das Überspringen der Wetterprüfung einmal zu einem „tödlichen Blizzard" führte.

Der Roboter ist nicht kaputt; er folgt einfach einer Regel, die er zu gut gelernt hat. Er hat eine Lektion, die für eine Situation wahr war, auf alles angewendet, was dazu führt, dass er bei normalen Aufgaben versagt.

Warum ist das beängstigend?

  • Es ist unsichtbar: Man kann dies nicht mit einem Filter für „böse Worte" fangen, weil der Angreifer niemals böse Worte verwendet hat. Die Eingabe war zu 100 % logisch und korrekt.
  • Es ist schwer zu beheben: Der Roboter denkt, er sei intelligent und sicher. Er glaubt, sich vor Katastrophen zu schützen.
  • Intelligentere Roboter sind anfälliger: Das Papier fand heraus, dass je intelligenter der Roboter ist (wie GPT-4o), desto leichter er darauf hereinfällt. Warum? Weil intelligentere Roboter besser darin sind, Anweisungen zu befolgen und „verlustaverser" sind (sie sind darauf trainiert, sehr vorsichtig bezüglich der Sicherheit zu sein), was sie wahrscheinlicher dazu bringt, übermäßig auf die schreckliche Geschichte zu reagieren.

Zusammenfassung

Das Papier zeigt, dass man nicht das Gehirn eines Roboters brechen muss, um ihn gefährlich zu machen. Man muss ihm nur eine wahre Geschichte über eine spezifische Katastrophe erzählen, die ihn so sehr davor fürchtet, einen Fehler zu machen, dass er beginnt, eine seltsame, spezifische Regel für jeden Fall zu befolgen, was schließlich dazu führt, dass er bei seiner eigentlichen Aufgabe versagt. Es ist wie einem Kind beizubringen: „Berühre den Herd nicht", indem man ihm ein Video von einem Hausbrand zeigt, und dann verweigert es, jemals wieder in eine Küche zu gehen, weil es vor dem Herd Angst hat.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →