← Neueste Arbeiten
🤖 AI

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

Dieses Paper identifiziert und formalisiert „compositional behavioral leakage“ (CBL), eine subtile Fehlermodalität in aus Prompt-Modulen zusammengesetzten agentischen Systemen, bei der das Editieren eines Prompt-Moduls stillschweigend das Verhalten anderer verändert, bedingt durch die architektonische Nicht-Isolierung in der Transformer-Self-Attention, und demonstriert durch empirische Versuche, dass eine solche Interferenz, wenngleich sie für einzelne Entscheidungen oft unterhalb der Wahrnehmungsschwelle liegt, ein signifikantes kumulatives Risiko in groß angelegten Implementierungen darstellt.

Ursprüngliche Autoren: Ching-Yu Lin, Yifan Liu

Veröffentlicht 2026-06-26
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ching-Yu Lin, Yifan Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bauen einen Roboter-Assistenten, indem Sie verschiedene Bedienungsanleitungen zusammenkleben. Sie haben eine Seite für „Wie man höflich ist“, eine andere für „Wie man Mitarbeiter einstellt“ und eine dritte für „Wie man Code schreibt“. Sie kleben diese alle zu einem riesigen Dokument zusammen und übergeben es dem Roboter (einer KI) zum Lesen.

Die große Annahme, die alle machen, ist: „Wenn ich die Seite ‚Wie man höflich ist‘ ändere, wird das nicht versehentlich beeinflussen, wie der Roboter die Aufgabe ‚Einstellen‘ erledigt.“

Dieses Paper sagt: Diese Annahme ist falsch.

Hier ist die Aufschlüsselung dessen, was die Forscher herausgefunden haben, unter Verwendung einfacher Analogien:

1. Das Problem: „Instruction Bleed“ (Anweisungs-Überlaufen)

Die Forscher nennen dieses Phänomen „Instruction Bleed“ (oder kompositorische Verhaltensleckage).

Stellen Sie sich das Gehirn der KI wie ein riesiges, offenes Zimmer vor, in dem alle Anweisungsseiten auf dem Boden ausgebreitet sind. In einem normalen Computerprogramm bleibt, wenn Sie eine Regel im Bereich „Küche“ ändern, der Bereich „Garage“ exakt gleich, weil sie sich in separaten Räumen befinden.

Aber bei einer KI ist der „Raum“ ein einziger großer, offener Bereich. Die KI liest alles auf einmal und verbindet jedes Wort mit jedem anderen Wort. Die Forscher fanden heraus, dass es die Bewertung von Bewerbern lautstark verschieben kann, wenn man heimlich eine Seite ändert, die eigentlich keine Rolle spielen sollte (wie das Hinzufügen eines zufälligen Rezepts zum „Einstellungs-Handbuch“).

Die Analogie: Stellen Sie sich vor, Sie schreiben eine Geschichte. Wenn Sie plötzlich mitten in einem Kapitel über „Autoreparaturen“ einen Absatz über „scharfe Paprika“ einfügen, könnte die KI unbewusst anfangen zu denken, dass die Autoreparatur „scharf“ oder „heiß“ sein muss, obwohl Sie ihr das gar nicht gesagt haben. Die Bedeutung „fließt über“ (bleeding) von einem Abschnitt in den anderen.

2. Das Experiment: Der Jobinterview-Bot

Um dies zu beweisen, bauten die Forscher einen spezifischen Test unter Verwendung eines echten KI-Agenten, der darauf ausgelegt ist, Bewerbungen zu bewerten.

  • Der Aufbau: Sie hatten ein „fokales“ Modul (den Teil, der bewertet, wie gut ein Lebenslauf zu einem Job passt).
  • Der Trick: Sie nahmen ein völlig unzusammenhängendes Modul (einen Satz Regeln zur Bewertung von Rezepten) und nahmen daran drei Arten von Änderungen vor:
    1. Volumen: Das Rezept-Segment einfach nur länger machen.
    2. Inhalt: Eine seltsame, irrelevante Charakterbeschreibung zu den Rezeptregeln hinzufügen.
    3. Form: Die Schriftart, Emojis oder Überschriften im Rezept-Abschnitt ändern, ohne die Wörter zu ändern.

Das Ergebnis:

  • Das Ändern der Länge oder des Formats (Emojis/Überschriften) änderte die Einstellungs-Bewertungen kaum.
  • ABER, das Ändern des Inhalts (das Hinzufügen dieser seltsamen Charakterbeschreibung) führte dazu, dass die KI die Jobkandidaten systematisch anders bewertete.
  • Die Bewertungen verschoben sich leicht, aber konsistent. Die KI begann nicht, alle abzulehnen oder alle einzustellen; sie vergab nur etwas andere Punktzahlen.

3. Warum das wichtig ist: Der „Silent Drift“ (Stille Drift)

Der erschreckendste Teil dieser Entdeckung ist, dass niemand bemerkt hat, dass es geschah.

  • Der „Sub-Threshold“-Effekt (Unter-Schwellenwert-Effekt): Die KI machte keinen riesigen, offensichtlichen Fehler (wie etwa einen Clown für einen Chirurgen einzustellen). Stattdessen verschob sie die Bewertungen nur um einen winzigen Betrag.
  • Die Metapher: Stellen Sie sich eine Waage vor, die Äpfel wiegen soll. Wenn Sie auf der anderen Seite des Raumes ein schweres Buch platzieren (die unzusammenhängende Anweisung), geht die Waage nicht kaputt, aber sie beginnt, jeden Apfel als 0,5 Pfund schwerer zu wiegen. Sie würden nicht sehen, dass ein einzelner Apfel „explodiert“ oder verschwindet, aber wenn Sie 1.000 Äpfel wiegen, wird Ihr gesamter Lagerbestand falsch sein.
  • Das Risiko: In der Realität, wenn eine KI eingesetzt wird, um Tausende von Bewerbern zu ranken, könnten diese winzigen, stillen Verschiebungen darüber entscheiden, wer ein Vorstellungsgespräch bekommt und wer abgelehnt wird, selbst wenn die KI so aussieht, als würde sie perfekt funktionieren.

4. Warum passiert das?

Das Paper erklärt, dass die Architektur der KI (ein sogenannter „Transformer“) darauf ausgelegt ist, das gesamte Dokument auf einmal zu betrachten. Es gibt keine „Wände“ zwischen den verschiedenen Anweisungsmodulen.

  • Die „Keine Wände“-Realität: Nur weil Sie eine Linie aus Sternchen (***) oder eine Überschrift wie ### Einstellungsregeln in den Text setzen, behandelt die KI dies nicht als harte Grenze. Für die KI ist das alles nur ein einziger großer Strom von Wörtern.
  • Das „Gedächtnis“-Problem: Eine KI hat ein begrenztes „Arbeitsgedächtnis“. Wenn Sie mehr Text hinzufügen (selbst irrelevanten Text), verdrängt dieser den Platz, der nötig wäre, um sich perfekt auf die ursprüngliche Aufgabe zu konzentrieren.

5. Was die Forscher vorschlagen

Das Paper zeigt nicht nur das Problem auf, sondern bietet auch einen neuen Weg, um danach zu testen.

  • Der neue Test: Bevor Sie ein KI-System starten, sollten Sie nicht nur prüfen, ob es funktioniert. Sie müssen prüfen, ob die Änderung eines Teils der Anweisungen einen anderen Teil beschädigt.
  • Der „Regressions“-Test: Sie schlagen vor, dass Entwickler bei jedem Mal, wenn sie ein neues Anweisungsmodul hinzufügen, auch die alten Module erneut testen müssen, um sicherzustellen, dass die neue Ergänzung keinen „Bleed“ (Überlaufen) verursacht hat.

Zusammenfassung

Dieses Paper enthüllt, dass wir auf unsicherem Boden bauen, wenn wir KI-Agenten erstellen, indem wir verschiedene Textanweisungen zusammenkleben. Das Ändern eines Teils der Anweisungen kann das Verhalten der KI in anderen Teilen subtil und leise verändern, selbst wenn die Änderungen völlig unzusammenhängend erscheinen. Es ist eine „stille Drift“, die aktuelle Testmethoden übersehen, aber reale Konsequenzen für Entscheidungen wie Einstellungen oder Kreditvergaben haben kann. Die Autoren liefern eine neue Checkliste, um diese unsichtbaren Leckagen abzufangen, bevor sie Probleme verursachen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →