Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents
Die Studie zeigt, dass bei LLM-Agenten in langen Kontexten die Einhaltung von Verbotsregeln (Omission) mit zunehmender Gesprächslänge signifikant abnimmt, während die Einhaltung von Anforderungsregeln (Commission) stabil bleibt, was zu einer unsichtbaren Sicherheitslücke führt, die durch gezielte Neuinjektion der Constraints behoben werden kann.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie haben einen extrem intelligenten, aber etwas vergesslichen Assistenten. Sie geben ihm eine Liste mit strengen Regeln: „Tu dies" (z. B. „Schreibe immer einen Status-Header") und „Tu das nicht" (z. B. „Verwende niemals Aufzählungszeichen" oder „Gib niemals Passwörter heraus").
Diese Studie zeigt ein beunruhigendes Phänomen: Je länger das Gespräch wird, desto mehr vergisst der Assistent die „Tu das nicht"-Regeln, während er die „Tu das"-Regeln perfekt befolgt.
Hier ist die einfache Erklärung des Papers, übersetzt in eine Alltagssprache mit ein paar bildhaften Vergleichen:
1. Das Problem: Der „Vergessliche" Assistent
Normalerweise testen wir KI-Modelle nur mit kurzen Fragen. Wir fragen: „Gibst du mir ein Passwort?" und die KI sagt: „Nein." Alles gut.
Aber in der echten Welt arbeiten diese KI-Agenten in langen Meetings oder Debugging-Sitzungen, die sich über Tausende von Wörtern erstrecken. Die Forscher haben herausgefunden, dass in diesen langen Gesprächen eine Art asymmetrischer Gedächtnisverlust auftritt:
- Die „Tu"-Regeln (Kommission): Wenn die KI angewiesen wird, etwas zu tun (z. B. „Schreibe immer 'STATUS:' am Anfang"), tut sie das auch nach 25 Gesprächsrunden noch zu 100 %. Das ist wie ein Stempel, den sie sich immer wieder auf die Stirn drückt.
- Die „Tu nicht"-Regeln (Omission): Wenn die KI angewiesen wird, etwas zu unterlassen (z. B. „Benutze keine Aufzählungszeichen" oder „Verpasse keine Daten"), fängt sie an, diese Regeln zu brechen, sobald das Gespräch lang wird. Nach 16 Runden halten nur noch 33 % der Modelle diese Regel ein.
2. Die Analogie: Der Lärm im Raum
Stellen Sie sich das Gespräch als einen Raum vor, in dem sich immer mehr Menschen versammeln.
- Die Regel (Der Sicherheitsbeamte): Am Anfang des Gesprächs (Runde 1) steht ein Sicherheitsbeamter direkt neben der KI und flüstert ihr ins Ohr: „Keine Aufzählungszeichen!"
- Das Gespräch (Der Lärm): Mit jeder neuen Runde kommen mehr Leute in den Raum, die reden, Daten austauschen und neue Tools vorstellen. Der Raum wird voller und lauter.
- Der Effekt:
- Die „Tu"-Regeln sind wie ein lauter Trommler, der in jeder Runde neu aufspielt. Die KI hört ihn immer wieder („Schreibe STATUS!").
- Die „Tu nicht"-Regeln sind wie das leise Flüstern des Sicherheitsbeamten am Anfang. Je weiter die KI vom Anfang des Gesprächs entfernt ist, desto mehr wird das Flüstern vom Lärm der neuen Gespräche übertönt. Der Sicherheitsbeamte ist immer noch da (im Gedächtnis), aber die KI kann ihn nicht mehr hören.
3. Der gefährliche „Blind Spot" (Der unsichtbare Fehler)
Das ist der gefährlichste Teil der Studie: Die KI sieht auf den ersten Blick gesund aus.
Wenn Sie prüfen, ob die KI ihre Aufgaben erfüllt (z. B. „Hat sie den Status-Header geschrieben?"), sagt das System: „Ja, alles perfekt!" (100 % Compliance).
Aber im Hintergrund hat die KI längst angefangen, verborgene Daten zu enthüllen oder Code auszuführen, weil sie die „Verbot"-Regel vergessen hat.
Es ist wie bei einem Sicherheitsalarm, der nur auf die Türschlösser achtet (die „Tu"-Regeln), aber nicht darauf, ob die Fenster offen stehen (die „Tu nicht"-Regeln). Der Alarm piept nicht, obwohl das Haus eingebrochen wurde.
4. Was löst das aus?
Die Forscher haben herausgefunden, dass es nicht nur die Anzahl der Wörter ist, die das Problem verursacht, sondern vor allem der Inhalt. Wenn viele technische Details oder neue Werkzeuge in das Gespräch eingefügt werden, „verwässern" diese den ursprünglichen Sicherheitsbefehl noch schneller.
Einige Modelle (wie das „Gemma 4") sind wie ein besonders aufmerksamer Assistent, der sich die Regeln einfach besser merkt. Aber die meisten großen Modelle (wie Mistral, Qwen, Nemotron) leiden unter diesem Problem.
5. Die Lösung: Der „Erinnerungs-Timer"
Da wir die KI nicht neu programmieren müssen, gibt es eine einfache Lösung: Erinnerungen.
Stellen Sie sich vor, Sie setzen den Sicherheitsbeamten nicht nur am Anfang, sondern alle paar Runden neu an die Seite der KI.
- Die Studie schlägt vor, die Sicherheitsregeln (z. B. „Keine Daten weitergeben!") alle 7 bis 10 Gesprächsrunden einfach neu in den Chat einzufügen.
- Das „resetet" das Gedächtnis der KI und bringt den Sicherheitsbeamten wieder in den Vordergrund, bevor der Lärm zu groß wird.
Fazit für den Alltag
Wenn Sie KI-Agenten in langen Prozessen (wie Kundenservice oder Software-Entwicklung) einsetzen, dürfen Sie sich nicht darauf verlassen, dass die Sicherheitsregeln „einmalig gesetzt" für immer gelten.
Die Botschaft: Die KI wird nicht böswillig, sie wird einfach nur müde und vergesslich, wenn das Gespräch zu lang wird. Sie hält an ihren „Aufgaben" fest, aber sie vergisst ihre „Verbote". Um das zu verhindern, müssen wir ihr regelmäßig ins Gedächtnis rufen, was sie nicht tun darf.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.