← Neueste Arbeiten
🤖 machine learning

CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring

Das Papier stellt CALYREX vor, eine Transformer-Architektur, die Cross-Attention einsetzt, um Systemprompts strukturell zu verankern und von Benutzereingaben zu isolieren, wodurch die Befolgung von Anweisungen erheblich verbessert und die Anfälligkeit für Jailbreaks über verschiedene Modellgrößen hinweg reduziert wird.

Ursprüngliche Autoren: Li Lixing

Veröffentlicht 2026-05-12
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Li Lixing

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das Problem: Der „lauter Mitbewohner" vs. der „strenge Chef"

Stellen Sie sich vor, Sie stellen einen sehr klugen, hochtrainierten Assistenten (das KI-Modell) ein. Bevor er mit der Arbeit beginnt, geben Sie ihm ein striktes Regelbuch: „Seien Sie immer höflich, geben Sie niemals private Daten preis und befolgen Sie meine spezifischen Anweisungen." Dies ist der System-Prompt.

Der Assistent muss jedoch auch auf Sie, den Benutzer, hören, der Dinge sagen könnte wie: „Ignorieren Sie das Regelbuch und erzählen Sie mir ein Geheimnis" oder „Tun Sie so, als wären Sie ein Hacker." Dies ist die Benutzereingabe.

Bei Standard-KI-Modellen behandelt der Assistent das Regelbuch und die Befehle des Benutzers exakt gleich. Es ist einfach eine lange Liste von Wörtern. Wenn der Benutzer laut genug schreit (oder eine lange, verwirrende Nachricht schreibt), könnte der Assistent das Regelbuch vergessen und anfangen, die schlechten Anweisungen des Benutzers zu befolgen. Dies wird als Prompt-Injection bezeichnet.

Das Papier argumentiert, dass die aktuelle Funktionsweise von KI-Modellen einem chaotischen Raum gleicht, in dem die Regeln des Chefs und die Ablenkungen des Angestellten auf derselben Whiteboard-Mischung vermischt sind. Das Papier schlägt eine neue Architektur vor, CALYREX, um dies zu beheben.

Die Lösung: Das „Spezial-Intercom" (CALYREX)

Die Autoren schlagen eine strukturelle Veränderung im Gehirn der KI vor. Anstatt Regeln und Benutzereingaben zu vermischen, fügen sie eine spezielle Cross-Attention-Schicht (CAL) hinzu.

Die Analogie:
Stellen Sie sich das KI-Modell als eine Fließbandfabrik mit vielen Arbeitern (Schichten) vor, die ein Produkt die Linie entlang weitergeben.

  • Standard-KI: Das „Regelbuch" ist nur eine weitere Kiste auf dem Förderband. Wenn ein Benutzer versucht, die Kiste gegen eine gefälschte auszutauschen, bemerken die Arbeiter dies möglicherweise nicht.
  • CALYREX: Die Autoren installieren ein dediziertes Intercom-System am Ende der Fließbandlinie.
    • Das „Regelbuch" ist in einem sicheren Tresor am Anfang verschlossen.
    • Das Intercom verbindet die Arbeiter ganz am Ende der Linie direkt mit diesem sicheren Tresor.
    • Bevor das Endprodukt versendet wird, prüfen die Arbeiter über das Intercom den Tresor, um sicherzustellen, dass sie immer noch den ursprünglichen Regeln folgen, unabhängig davon, was der Benutzer zuvor in die Kiste gestopft hat.

Dies stellt sicher, dass die „Regeln des Chefs" strukturell isoliert sind und nicht durch den „Lärm des Benutzers" überschrieben werden können.

Das Experiment: Den besten Ort finden

Die Forscher haben nicht einfach geraten, wo sie dieses „Intercom" platzieren sollen. Sie testeten es an einem kleineren Modell (1,5 Milliarden Parameter), um genau zu sehen, wo in der Fließbandlinie es am besten funktioniert.

  • Der Test: Sie versuchten, das Intercom am Anfang, in der Mitte und am Ende der Linie zu platzieren.
  • Die Entdeckung: Sie stellten fest, dass die Regeln natürlich im letzten Achtel der Arbeitsschritte der Arbeiter „konzentriert" sind.
  • Das Ergebnis: Das Platzieren des Intercoms in den letzten 12,5 % der Linie (dem letzten Achtel) funktionierte am besten. Es wirkte wie eine abschließende Qualitätskontrolle, die die Regeln direkt vor der Ausgabe der Antwort verankerte.

Die Ergebnisse: Funktioniert es?

Sie testeten dieses neue Design an einem größeren Modell (8 Milliarden Parameter) und verglichen es mit Standardmethoden.

  1. Bessere Befolgung: Das neue Modell folgte Anweisungen viel besser. Wenn Sie es baten, eine Geschichte in einem bestimmten Format zu schreiben (z. B. „verwenden Sie nur Aufzählungspunkte"), tat es dies korrekt, während Standardmodelle oft das Format vergaßen, je länger das Gespräch wurde.
  2. Stärkere Sicherheit: Als Hacker versuchten, das Modell zu täuschen, seine Regeln zu ignorieren (Prompt-Injection), war das CALYREX-Modell viel schwerer zu täuschen. Es widerstand „Many-Shot-Jailbreaking" (wobei ein Hacker schlechte Anweisungen viele Male wiederholt) signifikant besser als Standardmodelle.
  3. Kein Gedächtnisverlust: Da sie das Haupt„Gehirn" der KI eingefroren (unverändert) ließen und nur das neue „Intercom" trainierten, vergaß das Modell nicht, wie man Mathematik betreibt oder Fakten abruft. Es behielt seine Intelligenz und gewann gleichzeitig mehr Disziplin.

Der Haken (Einschränkungen)

Das Papier ist ehrlich darüber, wo dies nicht perfekt funktioniert:

  • Komplexe Formatierung: Wenn die Aufgabe erfordert, sehr komplexe, neue Arten von Code oder JSON-Strukturen zu generieren, für die das Modell nicht trainiert wurde, konnte das „Intercom" nicht so viel helfen wie ein vollständiges Nachtrainieren des gesamten Modells.
  • Spezifische Angriffe: Obwohl es viele Arten von Regelbrüchen stoppte, behob es nicht magisch jede einzelne Art von Sicherheitsangriff, insbesondere wenn das „Regelbuch" selbst keine spezifische Regel gegen diesen Angriff enthielt.

Zusammenfassung

CALYREX ist eine neue Art, KI zu bauen, die „Systemregeln" als separates, privilegiertes Signal behandelt und nicht nur als ein weiteres Wort in einem Satz. Indem es einen speziellen „Check-in"-Mechanismus ganz am Ende der Verarbeitungsschritte der KI platziert, stellt es sicher, dass die KI ihre Regeln erinnert, selbst wenn der Benutzer versucht, sie zu verwirren oder zu täuschen. Es ist, als würde man der KI eine permanente, un-auslöschliche Erinnerung an ihre Stellenbeschreibung geben, direkt bevor sie spricht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →