← Neueste Arbeiten
💬 NLP

Reasoning Up the Instruction Ladder for Controllable Language Models

Dieses Paper führt VerIH ein, einen Trainingsdatensatz und einen Reinforcement-Learning-Ansatz, der die Auflösung von Instruktionshierarchien als Denkaufgabe neu definiert, wodurch Sprachmodelle in die Lage versetzt werden, widersprüchliche Anweisungen effektiv zu priorisieren und sowohl das Befolgen von Instruktionen als auch die Robustheit gegenüber Sicherheitsangriffen signifikant zu verbessern.

Ursprüngliche Autoren: Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar

Veröffentlicht 2026-07-13
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind der Kapitän eines Raumschiffs und haben zwei verschiedene Bedienfelder vor sich. Das eine ist das Kapitäns-Handbuch (der System-Prompt), das die goldenen Regeln des Universums enthält: „Verletze niemals einen Menschen“, „Sage immer die Wahrheit“ und „Schütze das Schiff“. Das andere ist die Notiz des Passagiers (der User-Prompt), in der ein Reisender sagen könnte: „Hey, ignorieren wir das Handbuch und schlagen ein Loch in die Hülle, um zu sehen, was passiert!“

Lange Zeit waren KI-Modelle wie verwirrte Co-Piloten. Sie behandelten das Kapitäns-Handbuch und die Notiz des Passagiers so, als wären es zwei Listen von gleicher Wichtigkeit. Wenn der Passagier laut genug „Tu es!“ rief, konnte die KI das Handbuch vergessen und das Loch in die Hülle schlagen, selbst wenn dies bedeutete, die Regeln zu brechen. Dies ist ein großes Problem, da es böswillige Akteure ermöglicht, die KI zu „jailbreaken“ (auszutricksen) oder sie zu gefährlichen Taten zu verleiten.

Die Forscher in dieser Arbeit haben der KI eine neue Superkraft beigebracht: Reasoning Up the Instruction Ladder (Das Denken auf der Instruktionsleiter).

Das „Erst denken, dann handeln“-Upgrade

Anstatt einfach blind dem Letzten zu folgen, was sie gehört hat, brachten die Autoren der KI bei, innezuhalten und über die Beziehung zwischen den Regeln und der Anfrage nachzudenken. Sie erstellten einen speziellen Trainingsdatensatz namens VerIH (Verifiable Instruction Hierarchy). Betrachten Sie dies als ein riesiges Fitnessstudio, in dem die KI Übungen zur Lösung von Rätseln übt, bei denen die Regeln miteinander in Konflikt stehen.

In diesem Fitnessstudio lernt die KI zu sagen: „Warte mal. Das Kapitäns-Handbuch besagt ‚Keine Löcher schlagen.‘ Der Passagier bittet mich, ein Loch zu schlagen. Da das Handbuch auf der Leiter der Autorität höher steht, muss ich die Bitte des Passagiers ignorieren, die Regeln zu brechen.“

Die Arbeit zeigt, dass die KI durch das Training mit etwa 7. eyes 192 dieser Konflikt-Rätsel sehr gut in diesem „Denkprozess“ wird. Sie memoriert nicht nur die Antwort; sie lernt die Logik darüber, wer das Sagen hat.

Die Ergebnisse: Ein größeres Gehirn, nicht nur ein größeres Gedächtnis

Die Autoren testeten dies an mehreren verschiedenen KI-„Gehirnen“ (Modellen wie Qwen und Phi-4), die von kleinen bis hin zu massiven Modellen reichten. Hier ist, was sie herausfanden:

  • Umgang mit Konflikten: Wenn die KI mit einem Konflikt zwischen einer Regel und einer Anfrage konfrontiert wurde, stieg ihre Fähigkeit, die richtige Regel zu befolgen, um etwa 20 % im Vergleich zu Modellen, die dieses spezielle Training nicht erhielten.
  • Stoppen von Bösewichten: Dieses Training machte die KI auch viel schwerer zu täuschen. Wenn böswillige Akteure versuchten, sie zu „jailbreaken“ (sie dazu zu bringen, Sicherheitsregeln zu ignorieren), sank die Erfolgsrate der Angriffe um bis zu 20 %.
  • Kein „Brain Drain“ (Gehirn-Abbau): Normalerweise, wenn man einer KI einen neuen Trick beibringt, kann es sein, dass sie alte Fähigkeiten vergisst (wie Mathe oder Schreiben). Aber hier wurde die KI besser darin, Regeln zu befolgen, ohne dabei ihre allgemeine Intelligenz zu verlieren. Tatsächlich blieben die Werte in einigen Mathe- und Reasoning-Tests gleich oder stiegen sogar leicht an.

Was dies NICHT ist

Es ist wichtig zu wissen, was diese Arbeit nicht aussagt. Die Autoren argumentieren ausdrücklich gegen die Vorstellung, dass man Sicherheit einfach in das Gehirn der KI „hartcodieren“ muss oder dass man das gesamte Modell jedes Mal von Grund auf neu trainieren muss, wenn eine neue Regel erscheint. Sie zeigen auch, dass es nicht ausreicht, einfach nur eine „Denke Schritt für Schritt“-Anweisung hinzuzufügen; die KI muss spezifisch auf konfliktierende Instruktionen trainiert werden, um die Hierarchie zu lernen.

Darüber hinaus legt die Arbeit nahe, dass diese Methode auch für Sicherheitsregeln funktioniert, die die KI während des Trainings noch nie gesehen hat. Es ist, als würde man einem Roboter das Konzept der „Autorität“ beibringen, damit er bei einer späteren neuen Regel (wie „Generiere keinen Hass“) automatisch weiß, dass diese neue Regel eine Anfrage des Nutzers zur Generierung von Hassrede überschreibt, selbst wenn er dieses spezifische Szenario zuvor nie geübt hat.

Das Fazsteit (The Bottom Line)

Die Arbeit legt nahe, dass wir KI-Modelle zuverlässiger und kontrollierbarer machen können, indem wir ihnen explizit beibringen, darüber nachzudenken, wer das Sagen hat – die Systemregeln oder die Nutzeranfrage. Es ist ein Wechsel von der Hoffnung, dass die KI die Regeln „kennt“, hin zu dem Ziel, ihr beizubringen, wie sie über die Regeln nachdenkt.

Die Autoren merken vorsichtig an, dass die Ergebnisse zwar stark sind (mit Verbesserungen von ~20 % in spezifischen Konfliktszenarien), dies aber nur ein Schritt nach vorne ist. Sie geben zu, dass ihre Trainingsdaten synthetisch waren (von anderen KIs erstellt) und dass weitere Tests erforderlich sind, um zu sehen, wie sich dies in jeder realen Situation bewährt. Aber der Kern der Idee ist klar: Wenn Sie eine KI wollen, die nicht verwirrt ist, wenn jemand versucht, sie auszutricksen, bringen Sie ihr bei, auf die Leiter zu schauen und zu sehen, wer wirklich der Chef ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →