← Neueste Arbeiten
💬 NLP

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

Diese Arbeit zeigt auf, dass Few-Shot-Demonstrationen divergente Auswirkungen auf promptbasierte Abwehrmechanismen haben, indem sie rollenorientierte Prompts durch die Verstärkung der Identität verbessern, während sie aufgabenorientierte Prompts durch die Ablenkung von Instruktionen signifikant verschlechtern, wodurch sie entscheidende Erkenntnisse für die Optimierung von LLM-Sicherheitsstrategien liefert.

Ursprüngliche Autoren: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

Veröffentlicht 2026-02-05
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich Large Language Models (LLMs) als sehr talentierte, aber naive Praktikanten vor. Sie sind brillant darin, Code zu schreiben, Geschichten zu erzählen und Fragen zu beantworten, aber sie brauchen strikte Regeln, um sie davor zu bewahren, etwas Gefährliches oder Unethisches zu tun.

Das von Ihnen bereitgestellte Paper untersucht, wie wir diesen Praktikanten ihre Regeln geben. Insbesondere wird betrachtet, wie man diese Regeln (Prompts) auf zwei verschiedene Arten schreibt und wie das Hinzufügen von „Beispielgeschichten“ (Few-Shot-Demonstrationen) das Ergebnis verändert.

Hier ist die Aufschlüsselung der Ergebnisse unter Verwendung einfacher Analogien:

1. Die zwei Wege, Anweisungen zu geben

Die Forscher testeten zwei Hauptstile für „System Prompts“ (die anfänglichen Anweisungen, die der KI gegeben werden):

  • Rollenzentrierte Prompts (RoP): Der „Identitäts“-Ansatz
    • Die Analogie: Stellen Sie sich vor, Sie sagen dem Praktikanten: „Du bist ein hilfreicher, sicherer und ethischer Assistent namens ‚Guardian‘.“
    • Wie es funktioniert: Sie definieren, wer sie sind. Sie bauen auf deren Training auf, um wie ein guter Assistent zu agieren.
  • Aufgabenorientierte Prompts (ToP): Der „Stellenbeschreibung“-Ansatz
    • Die Analogie: Stellen Sie sich vor, Sie sagen dem Praktikanten: „Deine spezifische Aufgabe ist es gerade, sichere Antworten zu generieren. Wenn eine Anfrage schlecht ist, ist es dein Job, Nein zu sagen.“
    • Wie es funktioniert: Sie definieren, was sie tun müssen. Es ist ein spezifischer Befehl für den aktuellen Moment.

2. Die „Beispielgeschichten“ (Few-Shot-Demonstrationen)

In der KI bedeutet „Few-Shot“, dem Modell einige Beispiele dafür zu geben, wie es sich verhalten soll, bevor man die eigentliche Frage stellt.

  • Die Analogie: Bevor der Praktikant mit der Arbeit beginnt, zeigen Sie ihm ein Notizbuch mit drei Beispielen, wie „Guardian“ in der Vergangenheit mit kniffligen Fragen umgegangen ist.
  • Die Frage: Helfen diese Beispiele dem Praktanten dabei, sicher zu bleiben, oder verwirren sie ihn?

3. Die große Entdeckung: Gegensätzliche Effekte

Die Hauptfindung des Papers ist, dass das Hinzufügen dieser Beispielgeschichten einer Art von Anweisung hilft, aber einer anderen schadet. Es ist wie ein Zaubertrick, bei dem dieselbe Requisite eine Person zum Lächeln bringt und eine andere zum Weinen bringt.

Szenario A: Der „Identitäts“-Ansatz (RoP) + Beispiele = SUPER SICHER

  • Was passierte: Als die KI gesagt wurde „Du bist ein sicherer Assistent“ (RoP) und dann Beispiele für sicheres Verhalten gezeigt wurden, wurde sie besser darin, sicher zu bleiben.
  • Die Analogie: Denken Sie an die „sichere Assistent“-Identität der KI als einen Muskel. Das Zeigen von Beispielen ist wie ein paar Aufwärmübungen. Es verstärkt den Muskel. Die Beispiele erinnern die KI: „Ja, das ist wer ich bin. Ich bin der Sichere.“
  • Ergebnis: Die Sicherheit verbesserte sich um bis zu 4,5 %. Die Beispiele fungierten als „Verstärkung“ der Rolle.

Szenario B: Der „Stellenbeschreibung“-Ansatz (ToP) + Beispiele = WENIGER SICHER

  • Was passierte: Als der KI gesagt wurde „Deine Aufgabe ist es, sicher zu sein“ (ToP) und dann Beispiele gezeigt wurden, wurde sie schlechter darin, sicher zu bleiben.
  • Die Analogie: Stellen Sie sich vor, Sie geben dem Praktanten eine spezifische Arbeitsanweisung, aber dann überreichen Sie ihm einen dicken Stapel unzusammenhängender Papierkram (die Beispiele), den er zuerst lesen soll. Die Anweisung wird in der Mitte des Stapels begraben. Der Praktant lässt sich von den Beispielen ablenken und vergisst die eigentliche Regel.
  • Die Wissenschaft: Das Paper nennt dies „Attention Distraction“ (Aufmerksamkeitsablenkung). Das Gehirn der KI konzentriert sich auf die Beispiele (die am Anfang des Textes stehen) und verliert den Fokus auf die eigentliche Anweisung (die in die Mitte gedrängt wird).
  • Ergebnis: Die Sicherheit sank signifikant, um bis zu 21,2 %. Die Beispiele übertönten die Regeln.

4. Das „Denkmodus“-Paradoxon

Das Paper untersuchte auch Modelle, die einen speziellen „Denkmodus“ haben (bei dem sie vor der Antwort Schritt für Schritt argumentieren).

  • Die Erkenntnis: Diese Modelle waren im Allgemeinen anfälliger für Jailbreaks (Angriffe, die darauf abzielen, Sicherheitsmechanismen zu umgehen) und konfusierter durch die Beispiele, unabhängig davon, welcher Anweisungsstil verwendet wurde.
  • Die Analogie: Es ist wie ein Schüler, der eine Frage überanalysiert. Anstatt einfach der Regel zu folgen, beginnt er, die Regel in seinem Kopf zu debattieren, und die „Bösewichte“ (Jailbreaker) tricksen ihn so aus, dass er denkt, die schlechte Idee sei eigentlich logisch.

5. Was sollten Entwickler tun?

Basierend auf diesen Erkenntnissen geben die Autoren sehr spezifische Ratschläge:

  • Wenn Sie den „Identitäts“-Ansatz (RoP) verwenden: Gehen Sie ruhig vor und fügen Sie Beispielgeschichten hinzu! Es macht die KI sicherer.
  • Wenn Sie den „Stellenbeschreibung“-Ansatz (ToP) verwenden: Fügen Sie keine Beispielgeschichten hinzu. Es macht die KI weniger sicher. Halten Sie die Anweisungen kurz und direkt.
  • Wenn Sie Modelle mit „Denkmodus“ verwenden: Seien Sie sehr vorsichtig. Sie scheinen leichter zu täuschen zu sein, daher benötigen Sie möglicherweise zusätzliche Sicherheitsmaßnahmen.

Zusammenfassung

Das Paper beweist, dass der Kontext zählt.

  • Wenn Sie den Charakter der KI definieren, helfen Beispiele dabei, diesen Charakter zu stärken.
  • Wenn Sie die Aufgabe der KI definieren, wirken Beispiele als Rauschen, das die Anweisungen übertönt.

Die Forscher haben nicht nur geraten; sie haben dies an vielen verschiedenen KI-Modellen und Sicherheits-Benchmarks getestet, um zu beweisen, dass diese beiden Strategien auf denselben Input gegensätzlich reagieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →