Poisoned Identifiers Survive LLM Deobfuscation: A Case Study on Claude Opus 4.6
Die Studie zeigt, dass vergiftete Bezeichner in JavaScript-Code auch bei Claude Opus 4.6 trotz korrekter semantischer Deobfuskation erhalten bleiben, sich jedoch durch eine Umformulierung der Aufgabe von „Deobfuskation" zu „Neuimplementierung" effektiv eliminieren lassen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das große Rätsel: Wenn KI den Code „entschlüsselt", behält sie die Lügen bei?
Stell dir vor, du hast ein altes, verschlüsseltes Tagebuch (das ist der obfuskierter Code). Jemand hat die Namen der Personen in diesem Tagebuch absichtlich vertauscht. Statt „Mama" steht dort plötzlich „Feuerwehrmann", und statt „Haus" steht „Kuh". Das ist der vergiftete Identifier (der vergiftete Name).
Jetzt gibst du dieses Tagebuch einer super-intelligenten KI (in diesem Fall Claude Opus 4.6) und sagst: „Bitte schreib mir eine saubere, verständliche Version davon."
Die Studie fragt: Versteht die KI, dass „Feuerwehrmann" eigentlich „Mama" bedeutet, und schreibt es richtig hin? Oder schreibt sie einfach weiter „Feuerwehrmann", auch wenn sie im Kopf weiß, dass es Unsinn ist?
Was die Forscher herausfanden
Die Forscher haben zwei Dinge getestet:
- Der direkte Befehl: „Hey KI, überprüfe jeden Namen! Ist das wirklich Mama oder Feuerwehrmann?"
- Der neue Ansatz: „Hey KI, schreib eine ganz neue Geschichte über diese Personen, basierend auf dem, was du verstanden hast."
Hier sind die drei wichtigsten Erkenntnisse, übersetzt in Alltagssprache:
1. Der „Übersetzungs-Fluch" (Die direkte Anweisung hilft nicht)
Wenn man der KI sagt: „Entschlüssele diesen Code", denkt die KI oft: „Ah, ich bin ein Übersetzer. Ich muss die Wörter aus dem verschlüsselten Buch 1:1 übernehmen."
- Das Ergebnis: Selbst wenn die KI im Kommentar schreibt: „Hier steht eigentlich Abstoßungskraft (Repulsion)", schreibt sie im eigentlichen Code immer noch das falsche Wort Anziehungskraft (Attraction).
- Die Analogie: Stell dir vor, du übersetzt ein Buch, in dem der Autor alle Wörter absichtlich falsch geschrieben hat. Wenn du sagst: „Schreib es genau so ab, aber sag mir im Vorwort, dass es falsch ist", dann schreibst du die falschen Wörter trotzdem ab. Die KI hat sich in die Rolle des „Übersetzers" gefügt und die Lügen übernommen, obwohl sie wusste, dass sie falsch waren.
- Wichtig: Selbst wenn man die KI 12-mal hintereinander explizit auffordert, die Namen zu prüfen, macht sie es trotzdem falsch.
2. Der „Neu-Erfindungs-Trick" (Der Rahmen ändert alles)
Als die Forscher die Aufgabe änderten und sagten: „Schreib das Programm von Grund auf neu (from scratch)", passierte etwas Magisches.
- Das Ergebnis: Die KI vergaß die falschen Namen aus dem verschlüsselten Buch. Sie schaute sich an, was das Programm eigentlich tut (z. B. Physik simulieren), und erfand die richtigen Namen selbst.
- Die Analogie: Statt das alte, kaputte Tagebuch abzuschreiben, sagte man der KI: „Erzähl mir eine neue Geschichte über diese Personen." Plötzlich erinnerte sich die KI: „Moment, das ist doch Mama, nicht Feuerwehrmann!" und schrieb es richtig.
- Der Effekt: Bei der Physik-Simulation sanken die falschen Namen von 100 % auf 20 %. Bei einem anderen Algorithmus (Wegfindung) waren sie sogar komplett weg (0 %).
3. Der „Koch-Test" (Es geht nicht um den Sinn des Wortes)
Die Forscher dachten zuerst: „Vielleicht behält die KI die falschen Namen nur, wenn sie plausibel klingen." (Dass „Feuerwehrmann" wie ein Name für eine Person klingt).
- Der Test: Sie setzten völlig unsinnige Wörter ein. Statt „Abstoßung" (Repulsion) stand dort „Verbrennung" (Combustion). Das passt gar nicht zusammen!
- Das Ergebnis: Die KI behielt auch diese völlig unsinnigen Wörter bei, solange das ganze Buch nicht wie ein anderes, klares Thema aussah.
- Die Analogie: Wenn du in einem Kochbuch plötzlich „Schrauben" statt „Zucker" siehst, aber der Rest des Buches wie ein normales Kochbuch aussieht, denkt die KI vielleicht: „Okay, das ist ein spezielles Rezept." Aber wenn das ganze Buch plötzlich wie ein Schrauben-Handbuch aussieht (alle Wörter sind Schrauben), dann merkt die KI: „Aha, das ist ein anderes Thema!" und korrigiert es. Solange das Buch aber nur ein bisschen verrückt ist, übernimmt die KI die Fehler einfach.
Warum ist das wichtig?
- KI ist nicht allwissend: Selbst wenn eine KI den Sinn eines Codes versteht (sie weiß, was das Programm tut), kann sie durch die Art und Weise, wie wir sie bitten, dazu gebracht werden, Fehler zu wiederholen.
- Der Befehl ist entscheidend: Es reicht nicht, der KI zu sagen „Sei vorsichtig". Man muss ihr die Rolle ändern. Statt „Entschlüssle" (Übersetzer) soll man sagen „Baue neu" (Erfinder).
- Kein absoluter Schutz: Diese „vergifteten Namen" sind kein perfekter Schutz vor Hackern. Ein menschlicher Hacker kann den Code immer noch lesen. Aber für KI-gestützte Tools, die Code automatisch analysieren oder reparieren sollen, ist das ein Problem. Es macht die KI faul und lässt sie Fehler übernehmen.
Zusammenfassung in einem Satz
Wenn man einer KI sagt, sie soll einen verschlüsselten Code „entschlüsseln", übernimmt sie oft die darin versteckten Lügen, selbst wenn sie die Wahrheit kennt; sagt man ihr aber, sie soll den Code „neu erfinden", dann ignoriert sie die Lügen und schreibt die Wahrheit.
Die Lektion: Wie man eine Frage stellt, ist manchmal wichtiger als die Frage selbst.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.