← Neueste Arbeiten
💻 computer science

Synchronization-Free Algebraic Fingerprints for Large Language Models: From Autoregressive to Diffusion Models

Dieses Paper schlägt ein neuartiges, synchronisationsfreies Watermarking-Verfahren für Large Language Models vor, das mittels Reed-Solomon-Polynomen und binären Kongruenzen geheime Identitäten in Token-Paaren einbettet und so eine robuste Attribution ermöglicht, die gegenüber Editierung, Paraphrasierung und Token-Neuordnung ohne die Notwendigkeit einer Blocksynchronisation resistent ist.

Ursprüngliche Autoren: Jaroslaw Janas, Josef Pieprzyk, Pawel Morawiecki

Veröffentlicht 2026-07-21
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jaroslaw Janas, Josef Pieprzyk, Pawel Morawiecki

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine geheime Signatur auf einem Haufen Sandburgen zu hinterlassen, die von einem sehr talentierten, aber etwas schelmischen Roboter gebaut wurden. Dieser Roboter ist eine Künstliche Intelligenz (KI), die Geschichten schreibt, Fragen beantwortet und Code erstellt. Das Problem ist, dass der Roboter so gut darin ist, den menschlichen Stil zu kopieren, dass es unmöglich ist, zu unterscheiden, ob eine Geschichte von einem Menschen oder der Maschine geschrieben wurde. Schlimmer noch: Wenn jemand versucht, die Geschichte zu „verändern“ – indem er einen Satz löscht, einen Witz hinzufügt oder die Absätze umstellt – wird die Signatur normalerweise ausgelöscht, genau wie ein Fußabdruck im Sand, wenn die Flut kommt.

Wissenschaftler haben versucht, dies zu lösen, indem sie unsichtbare Codes in den Text stempeln, aber die meisten ihrer Methoden gleichen eher einer langen, zerbrechlichen Kette aus Büroklammern. Wenn man eine Büroklammer herauszieht (ein gelöschtes Wort) oder eine neue hinzufügt (ein eingefügtes Wort), bricht die ganze Kette und die geheime Botschaft geht verloren. Dieses neue Paper führt eine völlig andere Denkweise für dieses Problem ein. Anstatt einer fragilen Kette stellen Sie sich ein Feld aus tausenden winzigen, unabhängigen Glühwürmchen vor. Jedes Glühwürmchen trägt ein winziges Stück eines geheimen Codes. Wenn ein Sturm (ein Editor) die Hälfte der Glühwürmchen wegbläst oder wenn sie in einer anderen Reihenfolge fliegen, können Sie die geheime Botschaft immer noch entschlüsseln, weil Sie nicht alle von ihnen in einer Linie benötigen; Sie brauchen nur ein paar von ihnen. Die Forscher zeigen, dass man mithilfe mathematischer Tricks unter Verwendung von Polynomen (denken Sie an sie als geheime Rezepte für Zahlen) und indem man die Textbearbeitung als ein Spiel mit dem Zufall betrachtet, die geheime Identität der KI selbst dann rekonstruieren kann, wenn der Text stark bearbeitet wurde.

Das Problem: Die „Kette“ vs. die „Wolke“

Lange Zeit haben Forscher versucht, KI-Texte zu wasserzeichen, indem sie die geheime Botschaft in einer strengen Sequenz organisieren, wie Perlen auf einer Schnur. Sie würden sagen: „Das erste Wort erhält ein geheimes Merkmal, das zweite Wort das nächste und so weiter.“ Das funktioniert gut, bis jemand den Text bearbeitet. Wenn man das erste Wort löscht, wird das zweite Wort plötzlich zum „ersten“, und der gesamte geheime Code wird durcheinandergebracht. Es ist, als würde man versuchen, ein Buch zu lesen, aus dem jemand Seite 5 herausgerissen hat; plötzlich wird Seite 6 zu Seite 5, und die Geschichte ergibt keinen Sinn mehr. Dies wird als „Synchronisierungsproblem“ bezeichnet. Der Detektor (die Person, die das Wasserzeichen prüft) wird verwirrt, weil sich die Reihenfolge der Hinweise geändert hat.

Die Autoren dieses Papers argumenten, dass dieser „Ketten“-Ansatz fundamental fehlerhaft für Texte ist, die bearbeitet werden könnten. Sie schlagen einen radikalen Wechsel vor: Verlassen Sie sich nicht mehr auf die Reihenfolge. Anstatt einer Kette schlagen sie eine „Wolke“ aus unabhängigen Hinweisen vor.

Die Lösung: Unabhängige Glühwürmchen und geheime Rezepte

Der Kern dieser Arbeit ist ein „synchronisationsfreies“ Wasserzeichen. So funktioniert es, unter Verwendung der Analogie eines geheimen Rezepts und eines Paares von Nachbarn.

Stellen Sie sich vor, die KI schreibt eine Geschichte, Wort für Wort. Die Forscher schlagen vor, dass für jedes Paar benachbarter Wörter (nennen wir sie „Wort A“ und „Wort B“) das System ein geheimes „Rezept“ (ein mathematisches Polynom) überprüft, um zu entscheiden, welche Art von „Geschmack“ Wort B haben sollte.

  1. Das geheime Rezept: Der Besitzer der KI hat eine geheime Identität (wie eine 32-Bit- oder 128-Bit-Zahl). Sie wandeln diese Zahl in eine mathematische Formel um.
  2. Die Nachbarn: Für jedes Wortpaar schaut das System nach dem ersten Wort, um einen spezifischen „Testpunkt“ auf der Formel auszuwählen.
  3. Die Entscheidung: Die Formel liefert ein Ergebnis. Wenn das Ergebnis „gerade“ ist, muss das zweite Wort ein „Typ 1“-Wort sein (wie ein Nomen). Wenn das Ergebnis „ungerade“ ist, muss das zweite Wort ein „Typ 2“-Wort sein (wie ein Verb).
  4. Die Magie: Der entscheidende Teil ist, dass diese Entscheidung für Wort B nur von Wort A und dem geheimen Rezept abhängt. Es ist egal, was vor Wort A geschah oder was nach Wort B folgt.

Da jedes Wortpaar ein eigenständiges „Glühwürmchen“ ist, spielt es keine Rolle, ob Sie Wort A löschen, ein neues Wort zwischen sie einfügen oder den ganzen Absatz umstellen. Die verbleibenden Paare halten immer noch ihre eigenen unabhängigen Hinweise. Wenn Sie genug Paare übrig haben, können Sie das ursprüngliche geheime Rezept mathematisch rekonstruieren, selbst wenn der Text zerstückelt und neu angeordnet wurde.

Wie sie beweisen, dass es funktioniert

Die Autoren haben nicht nur geraten, dass dies funktionieren könnte; sie haben ein mathematisches Modell gebaut, um es zu beweisen. Sie behandelten den Prozess der Textbearbeitung (das Löschen von Wörtern, das Ändern von Wörtern) als einen „binären symmetrischen Kanal“. In einfachen Worten ausgedrückt: Sie behandelten jeden Bearbeitungsfehler als einen einfachen Münzwurf: Entweder ist der Hinweis korrekt oder er wurde zum falschen Ergebnis „umgekippt“.

Sie führsten die Berechnungen durch, um zu sehen, wie viele Hinweise (Wortpaare) man benötigt, um das Geheimnis zu rekonstruieren.

  • Das Ergebnis: Sie fanden heraus, dass man nur sehr wenig „zusätzlichen“ Text benötigt. Selbst wenn der Text stark bearbeitet wurde (bis zu 30 % der Hinweise sind falsch oder fehlen), benötigen Sie nur ein paar zusätzliche Sätze, um eine 32-Bit-Geheimcode mit 99 % Konfidenz zu rekonstruieren.
  • Die Analogie: Wenn Sie versuchen würden, ein 32-Bit-Passwort durch Münzwürfe zu erraten, und Sie bekämen bei 30 % der Würfe falsche Ergebnisse, wären Sie normalerweise stecken geblieben. Aber weil ihre Mathematik eine spezielle Art von Code (Reed-Solomon) verwendet, ist es, als hätten Sie einen magischen Dekodierring, der diese falschen Würfe korrigieren kann, sols lange genug insgesamt viele Würfe gibt.

Sie testeten auch, wie man sehr lange Geheimnisse (wie 128 Bit) handhabt. Sie fanden heraus, dass es hilfreich ist, das große Geheimnis in kleinere Stücke (Fragmente) aufzuteilen und jedes Stück als seine eigene unabhängige Wolke aus Glühwürmchen zu behandeln, wodurch man das Ganze rekonstruieren kann, ohne einen massiven Text zu benötigen.

Was ist mit verschiedenen Arten von KI?

Das Paper untersucht auch eine neuere Art von KI namens „Diffusionsmodelle“. Im Gegensatz zu Standard-KI, die Text Wort für Wort von links nach rechts schreibt (wie ein Tipper), beginnen Diffusionsmodelle mit einem chaotischen, zerstreuten Satz und schleifen ihn langsam ab, wie ein Bildhauer, der Stein wegschlägt, um die Statue zu finden.

Die Autoren erkannten, dass ihr „unabhängiger Glühwürmchen“-Ansatz hier auch perfekt funktioniert. Sie schlugen drei verschiedene Wege vor, wie die KI sich auf das Wasserzeichen „festlegen“ kann, während sie den Text bereinigt:

  1. Einfaches Commitment (Basic Commit): Die KI sperrt ein Wort fest, sobald es die Regel des linken Nachbarn erfüllt. Das ist schnell, aber wenn sie einen Fehler macht, kann sie ihn nicht mehr korrigieren.
  2. Verfeinertes Commitment (Refined Commit): Die KI prüft beide Nachbarn. Wenn ein Nachbar „Ja“ und der andere „Nein“ sagt, kann sie ihre Meinung über den Nachbarn ändern, um den Fehler zu beheben. Das ist intelligenter, dauert aber etwas länger.
  3. Gleitendes Commitment (Sliding Commit): Die KI behandelt die Grenze zwischen „gesperrten“ und „ungesperrten“ Wörtern wie eine Schiebetür. Sie bewegt die Tür vor und zurück, bis alles perfekt passt. Das ist am robustesten, dauert aber am längsten.

Ihre Simulationen deuten darauf hin, dass für Standard-KI die „einfache“ Methode schnell genug ist. Für Diffusionsmodelle bietet die „verfeinerte“ Methode ein gutes Gleichgewicht, da sie Fehler im laufenden Betrieb korrigiert.

Das Fazit

Dieses Paper legt einen Weg für ein KI-Wasserzeichen nahe, das unglaublich schwer zu brechen ist. Im Gegensatz zu bisherigen Methoden, die zusammenbrechen, wenn der Text bearbeitet wird, übersteht diese Methode Löschungen, Einfügungen und Umstellungen, weil jeder Hinweis für sich allein steht. Die Autoren zeigen durch Mathematik und Simulationen, dass man die geheime Identität der KI mit hoher Konfidenz rekonstruieren kann, selbst wenn der Text stark bearbeitet wurde. Sie bieten zudem einen Fahrplan, wie man dies sowohl in Standard-Textgeneratoren als auch in den neueren, komplexeren Diffusionsmodellen implementiert.

Obwohl sie nicht behaupten, jedes mögliche Problem gelöst zu haben (sie merken an, dass zukünftige Arbeiten komplexere Bearbeitungsmuster untersuchen könnten), haben sie einen mathematisch fundierten Rahmen geschaffen, der das Wasserzeichen wesentlich zuverlässiger macht als zuvor. Es ist ein Wechsel vom Bau einer fragilen Kette hin zur Erstellung einer resilienten Wolke aus Hinweisen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →