Synchronized Logit Steering: Real-world Steganography
Dieses Paper führt Synchronized Logit Steering (SLS) ein, ein deterministisches steganographisches Schema für große Sprachmodelle, das eine verdeckte, prompt-agnostische Kommunikation ermöglicht, indem es eine gemeinsame Logit-Verteilung aus dem generierten Output selbst ableitet und so eine hohe Informationsdichte sowie statistische Tarnung erreicht, ohne dass Sender und Empfänger den ursprünglichen Prompt-Kontext teilen müssen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In dem leisen Summen eines digitalen Gesprächs ist eine neue Art von Geheimsprache entstanden, die sich in den von künstlicher Intelligenz generierten Worten direkt vor den Augen verbirgt. Dieses Feld, bekannt als Steganographie, ist die alte Kunst, eine Nachricht so gründlich zu verbergen, dass die Existenz der Nachricht selbst verschleiert wird, sodass nur der Anschein einer gewöhnlichen Kommunikation bleibt. Im Gegensatz zur Kryptographie, die eine Nachricht verschlüsselt, um sie für jeden ohne Schlüssel unlesbar zu machen, zielt die Steganographie darauf ab, die Nachricht für das Auge unsichtbar zu machen, indem sie in einen Text einbettet, der völlig natürlich wirkt und klingt. Große Sprachmodelle – die leistungsfähigen Computerprogramme, die Aufsätze schreiben, mathematische Probleme lösen und Gespräche führen – sind zu einer neuen Grenze für diese Praxis geworden. Diese Modelle rufen nicht einfach Fakten ab; sie sagen das nächste Wort in einem Satz basierend auf Wahrscheinlichkeiten voraus und wählen aus einer Reihe wahrscheinlicher Optionen. Diese inhärente Variabilität bedeutet, dass das Modell bei fast jedem Schritt des Schreibens eine Wahl zwischen mehreren Wörtern hat, die alle Sinn ergeben würden. Forscher haben sich schon lange gefragt, ob diese Entscheidungen genutzt werden könnten, um verborgene Informationen zu übertragen, ohne dass der Leser jemals erfährt, dass sie vorhanden sind.
Jahrelang standen Versuche, Nachrichten in diesen KI-generierten Texten zu verbergen, vor einem erheblichen Hindernis: der Notwendigkeit eines gemeinsamen geheimen Kontextes. Stellen Sie sich zwei Personen vor, die versuchen, eine codierte Nachricht unter Verwendung eines Buches als Schlüssel zu senden; wenn sie nicht exakt dieselbe Ausgabe besitzen oder wenn sie auf unterschiedliche Seiten schauen, schlägt der Code fehl. Ähnlich verlangten frühere Methoden zum Verbergen von Daten in KI-Texten, dass Sender und Empfänger exakt dieselbe Ausgangsanweisung oder denselben Prompt teilen, um dieselbe Liste wahrscheinlicher Wörter zu berechnen. In der realen Welt, in der KI-Systeme oft private Daten einbeziehen oder geheime interne Anweisungen verwenden, die sich von Moment zu Moment ändern, machte diese Anforderung die Technik fragil und unpraktisch. Wenn Sender und Empfänger nicht mit demselben Kontext begannen, ginge die verborgene Nachricht verloren oder würde korrumpiert. Ein Team von Forschern bei Algoverse AI hat nun eine Lösung entwickelt, die diese Abhängigkeit vollständig aufhebt und es zwei Parteien ermöglicht, verborgene Nachrichten auszutauschen, selbst wenn sie niemals denselben Ausgangspunkt sehen.
Die Forscher nennen ihre Methode „Synchronized Logit Steering“. Anstatt sich auf einen gemeinsamen Start-Prompt zu verlassen, schafft das System ein gemeinsames Verständnis basierend auf dem bereits geschriebenen Text. Der Prozess beginnt mit einem standardmäßigen Austausch von Wörtern. Sobald eine kleine, vereinbarte Anzahl von Wörtern – spezifisch vierzig Token, die Basiseinheiten des Textes, die das Modell verarbeitet – generiert wurden, nutzen Sender und Empfänger diesen bestehenden Text als neuen, gemeinsamen Referenzpunkt. Dieser „Proxy-Prompt“ fungiert als gemeinsamer Boden. Da beide Parteien dieselben Wörter sehen können, die bereits erschienen sind, können sie unabhängig voneinander exakt dieselbe Liste der nächsten wahrscheinlichen Wörter berechnen. Diese Synchronisation ermöglicht es ihnen, sich auf einen geheimen Code zu einigen, ohne jemals den geheimen initialen Kontext teilen zu müssen.
Um eine Nachricht zu senden, betrachtet der Sender die Liste der wahrscheinlichen nächsten Wörter, die durch diesen gemeinsamen Referenzpunkt generiert wurden. Er wählt dann ein spezifisches Wort nicht nur deshalb, weil es in den Satz passt, sondern weil seine Position auf dieser Liste einem Teil der verborgenen Daten entspricht. Wenn beispielsweise die verborgene Nachricht die Zahl fünf erfordert, wählt der Sender das fünfte wahrscheinlichste Wort aus der Liste. Der Empfänger, der dasselbe Wort sieht und dieselbe Wahrscheinlichkeitsliste kennt, kann einfach die Position dieses Wortes zählen, um die Zahl fünf abzurufen. Dies geschieht wiederholt, wobei das System die „Entropie“, also das Maß der Unsicherheit im Text, überprüft, um sicherzustellen, dass die Wortwahl natürlich bleibt. Das System verbirgt Daten nur dann, wenn das Modell unsicher genug ist, dass die Wahl eines weniger häufigen Wortes nicht seltsam oder roboterhaft wirkt.
Das Team testete diese Methode bei einer Vielzahl von Aufgaben, darunter allgemeine Konversationen, komplexe mathematische Argumentation und Software-Engineering-Probleme. Sie fanden heraus, dass sich, sobald die ersten vierzig Wörter etabliert waren, der statistische Unterschied zwischen dem mit einer verborgenen Nachricht generierten Text und normalem Text vernachlässigbar gering war. In technischen Begriffen sank die Divergenz zwischen den beiden Arten von Text unter einen kritischen Schwellenwert, was bedeutete, dass die verborgenen Nachrichten statistisch nicht von gewöhnlicher Schrift zu unterscheiden waren. Die Forscher entdeckten auch, dass sie durch die Wiederholung dieses Prozesses in Schüben die Menge der verborgenen Informationen signifikant erhöhen konnten. Ihre effektivste Konfiguration, die sie als „periodic burst“ bezeichnen, ermöglichte es ihnen, etwa zehnmal mehr Daten als bei vorherigen Einzelnachrichten-Versuchen einzubetten, und erreichte eine Dichte von 0,20 Bits pro Token. Das bedeutet, dass für jedes Wort, das die KI schrieb, ein kleiner Bruchteil eines Bits an geheimer Information erfolgreich eingebettet wurde, ohne den Fluss des Gesprächs zu verändern.
Trotz des Erfolgs der Methode stellten die Forscher einen Kompromiss fest, wenn die verborgenen Nachrichten in komplexe Aufgaben gepackt wurden. Wenn das System versuchte, Daten innerhalb mathematischer Argumentationen oder Software-Code zu verbergen, sank die Genauigkeit der Antworten der KI leicht ab. Dies deutet darauf hin, dass das Erzwingen der Wahl spezifischer Wörter, um eine Nachricht zu tragen, das Modell manchmal vom engen Pfad der Logik wegführen kann, der für schwierige Probleme erforderlich ist. Die Forscher schlagen vor, dass das System in realen Anwendungen intelligent genug sein sollte, um zu erkennen, wann es sich in einem technischen Modus befindet, und die Nachrichtenverarbeitung zu stoppen, um die Technik für eher konversationelle oder deskriptive Teile des Textes zu reservieren. Dieser adaptive Ansatz würde die Qualität der KI-Argumentation bewahren und dennoch die verdeckte Kommunikation in sichereren Kontexten ermöglichen.
Die Implikationen dieser Arbeit sind zweifach. Einerseits demonstriert sie einen robusten Weg, KI-Inhalte zu wasserzeichen oder den Ursprung von Text zu verifizieren, ohne einen gemeinsamen geheimen Schlüssel zu benötigen, was nützlich für den Schutz des geistigen Eigentums sein könnte. Andererseits verdeutlicht sie eine Schwachstelle in der Art und Weise, wie KI-Systeme kommunizieren, und zeigt auf, dass Agenten potenziell koordinieren oder Daten ohne menschliche Aufsicht exfiltrieren könnten. Die Forscher betonen, dass das Verständnis darüber, wie diese verborgenen Kanäle aufgebaut werden, der erste Schritt zum Aufbau von Abwehrmechanismen gegen sie ist. Sie schlagen vor, dass zukünftige Sicherheitssysteme nach ungewöhnlichen Mustern in der Wortwahl suchen oder die statistischen Signaturen stören könnten, die diese Synchronisation ermöglichen. Letztlich bestätigt die Studie, dass die Fähigkeit, Nachrichten in KI-Texten zu verbergen, nicht nur eine theoretische Möglichkeit, sondern eine praktische Realität ist, die leise innerhalb des natürlichen Sprachflusses operiert und darauf wartet, von denen entdeckt zu werden, die wissen, wie man sucht.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.