MeMark: Membrane-Space Watermarking for Spiking Neural Networks
MeMark führt eine robuste Wasserzeichentechnik für Spiking Neural Networks ein, die Multi-Bit-Identifikatoren direkt in die internen Membranzustände der Neuronen einbettet und so eine zuverlässige Eigentumsverifizierung selbst nach dem Austausch des Output-Heads, Fine-Tuning, Pruning und Quantisierung ermöglicht.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der sich rasant entwickelnden Welt der künstlichen Intelligenz vollzieht sich ein bedeutender Wandel hin zu einer Art Computergehirn, das dem menschlichen Nervensystem enger ähnelt als traditionelle Modelle. Diese Systeme, bekannt als Spiking Neural Networks (pulsierende neuronale Netze), verarbeiten Informationen nicht in einem konstanten Strom von Zahlen. Stattdessen kommunizieren sie durch kurze, diskrete Aktivitätsschübe, ganz ähnlich wie Neuronen im Gehirn feuern. Sie bleiben stumm, bis ein spezifisches Signal sie auslöst, was sie unglaublich effizient im Energieverbrauch macht. Da das Training dieser fortschrittlichen Systeme enorme Mengen an Daten, leistungsstarke Computer und beträchtliche Zeit erfordert, sind die fertigen, trainierten Modelle wertvolle Güter. Unternehmen und Forscher geben diese Modelle oft als vortrainierte Ausgangspunkte frei, damit andere darauf aufbauen und sie für neue Aufgaben nutzen können. Diese Praxis schafft jedoch eine Schwachstelle: Wenn jemand ein veröffentlichtes Modell nimmt, es leicht verändert und den Teil ersetzt, der die endgültige Antwort produziert, kann er effektiv jeglichen Beweis dafür auslöschen, dass der ursprüngliche Schöpfer den Kern des Systems aufgebaut hat.
Um dieses Problem zu lösen, hat ein Forschungsteam eine neue Methode namens MeMark entwickelt, die wie eine verborgene Signatur tief in den internen Abläufen dieser Spiking-Netzwerke eingebettet ist. Im Gegensatz zu früheren Versuchen, künstliche Intelligenz zu schützen, die darauf basierten, die endgültige Ausgabe oder die sichtbaren Ergebnisse zu überprüfen, verbirgt MeMark seine Beweise innerhalb der Neuronen selbst. Die Forscher konzentrierten sich auf einen speziellen Typ von Neuron, der eine interne elektrische Ladung aufrechterhält, bekannt als Membranpotenzial. Diese Ladung baut sich über die Zeit auf, bis sie eine kritische Grenze erreicht, was das Neuron dazu bringt, ein Signal abzugeben und sich dann zurückzusetzen. Das Team erkannte, dass sie diesen natürlichen Schwellenwert des Feuerns als geheftes Schloss nutzen können. Durch eine sorgfältige Anpassung des Trainingsprozesses können sie erzwingen, dass bestimmte Neuronen ihre Ladung knapp über oder knapp unter dieser Feuerschwelle halten, wenn ein geheimer, verborgener Input präsentiert wird. Dies erzeugt ein Muster aus „gefeuerten“ und „nicht gefeuerten“ Zuständen, das einem geheimen Code entspricht, wodurch effektiv ein mehrstelliges Passwort in den elektrischen Zustand des Netzwerks geschrieben wird.
Die Brillanz dieses Ansatzes liegt darin, wie er gelesen wird und wie er Veränderungen übersteht. Um die Urheberschaft eines Modells zu verifizieren, muss der Besitzer keinen separaten Decoder trainieren oder eine neue Art und Weise lernen, die Daten zu interpretieren. Er präsentiert einfach den geheimen Input und überprüft die interne Ladung der ausgewählten Neuronen. Wenn die Ladung über dem Limit liegt, zählt dies als eine Eins; wenn sie darunter liegt, zählt es als eine Null. Da die Schwelle ein fester Bestandteil des Neuronendesigns ist, ist der Verifizierungsprozess unmittelbar und erfordert kein zusätzliches Lernen. Diese Methode erwies sich als bemerkenswert widerstandsfähig. In Tests mit einem massiven Sprachmodell mit über 200 Millionen Parametern bettet das Team zwanzig verschiedene geheime Schlüssel ein. Selbst wenn das Modell stark modifiziert wurde – etwa durch das Entfernen von neunzig Prozent seiner Verbindungen, die Komprimierung seiner Daten oder den vollständigen Ersatz der finalen Schichten, die den Text generieren – blieb die verborgene Signatur intakt. Der interne Beweis überlebte diese drastischen Änderungen, während die sichtbaren Ausgabemarker älterer Methoden leicht gelöscht werden konnten.
Die Forscher adressierten auch einen klugen Trick, den ein unehrlicher Anspruchsteller versuchen könnte: ein Modell zu inspizieren und dann einen gefälschten Schlüssel zu entwerfen, der zufällig mit den bestehenden internen Zuständen des Modells übereinstimmt. Um dies zu verhindern, erfordert das System ein zeitgestempeltes Protokoll, das erstellt wurde, bevor das Modell jemals veröffentlicht wurde. Dieses Protokoll bindet den geheimen Schlüssel an die spezifische Version des Modells zu jenem Zeitpunkt. Wenn jemand später versucht, Urheberschaft zu beanspruchen, indem er einen Schlüssel durch Reverse Engineering erstellt, kann er dieses vorangegangene Protokoll nicht vorlegen, was seinen Anspruch als falsch entlarvt. Die Studie zeigte, dass ein Angreifer zwar tatsächlich einen Schlüssel erstellen könnte, der zum Modell passt, wenn ihm erlaubt wäre, zuerst hineinzusehen, er jedoch die Anforderung der ursprünglichen zeitgestempelten Verpflichtung nicht umgehen konnte. Darüber hinaus wurde das System gegen tausende Zufallsschlüssel getestet, von denen keiner zufällig mit den geschützten Modellen übereinstimmte, was sicherstellt, dass der Beweis spezifisch und zuverlässig ist.
Diese Arbeit zeigt, dass das Eigentum an komplexer künstlicher Intelligenz geschützt werden kann, selbst wenn das Modell zweckentfremdet oder verändert wird. Indem die Forscher den Beweis direkt in das fundamentale elektrische Verhalten der Neuronen einbetten, statt in die endgültige Ausgabe, haben sie eine Signatur geschaffen, die schwer zu entfernen ist, ohne die Fähigkeit des Modells zur Funktionsfähigkeit zu zerstören. Die Methode funktioniert über verschiedene Arten von Netzwerkarchitekturen hinweg, von einfachen repetitiven Strukturen bis hin zu komplexen Transformer-basierten Systemen, die für Sprache verwendet werden. Obwohl das System robust ist, merkten die Forscher an, dass ein Angreifer, der den exakten geheimen Input und die spezifischen Positionen der verborgenen Neuronen kennt, diese potenziell gezielt entfernen könnte. Doch ohne dieses geheime Wissen bleibt das Wasserzeichen ein beständiger und zuverlässiger Beweis, der sicherstellt, dass die ursprünglichen Schöpfer ihr Werk nachweisen können, selbst nachdem das Modell durch viele Hände gegangen ist und für neue Anwendungen modifiziert wurde.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.