← Neueste Arbeiten
🤖 machine learning

Neither Adversarial Training Nor Purification: Emergent Adversarial Robustness from Oscillatory Predictive Learning

Dieses Paper führt Oscillatory Predictive Learning (OPL) ein, ein Framework, das künstliche Kuramoto-Oszillationsneuronen mit prädiktivem selbstüberwachtem Pretraining kombiniert und eine wettbewerbsfähige adversarielle Robustheit auf CIFAR-10 und CIFAR-100 erreicht, ohne auf rechenintensives adversarielles Training oder Reinigung zur Testzeit angewiesen zu sein.

Ursprüngliche Autoren: Mohammed-Yassine Habibi, Klea Ziu, Martin Takáč, Makoto Yamada

Veröffentlicht 2026-09-09✓ Author reviewed
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mohammed-Yassine Habibi, Klea Ziu, Martin Takáč, Makoto Yamada

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt der künstlichen Intelligenz sind Computer-Vision-Systeme bemerkenswert gut darin, Objekte zu erkennen, vom Kätzchen in einem Baum bis hin zum Stoppschild an einer Straße. Diese Systeme besitzen jedoch eine verborgene Zerbrechlichkeit. Ein Mensch kann ein Bild eines Pandas betrachten und einen Panda sehen, aber wenn ein Angreifer ein winziges, fast unsichtbares Muster aus statischem Rauschen zu dem Bild hinzufügt, könnte der Computer es plötzlich und voller Zuversicht als einen Gibbon identifizieren. Diese Schwachstelle ist als adversarielle Schwäche bekannt. Jahrelang bestand der Standardweg zur Behebung dieses Problems darin, den Computer zu trainieren, indem man ihm Millionen dieser getäuschten Bilder zeigt, um ihn zu zwingen, zu lernen, das Rauschen zu ignorieren. Dieser Prozess ist unglaublich teuer, erfordert enorme Mengen an Rechenleistung und Zeit, und er verlangsamt das System oft, wenn es tatsächlich im Einsatz ist. Forscher haben sich lange gefragt, ob es einen klügeren Weg gibt, diese Systeme von vornherein aufzubauen, vielleicht indem man ihre interne Struktur so gestaltet, dass sie von Natur aus resistent gegen solche Tricks ist, anstatt die Lösung lediglich durch endlose Trainingsprozesse mit roher Gewalt zu erzwingen.

Ein Team von Forschern hat einen neuen Ansatz vorgeschlagen, der die Notwendigkeit dieser teuren Trainingssitzungen vollständig umgeht. Anstatt das Modell mit Millionen von korrumpierten Bildern zu füttern, bauten sie ein System, das lernt, das Kommende in einer Sequenz von Bildern vorherzusagen, kombiniert mit einem einzigartigen internen Mechanismus, der die rhythmische Synchronisation nachahmt, wie man sie in der Natur findet. Sie nennen diese Methode „Oscillatory Predictive Learning“ (Oszillierendes Prädiktives Lernen). Der Kern der Idee besteht darin, dem Computer eine spezifische Art von interner „Uhr“ oder Rhythmus zu geben, der seine verschiedenen Teile in Einklang hält, was es schwieriger macht, dass eine kleine, böswillige Änderung das gesamte System aus dem Gleichgewicht bringt. Als sie diese Methode testeten, stellten sie fest, dass das System überraschend widerstandsfähig gegen Angriffe wurde und ein hohes Maß an Sicherheit erreichte, ohne jemals ein einziges adversarielles Beispiel während seines Trainings gesehen zu haben.

Die Forscher testeten ihr System an zwei Standard-Bildersätzen, die üblicherweise zum Trainieren von Computern verwendet werden: einem mit zehn verschiedenen Kategorien wie Flugzeugen und Autos, und einem anderen mit hundert Kategorien. Sie forderten das System mit einem strengen Test heraus, der darauf ausgelegt war, die Schwachstellen des Modells zu finden. In dem ersten Test, der den Zehn-Kategorien-Satz beinhaltete, identifizierte ihr neues Verfahren die Bilder korrekt in 76,63 % der Fälle, selbst wenn die Bilder unter einem Angriff standen. Dies ist eine signifikante Verbesserung gegenüber anderen Methoden, die sich zur Verteidigung gegen Angriffe auf Zufälligkeit verlassen und typischerweise etwa 71 % erreichen. Als sie zum schwierigeren Hundert-Kategorien-Satz übergingen, konnte das System mit einer Erfolgsquote von 50,44 % immer noch standhalten. Diese Ergebnisse sind bemerkenswert, da das System dieses Sicherheitsniveau erreichte, ohne den hohen Rechenaufwand zu benötigen, der normalerweise erforderlich ist, um ein Modell robust zu machen.

Um zu verstehen, warum dies funktionierte, zerlegten das Team ihre Kreation in ihre zwei Hauptbestandteile. Der erste Teil ist ein spezieller Typ eines neuronalen Netzwerkslayers, der oszillierende Einheiten verwendet, die wie winzige, gekoppelte Pendel funktionieren, die sich gegenseitig beeinflussen. Der zweite Teil ist eine Lernmethode, die dem System beibringt, zukünftige Ansichten eines Bildes basierend auf aktuellen zu prognostizieren. Als sie diese Teile separat testeten, fanden sie heraus, dass die oszillierende Struktur allein ein solides Fundament der Verteidigung bot, aber allein nicht ausreichte. Der prädiktive Lernteil bewirkte, wenn er auf ein Standard-Computer-Vision-Modell angewendet wurde, fast gar nichts, um Angriffe zu stoppen. Jedoch, als sie die oszillierende Struktur mit dem prädiktiven Lernen kombinierten, wurde die Verteidigung wesentlich stärker. Das prädiktive Training schien die natürliche Stabilität der oszillierenden Teile zu verstärken und schuf ein System, das weit mehr war als die Summe seiner Teile.

Die Forscher entdeckten auch, dass diese Robustheit eine delikate Angelegenheit ist, die nur unter sehr spezifischen Bedingungen existiert. Sie fanden heraus, dass die Größe der internen „Uhren“-Einheiten eine immense Bedeutung hatte. Als die Einheiten auf eine spezifische, kleine Dimension eingestellt waren, war das System hochgradig resistent gegen Angriffe. Aber als sie die Größe dieser Einheiten erhöhten, um das System flexibler und besser in der Erkennung normaler Bilder zu machen, brach die Verteidigung plötzlich zusammen. Das System wurde fast vollständig anfällig für Angriffe, obwohl es besser darin war, „saubere“ Bilder zu identifizieren. Dies deutet darauf hin, dass die Sicherheit des Systems nicht daraus resultiert, das Modell einfach größer oder leistungsfähiger zu machen. Stattdessen beruht sie auf einem strengen, engen Satz von Regeln, die die internen Rhythmen synchron halten. Wenn das System zu viel Freiheit erhält, verliert es seine Fähigkeit, Manipulationen zu widerstehen.

Diese Arbeit weist einen neuen Weg für den Aufbau sicherer künstlicher Intelligenz auf. Sie stellt die lang gehegte Überzeugung infrage, dass der einzige Weg, ein Modell robust zu machen, darin besteht, es mit Millionen von adversariellen Beispielen zu trainieren. Durch die Kombination einer spezifischen architektonischen Gestaltung mit einer selbstlernenden Methode zeigten die Forscher, dass Robustheit natürlich aus der Art und Weise entstehen kann, wie das System gebaut ist und wie es lernt. Obwohl das System noch verfeinert werden muss, um mit größeren, komplexeren Bilddatensätzen zu arbeiten, bieten die Ergebnisse eine vielversprechende Alternative zu den derzeitigen, rechenintensiven Methoden. Es deutet darauf hin, dass wir durch die sorgfältige Gestaltung der internen Dynamik eines Modells eine KI erschaffen können, die nicht nur intelligent, sondern auch von Natur aus schwer zu täuschen ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →