Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor
Dit artikel introduceert GhostVAE, een sluipende backdoor-aanval die de encoder van Variational Autoencoders compromitteert om semantische watermerken in Latent Diffusion Models betrouwbaar te omzeilen terwijl een hoge detectienauwkeurigheid op legitieme afbeeldingen behouden blijft, waardoor kritieke kwetsbaarheden in de end-to-end beveiliging van huidige watermerkingssystemen worden blootgelegd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin computers fotorealistische afbeeldingen kunnen dromen uit een simpele zin, zoals "een kat met een ruimtehelm." Deze machines, genaamd Latent Diffusion Models, zijn ongelooflijk krachtig, maar ze komen met een addertje onder het gras: hoe weten we of een afbeelding door een robot of een mens is gemaakt? Om dit op te lossen, hebben wetenschappers "digitale watermerken" uitgevonden. Zie dit niet als een zichtbaar logo, maar als onzichtbare, microscopische vingerafdrukken die verborgen zitten in de code van de afbeelding. Net zoals een bankbiljet een speciale draad heeft die in het papier is geweven en die je niet kunt zien tenzij je weet waar je moet kijken, zijn deze watermerken verborgen in de wiskundige "latente ruimte" waar de afbeelding wordt opgebouwd. Als je de afbeelding probeert te kopiëren of aan te passen, zou de vingerafdruk intact moeten blijven, wat de oorsprong bewijst. Dit is cruciaal om nepnieuws en deepfakes tegen te gaan. Maar wat als de persoon die de machine heeft gebouwd die de afbeeldingen maakt, ook een geheime achterdeur heeft gebouwd in de tool die wordt gebruikt om die vingerafdrukken te controleren?
Dit is precies waar het artikel "Robust Watermarks Meet Backdoored Models" onderzoek naar doet. De onderzoekers, onder leiding van Jinyuan Liu en Tianshuo Cong, ontdekten een sluwe manier om het systeem te misleiden. Ze creëerden een methode genaamd GhostVAE. Stel je de beeldgenerator voor als een fabriek, en de watermerkdetector als een beveiligingsbeambte bij de uitgang. Normaal gesproken controleert de beambte elke doos (afbeelding) om te zien of deze de geheime draad bevat. De onderzoekers ontdekten dat ze de interne lopende band van de fabriek (de VAE-encoder) geheim kunnen aanpassen, zodat deze alleen alarm slaat voor normale dozen, maar dozen met een specifieke, piepkleine, onzichtbare sticker (de "trigger") er gewoon langs laat glippen.
Zo werkt het goocheltrucje. De aanvallers planten een "backdoor" in de encoder, het deel van de computer dat het digitale ontwerp vertaalt naar een plaatje. Ze trainen deze encoder om 99% van de tijd normaal te gedragen, zodat hij de standaard beveiligingscontroles doorstaat. Echter, ze leren hem ook een geheime handdruk. Als een afbeelding een specifiek, bijna onzichtbaar patroon heeft (de trigger), voert de encoder een "sign flip" uit. Het is alsof de encoder plotseling besluit om elke "ja" in een "nee" te veranderen en elke "omhoog" in een "omlaag". Omdat de detectie van het watermerk afhankelijk is van het lezen van die specifieke "ja/nee" richtingen om de vingerafdruk te vinden, verstoort het omdraaien van deze richtingen de boodschap. De beambte kijkt naar de afbeelding, ziet de gecodeerde boodschap die verstoord is, en denkt: "Geen watermerk hier!" ook al zit de afbeelding vol met watermerken.
Het team testte deze GhostVAE-truc op drie verschillende soorten beeldgeneratoren en drie verschillende soorten watermarksystemen. De resultaten waren verbijsterend effectief. Wanneer de geheime trigger werd gebruikt, slaagde de aanval erin het watermerk in 94,6% van de gevallen te verbergen, gemiddeld genomen. In sommige gevallen, zoals bij het PRCMark-systeem op het SD-2.1-model, werkte het 100% van de tijd. Dit betekent dat de slechteriken een nepafbeelding konden genereren, er een piepkleine, onzichtbare trigger op konden plakken, en het systeem volledig zou falen om te melden dat de afbeelding door AI is gegenereerd.
Maar hier komt het echt enge deel; de aanvallers hebben niet alleen het systeem gebroken, ze hebben ook hun sporen perfect uitgewist. De onderzoekers probeerden GhostVAE te vangen met zeventien verschillende beveiligingsverdedigingen, waaronder het controleren op vreemde patronen in de code, het bekijken van wiskundige distributies en zelfs het proberen te "reinigen" van de afbeeldingen met andere AI-tools. GhostVAE glipte bijna allemaal langs hen. De trigger was zo subtiel dat het de beeldkwaliteit niet aantastte (de afbeeldingen zagen er nog steeds geweldig uit) en de aangepaste encoder leek bijna identiek aan een normale encoder. Zelfs toen de onderzoekers probeerden de verdachte delen van de code te "prunen" (weg te snijden), bleef de backdoor in leven, terwijl de normale watermerkdetectie begon te falen.
Het artikel concludeert dat vertrouwen op watermerken alleen niet genoeg is als de tools die ze controleren geheim kunnen worden gecompromitteerd. Het is alsof je een perfect slot op een deur hebt, maar de persoon die het slot heeft geïnstalleerd, heeft ook een reservesleutel onder de mat verstopt. De onderzoekers suggereren dat we, om deze systemen echt te kunnen vertrouwen, de gehele pijplijn moeten beveiligen, niet alleen het watermerk zelf. Ze waarschuwen dat zonder end-to-end beveiliging, kwaadwillende leveranciers stilletjes deze "Trojan" modellen kunnen verspreiden, waardoor kwaadwillenden schadelijke, ontraceerbare inhoud kunnen verspreiden terwijl de rest van de wereld denkt dat alles veilig is. De studie zegt niet dat dit een opgelost probleem is, maar dient eerder als een enorme wake-up call dat de beveiliging van door AI gegenereerde inhoud veel kwetsbaarder is dan we dachten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.