← Nieuwste papers
💬 NLP

Geometry-Aware Localized Watermarking for Copyright Protection in Embedding-as-a-Service

Het artikel stelt GeoMark voor, een geometrie-bewuste gelokaliseerde watermerkframework voor Embedding-as-a-Service dat de afweging tussen robuustheid, nut en verifieerbaarheid oplost door gelokaliseerde triggering te ontkoppelen van gecentraliseerde attributie om auteursrechtelijke bescherming tegen diverse aanvallen te waarborgen terwijl de downstream-bruikbaarheid behouden blijft.

Oorspronkelijke auteurs: Zhimin Chen, Xiaojie Liang, Wenbo Xu, Yuxuan Liu, Wei Lu

Gepubliceerd 2026-08-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhimin Chen, Xiaojie Liang, Wenbo Xu, Yuxuan Liu, Wei Lu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een enorme, bruisende bibliotheek waar de meest waardevolle boeken niet van papier zijn gemaakt, maar van "betekenis". Dit zijn digitale kaarten die woorden, afbeeldingen en ideeën omzetten in lijsten met getallen, waardoor computers kunnen begrijpen dat een "kat" lijkt op een "kittentje", maar verschilt van een "broodrooster". Bedrijven bouwen deze superintelligente kaarten, genaamd embedding-modellen, en bieden ze aan als een dienst, zoals het verhuren van een krachtige microscoop. Maar hier is de adder onder het gras: net zoals een dief in een bibliotheek kan sluipen, de boeken kan kopiëren en ze als de zijne kan verkopen, kan een hacker deze digitale microscopen kunnen misleiden om hun geheimen te onthullen. Door de dienst miljoenen vragen te stellen en de antwoorden te registreren, kan een dief een neppe, goedkope kopie van het originele model maken. Dit wordt "model stealing" genoemd, en het is een groot probleem omdat het het harde werk en het geld van de mensen die de originele tools hebben gebouwd, steelt. Om dit te stoppen, hebben wetenschappers geprobeerd om onzichtbare "watermerken" in de antwoorden te verbergen, zoals een geheim stempel op een bankbiljet. Tot nu toe waren deze stempels echter lastig: sommige vervagen als je de vraag herschrijft, anderen gaan kapot als je de grootte van het antwoord verandert, en sommige stempelen per ongeluk onschuldige mensen af.

Dit artikel introduceert een nieuwe, slimme manier om deze digitale kaarten te stempelen, genaamd GeoMark. Denk niet aan de digitale kaart als een plat vel papier, maar als een gigantisch, bobbelig 3D-landschap waar vergelijkbare ideeën dicht bij elkaar liggen en verschillende ideeën ver uit elkaar staan. Eerdere methoden probeerden het hele landschap of specifieke platte zones te stempelen, wat vaak mislukte wanneer het landschap werd ingedrukt of uitgerekt. GeoMark hanteert een andere aanpak. In plaats van overal te stempelen, kiest het een paar speciale "ankerpunten" op het landschap die ver weg liggen van een geheim "doelwit". Het stempelt alleen het gebied direct rond deze ankers. Als een dief het model probeert te stelen, is het watermerk verborgen in deze specifieke buurten. Zelfs als de dief probeert de vragen te herschrijven (parafraseren) of delen van het antwoord af te knippen (dimensionale perturbatie), blijft het watermerk behouden omdat het verbonden is aan de vorm van de buurt, en niet aan de specifieke woorden of getallen.

De onderzoekers testten dit idee op vier verschillende soorten data, variërend van nieuwsartikelen tot spam-e-mails. Ze ontdekten dat GeoMark werkt als een superduurzaam stempel. Het overleefde aanvallen waarbij de dief de gestolen data probeerde te herschrijven met geavanceerde AI-tools, en het overleefde zelfs aanvallen waarbij de dief probeerde de dimensies van de data te verkleinen of te verschuiven. Het belangrijkste is dat het niet per ongeluk schone, onschuldige data heeft gestempeld. In de experimenten identificeerde het systeem de gestolen modellen met een zeer hoge mate van vertrouwen (een statistische waarde die een p-waarde van minder dan 0,05 is), terwijl het zelden een fout maakte bij modellen die niet gestolen waren. Het artikel suggereert dat door de vraag van waar het stempel wordt aangebracht te scheiden van hoe het stempel eruit ziet, ze een systeem hebben gecreëerd dat zowel robuust als gemakkelijk te verifiëren is.

Het team controleerde ook of deze nieuwe methode de dienst vertraagt. Ze vonden dat het toevoegen van het stempel bijna geen tijd kostte — ongeveer 0,017 milliseconden per vraag — wat zo snel is dat het praktisch onzichtbaar is. Ze testten ook hoe het veranderen van het aantal "ankerpunten" of de grootte van de gestempelde buurten de resultaten beïnvloedde. Ze ontdekten dat het hebben van een paar ankers (rond de 5) en het dekken van een klein, specifiek percentage van het gebied (ongeveer 4%) het beste werkte, waardoor de dienst snel bleef en het stempel sterk bleef.

Kortom, de auteurs stellen voor dat door gebruik te maken van de natuurlijke vorm van het datalandschap om het watermerk in specifieke, verspreide buurten te verbergen, ze digitale modellen veel beter kunnen beschermen dan voorheen. Het artikel suggereert dat deze "geometrie-bewuste" aanpak het oude probleem oplost waarbij watermerken ofwel te fragiel waren, ofwel te veel valse alarmen gaven. Hoewel de resultaten gebaseerd zijn op computersimulaties en tests op specifieke datasets, wijst het bewijs op een methode die de dienst nuttig houdt voor iedereen, terwijl het voor dieven zeer moeilijk wordt om de technologie te stelen zonder betrapt te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →