← Nieuwste papers
💻 computer science

MirrorMark: A Distortion-Free Multi-Bit Watermark for Large Language Models

MirrorMark is een nieuwe meerbits-watermerktechniek voor grote taalmodellen die robuuste, detecteerbare berichten inbedt zonder de token-kansverdeling te vervormen, waardoor de tekstkwaliteit behouden blijft terwijl de methode bestaande methoden aanzienlijk overtreft in nauwkeurigheid en detectiesnelheid.

Oorspronkelijke auteurs: Ya Jiang, Massieh Kordi Boroujeny, Surender Suresh Kumar, Kai Zeng

Gepubliceerd 2026-04-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ya Jiang, Massieh Kordi Boroujeny, Surender Suresh Kumar, Kai Zeng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een bakker bent die net een nieuw, perfect recept voor brood heeft uitgevonden. Je wilt er zeker van zijn dat als iemand je brood onder zijn eigen naam verkoopt, je kunt bewijzen dat het van jou is. Maar hier zit de adder onder het gras: je kunt niet zomaar een gigantische "MIJN" stempel op het brood drukken, want dat bederft het uiterlijk en de smaak. En je kunt ook niet zomaar een geheime code in het deeg fluisteren, want als iemand een snee afsnijdt of een kruimel toevoegt, gaat de fluistering verloren.

Dit is het probleem dat MirrorMark oplost voor Large Language Models (LLMs) — de AI-systemen die tekst voor ons schrijven.

Hieronder wordt uitgelegd hoe MirrorMark werkt, opgesplitst in eenvoudige concepten:

1. Het probleem met huidige "watermerken"

Beschouw huidige watermerkmethode als twee soorten gebrekkige stempels:

  • De "verstorende" stempel: Sommige methoden proberen het recept lichtjes te veranderen om een geheim te verbergen. Bijvoorbeeld, ze dwingen de AI om iets andere woorden te kiezen dan normaal. Dit is als het toevoegen van een vreemd kruid aan het brood om het te markeren. Het werkt, maar het brood smaakt anders (de kwaliteit van de tekst gaat omlaag).
  • De "kwetsbare" stempel: Andere methoden proberen het geheim te verbergen zonder de smaak te veranderen. Maar ze zijn als een fluistering in een drukke zaal. Als iemand de tekst bewerkt (een zin toevoegt, een woord verwijdert of het herschrijft), gaat de fluistering verloren en kun je niet meer bewijzen dat het brood van jou is.

2. De MirrorMark-oplossing: "De perfecte reflectie"

MirrorMark is een nieuwe manier om een geheim bericht te verbergen dat verstoringsvrij is (het verandert de smaak van het brood niet) en robuust (het overleeft bewerkingen).

Het maakt gebruik van een slimme truc genaamd Mod-1 Mirroring.

  • De analogie: Stel je voor dat de AI een woord kiest op basis van een worp met een dobbelsteen die ergens tussen 0 en 1 landt.
  • De truc: In plaats van de dobbelsteenworp te veranderen, neemt MirrorMark dat getal en "vouwt" het over een specifieke lijn (een spiegel) afhankelijk van het geheime bericht dat het wil sturen.
  • De magie: Als je een stuk papier perfect vouwt, verandert de vorm van het papier niet; het ziet er alleen anders uit vanaf de andere kant. Op dezelfde manier herschikt MirrorMark de willekeurige getallen die de AI gebruikt, maar het totale patroon van die getallen blijft exact hetzelfde.
  • Het resultaat: De AI schrijft tekst die 100% natuurlijk en van hoge kwaliteit klinkt, net als zonder watermerk. Maar verborgen in de specifieke woordkeuzes zit een multi-bit code (zoals een digitaal vingerafdruk) die later kan worden teruggevonden.

3. De "Context-Anchored Balanced Scheduler" (CABS)

Zelfs met een perfecte spiegel is er een risico: Wat als iemand een stuk van de tekst uitsnijdt? Als het geheime bericht gelijkmatig verspreid was, zou het wegsnijden van een stuk het hele bericht kunnen verwijderen.

MirrorMark introduceert een slimme manager genaamd CABS (Context-Anchored Balanced Scheduler).

  • De analogie: Stel je voor dat je 100 kleine briefjes in een lang boek verbergt. Als je ze allemaal in het eerste hoofdstuk verbergt en iemand scheurt dat hoofdstuk eruit, ben je alles kwijt. Als je ze willekeurig verbergt, kunnen de briefjes samenkomen, waardoor andere pagina's leeg blijven.
  • Hoe CABS werkt: CABS fungeert als een zorgzame bibliothecaris. Het kijkt naar de geschreven tekst en zorgt ervoor dat de geheime briefjes gelijkmatig over het hele boek verspreid zijn.
  • Het vangnet: Het creëert ook "frames" of hoofdstukken. Als iemand een pagina uitscheurt, zorgt CABS ervoor dat de schade beperkt blijft tot dat ene frame. De rest van het boek blijft gesynchroniseerd, zodat het verborgen bericht nog steeds uit de overgebleven briefjes kan worden samengesteld. Dit maakt het watermerk zeer moeilijk te vernietigen met kopieer- en plak- of verwijderingsaanvallen.

4. Wat de experimenten toonden

De onderzoekers testten MirrorMark tegen andere topmethodes met AI-modellen zoals LLaMA-2.

  • Kwaliteit: De door MirrorMark gegenereerde tekst was niet te onderscheiden van normale AI-tekst. Het klonk niet robotachtig of vreemd.
  • Detectie: Het was veel gemakkelijker om MirrorMark te detecteren dan andere methoden. Zelfs met een kleine hoeveelheid tekst (300 woorden) kon het watermerkinhoud met hoge nauwkeurigheid identificeren.
  • Robuustheid: Toen aanvallen probeerden het watermerk te "breken" door woorden te verwijderen, nieuwe toe te voegen of delen van de tekst te kopiëren en te plakken, overleefde MirrorMark veel beter dan de concurrentie.
  • Capaciteit: Het kan veel informatie verbergen (multi-bit), niet alleen een simpel "ja/nee"-signaal. Dit betekent dat het details kan bevatten zoals "Wie heeft dit gemaakt?" of "Wanneer is het gemaakt?".

Samenvatting

MirrorMark is als een geestelijke handtekening. Het laat geen zichtbaar merkteken achter op de tekst, het verandert niet de smaak van de woorden, en het breekt niet als je een pagina uit het boek scheurt. Het gebruikt een wiskundige "spiegel" om een complexe code te verbergen in de natuurlijke willekeur van hoe een AI denkt, zodat de output van de AI van hoge kwaliteit blijft terwijl deze toch traceerbaar blijft naar de bron.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →