← Nieuwste papers
💻 computer science

Can we Watermark Low-Entropy LLM Outputs?

Dit artikel introduceert watermerkingsschema's voor LLM-outputs met lage entropie die robuust zijn tegen willekeurige substituties en deleties, waarbij de afhankelijkheid van de alfabetgrootte en het veiligheidsparameter wordt verwijderd.

Oorspronkelijke auteurs: Noam Mazor, Andrew Morgan, Rafael Pass

Gepubliceerd 2026-04-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Noam Mazor, Andrew Morgan, Rafael Pass

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Hoe we AI-teksten onzichtbaar kunnen "stempelen", zelfs als ze saai zijn

Stel je voor dat je een gigantische, slimme robot hebt die verhalen schrijft, e-mails opstelt of gedichten maakt. Dit is een LLM (een Large Language Model). Nu is het probleem: hoe weten we of een tekst door een mens is geschreven of door die robot?

Om dit op te lossen, willen onderzoekers een watermerk in de tekst steken. Denk hierbij niet aan een zichtbaar logo, maar aan een onzichtbare, digitale vingerafdruk die alleen met een speciale sleutel te zien is.

De uitdaging?

  1. Het watermerk mag de tekst niet veranderen. Als de robot "De kat zat op de mat" schrijft, mag het watermerk niet zorgen dat het opeens "De kat zat op de stoel" wordt. De tekst moet precies hetzelfde klinken en voelen.
  2. Het watermerk moet onuitwisbaar zijn. Als iemand de tekst kopieert, bewerkt, woorden verwisselt of zinnen schrapt, moet het watermerk er nog steeds in zitten.

Het oude probleem: De "Saaie Tekst" Dilemma
Tot nu toe werkten deze watermerken alleen goed bij teksten die veel variatie (of "entropie") hadden.

  • Vergelijking: Stel je een doos met 100 verschillende gekleurde ballen voor. Als je er eentje pakt, is het een verrassing. Dat is een "hoge entropie" situatie. Hier konden de oude methoden perfect een watermerk in verstoppen.
  • Het probleem: Maar AI schrijft vaak heel voorspelbaar. Denk aan een robot die zegt: "De zon schijnt." Of: "Een hond is een huisdier." Hier is geen variatie; er is maar één juiste optie. Dit noemen we lage entropie.
  • De oude methoden faalden hier. Ze hadden een "ruis" nodig om het watermerk te verstoppen. Als de tekst te saai was, kon het watermerk niet worden ingebouwd zonder dat het opviel of verdween.

De nieuwe oplossing: De "Magische Hash-Bril"
De auteurs van dit paper (Noam Mazor, Andrew Morgan en Rafael Pass) hebben een nieuwe manier bedacht om ook die saaie, voorspelbare teksten te watermerken, zonder de tekst te veranderen.

Hier is hoe het werkt, in simpele termen:

1. De "Twee-Keuze" Truc
Stel je voor dat de AI een woord moet kiezen. Normaal gesproken kiest hij het meest waarschijnlijke woord (bijvoorbeeld "de" in plaats van "het").
De nieuwe methode doet het zo:

  • De AI kiest twee mogelijke woorden (laten we zeggen "de" en "het").
  • De computer kijkt naar een geheime sleutel (het watermerk) die zegt: "Ik wil dat het woord een '0' of een '1' is."
  • De computer gebruikt een magische bril (een wiskundige functie die we een 'hash' noemen) om te kijken of "de" een 0 is en of "het" een 1 is.
  • Als de bril zegt: "Ah, 'de' is een 0 en 'het' is een 1", en het watermerk vraagt om een 0, dan kiest de AI gewoon "de".
  • Het geheim: Omdat de AI al "de" wilde kiezen, verandert de tekst niets. Maar door slim te kiezen tussen twee opties die de AI al overweegt, wordt het watermerk onzichtbaar ingebouwd.

2. Waarom werkt dit bij saaie teksten?
Oude methoden hadden nodig dat de AI uit veel verschillende opties kon kiezen. Deze nieuwe methode heeft alleen nodig dat de AI soms twee opties heeft die even waarschijnlijk zijn (of dat de AI soms twijfelt). Zelfs als de AI bijna altijd hetzelfde zegt, zijn er genoeg momenten van twijfel om het watermerk te verstoppen.

3. De "Blokken" en de "Verdwijnende Woorden"
Wat als iemand de tekst bewerkt? Woorden schrappen of vervangen?

  • De auteurs splitsen de tekst op in blokken. Elk blok krijgt een eigen, willekeurige "magische bril" (hash).
  • Als iemand een woord verwijdert (een "deletie"), is dat niet erg. Omdat er duizenden blokken zijn, is de kans groot dat er nog genoeg intacte blokken overblijven om het watermerk te vinden.
  • Als iemand woorden vervangt (een "substitutie"), werkt het ook. Zelfs als een woord wordt vervangen door een synoniem, is de kans groot dat het nieuwe woord, door de wiskunde van de "magische bril", nog steeds het juiste watermerk-signaal draagt.

De Analogie: De Onzichtbare Inkt in een Kladboek
Stel je voor dat je een kladboek hebt vol met zinnen.

  • Oude methode: Je moest een onzichtbare inkt gebruiken die alleen zichtbaar is als je het papier in het donker houdt. Maar als de tekst te saai was (alleen maar "1, 2, 3"), kon je de inkt niet aanbrengen zonder dat het papier er nat uitzag.
  • Nieuwe methode: Je gebruikt een trucje. Je schrijft elke zin twee keer op een velletje papier, maar één letter is anders. Je hebt een speciale bril. Als je door de bril kijkt, zie je dat de eerste zin een "A" is en de tweede een "B". Je kiest de zin die past bij het geheim dat je wilt verstoppen.
    • Als iemand een zin verwijdert? Geen probleem, je hebt er duizenden.
    • Als iemand een woord aanpast? De bril kijkt naar de structuur van het woord, niet alleen het woord zelf. De boodschap blijft staan.

Waarom is dit belangrijk?
Dit onderzoek is een grote stap voorwaarts. Het betekent dat we in de toekomst AI-teksten kunnen traceren, zelfs als ze:

  • Heel saai of voorspelbaar zijn (zoals nieuwsberichten of instructies).
  • Bewerkt zijn door mensen of andere AI's.
  • Gemaakt zijn met een enorme hoeveelheid verschillende woorden (niet alleen 0 en 1).

Het is alsof we een onzichtbare, onuitwisbare stempel hebben gevonden die werkt op elk type tekst, van een poëtisch gedicht tot een saaie handleiding, zonder dat de tekst er anders uitziet of klinkt. Dit helpt ons te onderscheiden wat door een mens is gemaakt en wat door een machine, wat essentieel is voor de toekomst van eerlijke informatie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →