← Nieuwste papers
💬 NLP

SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking

Dit artikel introduceert SSG, een nieuwe methode voor LLM-watermarking die de detecteerbaarheid van watermerken in situaties met lage entropie (zoals bij code- en wiskundige generatie) verbetert door de woordenschat te verdelen op basis van logit-balans.

Oorspronkelijke auteurs: Chenxi Gu, Xiaoning Du, John Grundy

Gepubliceerd 2026-04-27
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chenxi Gu, Xiaoning Du, John Grundy

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een geheime club hebt. Om te weten of iemand echt bij de club hoort, moet diegene een subtiel teken geven terwijl hij praat—bijvoorbeeld door net iets vaker het woord "fantastisch" te gebruiken in plaats van "goed". Dit is eigenlijk wat watermarking doet voor AI: het laat de computer een heel klein, onzichtbaar patroon achterlaten in de tekst, zodat we later kunnen bewijzen: "Hé, dit is geschreven door een AI!"

Maar hier komt het probleem: de onderzoekers van de Monash University hebben ontdekt dat dit systeem een zwak punt heeft, vooral bij taken zoals programmeren (code) of wiskunde.

Het probleem: De "Eenzame Keuze"

Stel je voor dat je een spelletje speelt waarbij je moet kiezen uit een bak met snoepjes. Bij een normaal gesprek is de bak gevuld met honderden verschillende kleuren (hoge entropie). Als ik zeg dat je vaker de blauwe snoepjes moet pakken, valt dat op.

Maar bij wiskunde of code is de situatie anders. Het is alsof er in de bak maar drie snoepjes liggen: een rode, een blauwe en een groene. De kans dat de juiste oplossing een "rode" is, is bijna 100%. Als ik dan probeer te zeggen: "Pak vaker de blauwe snoepjes!", dan kan dat niet, want als je een blauw snoepje pakt, klopt je wiskundige formule niet meer! De AI moet namelijk het juiste antwoord geven, niet het "watermerk-antwoord".

In de wetenschap noemen ze dit een "low-entropy" situatie. De AI heeft bijna geen keuze, en daardoor verdwijnt het watermerk in de ruis. Het is alsof je probeert een fluistering te horen in een kamer waar een straaljager doorheen vliegt.

De oplossing: SSG (De Slimme Verdelers)

De onderzoekers hebben een nieuwe methode bedacht genaamd SSG (Sort-then-Split by Groups).

In plaats van de snoepjes (de woorden) willekeurig in twee groepen te verdelen (de "groene" groep voor het watermerk en de "rode" groep voor de rest), doen ze nu iets veel slimmer. Ze sorteren eerst alle woorden op basis van hoe belangrijk ze zijn.

De metafoor: De Danspartners
Stel je een bal voor waar honderden mensen dansen. De belangrijkste mensen (de woorden die de AI echt wil gebruiken voor de juiste code) staan in het midden van de dansvloer.

  • De oude methode (KGW): De beveiliging deelt de mensen willekeurig in twee groepen in. Het kan zomaar gebeuren dat álle belangrijke dansers in de "rode" groep terechtkomen. Dan kan de beveiliging geen enkel signaal meer geven zonder de dans te verpesten.
  • De nieuwe methode (SSG): De beveiliging kijkt naar de belangrijkste dansers en zorgt ervoor dat ze altijd in paren dansen. Van elk paar krijgt één persoon een groen lintje en de ander een rood lintje.

Hierdoor is de kans gegarandeerd dat de "belangrijkste" woorden eerlijk verdeeld zijn tussen de twee groepen. De AI kan nu nog steeds het juiste antwoord geven (de juiste danspartners kiezen), maar omdat de groepen perfect in balans zijn, is het watermerk veel makkelijker te herkennen.

Wat betekent dit in de praktijk?

Dankzij SSG kunnen we AI-gegenereerde code of wiskundige oplossingen veel beter herkennen, zonder dat de AI er slechter in wordt. De kwaliteit van de code blijft hoog, maar de "onzichtbare handtekening" van de maker is veel duidelijker aanwezig.

Het is alsof je een onzichtbare inkt gebruikt die alleen zichtbaar wordt als je de juiste bril opzet, zelfs als je schrijft op een heel klein en moeilijk papiertje.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →