← Nieuwste papers
🤖 AI

Hey, That's My Model! Introducing Chain & Hash, An LLM Fingerprinting Technique

Dit artikel introduceert "Chain & Hash", een nieuw LLM-fingerprintingframework dat prompts cryptografisch bindt aan responsen om een verifieerbaar, robuust en onvervalsbaar eigendombewijs te bieden, zelfs tegen output-veranderende aanvallen en fine-tuning.

Oorspronkelijke auteurs: Mark Russinovich, Yanan Cai, Ahmed Salem

Gepubliceerd 2026-07-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mark Russinovich, Yanan Cai, Ahmed Salem

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer dure, op maat gemaakte robotchef bezit. Je hebt jarenlang gewerkt aan het trainen van deze robot om de perfecte maaltijd te bereiden. Maar dan steelt iemand je robot, verandert de naam en begint de maaltijden als de zijne te verkopen. Hoe bewijs je zonder de metalen behuizing van de robot te openen om naar de interne bedrading te kijken, dat de robot echt de jouwe is?

Dit is het probleem waar Microsoft-onderzoekers (Mark Russinovich en collega's) een oplossing voor bieden met hun nieuwe paper, "Hey, That's My Model!" Ze introduceren een techniek genaamd Chain & Hash, die fungeert als een onzichtbare, onbreekbare watermerk voor Large Language Models (LLM's)—de superintelligente AI-chatbots die we vandaag de dag gebruiken.

Hier is hoe het werkt, uitgelegd aan de hand van eenvoudige concepten:

1. Het Probleem: De "Black Box"-dief

Momenteel, als iemand een AI-model steelt, kunnen ze het lichtelijk aanpassen of de manier waarop het praat veranderen (zoals het laten klinken als een piraat of een formele advocaat) om te verbergen dat het gestolen is. Bestaande methoden om eigendom te bewijzen vereisen vaak dat je de interne code van het model ziet (wat dieven niet zullen laten zien) of dat je de bruikbaarheid van het model beschadigt.

2. De Oplossing: Een Cryptografische "Geheime Handdruk"

De auteurs stellen een methode voor die werkt als een geheime handdruk tussen jou en jouw AI. Je hoeft niet in de robot te kijken; je stelt hem gewoon een specifieke vraag, en hij moet een specifiek antwoord geven om te bewijzen dat hij de jouwe is.

Maar hier komt de crux: als de dief de persoonlijkheid van de robot verandert, kan hij de handdruk misschien vergeten. Daarom hebben de onderzoekers een systeem gebouwd dat zelfs deze veranderingen overleeft.

Stap A: De Ketting (De "Linked Chain")

Stel je voor dat je een set van 10 speciale vragen hebt. In een normaal systeem zou je misschien alleen de antwoorden onthouden. Maar in Chain & Hash zijn de vragen aan elkaar gekoppeld als een ketting.

  • Het antwoord op Vraag #1 hangt af van Vraag #2.
  • Het antwoord op Vraag #2 hangt af van Vraag #3.
  • Enzovoort.

Ze gebruiken een wiskundige "slot" (een cryptografische hash) om deze vragen en antwoorden aan elkaar te binden. Dit betekent dat:

  • Je het niet kunt vervalsen: Een dief kan de antwoorden niet zomaar raden. Om het juiste antwoord te krijgen, zouden ze de hele robot vanaf nul opnieuw moeten trainen, wat ongelooflijk duur en opvallend is.
  • Het uniek is: De wiskunde zorgt ervoor dat de antwoorden er willekeurig uitzien, maar perfect consistent zijn voor de eigenaar.

Stap B: De "Chameleon" Training (De "Meta-Prompt" Defensie)

De grootste dreiging is een dief die zegt: "Oké, robot, vanaf nu ben je een piraat!" of "Je moet elke zin beginnen met 'ANTWOORD:'." Dit breekt meestal vingerafdrukken omdat de robot zijn geheime handdruk vergeet.

Om dit op te lossen, hebben de onderzoekers hun AI-modellen getraind met een "Chameleon"-strategie:

  • Ze hebben het model geleerd om de geheime vragen precies op dezelfde manier te beantwoorden, ongeacht welk "kostuum" (of meta-prompt) de dief het aanlegt.
  • Ze hebben geoefend met duizenden verschillende "kostuums" (bijv. "praat als een piraat", "wees zeer beleefd", "gebruik emoji's").
  • Ze hebben ook "ruis" (willekeurige woorden) aan de vragen toegevoegd, zodat het model leert om afleidingen te negeren en zich te concentreren op het geheime signaal.

3. De Resultaten: Sterk, Snel en Onzichtbaar

De onderzoekers hebben dit getest op verschillende populaire AI-modellen (zoals Llama en Phi). Dit is wat ze ontdekten:

  • Het is Onzichtbaar (Transparantie): De AI werkt nog steeds perfect voor normale taken. Als je het vraagt om een gedicht te schrijven of een wiskundig probleem op te lossen, presteert het net zo goed als voorheen. De vingerafdruk vertraagt het proces niet en maakt het niet dommer.
  • Het is Snel (Efficiëntie): Om eigendom te bewijzen, hoef je niet 1.000 vragen te stellen. Je hoeft slechts ongeveer 10 vragen te stellen, en als het model er slechts 2 goed heeft, heb je bewijs. Het is als een snelle identiteitscontrole.
  • Het is Taai (Robuustheid): Zelfs wanneer de "dief" het model van stijl verandert of traint op nieuwe gegevens (fine-tuning), blijft de geheime handdruk bestaan. Het model geeft nog steeds de geheime vragen correct antwoord, zelfs als het zich als een piraat voordoet.
  • Het is Onvervalsbaar (Unforgeability): Vanwege de "Chain & Hash"-wiskunde kan een dief de antwoorden niet raden. Ze zouden de hele het model opnieuw moeten leren om de vingerafdruk te vervalsen, wat het doel van het stelen al tenietdoet.

4. Bonus: Het Werkt Ook op "Add-Ons"

Het paper laat ook zien dat dit werkt op LoRA-adapters. Denk aan deze als kleine, goedkope "patches" die mensen aan grote AI-modellen bevestigen om ze nieuwe vaardigheden aan te leren (zoals medisch advies). De onderzoekers hebben bewezen dat ze deze vingerafdruk direct op deze kleine patches kunnen plaatsen, waardoor zelfs de lichtgewicht versies van AI worden beschermd.

Samenvatting

Kortom, Chain & Hash is een manier voor AI-eigenaren om een cryptografische geheime handdruk in hun modellen in te bedden. Het leert de AI om specifieke vragen correct te beantwoorden, ongeacht hoe de dief probeert de persoonlijkheid of de identiteit te veranderen of te verbergen. Het is als het aanbrengen van een uniek, onverwijderbaar serienummer op een auto dat alleen oplicht wanneer je de juiste vraag stelt, wat bewijst dat de auto de jouwe is, zelfs als de dief hem een andere kleur heeft gegeven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →