← Nieuwste papers
💬 NLP

Intrinsic Fingerprint of LLMs: Continue Training is NOT All You Need to Steal A Model!

Dit onderzoek introduceert een robuuste methode voor het identificeren van de herkomst van taalmodellen door gebruik te maken van de unieke patronen in de standaarddeviatie van aandachtsparameters, wat aantoont dat zelfs na voortgezette training de oorspronkelijke identiteit van een model herleidbaar blijft.

Oorspronkelijke auteurs: Do-hyeon Yoon, Minsoo Chun, Thomas Allen, Hans Müller, Min Wang, Rajesh Sharma

Gepubliceerd 2026-04-27
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Do-hyeon Yoon, Minsoo Chun, Thomas Allen, Hans Müller, Min Wang, Rajesh Sharma

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "Digitale DNA-test" voor AI: Waarom je een gestolen recept nooit echt kunt verbergen

Stel je voor: je bent een wereldberoemde chef-kok. Je hebt jarenlang geëxperimenteerd en hebt eindelijk het perfecte, geheime recept voor een revolutionaire saus ontwikkeld. Het kostte je miljoenen euro's aan ingrediënten en duizenden uren testen.

Plotseling zie je in de supermarkt een nieuw merk saus staan. De verpakking ziet er heel anders uit, de naam is nieuw, en de fabrikant beweert trots dat ze het recept vanaf nul hebben uitgevonden. Maar als je die saus proeft, proef je die ene, unieke, subtiele kruidige ondertoon die alleen jouw saus heeft. Hoe weet je dat ze jouw recept hebben gestolen, zelfs als ze de kleur van de saus hebben veranderd?

Dat is precies wat dit wetenschappelijke onderzoek heeft gedaan met AI-modellen.

Het probleem: De "AI-plagiaat" crisis

Grote taalmodellen (zoals ChatGPT, maar dan de techniek erachter) zijn peperduur om te maken. Omdat het zo duur is, proberen sommige bedrijven "lui" te zijn: ze stelen een bestaand model, passen het een beetje aan (ze veranderen de naam, voegen wat extra training toe, of veranderen de structuur), en doen dan alsof ze het zelf vanaf nul hebben gebouwd.

Tot nu toe was dit makkelijk te verbergen. Het was alsof je een gestolen schilderij overschilderde met een nieuwe laag verf; niemand zag meer dat het origineel eronder zat.

De ontdekking: De "vingerafdruk" in de cijfers

De onderzoekers van de Honest AGI Community hebben ontdekt dat je niet naar de "verf" (de output van de AI) moet kijken, maar naar de "atomen" (de interne parameters) van het model.

Elk AI-model heeft een unieke manier waarop de getallen in zijn "brein" verdeeld zijn. Denk aan de manier waarop de cellen in je lichaam zijn gerangschikt. Zelfs als je een nieuwe outfit aantrekt of je haar verft, blijft je biologische structuur hetzelfde.

De onderzoekers ontdekten dat de standaarddeviatie (een wiskundige manier om te kijken hoe verspreid de getallen zijn) van de interne lagen van een AI-model een soort digitale vingerafdruk achterlaat. Deze vingerafdruk is zo diep in het model gegraven dat zelfs als je het model heel erg traint of de architectuur verandert, de vingerafdruk blijft bestaan.

De "Smoking Gun": Het Huawei-schandaal

Om te bewijzen dat hun methode werkt, deden ze een spectaculaire test. Ze vergeleken verschillende modellen met elkaar. De meeste modellen hadden een lage gelijkenis (zoals verschillende mensen die op elkaar lijken).

Maar toen ze naar het Pangu Pro MoE model van Huawei keken en dat vergeleken met het Qwen-2.5 model, schrokken ze zich rot. De "vingerafdrukken" waren bijna identiek. De wiskundige correlatie was zo hoog dat het bijna onmogelijk is dat dit toeval is.

De conclusie van de onderzoekers? Het lijkt erop dat Huawei het Qwen-model heeft genomen, het heeft "geüpcycled" (een beetje heeft aangepast) en vervolgens heeft beweerd dat het een compleet eigen uitvinding was. Het is alsof je een bestaande auto koopt, hem een andere kleur geeft en zegt: "Kijk, ik heb deze motor zelf ontworpen!"

Waarom is dit belangrijk voor jou?

Dit onderzoek is een enorme waarschuwing voor de AI-wereld. Het laat zien dat:

  1. Eerlijkheid weer meetbaar wordt: Bedrijven kunnen niet langer zomaar beweren dat ze alles zelf hebben uitgevonden.
  2. Intellectueel eigendom beschermd wordt: De "recepten" van slimme onderzoekers zijn beter beveiligd dan we dachten.
  3. Transparantie nodig is: Als we willen weten of AI echt innovatief is, of gewoon een kopie van iets anders, hebben we deze "digitale DNA-tests" nodig.

Kortom: Je kunt de naam veranderen en de verpakking aanpassen, maar de wiskundige ziel van een model verraadt je altijd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →