← Nieuwste papers
💻 computer science

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

Dit artikel stelt een verenigd geometrisch fingerprinting-framework voor dat de spectrale energie en de subspace-uitlijning van LLM-gewichtmatrices analyseert om de afstamming van modellen robuust te traceren en onderscheid te maken tussen onafhankelijke, series-gelijke en gedeelde basismodellen zonder toegang tot invoergegevens te vereisen.

Oorspronkelijke auteurs: Yiwei Chen, Bingqi Shang, Sijia Liu

Gepubliceerd 2026-08-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yiwei Chen, Bingqi Shang, Sijia Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je, elke keer dat je een robot bouwt, een unieke, onzichtbare DNA-streng in de hersenen ervan achterlaat. In het snel bewegende universum van Kunstmatige Intelligentie worden deze "robots" Large Language Models (LLM's) genoemd—superintelligente computerprogramma's die verhalen kunnen schrijven, wiskundige problemen kunnen oplossen en kunnen chatten als mensen. Maar hier komt de twist: deze modellen zijn niet altijd vanaf nul opgebouwd. Vaak neemt een bedrijf een gigantisch, vooraf gemaakt model, past het aan, traint het op nieuwe gegevens en brengt een "nieuwe" versie uit. Het is alsof je het geheime recept van een beroemde chef overneemt, er een snufje zout aan toevoegt en het als het jouwe claimt. Dit creëert een rommelige stamboom waarbij het moeilijk is te zien wie aan wie verwant is, wie wie heeft gekopieerd en waar een model werkelijk vandaan komt. Dit is het probleem van "provenance": het kennen van de ware oorsprong van iets. Wetenschappers hebben geprobeerd dit op te lossen door te kijken naar hoe modellen zich gedragen (zoals het testen van hun antwoorden), maar dat is lastig omdat de antwoorden kunnen veranderen afhankelijk van hoe je de vragen stelt. Dus, de grote vraag wordt: kunnen we in de hersenen van het model (de gewichten) kijken om een permanente, onveranderlijke vingerafdruk te vinden die ons de familiegeschiedenis vertelt, zonder dat we er ook maar één vraag aan hoeven te stellen?

Dit artikel, getiteld "Who Built This Model?", zegt ja, dat kunnen we. De auteurs, onderzoekers van Michigan State University, stellen een nieuwe manier voor om de afstamming van AI-modellen te traceren door te kijken naar de geometrie van hun interne gewichten. Ze behandelen de hersenen van het model als een complex muziekinstrument en luisteren naar twee verschillende "geluiden" die het maakt: de luidheid van de noten (spectrale energie) en de richting waarin de geluidsgolven reizen (subspace alignment).

Eerst keken ze naar de "luidheid" of de algehele energie van de gewichten van het model. Ze ontdekten dat dit fungeert als een grofmazige stamboom. Als twee modellen uit totaal andere families komen (zoals een robot gebouwd door Bedrijf A versus Bedrijf B), zijn hun "luidheidspatronen" totaal verschillend. Als ze uit dezelfde serie komen (zoals een versie van 3 miljard parameters en een versie van 7 miljard parameters van hetzelfde model), zijn hun patronen zeer vergelijkbaar. De onderzoekers toonden aan dat ze, door deze "spectrale energie" te meten, gemakkelijk konden onderscheiden of twee modellen vreemden of verre neven waren. Dit is een grote zaak, omdat eerdere methoden deze twee groepen vaak door elkaar haalden en het verschil niet zagen tussen een totaal nieuw model en een opgeschaalde versie van een oud model.

Echter, de "luidheidstest" loopt tegen een muur aan wanneer de modellen zeer nauwe verwanten zijn. Stel je twee modellen voor die van precies hetzelfde basismodel zijn vertrokken, maar daarna verschillende trainingskampen hebben doorlopen: de één leerde om een wiskundetutor te zijn, en de ander leerde om een creatieve schrijver te zijn. Hun "luidheid" is bijna identiek, dus de eerste test kan hen niet van elkaar onderscheiden. Dit is waar het tweede deel van de magie van het artikel om de hoek komt kijken: "subspace alignment". In plaats van alleen te luisteren naar hoe hard de muziek is, keken de auteurs naar de richting van de noten. Ze ontdekten dat zelfs wanneer het algemene volume hetzelfde is, de specifieke richtingen waarin de hersengolven van het model wijzen, licht veranderen afhankelijk van wat het model heeft geleerd. Als een model op een kleine dataset is getraind, is de directionele vingerafdruk bijna hetzelfde als die van het origineel. Maar als het op een enorme, diverse dataset is getraind, verschuiven die richtingen merkbaar.

Het team testte dit op meer dan 110 verschillende paren open-source modellen. Ze ontdekten dat hun nieuwe methode kon doen wat oude methoden niet konden: het kon de "vreemden" scheiden van de "neven", en vervolgens inzoomen om het verschil te zien tussen "neven" die verschillende levenservaringen hadden (verschillende trainingsdata of algoritmen). Ze toonden bijvoorbeeld aan dat hun methode kon detecteren dat een model dat getraind was op 100% van een dataset een andere geometrische vingerafdruk had dan een model dat slechts op 10% was getraind, zelfs als ze van hetzelfde basismodel vertrokken. Ze ontdekten ook dat verschillende trainingsalgoritmen (zoals DPO, PPO en RAFT) duidelijke geometrische littekens achterlaten op verschillende delen van de hersenen van het model.

Kortom, het artikel suggereert dat AI-modellen intrinsieke "biometrie" hebben verborgen in hun gewichtsruimte. Door een controle op globale energie te combineren met een controle op directionele geometrie (om verschillende families te scheiden en vervolgens nauwe verwanten te onderscheiden), kunnen we een betrouwbare kaart maken van wie wat heeft gebouwd en hoe ze zijn geëvolueerd. Dit bevredigt niet alleen de nieuwsgierigheid; het biedt een hulpmiddel om de toeleveringsketen van AI te controleren, zodat we de ware oorsprong weten van de modellen die we gebruiken, en helpt bij het besturen van hun evolutie naarmate ze complexer worden. De auteurs benadrukken dat dit werkt zelfs wanneer we geen toegang hebben tot de trainingsdata, maar alleen tot de uiteindelijke modelgewichten, wat het een krachtig instrument maakt voor transparantie in de AI-wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →