← Neueste Arbeiten
💻 computer science

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

Dieses Paper schlägt ein einheitliches geometrisches Fingerprinting-Framework vor, das die spektrale Energie und die Subraumausrichtung von LLM-Gewichtsmatrizen analysiert, um die Modellabstammung robust zurückzuverfolgen und zwischen unabhängigen, zur selben Serie gehörenden und auf derselben Basis basierenden Modellen zu unterscheiden, ohne Zugriff auf Eingabedaten zu benötigen.

Ursprüngliche Autoren: Yiwei Chen, Bingqi Shang, Sijia Liu

Veröffentlicht 2026-08-11
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yiwei Chen, Bingqi Shang, Sijia Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Sie jedes Mal, wenn Sie einen Roboter bauen, eine einzigartige, unsichtbare DNA-Strähne in dessen Gehirn hinterlassen. In dem schnelllebigen Universum der Künstlichen Intelligenz werden diese „Roboter“ als Large Language Models (LLMs) bezeichnet – superintelligente Computerprogramme, die Geschichten schreiben, Matheaufgaben lösen und wie Menschen chatten können. Aber hier ist der Clou: Diese Modelle werden nicht immer von Grund auf neu gebaut. Oft nimmt ein Unternehmen ein riesiges, vorgefertigtes Modell, passt es leicht an, trainiert es mit neuen Daten nach und veröffentlicht eine „neue“ Version. Es ist, als würde man das geheime Rezept eines berühmten Kochs nehmen, eine Prise Salz hinzufügen und es dann als sein eigenes bezeichnen. Dies schafft einen chaotischen Stammbaum, bei dem es schwer nachzuvollziehen ist, wer mit wem verwandt ist, wer wen kopiert hat und woher ein Modell tatsächlich stammt. Dies ist das Problem der „Provenienz“ (Herkunft): zu wissen, der wahre Ursprung von etwas. Wissenschaftler haben versucht, dies zu lösen, indem sie untersuchen, wie Modelle agieren (wie etwa durch das Testen ihrer Antworten), aber das ist knifflig, weil sich die Antworten ändern können, je nachdem, wie man die Fragen stellt. Also lautet die große Frage: Können wir in das Gehirn des Modells schauen (seine Gewichte), um einen permanenten, unveränderlichen Fingerabdruck zu finden, der uns seine Familiengeschichte verrät, ohne dass wir ihm auch nur eine einzige Frage stellen müssen?

Dieses Paper mit dem Titel „Who Built This Model?“ sagt: Ja, das können wir. Die Autoren, Forscher der Michigan State University, schlagen einen neuen Weg vor, die Abstammung von KI-Modellen zu verfolgen, indem sie die Geometrie ihrer internen Gewichte untersuchen. Sie behandeln das Gehirn des Modells wie ein komplexes Musikinstrument und hören auf zwei verschiedene „Klänge“, die es erzeugt: die Lautstärke der Töne (spektrale Energie) und die Richtung, in die die Schallwellen wandern (Subraum-Ausrichtung).

Zuerst untersuchten sie die „Lautstärke“ oder die gesamte Energie der Gewichte des Modells. Sie fanden heraus, dass dies wie ein grobkörniger Stammbaum fungiert. Wenn zwei Modelle aus völlig unterschiedlichen Familien stammen (wie ein Roboter, der von Unternehmen A gebaut wurde, im Vergleich zu einem von Unternehmen B), sind ihre „Lautstärkemuster“ völlig verschieden. Wenn sie aus derselben Serie stammen (wie eine 3-Milliarden-Parameter-Version und eine 7-Milliarden-Parameter-Version desselben Modells), sind ihre Muster sehr ähnlich. Die Forscher zeigten, dass sie durch die Messung dieser „spektralen Energie“ leicht feststellen konnten, ob zwei Modelle Fremde oder entfernte Cousins waren. Dies ist ein großer Fortschritt, da bisherige Methoden diese beiden Gruppen oft verwechselten und nicht zwischen einem völlig neuen Modell und einer skalierten Version eines alten Modells unterscheiden konnten.

Doch der „Lautstärke-Test“ stößt an seine Grenzen, wenn die Modelle sehr enge Verwandte sind. Stellen Sie sich zwei Modelle vor, die beide vom exakt gleichen Basismodell ausgegangen sind, aber dann unterschiedliche Trainingslager besucht haben: Das eine lernte, ein Mathetutor zu sein, das andere, ein kreativer Autor zu sein. Ihre „Lautstärke“ ist fast identisch, sodass der erste Test sie nicht voneinander unterscheiden kann. Hier geschieht die Magie des zweiten Teils des Papers: die „Subraum-Ausrichtung“. Anstatt nur darauf zu achten, wie laut die Musik ist, untersuchten die Autoren die Richtung der Töne. Sie entdeckten, dass selbst wenn die allgemeine Lautstärke gleich bleibt, die spezifischen Richtungen, in die die Gehirnwellen des Modells zeigen, sich je nach dem, was das Modell gelernt hat, leicht verändern. Wenn ein Modell auf einem winzigen Datensatz trainiert wurde, ist sein richtungsbezogener Fingerabdruck fast derselbe wie der des Originals. Wenn es jedoch auf einem massiven, vielfältigen Datensatz trainiert wurde, verschieben sich diese Richtungen merklich.

Das Team testete dies an über 110 verschiedenen Paaren von Open-Weight-Modellen. Sie fanden heraus, dass ihre neue Methode das leisten konnte, was alte Methoden nicht konnten: Sie konnte die „Fremden“ von den „Cousins“ trennen und dann so genau hinsehen, dass sie den Unterschied zwischen „Cousins“ mit unterschiedlichen Lebenserfahrungen (unterschiedliche Trainingsdaten oder Algorithmen) feststellen konnte. Beispielsweise zeigten sie, dass ihre Methode erkennen konnte, dass ein Modell, das mit 100 % eines Datensatzes trainiert wurde, einen anderen geometrischen Fingerabdruck hatte als eines, das nur mit 10 % trainiert wurde, obwohl beide vom selben Basismodell ausgingen. Sie fanden auch heraus, dass verschiedene Trainingsalgorithmen (wie DPO, PPO und RAFT) deutliche geometrische Narben an verschiedenen Teilen des Gehirns des Modells hinterlassen.

Kurz gesagt legt das Paper nahe, dass KI-Modelle eine intrinsische „Biometrie“ in ihrem Gewicht-Raum verbergen. Indem wir eine Prüfung der globalen Energie (um verschiedene Familien zu trennen) mit einer Prüfung der richtungsbezogenen Geometrie (um enge Verwandte zu unterscheiden) kombinieren, können wir eine zuverlässige Karte erstellen, wer was gebaut hat und wie es sich entwickelt hat. Dies dient nicht nur der Neugier; es bietet ein Werkzeug, um die Lieferkette der KI zu überprüfen, sicherzustellen, dass wir die wahren Ursprünge der Modelle kennen, die wir verwenden, und hilft dabei, ihre Entwicklung zu steuern, während sie immer komplexer werden. Die Autoren betonen, dass dies auch dann funktioniert, wenn wir keinen Zugriff auf die Trainingsdaten haben, sondern nur auf die fertigen Modellgewichte, was es zu einem mächtigen Werkzeug für Transparenz in der Welt der KI macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →