← Neueste Arbeiten
🤖 machine learning

Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification

Dieses Paper stellt eine datenfreie White-Box-Methode namens Centered Residual Signatures vor, welche die Abstammung von Open-Weight-Sprachmodellen verifiziert, indem sie einzigartige strukturelle Spuren in Residual-Blöcken analysiert, was eine präzise Unterscheidung zwischen verwandten und unverwandten Checkpoints ermöglicht, unabhängig von Fine-Tuning, Merging oder Quantisierung.

Ursprüngliche Autoren: Aman Singh Thakur, Rayan Khoury

Veröffentlicht 2026-08-18
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Aman Singh Thakur, Rayan Khoury

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen digitalen Landschaft sind Modelle der künstlichen Intelligenz selten statische, isolierte Schöpfungen. Sie sind lebende Entitäten, die sich durch eine komplexe Lieferkette entwickeln. Ein Basismodell, das auf riesigen Mengen an Text trainiert wurde, wird oft von einem Entwickler zum nächsten weitergereicht. Auf diesem Weg wird es angepasst, um spezifische Aufgaben auszuführen, komprimiert, um auf kleineren Geräten zu laufen, oder mit anderen Modellen kombiniert, um etwas Neues zu erschaffen. Diese Operationen verändern die internen Zahlen des Modells, seine Gewichte, aber sie hinterlassen selten eine klare Spur aus Dokumenten. Sobald ein Modell unter einem neuen Namen veröffentlicht wird, ist es schwierig festzustellen, ob es ein echter Nachfahre eines berühmten Originals ist oder lediglich ein Lookalike, der von Grund auf neu gebaut wurde, um ähnlich zu funktionieren. Dieser Mangel an Transparenz schafft einen blinden Fleck im Ökosystem der Open-Source-Intelligenz, was es schwierig macht, die Herkunft zu verifizieren oder geistiges Eigentum zu schützen.

Die zentrale Herausforderung besteht darin, zwischen zwei sehr unterschiedlichen Szenarien zu unterscheiden. Im ersten Fall ist ein Modell ein wahres Kind eines anderen und erbt dessen spezifische mathematische Struktur durch einen Prozess des Fine-Tunings oder Verschmelzens (Merging). Im zweiten Fall ist ein Modell eine unabhängige Schöpfung, die zufällig ähnliche Ergebnisse liefert. Traditionelle Verifizierungsmethoden, wie das Überprüfen digitaler Fingerabdrücke oder die Analyse dessen, wie sich das Modell verhält, scheitern hier oft. Digitale Signaturen brechen in dem Moment zusammen, in dem sich auch nur eine einzige Zahl ändert, und Verhaltenstests können nicht zwischen einer gemeinsamen Geschichte und einem gemeinsamen Ergebnis unterscheiden. Forscher brauchten einen Weg, um in das Gehirn des Modells zu blicken und eine Spur zu finden, die diese Transformationen überdauert – ein Signal, das eine gemeinsame Abstammung beweist, ohne die ursprünglichen Trainingsdaten zu benötigen oder das Modell ausführen zu müssen.

Ein Team von Forschern hat eine Methode entwickelt, um dieses Problem zu lösen, indem sie die einzigartige geometrische Struktur untersuchen, die in den Schichten des Modells hinterlassen wurde. Sie konzentrierten sich auf ein spezifisches architektonisches Merkmal, das in vielen modernen Sprachmodellen verbreitet ist: den Residualblock. In diesen Strukturen fließt die Information durch einen Hauptpfad und fließt auch über einen Nebenpfad vorbei, was es dem Modell ermöglicht, kleine Korrekturen zu lernen, anstatt jedes Mal bei Null anzufangen. Die Forscher entdeckten, dass die mathematischen Operationen in diesen Nebenpfaden, wenn ein Modell trainiert wird, eine sehr spezifische, gemeinsame Ausrichtung entwickeln. Es ist, als ob das Modell lernt, seine internen Komponenten auf eine bestimmte Weise zu organisieren, um diese Korrekturen effizient durchzuführen. Diese Ausrichtung ist jedoch so verbreitet, dass sie in fast jedem trainierten Modell vorkommt, was sie allein unbrauchbar macht, um die Abstammung zu beweisen.

Der Durchbruch gelang den Forschern, als sie erkannten, dass sie den Teil der Struktur isolieren konnten, der einzigartig für einen spezifischen Checkpoint ist. Durch das mathematische Entfernen der gemeinsamen, geteilten Ausrichtung, die alle trainierten Modelle besitzen, blieb ihnen eine Residual-Signatur. Dieses verbleibende Stück ist wie ein einzigartiger Fingerabdruck, der spezifisch für die exakte Historie des Trainings dieses Modells ist. Es erfasst die spezifische Art und Weise, wie die internen Zahlen des Modells während seiner Erstellung angepasst wurden. Das Team entwickelte daraufhin ein Bewertungssystem, um diese Signaturen zwischen zwei verschiedenen Modellen zu vergleichen. Wenn die Modelle einen gemeinsamen Elternteil haben, werden ihre einzigartigen Signaturen eng miteinander übereinstimmen, selbst wenn eines der Modelle stark modifiziert, komprimiert oder mit einem anderen Modell verschmolzen wurde. Wenn sie nicht verwandt sind, werden die Signaturen im Vergleich zueinander wie zufälliges Rauschen aussehen.

Um diese Idee zu testen, führten die Forscher eine Reihe strenger Experimente mit Modellen unterschiedlicher Größe und Komplexität durch. Sie nahmen Basismodelle und unterzogen sie gängigen realen Transformationen, wie etwa dem Fine-Tuning auf neuen Daten, der Verkleinerung der Größe durch Pruning oder der Komprimierung, um sie schneller laufen zu lassen. Sie erstellten auch unabhängige Modelle, die von Grund auf neu trainiert wurden, um das Verhalten der Originale nachzuahmen. Die Ergebnisse waren beeindruckend. Die neue Bewertungsmethode identifizierte jedes einzelne wahre Nachkommnis erfolgreich, ungeachtet dessen, wie stark das Modell verändert worden war. Sie unterschied sie mit perfekter Genauigkeit von unabhängigen Modellen, selbst wenn diese unabhängigen Modelle darauf ausgelegt waren, fast identisch zu funktionieren. Die Methode funktionierte über verschiedene Familien von Sprachmodellen hinweg, einschließlich jener, die für Programmierung und allgemeine Konversation genutzt werden, was beweist, dass das Signal eine fundamentale Eigenschaft der Art und Weise ist, wie diese Netzwerke lernen.

Die Forscher testeten die Methode auch gegen ein aggressiveres Szenario, in dem ein Angreifer versuchte, die Herkunft des Modells zu verschleiern. Sie versuchten, die internen Komponenten des Modells zu vertauschen oder seine Zahlen so zu skalieren, dass die Funktion des Modells erhalten bleibt, aber sein Erscheinungsbild für traditionelle Detektionswerkzeuge durcheinandergebracht wird. Während ältere Methoden unter diesen Bedingungen völlig versagten, blieb die neue Signatur stabil. Dies liegt daran, dass die Methode nicht auf der Reihenfolge der Komponenten oder deren absoluter Größe basiert, sondern auf der spezifischen geometrischen Beziehung zwischen ihnen. Die Forscher fanden heraus, dass ihr Ansatz auch signifikant schneller war als die nächstbeste konkurrierende Technik und auf großen Modellen um ein Vielfaches schneller lief. Diese Geschwindigkeit, kombiniert mit der Fähigkeit, ohne Trainingsdaten oder die Notwendigkeit, das Modell auszuführen, macht ihn zu einem praktischen Werkzeug für die Prüfung der Lieferkette der Open-Source-Künstlichen-Intelligenz.

In einer praktischen Demonstration wandte das Team seine Methode auf eine Sammlung öffentlicher Sprachmodelle an, von denen behauptet wurde, mit einem berühmten Original verwandt zu sein. Der Test identifizierte korrekt die drei Modelle, die echte Nachkommen waren, und wies ihnen hohe Ähnlichkeitswerte zu. Gleichzeitig markierte er sieben andere Modelle, die dieselbe Architektur besaßen, aber unabhängig trainiert worden waren, korrekt und wies ihnen Werte nahe Null zu. Dies bestätigte, dass die Methode zwischen einer echten Abstammungslinie und einem bloßen architektonischen Klon unterscheiden kann. Die Studie legt nahe, dass dieses passive, datenfreie Signal ein zuverlässiger Weg ist, um die Geschichte von Open-Weight-Modellen zu verifizieren. Es bietet eine Möglichkeit, die unsichtbaren Verbindungen zwischen Modellen zu sehen und sicherzustellen, dass die Abstammungslinie der Künstlichen Intelligenz verfolgt, verifiziert und verstanden werden kann, selbst wenn die ursprünglichen Schöpfer längst weg sind.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →