← Neueste Arbeiten
💬 NLP

A Hyperbolicity Atlas of Large Language Model Hidden States

Diese Arbeit präsentiert die erste systematische Untersuchung, die zeigt, dass die Gromov-Hyperbolizität in den Hidden States von LLMs primär durch die Schichttiefe getrieben wird – mit einem Höhepunkt in den mittleren Schichten und einer zunehmenden Baumstruktur in den finalen Schichten –, anstatt durch die Modellgröße, was ein praktisches Diagnosewerkzeug für das Verständnis hierarchischer Distanzstrukturen über verschiedene Modellfamilien und Eingabedomänen hinweg bietet.

Ursprüngliche Autoren: Zhichao Yang, Yuanze Hu, Gen Li, Qingchen Yu, Shiying Duan, Xinyu Wang, Ye Qiu, Zeming Liu, Guangxu Chen, Zhaoxin Fan

Veröffentlicht 2026-09-09
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhichao Yang, Yuanze Hu, Gen Li, Qingchen Yu, Shiying Duan, Xinyu Wang, Ye Qiu, Zeming Liu, Guangxu Chen, Zhaoxin Fan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In den Computern, die die moderne künstliche Intelligenz antreiben, existiert eine verborgene Welt der Zahlen. Wenn diese Maschinen einen Satz lesen oder eine Frage verarbeiten, speichern sie die Wörter nicht als Text. Stattdessen übersetzen sie jedes Wort in eine lange Liste von Zahlen, einen Vektor, der in einem riesigen, mehrdimensionalen Raum existiert. Seit Jahren wissen Wissenschaftler, dass die Dinge, die diese Maschinen verarbeiten – wie etwa die Struktur eines Stammbaums, die Schritte in einem Computerprogramm oder die Logik einer Geschichte – oft hierarchisch sind. Sie haben eine Spitze, eine Basis und viele Zweige dazwischen. Eine natürliche Frage stellte sich: Ordnen sich auch die internen Zahlenlisten, die die Maschine erstellt, um diese Dinge zu verstehen, in einer baumartigen Form an? Wenn die interne Karte der Maschine wie ein Baum aussert, könnte dies bedeuten, dass der Computer Informationen auf eine Weise organisiert, die die komplexen Strukturen der menschlichen Sprache und Logik widerspiegelt. Um dies zu beantworten, wandten Forscher ein mathematisches Konzept namens Hyperbolizität an, das wie ein Lineal fungiert, um zu messen, wie „baumartig“ eine Sammlung von Punkten ist. Ein niedriger Wert bedeutet, dass die Punkte in einer ordentlichen, verzweigenden Hierarchie angeordnet sind, während ein hoher Wert bedeutet, dass sie eher chaotisch und flach gestreut sind.

Ein Team von Forschern aus Peking und Guangzhou setzte sich zum Ziel, diese verborgene Geometrie über die fortschrittlichsten verfügbaren Sprachmodelle hinweg abzubilden. Sie bauten keine neue Maschine und veränderten nicht die Funktionsweise der bestehenden. Stattdessen agierten sie als Kartografen, indem sie zehn verschiedene Open-Source-Modelle durch vier sehr unterschiedliche Arten von Aufgaben schickten: das Lösen von Mathematikproblemen, das Schreiben von Computercode, das Beantworten von Fragen zum gesunden Menschenverstand und das Beurteilen der Wahrhaftigkeit von Aussagen. Für jedes einzelne Wort in den Eingabeaufforderungen (Prompts) massen sie den Abstand zwischen den Zahlenlisten, die die Maschine erstellte. Dies taten sie für über 800.000 spezifische Messungen, die zehn verschiedene Modelle unterschiedlicher Größe und jede einzelne Verarbeitungsschicht innerhalb jeder dieser Maschinen abdeckten. Ihr Ziel war es, einen Atlas zu erstellen, eine detaillierte Karte, die genau zeigt, wo die interne Struktur dieser Maschinen wie ein Baum aussieht und wo nicht.

Die auffälligste Entdeckung war, dass die Größe der Maschine weit weniger wichtig war als der Ort, an dem man in ihr nachsah. Viele Menschen nehmen an, dass ein größeres Modell mit mehr Parametern automatisch „schlauer“ oder strukturierter ist. Die Forscher fanden heraus, dass dies weitgehend nicht zutrifft. Einfach ein Modell größer zu machen, führte nicht konsistent dazu, dass seine interne Struktur baumartiger wurde. In einigen Fällen war ein größeres Modell tatsächlich weniger organisiert als ein kleineres, in anderen Fällen war es besser organisiert. Das wahre Muster zeigte sich, wenn sie die Tiefe der Verarbeitung der Maschine betrachteten. Während die Informationen von der ersten Schicht des Netzwerks zur Mitte wanderten, wurde die Struktur ungeordnet und flach, wodurch sie ihre baumartige Form verlor. Die Zahlen in den mittleren Schichten waren gedrängt und komplex, was eine Mischung aus vielen verschiedenen Arten von Informationen widerspiegelte. Doch als die Daten die finalen Schichten erreichten, kurz bevor die Maschine eine Antwort produzierte, änderte sich die Struktur dramatisch. Die Zahlen sprangen in eine viel klarere, baumartigere Anordnung zurück. Dies deutet darauf hin, dass die Maschine mit einer chaotischen Mischung aus Möglichkeiten beginnt und diese kurz vor dem Ende in eine strukturierte Form komprimiert.

Die Forscher fanden auch heraus, dass die spezifische Art des Modells und die Aufgabe, für die es trainiert wurde, die Karte signifikant veränderten. Zwei Modelle exakt derselben Größe konnten je nach ihrem Training völlig unterschiedliche interne Geometrien aufweisen. Beispielsweise zeigte ein Modell, das auf das Schreiben von Code spezialisiert war, eine sehr starke baumartige Struktur bei der Verarbeitung von Programmieraufgaben, aber ein Modell, das für allgemeine Mathematik trainiert wurde, zeigte dieses Muster nicht, selbst wenn es gebeten wurde, Mathematikaufgaben zu lösen. Tatsächlich ließ das auf Code spezialisierte Modell die Struktur von Code-Prompts eher wie einen Baum aussehen als das allgemeine Modell, während das auf Mathematik spezialisierte Modell seine Struktur komplexer hielt. Dies bedeutet, dass die „Form“ des Denkens einer Maschine keine feste Eigenschaft ihrer Größe ist, sondern ein flexibles Ergebnis dessen, wie sie trainiert wurde und was sie gerade tut.

Letztendlich liefert diese Studie einen neuen Weg, um zu verstehen, wie künstliche Intelligenz Informationen organisiert. Sie zeigt, dass die interne Welt dieser Modelle keine statische, uniforme Landschaft ist. Stattdessen ist es eine dynamische Reise, bei der Informationen in einem komplexen, flachen Zustand beginnen, durch einen überfüllten Mittelteil wandern und sich ganz am Ende in eine strukturierte, baumartige Form einpendeln. Die Forscher kommen zu dem Schluss, dass es nicht ausreicht, nur auf die endgültige Antwort oder die Gesamtgröße eines Modells zu schauen, um dessen innere Abläufe zu verstehen. Um wirklich zu sehen, wie diese Maschinen denken, muss man den Pfad betrachten, den die Informationen nehmen, und beachten, dass die wichtigsten strukturellen Veränderungen in den letzten Momenten vor einer Entscheidung stattfinden. Diese Karte bietet ein praktisches Werkzeug für Wissenschaftler, um zu sehen, wo diese Modelle ihre Gedanken organisieren und wo sie noch kämpfen, was offenbart, dass die Geometrie der Intelligenz weitaus nuancierter ist, als es ein einfaches Maß der Größe jemals zeigen könnte.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →