← Neueste Arbeiten
💻 computer science

Scale Determines Whether Language Models Organize Representation Geometry for Prediction

Dieser Beitrag stellt Subspace PGA vor, um zu zeigen, dass zwar die Repräsentationsgeometrie von Sprachmodellen für die Vorhersage organisiert ist, kleine Modelle diese Ausrichtung jedoch in späteren Schichten aufgrund eines Kapazitätstausches verlieren, der durch dominante Richtungen maskiert wird, während große Modelle sie während des gesamten Trainings bewahren.

Ursprüngliche Autoren: Weilun Xu

Veröffentlicht 2026-05-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Weilun Xu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die große Idee: Wie Sprachmodelle im Raum „denken"

Stellen Sie sich ein Sprachmodell (wie die, die Aufsätze schreiben oder mit Ihnen chatten) als eine riesige, mehrstöckige Bibliothek vor. Jedes Mal, wenn das Modell ein Wort liest, erstellt es ein „Lesezeichen" (eine Repräsentation) und legt es auf ein bestimmtes Regal in einem bestimmten Raum (einer Schicht) der Bibliothek ab.

Das Paper stellt eine einfache Frage: Wie sind diese Lesezeichen angeordnet?

Lange Zeit haben Wissenschaftler die Form der Regale betrachtet (sind sie überfüllt? sind sie leer?). Dieses Paper fragt etwas anderes: Sind die Regale so angeordnet, dass das Modell das nächste Wort vorhersagen kann?

Die Autoren entdeckten, dass die Antwort vollständig von der Größe der Bibliothek (dem Maßstab des Modells) abhängt.


Das Werkzeug: Der „Vorhersage-Kompass" (Subspace PGA)

Um diese Frage zu beantworten, entwickelten die Autoren ein neues Messwerkzeug namens Subspace PGA.

Stellen Sie sich das endgültige Ziel des Modells als eine „Zielzone" vor (die Unembedding-Matrix oder WUW_U). Dies ist die spezifische Richtung, in die das Modell zeigen muss, um das nächste Wort korrekt zu raten.

  • Der Test: Die Autoren nehmen die „Lesezeichen" aus der Mitte der Bibliothek und fragen: „Wenn wir nur die Richtungen betrachten, die auf die Zielzone zeigen, ergeben die Lesezeichen dann immer noch Sinn zueinander?"
  • Der Score (Z-Score):
    • Hoher positiver Score: Die Lesezeichen sind perfekt organisiert. Selbst wenn Sie alle anderen Richtungen ignorieren, halten die Richtungen, die auf die Zielzone zeigen, die Karte zusammen. Die Bibliothek ist auf Vorhersage organisiert.
    • Null oder negativer Score: Die Lesezeichen sind verstreut. Die Richtungen, die auf die Zielzone zeigen, sind genauso zufällig wie jede andere Richtung. Die Bibliothek hat ihre Organisation für Vorhersage verloren.

Die Entdeckung: Größe zählt

Die Forscher testeten Bibliotheken unterschiedlicher Größen (von winzigen Modellen mit 70 Millionen Parametern bis hin zu riesigen Modellen mit 6,9 Milliarden Parametern). Sie fanden zwei sehr unterschiedliche Verhaltensweisen:

1. Die großen Bibliotheken (Große Modelle)

Die „Direkte Route"
In großen Modellen (wie Pythia-1B und größer) ist die Organisation vom untersten bis zum obersten Stockwerk konsistent.

  • Analogie: Stellen Sie sich ein riesiges Autobahnnetz vor. Egal, welche Ausfahrt Sie nehmen, die Wegweiser sind immer klar und zeigen direkt zum Ziel. Die Richtungen der „Zielzone" sind immer die wichtigsten.
  • Ergebnis: Die Geometrie bleibt durchgehend für Vorhersagen organisiert.

2. Die kleinen Bibliotheken (Kleine Modelle)

Die „Umleitung"
In kleineren Modellen (wie Pythia-410M und kleiner) passiert etwas Seltsames in der Nähe der oberen Stockwerke (den späteren Schichten).

  • Analogie: Stellen Sie sich eine kleine, überfüllte Stadt vor. Je näher Sie an die Ausfahrt kommen, desto mehr wird die Hauptstraße von einem riesigen, langsam fahrenden Lastwagen blockiert (einer „dominanten Richtung" der Varianz). Dieser Lastwagen fährt nicht zur Zielzone; er fährt woanders hin.
  • Das Problem: Da die Stadt klein ist, gibt es nicht genug Platz sowohl für die „Zielzone-Straße" als auch für die „Lastwagen-Straße". Der Lastwagen übernimmt die ganze Straße. Die Schilder, die zur Zielzone zeigen, werden zur Seite gedrängt und unsichtbar.
  • Die Wendung: Kurz vor der allerletzten Ausfahrt (der letzten Schicht) räumt das Modell plötzlich den Lastwagen weg und stellt die Schilder wieder auf. Die endgültige Antwort ist immer noch korrekt, aber die Reise dorthin war eine Umleitung.

Wichtige Erkenntnisse in einfacher Sprache

1. Der „Maskierungs"-Effekt
Das Paper argumentiert, dass die kleinen Modelle nicht vergessen, wie man vorhersagt. Die Information ist noch da, aber sie wird von dieser einen riesigen „Lastwagen"-Richtung maskiert (versteckt).

  • Beweis: Wenn Sie künstlich diese eine dominante Richtung (den Lastwagen) entfernen, zeigen die kleinen Modelle plötzlich wieder eine perfekte Organisation, genau wie die großen. Die Struktur wurde nie zerstört; sie war nur zugedeckt.

2. Verlustkurven lügen
Normalerweise bewerten wir ein Modell anhand seines „Verlusts" (wie viele Fehler es macht).

  • Die Überraschung: Sowohl die kleinen Modelle (mit der Umleitung) als auch die großen Modelle (mit der direkten Route) erreichen dieselbe niedrige Fehlerrate. Beide sagen das nächste Wort gleich gut voraus.
  • Die Lehre: Man kann nicht daran erkennen, ob ein Modell „organisiert" ist oder eine „Umleitung" nimmt, indem man nur seine Fehlerrate betrachtet. Ein Modell kann perfekte Vorhersagen treffen, während seine innere Geometrie völlig durcheinander ist.

3. Alte Werkzeuge haben das übersehen
Wissenschaftler verwendeten zuvor Werkzeuge, die die „Form" der Daten maßen (wie weit die Lesezeichen verteilt sind).

  • Das Versagen: Diese alten Werkzeuge sagten, dass die kleinen und großen Modelle gleich aussahen. Sie konnten nicht erkennen, dass die kleinen Modelle eine Umleitung nahmen. Der neue „Vorhersage-Kompass" (Subspace PGA) ist das erste Werkzeug, das diesen Unterschied aufdeckt.

Zusammenfassende Analogie

Stellen Sie sich zwei Köche vor, die dieselbe Suppe zubereiten.

  • Der große Koch (Großes Modell): Hält alle Zutaten von Anfang bis Ende in beschrifteten Schüsseln organisiert. Wenn es Zeit zum Servieren ist, ist die Suppe fertig.
  • Der kleine Koch (Kleines Modell): Beginnt mit beschrifteten Schüsseln. Aber auf halber Weg kippt er alles in einen einzigen riesigen, chaotischen Topf, weil seine Küche zu klein ist, um die Schüsseln getrennt zu halten. Er rührt wild umher (die „Umleitung"). Allerdings schöpft er kurz vor dem Servieren magisch die perfekte Suppe aus dem Chaos heraus und serviert sie.

Das Ergebnis: Beide Köche servieren dieselbe köstliche Suppe (niedriger Verlust).
Der Unterschied: Die Küche des großen Kochs war die ganze Zeit über für die Aufgabe organisiert. Die Küche des kleinen Kochs war für den größten Teil des Prozesses chaotisch und unorganisiert und ordnete sich erst in der allerletzten Sekunde wieder.

Die Schlussfolgerung: Die Größe des Modells bestimmt nicht nur, wie gut es vorhersagt, sondern wie es seine innere Welt organisiert, um dies zu tun. Kleine Modelle nehmen einen chaotischen Umweg; große Modelle nehmen einen direkten Weg.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →