← Neueste Arbeiten
💬 NLP

YaRN: Efficient Context Window Extension of Large Language Models

YaRN ist eine recheneffiziente Methode zur Erweiterung des Kontextfensters von Large Language Models durch eine Optimierung der Rotary Position Embeddings (RoPE), die deutlich weniger Trainingsressourcen benötigt als bisherige Ansätze und eine bessere Extrapolation auf längere Sequenzen ermöglicht.

Ursprüngliche Autoren: Bowen Peng, Jeffrey Quesnelle, Honglu Fan, Enrico Shippole

Veröffentlicht 2026-02-10
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Bowen Peng, Jeffrey Quesnelle, Honglu Fan, Enrico Shippole

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stell dir vor, du liest ein extrem langes Buch. Dein Gehirn ist super darin, Informationen zu verarbeiten, aber es gibt ein Problem: Dein „Arbeitsgedächtnis“ ist wie ein kleiner Notizzettel. Sobald das Buch zu lang wird, fängst du an, die ersten Seiten zu vergessen, um Platz für die neuen zu machen. Du verlierst den roten Faden.

Große Sprachmodelle (wie ChatGPT) haben genau das gleiche Problem. Sie haben ein „Kontextfenster“ – eine begrenzte Menge an Text, die sie gleichzeitig „im Kopf“ behalten können. Wenn der Text länger ist als dieses Fenster, werden sie verwirrt oder vergessen den Anfang.

Die Forscher hinter YaRN haben nun eine Methode entwickelt, um dieses Arbeitsgedächtnis massiv zu vergrößern, ohne dass das Modell komplett neu lernen muss.

Hier ist die Erklärung, wie sie das machen, mit ein paar Analogien:

1. Das Problem: Die „falsche Geschwindigkeit“ der Zeit

Sprachmodelle nutzen eine Technik namens RoPE (Rotary Position Embeddings), um zu wissen, an welcher Stelle ein Wort steht. Man kann sich das wie eine Uhr vorstellen: Jedes Wort bekommt einen Zeiger. Wenn das Wort an Position 1 steht, zeigt der Zeiger auf 1 Uhr, bei Position 2 auf 2 Uhr und so weiter.

Wenn wir dem Modell jetzt plötzlich sagen: „Hey, lies ein Buch, das 10-mal länger ist!“, dann müsste der Zeiger bei Position 100 eigentlich auf 100 Uhr stehen. Aber die Uhr hat nur 12 Stunden! Die Zeiger drehen sich wild im Kreis und das Modell verliert völlig die Orientierung. Es weiß nicht mehr, ob ein Wort am Anfang oder am Ende steht.

2. Die alten Lösungen: Das „Gummiband-Problem“

Früher hat man versucht, die Zeit einfach zu dehnen (Position Interpolation). Das ist so, als würde man versuchen, eine 12-Stunden-Uhr so zu verlangsamen, dass sie 120 Stunden hält. Das Problem: Die Zeiger bewegen sich dann so langsam, dass man die feinen Unterschiede nicht mehr erkennt. Es ist, als würde man versuchen, eine präzise Partitur zu lesen, bei der die Noten so weit auseinandergezogen sind, dass man den Rhythmus nicht mehr spürt. Das Modell wird „verwaschen“ und ungenau.

3. Die Lösung: YaRN – Der „intelligente Zoom“

YaRN (was für „Noch eine RoPE-Erweiterungsmethode“ steht, ein kleiner Scherz der Forscher) ist viel smarter. Anstatt einfach alles gleichmäßig zu dehnen, nutzt es einen dreistufigen Ansatz:

  • Der Fokus auf das Grobe (Die Landkarte): Für die ganz großen Abstände (die „langwelligen“ Informationen) nutzt YaRN die Dehnung. Das ist wie eine Landkarte: Wenn du von Berlin nach München fährst, interessieren dich die Details der einzelnen Straßen nicht, sondern nur die großen Autobahnen.
  • Der Fokus auf das Feine (Die Lupe): Für die kurzen Abstände (die „hochfrequenten“ Informationen) lässt YaRN die Zeiger fast so, wie sie sind. Das ist wie beim Lesen: Wenn du ein Wort liest, musst du die Buchstaben und die Abstände zwischen den Wörtern ganz präzise erkennen können. YaRN sorgt dafür, dass diese „lokale Schärfe“ erhalten bleibt.
  • Die Temperatur-Regelung (Der Fokus-Regler): YaRN fügt noch einen kleinen Trick hinzu, indem es die „Aufmerksamkeit“ des Modells leicht anpasst (ähnlich wie man eine Brille zurechtrückt), damit es bei den riesigen Textmengen nicht den Überblick verliert.

Zusammenfassend: Was ist das Ergebnis?

Stell dir vor, du hättest eine Brille, die es dir erlaubt, gleichzeitig ein ganzes Dorf aus der Vogelperspektive zu sehen (den Überblick behalten) und gleichzeitig die winzigen Details eines einzelnen Blattes an einem Baum zu erkennen (die Präzision behalten).

Das bedeutet für die Praxis:

  • Viel effizienter: Man braucht 10-mal weniger Daten und viel weniger Rechenpower als früher.
  • Extrem weit blicken: Modelle, die eigentlich nur kurze Texte verstehen sollten, können plötzlich ganze Bücher oder riesige Code-Projekte am Stück „lesen“.
  • Kein Gedächtnisverlust: Das Modell wird nicht dümmer, nur weil es mehr Text liest. Es behält seine Intelligenz bei, während sein „Notizzettel“ riesig wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →