← Neueste Arbeiten
💬 NLP

Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

Dieses Paper führt eine Fine-Tuning-Methode für Transformer-Modelle ein, die effiziente Long-Context-Inferenz mittels Sparse Attention auf moderater Hardware ermöglicht, indem sie Modellen erlaubt, sich mit verschiedenen KV-Cache-Policies zu ko-adaptieren, wobei sie oft exakte Attention-Ansätze übertrifft.

Ursprüngliche Autoren: Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

Veröffentlicht 2026-08-21
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Moderne Systeme der künstlichen Intelligenz, die menschenähnliche Texte generieren, verlassen sich auf einen Mechanismus, der als Kurzzeitgedächtnis fungiert und es ihnen ermöglicht, sich an das zu erinnern, was früher in einem Gespräch oder einem langen Dokument gesagt wurde. Dieses Gedächtnis wird in einem digitalen Puffer gespeichert, der mit jedem neuen Wort, das das System verarbeitet, größer wird. Damit diese Systeme über lange Textstrecken hinweg gut funktionieren können, muss dieses Gedächtnis gewaltig sein, aber die Computerhardware, die erforderlich ist, um es bereitzustellen, ist teuer und begrenzt. Wenn der Speicherpuffer voll ist, muss das System entscheiden, welche alten Informationen es verwirft, um Platz für die neuen zu schaffen. Wenn es die falschen Informationen wegwirft, verliert das System die Fähigkeit zu denken oder Fragen präzise zu beantworten. Dies erzeugt einen schwierigen Kompromiss: Ein kleines Gedächtnis spart Geld und ermöglicht es dem System, auf Standardausrüstung zu laufen, birgt aber das Risiko, den Kontext zu verlieren, der für die Intelligenz notwendig ist.

Forscher haben lange versucht, dies zu lösen, indem sie das System lehren, selektiv bei dem zu sein, was es behält – ein Prozess, der als Sparse Attention bekannt ist. Jedoch enthüllt eine neue Studie einen kritischen Fehler in der Art und Weise, wie diese Systeme bisher trainiert wurden. Die meisten bestehenden Methoden trainieren die KI mit einem perfekten, unbegrenzten Gedächtnis und versuchen dann, sie später dazu zu zwingen, mit einem begrenzten Gedächtnis zu arbeiten. Die Forscher fanden heraus, dass dieser Ansatz scheitert, weil die KI nie gelernt hat, unter den spezifischen Einschränkungen zu funktionieren, denen sie in der Realität tatsächlich gegenüberstehen würde. Indem sie das Modell dazu brachten, von vornherein absichtlich zu vergessen und sich an eine feste Speichergröße anzupassen, demonstrierte das Team, dass das System deutlich besser performen konnte als jene, die mit unbegrenzten Ressourcen trainiert wurden, selbst wenn es auf einem einzigen, mäßig leistungsstarken Computerchip lief.

Das Team, unter der Leitung von Wissenschaftlern von Amazon Web Services und der Universität Amsterdam, entwickelte eine neue Art, diese großen Sprachmodelle fein abzustimmen. Anstatt massive Supercomputer zu verwenden, um ein perfektes Gedächtnis zu simulieren, lehrten sie die Modelle, mit einer spezifischen Speicherverwaltungsstrategie zu ko-adaptieren. Stellen Sie sich einen Bibliothekar vor, der darauf trainiert wird, Bücher in einer Bibliothek mit unendlichen Regalen zu organisieren, nur um später angewiesen zu werden, in einem winzigen Raum mit einem einzigen Regal zu arbeiten. Der Bibliothekar, der im großen Archiv trainiert wurde, würde wahrscheinlich Schwierigkeiten haben, in dem kleinen Raum zu priorisieren, was er behalten soll. Im Gegensatz dazu trainiert die in diesem Paper vorgeschlagene Methode den Bibliothekar direkt in dem kleinen Raum und lehrt ihn genau, welche Bücher er basierend auf den Regeln dieses spezifischen Raumes behalten und welche er wegwerfen soll. Dies ermöglicht es dem Modell, den Rhythmus seiner eigenen Einschränkungen zu lernen, anstatt zu versuchen, die Gewohnheiten des Besitzes von zu viel Platz zu verlernen.

Das Team testete diesen Ansatz an einem Modell mit vier Milliarden Parametern, einer Größe, die substanziell, aber handhabbar ist. Sie führten ihre Experimente auf einer einzigen Grafikkarte mit 40 Gigabyte Speicher durch, ein Setup, das für viele Organisationen erschwinglich ist im Vergleich zu den Clustern aus Dutzenden von Karten, die frühere Methoden erforderten. Sie verglichen ihre neue Trainingsmethode mit der Standardmethode, die eine Technik namens Sequence Parallelism nutzt, um die Speicherlast auf mehrere teure Geräte aufzuteilen. Die Ergebnisse zeigten, dass die mit der neuen Methode trainierten Modelle oft die Standardmodelle übertrafen, insbesondere wenn die Aufgabe erforderte, spezifische, prägnante Antworten zu generieren, anstatt lange, ausschweifende Texte. In mehreren Tests mit komplexen Fragen und Datenextraktion produzierten die Standardmethoden Ausgaben, die viel zu lang waren und voller zufälliger, unsinniger Zahlen bestanden, während die neue Methode lernte, zur richtigen Zeit aufzuhören und den korrekten Einzelwert zu liefern.

Ein wesentlicher Teil dieses Erfolgs war die Verbesserung des „Heavy-Hitter-Oracle“, einer populären Strategie, um zu entscheiden, welche Informationen man behält. Diese Strategie funktioniert, indem sie verfolgt, welchen Informationen das Modell über die Zeit hinweg die meiste Aufmerksamkeit schenkt. Die Forscher fanden heraus, dass die ursprüngliche Version dieser Strategie langsam und ineffizient war. Sie schrieben den zugrunde liegenden Code so um, dass er viel schneller arbeitet, was es dem System ermöglicht, diese Wichtigkeits-Scores zu berechnen, ohne den gesamten Prozess zu verlangsamen. Diese Optimierung bedeutete, dass das System in Echtzeit kluge Entscheidungen darüber treffen konnte, was es vergessen sollte, ohne die massive Rechenleistung zu benötigen, die normalerweise mit solchen Aufgaben einhergeht. Das Team veröffentlichte auch eine neue Open-Source-Softwarebibliothek, um diese Techniken anderen zugänglich zu machen, mit dem Ziel, die Hürden für jeden zu senken, der Langkontext-KI-Systeme bauen möchte, ohne dafür ein Vermögen an Hardware zu benötigen.

Die Studie unterstreicht, dass die Art und Weise, wie ein Modell trainiert wird, genauso wichtig ist wie die Hardware, auf der es läuft. Als die Forscher das Modell zwangen, mit exakt denselben Speicherbeschränkungen zu trainieren, denen es auch während der Nutzung gegenübersteht, lernte es, diese Beschränkungen effektiv zu navigieren. In einem spezifischen Test mit JSON-Daten versagte die Standardmethode vollständig, da sie nicht in der Lage war, die korrekten Datenpunkte zu finden, während die neue Methode Erfolg hatte, diese etwa die Hälfte der Zeit zu identifizieren. Dies deutet darauf hin, dass die Fähigkeit, lange Kontexte zu verarbeiten, nicht nur eine Frage des Besitzes von mehr Speicher ist, sondern davon abhängt, dem System beizubringen, wie es den vorhandenen Speicher verwaltet. Die Erkenntnisse zeigen, dass der effektivste Weg nach vorn für viele Anwendungen nicht darin besteht, größere Computer zu bauen, sondern die Software effizienter mit den Ressourcen werden zu lassen, die sie bereits besitzt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →