← Neueste Arbeiten
💬 NLP

PERK: Long-Context Reasoning as Test-Time Learning

Das Papier stellt PERK vor, ein parametereffizientes Framework, das mittels verschachtelter Meta-Learning-Schleifen Gradienten-Updates zur Testzeit nutzt, um lange Kontexte in Low-Rank-Adapter zu kodieren, wobei es Standard-Fine-Tuning und spezialisierte Modelle in Aufgaben des Long-Context-Reasoning über verschiedene Modellskalen hinweg signifikant übertrifft.

Ursprüngliche Autoren: Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

Veröffentlicht 2026-09-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Große Sprachmodelle sind leistungsstarke Werkzeuge, die gelernt haben zu lesen und zu schreiben, indem sie riesige Mengen an Text studiert haben. Sie zeichnen sich dadurch aus, Muster zu finden und Fragen zu beantworten, wenn die Information direkt vor ihnen liegt. Diese Modelle stehen jedoch vor einer erheblichen Hürde, wenn die benötigte Information in einer massiven Wand von Text verborgen ist, wie etwa in einem Buch mit großem Umfang oder einem langen Transkript. Wenn der Text länger wird, fällt es den Modellen oft schwer, das irrelevante Rauschen zu ignorieren und die spezifische Tatsache zu finden, die zur Lösung eines Problems erforderlich ist. Diese Schwierigkeit wird durch eine Tendenz vieler Modelle verstärkt, sich stark auf den Anfang oder das Ende eines Textes zu konzentrieren, während sie die Details in der Mitte aus den Augen verlieren. Forscher suchen schon lange nach Wegen, um diesen Modellen zu helfen, solche „Long-Context“-Aufgaben zu bewältigen, ohne dass sie von Grund auf neu trainiert werden müssen – ein Prozess, der oft prohibitiv teuer und zeitaufwendig ist.

In einer neuen Studie, die auf der ICLR 2026 Konferenz vorgestellt wurde, schlagen Forscher der EPFL eine Lösung namens PERK vor, was für „Parameter Efficient Reasoning over Knowledge“ steht. Anstatt zu versuchen, das Modell zu zwingen, ein massives Dokument auf einmal zu lesen, behandelt PERK den Akt des Lesens als einen Lernprozess, der genau in dem Moment stattfindet, in dem die Frage gestellt wird. Stellen Sie sich einen Studenten vor, der bei Erhalt eines dicken Lehrbuchs und einer spezifischen Frage die Seiten schnell scannt, um eine prägnante Menge an Notizen auf einem Notizblock zu schreiben. Sobald diese Notizen geschrieben sind, kann der Student das Lehrbuch weglegen und die Frage nur anhand der Notizen beantworten. PERK funktioniert in ähnlicher Weise. Wenn ein langes Dokument präsentiert wird, behält das Modell nicht den gesamten Text in seinem aktiven Speicher. Stattdessen nutzt es eine kurze, interne Lernphase, um die wichtigsten Teile dieses Textes in einen kleinen, effizienten Satz von Anpassungen seiner eigenen internen Einstellungen zu komprimieren. Diese Anpassungen fungieren wie ein spezialisiertes Speichermodul, das das Wesentliche des langen Dokuments speichert. Sobald dieser „Notizblock“ erstellt wurde, wird der ursprüngliche Text verworfen und das Modell nutzt seine neuen, aktualisierten Einstellungen, um Fragen über den Inhalt zu beantworten.

Die Forscher entwickelten eine Trainingsmethode, die das Modell lehrt, wie es diese Kompression und den Abruf effektiv durchführt. Sie verwendeten eine Technik, die aus zwei Ebenen des Lernens besteht. In der ersten Ebene lernt das Modell, einen Textblock schnell in seine Speichereinstellungen zu kodieren. In der zweiten Ebene lernt das Modell, wie es diese Einstellungen nutzt, um Fragen präzise zu beantworten. Um diesen Prozess effizient zu halten und zu verhindern, dass der Computer an seine Speichergrenzen stößt, aktualisiert das Modell nur einen winzigen Bruchteil seiner gesamten Parameter – spezifisch eine leichtgewichtige Zusatzkomponente, die als „Low-Rank Adapter“ bekannt ist. Dies ermöglicht es dem Modell, aus dem Kontext zu lernen, ohne seine Kernwissensbasis zu verändern. Die Forscher testeten diesen Ansatz bei verschiedenen anspruchsvollen Aufgaben, darunter das Finden einer einzelnen spezifischen Tatsache, die in tausenden von Seiten Text verborgen ist, das Beantworten komplexer Fragen, die das Verknüpfen mehrerer Informationsteile erfordern, sowie das Abrufen von Daten aus langen Listen ähnlich aussehender Datensätze.

Die Ergebnisse zeigten, dass PERK Standardmethoden, bei denen Modelle einfach auf lange Texte trainiert werden, um später Fragen zu beantworten, deutlich übertrifft. In Tests mit dem Qwen-2.5-Modell verbesserte PERK die Genauigkeit im Vergleich zu diesen Standardansätzen um bis zu 20 Prozent. Die Methode erwies sich als robust, selbst wenn das Modell aufgefordert wurde, Texte zu verarbeiten, die viel länger waren als die, die es während des Trainings gesehen hatte, wobei sie erfolgreich auf Kontexte von 64.000 und sogar 128.000 Token generalisierte. Darüber hinaus demonstrierte PERK die einzigartige Fähigkeit, die Position von Informationen zu ignorieren. Während andere Modelle oft versagen, wenn die relevante Tatsache vom Anfang oder Ende eines Textes in die Mitte verschoben wird, behielt PERK eine hohe Genauigkeit bei, unabhängig davon, wo die Information erschien. Dies deutet darauf an, dass PERK zuverlässiger argumentieren kann, indem es den Text in eine flexible Speicherstruktur kodiert, anstatt sich auf feste Positionen zu verlassen. Der Ansatz funktionierte konsistent über verschiedene Modellgrößen hinweg, von sehr kleinen Modellen mit 0,5 Milliarden Parametern bis hin zu größeren mit 8 Milliarden, und erreichte oder übertraf sogar die Leistung spezialisierter, massiver Modelle, die speziell für lange Kontexte entwickelt wurden.

Jenseits der Genauigkeit hob die Studie die Effizienz dieser Methode hervor. Da das Modell den Text in kleineren, handhabbaren Stücken verarbeitet und den ursprünglichen Text nach der Kodierung verwirft, benötigt es wesentlich weniger Computerspeicher, um extrem lange Dokumente zu verarbeiten. In Tests, bei denen Standardmethoden aufgrund von Speicherlimits bei 128.000 Tokens abstürzten, funktionierte PERK weiter und verarbeitete die Informationen in einem Bruchteil der Zeit und mit einem Bruchteil des Speichers. Die Forscher kamen zu dem Schluss, dass es durch die Umformulierung der Long-Context-Argumentation als eine „Test-Time Learning“-Aufgabe, bei der sich das Modell seinen Speicher während des Tests selbst anpasst, möglich ist, eine überlegene Leistung ohne die hohen Rechenkosten des traditionellen Trainings zu erzielen. Dieser Ansatz bietet einen vielversprechenden Weg nach vorn, um große Sprachmodelle fähiger zu machen, die riesigen und komplexen Informationen zu bewältigen, die in der realen Welt vorkommen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →