← Nieuwste papers
💬 NLP

PERK: Long-Context Reasoning as Test-Time Learning

Het artikel introduceert PERK, een parameter-efficiënt framework dat gebruikmaakt van gradiënt-updates tijdens de testfase via geneste meta-learning loops om lange contexten te coderen in low-rank adapters, wat aanzienlijk beter presteert dan standaard fine-tuning en gespecialiseerde modellen in long-context redeneertaken over diverse model-schalen heen.

Oorspronkelijke auteurs: Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

Gepubliceerd 2026-09-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn krachtige hulpmiddelen die hebben geleerd te lezen en te schrijven door enorme hoeveelheden tekst te bestuderen. Ze blinken uit in het vinden van patronen en het beantwoorden van vragen wanneer de informatie direct voor hen ligt. Echter, deze modellen worden geconfronteerd met een aanzienlijke hindernis wanneer de benodigde informatie begraven ligt in een massieve muur van tekst, zoals een document van een boeklengte of een lang transcript. Naarmate de tekst langer wordt, hebben de modellen vaak moeite om de irrelevante ruis te negeren en de specifieke feiten te vinden die nodig zijn om een probleem op te lossen. Deze moeilijkheid wordt verergerd door een neiging bij veel modellen om zwaar te focussen op het begin of het einde van een tekst, terwijl ze de details die in het midden verborgen liggen, uit het oog verliezen. Onderzoekers zoeken al lang naar manieren om deze modellen te helpen dergelijke "long-context" taken aan te pakken zonder dat ze vanaf nul opnieuw getraind moeten worden, een proces dat vaak onbetaalbaar duur en tijdrovend is.

In een nieuwe studie, gepresenteerd op de ICLR 2026 conferentie, stellen onderzoekers van EPFL een oplossing voor genaamd PERK, wat staat voor Parameter Efficient Reasoning over Knowledge. In plaats van te proberen het model een enorme document in één keer te laten lezen, behandelt PERK het lezen als een leerproces dat plaatsvindt op het moment dat de vraag wordt gesteld. Stel je een student voor die, bij het ontvangen van een dik tekstboek en een specifieke vraag, snel de pagina's scant om een beknopte set aantekeningen op een notitieblok te schrijven. Zodra die aantekeningen zijn geschreven, kan de student het tekstboek wegleggen en de vraag beantwoorden met behulp van alleen de aantekeningen. PERK werkt op een vergelijkbare manier. Wanneer een lang document wordt gepresenteerd, houdt het model niet de gehele tekst in zijn actieve geheugen. In plaats daarvan gebruikt het een korte, interne leerfase om de belangrijkste delen van die tekst te comprimeren tot een kleine, efficiënte set aanpassingen aan zijn eigen interne instellingen. Deze aanpassingen fungeren als een gespecialiseerd geheugenmodule die de essentie van het lange document opslaat. Zodra dit "notitieblok" is gemaakt, wordt de oorspronkelijke tekst weggegooid en gebruikt het model zijn nieuwe, bijgewerkte instellingen om vragen over de inhoud te beantwoorden.

De onderzoekers ontwikkelden een trainingsmethode die het model leert hoe het deze compressie en extractie effectief kan uitvoeren. Ze gebruikten een techniek die bestaat uit twee lagen van leren. In de eerste laag leert het model om snel een tekstblok te coderen naar zijn geheugeninstellingen. In de tweede laag leert het model hoe het die instellingen moet gebruiken om vragen accuraat te beantwoorden. Om dit proces efficiënt te houden en te voorkomen dat de computer zonder geheugen komt te zitten, werkt het model slechts een klein fractie van zijn totale parameters bij—specifiek, een lichtgewicht toevoeging die bekend staat als een low-rank adapter. Dit stelt het model in staat om te leren van de context zonder de kern van zijn kennisbasis te wijzigen. De onderzoekers testten deze aanpak op diverse uitdagende taken, waaronder het vinden van een enkel specifiek feit dat verborgen is tussen duizenden pagina's tekst, het beantwoorden van complexe vragen die het verbinden van meerdere stukjes informatie vereisen, en het ophalen van gegevens uit lange lijsten van op elkaar lijkende records.

De resultaten toonden aan dat PERK aanzienlijk beter presteerde dan standaardmethoden waarbij modellen simpelweg op lange teksten worden getraind om later vragen te beantwoorden. Bij tests met het Qwen-2.5 model verbeterde PERK de nauwkeurigheid met wel 20 procent vergeleken met deze standaardbenaderingen. De methode bleek robuust, zelfs wanneer het model werd gevraagd om teksten te verwerken die veel langer waren dan hij tijdens de training had gezien, waarbij het succesvol generaliseerde naar contexten van 64.000 en zelfs 128.000 tokens. Bovendien demonstreerde PERK een uniek vermogen om de positie van informatie te negeren. Terwijl andere modellen vaak falen wanneer het relevante feit van het begin of einde van een tekst naar het midden wordt verplaatst, behield PERK een hoge nauwkeurigheid, ongeacht waar de informatie zich bevond. Dit suggereert dat door de tekst te coderen in een flexibele geheugenstructuur in plaats van te vertrouwen op vaste posities, het model betrouwbaarder kan redeneren. De aanpak werkte consistent over verschillende modelgroottes, van zeer kleine modellen met 0,5 miljard parameters tot grotere modellen met 8 miljard, en evenaarde of overtrof zelfs de prestaties van gespecialiseerde, enorme modellen die specifiek voor lange contexten zijn ontworpen.

Naast nauwkeurigheid benadrukte de studie de efficiëntie van deze methode. Omdat het model de tekst in kleinere, beheersbare blokken verwerkt en de oorspronkelijke tekst na het coderen wegwerpt, heeft het aanzienlijk minder computergeheugen nodig om extreem lange documenten te verwerken. In tests waar standaardmethoden crashten door geheugenlimieten bij 128.000 tokens, bleef PERK functioneren, waarbij het de informatie verwerkte in een fractie van de tijd en een fractie van het geheugen gebruikte. De onderzoekers concludeerden dat door lang-context redeneren te herformuleren als een test-time leeropdracht, waarbij het model zijn eigen geheugen on the fly aanpast, het mogelijk is om superieure prestaties te bereiken zonder de zware computationele kosten van traditionele training. Deze aanpak biedt een veelbelovend pad voor het krachtiger maken van grote taalmodellen in het omgaan met de enorme en complexe informatie die in de echte wereld wordt gevonden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →