← Nieuwste papers
💬 NLP

Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference

Dit paper introduceert ASL, een trainingsvrije methode die de prestaties van grote taalmodellen verbetert door de laag voor token-pruning dynamisch aan te passen op basis van de variatie in attentiescores, waardoor de nauwkeurigheid bij moeilijke taken wordt verhoogd zonder de vooraf bepaalde KV-cache-budgets te overschrijden.

Oorspronkelijke auteurs: Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

Gepubliceerd 2026-04-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: De Slimme Portier voor de LLM: Hoe ASL de Gedachten van Kunstmatige Intelligentie Ordenen

Stel je voor dat een Grote Taalmodel (LLM) zoals een enorm, hyper-intelligent bibliothecaris is. Deze bibliothecaris moet enorme verhalen lezen om vragen te beantwoorden. Maar er is een groot probleem: de bibliothecaris heeft een geheugenkast (de "KV-cache") die vol raakt met notities van elke zin die hij leest. Als het verhaal 100.000 woorden lang is, wordt die kast zo vol dat de bibliothecaris stikt in zijn eigen notities en erg traag wordt.

Om dit op te lossen, hebben wetenschappers een truc bedacht: Token Pruning. Dit betekent simpelweg: "Weet je wat? We gooien de meeste notities weg en houden alleen de belangrijkste zinnen vast."

Maar hier zit de hapering in de oude methoden: ze gooien notities weg op een vast tijdstip.

  • Voorbeeld: "We houden na zin 15 alleen de top 10 zinnen over."
  • Het probleem: Soms is zin 15 nog niet belangrijk genoeg (bij moeilijke raadsels), en soms is het al te laat (bij simpele vragen). Het is alsof je altijd op hetzelfde moment de deur sluit, of het nu regent of dat de zon schijnt.

De Oplossing: ASL (Adaptive Selection Layer)

De auteurs van dit papier hebben een nieuwe methode bedacht genaamd ASL. In plaats van een vaste deurwachter, hebben ze een slimme, adaptieve portier bedacht.

Hier is hoe het werkt, vertaald naar alledaagse beelden:

1. De "Aandacht" als een zoeklicht

Stel je voor dat de bibliothecaris een zoeklicht in zijn hoofd heeft. Als hij een vraag krijgt, schijnt dit licht op de notities in zijn geheugen.

  • Bij makkelijke vragen (bijv. "Wat is de hoofdpersoon?") schijnt het licht direct op de juiste notitie. De rangschikking van de notities stabiliseert snel.
  • Bij moeilijke vragen (bijv. "Zoek een specifiek getal in een zee van tekst") flitst het licht eerst overal heen. Het duurt langer voordat het zich op één plek concentreert.

2. De "Variatie" meten (De Ruis vs. De Stilte)

De oude methoden wisten niet wanneer het licht stilviel. ASL doet iets slim: het meet de variatie in de rangschikking van de notities.

  • Hoge variatie: Het zoeklicht flitst nog overal heen. De rangschikking van de "belangrijkste notities" verandert elke seconde. Conclusie: Nog niet klaar om te kiezen!
  • Lage variatie: Het zoeklicht is gestabiliseerd. Dezelfde notities staan steeds bovenaan. Conclusie: We weten nu wie belangrijk is! Tijd om te kiezen.

3. De Adaptieve Keuze

ASL kijkt continu naar deze variatie.

  • Is de vraag makkelijk? Dan ziet ASL snel dat de rangschikking stabiel is en sluit de deur vroeg. Dit is supersnel.
  • Is de vraag moeilijk? Dan ziet ASL dat de rangschikking nog steeds chaotisch is en houdt de deur langer open. Hij wacht tot de bibliothecaris echt zeker weet wat belangrijk is.

Waarom is dit zo goed?

Stel je voor dat je een reisplanner bent voor twee soorten reizigers:

  1. De Vakantieganger (Makkelijke taak): Hij wil snel naar het strand. Een oude planner zegt: "We vertrekken om 10:00, ongeacht het weer."
  2. De Bergbeklimmer (Moeilijke taak): Hij moet een specifieke route vinden in een storm. Een oude planner zegt ook: "We vertrekken om 10:00." De bergbeklimmer valt in de afgrond omdat hij te vroeg vertrok.

ASL is de slimme planner:

  • Voor de vakantieganger zegt hij: "Het weer is goed, de route is duidelijk. We vertrekken nu!" (Snelheid).
  • Voor de bergbeklimmer zegt hij: "Het is nog te onduidelijk. Wacht nog even tot de storm stopt en de route zichtbaar is." (Nauwkeurigheid).

Het Resultaat in de Praktijk

De onderzoekers hebben dit getest op moeilijke taken (zoals het vinden van een "naald in een hooiberg" in enorme teksten).

  • Oude methoden faalden vaak bij moeilijke taken omdat ze te vroeg beslisten.
  • ASL past zich aan. Bij moeilijke taken wacht hij langer, waardoor hij veel nauwkeuriger is. Bij makkelijke taken is hij net zo snel als de anderen.

Samenvatting in één zin

ASL is een slimme truc die voor elke vraag apart beslist wanneer het slimste moment is om te stoppen met lezen en te beginnen met antwoorden, in plaats van een starre regel te volgen. Hierdoor is de kunstmatige intelligentie sneller bij simpele taken en veel slimmer bij moeilijke taken, zonder dat het geheugen volloopt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →