← Nieuwste papers
🤖 machine learning

RAP: Runtime Adaptive Pruning for LLM Inference

Dit artikel introduceert RAP, een framework dat wordt aangedreven door versterkt leren en dat LLM-inferentie-afsnijstrategieën dynamisch in real-time aanpast door gezamenlijke optimalisatie van modelgewichten en KV-cache-behoud om de nuttigheid te maximaliseren onder variërende geheugenslimieten en werklastomstandigheden.

Oorspronkelijke auteurs: Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, uitzonderlijk slimme bibliotheekassistent hebt (een Large Language Model, of LLM) die verhalen kan schrijven, vragen kan beantwoorden en problemen kan oplossen. Maar er is een addertje onder het gras: deze assistent is zo massief dat hij een magazijn vol met planken (geheugen) en een enorm team van werknemers (rekenkracht) nodig heeft om gewoon te blijven draaien.

Als je probeert deze assistent op een klein apparaat te draaien, zoals een smartphone of een laptop, crasht hij vaak omdat hij de ruimte opraakt of te traag wordt.

Het Probleem: De "Eén-maat-voor-alles"-Fout

Op dit moment proberen de meeste mensen deze gigantische assistent te verkleinen door permanent delen ervan weg te halen, zoals het verwijderen van planken of het ontslaan van werknemers op basis van een vaste regel. Ze zeggen: "Oké, we zullen altijd 30% van de bibliotheek weghalen."

Het paper stelt dat dit een slecht idee is, omdat de behoeften van de bibliotheek elke dag veranderen.

  • Scenario A: Een gebruiker stelt een zeer korte vraag. De assistent heeft slechts een klein beetje ruimte nodig om het gesprek te onthouden.
  • Scenario B: Een gebruiker vraagt de assistent om een roman van 10.000 woorden te schrijven. De assistent heeft plotseling een enorme hoeveelheid ruimte nodig om alleen al het "schrijfblok" (het KV-cache) vast te houden, waar hij de tot nu toe geschreven story bijhoudt.

Als je permanent 30% van het brein van de assistent weghaalt om hem op een telefoon te laten passen, kun je hem kapotmaken als iemand een lange vraag stelt. Als je niets weghaalt, past hij helemaal niet op de telefoon. Bestaande methoden zijn als een stijf harnas: het is óf te zwaar om te dragen, óf als je het knipt om het lichter te maken, laat het je bloot.

De Oplossing: RAP (Runtime Adaptive Pruning)

De auteurs stellen RAP voor, wat neerkomt op het geven van een slim, elastisch pak aan de assistent dat in real-time van vorm verandert.

In plaats van de assistent eenmalig en voorgoed te verkleinen, gebruikt RAP een Reinforcement Learning (RL)-agent. Denk aan deze agent als een zeer bekwame verkeersleider of een podiummanager.

  1. Hij Kijkt Naar de Menigte: Voordat de assistent aan het werk gaat, bekijkt de agent het specifieke verzoek. Is het een korte vraag? Een lang verhaal? Is het geheugen van de telefoon vol omdat een andere app draait?
  2. Hij Neemt Directe Beslissingen: Op basis van wat hij ziet, beslist de agent nu direct wat er tijdelijk verborgen moet worden.
    • Als het verzoek kort is en het geheugen krap, kan hij sommige zware "denk"-delen (FFN-lagen) verbergen om ruimte te besparen.
    • Als het verzoek lang is en het geheugen vol, kan hij sommige "aandacht"-delen (MHA-lagen) verbergen die nodig zijn om het lange verhaal bij te houden.
  3. Hij Bewaart de Beste Delen: De agent weet dat niet alle delen van het brein even belangrijk zijn. Sommige lagen zijn belangrijker voor bepaalde taken. Hij gebruikt een speciale "belangrijkheidsscanner" (genaamd Greedy Sequential Importance) om precies te bepalen welke delen veilig opgeborgen kunnen worden zonder het antwoord te verpesten.

Hoe Het Werkt (De Analogie)

Stel je voor dat je een koffer inpakt voor een reis, maar je weet nog niet hoe het weer wordt.

  • Oude Manier: Je beslist om je zware winterjas en je zwemshort altijd thuis te laten. Als het regent, word je nat. Als het zonnig is, heb je geen zwemkleding.
  • RAP-Methode: Je hebt een slimme robotassistent.
    • Je zegt tegen hem: "Ik heb een kleine koffer (geheugenlimiet) en ik ga naar het strand (lang gesprek)."
    • De robot wisselt je zware jas direct in voor een licht T-shirt en houdt de zwemshort.
    • Je zegt tegen hem: "Ik heb een kleine koffer en ik ga naar de bergen (kort gesprek)."
    • De robot wisselt de zwemshort in voor een warme muts.

De robot leert door ervaring (Reinforcement Learning) om elke keer de perfecte wissel te maken, zodat je in de koffer past maar toch precies hebt wat je nodig hebt voor de specifieke reis.

Wat Ze Vonden

Het paper testte deze "slimme robot" op verschillende populaire AI-modellen (zoals Llama en Qwen).

  • Betere Resultaten: Wanneer het geheugen krap was, hield RAP de AI veel beter werkend dan de oude "vaste knip"-methoden. Hij crashte niet en de antwoorden waren nog steeds slim.
  • Flexibiliteit: Het hanteerde verschillende soorten verzoeken (kort versus lang) zonder dat een mens het opnieuw hoefde af te stemmen.
  • Snelheid: De "robot" die de beslissingen nam, was zo snel en klein dat hij het proces helemaal niet vertraagde. Het voegde bijna geen extra tijd toe aan het gesprek.

De Conclusie

RAP is een nieuwe manier om grote AI-modellen op kleinere apparaten te draaien. In plaats van permanent delen van de AI af te hakken, herschikt het de AI dynamisch onderweg, waarbij alleen de delen worden bewaard die nodig zijn voor de specifieke taak en de beschikbare ruimte. Het is het verschil tussen het dragen van een stijf, zwaar pak en het dragen van een slim, rekbaar pak dat zich aanpast aan wat je die dag doet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →