← Nieuwste papers
🤖 machine learning

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

Dit artikel onthult dat modellen tijdens de prefill-fase voornamelijk veld-geconditioneerde conclusies opslaan in downstream KV-cache-notities in plaats van te vertrouwen op de vectoren van het veld zelf, wat een nieuwe aanpak mogelijk maakt waarbij caches efficiënt bewerkt kunnen worden via chain-of-thought en samengesteld kunnen worden over contexten heen om een bijna perfecte nauwkeurigheid te bereiken met aanzienlijk verminderde latentie vergeleken met volledige herberekening.

Oorspronkelijke auteurs: Bojie Li

Gepubliceerd 2026-06-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bojie Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Het "Notitieboekje" van het Model

Stel je voor dat een groot taalmodel (zoals een zeer slimme robotassistent) een lang document leest om een vraag te beantwoorden. Normaal gesproken, wanneer de robot een zin leest, "denkt" hij erover na en gaat hij dan verder. Als de zin later verandert, moet de robot het hele document opnieuw lezen om de nieuwe context te begrijpen. Dit is traag en duur.

Dit paper ontdekt iets verrassends: de robot leest niet alleen het document; hij maakt aantekeningen in een apart "notitieboekje" (de KV Cache) terwijl hij leest.

Cruciaal is dat de robot zijn conclusies in dit notitieboekje schrijft, en niet alleen de ruwe woorden. Zodra hij begrijpt: "Oh, de status van de bestelling is 'verzonden', dus ik moet de terugbetaling weigeren," schrijft hij die conclusie in het notitieboekje. Later, wanneer hij een beslissing moet nemen, kijkt hij niet terug naar de oorspronkelijke zin; hij leest alleen zijn eigen aantekeningen.

Het Probleem: De "Verouderde Notitie"-val

De onderzoekers probeerden een eenvoudige oplossing toen een stuk informatie veranderde (bijvoorbeeld de status van een bestelling veranderde van "verzonden" naar "in behandeling"). Ze dachten: "Als ik alleen het specifieke woord in de tekst aanpas, zal de robot de verandering zien en zijn antwoord bijwerken."

Ze hadden het mis.

Omdat de robot zijn conclusie ("Weiger de terugbetaling") al in het notitieboekje had geschreven op basis van de oude informatie, werkte het simpelweg aanpassen van het oorspronkelijke woord niet. De robot negeerde de verandering en bleef zijn oude aantekening lezen. Het was alsozien dat je een wiskundige som probeert te veranderen van 2+2=42+2=4 naar 2+2=52+2=5 op een blaadje papier, maar de student had al "Het antwoord is 4" in zijn schrift geschreven en kopieert dat gewoon over. De student zou de verandering in de som niet opmerken, tenzij je hem dwong de hele pagina opnieuw te lezen.

Oplossing 1: De "Errata" (Het Post-it briefje)

Omdat de robot op zijn aantekeningen vertrouwt, vonden de onderzoekers een manier om de fout te herstellen zonder het hele boek opnieuw te hoeven lezen.

In plaats van te proberen de oude aantekening chirurgisch uit te wissen en te herschrijven (wat niet werkt), voegden ze simpelweg een nieuwe, luide aantekening toe aan het einde van het document.

  • De Analogie: Stel je voor dat de robot een contract leest. Je kunt niet gemakkelijk een clausule in het midden van het contract doorhalen zonder de paginanummers te verstoren. In plaats daarvan plak je een felgeel "ERRATUM"-briefje aan het einde van het contract met de tekst: "Negeer de vorige aantekening. De status is nu 'In behandeling'. Het antwoord is 'Goedkeuren'."
  • Het Resultaat: De robot ziet deze nieuwe, luide aantekening, werkt zijn beslissing bij en negeert de oude aantekening. Dit is ongelooflijk snel en werkt bijna perfect.

Oplossing 2: "Composing" Skills (De Lego-steen)

De tweede ontdekking gaat over het hergebruiken van werk.

Stel je voor dat je een lange, complexe instructiehandleiding hebt voor een specifieke taak (zoals "Hoe een vlucht te boeken"). Normaal gesproken moet de robot elke keer dat je hem vraagt een vlucht te boeken, die hele handleiding vanaf nul lezen.

De onderzoekers ontdekten dat omdat de robot zijn conclusies in het notitieboekje schrijft, je de aantekeningen voor die handleiding één keer vooraf kunt schrijven, kunt opslaan en vervolgens in een nieuw gesprek kunt "plakken".

  • De Analogie: In plaats van elke keer een handleiding van 50 pagina's te lezen als je een stoel wilt bouwen, heb je een vooraf samengestelde "Stoel-kit" (de aantekeningen). Je pakt de kit gewoon en plaatst deze in je werkruimte.
  • De Magie: Je kunt deze kit naar een andere plek in het gesprek verplaatsen (repositioneren) en het werkt nog steeds perfect. De robot hoeft de handleiding niet opnieuw te lezen; hij pakt gewoon de vooraf geschreven aantekeningen op en gaat verder. Dit maakt het proces 14 keer sneller voor lange documenten.

Waarom dit belangrijk is

  1. Het is Bewerkbaar: Als een gebruiker een detail verandert (zoals hun naam of een bestelstatus), hoef je het hele gesprek niet opnieuw te starten. Je voegt gewoon een "correctie-notitie" toe aan het einde, en de robot past zijn gedrag direct aan.
  2. Het is Composable (Samenstelbaar): Je kunt een bibliotheek van "vaardigheden" bouwen (zo zoals een recept voor het boeken van vluchten of een gids voor het afhandelen van retourzendingen). Je kunt deze vaardigheden vooraf berekenen en ze direct in elk gesprek plakken, wat enorme hoeveelheden tijd en rekenkracht bespaart.
  3. Het Werkt Overal: De onderzoekers hebben dit getest op veel verschillende soorten AI-modellen (van kleine tot enorme modellen, en zelfs modellen die naar afbeeldingen kijken), en het werkte voor al deze modellen.

Samenvatting in één zin

Het paper onthult dat AI-modellen tijdens het lezen conclusies opschrijven in een verborgen notitieboekje; door dit te beseffen, kunnen we fouten herstellen door een "correctie-notitie" aan het einde toe te voegen en taken versnellen door vooraf geschreven "vaardigheids-notities" te plakken, in plaats van de AI alles opnieuw te laten lezen vanaf het begin.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →