← Nieuwste papers
💻 computer science

Leyline: KV Cache Directives for Agentic Inference

Dit artikel introduceert Leyline, een nieuw serving-side primitief dat agentic LLM's in staat stelt om via declaratieve instructies en closed-form RoPE-correcties dynamisch gecachte inhoud te bewerken of te verwijderen, waardoor de noodzaak voor kostbare re-prefilling wordt geëlimineerd en zowel de latentie als de taalsuccesratio's aanzienlijk worden verbeterd.

Oorspronkelijke auteurs: Bole Ma, Jan Eitzinger, Harald Koestler

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bole Ma, Jan Eitzinger, Harald Koestler

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, snel pratende assistent bent (een AI) die een detective helpt een mysterie op te lossen. Om zijn werk te doen, houdt de assistent een enorme "kladblok" (een KV Cache) in zijn geest. Dit kladblok bevat alles wat de detective heeft gezegd, elke gevonden aanwijzing en elk gebruikt hulpmiddel tot nu toe.

De Oude Manier: Het "Alleen Toevoegen"-Notitieboek

In het verleden werkten AI-assistenten als een persoon die in een notitieboek schrijft zonder ooit te wissen.

  • De Regel: Je schrijft een aanwijzing, en daarna schrijf je de volgende aanwijzing eronder. Het notitieboek wordt alleen maar groter.
  • Het Probleem: Als de detective beseft: "Wacht, die laatste aanwijzing klopte niet, laten we die weggooien en een andere invalshoek proberen," kon het oude systeem die regel niet zomaar verwijderen. Het moest de hele pagina eruit scheuren en alles vanaf het begin opnieuw schrijven om de paginanummers correct te houden.
  • De Kosten: Dit is traag en verspillend. Het is alsof je een heel boek opnieuw schrijft om één woord in het midden te veranderen.

Het Nieuwe Probleem: De "Agentic" Detective

Moderne AI-agenten zijn dynamischer. Ze chatten niet alleen; ze handelen. Ze proberen een hulpmiddel, falen, verwijderen de fout, proberen het opnieuw en vatten oude aantekeningen samen om ruimte te besparen.

  • Het Probleat: Wanneer de agent een blok tekst in het midden van het gesprek verwijdert, verschuiven de "paginanummers" (posities) van alles wat daarna komt.
  • Het Gevolg: Het oude "kladblok" raakt in de war. Het denkt dat de aanwijzingen op de verkeerde plaatsen staan, waardoor het zijn geheugen moet weggooien en opnieuw moet beginnen (re-prefill) telkens wanneer de agent iets bewerkt. Dit doodt de snelheid.

De Oplossing: Leyline (De "Magische Schaar")

De paper introduceert Leyline, een nieuwe tool voor het serving-systeem van de AI. Zie Leyline als een paar magische scharen en een positie-verschuivende liniaal.

Zo werkt het, met behulp van een eenvoudige analogie:

  1. De Directieve (De Instructie):
    De AI-agent vertelt Leyline: "Knip de paragraaf over de mislukte tool-aanroep (Span) eruit en vervang deze door een korte notitie: 'Output weggelaten' (Replacement)."
    De agent hoeft niet te weten hoe de wiskunde werkt; hij geeft alleen de instructie.

  2. De Splice (Het Knippen en Plakken):
    Leyline knipt de oude paragraaf fysiek uit het geheugen en plakt de korte notitie op die plek.

    • Cruciale Stap: Omdat de tekst korter is geworden, ligt alles na dat punt nu fysiek dichter bij het begin.
  3. De "Magische Liniaal" (De δ\delta-Rotatie):
    Dit is het geheime ingrediënt van de paper. In AI wordt de "positie" van een woord gecodeerd als een geheime code (RoPE). Als je een woord van positie 100 naar positie 90 verplaatst, moet de code veranderen.

    • Oude Manier: De code voor elk enkel woord na de knip opnieuw berekenen. (Traag!)
    • Leyline Manier: Leyline gebruikt een wiskundige afkorting. Het realiseert zich dat als je alles met 10 plaatsen hebt verschoven, je alleen een eenvoudige "rotatie" (een snelle wiskundige aanpassing) hoeft toe te passen op de codes van de woorden die volgden. Het is alsoals een rij mensen vertellen: "Iedereen beweegt 10 stappen naar links," en alleen hun hoofdbanden aanpassen om de nieuwe plek te reflecteren, in plaats van dat ze de hele rij opnieuw moeten lopen.

Waarom Dit Er Toe Doet (De Resultaten)

De onderzoekers hebben Leyline op twee manieren getest:

  1. De Snelheidstest (Mechanisme):
    Wanneer de AI zijn eigen geheugen bewerkt, bespaart Leyline een enorme hoeveelheid tijd.

    • Analogie: In plaats van een document van 50 pagina's te herschrijven om een typefout te herstellen, vervang je gewoon de pagina en update je de paginanummers direct.
    • Resultaat: Het systeem werd tot wel 241 milliseconden sneller per verzoek en maakte ongeveer 11% meer van het bestaande geheugen opnieuw gebruikt, wat betekent dat het niet de hele conversatie opnieuw hoefde te lezen.
  2. De Slimmere Agent Test (Beleid):
    De onderzoekers gaven de AI een eenvoudige regel: "Als een tool-output oud en nutteloos is, verwijder deze dan."

    • Zonder Leyline: De AI zou de tekst verwijderen, maar het systeem zou alles opnieuw moeten berekenen, waardoor de AI zo traag wordt dat hij de taak mogelijk niet kan voltooien.
    • Met Leyline: De AI verwijdert de rommel direct. Omdat de context schoner en korter is, kan de AI zich beter concentreren op de belangrijke aanwijzingen.
    • Resultaat: De AI loste 14,3% meer moeilijke debugging-taken op omdat hij niet werd afgeleid door oude, nutteloze informatie, en hij betaalde niet de zware snelheidstraf voor het verwijderen ervan.

Het Grotere Plaatje

Leyline verandert de relatie tussen de AI (de agent) en het computergeheugen (de cache).

  • Vóór: Het computergeheugen was een passief, rigide notitieboek waar de AI voorzichtig mee moest omgaan.
  • Nu: Het geheugen is een programmeerbare tool. De AI kan zeggen: "Knip dit, plak dat, en pas de nummers aan," en het systeem gehoorzaamt direct zonder de draad kwijt te raken.

De paper bewijst dat door de AI expliciet de opdracht te geven om het systeem te laten bewerken, we de AI snel, slim en gefocust kunnen houden, zelfs wanneer hij voortdurend van gedachten verandert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →