← Nieuwste papers
🤖 machine learning

Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

Irminsul introduceert een native, positieonafhankelijk cachesysteem voor Agentic LLM's dat de architecturale structuur van Multi-Head Latent Attention benut om inhoudsadressering voor key-value caching mogelijk te maken, waardoor tot 83% prompt-tokenherstel en 63% energiebesparing tijdens het prefillen wordt bereikt door de cache-invalidatieproblemen die inherent zijn aan traditionele prefix-matching-aanpakken te overwinnen.

Oorspronkelijke auteurs: Bole Ma, Jan Eitzinger, Harald Köstler

Gepubliceerd 2026-05-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bole Ma, Jan Eitzinger, Harald Köstler

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer drukke, supersnelle bibliotheek runt waar een bibliothecaris (de AI) een enorme stapel documenten moet lezen om een vraag te beantwoorden. Om snel te zijn, houdt de bibliothecaris een "spiekbriefje" (een cache) bij van de meest recente pagina's die ze hebben gelezen, zodat ze ze niet elke keer opnieuw vanaf het begin hoeven te lezen.

Het Probleem: De "Waar" versus de "Wat"

Bij de oude manier van werken (genaamd Prefix Caching) was het spiekbriefje van de bibliothecaris strikt georganiseerd op locatie.

  • "Pagina 1 is de Systeemprompt."
  • "Pagina 2 is Document A."
  • "Pagina 3 is Document B."

Als de bibliothecaris een nieuwe vraag stelt en de volgorde verandert iets – zeg, "Pagina 1 is nog steeds de Systeemprompt, maar nu staat Document A op Pagina 5" – dan werkt het oude spiekbriefje niet meer. De bibliothecaris denkt: "Oh, Pagina 2 is anders, dus ik moet het hele spiekbriefje weggooien en alles opnieuw vanaf het begin lezen."

In de wereld van Agentic AI (AI die hulpmiddelen gebruikt, het web doorzoekt en met andere AI's praat), gebeurt dit voortdurend. De AI kan hetzelfde document ophalen, maar omdat het wordt ingevoegd in een ander deel van het gesprek, verandert de "locatie". Het oude systeem ziet dit als een gloednieuw, onleesbaar zooitje, waardoor de AI tijd en energie verspilt aan het opnieuw lezen van dingen die het al kent.

De Oplossing: Irminsul (De "Inhouds"-bibliothecaris)

Het paper introduceert een nieuw systeem genaamd Irminsul. In plaats van het spiekbriefje te organiseren op waar een pagina zit, organiseert Irminsul het op wat de pagina eigenlijk zegt.

Stel je het zo voor:

  • Oude manier: "Ik herinner me het boek alleen als het op de 3e plank staat."
  • Irminsul: "Ik herinner me het boek omdat het een exemplaar is van Harry Potter, ongeacht op welke plank het staat."

Irminsul breekt het gesprek op in stukken gebaseerd op de daadwerkelijke tekst (inhoud). Als de AI "Document A" opnieuw ziet, zelfs als het op een andere plek staat, zegt Irminsul: "Ik heb deze exacte tekst al eerder gezien! Ik kan mijn notities opnieuw gebruiken."

Het Geheime Ingrediënt: De "Positie"-aanpassing

Je zou kunnen vragen: "Als de tekst hetzelfde is, maar de positie anders, wordt de AI dan niet in de war?"

Ja, meestal wel. In AI maakt de "positie" van een woord veel uit (het is als weten of een woord aan het begin of einde van een zin staat).

  • Het Oude Probleem: Om de positie te corrigeren, moesten de oude systemen het hele spiekbriefje herschrijven voor elk enkel woord. Het was alsof je een heel boek herschrijft alleen om het paginanummer te veranderen. Dit was traag en duur.
  • De Irminsul-truc: Het paper richt zich op een specifiek type AI-architectuur genaamd MLA (Multi-Head Latent Attention). Deze architectuur is speciaal omdat het de "notities" splitst in twee delen:
    1. De Inhoud (90%): De daadwerkelijke betekenis van de woorden. Dit deel is identiek, ongeacht de positie.
    2. De Positie (10%): Een klein labeltje dat zegt "Ik ben hier".

Irminsul beseft dat het alleen dat kleine 10%-labeltje hoeft aan te passen. Het gebruikt een slimme wiskundige "draai" (genaamd een δ\delta-rotatie) om het positielabeltje direct bij te werken zonder het hele boek opnieuw te schrijven. Het is alsof je een foto van een document maakt en het gewoon naar een nieuwe plek op het bureau schuift, in plaats van een nieuwe foto van de hele kamer te maken.

De Resultaten

Het paper testte dit uit op drie real-world AI-systemen (DeepSeek, Kimi en JoyAI) die fungeren als agenten.

  • Herstel: Bij complexe taken waarbij de AI documenten verplaatst, kon Irminsul ongeveer 77% tot 83% van het werk opnieuw gebruiken dat het oude systeem weggooide.
  • Energie: Omdat het de tekst niet opnieuw hoeft te lezen, bespaart het ongeveer 63% van de energie die nodig is om die herhalende delen te verwerken.
  • Nauwkeurigheid: De AI antwoordt net zo correct als voorheen; het raakt niet in de war door de nieuwe methode.

De "Eerste Pagina"-regel

Er is één klein nadeel. De allereerste paar woorden van elk gesprek fungeren als een "zwaartekrachtanker" voor de aandacht van de AI. Het paper ontdekte dat als je probeert een stukje opnieuw te gebruiken dat direct aan het begin van een gesprek begint, de AI in de war raakt.

  • De Oplossing: Irminsul leest gewoon het allereerste stukje tekst (de eerste 32 woorden) elke keer opnieuw, maar voor alles daarna gebruikt het de slimme "inhoudsgebaseerde" hergebruik. Deze kleine kostenprijs zorgt ervoor dat de rest van het systeem perfect werkt.

Samenvatting

Irminsul is een slimmere manier voor AI om dingen te onthouden. In plaats van te zeggen: "Ik herinner me dit omdat het in vak #5 zat", zegt het: "Ik herinner me dit omdat het hetzelfde verhaal is." Door te beseffen dat het "verhaal" (inhoud) belangrijker is dan het "vak" (positie), en door een speciale truc te gebruiken om het positielabeltje snel te corrigeren, maakt het AI-agenten sneller, goedkoper in gebruik en veel beter in het afhandelen van complexe, veranderende gesprekken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →