← Nieuwste papers
🤖 AI

Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory

Nexus versnelt agentic LLM's op unified memory door tool-routing te ontkoppelen van dure schema prefilling via een semantische lookaside buffer en gecomprimeerde signaturen, terwijl het een diepte-adaptief KV-cache splicing mechanisme met fallback re-decoding hanteert om de output-getrouwheid te behouden ondanks rotary position embedding drift.

Oorspronkelijke auteurs: Mustafa Arslan

Gepubliceerd 2026-08-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mustafa Arslan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie leert een specifiek type softwareagent te handelen namens ons. Deze digitale assistenten beantwoorden niet alleen vragen; ze reiken uit om hulpmiddelen te gebruiken, zoals het controleren van een agenda, het doorzoeken van een database of het versturen van een e-mail. Om dit te doen, moet de software eerst een gedetailleerde instructiehandleiding begrijpen voor elk afzonderlijk hulpmiddel dat het mogelijk kan gebruiken. Naarmate het aantal beschikbare hulpmiddelen groeit naar honderden, worden deze handleidingen enorm en vullen ze het kortetermijngeheugen van de computer met repetitieve tekst voordat de agent zelfs maar kan beginnen met denken. Dit creëert een flessenhals: hoe meer hulpmiddelen de agent heeft, hoe langer het duurt voordat hij aan het werk kan beginnen, omdat de computer deze enorme instructiesets elke keer dat hij een nieuwe stap zet, opnieuw moet lezen en verwerken.

Onderzoekers hebben gezocht naar een manier om deze flessenhals te omzeilen. Eén idee was om het werk van de computer op deze instructies op te slaan in een gecomprimeerde vorm, zoals een bladwijzer, en het simpelweg terug te plakken in het geheugen wanneer dat nodig is. Dit klinkt efficiënt, maar loopt tegen een fundamenteel probleem aan met de manier waarop moderne AI-modellen tijd en volgorde bijhouden. Deze modellen gebruiken een systeem om te onthouden waar ze zich in een reeks woorden bevinden, en als je een opgeslagen brok werk naar een andere plek in het geheugen verplaatst, raakt het model in de war over de volgorde van gebeurtenissen. Het is alsoals het uit een boek halen van een pagina uit het midden en deze in een ander hoofdstuk plakken; het verhaal kan nog steeds logisch zijn, maar de subtiele verbindingen tussen zinnen kunnen verbreken, wat leidt tot fouten.

Een team van onafhankelijke onderzoekers heeft nu een systeem genaamd Nexus gebouwd om door dit lastige landschap te navigeren. Ze ontdekten dat je deze opgeslagen instructieblokken niet zomaar kunt verplaatsen zonder risico, maar dat je dat wel kunt doen als je voorzichtig bent over waar je ze plaatst en hoe je de fouten die onvermijdelijk binnensluipen herstelt. Hun werk, getest op een specifelijk type krachtige computerchip die in moderne laptops wordt gevonden, onthult een precieze grens voor hoe ver je deze blokken kunt verplaatsen voordat de output van de AI onbetrouwbaar wordt. Ze ontdekten dat als het blok te ver wordt verplaatst, het begrip van het model voor de sequentie afwijkt, maar dat deze afwijking voorspelbaar is. De onderzoekers ontwierpen een methode om te detecteren wanneer deze afwijking te groot wordt en om automatisch alleen het noodzakelijke deel van de instructies opnieuw te lezen om het geheugen perfect weer aan elkaar te naaien.

De meest significante bevinding van dit werk is dat het systeem niet afhankelijk hoeft te zijn van deze risicovolle geheugensnelkoppelingen voor zijn meest kritieke taak: beslissen welk hulpmiddel te gebruiken. In plaats van de AI te dwingen de enorme instructiehandleidingen te lezen om een keuze te maken, gebruikt Nexus een apart, ultrasnel opzoeksysteem. Dit systeem scant een compacte lijst van hulpmiddelnamen en beschrijvingen om de juiste match in microseconden te vinden. Zodra het hulpmiddel is gekozen, genereert de AI de benodigde argumenten met behulp van een kleine, gecomprimeerde samenvatting van de instructies—vaak slechts een paar dozijn woorden—in plaats van de volledige, opgeblazen tekst. Deze aanpak houdt het hoofdgeheugen schoon en zorgt ervoor dat de agent veel sneller aan zijn werk kan beginnen, waarbij hij het eerste woord van zijn antwoord vindt in minder dan de helft van de tijd die nodig zou zijn om de volledige handleidingen opnieuw te lezen.

De onderzoekers hebben ook de grenzen van hun geheugen-spleettechniek rigoureus getest. Ze bevestigden dat hoewel de methode goed werkt voor korte afstanden, er een harde limiet is. Als het opgeslagen blok meer dan 256 posities verwijderd is van waar het oorspronlijk werd gecreëerd, worden de fouten te significant om te negeren. Op dat punt stopt het systeem met het proberen te patchen van het geheugen en valt het terug op de tragere, maar veiligere methode van het opnieuw lezen van de volledige tekst. Dit zorgt ervoor dat de uiteindelijke output altijd exact even nauwkeurig is als wanneer de computer nooit geprobeerd had om een kortere weg te nemen. Ze bewezen ook dat een eenvoudigere, goedkopere methode om te raden wanneer men de snelkoppeling moet stoppen—gebaseerd op een snelle controle van de interne staat van het geheugen—niet werkt, omdat het de fouten niet betrouwbaar kan voorspellen.

In hun tests slaagde het Nexus-systeem erin om een register van 250 verschillende hulpmiddelen te verwerken zonder te vertragen, waarbij een hoge succesratio in het kiezen van het juiste hulpmiddel werd behouden. Wanneer de context matig was, was het systeem tot 1,7 keer sneller dan de traditionele methode van het alles opnieuw lezen. Echter, naarmate het gesprek langer en dieper werd, nam het snelheidsvoordeel vanzelf af, waardoor het uiteindelijk de prestaties van de standaardmethode evenaarde. Dit is geen falen, maar een kenmerk van hun ontwerp: het systeem geeft prioriteit aan het juist krijgen van het antwoord boven het snel zijn. Het garandeert dat de output nooit slechter is dan de standaardmethode, zelfs als het soms even lang duurt.

Het werk werd uitgevoerd op een enkel type computerchip met een uniforme geheugenarchitectuur, die de processor in staat stelt om gegevens direct te benaderen zonder ze tussen verschillende delen van de machine te verplaatsen. Deze specifieke hardwareopstelling was essentieel om de geheugen-spleettechniek te laten werken, aangezien het directe fysieke toegang tot de geheugencellen vereist. De onderzoekers zijn duidelijk over het feit dat hoewel de snelheidscijfers specif kind aan deze ene opstelling, de onderliggende principes—de limieten van het verplaatsen van geheugenblokken en de noodzaak van een apart routingsysteem—universele waarheden lijken te zijn over hoe deze modellen functioneren. Ze hebben een duidelijke kaart geleverd van waar de snelkoppelingen werken, waar ze breken, en hoe men een systeem bouwt dat die grenzen respecteert om zowel snelheid als betrouwbaarheid te leveren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →