← Nieuwste papers
🤖 machine learning

Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection

Dit artikel introduceert PRECOG en SMC, een retrieval-augmented generatiesysteem voor State-Space Models dat documentcorpora vooraf encodeert in vaste verborgen toestanden om O(1)O(1) contextinjectie te bereiken, wat interactieve edge language models mogelijk maakt met enorme snelheidsverbeteringen ten opzichte van traditionele Transformer-gebaseerde RAG.

Oorspronkelijke auteurs: Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson, M Anthony Lewis, Jonathan Tapson

Gepubliceerd 2026-08-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson, M Anthony Lewis, Jonathan Tapson

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot probeert te leren vragen te beantwoorden door hem een enorme bibliotheek aan boeken te voeren. In de wereld van kunstmatige intelligentie is de meest populaire manier om dit te doen alsof je de robot een stapel papier geeft en zegt: "Lees elk afzonderlijk woord van deze papieren voordat je mijn vraag beantwoordt." Dit werkt, maar het is traag. Als de stapel enorm is, moet de robot een lange tijd besteden aan alleen al het lezen van de context voordat hij zelfs maar "Hallo" kan zeggen. Bovendien moet de robot elk woord dat hij net heeft gelezen onthouden, wat veel geheugen kost, zoals proberen een hele encyclopedie in je hoofd te houden terwijl je praat.

Wetenschappers hebben gezocht naar een manier om dit proces sneller en lichter te maken, vooral voor robots die leven op kleine apparaten zoals telefoons of slimme apparaten, waar het geheugen beperkt is en snelheid alles is. Ze verkennen een ander soort hersenarchitectuur genaamd een "State-Space Model" (SSM). Denk aan een SSM niet als een robot die een boek pagina voor pagina leest en elk woord uit het hoofd leert, maar als een robot die een boek leest en vervolgens het hele verhaal direct comprimeert tot één enkele, kleine, magische samenvattingskaart. Deze kaart bevat de betekenis van wat er is gelezen, maar niet de woorden zelf, en het maakt niet uit waar in het boek het verhaal zich afspeelde. De grote vraag die onderzoekers stellen is: Kunnen we deze "samenvattingskaart"-truc gebruiken om het trage leesgedeelte volledig over te slaan? Als we dat kunnen, kunnen we AI maken die vragen direct beantwoordt, zelfs op kleine apparaten, zonder dat we een enorme computer in de cloud nodig hebben.

Dit artikel introduceert een slimme truc genaamd PRECOG (wat staat voor Pre-Computed Context Injection) die zegt: "Ja, dat kunnen we." De auteurs, werkend met een specifiek type AI-model genaamd TENNs-LLM, hebben ontdekt hoe ze een tekstblok kunnen nemen, het één keer door de AI kunnen laten lopen om een kleine "samenvattingskaart" (een verborgen toestand) te creëren, en deze vervolgens op te slaan. Later, wanneer een gebruiker een vraag stelt, in plaats van de AI de tekst opnieuw te laten lezen, haalt het systeem simpelweg de opgeslagen samenvattingskaart erbij en plaatst deze direct in de hersenen van de AI. Het is alsof je het lezen van de tekst tijdens een toets overslaat en de student gewoon de voorbereide aantekeningen geeft die hij al heeft bestudeerd.

De resultaten zijn verbijsterend wat betreft snelheid. Op de specifieke edge-hardware die het team testte, duurde de oude manier van het "lezen" van de context ongeveer 27 seconden om alleen al het eerste antwoord te krijgen. Met PRECOG daalde die tijd naar minder dan 6 milliseconden. Dat is een versnelling van ongeveer 4.500 keer, waardoor een proces dat onbruikbaar was, veranderde in iets dat direct en interactief aanvoelt. Het artikel bewijst wiskundig dat deze kortere weg de AI niet "dom" maakt; de antwoorden zijn net zo goed als wanneer de tekst woord voor woord zou zijn gelezen, omdat de manier waarop dit specifieke type AI werkt, toestaat dat de samenvattingskaart een perfecte vervanging is voor de tekst.

Het artikel introduceert ook een tweede functie genaamd SMC (Structured Memory Consolidation). Als PRECOG gaat over het onthouden van een bibliotheek aan boeken, dan gaat SMC over het onthouden van een mensenleven. Het organiseert de langetermijngeheugens van de AI (zoals je voorkeuren of eerdere gesprekken) in verschillende "mappen" of clusters, zoals "Emoties", "Feiten" of "Locaties". Het kan vervolgens direct de juiste map in de hersenen van de AI laden wanneer je een gesprek begint, zodat de AI onthoudt wie je bent en wat je leuk vindt, zonder dat je het elke keer opnieuw hoeft te herinneren. Dit hele systeem is ontworpen om te werken op kleine, energiezuinige apparaten, wat het mogelijk maakt om een superintelligente, geheugenrijke AI-assistent direct in je broekzak te hebben.

De auteurs zijn zeer zelfverzekerd over hun wiskunde. Ze hebben bewezen dat voor dit specifieke type AI, de "samenvattingskaart"-methode geen benadering of een gok is, maar wiskundig identiek is aan het lezen van de tekst. Ze wijzen echter ook uit dat deze truc alleen werkt voor dit specifieke type AI-architectuur. De meer gangbare AI-modellen (genaamd Transformers) zijn anders gebouwd; ze raken in de knoop met de volgorde van woorden, waardoor je niet zomaar een samenvattingskaart voor hen kunt gebruiken. Voor die modellen moet je de tekst nog steeds elke keer lezen. Maar voor de toekomst van kleine, snelle, edge-gebaseerde AI suggereert dit artikel een pad waarbij we krachtig geheugen kunnen hebben zonder de zware bagage van traag lezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →