← Nieuwste papers
💬 NLP

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

Dit artikel introduceert Engram, een schaalbare conditionele geheugenmodule die NN-gram embeddings moderniseert voor O(1)O(1) lookup, waarbij een uvormige spaarsheidstoewijzingswet wordt onthuld die de afweging tussen neurale berekening en statisch geheugen optimaliseert om de prestaties op het gebied van redeneren, code en long-context retrieval in grote taalmodellen aanzienlijk te verbeteren.

Oorspronkelijke auteurs: Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Z
Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Zhang, Yixu Wei, M. Y Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, complexe puzzel probeert op te lossen. Al een lange tijd worden de slimste puzzeloplossers (AI-modellen) gebouwd als enorme fabrieken. Ze hebben duizenden gespecialiseerde arbeiders (genaamd "Mixture-of-Experts" of MoE) die pas in actie komen wanneer dat nodig is om ingewikkelde logica of nieuwe ideeën te begrijpen. Dit is geweldig voor het denken, maar het is een beetje onhandig als het gaat om het onthouden van simpele, saaie feiten.

Denk er zo over na: Als je een briljante wiskundige zou vragen: "Wat is de hoofdstad van Frankrijk?", dan zou hij niet alleen "Parijs" zeggen. Hij zou een volledige mentale simulatie moeten draaien en het antwoord telkens opnieuw van de grond af aan moeten afleiden. Het is alsof je een supercomputer gebruikt om een telefoonnummer in je eigen hoofd op te zoeken.

De Grote Ontdekking: Een "Spiekbriefje" voor het Brein
De onderzoekers van DeepSeek-AI en Peking University vroegen zich af: Wat als we deze modellen een toegewijd "spiekbriefje" gaven voor de dingen die ze gewoon moeten onthouden?

Ze introduceerden een nieuw hulpmiddel genaamd Engram. In plaats van de AI te dwingen om zich door elk woord heen te "denken", werkt Engram als een supersnelle, O(1) lookup-tabel (dat betekent dat het evenveel tijd kost of je nu één woord of een miljoen woorden opzoekt). Het is gebaseerd op een klassiek idee genaamd N-grams (het bekijken van groepen woorden samen), maar ze hebben dit geüpgraded met moderne technologie om het perfect te laten werken binnen een gigantische AI.

Het "U-vormige" Geheim
Het team ontdekte een fascinerende regel over hoe je deze modellen bouwt, die ze een U-vormige schalingswet noemen.

Stel je voor dat je een vast budget hebt aan "hersencapaciteit" (rekenstappen). Je kunt dit budget volledig uitgeven aan de "denkende arbeiders" (MoE), of je kunt het volledig uitgeven aan het "geheugen-spiekbriefje" (Engram).

  • Als je 100% aan de denkende arbeiders uitgeeft, is het model goed in logica, maar slecht in het onthouden van feiten.
  • Als je 100% aan het spiekbriefje uitgeeft, onthoudt het model feiten, maar kan het niet goed redeneren.
  • Het Zoete Punt: Het onderzoek vond dat de beste prestaties worden geleverd wanneer je het budget verdeelt. Je hebt beide nodig. Specifiek ontdekten ze dat het de hele systemen slimmer maakt als je ongeveer 20–25% van het "beschikbare" geheugenbudget wegneemt bij de denkende arbeiders en het geeft aan de Engram-geheugenmodule. Het is alsof je beseft dat een genie een goede bibliotheek nodig heeft, en niet alleen een snel brein.

Wat Er Eigenlijk Gebeurde (Het Bewijs)
Ze bouwden een model genaamd Engram-27B en vergeleken dit met een standaard "alleen-denkend" model van exact dezelfde grootte en snelheid. De resultaten waren verrassend sterk:

  • Kennis: Het werd beter in trivia en feiten (zoals een score die +3,4 hoger lag op MMLU en +4,0 op CMMLU).
  • Redeneren: Nog verrassender was dat het ook veel beter werd in algemeen redeneren en logische puzzels (een score van +5,0 hoger op BBH en +3,7 op ARC-Challenge).
  • Wiskunde & Code: Het verbeterde ook bij coderen en wiskunde (zoals +3,0 op HumanEval).

Het papier suggereert dat dit gebeurt omdat de Engram-module de "saaie" zaken afhandelt (zoals het onthouden dat "Alexander de Grote" een specifie benaamde naam is), zodat het hoofdbrein geen tijd hoeft te verspillen aan het reconstrueren ervan. Dit bevrijdt de diepe lagen van de AI om zich te concentreren op complexe, diepe processen. Het is alsof een secretaresse de planning regelt, zodat de CEO zich op de strategie kan richten.

De "Lang Geheugen" Truc
Een van de coolste bijeffecten is hoe goed deze modellen lange verhalen afhandelen. Omdat de Engram-module lokale details direct grijpt, heeft de hoofd-AI meer "aandacht" over om het hele verhaal van begin tot eind te onthouden. In tests kon het Engram-model een specifieke naald in een hooiberg van tekst 97,0% van de tijd vinden, terwijl het standaardmodel slechts 84,2% haalde.

De Hardware Magie
Ten slotte betogen de auteurs dat dit niet alleen een softwaretruc is, maar ook hardwarevriendelijk is. Omdat het "spiekbriefje" gebruikmaakt van vaste adressen (deterministische ID's), kan de computer de volgende stuk informatie ophalen terwijl hij nog bezig is met de berekening van het huidige stuk. Dit betekent dat ze een enorme tabel van 100 miljard parameters op het gewone harde schijfgeheugen (hostgeheugen) van een computer kunnen opslaan en toch resultaten krijgen die bijna net zo snel zijn als wanneer ze op de super-snelle GPU zouden staan. De snelheidspenalty was verwaarloosbaar, minder dan 3%.

Wat Ze Expliciet Zeggen Dat Het NIET Is
Het paper is heel duidelijk over wat dit niet is:

  • Het is niet simpelweg een grotere vocabulaire. Ze hebben geprobeerd de vocabulaire groter te maken (OverEncoding), maar dat werkte niet zo goed als Engram.
  • Het is geen vervanging voor het "denkgedeelte". Als je de denkende arbeiders (MoE) volledig verwijdert, faalt het model in redeneren. Het geheugen is een helper, geen vervanging.
  • Het is geen magische oplossing voor alles. Het paper merkt op dat hoewel het helpt bij feiten en redeneren, de "backbone" (de hoofd-AI) nog steeds het zware werk doet voor zaken zoals leesvaardigheid, wat meer afhankelijk is van context dan van statisch geheugen.

Hoe Zeker Zijn Ze?
De auteurs zijn zeer zelfverzekerd over hun metingen. Ze hebben dit niet alleen gesimuleerd; ze hebben echte modellen getraind op 262 miljard tokens aan data en getest op echte benchmarks. Ze hebben aangetoond dat de "U-vormige" regel standhoudt bij verschillende groottes en dat de prestatiewinsten echt, meetbaar en herhaalbaar zijn. Ze hebben zelfs de "poorten" binnen het model gevisualiseerd om aan te tonen dat het geheugen specif

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →