← Ultimi articoli
💬 NLP

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

Questo articolo introduce Engram, un modulo di memoria condizionale scalabile che modernizza gli embedding N-gram per una ricerca O(1), rivelando una legge di allocazione della sparsità a forma di U che ottimizza il compromesso tra computazione neurale e memoria statica per potenziare significativamente le prestazioni di ragionamento, codifica e recupero di lungo contesto nei modelli linguistici di grandi dimensioni.

Autori originali: Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Z
Pubblicato 2026-07-14
📖 5 min di lettura🧠 Approfondimento

Autori originali: Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Zhang, Yixu Wei, M. Y Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di risolvere un puzzle gigante e complesso. Per molto tempo, i risolutori di puzzle più intelligenti (i modelli AI) sono stati costruiti come enormi fabbriche. Hanno migliaia di lavoratori specializzati (chiamati "Mixture-of-Experts" o MoE) che intervengono solo quando necessario per comprendere logiche difficili o nuove idee. Questo è ottimo per il pensiero, ma è un po' goffo quando si tratta di ricordare fatti semplici e noiosi.

Pensa a questo: se chiedessi a un matematico brillante: "Qual è la capitale della Francia?", non direbbe semplicemente "Parigi". Dovrebbe eseguire una simulazione mentale completa, riderivando la risposta da zero ogni singola volta, consumando molta energia cerebrale solo per ricordare qualcosa che conosce da sempre. È come usare un supercomputer per cercare un numero di telefono nella propria testa.

La Grande Scoperta: Un "Foglietto di Ripasso" per il Cervello
I ricercatori di DeepSeek-AI e dell'Università di Pechino si sono chiesti: E se dessimo a questi modelli un "foglietto di ripasso" dedicato per le cose che devono solo ricordare?

Hanno introdotto un nuovo strumento chiamato Engram. Invece di costringere l'IA a "pensare" attraverso ogni singola parola, Engram agisce come una tabella di ricerca super veloce, O(1) (il che significa che richiede lo stesso tempo infinitesimale sia che tu cerchi una parola che un milione). Si basa su un'idea della vecchia scuola chiamata N-gram (osservare gruppi di parole insieme), ma l'hanno aggiornata con tecnologie moderne per farla funzionare perfettamente all'interno di una IA gigante.

Il Segreto a "Forma di U"
Il team ha scoperto una regola affascinante su come costruire questi modelli, che chiamano legge di scala a forma di U.

Immagina di avere un budget fisso di "potenza cerebrale" (passaggi computazionali). Puoi spendere tutto per i "lavoratori del pensiero" (MoE), oppure puoi spendere tutto per il "foglietto di ripasso della memoria" (Engram).

  • Se spendi il 100% nei lavoratori del pensiero, il modello è bravo nella logica ma scarso nel ricordare i fatti.
  • Se spendi il 100% nel foglietto di ripasso, il modello ricorda i fatti ma non sa ragionare bene.
  • Il Punto di Equilibrio: Il team ha scoperto che la prestazione migliore avviene quando si divide il budget. Hai bisogno di entrambi. Nello specifico, hanno scoperto che sottrarre circa il 20–25% del budget di memoria "libera" ai lavoratori del pensiero e darlo al modulo di memoria Engram rende l'intero sistema più intelligente. È come rendersi conto che un genio ha bisogno di una buona biblioteca, non solo di un cervello veloce.

Cosa è Successo Davvero? (La Prova)
Hanno costruito un modello chiamato Engram-27B e l'hanno confrontato con un modello standard "solo pensiero" della stessa dimensione e velocità. I risultati sono stati sorprendentemente forti:

  • Conoscenza: È diventato migliore nei quiz e nei fatti (ottenendo un punteggio superiore di +3.4 su MMLU e +4.0 su CMMLU).
  • Ragionamento: Ancora più sorprendente, è diventato molto migliore nel ragionamento generale e nei rompicapi logici (ottenendo +5.0 su BBH e +3.7 su ARC-Challenge).
  • Matematica e Codice: È migliorato anche nella programmazione e nella matematica (come +3.0 su HumanEval).

Il documento suggerisce che questo accade perché il modulo Engram gestisce le cose "noiose" (come ricordare che "Alessandro Magno" è un nome specifico) in modo che il cervello principale non debba perdere tempo a ricostruirlo. Questo libera gli strati profondi dell'IA per concentrarsi sul pensiero complesso e profondo. È come avere un segretario che si occupa di tutta la gestione degli appuntamenti in modo che il CEO possa concentrarsi sulla strategia.

Il Trucco della "Memoria Lunga"
Uno degli effetti collaterali più interessanti è quanto bene questi modelli gestiscono storie lunghe. Poiché il modulo Engram cattura i dettagli locali istantaneamente, l'IA principale ha più "attenzione" residua per ricordare l'intera storia dall'inizio alla fine. Nei test, il modello Engram riusciva a trovare un ago specifico in un pagliaio di testo il 97.0% delle volte, mentre il modello standard riusciva solo l'84.2%.

La Magia dell'Hardware
Infine, il documento sostiene che questo non è solo un trucco software; è un metodo favorevole all'hardware. Poiché il "foglietto di ripasso" utilizza indirizzi fissi (ID deterministici), il computer può iniziare a recuperare il pezzo di memoria successivo mentre sta ancora facendo i calcoli per quello attuale. Ciò significa che possono memorizzare una tabella enorme da 100 miliardi di parametri su un normale hard disk di un computer (memoria host) e ottenere comunque risultati quasi velocemente come se fosse sulla super-veloce GPU. La penalità di velocità è stata trascurabile, meno del 3%.

Cosa Dicono Esplicitamente che NON È
Il documento è molto chiaro su cosa questo non sia:

  • Non è solo un vocabolario più grande. Hanno provato ad ingrandire semplicemente il vocabolario (OverEncoding), e non ha funzionato bene come Engram.
  • Non è un sostituto della parte del "pensiero". Se rimuovi completamente i lavoratori del pensiero (MoE), il modello fallisce nel ragionamento. La memoria è un aiuto, non un sostituto.
  • Non è una soluzione magica per tutto. Il documento nota che, sebbene aiuti con i fatti e il ragionamento, la "struttura portante" (l'IA principale) è quella che compie il lavoro pesante per compiti come la comprensione del testo, che si basa più sul contesto che sulla memoria statica.

Quanto Sono Sicuri?
Gli autori sono molto sicuri delle loro misurazioni. Non si sono limitati a simulare; hanno addestrato modelli reali su 262 miliardi di token di dati e li hanno testati su benchmark reali. Hanno dimostrato che la regola della "forma di U" regge attraverso diverse dimensioni e che i guadagni di prestazione sono reali, misurabili e ripetibili. Hanno persino visualizzato i "gate" all'interno del modello per mostrare che esso attiva effettmente la memoria specificamente per nomi e frasi, proprio come progettato.

In breve, il documento suggerisce che il futuro dell'IA non riguarda solo il rendere i cervelli più grandi; si tratta di dare a quei cervelli un modo più veloce, più intelligente e più efficace per cercare informazioni.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →