← Ultimi articoli
🤖 AI

SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation

SelKV è un framework senza necessità di addestramento che comprime le cache KV fondendo o scartando selettivamente i token in base alla similarità dei vettori di valore e compensando gli squilibri di attenzione tramite il bias dei logit, ottenendo una qualità di generazione quasi priva di perdite e significativi incrementi di velocità pur mantenendo solo il 25% della cache originale.

Autori originali: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

Pubblicato 2026-07-21
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di ricordare una storia mastodontica di 100.000 pagine mentre scrivi un nuovo capitolo. Ogni volta che pensi a un punto della trama, devi sfogliare l'intero tuo taccuino per ritrovare i dettagli corretti. Più pagine scrivi, più il tuo taccuino diventa pesante, finché le tue braccia non sono troppo stanche per tenerlo su. Questo è esattamente ciò che accade all'interno del "cervello" di un Large Language Model (LLM) quando cerca di elaborare testi lunghi. Questi modelli sono incredibilmente intelligenti, ma hanno un problema di memoria: mentre leggono, memorizzano una "cache Key-Value" — un sistema di archiviazione digitale di tutto ciò che hanno visto finora — per aiutarli a capire cosa viene dopo. Più lungo è il testo, più grande diventa questo archivio, finendo per riempire tutta la memoria del computer e rallentando tutto fino a un passo d'oca.

Per risolvere questo problema, gli scienziati hanno provato due trucchi principali. Il primo è l' "eviction" (espulsione), che è come buttare via le vecchie pagine che pensi non siano importanti. Il secondo è il "merging" (fusione), che è come incollare insieme pagine simili per risparmiare spazio. Ma entrambi i metodi hanno un difetto. Buttare via le pagine può far perdere indizi cruciali, e incollare le pagine insieme crea spesso una versione "sfocata" dove il modello dimentica quanta attenzione prestare al gruppo incollato. È come se incollassi dieci foto di un gatto tra loro; il modello potrebbe ancora dare a quella singola macchia incollata la stessa quantità di attenzione che avrebbe dato a una singola foto, anche se ora ne rappresenta dieci. Questo fa sì che il modello si confonda e commetta errori.

Entra in scena SelKV, un nuovo e intelligente metodo che agisce come un bibliotecario esperto per questi archivi digitali. Invece di incollare ciecamente le pagine o di buttarle nella spazzatura, SelKV utilizza un "soft cosine gate" — pensa a un buttafuori all'ingresso di un club che controlla quanto due pagine si somiglino prima di decidere cosa fare. Se due pagine sono molto simili, vengono incollate strettamente. Se sono totalmente diverse, il buttafuori ne manda via una per mantenere pulita la memoria. Ma la vera magia è l' "attention compensation" (compensazione dell'attenzione). Poiché incollare le pagine insieme di solito fa sì che il modello le ignori, SelKV aggiunge un piccolo "aumento di volume" alle pagine incollate, assicurando che il modello presti la giusta quantità di attenzione a esse.

I ricercatori hanno testato questo sistema su tre diversi modelli di IA utilizzando 16 compiti differenti, dal rispondere a domande su documenti multipli allo scrivere codice. Hanno scoperto che, mantenendo solo il 25% dello spazio di memoria originale, SelKV si comportava quasi altrettanto bene di avere la memoria completa e, in alcuni quiz difficili su documenti multipli, ha effettivamente performato meglio della versione completa. Sembra che, essendo selettivo, l'IA abbia effettivamente si sia concentrata sulle parti più importanti della storia. Inoltre, quando il testo diventava enorme (100.000 token), questo metodo rendeva l'IA 3,3 volte più veloce nella decodifica del testo. Il documento suggerisce che questo approccio sia particolarmente efficace per i moderni modelli di IA che utilizzano un tipo specifico di attenzione (chiamata GQA), offrendo un modo per mantenere questi potenti cervelli veloci senza perdere la memoria.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →