← Últimos artículos
🤖 AI

SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation

SelKV es un marco de trabajo libre de entrenamiento que comprime los cachés KV mediante la fusión o el descarte selectivo de tokens basado en la similitud de los vectores de valor y la compensación de desequilibrios de atención mediante sesgo de logit, logrando una calidad de generación casi sin pérdidas y aceleraciones significativas mientras retiene solo el 25% del caché original.

Autores originales: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

Publicado 2026-07-21
📖 3 min de lectura☕ Lectura para el café

Autores originales: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando recordar una historia masiva de 100.000 páginas mientras escribes un nuevo capítulo. Cada vez que piensas en un punto de la trama, tienes que hojear todo tu cuaderno para encontrar los detalles correctos. Cuantas más páginas escribes, más pesado se vuelve tu cuaderno, hasta que tus brazos se cansan demasiado para sostenerlo. Esto es exactamente lo que sucede dentro del "cerebro" de un Modelo de Lenguaje Extenso (LLM) cuando intenta procesar textos largos. Estos modelos son increíblemente inteligentes, pero tienen un problema de memoria: a medida que leen, almacenan un "caché de Clave-Valor" —un sistema de archivo digital de todo lo que han visto hasta ahora— para ayudarles a entender qué viene después. Cuanto más largo es el texto, más grande se vuelve este archivador, llenando eventualmente toda la memoria de la computadora y ralentizando todo hasta un paso de tortuga.

Para solucionar esto, los científicos han probado dos trucos principales. El primero es la "evicción", que es como tirar a la basura las páginas viejas que crees que no son importantes. El segundo es la "fusión", que es como pegar páginas similares para ahorrar espacio. Pero ambos métodos tienen un defecto. Tirar páginas puede hacer que se pierdan pistas cruciales, y pegar páginas a menudo crea una versión "borrosa" donde el modelo olvida cuánta atención debe prestar al grupo pegado. Es como si pegaras diez fotos de un gato; el modelo podría seguir dando a ese único bloque pegado la misma cantidad de atención que le daría a una sola foto, a pesar de que ahora representa a diez. Esto hace que el modelo se confunda y cometa errores.

Aquí entra SelKV, un nuevo y astuto método que actúa como un bibliotecario inteligente para estos archivadores digitales. En lugar de pegar páginas a ciegas o tirarlas a la basura, SelKV utiliza una "puerta de coseno suave" —piensa en ello como un portero de un club que revisa qué tanto se parecen dos páginas antes de decidir qué hacer. Si dos páginas son muy similares, se pegan estrechamente. Si son totalmente diferentes, el portero envía una de ellas lejos para mantener la memoria limpia. Pero la verdadera magia es la "compensación de atención". Dado que pegar páginas suele hacer que el modelo las ignore, SelKV añade un pequeño "aumento de volumen" a las páginas pegadas, asegurando que el modelo preste la cantidad de atención adecuada a ellas.

Los investigadores probaron este sistema en tres modelos de IA diferentes utilizando 16 tareas distintas, desde responder preguntas sobre múltiples documentos hasta escribir código. Descubrieron que, al mantener solo el 25% del espacio de memoria original, SelKV funcionaba casi tan bien como si tuviera la memoria completa, e incluso en algunos cuestionarios complicados de múltiples documentos, funcionó mejor que la versión completa. Parece que, al ser selectivo, la IA en realidad se enfocó en las partes más importantes de la historia. Además, cuando el texto se volvía enorme (100.000 tokens), este método hizo que la IA decodificara texto 3,3 veces más rápido. El artículo sugiere que este enfoque es especialmente bueno para los modelos de IA modernos que utilizan un tipo específico de atención (llamada GQA), ofreciendo una forma de mantener estos cerebros poderosos funcionando rápido sin perder su memoria.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →