Value-Aware Stochastic KV Cache Eviction for Reasoning Models
Autores originales: Ting-Yun Chang, Harvey Yiyun Fu, Deqing Fu, Chenghao Yang, Jesse Thomason, Robin Jia
Autores originales: Ting-Yun Chang, Harvey Yiyun Fu, Deqing Fu, Chenghao Yang, Jesse Thomason, Robin Jia
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: Evicción de Caché KV Estocástica Consciente del Valor para Modelos de Razonamiento
1. Planteamiento del Problema
Los modelos de razonamiento (por ejemplo, Qwen3, o1 de OpenAI) logran una alta precisión generando cadenas de pensamiento extendidas antes de producir una respuesta final. Sin embargo, esta capacidad crea un cuello de botella significativo en memoria y computación durante la fase de decodificación. A medida que la longitud de la secuencia crece, el caché de Clave-Valor (KV) requerido para almacenar las representaciones de cada token pasado incurre en un gasto excesivo.
Las soluciones existentes se dividen en dos categorías:
- Métodos basados en selección: Estos retienen el caché KV completo pero activan solo un subconjunto disperso de tokens durante el cómputo de la atención. Aunque son precisos, su huella de memoria escala linealmente con la longitud de la secuencia (O(T)), por lo que no resuelven el cuello de botella de memoria.
- Métodos basados en evicción: Estos descartan permanentemente pares KV de baja importancia una vez alcanzado un presupuesto predefinido, ofreciendo una huella de memoria estática y un mejor rendimiento (throughput). Sin embargo, los métodos de evicción actuales sufren una degradación significativa de la precisión en tareas de razonamiento en comparación con las alternativas basadas en selección, lo que a menudo provoca que los modelos entren en bucles de razonamiento repetitivos o generen salidas sin sentido.
El artículo identifica que las estrategias de evicción actuales no tienen en cuenta dos factores críticos: la influencia desproporcionada de los estados de valor de gran magnitud y la necesidad de diversidad estocástica en los tokens retenidos.
2. Metodología: VASE
Los autores proponen la Evicción de Caché KV Estocástica Consciente del Valor (VASE), un marco de evicción sin entrenamiento diseñado para cerrar la brecha entre eficiencia y precisión. VASE opera dentro de un marco de evicción periódica (usando un presupuesto persistente K y un búfer reciente B) e introduce dos mecanismos centrales:
A. Protección de Estados de Valor de Gran Magnitud
Los autores observan que los estados de valor en los modelos de razonamiento exhiben una distribución fuertemente sesgada, donde una pequeña fracción de los tokens posee magnitudes vectoriales anormalmente grandes (medidas por el rango Range(v)=max(v)−min(v)).
- Hallazgo: Evictar estos valores de alta magnitud causa un colapso catastrófico de la precisión (por ejemplo, cayendo de ~88% a 14% en GSM8K) e induce bucles repetitivos donde el modelo examina el contexto interminablemente sin llegar a una conclusión.
- Mecanismo: VASE reserva una porción específica del presupuesto de tokens (Nv) para retener incondicionalmente los Nv tokens con las mayores magnitudes de valor. Esto asegura que los vectores de valor más influyentes nunca sean descartados.
B. Introducción de Estocasticidad
Los métodos de evicción actuales suelen utilizar una selección top-k determinista, lo que puede derivar en una falta de diversidad en el caché retenido.
- Hallazgo: La introducción de estocasticidad mejora la precisión al asegurar una cobertura más representativa de todo el contexto.
- Mecanismo: En lugar de seleccionar determinísticamente los tokens con mayor puntuación, VASE emplea un muestreo estocástico ponderado.
- VASE-AttnV: Combina la reserva consciente del valor con el muestreo estocástico basado en puntuaciones de atención (derivadas de SnapKV).
- VASE-DKV: Adapta el método CurDKV (que utiliza puntuaciones de apalancamiento de la descomposición de matrices CUR) mediante el remuestreo de la matriz de proyección Gaussiana G en cada paso de evicción. Esto evita que los tokens con representaciones específicas reciban consistentemente puntuaciones bajas y sean evictos permanentemente.
3. Contribuciones Clave
- Identificación de Factores Críticos: El artículo establece que (1) los estados de valor de gran magnitud son crucialos para mantener la progresión del razonamiento y prevenir bucles repetitivos, y (2) la estocasticidad en las decisiones de evicción aumenta significativamente la precisión al incrementar la diversidad del caché.
- Marco VASE: Una novedosa receta de evicción sin entrenamiento que integra la protección de la magnitud del estado de valor y el muestreo estocástico. Es el primer método de evicción que combina puntuación basada en claves, puntuación basada en valores y promoción de la diversidad.
- Conexión con la Cuantización: Los autores demuestran que los estados de valor de gran rango son también la fuente principal de error de reconstrucción en la cuantización del caché KV por token, lo que sugiere que los hallazgos de VASE se generalizan a otras técnicas de compresión.
4. Resultados Experimentales
Los autores evaluaron VASE en Qwen3-4B y Qwen3-14B a través de seis tareas de razonamiento (AIME25/26, HMMT25, GPQA-Diamond, MATH, LiveCodeBench-v6) con una tasa de compresión de caché KV de 4×.
- Precisión vs. Métodos de Selección: VASE-AttnV logró una precisión promedio superior al método de selección más fuerte (SeerAttention-R) en ambos tamaños de modelo, manteniendo una huella de memoria estática.
- Qwen3-4B: VASE-AttnV (59.09%) superó a SeerAttention-R (58.81%) y al baseline de evicción más fuerte R-KV (54.69%) por un 4.4%.
- Qwen3-14B: VASE-AttnV (65.81%) igualó a SeerAttention-R (65.37%) y superó a R-KV (60.90%) por un 4.9%.
- Estudios de Ablación:
- Conciencia de Valor: Reservar espacios para valores de gran magnitud mejoró la precisión en GSM8K hasta en un 16.2% respecto a los baselines.
- Estocasticidad: Añadir muestreo estocástico a CurDKV mejoró la precisión en un 9.2% en Qwen3-14B.
- Eficiencia: VASE-DKV logró el mayor rendimiento (3.1× más rápido que el baseline del modelo completo a 16K tokens) y el uso de memoria pico más bajo entre todos los métodos probados.
- Generación de Código: En LiveCodeBench, los métodos VASE superaron significativamente al método de selección Se_erAttention-R, que tuvo dificultades con los cambios de dominio.
5. Significado y Reivindicaciones
El artículo afirma que VASE cierra con éxito la brecha de eficiencia-precisión que históricamente ha afectado a los métodos de evicción de caché KV. Al priorizar los estados de valor de gran magnitud e introducir la estocasticidad, VASE permite que los modelos de razonamiento operen con una huella de memoria estática sin sacrificar la precisión típicamente asociada con los enfoques de caché completo o de selección.
Los autores enfatizan que sus hallazgos sobre la importancia de la magnitud del estado de valor tienen implicaciones más amplias más allá de la evicción, específicamente para la cuantización del caché KV, donde se identifican los valores de gran rango como una fuente primaria de error. Sugieren que los futuros métodos de inferencia con eficiencia de memoria deberían considerar enfoques de precisión mixta que protejan estos estados críticos de alta magnitud.
En última instancia, VASE proporciona una receta simple, efectiva y sin entrenamiento para soportar FlashAttention2 y permitir la inferencia escalable para modelos de razonamiento de cadena larga.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de machine learning cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.