← Últimos artículos
💻 computer science

Tamarin (HSQ): Reversible Hierarchical KV-Cache Compression for LLM Inference

Tamarin (HSQ) introduce un esquema de compresión de caché KV jerárquico de tres niveles y reversible que enruta los tokens hacia un nivel focal, vectores de resumen aprendidos y un archivo basado en CPU para lograr una reducción de memoria GPU de 12 a 28 veces para la inferencia de LLM de contexto largo, manteniendo una perplejidad y precisión de recuperación cercanas a la línea base.

Autores originales: Alikhan Bazakov, Kirill Kiselev

Publicado 2026-07-10
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Alikhan Bazakov, Kirill Kiselev

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando leer un libro masivo de 32.000 páginas en una tableta diminuta. El problema no es el texto del libro; es que la memoria de tu tableta se llena instantáneamente con solo sostener las páginas que ya has leído. En el mundo de la IA, esta "memoria" se llama caché KV, y para los modelos grandes, consume toda la potencia de tu computadora, obligándote a desechar las páginas viejas para hacer espacio para las nuevas.

La mayoría de las soluciones actuales son como un bibliotecario que, cuando el estante se llena, decide desechar los libros que cree que no necesitarás. Pueden conservar las primeras páginas y las últimas, pero si de repente haces una pregunta sobre un detalle en medio del libro, esa página se ha ido para siempre. El artículo llama a esto "evicción" (expulsión), y argumenta que esto es un fallo fatal porque no puedes predecir qué le preguntará un usuario a continuación.

La Gran Idea: El Índice Mágico, No el Cubo de la Basura

Los autores de este artículo, de Siamang Labs, proponen un enfoque diferente llamado Tamarin (técnicamente conocido como HSQ). En lugar de tirar las páginas, tratan la memoria como un índice gigante y buscable.

Así es como funciona su sistema de tres niveles, utilizando una analogía de una biblioteca:

  1. El Estante "VIP" (L1): Una sección pequeña y de alta velocidad en tu tableta (GPU) contiene las páginas más importantes y las más recientes. Estas se mantienen con todo su detalle, solo que un poco reducidas (precisión de 4 bits).
  2. Las "Tarjetas de Pistas" (L2): Para el resto del libro, el sistema crea diminutas "tarjetas de pistas" de 3 bits para cada grupo de 8 a 16 páginas. Estas tarjetas no contienen la historia; solo contienen un resumen de de qué tratan las páginas. Viven en tu tableta también.
  3. El "Archivo Profundo" (L3): El texto original completo de cada una de las páginas se almacena en un enorme almacén al otro lado de la calle (CPU RAM), también reducido a una precisión de 4 bits.

Cómo Funciona en Tiempo Real

Cuando la IA está leyendo y de repente necesita responder una pregunta, no adivina. Primero mira las Tarjetas de Pistas (L2). Una IA "lectora", pequeña y astuta, califica estas tarjetas para ver qué grupos de páginas son relevantes para la pregunta actual.

Si una tarjeta parece prometedora, el sistema corre instantáneamente al Archivo Profundo (L3), toma las páginas originales y las trae de vuelta a la tableta justo antes de que la IA tome su decisión.

El artículo demuestra que este enfoque de "indexación" es la clave. En una prueba donde desactivaron el paso de "recuperar desde el archivo", la capacidad del sistema para encontrar información oculta (llamada búsqueda de "aguja en un pajar") cayó al 0%. Esto confirma que las tarjetas de pistas son solo para la ruta; el contenido real vive en el archivo.

Los Resultados: Ahorros Masivos con Casi Ningún Costo

El artículo midió esto en varios modelos (específicamente la familia Qwen3, que va desde 0,6 mil millones hasta 14 mil millones de parámetros). Esto es lo que encontraron:

  • Ahorro de Memoria: Con una longitud de contexto de 32.000 tokens, Tamarin reduce el uso de memoria de la GPU entre 12 y 28 veces. Por ejemplo, un modelo que normalmente necesita 4,5 GiB de memoria para el caché a 32K tokens solo necesita unos 172 MiB en la GPU. El resto vive en la memoria RAM de la CPU.
  • Calidad: Para modelos más grandes (4B y 8B de parámetros), la calidad es casi idéntica a la versión sin comprimir. La "perplejidad" (una medida de cuánto se confunde la IA) solo aumenta entre un 0,1% y un 0,4%. La IA está de acuerdo con la versión original en el 96% al 97% de las palabras que elige.
  • Recuperación: En pruebas con 500 intentos para encontrar un código oculto en diferentes profundidades del texto, el modelo de 8B encontró el código 500 de 500 veces, igualando estadísticamente a la línea base sin comprimir.

Lo que el Artículo Descarta y Donde Falla

Los autores son muy claros sobre lo que esto no es y dónde tiene dificultades:

  • No es una mejora de velocidad: El artículo establece explícicamente que Tamarin no hace que la IA sea más rápida. De hecho, debido a que tiene que recuperar datos del archivo de la CPU, la velocidad a 32K tokens cae a aproximadamente el 17–18% de la velocidad normal. El intercambio es capacidad (meter más texto) por velocidad.
  • No funciona perfectamente en modelos diminutos: Para el modelo más pequeño probado (0,6 mil millones de parámetros), el costo de calidad es mayor. El artículo señala un aumento del 6–10% en la perplejidad cuando se usan pesos de 4 bits, lo cual se considera un fallo para ese tamaño específico.
  • No es una solución mágica para todas las familias de IA: El método funciona muy bien en los modelos Qwen3, pero cuando lo probaron en una familia diferente (Mistral-7B), los resultados fueron desordenados, con una caída de 20 puntos porcentuales en la precisión en ciertas profundidades. Los autores sospechan que esto se debe a que Mistral carece de un paso específico de "normalización" que Qwen posee, lo que hace que las "tarjetas de pistas" sean más difíciles de leer.
  • Un punto de control específico "frágil": Incluso en el modelo de 14B, hubo dos puntos específicos en el texto donde el sistema tuvo dificultades para encontrar la aguja oculta, cayendo al 80,4% de precisión. El artículo atribuye esto a un fallo específico en el entrenamiento de ese modelo, no al método en sí.

La Conclusión

El artículo sugiere que, para modelos grandes (4B en adelante), Tamarin es una forma probada de meter cantidades masivas de texto en una memoria limitada sin borrar la información permanentemente. Convierte el problema de "quedarse sin espacio" en un problema de "gestionar un índice". Aunque ralentiza las cosas y requiere un ajuste cuidadoso para diferentes tipos de IA, resuelve con éxito el cuello de botella de la memoria para tareas de contexto largo donde mantener cada pieza de información es crítico.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →