← Últimos artículos
🤖 machine learning

Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches

Este artículo presenta SAECache, una política de expulsión de caché de prefijos adaptativa semánticamente que aprovecha los valores de reutilización variables de diferentes tipos de tokens mediante una arquitectura de múltiples colas y aprendizaje en línea para mejorar significativamente la eficiencia de servicio de LLM mientras elimina la necesidad de ajuste manual de parámetros.

Autores originales: Shaoke Fang, Ziang Li, Wenfei Wu, Jiatong Ji, Qingsong Liu, Ruizhi Pu

Publicado 2026-05-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Shaoke Fang, Ziang Li, Wenfei Wu, Jiatong Ji, Qingsong Liu, Ruizhi Pu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que gestionas una cafetería de lujo muy concurrida (el Modelo de Lenguaje Grande o LLM) que atiende a millones de clientes cada día. Para preparar café rápidamente, tienes una "estantería de memoria" especial (la Memoria de la GPU) donde guardas los ingredientes preelaborados y las instrucciones para los pedidos que ya has iniciado. Esto se denomina Almacenamiento en Caché de Prefijos.

Si un nuevo cliente pide un latte que es 90% idéntico a un pedido anterior, no necesitas moler granos nuevos ni espumar leche nueva; simplemente tomas la base preelaborada de la estantería. Esto hace que el primer sorbo (el Primer Token) aparezca casi instantáneamente.

Sin embargo, tu estantería es diminuta. No puedes mantener cada base preelaborada para siempre. Eventualmente, tienes que tirar algunas cosas para hacer espacio a nuevos pedidos. Esto es la Política de Expulsión.

El Problema: El Error de "Una Talla Única"

Durante mucho tiempo, los gerentes de cafeterías usaron una regla simple: "Tira el artículo más antiguo primero." (Esta es la política LRU).

El artículo argumenta que esta es una mala idea porque no todos los artículos en la estantería son igualmente valiosos.

  • El Prompt del Sistema: Imagina un "Menú Estándar" que ve cada cliente. Nunca cambia. Es increíblemente valioso porque todos lo piden.
  • La Cadena de Pensamiento: Imagina el monólogo interno desordenado de un cliente sobre por qué quiere un latte. Esto es único para esa persona y ese momento. Casi nunca es útil para el siguiente cliente.

La vieja regla trataba al "Menú Estándar" y al "Monólogo Desordenado" exactamente igual. Si el Monólogo era ligeramente más nuevo que el Menú, la vieja regla tiraría el Menú para hacer espacio al Monólogo. Esto es un desastre porque el siguiente cliente necesitará el Menú inmediatamente, pero el Monólogo es inútil para ellos.

La Solución: SAECache (El Gerente Inteligente)

Los autores crearon un nuevo sistema llamado SAECache. Piensa en él como un gerente inteligente que no solo mira cuándo se tocó un artículo por última vez, sino qué es realmente el artículo.

Así es como funciona, usando analogías simples:

1. Los Cuatro Contenedores Especializados (Arquitectura de Cola Múltiple)

En lugar de una sola estantería grande, SAECache organiza la estantería en cuatro contenedores distintos, cada uno con sus propias reglas:

  • El Contenedor "Basura": Contiene artículos que casi nunca se reutilizan (como el monólogo desordenado o los pasos finales de una bebida). Estos se tiran primero.
  • El Contenedor "Plantilla": Contiene instrucciones estándar y prompts del sistema (como el menú). Estos se guardan con mucho cuidado porque se reutilizan constantemente.
  • El Contenedor "Chat": Contiene conversaciones donde las personas hablan de ida y vuelta.
  • El Contenedor "Agente": Contiene tareas complejas donde la IA está trabajando (como programar o usar herramientas).

2. La "Puntuación de Valor" (Ponderación Consciente Semánticamente)

El gerente no solo adivina qué contenedor es importante. ¡Aprende!

  • Si el gerente tira un "Prompt del Sistema" y luego inmediatamente se le pide de nuevo, el sistema aprende: "¡Ups! Tiré algo valioso. Debería dar a los Prompts del Sistema una puntuación más alta la próxima vez."
  • Si tira una "Cadena de Pensamiento" y nadie la pide, aprende: "¡Buen trabajo! Eso era basura. Seguiré dándole una puntuación baja."

Esto sucede automáticamente, como un gerente ajustando las estanterías según lo que los clientes compran realmente, sin necesidad de que un humano les diga qué hacer.

3. La "Máquina del Tiempo" (Temporización Adaptativa)

El sistema también aprende cuándo vuelve la gente.

  • Las sesiones de Chat pueden tener pausas largas (como un cliente tomando un descanso para café).
  • Las sesiones de Agente pueden ser muy rápidas y frenéticas.
    El sistema aprende el "latido" específico de cada tipo de sesión. Sabe que si una sesión de Chat no ha regresado en 10 minutos, probablemente se ha ido para siempre. Pero si una sesión de Agente no ha regresado en 10 segundos, quizás solo esté pensando. Ajusta sus reglas de expulsión en tiempo real para coincidir con el ritmo del tráfico.

Los Resultados: Café más Rápido, Menos Desperdicio

El artículo probó a este nuevo gerente contra la vieja regla de "el más antiguo primero" y otros sistemas inteligentes pero rígidos.

  • Velocidad: El nuevo sistema hizo que el primer sorbo de café apareciera de 1.4 a 2.7 veces más rápido en entornos concurridos y mixtos.
  • Adaptabilidad: Los sistemas antiguos fallaban cuando cambiaba el tipo de clientes (por ejemplo, si la cafetería de repente tenía más clientes de pedido único en lugar de conversadores). El nuevo sistema se adaptó instantáneamente.
  • Eficiencia: Ahorró una cantidad masiva de memoria "desperdiciada" al no acumular basura (como los monólogos desordenados) y al mantener las cosas valiosas (como el menú) a salvo.

Resumen

En resumen, el artículo dice: No trates todos los bloques de memoria igual. Solo porque dos cosas se tocaron al mismo tiempo no significa que sean igualmente útiles. Al enseñarle al ordenador a entender el significado de los datos (¿es esto un menú? ¿es esto una broma? ¿es esto una herramienta?) y permitirle aprender de sus propios errores en tiempo real, podemos hacer que la IA sea mucho más rápida y eficiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →