InferScale: GPU-Native KV Injection for Personalized LLM Serving
InferScale es un sistema de memoria nativo de GPU que acelera el servicio de LLM personalizados mediante la precomputación e inyección de estados KV reutilizables directamente en el caché de vLLM, desacoplando así la latencia del primer token (time-to-first-token) del tamaño del contexto recuperado mientras mantiene una alta precisión.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando enseñarle a un robot superinteligente toda la historia de tu vida para que pueda responder preguntas sobre ti. Cada vez que le haces una pregunta al robot, tienes que pegar toda tu biografía en su cerebro antes de que pueda pensar. Si tu biografía es corta, el robot piensa rápido. Pero si tu biografía es larga —llena de años de recuerdos, bromas internas y aventuras pasadas— el robot tiene que volver a leer y procesar cada una de las palabras de esa biografía solo para responder "¿Cuál es mi color favorito?". Este proceso de relectura es lento y costoso, como un bibliotecario que tiene que volver a colocar en los estantes cada uno de los libros de la biblioteca antes de entregarte solo uno. Este es el estado actual de la IA "personalizada": cuanto más memoria le das, más lenta se vuelve para hablar contigo.
El artículo que vas a leer aborda este problema utilizando un truco ingenioso del mundo de la informática llamado "caché de Key-Value" (Clave-Valor). Piensa en el cerebro del robot como una pizarra gigante donde escribe las partes más importantes de lo que ha leído hasta ahora, para no tener que volver a leer el texto original. Normalmente, si cambias el orden de los libros en el estante, el robot tiene que volver a escribir toda la pizarra. Pero, ¿y si el robot pudiera simplemente tomar las notas ya escritas de un cajón y pegarlas en la pizarra instantáneamente, sin importar a dónde quiera colocarlas? Esa es la idea central de esta investigación: en lugar de obligar al robot a releer tus recuerdos, precalculamos las "notas" de cada recuerdo y las almacenamos en el superrápido disco duro interno del robot. Entonces, cuando haces una pregunta, simplemente dejamos caer esas notas directamente en el cerebro del robot.
El Problema: La trampa de la "Relectura"
Hoy en día, cuando usas un asistente de IA con un historial largo de conversaciones, el sistema tiene que encontrar los recuerdos más relevantes y pegarlos en tu nueva pregunta. Esto se llama "inyección de prompts" (prompt injection). Imagina que le pides consejo a un amigo, pero cada vez que hablas, tienes que leer en voz alta las últimas 5 de páginas de tu diario antes de poder decir tu pregunta real. Cuantas más páginas leas, más tardará en llegar al consejo. Incluso si haces exactamente la misma pregunta diez veces, el amigo tiene que leer esas 50 páginas diez veces. Esto hace que la IA se sienta lenta, especialmente a medida que tu memoria personal crece.
La Solución: InferScale
Los investigadores, Peter Li y Prashant Pandey, construyeron un nuevo sistema llamado InferScale. En lugar de hacer que la IA vuelva a leer los recuerdos, InferScale realiza el trabajo pesado una sola vez antes de que empieces a hablar. Toma cada hecho de la memoria (como "Me encanta la pizza" o "Mi perro se llama Rex") y calcula sus "notas cerebrales" (llamadas estados KV) de antemano. Estas notas se almacenan directamente en la tarjeta gráfica (la GPU), que es el cerebro superrápido de la computadora.
Cuando haces una pregunta, el sistema no envía el texto de tus recuerdos a la IA. En su lugar, encuentra las "notas cerebrales" adecuadas de la GPU y las inyecta directamente en la memoria de trabajo de la IA. Es como tener una biblioteca donde, en lugar de entregarte los libros, el bibliotecario pega instantáneamente los párrafos exactos que necesitas en tu escritorio. La IA nunca tiene que volver a leer el texto original; simplemente usa las notas.
Los Trucos Mágicos
Para que esto funcione, el equipo tuvo que resolver dos acertijos complicados:
El problema del "Objetivo Móvil" (RoPE fragmentado/Chunked RoPE):
Normalmente, estas "notas cerebrales" están ligadas a un lugar específico en el texto. Si mueves un recuerdo del principio de una historia al medio, las notas dejan de ser correctas. Los investigadores inventaron una técnica llamada Chunked RoPE. Imagina que las notas están escritas en un tipo especial de papel que se puede rotar. No importa dónde coloques el papel en el escritorio, puedes girarlo para que coincida perfectamente con la nueva posición. Esto permite que el sistema tome un recuerdo almacenado en un lugar y lo suelte en cualquier parte de tu conversación sin romper las matemáticas.El problema del "Contexto" (Codificación de ventana de contexto/Context-Window Encoding):
Si solo tomas una frase como "Él fue a la tienda", la IA podría no saber quién es "Él". Si almacenas el recuerdo de forma aislada, pierdes el contexto. Para solucionar esto, el sistema almacena el recuerdo con una pequeña ventana de las frases que le preceden (como "John fue a la tienda"). Sin embargo, solo guarda las "notas cerebrales" de la parte específica del recuerdo, no de toda la ventana. De esta manera, la IA entiende el contexto ("Él" es John) sin tener que volver a leer todo el párrafo cada vez.
Lo que Encontraron
Los resultados son impresionantes. Los investigadores probaron esto en tres modelos de IA diferentes (Llama-3.1-8B, Mistral-7B y Qwen2.5-7B) utilizando un conjunto de datos de conversaciones largas.
- Velocidad: En la forma antigua (Mem0), a medida que aumentaban el número de recuerdos recuperados de 5 a 50, el tiempo que tardaba la IA en empezar a hablar (Tiempo al Primer Token/Time-to-First-Token) aumentó un 106% (de 33.2 ms a 68.3 ms). Con InferScale, ese mismo aumento solo causó un retraso del 4% (de 16.6 ms a 17.3 ms).
- Rendimiento (Throughput): Cuando 100 personas usaban el sistema al mismo tiempo, InferScale manejaba de 3.7 a 4.5 veces más preguntas por segundo que el sistema antiguo.
- Precisión: Debido a que el sistema a veces almacena los recuerdos por separado, existía el riesgo de que la IA se confundiera. Sin embargo, al usar el truco de la "Ventana de Contexto", recuperaron casi toda la precisión. En la carga de memoria más alta, InferScale obtuvo el 60.3% de las respuestas correctas, lo cual es muy cercano al 63.3% del sistema antiguo, pero mucho más rápido.
Por qué es Importante
Este artículo demuestra que no tienes que elegir entre una IA inteligente y con mucha memoria y una que sea rápida. Al mover el almacenamiento de la memoria a la GPU e inyectar las "notas cerebrales" directamente, desacoplaron la velocidad de la IA del tamaño de su memoria. El sistema no requiere reentrenar los modelos de IA ni realizar cambios en el motor subyacente, lo que lo convierte en una actualización práctica para el futuro de los asistentes de IA personalizados. Incluso si los datos de la memoria son demasiado grandes para caber en la GPU rápida, demostraron que derivar ese contenido a la memoria regular de la computadora sigue manteniendo el sistema significativamente más rápido que los métodos actuales.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.