Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
El artículo presenta ConServe, un marco de planificación que desplaza la unidad de planificación de turnos individuales a conversaciones completas para eliminar la necesidad de predecir costos futuros desconocidos, reduciendo así la latencia y mejorando la eficiencia energética al aprovechar una estructura estable de dos fases de prellenado limitado por cómputo y decodificación limitada por memoria.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que diriges la cocina de un restaurante muy concurrido. En los viejos tiempos, cada pedido era sencillo: un cliente entra, cocinas la comida y se va. Podías gestionar la cocina fácilmente porque cada pedido tomaba aproximadamente la misma cantidad de tiempo y esfuerzo.
Pero ahora, imagina que tus clientes son "Agentes de IA". No solo piden una comida; comienzan un proyecto complejo.
- El Primer Turno (El Gran Informe): El cliente se sienta y te entrega un manual de instrucciones masivo de 50 páginas. Esto toma mucho tiempo leerlo y entenderlo (el "Prefill" o Prellenado).
- Los Turnos Intermedios (Las Llamadas a Herramientas): El chef comienza a cocinar, luego se detiene para llamar a un proveedor, esperar una respuesta, revisar una receta y volver a llamar. Estos pasos son cortos, pero ocurren una y otra vez.
- El Turno Final (El Resultado): Finalmente, el plato está listo para ser servido.
El Problema: La Vieja Forma de Programar
Los gestores de cocina actuales (sistemas de IA) tratan cada paso individual como un pedido separado. Cada vez que el chef se detiene para llamar a un proveedor, el gestor tiene que decidir: "¿Dejo al chef terminar este paso aquí mismo en la cocina principal, o envío este paso específico a una estación diferente y especializada?"
El problema es que el gestor tiene que adivinar cuánto tiempo tomará ese paso o cuánta memoria necesitará antes de que ocurra. Si adivina mal, envía el paso a la estación equivocada, causando un embotellamiento. Es como un policía de tránsito tratando de dirigir los autos prediciendo exactamente qué tan rápido conducirá cada conductor antes de que siquiera comiencen a moverse.
La Solución: ConServe (El Enfoque a Nivel de Conversación)
El artículo presenta un nuevo sistema llamado ConServe. En lugar de gestionar cada paso por separado, ConServe gestiona toda la conversación como una única unidad.
Aquí es cómo ConServe cambia las reglas usando un plan de dos fases:
Fase 1: El Trabajo Pesado (El Prefill)
Cuando el cliente llega por primera vez con ese manual de 50 páginas, ConServe lo envía inmediatamente a una estación de alta potencia y súper rápida (una GPU potente). Esta estación está construida específicamente para leer documentos enormes rápidamente. Lee el manual, entiende el contexto y crea un "mapa de memoria" (llamado caché KV) de todo lo necesario.
Fase 2: La Larga Cola (El Resto de la Conversación)
Una vez que se ha realizado ese mapa inicial, ConServe dice: "Muy bien, el trabajo pesado ha terminado. Ahora, toda esta conversación pertenece a una estación específica, más pequeña y eficiente en energía".
- El "mapa de memoria" se mueve exactamente una vez a esta nueva estación.
- A partir de ese momento, cada uno de los pasos de seguimiento (las llamadas a herramientas, las actualizaciones cortas) ocurre allí mismo en esa misma estación.
- El sistema nunca vuelve a adivinar. No importa si el siguiente paso es corto o largo; la conversación permanece anclada a esa misma estación hasta que el trabajo termine.
Por qué esto es mejor (La Analogía)
Piénsalo como un camión de reparto:
- La Vieja Forma: Intentas predecir si el próximo paquete es pesado o ligero. Si adivinas mal, envías un camión pequeño para una carga pesada, o un camión grande para un paquete diminuto. Desperdicias gasolina y tiempo.
- ConServe: Cargas el camión una vez al principio. Conduces el camión hacia el destino y lo estacionas allí. Todos los paquetes subsiguientes para ese mismo cliente se cargan en ese mismo camión. No necesitas predecir el peso del siguiente paquete; simplemente mantienes el camión funcionando eficientemente.
Los Resultados
El artículo probó esto con cargas de trabajo reales de agentes de IA y descubrió:
- Velocidad: Redujo el tiempo que tarda el cliente en ver el primer resultado real (no solo una llamada a una herramienta) en un 51%. Es como recibir tu comida un 50% más rápido porque la cocina no está confundida sobre dónde poner los ingredientes.
- Eficiencia: Ahorró un 7.5% de energía. Al usar una estación potente solo para la lectura inicial masiva y una estación más barata para el resto, desperdicia menos electricidad.
- Fiabilidad: Debido a que el sistema no tiene que adivinar (predecir) qué pasará después, nunca comete errores de "giro equivocado". Los sistemas antiguos se bloqueaban o se ralentizaban si sus predicciones fallaban; ConServe simplemente sigue adelante porque se basa en lo que realmente puede ver en ese momento.
En resumen: ConServe deja de intentar predecir el futuro de cada pequeño paso en una conversación de IA. En su lugar, trata toda la conversación como un solo trabajo, maneja el inicio pesado con un motor potente y luego deja que un motor constante y eficiente termine el resto.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.