MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems
MARS es un sistema eficiente y adaptativo de co-planificación que coordina globalmente recursos heterogéneos GPU-CPU para agentes autónomos de LLM al desacoplar la admisión de la ejecución y optimizar la retención del estado, reduciendo así significativamente la latencia de extremo a extremo mientras mantiene un alto rendimiento.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que gestionas una cocina moderna y muy concurrida. En el pasado, esta cocina solo preparaba platos sencillos y únicos (como una sola respuesta de texto). Los chefs (las GPUs) eran los únicos que importaban, y el objetivo era simplemente cocinar tantos platos por hora como fuera posible.
Pero hoy, la cocina ha cambiado. Ahora ejecuta agentes autónomos—piensa en ellos como superchefs que no solo cocinan un plato, sino que emprenden un viaje complejo para resolver un problema. Podrían cocinar un poco, luego correr a la despensa para agarrar un ingrediente (usando una herramienta), consultar un libro de recetas (leyendo un archivo), volver a la estufa, cocinar un poco más y repetir este bucle docenas de veces hasta que el trabajo esté terminado.
El artículo introduce MARS, un nuevo "Gerente de Cocina" diseñado específicamente para este estilo caótico y multietapa de cocina. Así es como funciona, usando analogías sencillas:
El Problema: La Cocina Antigua Se Estaba Rompiendo
Los antiguos gerentes de cocina (sistemas de IA existentes) estaban diseñados para la era del "plato único". Cuando se enfrentaban a estos nuevos y complejos viajes de agentes, cometían tres grandes errores:
- La Trampa de "Parar y Seguir": Cuando un chef dejaba de cocinar para correr a la despensa (ejecución de herramientas en CPU), el antiguo gerente o bien tiraba las notas del chef (caché KV) para ahorrar espacio o las mantenía para siempre, obstruyendo la encimera. Si las notas se tiraban, el chef tenía que reescribir toda la receta desde cero al regresar, desperdiciando enormes cantidades de tiempo.
- El Bloqueo del "Pedido Gigante": Si llegaba un pedido enorme y complejo (un contexto largo), se apoderaba de la estufa y bloqueaba todos los pedidos pequeños y rápidos que estaban detrás, incluso si esos pedidos pequeños estaban listos para salir.
- El "Punto Ciego": El gerente solo vigilaba la estufa (GPU). No veía que la despensa (CPU) estaba atascada. Así que seguía enviando chefs a la estufa aunque la despensa estuviera llena, causando un atasco donde los chefs permanecían ociosos esperando ingredientes.
La Solución: MARS (El Gerente de Cocina Inteligente)
MARS soluciona esto actuando como un sistema nervioso central que ve todo—tanto la estufa como la despensa—y los coordina perfectamente.
1. El "Flujo Unificado de Información" (El Walkie-Talkie)
En lugar de adivinar, MARS tiene una transmisión en vivo que conecta la estufa y la despensa.
- Cómo funciona: Cada vez que un chef se detiene para ir a la despensa, o regresa con un ingrediente, se envía una señal instantáneamente. El gerente sabe exactamente por qué se detuvo el chef y cuándo volverá.
- El Beneficio: El gerente nunca tiene que adivinar. Sabe exactamente cuánto espacio en la encimera (memoria) mantener para las notas del chef y cuándo liberar espacio para nuevos pedidos.
2. El "Plano de Control Externo" (El Portero)
Antes de que un nuevo pedido incluso entre a la cocina, MARS verifica si la cocina realmente puede manejarlo.
- Cómo funciona: Mira dos cosas: ¿Está libre la estufa? ¿Está libre la despensa? Si la despensa está atascada con tareas de herramientas, MARS dice: "No hay nuevos pedidos por ahora", incluso si la estufa está vacía. Esto evita que la cocina se abrume.
- El Beneficio: Evita que la cocina acepte demasiados pedidos a la vez, lo que causaría un colapso total donde nada se terminaría.
3. El "Planificador Interno Centrado en el Agente" (El Despachador Inteligente)
Una vez que los pedidos están dentro, MARS decide quién cocina a continuación. No sigue simplemente una fila de "Primero en llegar, primero en ser servido".
- Cómo funciona:
- Prioridad: Si un chef está en medio de un paso rápido e interactivo, MARS lo deja ir primero. Si un chef está atascado en una receta masiva y lenta, MARS podría pausarlo brevemente para dejar que otros terminen, evitando el bloqueo del "pedido gigante".
- El Truco de la "Reanudación Caliente": MARS decide inteligentemente si mantener las notas del chef (caché KV) en la encimera. Si el chef va a volver en 2 segundos, MARS mantiene las notas (ahorrando tiempo). Si se va por 20 minutos, MARS borra las notas para hacer espacio para otros. Solo mantiene las notas cuando realmente ahorra tiempo.
Los Resultados: Más Rápido y Más Suave
El artículo probó MARS en escenarios del mundo real (como un asistente de programación que escribe y prueba software).
- Velocidad: MARS hizo que los agentes terminaran sus tareas hasta 5.94 veces más rápido que los sistemas antiguos en pruebas controladas. En una configuración real de programación, aceleró la finalización de tareas en 1.87 veces.
- Fiabilidad: Mientras que los sistemas antiguos se obstruían tanto que dejaban de terminar tareas por completo (alta "producción" pero cero "producción útil"), MARS mantenía la cocina funcionando sin problemas, asegurando que las tareas realmente se completaran a tiempo.
Resumen
Piensa en MARS como la diferencia entre un gerente de cocina que solo cuenta cuántas ollas hay en la estufa versus uno que entiende el flujo completo del restaurante. Al vigilar simultáneamente la estufa y la despensa, y tomando decisiones inteligentes sobre quién cocina a continuación y qué notas mantener, MARS asegura que los agentes de IA complejos y multietapa puedan trabajar eficientemente sin quedar atrapados en atascos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.