← Últimos artículos
🤖 AI

A Policy-Driven Runtime Layer for Agentic LLM Serving

Este artículo propone una nueva "capa de ejecución de agentes" arquitectónica que cierra la brecha entre los marcos de agentes múltiples y los motores de servicio de LLM para habilitar optimizaciones impulsadas por políticas, demostrando mediante el sistema CacheSage que este enfoque mejora significativamente las tasas de aciertos en caché, el tiempo hasta el primer token y el rendimiento en diversas cargas de trabajo de agentes múltiples.

Autores originales: Rui Zhang, Chaeeun Kim, Liting Hu

Publicado 2026-05-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Rui Zhang, Chaeeun Kim, Liting Hu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás dirigiendo un restaurante concurrido y de alta gama.

La Configuración Actual: Una Ruptura en la Comunicación
Actualmente, tu restaurante tiene dos capas distintas que no se comunican bien entre sí:

  1. El Jefe de Cocina (El Marco de Agentes): Esta persona conoce el menú, los roles de los camareros y las instrucciones específicas para cada mesa. Sabe quién está pidiendo y qué necesita. Sin embargo, nunca ve el suelo de la cocina; no sabe qué ollas están actualmente en la estufa ni qué ingredientes se están agotando.
  2. El Personal de Cocina (El Motor de Servicio): Este equipo ve cada pedido individual que entra. Sabe exactamente cuántas ollas están hirviendo y qué tan rápido pueden cocinar. Pero no tiene idea de quiénes son los clientes ni cuál es la "historia" de la comida. Para ellos, cada pedido es solo una solicitud genérica.

El Problema: La "Costura" Donde Todo Falla
Debido a que estos dos grupos no comparten información, el restaurante toma decisiones ineficientes.

  • Ejemplo: El Jefe de Cocina sabe que la Mesa 4 siempre pide el mismo entrante antes de su plato principal. Pero el Personal de Cocina no lo sabe. Así que, cada vez que la Mesa 4 pide, la cocina tiene que empezar a picar cebollas desde cero, incluso aunque lo acabaran de hacer hace cinco minutos para la misma mesa.
  • El artículo llama a esto la "costura". Actualmente, si quieres solucionar esto, tienes que parchear las notas del Jefe de Cocina o el flujo de trabajo de la Cocina con una regla específica y única. Es desordenado y no escala.

La Solución: La "Capa de Ejecución de Agentes" (El Nuevo Gerente de Piso)
Los autores proponen construir una tercera capa justo entre el Chef y la Cocina: un Gerente de Piso.

Este Gerente de Piso tiene un trabajo especial. Escucha al Chef (para conocer los roles e identidades) y vigila la Cocina (para ver los eventos de cocción). Utilizan este conocimiento combinado para tomar decisiones inteligentes usando cuatro herramientas simples:

  1. Observar: "Veo que llega un nuevo pedido del camarero 'Planificador'".
  2. Puntuar: "Basado en la historia, este pedido del 'Planificador' es muy importante y probablemente será seguido por un pedido del 'Codificador'. Dáselo alta prioridad".
  3. Predecir: "Apuesto a que el siguiente pedido será del camarero 'Codificador'. Preparémosle los ingredientes ahora".
  4. Actuar: "Adelante, precalienta la estufa para el 'Codificador' para que no haya retraso".

Este Gerente de Piso actúa como un traductor universal. Cualquier regla nueva (como "sé justo con todas las mesas" o "ahorra energía") puede conectarse a este gerente sin romper al Chef ni a la Cocina.

El Estudio de Caso: "CacheSage" (La Despensa Inteligente)
Para demostrar que esto funciona, los autores construyeron un Gerente de Piso específico llamado CacheSage para manejar la "despensa" (la memoria de la computadora, o caché KV).

  • La Vieja Forma: La cocina tira ingredientes (memoria) basándose en cuánto tiempo ha pasado desde que se usaron. Si el camarero "Planificador" regresa después de un descanso, la cocina tiene que volver a picar todo porque los ingredientes fueron tirados.
  • La Forma CacheSage: El Gerente de Piso aprende los patrones. Nota que "Planificador" casi siempre lleva a "Codificador".
    • Cuando el "Planificador" termina, el Gerente de Piso dice: "Predigo que 'Codificador' es el siguiente".
    • Mantienen los ingredientes del "Planificador" a salvo (para que no sean tirados) e incluso comienzan a preparar los ingredientes del "Codificador" antes de que llegue el pedido.

Los Resultados
Cuando probaron esto en cinco escenarios de "restaurante" del mundo real diferentes (tareas complejas de IA):

  • Menos Desperdicio: Mantuvieron los ingredientes correctos en la despensa entre un 13% y un 37% más a menudo que antes.
  • Servicio Más Rápido: Los clientes recibieron su comida entre un 12% y un 29% más rápido porque la cocina no tuvo que empezar desde cero.
  • Más Clientes: El restaurante pudo atender entre un 6% y un 14% más de mesas por hora.

En Resumen
El artículo argumenta que para hacer que los agentes de IA funcionen de manera eficiente, no podemos simplemente ajustar la capa superior (la lógica) o la capa inferior (el hardware). Necesitamos un "gerente intermedio" dedicado que comprenda tanto la identidad de los agentes como los eventos del motor, utilizando un conjunto simple de cuatro reglas para hacer que todo el sistema sea más inteligente y rápido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →