← Últimos artículos
🤖 machine learning

BlendServe: Optimizing Offline Inference for Auto-regressive Large Models with Resource-aware Batching

BlendServe es un sistema que optimiza la inferencia de modelos grandes autorregresivos fuera de línea mediante la introducción de un árbol de prefijos consciente de los recursos para combinar eficazmente el solapamiento de recursos y el uso compartido de prefijos, logrando así una mejora de hasta 1.44x en el rendimiento sobre estándares de la industria como vLLM y SGLang.

Autores originales: Yilong Zhao, Shuo Yang, Kan Zhu, Lianmin Zheng, Baris Kasikci, Yang Zhou, Jiarong Xing, Ion Stoica

Publicado 2026-06-09
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yilong Zhao, Shuo Yang, Kan Zhu, Lianmin Zheng, Baris Kasikci, Yang Zhou, Jiarong Xing, Ion Stoica

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges una fábrica masiva y de alta velocidad que construye robots personalizados (estos son los modelos de IA). Tu trabajo es procesar miles de pedidos (solicitudes) para construir estos robots.

En el pasado, si querías construir robots rápidamente, tenías que elegir entre dos tipos de pedidos:

  1. Los pedidos de "Esfuerzo Pesado": Requieren mucha fuerza (cómputo) pero muy poco espacio de almacenamiento. Piensa en ellos como pedidos para construir un robot con un brazo súper fuerte pero sin compartimentos de almacenamiento.
  2. Los pedidos de "Almacenamiento Pesado": Requieren muy poca fuerza pero una cantidad masiva de espacio de almacenamiento. Piensa en ellos como pedidos para construir un robot con un brazo diminuto pero con un almacén gigante en su interior.

El Problema: El cuello de botella en la planta de la fábrica

Tu fábrica tiene dos recursos principales:

  • Máquinas de Fuerza (Cómputo): Son rápidas pero se cansan si tienen que esperar alrededor.
  • Estantes de Almacenamiento (Memoria): Son enormes pero se obstruyen si no se usan de manera eficiente.

La Forma Antigua (Loteo Naive):
Anteriormente, las fábricas simplemente tomaban los pedidos en el orden en que llegaban. Si tenías una línea de 10 pedidos de "Esfuerzo Pesado", tus Máquinas de Fuerza trabajaban a destajo, pero tus Estantes de Almacenamiento se quedaban vacíos e inútiles. Luego, si los siguientes 10 pedidos eran de "Almacenamiento Pesado", tus Estantes de Almacenamiento estaban saturados, pero tus Máquinas de Fuerza estaban inactivas, moviendo los dedos sin hacer nada.

Esto es como intentar llenar un camión solo con ladrillos, y luego solo con plumas. No puedes meter tanto como podrías si los mezclaras. El camión (tu chip de computadora) termina medio vacío la mitad del tiempo.

El Nuevo Problema:
Hubo otro truco que las fábricas usaban llamado "Compartición de Prefijos" (Prefix Sharing). Imagina que muchos pedidos comienzan con el mismo primer paso exacto (como "Pintar el robot de azul"). Si haces estos pedidos uno tras otro, solo pintas de azul una vez y reutilizas ese resultado. Esto ahorra muchísimo tiempo.

Sin embargo, el "mejor" orden para compartir (hacer todos los pedidos de "Pintar de Azul" juntos) a menudo significaba agrupar todos los pedidos de "Esfuerzo Pesado" juntos y todos los de "Almacenamiento Pesado" juntos. Esto arruinaba la estrategia de "mezcla", dejando tus máquinas a medio vacío de nuevo.

La Solución: BlendServe

Los autores de este artículo crearon un sistema llamado BlendServe. Piensa en él como un gerente de fábrica superinteligente que puede reorganizar el orden del trabajo para obtener lo mejor de ambos mundos.

1. El "Árbol Consciente de los Recursos":
En lugar de una simple línea, BlendServe organiza todos los pedidos en un gigantesco árbol genealógico.

  • Ramas: Agrupan pedidos que comparten los mismos pasos iniciales (Compartición de Prefijo).
  • Etiquetas: Cada rama está etiquetada con cuánto "Esfuerzo" vs. "Almacenamiento" necesita.

2. El Algoritmo de "Escaneo Dual":
Este es el trucción mágico. El gerente no solo camina por la línea. Se para en ambos extremos del árbol al mismo tiempo:

  • Toma un pedido de "Esfuerzo Pesado" del lado izquierdo.
  • Toma un pedido de "Almacenamiento Pesado" del lado derecho.
  • Los pone juntos en el mismo lote.

El Resultado:
Ahora, cuando la fábrica se pone en marcha, las Máquinas de Fuerza están trabajando duro mientras los Estantes de Almacenamiento se están llenando. Se están ayudando mutuamente. El camión está completamente cargado con una mezcla perfecta de ladrillos y plumas.

Por qué esto importa

El artículo afirma que, al realizar esta mezcla inteligente mientras mantienen los "pasos compartidos" juntos, BlendServe puede:

  • Acelerar la fábrica hasta en un 44% en comparación con los sistemas actuales más avanzados (como vLLM y SGLang).
  • Lograr el 90% de la velocidad teórica "perfecta". Imagina que la velocidad perfecta es de 100 mph; BlendServe te lleva a 90 mph, mientras que otros sistemas podrían llegar solo a 60 o 70 mph.

El Problema (y cómo lo resolvieron)

El artículo admite que predecir exactamente cuánto tiempo tomará un pedido de "Almacenamiento Pesado" es difícil porque la IA genera texto palabra por palabra. Para solucionar esto, BlendServe realiza una rápida "prueba de funcionamiento" en una pequeña muestra de los pedidos para adivinar cuánto tardarán, y luego utiliza esas suposiciones para construir la mezcla perfecta. Incluso si la suposición es ligeramente errónea, el sistema es lo suficientemente robusto como para ajustarse sobre la marcha.

En resumen, BlendServe es un programador inteligente que evita que tu computadora se quede inactiva. Mezcla diferentes tipos de tareas de IA para que el cerebro y la memoria de tu computadora trabajen en perfecta armonía, haciendo que el procesamiento de IA fuera de línea sea mucho más rápido y económico.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →