HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization
HeraSys es un sistema de servicio de LLM que optimiza el rendimiento de extremo a extremo de flujos de trabajo multitenant concurrentes mediante la eliminación de la redundancia computacional entre flujos de trabajo a través de la fusión estructural de nodos y empleando una política de programación conjunta sensible a la carga para reducir significativamente la latencia de cola mientras aumenta el rendimiento.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina una cocina bulliciosa donde un equipo de chefs intenta cocinar cientos de platos complejos a la vez. En el mundo de la Inteligencia Artificial, estos "platos" son tareas realizadas por los Modelos de Lenguaje Extensos (LLM, por sus siglas en inglés)—los cerebros informáticos súper inteligentes que escriben historias, responden preguntas y resuelven problemas. Usualmente, cuando le pides algo a una IA, se trata como un pedido único y aislado. Pero en el mundo real, las aplicaciones se están convirtiendo en banquetes elaborados: un solo pedido puede implicar buscar información, consultar una base de datos y luego escribir un resumen, todo de una sola vez. Estos se llaman "flujos de trabajo" (workflows).
El problema es que cuando muchas personas piden estos banquetes complejos al mismo tiempo, la cocina se vuelve caótica. Si dos clientes piden que se pique el mismo ingrediente, la cocina podría picarlo dos veces, desperdiciando tiempo y energía. Peor aún, si un cliente pide un estofado masivo y de cocción lenta, los chefs podrían quedarse estancados en él, dejando a todos los demás esperando a que se sirvan sus ensaladas rápidas. Este es el desafío de "servir" la IA: ¿cómo gestionas una inundación de pedidos complejos y superpuestos sin que el sistema se detenga o deje a algunas personas esperando para siempre?
Aquí es donde entra en escena un nuevo sistema llamado HeraSys. Piensa en HeraSys como un revolucionario gerente de cocina que no solo mira un pedido a la vez, sino que observa todo el suelo de la cocina para ver cómo los diferentes pedidos pueden ayudarse entre sí. En lugar de tratar cada solicitud como una isla separada, HeraSys busca superposiciones. Si dos clientes diferentes necesitan que se analice el mismo documento o se use la misma herramienta, HeraSys dice: "¡Oye, hagamos eso una sola vez y compartamos el resultado!". También actúa como un policía de tráfico, asegurándose de que los pedidos rápidos y sencillos no se queden atrapados detrás de los pesados y lentos, y que los lentos no se queden sin atención.
Los investigadores detrás de HeraSys construyeron un sistema que descompone estas tareas complejas de IA en piezas diminutas y de grano fino. Descubrieron que, al fusionar pasos duplicados y programar inteligentemente quién recibe los recursos de la cocina (como potentes chips informáticos), podían hacer que todo el sistema fuera mucho más rápido. En sus pruebas, demostraron que HeraSys podía reducir el tiempo que tardan en completarse las solicitudes más lentas hasta en 2.17 veces (lo que significa que eran más del doble de rápidas) y aumentó el número total de tareas que el sistema puede manejar hasta en 1.85 veces en comparación con los mejores sistemas existentes.
El artículo argumenta en contra de la vieja forma de hacer las cosas, donde los sistemas tratan cada solicitud como un trabajo independiente y aislado. Demuestran que este "aislamiento" crea desperdicio y cuellos de botella innecesarios. En su lugar, proponen un enfoque colaborativo donde el sistema busca activamente el trabajo compartido. También argumentan en contra de reglas de programación simples como "el primero en llegar es el primero en ser atendido", que pueden causar que las tareas largas bloqueen a todos los demás, o "el trabajo más corto primero", que puede hacer que las tareas largas esperen para siempre. HeraSys sugiere una estrategia equilibrada y "consciente de la carga" que reserva algunos recursos para las tareas pesadas mientras prioriza las rápidas, asegurando la equidad y la velocidad para todos.
Los resultados, medidos a través de extensos experimentos en hardware real, sugieren que este enfoque colaborativo y de grano fino es un paso significativo hacia adelante. Al fusionar pasos redundantes y ajustar dinámicamente cómo se agrupan y ejecutan las tareas, HeraSys logra mantener bajo el tiempo de espera promedio mientras evita la "cola" de retrasos lentos y frustrantes que suelen afectar a los sistemas de IA complejos. Es un poco como darse cuenta de que, si organizas a un grupo de amigos para limpiar una casa, no deberías simplemente asignar a cada persona una habitación; deberías notar que dos personas están aspirando el mismo pasillo y hacer que trabajen juntas, mientras te aseguras de que la persona que lava las ventanas no se quede esperando a que termine la aspiradora.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.