← Últimos artículos
🤖 machine learning

TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference

TokenWeave es un sistema novedoso que logra una superposición eficiente de computación y comunicación para la inferencia distribuida de LLM en tamaños de lote pequeños fusionando la operación RMSNorm con la comunicación AllReduce mediante características especializadas de GPU, reduciendo así la latencia y aumentando el rendimiento incluso cuando el número de tokens por iteración es tan bajo como 1024.

Autores originales: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

Publicado 2026-05-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás dirigiendo una fábrica masiva y de alta velocidad (un Modelo de Lenguaje Grande) que procesa solicitudes de clientes. Para hacer que esta fábrica sea lo suficientemente rápida, has contratado a un equipo de 8 trabajadores expertos (GPUs) para que trabajen juntos. Están conectados por un sistema de cintas transportadoras súper rápidas (NVLink) para que puedan compartir su trabajo instantáneamente.

Sin embargo, hay un problema: Los trabajadores pasan demasiado tiempo esperando para hablar entre sí.

Incluso con las cintas transportadoras súper rápidas, los trabajadores deben detener su construcción real (cálculo) para pasar notas de ida y vuelta (comunicación). En el artículo, los autores descubrieron que, para modelos grandes, este "tiempo de conversación" consume aproximadamente el 20% del tiempo total. Es como un chef que se detiene para llamar a los otros chefs en la cocina solo para preguntar: "¿Tienes la sal?" antes de poder picar la siguiente verdura.

La Vieja Forma: Descomponer las Cosas

Los intentos anteriores de solucionar esto trataron de dividir el trabajo en piezas diminutas. La idea era: "Mientras el Trabajador A pasa una nota al Trabajador B, el Trabajador A puede comenzar a picar la siguiente verdura".

Pero los autores descubrieron que esto no funcionaba bien para pedidos pequeños (que es lo que sucede cuando le haces una pregunta corta a una IA). Dividir un trabajo grande en piezas diminutas en realidad hacía que los trabajadores fueran más lentos porque tenían que detenerse y empezar tantas veces. ¡Es como intentar correr una carrera de relevos donde pasas el testigo cada 10 pies; el tiempo dedicado a correr es menor que el tiempo dedicado a detenerse para entregar el testigo!

La Nueva Solución: TokenWeave

Los autores construyeron un nuevo sistema llamado TokenWeave. Piensa en ello como un gerente inteligente que reorganiza el piso de la fábrica para eliminar el tiempo de espera. Así es como lo hicieron, utilizando tres trucos simples:

1. La "División Inteligente" (La Autopista de Dos Carriles)

En lugar de intentar dividir el trabajo en un millón de piezas diminutas, TokenWeave divide el pedido en solo dos grandes bloques.

  • Bloque A comienza a trabajar en la primera mitad del trabajo.
  • Bloque B comienza a trabajar en la segunda mitad.
  • La Magia: Mientras el Bloque A está ocupado haciendo sus cálculos, el Bloque B está ocupado pasando sus notas. Luego, cambian. El Bloque A pasa notas mientras el Bloque B hace cálculos.
  • Por qué funciona: Los autores descubrieron exactamente cómo dividir el trabajo para que los trabajadores no se queden "atascados" esperando la cinta transportadora. Lo llaman "consciente de las ondas", lo que significa que se aseguran de que los trabajadores siempre estén ocupados, al igual que un sistema de semáforos bien sincronizado que mantiene a los coches en movimiento sin detenerse.

2. El "Núcleo Fusionado" (La Herramienta Todo-en-Uno)

En la vieja fábrica, los trabajadores tenían que hacer dos cosas separadas:

  1. Pasar las notas (Comunicación).
  2. Normalizar los datos (un paso matemático llamado RMSNorm).

Los autores se dieron cuenta de que hacer estos dos pasos por separado era un desperdicio. Es como tener que caminar al armario de suministros para conseguir un martillo, luego caminar de vuelta al banco de trabajo para clavar un clavo, y luego caminar de vuelta al armario para conseguir un destornillador.

  • La Solución: Construyeron una nueva "superherramienta" (un núcleo fusionado) que realiza el paso de notas y el paso matemático al mismo tiempo.
  • El Bonus: Esta superherramienta es tan eficiente que solo necesita una pequeña fracción de la energía de la fábrica (solo 2–8 trabajadores de 132) para funcionar. Esto deja al resto de los trabajadores libres para concentrarse completamente en el trabajo pesado (cálculo).

3. La "Reordenación Inteligente" (Hacerlo en el Orden Correcto)

Por lo general, la fábrica pasa todas las notas primero, luego hace los cálculos. Pero los autores se dieron cuenta de que el paso matemático (RMSNorm) podía hacerse durante el proceso de paso de notas si reorganizaban los pasos.

  • La Analogía: En lugar de esperar a que llegue todo el camión antes de comenzar a descargar, comienzas a descargar la primera caja tan pronto como el camión se acerca. TokenWeave reorganiza los pasos para que las matemáticas ocurran mientras los datos aún se mueven, ahorrando una cantidad masiva de tiempo.

Los Resultados

El artículo probó este nuevo sistema en computadoras potentes (8x GPUs H100) con modelos del mundo real como Llama y Qwen.

  • Velocidad: Descubrieron que TokenWeave hacía que la fábrica fuera 1.28 veces más rápida (una aceleración del 28%) en comparación con los mejores sistemas existentes.
  • Pedidos Pequeños: Incluso para preguntas muy cortas (solo 1,000 palabras), fue 1.2 veces más rápido. Los sistemas anteriores en realidad se volvían más lentos con pedidos pequeños.
  • Rendimiento: La fábrica podía manejar 19% más clientes por hora.
  • La Afirmación "Mágica": En algunos casos, TokenWeave fue tan eficiente que funcionó mejor que una versión teórica de la fábrica que tenía cero comunicación en absoluto. Esto se debe a que su nueva "superherramienta" solucionó el paso matemático tan bien que compensó el tiempo dedicado a hablar.

Resumen

TokenWeave es como un director de orquesta maestro. En lugar de permitir que los músicos se detengan para hablar entre sí (lo que ralentiza la música), les enseña a tocar sus partes mientras el director pasa la partitura simultáneamente. Al dividir el trabajo en solo dos bloques inteligentes y utilizar una nueva herramienta "todo-en-uno", eliminaron el tiempo de espera, haciendo que la inferencia de IA sea significativamente más rápida y eficiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →