← Últimos artículos
🤖 machine learning

Understanding and Improving Communication Performance in Multi-node LLM Inference

Este artículo presenta un estudio de rendimiento de la inferencia de LLM en múltiples nodos que identifica las operaciones all-reduce como un cuello de botella clave e introduce NVRAR, un algoritmo jerárquico all-reduce que utiliza NVSHMEM y que reduce significativamente la latencia y mejora el rendimiento de extremo a extremo para modelos grandes como Llama 3.1 405B en comparación con las implementaciones estándar de NCCL.

Autores originales: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

Publicado 2026-05-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas masivo y complejo. En el mundo de la Inteligencia Artificial, este rompecabezas es un "Modelo de Lenguaje Grande" (LLM): un cerebro informático superinteligente que puede escribir historias, responder preguntas y resolver problemas. A medida que estos cerebros se vuelven más grandes e inteligentes, se vuelven demasiado pesados para que una sola computadora los contenga.

Para resolver esto, los científicos dividen las piezas del rompecabezas entre muchas computadoras (llamadas "nodos") que trabajan juntas. Este artículo trata sobre averiguar cómo hacer que estas computadoras se comuniquen entre sí de manera eficiente para que no pierdan tiempo esperando.

Aquí tienes una explicación sencilla de lo que los investigadores descubrieron y construyeron:

1. El Problema: El Cuello de Botella del "Juego del Teléfono"

Cuando las computadoras trabajan juntas, deben compartir información constantemente.

  • La Configuración: Imagina un equipo de 32 personas (GPUs) intentando resolver el rompecabezas. Están divididas en grupos (nodos). Dentro de un grupo, pueden gritarse entre sí instantáneamente (como usando un walkie-talkie interno superrápido llamado NVLink). Pero para hablar con los otros grupos, deben usar una línea telefónica más lenta y de larga distancia (la red entre nodos).
  • El Problema: Los investigadores descubrieron que cuando las computadoras intentan resolver la parte de "decodificación" del rompecabezas (generando una palabra a la vez), necesitan enviarse mensajes muy pequeños entre sí.
  • La Analogía: Imagina que estás en una carrera de relevos. Si tienes que correr una larga distancia para pasar una nota diminuta al siguiente corredor, y la persona a la que se la pasas es lenta recibiendo notas, pasas la mayor parte de tu tiempo esperando. El artículo descubrió que el software de "línea telefónica" estándar (llamado NCCL) era terrible manejando estas notas pequeñas y frecuentes entre diferentes edificios (nodos). Era como intentar enviar una postal a través de un servicio postal lento cuando necesitabas pasar un apretón de manos secreto instantáneamente.

2. La Comparación: Dos Maneras de Organizar al Equipo

Los investigadores probaron dos formas principales de organizar al equipo:

  • Paralelismo Tensorial (TP): Todos trabajan en la misma parte del rompecabezas al mismo tiempo, pero deben verificar constantemente con todos los demás para asegurarse de que están de acuerdo. Esto es excelente para trozos grandes de trabajo, pero se ve obstaculizado por todas las verificaciones (comunicación).
  • Paralelismo Híbrido (HP): Dividen el rompecabezas en grandes trozos y asignan diferentes trozos a diferentes personas. Esto reduce la necesidad de verificar, pero no es tan eficiente para la parte de generación "palabra por palabra" de la tarea.

El Hallazgo: Para la parte de "palabra por palabra" de la tarea (que es lo que sucede la mayor parte del tiempo), TP suele ser mejor, pero solo si el equipo puede hablar entre sí lo suficientemente rápido. La forma estándar de hablar era demasiado lenta, causando que el equipo se detuviera.

3. La Solución: NVRAR (El "Carril Expreso")

Para arreglar la comunicación lenta, los investigadores construyeron una nueva herramienta llamada NVRAR.

  • Cómo funciona: En lugar de usar el servicio postal estándar y lento, construyeron un "Carril Expreso" personalizado utilizando una tecnología llamada NVSHMEM.
  • La Analogía: Piensa en la vieja forma como enviar una carta que tiene que ser sellada, clasificada y entregada por un camión. NVRAR es como tener un dron dedicado que vuela directamente de una persona a otra, dejando caer la nota y recogiendo una respuesta en el mismo instante.
  • El Truco de la "Duplicación Recursiva": Organizaron la comunicación como un juego de "teléfono" donde todos duplican el número de personas con las que hablan en cada paso. En lugar de que todos hablen con todos uno por uno, se emparejan, se fusionan, se emparejan de nuevo y se fusionan de nuevo. Esto es mucho más rápido para grupos grandes.

4. Los Resultados: Acelerando al Equipo

Cuando conectaron este nuevo "Carril Expreso" (NVRAR) a su sistema:

  • Hablar Más Rápido: Para los mensajes pequeños utilizados en estas tareas de IA, el nuevo sistema fue de 1.9 a 3.6 veces más rápido que el sistema estándar.
  • Mejor Resolución de Rompecabezas: Cuando usaron este nuevo sistema para ejecutar el masivo modelo "Llama 3.1 405B" (un cerebro gigante de IA), el tiempo que tardaba en generar respuestas disminuyó significativamente. En algunos casos, el equipo terminó 1.72 veces más rápido que antes.
  • Prueba del Mundo Real: Probaron esto en tráfico del mundo real (simulando miles de usuarios haciendo preguntas) y descubrieron que el sistema podía manejar más solicitudes por segundo sin ralentizarse.

Resumen

El artículo trata esencialmente sobre darse cuenta de que cuando un enorme equipo de computadoras intenta resolver un rompecabezas de IA, el mayor retraso no es el pensamiento, sino la conversación. La forma estándar de hablar entre diferentes edificios era demasiado lenta para los mensajes pequeños y frecuentes necesarios. Los autores construyeron un sistema de comunicación personalizado y de alta velocidad (NVRAR) que actúa como un carril expreso, permitiendo que el equipo se coordine instantáneamente y resuelva el rompecabezas mucho más rápido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →