← Últimos artículos
🤖 machine learning

Distributed Training using an Intelligent Network

Este artículo propone un marco de red inteligente para el entrenamiento distribuido a través de redes de área amplia que combina la transmisión multicast y la agregación en línea mediante FPGA con esquemas de sincronización optimizados para superar las restricciones de ancho de banda y latencia, reduciendo así la brecha de rendimiento con el entrenamiento en coubicación.

Autores originales: Nihar Shah, Ben Blier

Publicado 2026-08-28✓ Author reviewed
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nihar Shah, Ben Blier

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de inteligencia artificial más potentes del mundo se están volviendo demasiado grandes para caber dentro de un solo edificio. El entrenamiento de estos sistemas requiere miles de computadoras trabajando juntas, pero los límites físicos de potencia y espacio significan que ningún centro de datos puede contenerlos todos ya. En su lugar, los investigadores deben repartir su capacidad de cómputo en múltiples ubicaciones, a veces separadas por océanos. Esto crea un problema difícil: las computadoras necesitan hablar entre sí constantemente para mantenerse sincronizadas, pero enviar cantidades masivas de datos a través de largas distancias es lento y costoso. Las conexiones entre estos sitios distantes son a menudo estrechas e irregulares, lo que provoca que las computadoras permanezcan inactivas mientras esperan a que llegue la información. Si las computadoras no pueden compartir su progreso rápidamente, todo el proceso de entrenamiento se ralentiza, desperdiciando tiempo y energía valiosos.

Un equipo de investigadores de la Fundación DoubleZero ha propuesto una nueva forma de resolver este cuello de botella convirtiendo a la propia red en un ayudante activo. En lugar de tratar la conexión a internet como una tubería pasiva que simplemente transporta datos, sugieren utilizar hardware especializado dentro de la red para gestionar el flujo de información. Su enfoque combina dos tecnologías existentes de una manera novedosa para conexiones de área amplia. Primero, utilizan un método llamado multicast, que permite que una sola computadora envíe un mensaje que la red copia y entrega automáticamente a muchos destinos diferentes a la vez, en lugar de enviar copias separadas para cada uno. Segundo, colocan chips programables, conocidos como FPGAs, en el borde de la red cerca de cada clúster de computadoras. Estos chips actúan como agregadores inteligentes, reuniendo flujos entrantes de datos de muchas fuentes diferentes y fusionándolos en un único flujo limpio antes de que llegue a las computadoras locales. Al realizar el trabajo pesado de copiar y combinar datos dentro de la red, el sistema reduce la carga en las conexiones limitadas entre los sitios distantes.

Para que este sistema funcione de manera efectiva, los investigadores también desarrollaron un nuevo marco matemático para decidir exactamente cómo y cuándo deben hablar las computadoras entre sí. En una configuración tradicional, cada computadora podría intentar hablar con todas las demás al mismo tiempo, lo que congestionaría la red. El nuevo marco trata a la red como un mapa con carreteras específicas y reglas de tráfico. Calcula la mejor manera de agrupar a las computadoras en pequeños círculos rotativos de comunicación. En cada ronda, un grupo específico de computadoras intercambia información mientras otras esperan, y luego los grupos cambian en la siguiente ronda. El objetivo es encontrar el equilibrio perfecto entre cuánto tiempo esperan las computadoras y cuánta información comparten. Los investigadores probaron esta idea utilizando una simulación basada en una red real y programable que abarca nueve ciudades en tres continentes. Modelaron los tiempos de viaje reales y las velocidades de conexión entre ciudades como Tokio, Nueva York y Londres para ver cómo se comportarían diferentes estrategias de agrupación.

Las simulaciones revelaron que la mejor estrategia depende fuertemente de las capacidades del hardware. Cuando los chips de la red tenían muy poca memoria, el enfoque más eficiente era formar grupos pequeños de tres computadoras que rotaban a través de diferentes combinaciones. Esto permitía que los datos fluyeran rápidamente sin sobrepasar la capacidad del sistema para retener información. Sin embargo, cuando los investigadores dotaron a los chips con más memoria, la estrategia óptima cambió por completo. Con suficiente memoria para manejar los retrasos del viaje de larga distancia, el sistema podía soportar una estrategia donde cada computadora hablaba con todas las demás simultáneamente. Este enfoque de "todos contra todos" (all-to-all), que anteriormente era imposible a través de largas distancias, se convirtió en el método más rápido porque permitía que la información se propagara a todos en el menor tiempo posible. El estudio demostró que, al combinar estas tecnologías de red inteligentes con un programa que se adapta a los límites del hardware, es posible cerrar la brecha entre el entrenamiento de computadoras distribuidas por todo el mundo y aquellas que están situadas una al lado de la otra en la misma sala.

Los investigadores enfatizan que su trabajo es actualmente una simulación basada en una red viva que aún se está construyendo. Aunque la red DoubleZero existe y transporta tráfico, aún no cuenta con suficientes clústeres de computadoras conectados para entrenar un modelo masivo en una prueba del mundo real. Los resultados presentados son una prueba de concepto, demostrando que las ganancias teóricas son reales y que la combinación adecuada de hardware de red y lógica de programación puede superar las barreras tradicionales de la distancia. Los hallazgos sugieren que el futuro del entrenamiento de modelos gigantes de inteligencia artificial no dependerá solo de computadoras más rápidas, sino de redes más inteligentes que participen activamente en el proceso de aprendizaje, convirtiendo las vastas distancias entre los centros de datos de una debilidad en una parte manejable del sistema.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →