Provisioning to Runtime Optimization of a +100 MW AI Cluster
Este documento presenta el primer relato integral de la gestión de energía para un centro de datos de IA hiperescalar, detallando el proceso desde la planificación inicial de energía para aceleradores de próxima generación hasta la optimización en tiempo de ejecución de una instalación de 150 MW que alberga 83.000 GPUs GB200.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando construir el superordenador más grande y potente del mundo para resolver los problemas más difíciles en la Inteligencia Artificial. Has comprado miles de los chips informáticos más rápidos (GPUs) que el dinero puede comprar. Pero hay un problema: no tienes suficiente electricidad para hacerlos funcionar todos a máxima velocidad.
De hecho, el artículo argumenta que quedarse sin energía es ahora un problema mayor que quedarse sin chips informáticos. Es como tener una flota de 100 coches de carreras pero solo suficiente gasolina para llenar la mitad de ellos.
Este artículo describe cómo Meta (la empresa detrás de Facebook) resolvió este problema para un centro de datos masivo de 150 megavatios. No simplemente conectaron todo y esperaron lo mejor; trataron la electricidad como un recurso precioso y limitado que necesitaba ser gestionado en tres etapas distintas.
Aquí está la historia de cómo lo hicieron, utilizando analogías simples.
Las Tres Etapas de la Gestión de Energía
Los autores dividen el proceso en tres fases: Planificación, Verificación y Ejecución.
Fase 1: Planificación (La fase de "Presupuesto")
Antes de que los ordenadores siquiera llegaran, el equipo tuvo que calcular cuántos podían ajustar a su presupuesto fijo de electricidad.
- El Viejo Método: Por lo general, los ingenieros miran la "velocidad máxima" de un chip (su Potencia de Diseño Térmico, o TDP) y asumen que eso es lo que siempre consumirá. Si un chip está clasificado para 1.200 vatios, planifican para 1.200 vatios.
- El Método de Meta: Se dieron cuenta de que si forzaban a cada chip a funcionar a su máximo absoluto, solo podrían colocar unos pocos chips en el edificio. En su lugar, se preguntaron: "¿Y si hacemos funcionar todos los chips ligeramente más lento?"
- La Analogía: Imagina un buffet con una cantidad fija de comida.
- Estrategia A: Darle a todos una comida masiva de 10 platos. Solo puedes alimentar a 50 personas.
- Estrategia B: Darle a todos una comida ligeramente más pequeña de 8 platos. Ahora puedes alimentar a 60 personas.
- El Resultado: Aunque cada persona recibió ligeramente menos comida, la cantidad total de comida consumida por el grupo es mayor, y se alimenta a más personas.
- El Descubrimiento: Encontraron que al reducir el límite de potencia de cada GPU de 1.200 vatios a aproximadamente 1.000 vatios, podían colocar muchas más GPUs en el centro de datos. La ligera caída en la velocidad para cada chip individual fue más que compensada por tener más chips trabajando juntos. Esto les dio un impulso del 10% en la potencia informática total.
Fase 2: Verificación (La fase de "Realidad")
Una vez instalados los ordenadores, el equipo se dio cuenta de que sus planes no coincidían perfectamente con la realidad.
- El Problema: Los medidores de energía internos de los ordenadores (PSU) estaban mintiendo. Estaban siendo excesivamente cautelosos, informando de que las máquinas estaban consumiendo más energía de la que realmente consumían. Es como un indicador de combustible de un coche que siempre dice "Vacío" cuando aún tienes un cuarto de tanque.
- La Solución: Compararon los medidores internos con los sensores de energía principales del edificio (que son muy precisos). Descubrieron que si ignoraban las lecturas del "peor caso" y miraban el "promedio" de uso (específicamente el percentil 70), podían confiar más en los números.
- El Resultado: Como dejaron de confiar en los medidores internos excesivamente cautelosos, se dieron cuenta de que tenían un poco de energía "oculta" que no estaban utilizando. Subieron la potencia ligeramente (de 1.000W a 1.020W), exprimiendo otro impulso del 2% en el rendimiento.
Fase 3: Ejecución (La fase de "Policía de Tráfico")
Ahora el centro de datos está ejecutando trabajos de entrenamiento de IA en vivo. El problema es que las cargas de trabajo de IA son "síncronas", lo que significa que todos los chips tienen que esperar a los demás. Si un chip es lento, todo el trabajo se ralentiza.
- El Problema: A veces, la red eléctrica recibe un pico repentino. Si el sistema detecta un pico, la vieja forma era detener inmediatamente o ralentizar un chip específico para ahorrar energía. Pero en una carrera sincronizada, si ralentizas a un corredor, todo el equipo pierde.
- La Solución (Dimmer): Construyeron un sistema inteligente llamado "Dimmer". En lugar de castigar a un chip, reduce suavemente la potencia de cada chip en el trabajo en una cantidad pequeña e igual.
- La Analogía: Imagina un grupo de corredores en una carrera de relevos. Si la pista se vuelve resbaladiza (límite de energía), en lugar de hacer tropezar a un corredor (lo que detendría a todo el equipo), el entrenador le dice a todos que corran solo un poquito más lento. El equipo se mantiene unido y la carrera continúa sin detenerse.
- El Resultado: Esto evita que el sistema se bloquee y les permite utilizar los últimos pocos por cientos de energía "varada" que antes se desperdiciaba. Esto añadió otro impulso de ~2%.
Otras Ideas Clave
- El Efecto "Cuello de Botella": El centro de datos es una mezcla de diferentes hardware (ordenadores, refrigeración, conmutadores de red). A veces, el límite de energía no lo establecen los ordenadores, sino el sistema de refrigeración o los cables de red. Si una parte de la cadena es débil, limita a toda la cadena.
- Oscilaciones de Energía: Cuando los chips de IA trabajan, a veces se detienen por una fracción de segundo para hablar entre sí, lo que hace que el consumo de energía baje y luego suba de golpe. El equipo creó un "suavizador de software" que llena estos pequeños huecos con trabajo ficticio, manteniendo el consumo de energía estable como un río tranquilo en lugar de un mar agitado. Esto protege la red eléctrica del edificio de golpes.
- Lo Nuevo es Mejor: Compararon sus nuevos chips (GB200) con los anteriores (H100). Los nuevos chips son tan eficientes que, aunque consumen menos energía por chip, el nuevo clúster es casi dos veces más rápido que lo que habría sido el antiguo en el mismo edificio.
La Conclusión
Al tratar la electricidad como un recurso flexible en lugar de un límite fijo, y gestionándola cuidadosamente desde la etapa de planificación hasta las operaciones diarias, Meta logró obtener aproximadamente un 14% más de potencia informática de su centro de datos de 150 megavatios sin construir una sola pared nueva ni comprar un solo cable nuevo.
No encontraron una batería mágica; simplemente aprendieron a usar la electricidad que ya tenían de manera mucho más sabia.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.