← Últimos artículos
🤖 machine learning

DASH: Faster Shampoo via Batched Block Preconditioning and Efficient Inverse-Root Solvers

Este artículo presenta DASH, una implementación significativamente más rápida del optimizador Distributed Shampoo que aprovecha el apilamiento de tensores 3D para mejorar la utilización de la GPU y novedosos resolvedores de raíz inversa (aproximaciones de Newton-DB y Chebyshev) para lograr hasta un 5.6x de aceleración manteniendo o mejorando la calidad de la convergencia.

Autores originales: Ionut-Vlad Modoranu, Philip Zmushko, Erik Schultheis, Mher Safaryan, Dan Alistarh

Publicado 2026-06-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ionut-Vlad Modoranu, Philip Zmushko, Erik Schultheis, Mher Safaryan, Dan Alistarh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot gigante a hablar un nuevo idioma. Para lograrlo, necesitas un "optimizador": un entrenador inteligente que ajuste el cerebro del robot (sus parámetros) después de cada lección para minimizar los errores.

Durante años, el método más popular ha sido Adam, un método que es rápido pero un poco "perezoso". Solo observa cuánto necesita cambiar cada neurona de forma individual, ignorando cómo las neuronas trabajan juntas en equipo.

Entra en escena Shampoo, un entrenador mucho más inteligente. En lugar de mirar las neuronas una por una, Shampoo observa cómo interactúan en grupos. Esto conduce a un mejor aprendizaje y a modelos que son más fáciles de comprimir después. Sin embargo, hay un inconveniente: Shampoo es increíblemente lento. Es como un entrenador genio que pasa tanto tiempo calculando el movimiento perfecto que el robot apenas tiene práctica.

El artículo presenta DASH (Distributed Accelerated SHampoo), un nuevo sistema que hace que este entrenador genio corra a la velocidad de un velocista sin perder su inteligencia. Así es como lo lograron, usando analogías simples:

1. El truco de "apilar" (Precondicionamiento de bloques por lotes)

El Problema:
Imagina que tienes una biblioteca masiva de libros (los datos) que debe ser organizada. La forma antigua (Distributed Shampoo) era tomar un libro, organizarlo, guardarlo, tomar el siguiente, organizarlo, y así sucesivamente. Incluso si tienes 1,000 trabajadores (GPUs), la mayoría estaba allí parados esperando a que la persona anterior terminara. Esto es ineficiente.

La Solución de DASH:
DASH cambia el flujo de trabajo. En lugar de manejar los libros uno por uno, los apila en torres 3D ordenadas y uniformes. Ahora, los trabajadores pueden agarrar una torre completa y organizar todos los libros dentro de ella al mismo tiempo.

  • La Analogía: Es la diferencia entre un cajero escaneando artículos uno por uno frente a una cinta transportadora que alimenta una máquina que escanea una caja entera de comestibles instantáneamente.
  • El Resultado: Este "apilamiento" permite que los potentes chips gráficos de la computadora (GPUs) trabajen a su máxima capacidad, haciendo que los pasos del optimizador sean hasta 5.6 veces más rápidos.

2. Matemáticas de "atajo" (Solucionadores de raíz cuadrada inversa eficientes)

El Problema:
Para hacer su trabajo, Shampoo tiene que resolver un rompecabezas matemático muy difícil en cada paso: encontrar la "raíz cuadrada inversa" de una matriz gigante. La forma antigua de resolver esto era como intentar encontrar una aguja en un pajar revisando cada brizna de paja una por una (un método llamado Descomposición de Valores Propios). Es preciso, pero dolorosamente lento.

La Solución de DASH:
Los autores introdujeron dos nuevos "atajos" para resolver este rompecabezas:

  • Newton-DB: Un método iterativo inteligente que se acerca a la respuesta con cada intento, como un GPS que recalcula tu ruta mientras conduces.
  • Polinomios de Chebyshev: Una aproximación matemática que adivina la respuesta muy rápidamente.
  • La Analogía: En lugar de caminar por todos los senderos de un laberinto para encontrar la salida (la forma antigua), estos nuevos métodos son como tener un mapa que muestra la dirección general, permitiéndote correr hacia la salida.

3. Calibración con "regla" (Escalamiento de matrices)

El Problema:
Al usar estos atajos, las matemáticas pueden volverse inestables si los números son demasiado grandes o demasiado pequeños. El método antiguo usaba una "regla" (norma de Frobenius) que era demasiado larga, estirando los números y haciendo que los atajos tardaran muchos más pasos en converger. Era como intentar medir una hormiga diminuta con una cinta métrica de 30 metros; la precisión se pierde.

La Solución de DASH:
Los autores se dieron cuenta de que necesitaban una mejor regla. Desarrollaron una técnica llamada Multi-Power-Iteration.

  • La Analogía: En lugar de adivinar la longitud de la hormiga con una cinta métrica gigante, usan un calibrador especializado de alta precisión que se ajusta perfectamente a la hormiga. Esto asegura que las matemáticas converjan rápidamente y no colapsen debido a errores numéricos.

4. Los Resultados

El artículo probó DASH en un modelo de lenguaje grande (Llama con 953 millones de parámetros).

  • Velocidad: DASH completó la parte de "pensamiento" del paso de entrenamiento 5.6 veces más rápido que la versión anterior más avanzada.
  • Calidad: A pesar de ser mucho más rápido, los modelos entrenados con DASH fueron tan buenos, o incluso ligeramente mejores, al aprender. De hecho, el atajo "Newton-DB" produjo modelos con las tasas de error (perplejidad) más bajas de todos los métodos probados.

Resumen

Piensa en Shampoo como un motor de Ferrari que estaba atrapado en el tráfico porque el conductor estaba tomando la ruta escénica. DASH es el mismo motor de Ferrari, pero ahora tiene:

  1. Una autopista más ancha (Apilamiento de bloques) para que pueda conducir más rápido.
  2. Un atajo de GPS (Newton-DB) para evitar los atascos.
  3. Mejores herramientas de navegación (Multi-Power-Iteration) para asegurar que no se pierda.

El resultado es que el optimizador "inteligente" (Shampoo) ya no es demasiado lento para ser usado, convirtiéndolo en una opción práctica para entrenar la próxima generación de modelos de IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →