← Últimos artículos
💬 NLP

Can Model Merging Improve Aggregation in DiLoCo?

Este artículo cierra la brecha entre la fusión de modelos y el aprendizaje distribuido al demostrar que la adaptación de la técnica de fusión Iso-C con el impulso de Nesterov (IsoLoCo) supera significativamente a los métodos DiLoCo existentes en el entrenamiento distribuido de baja comunicación, particularmente a medida que aumenta el número de trabajadores locales.

Autores originales: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

Publicado 2026-07-07
📖 4 min de lectura☕ Lectura para el café

Autores originales: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando entrenar un cerebro de IA gigante y superinteligente. Para hacerlo, necesitas una cantidad masiva de potencia informática. Normalmente, las empresas utilizan un enfoque de "paralelismo de datos": alinean cientos de computadoras una al lado de la otra, todas trabajando exactamente en la misma tarea al mismo tiempo, comunicándose constantemente actualizaciones entre sí. Esto es rápido, pero requiere cables costosos y de alta velocidad que conecten cada una de las computadoras. Si una computadora es lenta o el cable es débil, toda la línea tiene que esperar.

El Problema: El enfoque de las "Islas"
Para ahorrar dinero y utilizar conexiones más débiles, los investigadores desarrollaron un método llamado DiLoCo. Imagina que, en lugar de una sola línea, tienes muchos "islas" de computadoras separadas:

  1. Cada isla entrena su propia versión del cerebro de IA de forma independiente durante un tiempo (digamos, 30 pasos).
  2. No se comunican durante esos 30 pasos.
  3. Después de 30 pasos, envían un resumen de lo que han aprendido (un "pseudo-gradiente") a un núcleo central.
  4. El núcleo promedia estos resúmenes y actualiza el cerebro principal.

El Fallo:
El artículo encontró un fallo en este enfoque de "Islas": a medida que añades más islas (trabajadores) o dejas que entrenen durante más tiempo antes de hablar, la IA empieza a confundirse. Es como un grupo de personas intentando dibujar un cuadro juntas sin hablar: si trabajan demasiado tiempo por su cuenta, empiezan a dibujar cosas diferentes y, cuando intentan combinar su trabajo, el resultado es desastroso. En términos técnicos, las "actualizaciones" de las diferentes islas empiezan a chocar entre sí, degradando el rendimiento de la IA.

La Inspiración: Fusionar Modelos Expertos
Por separado, otro grupo de investigadores trabajaba en la Fusión de Modelos (Model Merging). Imagina que tienes un chef experto que aprendió a cocinar comida italiana y otro que aprendió a cocinar comida japonesa. Quieres un chef que pueda hacer ambas cosas.

  • La forma antigua: Simplemente promediar sus recetas. Esto a menudo falla porque los ingredientes chocan (por ejemplo, mezclar salsa de soja con crema espesa).
  • La nueva forma (Aritmética de Tareas): En lugar de promediar toda la receta, observas la diferencia entre la receta final del experto y la receta base original. Luego, combinas cuidadosamente solo esas diferencias.

El momento de revelación ("Aha!") del artículo fue darse cuenta de que DiLoCo es en realidad lo mismo que la Fusión de Modelos, solo que en un bucle.

  • El "Modelo Base" es el cerebro de la IA de la última vez que todos hablaron.
  • Las "Islas" son los expertos que entrenaron por su cuenta.
  • Las "Actualizaciones" que envían de vuelta son las "diferencias" (o vectores de tarea).

El artículo argumenta que la razón por la que DiLoCo se vuelve desastroso con muchas islas es la misma razón por la que la fusión de recetas se vuelve desastrosa: la Interferencia. Las actualizaciones de las diferentes islas están luchando entre sí.

La Solución: IsoLoCo
Los autores decidieron tomar la "mejor receta" del mundo de la Fusión de Modelos para arreglar DiLoCo. Probaron varias técnicas de fusión y descubrieron que una llamada Iso-C (fusión isotrópica) funcionaba mejor.

Piensa en Iso-C como un "armonizador" para las actualizaciones. Cuando las islas envían sus actualizaciones de vuelta:

  1. El armonizador observa la "forma" de las actualizaciones.
  2. Si una isla está gritando demasiado fuerte en una dirección específica (una dirección matemática específica), el armonizador baja ese volumen para que coincida con el promedio.
  3. Esto evita que una sola isla domine o choque con las demás, creando una actualización combinada más suave y equilibrada.

Tomaron este "armonizador" y le añadieron una característica de "momento" (como un corredor que mantiene su velocidad incluso cuando el camino se vuelve accidentado) para crear un nuevo método que llaman IsoLoCo.

Los Resultados
El artículo probó esto en diferentes tamaños de modelos de IA y con diferentes números de islas (de 1 a 128).

  • El Ganador: IsoLoCo superó consistentemente al método original DiLoCo.
  • La Brecha: Cuantas más islas añadías, mayor era la ventaja de IsoLoCo. Con 128 islas, el método original se volvía bastante desastroso, pero IsoLoCo se mantenía limpio y eficiente.
  • La Velocidad: También crearon un "modo rápido" para IsoLoCo utilizando un atajo matemático (iteraciones de Newton-Schulz) que hizo que el proceso fuera mucho más rápido sin perder calidad.

En Resumen
El artículo demuestra que, al tratar el entrenamiento de IA distribuido como un problema de "fusión de expertos", podemos usar trucos matemáticos avanzados para evitar que las computadoras luchen entre sí. Esto nos permite entrenar modelos de IA masivos a través de muchas computadoras débilmente conectadas sin perder rendimiento, haciendo que el entrenamiento de IA a gran escala sea más barato y escalable.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →