← Últimos artigos
💬 NLP

Can Model Merging Improve Aggregation in DiLoCo?

Este artigo preenche a lacuna entre a fusão de modelos e o aprendizado distribuído ao demonstrar que adaptar a técnica de fusão Iso-C com o momento de Nesterov (IsoLoCo) supera significativamente os métodos DiLoCo existentes em treinamento distribuído de baixa comunicação, particularmente à medida que o número de trabalhadores locais aumenta.

Autores originais: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

Publicado 2026-07-07
📖 4 min de leitura☕ Leitura rápida

Autores originais: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando treinar um cérebro de IA gigante e superinteligente. Para fazer isso, você precisa de uma quantidade massiva de poder computacional. Normalmente, as empresas usam uma abordagem de "paralelismo de dados": elas alinham centenas de computadores lado a lado, todos trabalhando exatamente na mesma tarefa ao mesmo tempo, constantemente gritando atualizações uns para os outros. Isso é rápido, mas exige cabos caros e de alta velocidade conectando cada computador. Se um computador for lento ou o cabo for fraco, toda a linha tem que esperar.

O Problema: A Abordagem das "Ilhas"
Para economizar dinheiro e usar conexões mais fracas, pesquisadores desenvolveram um método chamado DiLoCo. Imagine que, em vez de uma única linha, você tem muitas "ilhas" separadas de computadores:

  1. Cada ilha treina sua própria versão do cérebro de IA de forma independente por um tempo (digamos, 30 passos).
  2. Eles não conversam durante esses 30 passos.
  3. Após 30 passos, eles enviam um resumo do que aprenderam (um "pseudo-gradiente") para um hub central.
  4. O hub faz a média desses resumos e atualiza o cérebro principal.

A Falha:
O artigo descobriu uma falha nessa abordagem de "Ilhas". À medida que você adiciona mais ilhas (trabalhadores) ou permite que eles treinem por mais tempo antes de conversar, a IA começa a ficar confusa. É como um grupo de pessoas tentando desenhar um quadro juntas sem conversar: se elas trabalharem muito tempo sozinhas, começam a desenhar coisas diferentes e, quando tentam combinar seus trabalhos, o resultado fica bagunçado. Em termos técnicos, as "atualizações" das diferentes ilhas começam a colidir umas com as outras, degradando o desempenho da IA.

A Inspiração: Mesclando Modelos Especialistas
Separadamente, outro grupo de pesquisadores estava trabalhando em Mesclagem de Modelos (Model Merging). Imagine que você tem um chef especialista que aprendeu a fazer comida italiana e outro que aprendeu a fazer comida japonesa. Você quer um chef que saiba fazer as duas coisas.

  • O Jeito Antigo: Apenas tirar a média de suas receitas. Isso geralmente falha porque os ingredientes colidem (ex: misturar molho de soja com creme de leite).
  • O Jeito Novo (Aritmética de Tarefas): Em vez de tirar a média de toda a receita, você observa a diferença entre a receita final do especialista e a receita base original. Você então combina cuidadosamente apenas essas diferenças.

O momento "Eureca!" do artigo foi perceber que o DiLoCo está, na verdade, fazendo a mesma coisa que a Mesclagem de Modelos, apenas em um ciclo.

  • O "Modelo Base" é o cérebro de IA da última vez que todos conversaram.
  • As "Ilhas" são os especialistas que treinaram por conta própria.
  • As "Atualizações" que eles enviam de volta são as "diferenças" (ou vetores de tarefa).

O artigo argumenta que a razão pela qual o DiLoCo fica bagunçado com muitas ilhas é a mesma razão pela qual a mesclagem de receitas fica bagunçada: Interferência. As atualizações de diferentes ilhas estão lutando entre si.

A Solução: IsoLoCo
Os autores decidiram pegar a "melhor receita" do mundo da Mesclagem de Modelos para consertar o DiLoCo. Eles testaram várias técnicas de mesclagem e descobriram que uma chamada Iso-C (mesclagem isotrópica) funcionou melhor.

Pense no Iso-C como um "harmonizador" para as atualizações. Quando as ilhas enviam suas atualizações de volta:

  1. O harmonizador observa a "forma" das atualizações.
  2. Se uma ilha estiver gritando muito alto em uma direção específica (uma direção matemática específica), o harmonizador abaixa esse volume para corresponder à média.
  3. Isso evita que uma única ilha domine ou colida com as outras, criando uma atualização combinada mais suave e equilibrada.

Eles pegaram esse "harmonizador" e adicionaram um recurso de "momentum" (como um corredor que mantém sua velocidade mesmo quando a estrada fica acidentada) para criar um novo método chamado IsoLoCo.

Os Resultados
O artigo testou isso em diferentes tamanhos de modelos de IA e com diferentes números de ilhas (de 1 a 128).

  • O Vencedor: O IsoLoCo consistentemente superou o método DiLoCo original.
  • A Lacuna: Quanto mais ilhas você adicionava, maior era a vantagem do IsoLoCo. Com 128 ilhas, o método original ficava bastante bagunçado, mas o IsoLoCo permanecia limpo e eficiente.
  • A Velocidade: Eles também criaram um "modo rápido" para o IsoLoCo usando um atalho matemático (iterações de Newton-Schulz) que tornou o processo muito mais rápido sem perder a qualidade.

Em Resumo
O artigo mostra que, ao tratar o treinamento de IA distribuído como um problema de "mesclagem de especialistas", podemos usar truques matemáticos avançados para impedir que os computadores lutem entre si. Isso nos permite treinar modelos de IA massivos através de muitos computadores fracamente conectados sem perder o desempenho, tornando o treinamento de IA em grande escala mais barato e escalável.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →