← Últimos artigos
🤖 machine learning

Heterogeneous Parallelism for Multimodal Large Language Model Training

Este artigo apresenta um framework de paralelismo heterogêneo para o treinamento de modelos de linguagem grandes multimodais que permite layouts de paralelismo de tensores independentes para diferentes módulos dentro de um único grafo, resolvendo incompatibilidades de escalabilidade específicas de cada modalidade e alcançando até 49,3% mais TFLOPS/GPU por meio de execução co-localizada otimizada.

Autores originais: Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

Publicado 2026-05-28
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando treinar um robô superinteligente que pode ver, ouvir e ler. Para fazer isso, você precisa combinar dois tipos muito diferentes de "cérebros":

  1. O Codificador (Encoder): Esta parte é como uma câmera ou microfone especializado. É excelente no processamento de imagens ou sons, mas funciona melhor com um bloco de dados específico e de tamanho fixo.
  2. O LLM (Modelo de Linguagem de Grande Escala): Este é o cérebro gigante de linguagem. É enorme, precisa ler quantidades massivas de texto de uma só vez e requer uma maneira muito diferente de organizar seu trabalho para ser eficiente.

O Problema: O Terno "Tamanho Único"

No passado, ao treinar esses robôs combinados, os engenheiros forçavam ambos os cérebros a usar exatamente o mesmo "uniforme" (uma maneira específica de dividir o trabalho entre muitos computadores).

Pense nisso como uma equipe de construção onde os encanadores e os eletricistas são forçados a trabalhar na mesma formação exata.

  • Os eletricistas (o LLM) precisam ficar em um círculo enorme para passar fios rapidamente (uma técnica chamada Paralelismo de Tensores).
  • Os encanadores (o Codificador) só precisam trabalhar em pequenos pares porque seus canos são curtos e fixos.

Se você forçar os encanadores a ficarem no círculo enorme do eletricista, eles passam todo o tempo esperando que os eletricistas terminem de passar os fios. Eles não estão fazendo nenhuma encanação; apenas estão parados. Isso atrasa todo o projeto.

A Solução: "Paralelismo Heterogêneo"

Este artigo apresenta uma nova maneira de organizar a equipe de construção chamada Paralelismo Heterogêneo. Em vez de forçar todos a usar um único uniforme, permite que cada equipe use o uniforme que melhor se adapta a eles, mesmo que estejam trabalhando no mesmo prédio.

O sistema permite que a equipe do "Codificador" e a equipe do "LLM":

  1. Dividam seu trabalho de forma diferente: O LLM pode usar um círculo massivo de computadores, enquanto o Codificador usa um par apertado.
  2. Escolham seus próprios lugares: Podem sentar nos mesmos computadores (compartilhando o hardware) ou em computadores completamente diferentes, dependendo do que economiza mais espaço e tempo.

O Truque de Mágica: O "Tradutor"

A parte mais difícil de permitir que duas equipes trabalhem de forma diferente é passar informações entre elas. Se o Codificador terminar seu trabalho no formato de "pequeno par", mas o LLM esperar no formato de "círculo enorme", os dados ficam embaralhados.

Os autores construíram um Tradutor especial (chamado de Comunicador de Fronteira).

  • Passagem Forward (A Entrega): Quando o Codificador termina, o Tradutor remodela instantaneamente os dados no formato que o LLM precisa. É como um mensageiro que pega um pequeno pacote, o reembala em uma caixa grande e o entrega à equipe do LLM.
  • Passagem Backward (O Retorno): Quando o LLM aprende com seus erros, ele envia feedback de volta. O Tradutor pega esse feedback, desmonta-o de volta para o pequeno formato que o Codificador entende e o devolve.

Isso garante que, mesmo que as equipes estejam trabalhando de maneiras diferentes, elas nunca percam o controle dos dados ou do processo de aprendizado.

Duas Maneiras de Sentar: "Colocados" vs. "Não Colocados"

O artigo testa duas maneiras de organizar essas equipes:

  1. Colocados (Compartilhando a Mesma Mesa):

    • O Cenário: O Codificador e o LLM cabem no mesmo conjunto de computadores.
    • O Benefício: Em vez de forçar o Codificador a sentar no círculo ineficiente do LLM, o sistema permite que o Codificador sente em seus próprios pares eficientes nos mesmos computadores.
    • O Resultado: É como ter um chef e um sous-chef na mesma cozinha. O chef corta legumes (Codificador) enquanto o sous-chef mexe a sopa (LLM). Eles não atrapalham um ao outro, e a cozinha funciona até 49% mais rápido porque ninguém fica esperando.
  2. Não Colocados (Salas Separadas):

    • O Cenário: O Codificador é tão grande (ou o LLM é tão faminto de memória) que não podem compartilhar os mesmos computadores sem ficar sem espaço.
    • O Benefício: O sistema move o Codificador para uma sala separada (um conjunto separado de computadores) inteiramente. Isso libera a sala do LLM para ser organizada perfeitamente para suas próprias necessidades, sem o Codificador bagunçar o espaço.
    • O Resultado: É como mover a maquinaria pesada para um armazém separado para que o escritório principal possa ser organizado para máxima eficiência. Isso melhorou a velocidade total de processamento de palavras em até 13%.

A Prova

Os autores não apenas adivinharam que isso funcionaria; eles testaram.

  • Eles provaram que o "Tradutor" não atrapalha a matemática. O robô aprende na mesma velocidade e precisão de antes, apenas mais rápido.
  • Eles mostraram que, para Codificadores pequenos, compartilhar os computadores (Colocados) é o melhor.
  • Eles mostraram que, para Codificadores massivos, movê-los para uma sala separada (Não Colocados) é o melhor.

Resumo

Este artigo trata de parar a abordagem de "tamanho único" para treinar IA. Ao permitir que diferentes partes do sistema de IA usem a maneira mais eficiente de trabalhar para seu trabalho específico, e ao construir um tradutor inteligente para passar dados entre elas, o sistema treina muito mais rápido e usa menos poder de computador. É como finalmente deixar os encanadores e eletricistas trabalharem em suas próprias formações naturais, em vez de forçá-los a marchar em passo unido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →