← Últimos artigos
🤖 machine learning

Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding

Este artigo apresenta um framework de decodificação especulativa integrado ao sistema no NeMo-RL que atua como um primitivo de aceleração sem perdas para rollouts de pós-treinamento em RL, alcançando uma melhoria de 1,8x no throughput na escala de 8B e projetando até uma aceleração de 2,5x no treinamento de ponta a ponta na escala de 235B quando combinado com execução assíncrona.

Autores originais: Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Putterman, Benjamin Chislett, Maor Ashkenazi, Joseph Guman, Gerald Shen, Tugrul Ko
Publicado 2026-04-30
📖 4 min de leitura☕ Leitura rápida

Autores originais: Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Putterman, Benjamin Chislett, Maor Ashkenazi, Joseph Guman, Gerald Shen, Tugrul Konuk, Ashwath Aithal, Ritika Borkar, Ran Zilberstein, Bita Rouhani

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está treinando um aluno brilhante, mas de raciocínio lento (o modelo de IA) para resolver problemas matemáticos complexos. Para ensiná-lo, você precisa fazer uma pergunta, esperar que ele escreva todo o seu processo de pensamento passo a passo e, em seguida, verificar se ele acertou.

O problema é que a parte de "verificar" é rápida, mas a parte de "escrever" é incrivelmente lenta. O aluno escreve uma palavra, pausa para pensar, escreve a próxima palavra, pausa novamente, e assim por diante. Essa escrita lenta, palavra por palavra, é o maior gargalo no treinamento desses modelos de IA.

Este artigo apresenta um truque inteligente chamado Decodificação Especulativa para acelerar esse processo de escrita sem alterar como o aluno pensa ou o que ele aprende.

A Ideia Central: O "Assistente de Rascunho"

Pense no modelo de IA como um chef de cozinha mestre, muito preciso, mas lento. Para acelerar as coisas, você contrata um sous-chef rápido e energético (o "modelo de rascunho").

  1. O Jeito Antigo (Autoregressivo): O chef mestre escreve uma palavra, para, pensa, escreve a próxima, para, pensa. Leva uma eternidade.
  2. O Jeito Novo (Decodificação Especulativa): O sous-chef rapidamente adivinha as próximas 3 ou 4 palavras que o chef poderia escrever. O sous-chef as escreve rapidamente.
  3. A Verificação: O chef mestre então lança um olhar rápido nas anotações do sous-chef.
    • Se as anotações estiverem corretas, o chef diz: "Ótimo!" e aceita todas as 4 palavras de uma só vez.
    • Se as anotações estiverem erradas, o chef as risca, escreve a palavra correta e recomeça.

A Magia: Como o sous-chef é rápido, o chef consegue aceitar várias palavras de uma só vez na maioria das vezes. O resultado final é exatamente o mesmo que se o chef tivesse escrito sozinho, mas acontece muito mais rápido.

O Que o Artigo Realmente Fez

Os pesquisadores integraram esse sistema em uma estrutura de treinamento real chamada NeMo-RL. Eles não o testaram apenas em tarefas simples; testaram em tarefas de "raciocínio" onde a IA precisa pensar bastante (como resolver problemas matemáticos).

Aqui estão suas principais descobertas, traduzidas para termos do cotidiano:

  • Funciona Sem Trapacear: Alguns métodos de aceleração tentam cortar cantos (como usar matemática de menor qualidade ou pular etapas), o que pode arruinar o aprendizado do aluno. Este método é "sem perdas". Ele garante que a IA aprenda exatamente da mesma forma que aprenderia sem o assistente, apenas mais rápido.
  • O Aumento de Velocidade:
    • Em um modelo de tamanho médio (8 bilhões de parâmetros), eles viram o processo de escrita acelerar em 1,5 a 1,8 vezes.
    • Como a escrita consome cerca de 70% do tempo total de treinamento, todo o processo de treinamento ficou cerca de 1,35 a 1,4 vezes mais rápido.
  • O "Rascunho" Importa: O sous-chef precisa ser um bom adivinhador.
    • Se você treinar o sous-chef nos exatos mesmos tipos de problemas matemáticos que o aluno está aprendendo, o aumento de velocidade é enorme.
    • Se você usar um sous-chef genérico que só conhece conversas gerais, o aumento de velocidade é menor.
    • Não adivinhe muito à frente: Se o sous-chef tentar adivinhar 7 palavras de uma vez, ele comete muitos erros, e o chef mestre gasta muito tempo corrigindo-os. Adivinhar 3 palavras de cada vez foi o "ponto ideal".
  • O Futuro (Modelos Grandes): Eles usaram um simulador de computador superpreciso para prever o que acontece com modelos massivos (235 bilhões de parâmetros) e milhares de computadores trabalhando juntos.
    • Eles preveem que, para esses modelos gigantes, essa técnica poderia tornar todo o processo de treinamento 2,5 vezes mais rápido.

Por Que Isso Importa

No mundo da IA, tempo é dinheiro. Se você pode treinar um modelo 2,5 vezes mais rápido, você pode obter um modelo mais inteligente no mesmo período de tempo, ou obter o mesmo modelo por uma fração do custo.

O artigo prova que você não precisa alterar o "cérebro" da IA ou as regras do jogo para obter essa velocidade. Você só precisa adicionar um assistente inteligente e rápido para ajudar a escrever os rascunhos e deixar o modelo principal fazer a verificação final. É uma atualização de sistema que faz todo o pipeline de treinamento funcionar de forma mais suave sem quebrar nada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →