← Últimos artigos
💬 NLP

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

O artigo apresenta o Nemotron-Cascade 2, um modelo aberto de 30B parâmetros (com 3B ativados) que, graças ao uso de RL em cascata expandido e destilação on-policy multi-domínio, alcança desempenho de nível de medalha de ouro em competições matemáticas e de programação, rivalizando com modelos fronteira muito maiores.

Autores originais: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi
Publicado 2026-03-20
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um gênio muito inteligente, mas que é um pouco desajeitado. Ele sabe resolver problemas de matemática complexos, mas às vezes esquece como escrever um e-mail simples, ou perde a linha quando a conversa fica longa. Além disso, ele é "gordo" (tem muitos parâmetros), o que o torna lento e caro para usar.

O Nemotron-Cascade 2 é a história de como a NVIDIA pegou um modelo de IA de tamanho médio (30 bilhões de "cérebros", mas usando apenas 3 bilhões de cada vez) e o transformou em um campeão olímpico de raciocínio, capaz de ganhar medalhas de ouro em competições de matemática e programação do mundo todo.

Aqui está como eles fizeram isso, usando analogias do dia a dia:

1. O Treinamento em Cascata (A Escola de Especialistas)

Antes, treinar uma IA para fazer tudo ao mesmo tempo era como tentar ensinar um aluno a ser um médico, um advogado e um jogador de xadrez na mesma aula. O aluno ficava confuso e esquecia o que aprendeu antes (o famoso "esquecimento catastrófico").

O Nemotron-Cascade 2 usa uma técnica chamada Treinamento em Cascata.

  • A Analogia: Imagine que o modelo é um estudante universitário. Em vez de tentar aprender tudo de uma vez, ele faz um curso intensivo de cada matéria, uma por vez.
    1. Primeiro, ele estuda apenas Matemática por um mês, até ficar um gênio.
    2. Depois, ele vai para um curso de Programação, mantendo o que aprendeu de matemática.
    3. Em seguida, um curso de Escrita Criativa, e assim por diante.
  • O Segredo: Ao focar em uma coisa de cada vez, ele não esquece o que aprendeu antes. É como se ele tivesse um "diário de bordo" que o impede de apagar os conhecimentos anteriores.

2. O Mestre e o Aprendiz (Distilação On-Policy)

Durante esse treinamento intensivo, às vezes o aluno começa a errar em coisas que ele já sabia (ex: ao aprender programação avançada, ele pode esquecer como somar frações simples).

Para evitar isso, eles usam a Distilação On-Policy.

  • A Analogia: Imagine que, a cada etapa do curso, o aluno tira uma "foto" do seu melhor desempenho até aquele momento. Essa "foto" vira um Mestre.
  • Quando o aluno começa a aprender algo novo e percebe que está ficando ruim no antigo, ele olha para a foto do seu "Mestre" (o modelo anterior) e diz: "Ei, olhe como eu fazia isso antes! Vamos voltar a ser assim."
  • Isso permite que ele aprenda coisas novas sem perder as antigas, mantendo um equilíbrio perfeito.

3. A "Fórmula Mágica" de Eficiência (MoE)

O modelo é do tipo MoE (Mixture of Experts).

  • A Analogia: Pense em uma empresa gigante com 30 mil funcionários. Se todos tentassem responder a um e-mail ao mesmo tempo, seria um caos e custaria uma fortuna.
  • No Nemotron-Cascade 2, eles têm 30 mil funcionários, mas apenas 3 mil são ativados para cada tarefa específica.
    • Se a pergunta é sobre matemática, ativam-se apenas os "matemáticos".
    • Se é sobre programação, ativam-se os "programadores".
  • Isso torna o modelo super rápido e barato (como usar apenas 3 mil funcionários), mas com a inteligência de ter 30 mil especialistas no banco de dados.

4. Os Resultados: O Gênio de 30B

O resultado desse treinamento é impressionante. Um modelo que é apenas 1/20 do tamanho dos gigantes mais famosos (como o DeepSeek-V3 ou o Gemini) consegue:

  • Matemática: Ganhar medalhas de ouro na Olimpíada Internacional de Matemática (IMO). É como se um aluno do ensino médio resolvesse problemas que só os melhores matemáticos do mundo conseguem.
  • Programação: Resolver competições de código (IOI e ICPC) com a mesma eficiência de modelos gigantes.
  • Agência: Conseguir usar ferramentas, navegar na internet e corrigir bugs em softwares complexos.

Resumo Final

O Nemotron-Cascade 2 é como pegar um carro compacto (30B) e, através de um treinamento de pilotagem extremamente organizado (Cascata) e com a ajuda de um instrutor que nunca deixa você esquecer as lições antigas (Distilação), transformá-lo em um carro de Fórmula 1. Ele é pequeno, ágil e barato de manter, mas corre tão rápido quanto os carros gigantes e caros.

A NVIDIA liberou tudo (o código, os dados e o modelo) para que qualquer pessoa possa usar essa "fórmula mágica" e criar suas próprias IAs inteligentes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →