Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
O artigo apresenta o Nemotron-Cascade 2, um modelo aberto de 30B parâmetros (com 3B ativados) que, graças ao uso de RL em cascata expandido e destilação on-policy multi-domínio, alcança desempenho de nível de medalha de ouro em competições matemáticas e de programação, rivalizando com modelos fronteira muito maiores.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um gênio muito inteligente, mas que é um pouco desajeitado. Ele sabe resolver problemas de matemática complexos, mas às vezes esquece como escrever um e-mail simples, ou perde a linha quando a conversa fica longa. Além disso, ele é "gordo" (tem muitos parâmetros), o que o torna lento e caro para usar.
O Nemotron-Cascade 2 é a história de como a NVIDIA pegou um modelo de IA de tamanho médio (30 bilhões de "cérebros", mas usando apenas 3 bilhões de cada vez) e o transformou em um campeão olímpico de raciocínio, capaz de ganhar medalhas de ouro em competições de matemática e programação do mundo todo.
Aqui está como eles fizeram isso, usando analogias do dia a dia:
1. O Treinamento em Cascata (A Escola de Especialistas)
Antes, treinar uma IA para fazer tudo ao mesmo tempo era como tentar ensinar um aluno a ser um médico, um advogado e um jogador de xadrez na mesma aula. O aluno ficava confuso e esquecia o que aprendeu antes (o famoso "esquecimento catastrófico").
O Nemotron-Cascade 2 usa uma técnica chamada Treinamento em Cascata.
- A Analogia: Imagine que o modelo é um estudante universitário. Em vez de tentar aprender tudo de uma vez, ele faz um curso intensivo de cada matéria, uma por vez.
- Primeiro, ele estuda apenas Matemática por um mês, até ficar um gênio.
- Depois, ele vai para um curso de Programação, mantendo o que aprendeu de matemática.
- Em seguida, um curso de Escrita Criativa, e assim por diante.
- O Segredo: Ao focar em uma coisa de cada vez, ele não esquece o que aprendeu antes. É como se ele tivesse um "diário de bordo" que o impede de apagar os conhecimentos anteriores.
2. O Mestre e o Aprendiz (Distilação On-Policy)
Durante esse treinamento intensivo, às vezes o aluno começa a errar em coisas que ele já sabia (ex: ao aprender programação avançada, ele pode esquecer como somar frações simples).
Para evitar isso, eles usam a Distilação On-Policy.
- A Analogia: Imagine que, a cada etapa do curso, o aluno tira uma "foto" do seu melhor desempenho até aquele momento. Essa "foto" vira um Mestre.
- Quando o aluno começa a aprender algo novo e percebe que está ficando ruim no antigo, ele olha para a foto do seu "Mestre" (o modelo anterior) e diz: "Ei, olhe como eu fazia isso antes! Vamos voltar a ser assim."
- Isso permite que ele aprenda coisas novas sem perder as antigas, mantendo um equilíbrio perfeito.
3. A "Fórmula Mágica" de Eficiência (MoE)
O modelo é do tipo MoE (Mixture of Experts).
- A Analogia: Pense em uma empresa gigante com 30 mil funcionários. Se todos tentassem responder a um e-mail ao mesmo tempo, seria um caos e custaria uma fortuna.
- No Nemotron-Cascade 2, eles têm 30 mil funcionários, mas apenas 3 mil são ativados para cada tarefa específica.
- Se a pergunta é sobre matemática, ativam-se apenas os "matemáticos".
- Se é sobre programação, ativam-se os "programadores".
- Isso torna o modelo super rápido e barato (como usar apenas 3 mil funcionários), mas com a inteligência de ter 30 mil especialistas no banco de dados.
4. Os Resultados: O Gênio de 30B
O resultado desse treinamento é impressionante. Um modelo que é apenas 1/20 do tamanho dos gigantes mais famosos (como o DeepSeek-V3 ou o Gemini) consegue:
- Matemática: Ganhar medalhas de ouro na Olimpíada Internacional de Matemática (IMO). É como se um aluno do ensino médio resolvesse problemas que só os melhores matemáticos do mundo conseguem.
- Programação: Resolver competições de código (IOI e ICPC) com a mesma eficiência de modelos gigantes.
- Agência: Conseguir usar ferramentas, navegar na internet e corrigir bugs em softwares complexos.
Resumo Final
O Nemotron-Cascade 2 é como pegar um carro compacto (30B) e, através de um treinamento de pilotagem extremamente organizado (Cascata) e com a ajuda de um instrutor que nunca deixa você esquecer as lições antigas (Distilação), transformá-lo em um carro de Fórmula 1. Ele é pequeno, ágil e barato de manter, mas corre tão rápido quanto os carros gigantes e caros.
A NVIDIA liberou tudo (o código, os dados e o modelo) para que qualquer pessoa possa usar essa "fórmula mágica" e criar suas próprias IAs inteligentes.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.