← Nieuwste papers
💬 NLP

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

Nemotron-Cascade 2 is een open 30B MoE-model dat door middel van Cascade RL en multi-domein on-policy distillatie best-in-class redeneervermogen en agentic vaardigheden bereikt, met prestaties op gouden medaille-niveau in wiskunde en informatica die vergelijkbaar zijn met veel grotere modellen.

Oorspronkelijke auteurs: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi
Gepubliceerd 2026-03-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Nemotron-Cascade 2: De Slimme, Compacte Meester van de Redenering

Stel je voor dat je een genie wilt bouwen dat wiskundeproblemen oplost alsof het een olympiër is, en code schrijft alsof het een senior developer is. Meestal denk je dan: "Oké, dan moet je een enorme supercomputer bouwen met miljarden 'hersencellen' (parameters)."

NVIDIA heeft echter een andere aanpak gepresenteerd met Nemotron-Cascade 2. Dit model is verrassend klein (ongeveer 30 miljard parameters, maar slechts 3 miljard actief tegelijk), maar presteert net zo goed als de grootste, zwaarste modellen ter wereld.

Hier is hoe ze dit hebben gedaan, vertaald naar alledaagse taal:

1. De Basis: Een Leerling met een Perfecte Studiegids (SFT)

Voordat het model gaat "leren" door fouten te maken, krijgen ze eerst een enorme hoeveelheid kennis mee.

  • De Analogie: Stel je voor dat je een student voorbereidt op de Olympiade. Je geeft hem niet zomaar een boek, maar een perfecte samenvatting van de beste boeken ter wereld over wiskunde, coderen, wetenschap en logisch denken.
  • Wat ze deden: Ze trainden het model met een zorgvuldig samengestelde dataset (Supervised Fine-Tuning). Het model leerde hoe het moet praten, hoe het moet redeneren en hoe het tools (zoals een rekenmachine of code-uitvoerder) moet gebruiken.

2. De "Cascade": Een Trapsgewijze Trainingssessie

Dit is het hart van hun innovatie. In plaats van het model alles tegelijk te laten leren (wat vaak leidt tot verwarring of het vergeten van eerdere vaardigheden), trainden ze het in stappen, alsof je een atleet traint.

  • De Analogie: Stel je voor dat je een atleet traint voor een meerkamp.
    1. Eerst train je alleen op hardlopen (instructies volgen).
    2. Daarna ga je springen (wiskundig redeneren).
    3. Dan kogelstoten (coderen).
    4. En tenslotte discuswerpen (software engineering).
      Als je ze allemaal tegelijk traint, wordt de atleet verward. Door ze stap voor stap te trainen, wordt hij in elke discipline een meester zonder zijn vaardigheden in de vorige te verliezen. Dit noemen ze Cascade RL (Reinforcement Learning).

3. De "Gouden Leraar": Het Herstellen van Vergeten Vaardigheden

Tijdens het trainen in de moeilijkste stappen (zoals wiskunde) kan het model soms vergeten hoe het goed moet praten of hoe het moet coderen.

  • De Analogie: Stel je voor dat je tijdens je hardlooptraining vergeet hoe je moet ademen. Je hebt een gouden leraar nodig die je weer even laat ademen, zonder dat je stopt met hardlopen.
  • Wat ze deden: Ze introduceerden Multi-Domain On-Policy Distillation (MOPD). Tijdens het trainen in een moeilijk domein (bijv. wiskunde), kijken ze naar een "leraar" die al goed was in dat specifieke domein. Ze laten het model van die leraar leren, zodat het de vaardigheden van de vorige stappen (zoals beleefdheid of coderen) niet vergeet. Het is alsof je een student laat kijken naar de beste antwoorden van de vorige dag, zodat hij niet terugvalt in oude gewoontes.

4. De Resultaten: Een Dwerg die Reuzen Verslaat

Het resultaat is verbazingwekkend. Dit kleine model (30B) doet het net zo goed als enorme modellen (671B of meer) op de zwaarste toetsen:

  • Wiskunde: Het haalde een Gouden Medaille op de Internationale Wiskunde Olympiade (IMO) 2025.
  • Programmeren: Het won goud op de Internationale Informatica Olympiade (IOI) en deed het uitstekend op de wereldkampioenschappen programmeren (ICPC).
  • Efficiëntie: Het doet dit met 20 keer minder parameters dan de concurrenten. Het is als een Formule 1-auto die net zo snel is als een vrachtwagen, maar met een motor die 20 keer kleiner is.

Samenvattend

Nemotron-Cascade 2 is een bewijs dat je niet per se een "gigant" hoeft te zijn om slim te zijn. Door slim te trainen (stap voor stap) en constant te kijken naar de beste voorbeelden (distillatie), kun je een compact model bouwen dat de wereld van de complexe redenering en programmering veroverd. Het is de "slimme dwerg" die de reuzen van de AI-wereld een hart onder de riem steekt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →