← Neueste Arbeiten
💬 NLP

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

Das Paper stellt Nemotron-Cascade 2 vor, ein effizientes 30B-MoE-Modell mit 3B aktiven Parametern, das durch erweitertes Cascade-RL und multi-dimensionale On-Policy-Distillation Goldmedaillenniveau in Mathematik und Programmierung erreicht und dabei nur ein Zwanzigstel der Parameter von führenden Modellen benötigt.

Ursprüngliche Autoren: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi
Veröffentlicht 2026-03-20
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten einen jungen, sehr intelligenten Schüler (das KI-Modell) auf die schwierigsten Prüfungen der Welt vorbereiten: Mathematik-Olympiaden, Programmier-Wettbewerbe und komplexe Software-Projekte.

Die NVIDIA-Forscher haben mit Nemotron-Cascade 2 genau das erreicht. Hier ist die Erklärung, wie sie das gemacht haben, ganz ohne Fachchinesisch:

1. Der Schüler: Klein, aber oho

Das Modell ist wie ein 30-jähriger Genie-Schüler (30 Milliarden Parameter), aber er ist extrem effizient. Er aktiviert nur etwa 3 Milliarden "Gehirnzellen" gleichzeitig.

  • Die Analogie: Stellen Sie sich einen Marathonläufer vor, der so schnell läuft wie ein riesiger, schwerer Elefant, aber nur halb so viel Energie verbraucht.
  • Das Ergebnis: Dieser kleine Schüler hat es geschafft, Goldmedaillen in der Internationalen Mathematik-Olympiade (IMO) und der Informatik-Olympiade (IOI) zu gewinnen. Das ist so, als würde ein kleiner, schlanker Schüler gegen riesige, gut gefütterte Riesen (wie DeepSeek oder Gemini) antreten und gewinnen. Er ist der zweite offene KI-Modell-Typ, der das je geschafft hat.

2. Die Lehrmethode: Der "Kaskaden"-Ansatz (Cascade RL)

Früher haben KI-Modelle oft versucht, alles gleichzeitig zu lernen: Mathematik, Schreiben, Programmieren und Höflichkeit. Das führte zu Verwirrung (wie wenn man versucht, gleichzeitig Klavier, Geige und Fußball zu lernen).

Nemotron-Cascade 2 nutzt eine Kaskaden-Methode:

  • Die Analogie: Stellen Sie sich einen Stufen-Turm vor.
    1. Zuerst lernt der Schüler nur, Anweisungen genau zu befolgen (z. B. "Schreibe genau 50 Wörter").
    2. Dann lernt er Wissenschaft und Tools nutzen.
    3. Danach kommt Programmieren.
    4. Zuletzt lernt er, wie ein Software-Ingenieur zu denken.
  • Der Vorteil: Wenn er eine Stufe perfekt beherrscht, geht er zur nächsten. Er vergisst das Alte nicht (kein "Katastrophales Vergessen"), weil jede Stufe auf der vorherigen aufbaut. Es ist wie beim Klettern: Man rutscht nicht zurück, wenn man den nächsten Griff sucht.

3. Der geheime Trick: "On-Policy Distillation" (Das Nachschleifen)

Während des Trainings gab es Momente, in denen der Schüler bei einer neuen Fähigkeit (z. B. Programmieren) etwas schlechter wurde bei einer alten (z. B. Mathematik). Das nennt man "Rückgang".

Hier kommt der Lehrer-Trick ins Spiel:

  • Die Analogie: Stellen Sie sich vor, der Schüler hat während des Trainings verschiedene "Bestenlisten" erstellt. Für Mathematik war er an Tag 50 am besten, für Programmieren an Tag 80.
  • Die Lösung: Anstatt nur den aktuellen Schüler zu trainieren, holen sich die Forscher die besten Versionen des Schülers aus der Vergangenheit (die "Lehrer") und lassen den aktuellen Schüler von ihnen lernen.
  • Das Bild: Es ist wie ein Sportler, der sich sein eigenes Video von der letzten Woche ansieht, um seine Technik zu perfektionieren, bevor er zum nächsten Wettkampf geht. So wird sichergestellt, dass er in allen Fächern stark bleibt, nicht nur im aktuellen.

4. Die Ergebnisse: Warum ist das so besonders?

  • Intelligenz-Dichte: Das Modell hat nur 20-mal weniger Parameter als die riesigen Konkurrenten (wie DeepSeek-V3.2-Speciale), ist aber genauso gut. Das ist, als würde ein Fahrrad die gleiche Strecke in der gleichen Zeit schaffen wie ein Formel-1-Rennwagen, nur mit viel weniger Benzin.
  • Offenheit: NVIDIA hat nicht nur das Modell veröffentlicht, sondern auch die Trainingsdaten und die Methoden. Das ist, als würden sie nicht nur das Auto schenken, sondern auch den Bauplan und das Rezept für den Motor, damit jeder damit weiterarbeiten kann.

Zusammenfassung in einem Satz

Nemotron-Cascade 2 ist ein kleines, aber extrem schlau trainiertes KI-Modell, das durch eine stufenweise Lernmethode und den klugen Rückgriff auf seine eigenen früheren Bestleistungen Weltklasse-Leistungen in Mathematik und Programmieren erreicht, ohne dabei riesig und teuer zu sein.

Es ist der Beweis, dass man nicht unbedingt den größten "Gehirn"-Kasten braucht, um die schwierigsten Rätsel der Welt zu lösen – man braucht nur die richtige Lernstrategie.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →