Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
Dit artikel introduceert Nemotron 3 Super, een open-source hybride Mamba-Transformer MoE-model met 120 miljard parameters dat is getraind op NVFP4, LatentMoE-architectuur en MTP-lagen, en dat door middel van 25 biljoen tokens pre-training en post-training een context van 1 miljoen tokens ondersteunt met tot 7,5 keer hogere doorvoersnelheid dan vergelijkbare modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robot bouwt die niet alleen slim is, maar ook snel, efficiënt en handig in het uitvoeren van complexe taken. Dat is precies wat NVIDIA heeft gedaan met hun nieuwe model: Nemotron 3 Super.
Hier is een uitleg in gewoon Nederlands, vol met beeldende vergelijkingen, zodat je het zonder technische jargon begrijpt.
1. De Motor: Een slimme mix van twee wereldkampioenen
Stel je een auto voor die twee verschillende motoren heeft:
- Motor A (Mamba): Deze is extreem snel en zuinig. Hij kan lange verhalen lezen zonder zijn geheugen te verliezen, net als een marathonloper die zijn ademhaling perfect beheerst.
- Motor B (Transformer): Deze is de denker. Hij is goed in het begrijpen van complexe verbanden en het vinden van het juiste antwoord, net als een professor die alles uit zijn hoofd kent.
Nemotron 3 Super combineert deze twee. Het gebruikt de snelle motor voor het grootste deel van het werk en schakelt de denker in alleen als het echt nodig is. Dit zorgt ervoor dat de robot niet alleen slim is, maar ook veel sneller reageert dan zijn concurrenten.
2. De "Magische" Expertgroep (LatentMoE)
Normaal gesproken hebben slimme modellen een enorme hersenstroom van experts die allemaal tegelijk aan het werk zijn. Dat is zwaar en traag.
Nemotron 3 Super gebruikt een nieuwe truc genaamd LatentMoE.
- De vergelijking: Stel je een groot kantoor voor met 500 experts. Bij een oud model zouden al die experts elk een gesprek moeten voeren, wat veel tijd kost. Bij Nemotron worden de vragen eerst "samengeperst" naar een kortere, kernachtige samenvatting.
- Het resultaat: De experts hoeven niet meer naar de hele, lange vraag te kijken, maar alleen naar de samenvatting. Hierdoor kunnen ze meer experts tegelijk inschakelen (meer kennis) zonder dat het langzamer wordt. Het is alsof je een team van 500 mensen hebt, maar ze werken allemaal in een snellere, compactere taal.
3. Voorspellen als een pro (Multi-Token Prediction)
Normaal gesproken schrijft een AI één woord per keer, net als iemand die heel voorzichtig een zin bouwt.
Nemotron 3 Super heeft een extra talent: MTP (Multi-Token Prediction).
- De analogie: Stel je voor dat je een verhaal schrijft. Een normale AI schrijft: "Ik", "ga", "naar", "de"... (één woord per seconde). Nemotron 3 Super schrijft als een ervaren schrijver die al weet hoe de zin eindigt: "Ik ga naar de winkel om brood te kopen."
- Het voordeel: Omdat hij meerdere woorden tegelijk voorspelt en controleert, is hij tot 7,5 keer sneller in het genereren van tekst. Hij "droomt" de volgende woorden al in terwijl hij de huidige schrijft.
4. De Leerperiode: Van student tot agent
Het model is getraind in drie fases, net als een student die naar de universiteit gaat:
- De Basis (Pre-training): Het model heeft 25 biljoen woorden gelezen (dat is meer dan alle boeken in de wereld samen!). Het heeft hierbij gelezen in een speciale, compacte taal (NVFP4) om ruimte te besparen, maar zonder zijn intelligentie te verliezen.
- De Praktijk (Post-training): Hier wordt het echt interessant. Het model is niet alleen geleerd om te praten, maar om acties te ondernemen.
- Het heeft geoefend met software schrijven (bugfixen in code).
- Het heeft geoefend met terminal commando's (besturingssysteem taken).
- Het heeft geoefend met zoekopdrachten en rekenen.
- Het is getraind om te werken als een "agent": een digitale assistent die zelfstandig taken kan uitvoeren, zoals "zoek de beste vlucht, boek die, en stuur een bevestiging."
- De Fijnafstelling (RL): Het model heeft feedback gekregen van mensen en andere AI's om te leren wat "goed" en "veilig" is, zodat het niet alleen slim is, maar ook betrouwbaar.
5. Waarom is dit belangrijk voor jou?
- Snelheid: Omdat het model zo efficiënt is, kun je er veel meer mee doen op dezelfde computerhardware. Het is alsof je met dezelfde benzine twee keer zo ver rijdt.
- Open Source: NVIDIA heeft de blauwdrukken (de "recepten") en de modellen gratis beschikbaar gesteld. Iedereen kan dit gebruiken om zijn eigen slimme assistenten te bouwen.
- Agenten: Dit model is speciaal gemaakt om taken uit te voeren, niet alleen om te chatten. Het kan dus echt werk voor je doen, van het oplossen van codeproblemen tot het analyseren van financiële rapporten.
Kortom: Nemotron 3 Super is een slimme, snelle en handige robot die is opgeleid om complexe taken zelfstandig te regelen, en dat allemaal doet met minder energie en meer snelheid dan de modellen die we tot nu toe kenden. Het is de toekomst van AI die niet alleen praat, maar ook doet.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.