Mellum2 Technical Report
Mellum 2 is een open-weight, 12B-parameter Mixture-of-Experts taalmodel met 2,5B actieve parameters per token, gespecialiseerd in software engineering en agentische taken, dat concurrerende prestaties levert met grotere modellen door architecturale innovaties zoals Multi-Token Prediction en een driefasig trainingscurriculum dat 10,6 biljoen tokens beslaat.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente programmeerassistent probeert te bouwen die in je computer leeft. De uitdaging is dat je wilt dat het ongelooflijk slim is (zoals een senior engineer), maar ook ongelooflijk snel en goedkoop om te draaien (zoals een standaard kantoorlaptop). Meestal moet je kiezen: of de "slimme" versie is enorm en traag, of de "snelle" versie is te simpel om moeilijke problemen aan te pakken.
Het team van JetBrains heeft Mellum 2 gebouwd om precies dit probleem op te lossen. Hier is hoe ze het deden, eenvoudig uitgelegd:
1. Het "Zwitsers Zakmes" Brein (De Architectuur)
De meeste AI-modellen zijn als één enkele, gigantische hersencel die alles doet. Mellum 2 is anders. Het is gebouwd als een Mixture-of-Experts (MoE).
- De Analogie: Stel je een enorme bibliotheek voor met 64 verschillende gespecialiseerde bibliothecarissen (experts). Wanneer je een vraag stelt, wordt niet alle 64 bibliothecarissen wakker. In plaats daarvan heeft het model een slimme manager die slechts de 8 meest relevante bibliothecarissen kiest voor jouw specifieke vraag.
- Het Resultaat: Het model heeft de totale kennis van een 12-miljard-parameters tellende "reusachtige" hersenpan, maar voor elk woord dat het schrijft, "denkt" het met de kracht van een 2,5-miljard-parameters brein. Dit maakt het snel genoeg om op standaard hardware te draaien, terwijl het nog steeds erg slim is.
2. De "Sliding Window" en "Drafting" Trucs
Om het nog sneller te maken, hebben ze twee slimme afkortingen toegevoegd:
- Sliding Window: In plaats van te proberen elk woord te onthouden dat je ooit in een gesprek hebt getypt (wat traag wordt), focust het model zich op de laatste 1.024 woorden via een sliding window (schuivend venster), zoals een venster op een trein. Het houdt de meest recente context scherp terwijl oudere details vervagen, wat enorm veel energie bespaart.
- De "Draft" Assistent: Het model heeft een kleine, ingebouwde "drafting" (concept) assistent. Voordat het zich vastlegt op het schrijven van een definitief antwoord, raadt deze kleine assistent de volgende paar woorden. Als de gok goed is, slaat het hoofdmodel het werk over en accepteert het de gok simpelweg. Het is alsoals een schrijver die een vriend heeft die de volgende zin fluistert, zodat de schrijver sneller kan typen.
3. Het "Drie-Fasen" Schoolcurriculum
Ze hebben het model niet zomaar met willekeurige data gevoerd. Ze hebben het onderwezen in drie specifieke fasen, zoals een schoolcurriculum:
- Fase 1 (De Generalist): Ze begonnen met een enorme mix van algemene internetdata (70%) en wat code (23%). Dit gaf het model een breed begrip van hoe mensen praten en schrijven.
- Fase 2 (De Specialist): Ze verschoven de mix naar meer hoogwaardige code (42%) en wiskunde. Dit is waar het model de specifieke regels van programmeren begon te leren.
- Fase 3 (De Meester): In de laatste fase bestond de mix bijna volledig uit code en wiskunde (59% code). Dit is de "bootcamp" waar het model zijn vaardigheden aanscherpte om een expert-programmeur te worden.
4. Twee Persoonlijkheden: "Instruct" en "Thinking"
Vanuit hetzelfde getrainde brein hebben ze twee versies van het model uitgebracht:
- Het "Instruct" Model: Dit is de directe werker. Je stelt een vraag en het geeft direct het antwoord. Het is ideaal voor snelle taken.
- Het "Thinking" Model: Dit is de diepe denker. Voordat het een antwoord geeft, schrijft het een "reasoning trace" (redeneringspad) — een stapsgewijde uitleg van hoe het het probleem heeft opgelost. Dit is als een leerling die de tussenstappen laat zien bij een wiskundetoets. Het onderzoek toonde aan dat deze "denkmodus" het model veel beter maakt in het oplossen van moeilijke logische puzzels en complexe programmeeruitdagingen.
5. Het "Bewijs" (Testen)
Ze hebben Mellum 2 getest tegen andere populaire modellen.
- Snelheid: Het draait zo snel als een 7-miljard-parameters model (wat veel kleiner is dan de totale 12 miljard grootte), maar is slimmer dan veel modellen van zijn omvang.
- Coderen: Het blinkt uit in het schrijven van code, debuggen en het gebruiken van tools (zoals het doorzoeken van het web of het uitvoeren van commando's).
- De Afruil: Omdat ze er zo zwaar op hebben gefocust om een expert in coderen te worden, is het model iets minder deskundig over algemene wereldfeiten (zoals geschiedenis of biologie) vergeleken met modellen die getraind zijn als algemene chatbots. Maar voor de beoogde taak — het helpen van ontwikkelaars — is het een top performer.
Samenvatting
Mellum 2 is een gespecialiseerde programmeerassistent die een "team van experts"-architectuur gebruikt om zowel slim als snel te zijn. Het is getraind via een zorgvuldig ontworpen curriculum om code en wiskunde te beheersen, en het komt in twee smaken: één voor snelle antwoorden en één voor diepgaande, stapsgewijze redenering. Het team heeft het gratis uitgebracht zodat iedereen het kan gebruiken om betere software te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.