← Ultimi articoli
💬 NLP

Mellum2 Technical Report

Mellum 2 è un modello linguistico a pesi aperti, con 12 miliardi di parametri e una struttura Mixture-of-Experts con 2,5 miliardi di parametri attivi per token, specializzato nell'ingegneria del software e in compiti agentici, che raggiunge prestazioni competitive con modelli più grandi attraverso innovazioni architettoniche come la Multi-Token Prediction e un curriculum di addestramento in tre fasi che copre 10,6 trilioni di token.

Autori originali: Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

Pubblicato 2026-06-01
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di voler costruire un assistente alla programmazione super intelligente che viva all'interno del tuo computer. La sfida è che vuoi che sia incredibilmente intelligente (come un ingegnere senior) ma anche incredibilmente veloce ed economico da gestire (come un normale laptop da ufficio). Di solito, devi scegliere tra uno: la versione "intelligente" è enorme e lenta, oppure la versione "veloce" è troppo semplice per gestire problemi difficili.

Il team di JetBrains ha costruito Mellum 2 per risolvere esattamente questo problema. Ecco come ci sono riusciti, spiegato in modo semplice:

1. Il cervello "Coltellino Svizzero" (L'Architettura)

La maggior parte dei modelli IA sono come una singola, gigantesca cellula cerebrale che fa tutto. Mellum 2 è diverso. È costruito come un Mixture-of-Experts (MoE).

  • L'Analogia: Immagina una biblioteca enorme con 64 diversi bibliotecari specializzati. Quando fai una domanda, il modello non sveglia tutti i 64 bibliotecari. Inveve, ha un manager intelligente che sceglie solo gli 8 bibliotecari più rilevanti per la tua specifica domanda.
  • Il Risultato: Il modello ha la conoscenza totale di un cervello "gigante" da 12 miliardi di parametri, ma per ogni singola parola che scrive, "pensa" solo con la potenza di un cervello da 2,5 miliardi di parametri. Questo lo rende abbastanza veloce da girare su hardware standard pur rimanendo molto intelligente.

2. I trucchi della "Finestra Scorrevole" e della "Bozza"

Per renderlo ancora più veloce, hanno aggiunto due scorciatoie ingegnose:

  • Finestra Scorrevole (Sliding Window): Invece di cercare di ricordare ogni singola parola che hai digitato in una conversazione (il che rallenta il processo), il modello si concentra sulle ultime 1.024 parole come una finestra scorrevole su un treno. Mantiene nitido il contesto più recente mentre lascia che i dettagli più vecchi sbiadiscano, il che risparmia un sacco di energia.
  • L'Assistente di "Bozza": Il modello ha un piccolo assistente di "bozza" integrato. Prima di impegnarsi a scrivere una risposta finale, questo piccolo assistente indovina le prossime parole. Se l'indovinata è corretta, il modello principale salta il lavoro e la accetta semplicemente. È come uno scrittore che ha un amico che gli sussurra la frase successiva così può scrivere più velocemente.

3. Il "Curriculum Scolastico in Tre Fasi"

Non si sono limitati a nutrire il modello con dati casuali. Lo hanno istruito in tre fasi specifiche, come un curriculum scolastico:

  • Fase 1 (Il Generalista): Hanno iniziato con un enorme mix di dati generali di internet (70%) e un po' di codice (23%). Questo ha dato al modello una comprensione ampia di come gli umani parlano e scrivono.
  • Fase 2 (Lo Specialista): Hanno spostato il mix per includere più codice di alta qualità (42%) e matematica. È qui che il modello ha iniziato a imparare le regole specifiche della programmazione.
  • Fase 3 (Il Maestro): Nella fase finale, il mix era quasi interamente composto da codice e matematica (59% codice). Questo è il "campo di addestramento intensivo" dove il modello ha affinato le sue abilità per diventare un esperto.

4. Due Personalità: "Instruct" e "Thinking"

Dallo stesso cervello addestrato, hanno rilasciato due versioni del modello:

  • Il Modello "Instruct": È il lavoratore diretto. Fai una domanda e lui ti dà la risposta immediatamente. È ottimo per compiti rapidi.
  • Il Modello "Thinking": È il pensatore profondo. Prima di darti una risposta, scrive una "traccia di ragionamento" (reasoning trace) — una spiegazione passo dopo passo di come ha risolto il problema. Questo è come uno studente che mostra i passaggi di un problema di matematica. Il documento ha scoperto che questa modalità di "pensiero" rende il modello molto più bravo a risolvere enigmi logici difficili e sfide di programmazione complesse.

5. La "Prova" (Test)

Hanno testato Mellum 2 contro altri modelli popolari.

  • Velocità: Gira velocemente come un modello da 7 miliardi di parametri (che è molto più piccolo del suo totale di 12 miliardi) ma è più intelligente di molti modelli della sua dimensione.
  • Coding: Eccelle nello scrivere codice, nel debugging e nell'uso di strumenti (come cercare sul web o eseguire comandi).
  • Il Compromesso: Poiché si sono concentrati così tanto nel renderlo un esperto di programmazione, è leggermente meno informato su fatti generali del mondo (come la storia o la biologia) rispetto ai modelli addestrati per essere chatbot generici. Tuttavia, per il suo compito previsto — aiutare gli sviluppatori — è un performer di alto livello.

Riassunto

Mellum 2 è un assistente alla programmazione specializzato che utilizza un'architettura a "team di esperti" per essere sia intelligente che veloce. È stato addestrato attraverso un curriculum attentamente progettato per padroneggiare il codice e la matematica, e viene fornito in due varianti: una per risposte rapide e una per un ragionamento profondo e passo dopo passo. Il team lo ha rilasciato gratuitamente affinché chiunque possa usarlo per creare software migliori.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →