← Ultimi articoli
💬 NLP

A Sovereign, Open-Source Foundation Model for German and English

Il documento presenta Soofi S 30B-A3B, un modello ibrido Mamba Transformer Mixture-of-Experts sovrano e open-source, addestrato su 27 trilioni di token con un focus su tedesco e inglese, che raggiunge prestazioni state-of-the-art tra i modelli open offrendo al contempo un'efficienza di inferenza superiore per applicazioni a lungo contesto.

Autori originali: The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Khan, Maurice Kraus, Timm Ruland, Richard Rutmann, Sebastian Sztwiertnia, Markus F
Pubblicato 2026-07-13
📖 6 min di lettura🧠 Approfondimento

Autori originali: The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Khan, Maurice Kraus, Timm Ruland, Richard Rutmann, Sebastian Sztwiertnia, Markus Frey, Daniil Gurgurov, Jan Pfister, Tom Röhr, Sebastian von Rohrscheidt, Jörg Bienert, Nicolas Flores-Herr, Simon Gottschalk, Andreas Hotho, Kristian Kersting, Joachim Köhler, Alexander Löser, Wolfgang Nejdl, Simon Ostermann, Jan Plogsties, Patrick Putzky, Mehdi Ali, Michael Fromm, Max Lübbering

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di voler costruire l'ultimo robot chef bilingue capace di cucinare a dovere sia in inglese che in tedesco. La maggior parte delle persone pensa che il segreto per un grande chef sia semplicemente assumere una cucina più grande con più cuochi (più parametri). Ma il team dietro a Soofi S ha scoperto un trucco diverso: invece di assumere 30 miliardi di cuochi, ne ha assunti un piccolo team iper-efficiente di soli 3 miliardi di cuochi incredibilmente veloci nel passare da un compito all'altro, mantenendo gli altri 27 miliardi come una massiccia e silenziosa biblioteca di ricette che possono attingere istantaneamente.

Questa non è solo una teoria; è un robot chef completamente costruito, open-source, chiamato Soofi S 30B-A3B, che gli autori hanno effettivamente addestrato e testato. Ecco la storia di come l'hanno fatto, cosa può fare e dove incontra ancora qualche inciampo.

La Salsa Segreta: Una Cucina Ibrida

La maggior parte dei modelli AI sono come una folla densa di persone dove tutti devono urlare per farsi sentire, il che diventa disordinoso e lento quando la stanza diventa enorme (conversazioni lunghe). Soofi S è diverso. Utilizza un design ibrido che mescola due tipi di "cuochi":

  1. Layer Mamba-2: Immaginali come gli chef che ricordano tutta la storia nella loro testa senza bisogno di scriverla. Non hanno bisogno di tenere un enorme taccuino (chiamato "KV cache") che diventa sempre più pesante man mano che la storia si allunga.
  2. MoE (Mixture of Experts): Questa è la parte dei "3 miliardi attivi". Dei totali 31,6 miliardi di parametri, il modello "sveglia" solo 3,2 miliardi di essi per ogni singola parola che genera.

Il risultato? Quando chiedi a questo modello di leggere un libro lungo 1 milione di parole, non rallenta. Mentre altri modelli diventano lenti perché devono trasportare un pesante taccuino, Soofi S mantiene la sua velocità costante. Gli autori hanno misurato questo dato e hanno scoperto che, a una lunghezza di contesto di 40.000 token (circa 30.000 parole), Soofi S era 8 o 9 volte più veloce di altri modelli densi di dimensioni simili nella generazione di testo.

La Ricetta: Focus Tedesco-Inglese

Il team non ha semplicemente gettato testi casuali da internet nel calderone. Ha seguito una ricetta rigorosa in tre fasi, progettata per rendere il modello un campione in tedesco e inglese specificamente, piuttosto che un cuoco mediocre per 100 lingue.

  • Fase 1 (Il Grande Mix): Hanno iniziato con un massiccio insieme di 20 trilioni di token di dati diversificati. Hanno deliberatamente fatto in modo che il tedesco non fosse solo un contorno; lo hanno aumentato al 7,2% del mix (rispetto al solito 5% in altri modelli).
  • Fase 2 (L'Annealing ad Alta Qualità): Man mano che il modello diventava più intelligente, sono passati a una "dieta di alta qualità". Hanno rimoso il cibo spazzatura e si sono concentrati sui migliori dati di codice, matematica e ragionamento. Qui, hanno aumentato ulteriormente la quota di tedesco, portandola al 15,3% del mix.
  • Fase 3 (Estensione per Storie Lunghe): Infine, hanno insegnato al modello come gestire storie molto lunghe, addestrandolo su dati che vanno da 4.000 a 1 milione di token di lunghezza.

Gli autori sono molto trasparenti su questo: hanno rilasciato la lista esatta degli ingredienti, inclusi quanti tipi di ricette di alta qualità hanno ripetuto (epoch) e quali hanno deciso di non usare. Ammettono persino che circa l'1,3% dei loro dati in tedesco proviene da una fonte con licenza commerciale (Genios) di cui non possono condividere il testo grezzo, ma hanno fornito le statistiche esatte affinché chiunque possa controllare il mix.

Il Test del Gusto: Quanto è Buono?

Il team ha sottoposto Soofi S a un rigoroso test del gusto contro 16 altri modelli open, inclusi giganti come Olmo 3 32B, Apertus 70B e Qwen3.5 35B.

  • La Grande Vittoria: Soofi S è diventato il miglior performer tra i modelli completamente open sia per l'inglese che per il tedesco. Ha battuto ogni baseline sovrana europea testata, spesso con margini enormi. Ad esempio, nei benchmark di codice in tedesco, ha ottenuto un punteggio di 84,2 su MBPP-DE, superando di gran lunga il secondo classificato.
  • Il Vantaggio "Attivo": Anche se attiva solo 3 miliardi di parametri alla volta, ha eguagliato o superato modelli densi che hanno 14 o 27 miliardi di parametri attivi. È come un corridore leggero che batte un pugile dei pesi massimi in uno sprint.
  • Il Vantaggio "Open": A differenza di molti modelli "open" che condividono solo i pesi finali (il piatto cucinato) ma nascondono la ricetta, Soofi S condivide i pesi, il codice, gli iperparametri e l'esatta contabilità dei dati.

Gli Inciampi sulla Strada (Limitazioni)

Gli autori sono onesti su dove lo chef robot inciampa ancora:

  1. Matematica in Tedesco: Sebbene sia bravo nella matematica scolastica tedesca (punteggio di 87,1 su GSM8K-Platinum-DE), resta indietro sulla matematica tedesca più difficile, di tipo competitivo (punteggio di 56,0 su Minerva MATH-DE), restando dietro a modelli come Qwen3.5.
  2. Richiamo della Memoria: Poiché ha solo 3 miliardi di parametri attivi, a volte fatica a ricordare fatti oscuri dal mondo aperto (punteggio di 79,0 su NaturalQuestions), mentre i modelli più grandi e densi ricordano di più. Gli autori suggeriscono che, nella vita reale, lo si potrebbe abbinare a un motore di ricerca per risolvere questo problema.
  3. Contaminazione del Codice: In un benchmark specifico sul codice chiamato LBPP (che testa se il modello sta solo memorizzando i dati di addestramento), ha ottenuto un punteggio di 31,0, inferiore rispetto ad alcuni modelli più grandi.

Il Verdetto

Soofi S dimostra che non serve un cervello enorme, lento e denso per essere un'IA di alto livello. Usando un design ibrido Mamba-Transformer e concentrandosi intensamente su tedesco e inglese, il team ha costruito un modello che è sovrano (costruito su suolo tedesco con finanziamenti tedeschi), aperto (completamente trasparente) ed efficiente (veloce ed economico da gestire).

Non è una bacchetta magica che risolve tutto — specialmente nella matematica tedesca difficile o nel puro richiamo dei fatti — ma per conversazioni lunghe, programmazione e compiti bilingui, stabilisce un nuovo standard per ciò che un modello europeo "sovrano" può raggiungere. Gli autori suggeriscono che con più dati di alta qualità in tedesco, questo modello potrebbe migliorare ulteriormente, ma per ora, è il modello base tedesco-inglese completamente open più forte che abbiano testato.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →