← Derniers articles
💬 NLP

A Sovereign, Open-Source Foundation Model for German and English

Le document présente Soofi S 30B-A3B, un modèle hybride Mamba Transformer de type Mixture-of-Experts souverain et open-source, entraîné sur 27 billions de tokens avec un accent mis sur l'allemand et l'anglais, qui atteint des performances de pointe parmi les modèles ouverts tout en offrant une efficacité d'inférence supérieure pour les applications à contexte long.

Auteurs originaux : The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Khan, Maurice Kraus, Timm Ruland, Richard Rutmann, Sebastian Sztwiertnia, Markus F
Publié 2026-07-13
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : The Soofi-Team, :, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff, Maximilian Idahl, Alex Jude, Abbas Goher Khan, Maurice Kraus, Timm Ruland, Richard Rutmann, Sebastian Sztwiertnia, Markus Frey, Daniil Gurgurov, Jan Pfister, Tom Röhr, Sebastian von Rohrscheidt, Jörg Bienert, Nicolas Flores-Herr, Simon Gottschalk, Andreas Hotho, Kristian Kersting, Joachim Köhler, Alexander Löser, Wolfgang Nejdl, Simon Ostermann, Jan Plogsties, Patrick Putzky, Mehdi Ali, Michael Fromm, Max Lübbering

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de construire le robot chef bilingue ultime, capable de cuisiner avec brio en anglais et en allemand. La plupart des gens pensent que le secret d'un grand chef réside simplement dans l'embauche d'une plus grande cuisine avec plus de cuisiniers (plus de paramètres). Mais l'équipe derrière Soofi S a découvert un truc différent : au lieu d'embaucher 30 milliards de cuisiniers, ils ont engagé une équipe minuscule et hyper efficace de seulement 3 milliards de cuisiniers capables de changer de tâche très rapidement, tout en gardant les 27 autres milliards comme une immense bibliothèque de recettes qu'ils peuvent consulter instantanément.

Ce n'est pas seulement une théorie ; c'est un robot chef hybride, entièrement construit, ouvert et nommé Soofi S 30B-A3B, que les auteurs ont réellement entraîné et testé. Voici l'histoire de la façon dont ils l'ont fait, de ce qu'il peut faire, et des quelques accrocs qu'il rencontre encore sur la route.

La Recette Secrète : Une Cuisine Hybride

La plupart des modèles d'IA sont comme une foule dense de personnes où tout le monde doit crier pour être entendu, ce qui devient désordonné et lent lorsque la pièce devient immense (longues conversations). Soofi S est différent. Il utilise un design hybride qui mélange deux types de « cuisiniers » :

  1. Couches Mamba-2 : Considérez-les comme des chefs qui retiennent toute l'histoire dans leur tête sans avoir besoin de l'écrire. Ils n'ont pas besoin de garder un immense carnet de notes (appelé « KV cache ») qui devient de plus en plus lourd à mesure que l'histoire s'allonge.
  2. MoE (Mixture of Experts) : C'est la partie des « 3 milliards actifs ». Sur un total de 31,6 milliards de paramètres, le modèle ne « réveille » que 3,2 milliards d'entre eux pour chaque mot généré.

Le résultat ? Lorsque vous demandez à ce modèle de lire un livre de 1 million de mots, il ne ralentit pas. Tandis que d'autres modèles deviennent léthargiques parce qu'ils doivent porter un carnet de notes pesant, Soofi S maintient sa vitesse constante. Les auteurs ont mesuré cela et ont constaté qu'à une longueur de contexte de 40 000 tokens (environ 30 000 mots), Soofi S était 8 à 9 fois plus rapide pour générer du texte que les autres modèles denses de taille similaire.

La Recette : Focus Allemand-Anglais

L'équipe n'a pas simplement jeté des textes aléatoires d'Internet dans la marmite. Ils ont suivi une recette stricte en trois phases conçue pour faire du modèle un champion spécifiquement en allemand et en anglais, plutôt qu'un chef médiocre pour 100 langues.

  • Phase 1 (Le Grand Mélange) : Ils ont commencé avec un énorme volume de 20 billions de tokens de données diverses. Ils ont délibérément veillé à ce que l'allemand ne soit pas juste un accompagnement ; ils l'ont augmenté à 7,2 % du mélange (comparé aux 5 % habituels dans d'autres modèles).
  • Phase 2 (Le Recuit de Haute Qualité) : À mesure que le modèle devenait plus intelligent, ils sont passés à un régime de « haute qualité ». Ils ont supprimé la malbouffe pour se concentrer sur le meilleur code, les mathématiques et les données de raisonnement. Ici, ils ont augmenté la part d'allemand encore plus haut, à 15,3 % du mélange.
  • Phase 3 (L'Extension de Longue Histoire) : Enfin, ils ont appris au modèle comment gérer de très longues histoires, en l'entraînant sur des données allant de 4 000 à 1 million de tokens de long.

Les auteurs sont très transparents à ce sujet : ils ont publié la liste exacte des ingrédients, y compris le nombre de fois qu'ils ont répété certaines recettes de haute qualité (époques) et celles qu'ils ont décidé de ne pas utiliser. Ils admettent même qu'environ 1,3 % de leurs données allemandes proviennent d'une source sous licence commerciale (Genios) dont ils ne peuvent pas partager le texte brut, mais ils ont fourni les statistiques exactes afin que quiconque puisse auditer le mélange.

Le Test de Dégustation : Est-ce bon ?

L'équipe a soumis Soofi S à un test de dégustation rigoureux contre 16 autres modèles ouverts, incluant des géants comme Olmo 3 32B, Apertus 70B et Qwen3.5 35B.

  • La Grande Victoire : Soofi S est devenu le meilleur performeur parmi les modèles entièrement ouverts pour l'anglais et l'allemand. Il a battu tous les référentiels souverains européens testés, souvent par de larges marges. Par exemple, sur les benchmarks de code allemand, il a obtenu un score de 84,2 sur MBPP-DE, dépassant largement le suivant.
  • L'Avantage de l'« Actif » : Même s'il n'active que 3 milliards de paramètres à la fois, il a égalé ou battu des modèles denses qui possèdent de 14 à 27 milliards de paramètres actifs. C'est comme un coureur léger qui bat un boxeur poids lourd lors d'un sprint.
  • L'Avantage de l'« Ouvert » : Contrairement à de nombreux modèles « ouverts » qui ne partagent que les poids finaux (le plat cuisiné) mais cachent la recette, Soofi S partage les poids, le code, les hyperparamètres et la comptabilité exacte des données.

Les Accrocs sur la Route (Limites)

Les auteurs sont honnêtes sur les points où le robot chef trébuche encore :

  1. Mathématiques en Allemand : Bien qu'il soit excellent en mathématiques de niveau primaire en allemand (score de 87,1 sur GSM8K-Platinum-DE), il est en retrait sur les mathématiques allemandes plus complexes de type compétition (score de 56,0 sur Minerva MATH-DE), restant derrière des modèles comme Qwen3.5.
  2. Rappel de Mémoire : Parce qu'il n'a que 3 milliards de paramètres actifs, il a parfois du mal à se souvenir de faits obscurs du monde ouvert (score de 79,0 sur NaturalQuestions), là où les modèles plus grands et plus denses se souviennent de plus de choses. Les auteurs suggèrent qu'en situation réelle, on pourrait le coupler à un moteur de recherche pour corriger cela.
  3. Contamination de Code : Sur un benchmark de code spécifique appelé LBPP (qui teste si le modèle ne fait que mémoriser les données d'entraînement), il a obtenu 31,0, ce qui est inférieur à certains modèles plus grands.

Le Verdict

Soofi S prouve que vous n'avez pas besoin d'un cerveau massif, lent et dense pour être une IA de haut niveau. En utilisant un design hybride Mamba-Transformer et en se concentrant intensément sur l'allemand et l'anglais, l'équipe a construit un modèle qui est souverain (construit sur le sol allemand avec un financement allemand), ouvert (entièrement transparent) et efficace (rapide et peu coûteux à exécuter).

Ce n'est pas une solution miracle qui résout tout — surtout pour les mathématiques allemandes difficiles ou le pur rappel de faits — mais pour les longues conversations, le codage et les tâches bilingues, il établit une nouvelle norme pour ce qu'un modèle européen « souverain » peut accomplir. Les auteurs suggèrent qu'avec plus de données allemandes de haute qualité, ce modèle pourrait encore s'améliorer, mais pour l'instant, il reste le modèle de base allemand-anglais le plus solide entièrement ouvert qu'ils aient testé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →