DiffusionGemma Technical Report
DiffusionGemma est un modèle de langage aux poids ouverts qui atteint des vitesses de génération de texte exceptionnelles d'environ 1 500 jetons par seconde en affinant une architecture Gemma 4 avec un pipeline à deux étapes efficace en termes de calcul pour permettre une diffusion discrète parallèle par blocs, établissant ainsi une nouvelle frontière de Pareto pour le compromis entre la vitesse d'inférence et la capacité du modèle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez d'écrire une histoire, mais que vous soyez contraint de l'écrire lettre par lettre, de gauche à droite, sans jamais pouvoir revenir en arrière ou changer d'avis. Si vous faites une erreur dans la première phrase, vous devez continuer à écrire le reste du livre avec cette erreur, en espérant la corriger plus tard en ajoutant d'autres mots. C'est ainsi que fonctionnent la plupart des programmes informatiques « intelligents » modernes, appelés Grands Modèles de Langage (LLM). Ils sont comme un dactylo très rapide qui ne peut pas utiliser la touche de retour arrière. Bien qu'ils soient brillants, cette règle de « sens unique » crée un embouteillage dans leur cerveau. Chaque fois qu'ils veulent écrire le mot suivant, ils doivent s'arrêter, se souvenir de tout ce qu'ils viennent d'écrire et calculer l'étape suivante. Cela les rend lents, surtout quand vous êtes le seul à les utiliser, car l'ordinateur passe plus de temps à se souvenir du passé qu'à réellement réfléchir au futur.
Les scientifiques cherchent un moyen de permettre à ces ordinateurs d'écrire par « blocs » plutôt que par lettres, leur permettant de regarder vers l'avant et de corriger les erreurs au fur et à mesure, tout comme un humain corrige un brouillon. Cette idée est appelée « diffusion ». Imaginez cela comme un sculpteur commençant avec un bloc de pierre recouvert de brouillard. Au lieu de tailler un minuscule morceau à la fois, le sculpteur regarde l'ensemble du bloc, devine où devrait se trouver la statue, et dissipe le brouillard de toute la forme d'un coup. Il répète ce processus, rendant la forme de plus en plus nette, jusqu'à ce que la statue soit parfaite. Ce document présente un nouveau modèle appelé DiffusionGemma, qui tente d'utiliser cette méthode de « dissipation du brouillard » pour écrire du texte incroyablement vite, tout en étant assez intelligent pour résoudre des problèmes mathématiques difficiles et écrire du code.
Le nouveau écrivain qui « dissipe le brouillard »
Les chercheurs de Google DeepMind ont construit DiffusionGemma, un modèle informatique expérimental qui brise l'ancienne règle du « un mot à la fois ». Au lieu d'écrire une phrase lettre par lettre, DiffusionGemma écrit de gros blocs de 256 mots d'un seul coup. Imaginez que vous essayez de remplir une page de cahier. L'ancienne méthode consiste à tremper votre plume dans l'encre, écrire un mot, lever la plume, réfléchir, tremper à nouveau et écrire le suivant. DiffusionGera est comme un tampon qui imprime un paragraphe entier instantanément. Si le tampon fait une erreur, il ne se contente pas de continuer ; il estompe tout le paragraphe et essaie de le tamponner à nouveau, mais cette fois avec une image plus claire de ce à quoi il devrait ressembler. Il fait cela encore et encore, affinant tout le bloc de texte en parallèle, jusqu'à ce que les mots se mettent en place.
L'équipe n'a pas construit ce modèle à partir de zéro. Ils sont partis d'un modèle existant très intelligent appelé Gemma 4 (qui possède environ 25,2 milliards de parties totales, dont 3,8 milliards actives à un instant donné) et lui ont appris un nouveau tour. Ils ont utilisé un processus d'entraînement en deux étapes. Premièrement, ils ont montré au modèle comment « débruiter » (denoise) du texte, lui apprenant à regarder un bloc de mots désordonné et confus pour comprendre quelle devrait être la phrase propre. Deuxièmement, ils ont utilisé un type spécial d'« apprentissage par renforcement » combiné à la « distillation de l'échantillonneur » (sampler distillation). Considérez cela comme un entraîneur qui ne se contente pas de dire au modèle « bon travail », mais qui lui apprend aussi comment terminer la tâche plus rapidement. L'entraîneur pousse le modèle à être plus intelligent tout en lui apprenant à arrêter d'affiner le texte dès qu'il est suffisamment confiant, ce qui permet de gagner du temps.
Une vitesse qui dépasse l'entendement
Les résultats sont stupéfiants. Sur une puce informatique puissante appelée GPU NVIDIA H100, DiffusionGemma peut générer environ 1 500 mots par seconde. Pour donner une perspective, les meilleurs modèles de « l'ancienne école », même avec leurs astuces les plus rapides, parviennent généralement à environ 300 mots par seconde. DiffusionGemma est environ 5 fois plus rapide que la version standard et environ 2,5 fois plus rapide que les autres modèles rapides qui sont actuellement cachés derrière des barrières de paiement privées.
Le document montre que ce n'est pas seulement un tour de vitesse qui rend le modèle idiot. Bien qu'il soit légèrement moins parfait sur certaines tâches de raisonnement très difficiles par rapport au modèle Gemma 4 original, il reste incroyablement capable. Il peut résoudre des problèmes mathématiques complexes, écrire du code et même comprendre des images. Les chercheurs ont découvert qu'en écrivant par blocs de 256, le modèle peut produire environ 20 mots pour chaque « étape de réflexion » qu'il effectue, alors que les anciens modèles ne produisent généralement qu'1 mot par étape. Cette efficacité massive lui permet de contourner les goulots d'étranglement de la mémoire qui ralentissent habituellement les ordinateurs.
Pourquoi cela importe (et ce qu'il ne peut pas encore faire)
Le document suggère que cette approche ouvre une nouvelle porte sur la façon dont nous utilisons l'IA. Parce que le modèle peut générer du texte si rapidement, il pourrait être utilisé pour des choses qui nécessitent des réponses instantanées, comme une conversation en temps réel ou pour aider les médecins à rédiger des rapports en une fraction de seconde. Les chercheurs ont également montré que le modèle est flexible : il peut toujours écrire dans l'ancien style « un mot à la fois » si nécessaire, et il peut même basculer entre le mode « réflexion » (où il planifie sa réponse) et le mode « rapide ».
Cependant, les auteurs prennent soin de préciser qu'il s'agit d'une version expérimentale. Ce n'est pas encore un remplacement parfait des anciens modèles. Ils admettent que le modèle se retrouve parfois coincé dans des boucles répétitives (comme dire « le le le » de façon répétée) ou produit des réponses légèrement plus courtes et plus concises que l'original. Ils notent également que, bien qu'il soit super rapide pour une seule personne, si vous essayez de servir des centaines de personnes à la fois, les anciens modèles « un mot à la fois » pourraient finir par rattraper sa vitesse. Mais pour le moment, DiffusionGemma a établi une nouvelle « frontière », prouvant que l'on peut avoir à la fois une vitesse extrême et une haute intelligence, brisant la vieille règle selon laquelle il fallait choisir entre les deux.
En résumé, DiffusionGemma suggère que l'avenir de l'écriture avec les ordinateurs pourrait ne pas être une marche lente et prudente, mais un raffinement rapide et simultané des idées, dissipant le brouillard de l'ensemble de l'image d'un seul coup.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.