← Nieuwste papers
💬 NLP

DiffusionGemma Technical Report

DiffusionGemma is een open-weight taalmodel dat uitzonderlijke tekstgeneratiesnelheden van ongeveer 1.500 tokens per seconde bereikt door een Gemma 4-architectuur te verfijnen met een rekenefficiënte tweestaps-pipeline om parallelle blokwijze discrete diffusie mogelijk te maken, waardoor een nieuwe Pareto-front wordt gevestigd voor de afweging tussen inferentiesnelheid en modelcapaciteit.

Oorspronkelijke auteurs: DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Naba
Gepubliceerd 2026-08-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, João Gabriel Oliveira, Nicolas Perez-Nieves, Nastasia Prutianova, Bobak Shahriari, Jean Tarbouriech, Pavel Tyletski, Çağlar Ünlü, Cindy Wu, Glenn Cameron, Jerome Connor, Sertan Girgin, Maarten Grootendorst, Alon Levkovitch, Eliya Nachmani, Omar Sanseviero, Piotr Stanczyk, Quentin Berthet, Andrew Campbell, Clément Crepy, Valentin De Bortoli, Arnaud Doucet, Romuald Elie, Alexandre Galashov, Klaus Greff, Alexis Jacq, David Ruhe, Yu-Han Wu, Sebastian Flennerhag, Brendan O'Donoghue, George Scrivener, Shantanu Thakoor

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een verhaal probeert te schrijven, maar je bent gedwongen om het één letter tegelijk te schrijven, van links naar rechts, zonder ooit terug te mogen kijken of van gedachten te mogen veranderen. Als je een fout maakt in de eerste zin, moet je de rest van het boek met die fout blijven schrijven, in de hoop het later te herstellen door meer woorden toe te voegen. Dit is hoe de meeste moderne "slimme" computerprogramma's, Large Language Models genoemd, momenteel werken. Ze zijn als een zeer snelle typist die niet op de backspace-toets kan drukken. Hoewel ze briljant zijn, creëert deze "éénrichtingsregel" een verkeersopstopping in hun hersenen. Elke keer dat ze het volgende woord willen schrijven, moeten ze stoppen, onthouden wat ze net hebben geschreven en de volgende stap berekenen. Dit maakt ze traag, vooral wanneer jij de enige bent die ze gebruikt, omdat de computer meer tijd besteedt aan het onthouden van het verleden dan aan het daadwerkelijk nadenken over de toekomst.

Wetenschappers zoeken naar een manier om deze computers in "blokken" te laten schrijven in plaats van letters, waardoor ze vooruit kunnen kijken en fouten kunnen herstellen terwijl ze bezig zijn, net zoals een mens een concepttekst bewerkt. Dit idee wordt "diffusie" genoemd. Denk aan een beeldhouwer die begint met een blok steen dat bedekt is met mist. In plaats van telkens een klein stukje weg te hakken, kijkt de beeldhouwer naar het hele blok, raadt waar het beeld zou moeten zitten, en veegt de mist van de hele vorm in één keer weg. Ze herhalen dit, waardoor het steeds duidelijker wordt, totdat het beeld perfect is. Dit paper introduceert een nieuw model genaamd DiffusionGemma, dat probeert deze "mist-klarende" methode te gebruiken om tekst ongelooflijk snel te schrijven, terwijl het nog steeds slim genoeg is om moeilijke wiskundige problemen op te lossen en code te schrijven.

De Nieuwe "Mist-Klarende" Schrijver

De onderzoekers bij Google DeepMind hebben DiffusionGemma gebouwd, een experimenteel computermodel dat de oude "één-woord-tegelijk-regel" doorbreekt. In plaats van een zin letter voor letter te schrijven, schrijft DiffusionGemma in grote blokken van 256 woorden tegelijk. Stel je voor dat je een pagina in een schrift probeert te vullen. De oude manier is als het in de inkt dopen van je pen, één woord schrijven, de pen optillen, nadenken, opnieuw dopen en het volgende woord schrijven. DiffusionGemma is als het hebben van een stempel die een hele paragraaf direct afdrukt. Als de stempel een fout maakt, gaat hij niet gewoon door; hij veegt de hele paragraaf uit en probeert de stempel opnieuw, maar dit keer met een duidelijker beeld van hoe het eruit zou moeten zien. Het doet dit steeds opnieuw, door het hele tekstblok parallel te verfijnen, totdat de woorden op hun plek vallen.

Het team heeft dit model niet vanaf nul opgebouwd. Ze begonnen met een zeer slim, bestaand model genaamd Gemma 4 (dat ongeveer 25,2 miljard totale onderdelen heeft, waarvan er 3,8 miljard op elk gegeven moment actief zijn) en hebben het een nieuwe truc geleerd. Ze gebruikten een tweetraps trainingsproces. Eerst lieten ze het model leren hoe het tekst moet "ontruisen" (denoise), waarbij het leert om naar een rommelig, door elkaar gehusseld blok woorden te kijken en te achterhalen wat de schone zin moet zijn. Ten tweede gebruikten ze een speciale vorm van "reinforcement learning" gecombineerd met "sampler distillation". Denk hierbij aan een coach die niet alleen zegt "goed gedaan", maar het model ook leert hoe het de klus sneller kan klaren. De coach pusht het model om slimmer te worden, terwijl het het model ook leert om met de verfijning van de tekst te stoppen zodra het er genoeg van zeker is, wat tijd bespaart.

Snelheid Die de Deuren Openbreekt

De resultaten zijn verbijsterend. Op een enkele krachtige computerchip genaamd een NVIDIA H100 GPU, kan DiffusionGemma ongeveer 1.500 woorden per seconde genereren. Om dit in perspectief te plaatsen: de beste "ouderwetse" modellen, zelfs met hun snelste trucjes, halen meestal rond de 300 woorden per seconde. DiffusionGemma is ongeveer 5 keer sneller dan de standaardversie en ongeveer 2,5 keer sneller dan andere snelle modellen die momenteel achter private betaalmuren verborgen zitten.

Het paper laat zien dat dit niet alleen een snelheidstruc is die het model dom maakt. Hoewel het bij sommige zeer moeilijke redeneertaken iets minder perfect is dan het originele Gemma 4-model, is het nog steeds ongelooflijk bekwaam. Het kan complexe wiskundige problemen oplossen, code schrijven en zelfs afbeeldingen begrijpen. De onderzoekers ontdekten dat door in blokken van 256 te schrijven, het model ongeveer 20 woorden kan produceren voor elke "denkstap" die het zet, terwijl de oude modellen meestal slechts 1 woord per stap produceren. Deze enorme efficiëntie stelt het in staat om de geheugenbottlenecks te omzeilen die computers normaal gesproken vertragen.

Waarom Dit Ertoe Doet (En Wat Het Nog Niet Kan)

Het paper suggereert dat deze aanpak een nieuwe deur opent voor hoe we AI gebruiken. Omdat het model tekst zo snel kan genereren, zou het gebruikt kunnen worden voor zaken die directe antwoorden vereisen, zoals real-time conversatie of het helpen van artsen bij het opstellen van rapporten in een fractie van een seconde. De onderzoekers toonden ook aan dat het model flexibel is: het kan nog steeds de oude "één-woord-tegelijk"-stijl gebruiken als dat nodig is, en het kan zelfs schakelen tussen de "denkmodus" (waarin het zijn antwoord plant) en de "snelle modus".

De auteurs wijzen er echter voorzichtig op dat dit een experimentele release is. Het is nog geen perfecte vervanging voor de oude modellen. Ze geven toe dat het model soms in repetitieve lussen kan blijven hangen (zoals "de de de" herhaaldelijk zeggen) of iets kortere, meer beknopte antwoorden geeft dan het originele model. Ze merken ook op dat hoewel het super snel is voor één persoon die het gebruikt, als je probeert honderden mensen tegelijk te bedienen, de oude "één-woord"-modellen qua snelheid uiteindelijk kunnen inhalen. Maar voor het moment heeft DiffusionGemma een nieuwe "frontier" gevestigd, door te bewijzen dat je zowel extreme snelheid als hoge intelligentie kunt hebben, waarmee de oude regel wordt doorbroken dat je moest kiezen tussen de twee.

Kortom, DiffusionGemma suggereert dat de toekomst van het schrijven met computers misschien niet een langzame, voorzichtige mars is, maar een snelle, gelijktijdige verfijning van ideeën, waarbij de mist van het hele plaatje in één keer wordt weggeveegd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →