Fine-Tuning and Serving Gemma 4 31B on Google Cloud TPU: A Technical Comparison with GPU Baselines
Dit artikel presenteert de eerste end-to-end demonstratie van het fijnafstemmen en serveren van Gemma 4 31B op Google Cloud TPUs, waarin de benodigde code-aanpassingen worden gedetailleerd om GPU-native workflows te porteren naar de JAX-stack, en wordt aangetoond dat de TPU-configuratie 1,61x snellere training realiseert tegen 1,82x lagere kosten met vergelijkbare inferentie-doorvoer en aanzienlijk verlaagde latentie in vergelijking met H100 GPU-baselines.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een briljante maar zeer dure robot (een AI-model) een nieuwe vaardigheid aan te leren: het schrijven van computercode voor elektronische circuits (Verilog). Je hebt twee opties voor de "school" waar deze training plaatsvindt:
- De GPU-school: Gerund door NVIDIA, met hun beroemde H100-chips. Dit is het standaard, goed begane pad met veel ervaren docenten.
- De TPU-school: Gerund door Google, met hun op maat gemaakte TPU-chips. Dit is een nieuwere, sterk gespecialiseerde campus die sneller en goedkoper is, maar vereist dat je een volledig nieuwe taal leert om er binnen te komen.
Dit rapport van h2loop.ai is een "veldgids" geschreven door ingenieurs die besloten de Google TPU-school te proberen. Ze namen een AI-model met 31 miljard parameters (Gemma 4) en leerden het code schrijven, waarna ze vergeleken hoe goed het werkte in vergelijking met de standaard NVIDIA-school.
Hier is de uiteenzetting van hun reis, eenvoudig uitgelegd:
1. De Taalbarrière (Het "Porting"-probleem)
Het grootste obstakel was niet de hardware zelf; het was de software.
- De GPU-school spreekt PyTorch, een populaire programmeertaal die de meeste AI-ontwikkelaars al kennen.
- De TPU-school spreekt JAX, een andere taal die een andere denkwijze vereist.
De auteurs moesten hun volledige "lesplan" vertalen van PyTorch naar JAX. Ze moesten:
- De manier waarop het brein van het model over meerdere chips wordt verdeeld, herschikken (zoals het organiseren van een bibliotheek waar boeken over 4 verschillende kamers verspreid zijn in plaats van 2).
- Specifieke onderdelen van het model hernoemen, omdat de TPU-school dingen anders noemt (bijvoorbeeld een "q_proj" een "q_einsum" noemen).
- Een speciale "brug" bouwen om hun werk op te slaan, omdat de TPU-school een ander bestandsysteem gebruikt (Orbax) dan de rest van de wereld (Safetensors).
De Analogie: Het is alsof je een huis verhuist. Het meubilair (het AI-model) is hetzelfde, maar het nieuwe huis (TPU) heeft andere deuropeningen en plattegronden. Je moet het meubilair uit elkaar halen, door de nieuwe deuren dragen en weer in elkaar zetten, anders past het niet.
2. De Trainingswedstrijd (De robot leren)
Zodra ze het model hadden opgezet, begonnen ze aan de trainingswedstrijd.
- Snelheid: De TPU-school was 1,6 keer sneller. Het voltooide de training in 3,3 uur, terwijl de GPU-school 5,4 uur nodig had.
- Kosten: Omdat de TPU-school minder per uur rekent én sneller klaar is, was de totale rekening 2,1 keer goedkoper.
- GPU-rekening: ~$119
- TPU-rekening: ~$56
Waarom was TPU sneller?
Stel je de TPU-chips voor als een team van 4 hardlopers die een stok (data) via een supersnelle interne snelweg (ICI) uiterst snel aan elkaar doorgeven. De GPU-school had slechts 2 hardlopers. Hoewel de individuele GPU-hardlopers iets sneller waren, zorgde het vermogen van het TPU-team om samen te werken en data gezamenlijk te verplaatsen ervoor dat het hele team won.
3. Het Examen (Heeft de robot geleerd?)
Na de training testten ze de robots op een Verilog-coderingsexamen.
- Het resultaat: De robot die op GPU's was getraind scoorde iets hoger (ongeveer 5% beter) op de moeilijkste vragen.
- De vangst: De auteurs merkten op dat dit verschil waarschijnlijk komt omdat de twee scholen de examens iets anders beoordeelden (de ene negeerde het "prompt"-gedeelte van de vraag, de andere niet), niet omdat de ene robot van nature slimmer was. Het verschil was statistisch niet enorm groot.
4. Het Sollicitatiegesprek (Het model bedienen)
Na de training moet het model aan het werk worden gezet, waarbij het vragen van gebruikers in real-time beantwoordt. Dit heet "inference". Ze testten hoe snel het model vragen van verschillende lengtes kon beantwoorden.
Korte vragen (Eenvoudige taken):
- De GPU-school was iets sneller in het beantwoorden van zeer korte vragen.
- Het was ook iets goedkoper per antwoord voor deze snelle taken.
- Analogie: Als je gewoon een enkele koffie wilt kopen, is de lokale winkel (GPU) iets efficiënter.
Lange vragen (Complexe taken):
- Toen de vragen lang werden (4.000+ woorden), was de TPU-school absoluut superieur.
- Snelheid: De TPU was 23 keer sneller in het starten van het beantwoorden van een lange vraag (Time-to-First-Token).
- Capaciteit: De TPU kon 4 keer meer mensen tegelijkertijd lange vragen laten stellen zonder vertraging.
- Analogie: Als je een hele roman moet schrijven, heeft de TPU-school een enorme bibliotheek en een team van schrijvers die naadloos samen kunnen werken. De GPU-school raakt overweldigd en begint boeken te laten vallen.
5. Het Eindoordeel
De auteurs concluderen dat voor hun specifieke behoeften (het trainen van een groot model en het bedienen van gebruikers), Googles TPU de winnaar is.
- Training: TPU is de duidelijke kampioen (Sneller en veel goedkoper).
- Inference: TPU is de kampioen voor alles wat complex of lang is. Voor zeer eenvoudige, korte taken is de GPU nog steeds iets beter.
- Totale kosten: Als je de trainingskosten optelt bij een dag lang gebruikers bedienen, was de TPU-opstelling overall 1,8 keer goedkoper.
De Conclusie:
Overschakelen naar de TPU-school vereiste veel hard werk vooraf (een nieuwe taal leren, het meubilair repareren, bruggen bouwen). Maar zodra ze zich hadden gevestigd, draaide de school sneller, kostte het minder en hanteerde het grote, complexe taken veel beter dan de traditionele GPU-school. Voor een bedrijf dat zware AI-werkzaamheden verricht, was de extra inspanning om over te schakelen het waard vanwege de besparingen en prestaties.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.