Fine-Tuning and Serving Gemma 4 31B on Google Cloud TPU: A Technical Comparison with GPU Baselines
यह शोध पत्र Google Cloud TPUs पर Gemma 4 31B को फाइन-ट्यूनिंग और सर्व करने के पहले एंड-टू-एंड प्रदर्शन को प्रस्तुत करता है, जिसमें GPU-नेटिव वर्कफ़्लो को JAX स्टैक पर पोर्ट करने के लिए आवश्यक कोड अनुकूलनों का विवरण दिया गया है और यह प्रदर्शित किया गया है कि TPU कॉन्फ़िगरेशन H100 GPU बेसलाइन की तुलना में 1.61x तेज़ प्रशिक्षण और 1.82x कम लागत के साथ तुलनीय इन्फरेंस थ्रूपुट और काफी कम विलंबता (लेटेंसी) प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत महंगे रोबोट (एक AI मॉडल) को एक नया कौशल सिखाने की कोशिश कर रहे हैं: इलेक्ट्रॉनिक सर्किट के लिए कंप्यूटर कोड (Verilog) लिखना। आपके पास इस प्रशिक्षण के लिए दो विकल्प हैं:
- GPU स्कूल: NVIDIA द्वारा संचालित, उनके प्रसिद्ध H100 चिप्स का उपयोग करता है। यह एक मानक, सुधारा हुआ रास्ता है जिसमें अनुभवी शिक्षकों की भरमार है।
- TPU स्कूल: Google द्वारा संचालित, उनके कस्टम TPU चिप्स का उपयोग करता है। यह एक नया, अत्यधिक विशिष्ट कैंपस है जो तेज़ और सस्ता है लेकिन इसके लिए आपको अंदर जाने के लिए एक पूरी तरह से नई भाषा सीखने की आवश्यकता है।
h2loop.ai की यह रिपोर्ट एक "फील्ड गाइड" है जिसे उन इंजीनियरों द्वारा लिखा गया है जिन्होंने Google के TPU स्कूल को आज़माने का निर्णय लिया। उन्होंने एक 31-बिलियन-पैरामीटर वाले AI मॉडल (Gemma 4) को कोड लिखना सिखाया, और फिर तुलना की कि यह NVIDIA स्कूल के मुकाबले कितना अच्छा काम करता है।
यहाँ उनकी यात्रा का विवरण दिया गया है, जिसे सरल शब्दों में समझाया गया है:
1. भाषा की बाधा (द "पोर्टिंग" समस्या)
सबसे बड़ी बाधा हार्डवेयर नहीं थी; बल्कि सॉफ्टवेयर था।
- GPU स्कूल PyTorch बोलता है, जो एक लोकप्रिय प्रोग्रामिंग भाषा है जिसे अधिकांश AI डेवलपर्स पहले से जानते हैं।
- TPU स्कूल JAX बोलता है, जो एक अलग भाषा है जिसके लिए सोचने का एक अलग तरीका चाहिए।
लेखकों को अपना पूरा "पाठ योजना" (lesson plan) PyTorch से JAX में अनुवाद करना पड़ा। उन्हें निम्नलिखित कार्य करने पड़े:
- मॉडल के मस्तिष्क को कई चिप्स के बीच कैसे विभाजित किया जाए, इसे पुनर्गठित करना (जैसे एक लाइब्रेरी को व्यवस्थित करना जहाँ किताबें 2 कमरों के बजाय 4 अलग-अलग कमरों में बिखरी हुई हैं)।
- मॉडल के विशिष्ट हिस्सों का नाम बदलना क्योंकि TPU स्कूल चीजों को अलग तरह से बुलाता है (जैसे "q_proj" को "q_einsum" कहना)।
- अपना काम सहेजने के लिए एक कस्टम "पुल" (bridge) बनाना, क्योंकि TPU स्कूल बाकी दुनिया (Safetensors) की तुलना में एक अलग फाइलिंग सिस्टम (Orbax) का उपयोग करता है।
उपमा: यह घर बदलने जैसा है। फर्नीचर (AI मॉडल) वही है, लेकिन नए घर (TPU) में दरवाजे और फर्श के नक्शे अलग हैं। आपको फर्नीचर को खोलना होगा, नए दरवाजों से ले जाना होगा, और फिर से जोड़ना होगा, अन्यथा वह फिट नहीं होगा।
2. प्रशिक्षण की दौड़ (रोबोट को सिखाना)
एक बार जब उन्होंने मॉडल को सेट कर लिया, तो उन्होंने प्रशिक्षण की दौड़ शुरू की।
- गति: TPU स्कूल 1.6 गुना तेज़ था। इसने 3.3 घंटे में प्रशिक्षण कोर्स पूरा किया, जबकि GPU स्कूल को 5.4 घंटे लगे।
- लागत: क्योंकि TPU स्कूल प्रति घंटा कम शुल्क लेता है और तेज़ भी पूरा होता है, इसलिए कुल बिल 2.1 गुना सस्ता था।
- GPU बिल: ~$119
- TPU बिल: ~$56
TPU तेज़ क्यों था?
TPU चिप्स को एक ऐसे धावक दल के रूप में सोचें जो एक बहुत ही तेज़ आंतरिक राजमार्ग (ICI) के माध्यम से एक-दूसरे को बहुत तेज़ी से बैटन (डेटा) पास करते हैं। GPU स्कूल में केवल 2 धावक थे। भले ही व्यक्तिगत रूप से GPU धावक थोड़े तेज़ थे, लेकिन TPU टीम की डेटा को एक साथ चलाने और स्थानांतरित करने की क्षमता ने पूरे दल को विजेता बना दिया।
3. परीक्षा (क्या रोबोट ने सीखा?)
प्रशिक्षण के बाद, उन्होंने रोबोटों का Verilog कोडिंग परीक्षा पर परीक्षण किया।
- परिणाम: GPU पर प्रशिक्षित रोबोट ने कठिन सवालों पर थोड़ा बेहतर स्कोर किया (लग लगभग 5% बेहतर)।
- कैच (Catch): लेखकों ने नोट किया कि यह अंतर संभवतः इसलिए है क्योंकि दोनों स्कूलों ने परीक्षाओं को थोड़ा अलग तरह से ग्रेड किया (एक ने प्रश्न के "प्रॉम्प्ट" वाले हिस्से को अनदेखा किया, दूसरे ने नहीं), न कि इसलिए कि एक रोबोट स्वाभाविक रूप से अधिक स्मार्ट था। यह अंतर सांख्यिकीय रूप से बहुत बड़ा नहीं था।
4. जॉब इंटरव्यू (मॉडल को काम पर लगाना)
प्रशिक्षण के बाद, मॉडल को वास्तविक समय में उपयोगकर्ताओं के सवालों के जवाब देने के लिए काम पर लगाया जाना चाहिए। इसे "इन्फरेंस" (inference) कहा जाता है। उन्होंने विभिन्न लंबाई के सवालों के जवाब देने की गति का परीक्षण किया।
छोटे सवाल (सरल कार्य):
- बहुत छोटे सवालों के जवाब देने में GPU स्कूल थोड़ा तेज़ था।
- इन त्वरित कार्यों के लिए यह थोड़ा सस्ता भी था।
- उपमा: यदि आपको बस एक कॉफी खरीदनी है, तो स्थानीय दुकान (GPU) थोड़ी अधिक कुशल है।
लंबे सवाल (जटिल कार्य):
- जब सवाल लंबे (4,000+ शब्द) हो गए, तो TPU स्कूल ने पूरी तरह से दबदबा बना लिया।
- गति: लंबे सवाल का जवाब देना शुरू करने में (Time-to-First-Token) TPU 23 गुना तेज़ था।
- क्षमता: TPU बिना धीमे हुए एक साथ लंबे सवाल पूछने वाले 4 गुना अधिक लोगों को संभाल सकता था।
- उपमा: यदि आपको पूरा उपन्यास लिखना है, तो TPU स्कूल के पास एक विशाल पुस्तकालय और लेखकों की एक टीम है जो बिना किसी बाधा के मिलकर काम कर सकती है। GPU स्कूल अभिभूत हो जाता है और किताबें गिराना शुरू कर देता है।
5. अंतिम निर्णय
लेखक निष्कर्ष निकालते हैं कि उनकी विशिष्ट आवश्यकताओं के लिए (एक बड़े मॉडल को प्रशिक्षित करना और उसे उपयोगकर्ताओं को सेवा देना), Google का TPU विजेता है।
- प्रशिक्षण: TPU स्पष्ट विजेता है (तेज़ और बहुत सस्ता)।
- इन्फरेंस: जटिल या लंबे कार्यों के लिए TPU चैंपियन है। बहुत सरल, छोटे कार्यों के लिए, GPU अभी भी थोड़ा बेहतर है।
- कुल लागत: जब आप प्रशिक्षण लागत और उपयोगकर्ताओं को सेवा देने के एक दिन को जोड़ते हैं, तो TPU सेटअप कुल मिलाकर 1.8 गुना सस्ता था।
निचोड़:
TPU स्कूल में स्विच करने के लिए शुरुआत में बहुत कड़ी मेहनत (एक नई भाषा सीखना, फर्नीचर ठीक करना, पुल बनाना) की आवश्यकता थी। लेकिन एक बार जब वे सेटल हो गए, तो स्कूल तेज़ चला, कम खर्च आया, और बड़े, जटिल कार्यों को GPU स्कूल की तुलना में बहुत बेहतर तरीके से संभाला। भारी AI कार्य करने वाली कंपनी के लिए, स्विच करने का अतिरिक्त प्रयास बचत और प्रदर्शन के लायक था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।