Gemma 4 Technical Report
जेम्मा 4 (Gemma 4) तकनीकी रिपोर्ट एक नई पीढ़ी के ओपन-वेट, नेटिवली मल्टीमॉडल मॉडल्स का परिचय देती है जिसमें विविध आर्किटेक्चर, कच्चे ऑडियो और इमेज प्रोसेसिंग के लिए एनकोडर-मुक्त डिज़ाइन और एक थिंकिंग मोड शामिल है, जो सामूहिक रूप से STEM और लॉन्ग-कॉन्टेक्स्ट बेंचमार्क में दक्षता, तर्क और प्रदर्शन में महत्वपूर्ण प्रगति प्रदान करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि Google DeepMind ने अभी-अभी Gemma 4 का अनावरण किया है, जो "स्मार्ट सहायकों" का एक नया परिवार है जो हर किसी के उपयोग, सुधार और निर्माण के लिए खुला है। इन्हें केवल एक एकल, विशाल रोबोट के रूप में न सोचें, बल्कि विभिन्न आकारों के औजारों के एक पूरे सेट के रूप में सोचें, जो एक छोटे, जेब में रखे जाने वाले मददगार से लेकर एक विशाल, सुपर-कंप्यूटर स्तर के विचारक तक विस्तृत हैं।
यहाँ बताया गया है कि Gemma 4 को क्या विशेष बनाता है, सरल उपमाओं का उपयोग करते हुए:
1. विभिन्न आकारों का एक टूलबॉक्स
पहले, आपके पास शायद एक बड़ा मस्तिष्क या एक छोटा मस्तिष्क होता था। Gemma 4 एक पूरा सेट प्रदान करता है:
- पॉकेट हेल्पर्स (2.3B और 4.5B): ये स्मार्ट वॉच की तरह हैं। ये इतने छोटे हैं कि बिना किसी विशाल सर्वर फार्म की आवश्यकता के आपके फोन या लैपटॉप पर चल सकते हैं।
- वर्कहोर्स (12B और 31B): ये शक्तिशाली डेस्कटॉप कंप्यूटर की तरह हैं, जो जटिल कार्यों को संभालने में सक्षम हैं।
- स्पेशलिस्ट (26B-A4B): यह एक "मिश्रण विशेषज्ञ" (Mixture of Experts) मॉडल है। कल्पना कीजिए कि 26 लोगों की एक टीम है जहाँ, किसी भी दिए गए प्रश्न के लिए, केवल 4 सबसे प्रासंगिक विशेषज्ञ उत्तर देने के लिए आगे आते हैं। यह इसे बहुत स्मार्ट होने के साथ-साथ अविश्वसनीय रूप से तेज़ और कुशल बनाता है।
2. "सोचने वाली टोपी" (रीजनिंग मोड)
सबसे बड़ा अपग्रेड एक नया "थिंकिंग मोड" है।
- पहले: यदि आप किसी मॉडल से कठिन गणित का प्रश्न पूछते, तो वह तुरंत उत्तर का अनुमान लगा लेता।
- अब: मॉडल एक "सोचने वाली टोपी" पहनता है। वह अंतिम उत्तर लिखने से पहले अपने विचारों की प्रक्रिया को खुद से फुसफुसाता है (जैसे एक छात्र रफ पेपर पर समस्या को हल करता है) इससे पहले कि वह अंतिम उत्तर लिखे। यह इसे गणित और कोडिंग की पेचीदा समस्याओं को बहुत बेहतर तरीके से हल करने की अनुमति देता है, ठीक वैसे ही जैसे इंसान समय लेकर सोचने पर करते हैं।
3. चश्मे या कानों के बिना देखना और सुनना
पुराने मॉडलों को चित्रों और ध्वनियों को समझने के लिए विशेष "चश्मे" (विज़न एनकोडर) और "कानों" (ऑडियो एनकोडर) की आवश्यकता होती थी। ये भारी, अलग उपकरण थे जो मस्तिष्क से जुड़े होते थे।
- नया दृष्टिकोण: 12B मॉडल एनकोडर-मुक्त (encoder-free) है। यह ऐसा है जैसे मस्तिष्क ने सीधे देखना और सुनना सीख लिया है। भारी चश्मा पहनने के बजाय, यह छवि के कच्चे पिक्सेल या आवाज की कच्ची तरंगों को देखता है और उन्हें तुरंत समझ लेता है। यह पूरे सिस्टम को हल्का, तेज़ और कम अव्यवस्थित बनाता है।
4. अनंत पुस्तकालय (लॉन्ग कॉन्टेक्स्ट)
कल्पना कीजिए कि आप 1,000 पन्नों की किताब पढ़ने की कोशिश कर रहे हैं और उसके हर विवरण को याद रखने की कोशिश कर रहे हैं। पुराने मॉडल "मेमोरी फॉग" (स्मृति धुंधलापन) का शिकार हो जाते थे और अंत तक पहुँचते-पहुँचते शुरुआत को भूल जाते थे।
- समाधान: Gemma 4 एक चतुर मेमोरी ट्रिक का उपयोग करता है। यह किताब को एक स्लाइडिंग विंडो की तरह मानता है: यह पिछले कुछ पन्नों को हाई डेफिनेशन में याद रखता है (लोकल अटेंशन) लेकिन पूरी किताब का एक संक्षिप्त, कुशल इंडेक्स भी रखता है (ग्लोबल अटेंशन)।
- परिणाम: यह बिना मेमोरी खत्म किए भारी मात्रा में टेक्स्ट (128k या 256k टोकन तक) को पढ़ और याद रख सकता है, और यह पहले की तुलना में 37.5% कम मेमोरी का उपयोग करके करता है।
5. दौड़ में तेजी लाना (एफिशिएंसी)
- भविष्य की भविष्यवाणी करना: मॉडल में एक "ड्राफ्टर" हेड होता है। कल्पना कीजिए कि एक रेस कार ड्राइवर जो न केवल कार चलाता है बल्कि होने वाले अगले तीन मोड़ों की भविष्यवाणी भी करता है। यह मॉडल को वाक्य में अगले कुछ शब्दों का तुरंत अनुमान लगाने की अनुमति देता है, जिससे यह बहुत तेज़ी से बोल पाता है।
- मस्तिष्क को संकुचित करना: टीम ने मॉडल्स को "क्वांटाइज्ड" (quantized) होने के लिए प्रशिक्षित किया है। इसे एक सूटकेस पैक करने की तरह समझें। भारी, फूले हुए कपड़े (फुल प्रिसिजन) पैक करने के बजाय, उन्होंने सब कुछ कसकर फोल्ड किया है (कंप्रेस्ड वेट्स) ताकि यह एक छोटे बैग में फिट हो सके। आप गुणवत्ता में लगभग कोई कमी नहीं आए बिना इन मॉडल्स को मोबाइल उपकरणों पर चला सकते हैं।
6. वे कितने स्मार्ट हैं?
पेपर "एरिना" नामक एक "ब्लाइंड टेस्ट" में अन्य शीर्ष-स्तरीय मॉडलों (जैसे क्लॉड या डीपसीक) के साथ Gemma 4 की तुलना करता है।
- परिणाम: 31B मॉडल अपने आकार की श्रेणी में शीर्ष-रैंक वाला ओपन मॉडल (जिसका अर्थ है कि कोई भी इसे डाउनलोड कर सकता है) है। यह उन मॉडलों के समान प्रदर्शन करता है जो आकार में 10 गुना बड़े हैं।
- छोटा दिग्गज: छोटा 2.3B मॉडल पिछली पीढ़ी के 27B मॉडल के समान प्रदर्शन करता है, जिसका अर्थ है कि यह पहले की तुलना में 10 गुना अधिक कुशल है।
7. सुरक्षा और जिम्मेदारी
ठीक वैसे ही जैसे आप किसी बच्चे को बिना प्रशिक्षण के कार चलाने की अनुमति नहीं देंगे, टीम ने Gemma 4 में बुनियादी स्तर से सुरक्षा को शामिल किया है।
- उन्होंने ट्रेनिंग से पहले खतरनाक या हानिकारक डेटा को फ़िल्टर किया।
- उन्होंने यह सुनिश्चित करने के लिए मॉडलों का कड़ाई से परीक्षण किया कि वे घृणास्पद भाषण, खतरनाक निर्देश या हानिकारक सामग्री उत्पन्न न करें।
- वे स्वीकार करते हैं कि हालांकि ये उपकरण शक्तिशाली हैं, इनका उपयोग जिम्मेदारी से किया जाना चाहिए, और वे डेवलपर्स को सुरक्षित रहने में मदद करने के लिए दिशानिर्देश प्रदान करते हैं।
संक्षेप में: Gemma 4 ओपन एआई की एक नई पीढ़ी है जो तेज़ है, तर्क करने में अधिक स्मार्ट है, सीधे देख और सुन सकती है, और भारी मात्रा में जानकारी को याद रख सकती है—और यह सब इतना छोटा है कि आपके अपने उपकरणों पर चल सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।