ZAYA1-8B Technical Report
यह शोध पत्र ZAYA1-8B को प्रस्तुत करता है, जो पूरी तरह से AMD इंफ्रास्ट्रक्चर पर प्रशिक्षित एक अत्यधिक कुशल 8B-पैरामीटर वाला MoE रीजनिंग मॉडल है, जो एक विशेष चार-चरणीय RL कैस्केड और नवीन मार्कोवियन RSA टेस्ट-टाइम कंप्यूट पद्धति के माध्यम से गणित और कोडिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है, जो प्रभावी रूप से बहुत बड़े मॉडलों के साथ के अंतर को कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ ZAYA1-8B के तकनीकी विवरण का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।
बड़ी तस्वीर: एक छोटा दिमाग लेकिन एक महाशक्ति
कल्पना कीजिए कि आपके पास ZAYA1-8B नाम का एक छोटा, अविश्वसनीय रूप से बुद्धिमान छात्र है। इस छात्र के पास केवल 700 मिलियन सक्रिय न्यूरॉन्स (एक AI के लिए बहुत छोटा आकार) वाला मस्तिष्क है, लेकिन वे 8 बिलियन कुल न्यूरॉन्स वाले एक बड़े "स्कूल" का हिस्सा हैं।
आमतौर पर, कठिन गणित की समस्याओं को हल करने या जटिल कोड लिखने के लिए, आपको एक विशाल मस्तिष्क (जैसे अरबों पैरामीटर्स वाला एक बड़ा AI) की आवश्यकता होती है। ZAYA1-8B विशेष है क्योंकि, छोटा होने के बावजूद, यह इन कठिन समस्याओं को बहुत बड़े "प्रतिभाशाली" छात्रों के समान या उनसे भी बेहतर तरीके से हल कर सकता है।
कैसे? तीन गुप्त हथियारों का उपयोग करके: सोचने का एक नया तरीका, एक विशेष प्रशिक्षण शिविर, और अपने काम की जाँच करने का एक अनूठा तरीका।
1. आर्किटेक्चर (संरचना): एक विशेषज्ञ टीम
अधिकांश AI मॉडल एक अकेले व्यक्ति की तरह होते हैं जो सब कुछ अकेले करने की कोशिश करता है। ZAYA1-8B "Mixture of Experts" (MoE) का उपयोग करके एक विशेषज्ञ टीम की तरह बनाया गया है।
- टीम: एक कक्षा की कल्पना करें जिसमें 16 अलग-अलग शिक्षक (विशेषज्ञ) हैं। जब कोई प्रश्न आता है, तो एक "रूटर" (क्लास मॉनिटर) यह तय करता है कि कौन सा शिक्षक उत्तर देने के लिए सबसे उपयुक्त है।
- नया मॉनिटर (ZAYA1 Router): पुराने मॉडलों में, मॉनिटर एक साधारण नियम का पालन करने वाला था। ZAYA1-8B एक स्मार्ट, मल्टी-लेयर्ड मॉनिटर का उपयोग करता है जो यह निर्णय लेने में बेहतर होता है कि किसे पढ़ाना चाहिए, जिससे यह सुनिश्चित होता है कि हर बार सही विशेषज्ञ ही काम संभाले।
- संकुचित लाइब्रेरी (CCA): लंबी किताबें पढ़ने या लंबी कहानियों को याद रखने के लिए, मॉडल एक "संकुचित लाइब्रेरी" प्रणाली का उपयोग करता है। अपने दिमाग में हर एक किताब का पन्ना रखने के बजाय, यह एक सारांशित, संकुचित संस्करण संग्रहीत करता है जो स्थान और ऊर्जा बचाता है लेकिन सभी महत्वपूर्ण विवरणों को बनाए रखता है। यह इसे बिना थके बहुत लंबी बातचीत संभालने में सक्षम बनाता है।
2. प्रशिक्षण: बोलने से पहले सोचना सीखना
यह पेपर एक अनूठी प्रशिक्षण प्रक्रिया का वर्णन करता है जिसे इस छात्र को एक 'रीजनिंग मशीन' (तर्क करने वाली मशीन) में बदलने के लिए डिज़ाइन किया गया है।
- "उत्तर-संरक्षण" ट्रिम (Answer-Preserving Trim): शिक्षकों के पास अक्सर लंबे, विस्तृत स्पष्टीकरण (तर्क के निशान) होते हैं जो एक टेक्स्टबुक के एक एकल पृष्ठ पर फिट नहीं होते। कहानी के बीच के हिस्से को काटने के बजाय (जो तर्क को खराब कर देगा), ZAYA1-8B एक विशेष ट्रिक का उपयोग करता है: यह स्पष्टीकरण के अंत को काट देता है लेकिन अंतिम उत्तर को सुरक्षित रखता है। यह मॉडल को योजना बनाना और सोचना सिखाता है, भले ही पूरी विचार प्रक्रिया एक बार में फिट होने के लिए बहुत लंबी क्यों न हो।
- चार चरणों वाला बूट कैंप: बुनियादी बातें सीखने के बाद, मॉडल एक कठोर "रीइन्फोर्समेंट लर्निंग" (RL) बूट कैंप से गुजरा:
- वार्म-अप: कठिन सोचने की आदत डालने के लिए आसान पहेलियाँ और गणित की समस्याएँ हल करना।
- जिम: एक कस्टम वातावरण जिसमें 400 अलग-अलग पहेली जनरेटर हैं जो मॉडल के बेहतर होने के साथ-साथ कठिन होते जाते हैं।
- मुख्य कार्यक्रम: वास्तविक गणित और कोडिंग चुनौतियों का सामना करना, जिसमें एक विशेष "टेस्ट-टाइम कंप्यूट" (TTC) चरण शामिल है जहाँ यह कई संभावित उत्तर उत्पन्न करना और सबसे अच्छा चुनना सीखता है।
- पॉलिशिंग: एक सहायक के रूप में विनम्रता से चैट करने और निर्देशों का पालन करने के लिए अंतिम चरण।
3. गुप्त सूत्र: "मार्कोवियन RSA" (सामूहिक सोच)
यह इस पेपर का सबसे अभिनव हिस्सा है। आमतौर पर, जब एक AI किसी कठिन समस्या को हल करता है, तो वह एक लंबे, निरंतर प्रवाह में उत्तर सोचने की कोशिश करता है। यदि प्रवाह बहुत लंबा हो जाता है, तो AI भ्रमित हो जाता है।
ZAYA1-8B मार्कोवियन RSA नामक एक विधि का उपयोग करता है। इसे एक ट्विस्ट के साथ रिले रेस के रूप में सोचें:
- रेस: एक धावक द्वारा पूरी मैराथन दौड़ने के बजाय, मॉडल एक ही समय में 16 धावक (उम्मीदवार) भेजता है।
- हैंडऑफ (सौंपना): प्रत्येक धावक एक छोटी, सुरक्षित दूरी (एक "टेल" जो 4,000 शब्दों की है) तक दौड़ता है। वे दौड़ का पूरा इतिहास अपने साथ नहीं ले जाते; वे बस अपने पिछले कुछ कदम (टेल) अगले दौर को सौंप देते हैं।
- एकत्रीकरण (Aggregation): एक "कोच" सभी 16 धावकों के अंतिम कुछ कदमों को देखता है, सबसे अच्छे विचारों को जोड़ता है, और उन्हें अगले दौर के लिए भेज देता है।
- परिणाम: सोचने की प्रक्रिया को छोटे, प्रबंधनीय टुकड़ों में तोड़कर और सबसे अच्छे रास्ते पर वोट करने के लिए टीम का उपयोग करके, ZAYA1-8B उन कठिन गणितीय समस्याओं (जैसे AIME और HMMT प्रतियोगिताएं) को हल कर सकता है जिनमें आमतौर पर बहुत बड़े मस्तिष्क की आवश्यकता होती है।
उपमा: एक विशाल जिग्सॉ पहेली (jigsaw puzzle) को हल करने की कोशिश करने की कल्पना करें।
- पुराना तरीका: एक व्यक्ति एक साथ पूरे पहेली को अपने दिमाग में रखने की कोशिश करता है। वह अभिभूत (overwhelmed) हो जाता है।
- ZAYA1-8B का तरीका: आप 16 लोगों को छोटे हिस्सों पर काम करने के लिए भेजते हैं। वे केवल अपने हिस्से के कुछ टुकड़े ही अगले समूह को सौंपते हैं। समूह पूरे चित्र को बनाने के लिए इन छोटे टुकड़ों को जोड़ता है। यह तेज़ है, कम मेमोरी का उपयोग करता है, और बेहतर परिणाम देता है।
4. हार्डवेयर: AMD पर निर्मित
इस पूरे मॉडल को AMD कंप्यूटर चिप्स (विशेष रूप से MI300X GPU) का उपयोग करके प्रशिक्षित किया गया था। यह एक बड़ी बात है क्योंकि यह साबित करता है कि शीर्ष स्तर के रीजनिंग मॉडल को प्रशिक्षित करने के लिए आपको सबसे महंगे, मालिकाना (proprietary) चिप्स की आवश्यकता नहीं है। टीम ने दिखाया कि सही सॉफ्टवेयर और हार्डवेयर सेटअप के साथ, AMD चिप्स जटिल AI प्रशिक्षण का भारी काम संभाल सकते हैं।
5. परिणाम: छोटा लेकिन शक्तिशाली
पेपर का दावा है कि इस सेटअप के साथ:
- ZAYA1-8B (केवल 0.7 बिलियन सक्रिय पैरामीटर्स के साथ) गणित और कोडिंग परीक्षणों पर DeepSeek-R1 (जिसमें 37 बिलियन सक्रिय पैरामीटर्स हैं) को मात देता है या उसके बराबर प्रदर्शन करता है।
- जब "मार्कोवियन RSA" सामूहिक-सोच पद्धति का उपयोग किया जाता है, तो यह कठिन गणित प्रतियोगिताओं में ऐसे स्कोर प्राप्त करता है जो Gemini-2.5 Pro और GPT-5-High जैसे विशाल, महंगे मॉडलों के बहुत करीब हैं।
सारांश
ZAYA1-8B एक छोटा, कुशल AI है जो यह साबित करता है कि जीनियस बनने के लिए आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है। एक स्मार्ट टीम संरचना, एक विशेष प्रशिक्षण पद्धति जो उत्तरों को सुरक्षित रखती है, और सोचने के लिए "ग्रुप रिले रेस" रणनीति का उपयोग करके, यह अपने बड़े प्रतिस्पर्धियों की तुलना में बहुत कम कंप्यूटिंग पावर का उपयोग करते हुए सबसे कठिन गणित और कोडिंग समस्याओं को हल कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।