← नवीनतम पेपर
💬 NLP

ZAYA1-8B Technical Report

यह शोध पत्र ZAYA1-8B को प्रस्तुत करता है, जो पूरी तरह से AMD इंफ्रास्ट्रक्चर पर प्रशिक्षित एक अत्यधिक कुशल 8B-पैरामीटर वाला MoE रीजनिंग मॉडल है, जो एक विशेष चार-चरणीय RL कैस्केड और नवीन मार्कोवियन RSA टेस्ट-टाइम कंप्यूट पद्धति के माध्यम से गणित और कोडिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है, जो प्रभावी रूप से बहुत बड़े मॉडलों के साथ के अंतर को कम करता है।

मूल लेखक: Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepal
प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepalli, Skyler Szot, Srivatsan Rajagopal, Alex Ong, Bhavana Mehta, Beren Millidge

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ZAYA1-8B के तकनीकी विवरण का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी तस्वीर: एक छोटा दिमाग लेकिन एक महाशक्ति

कल्पना कीजिए कि आपके पास ZAYA1-8B नाम का एक छोटा, अविश्वसनीय रूप से बुद्धिमान छात्र है। इस छात्र के पास केवल 700 मिलियन सक्रिय न्यूरॉन्स (एक AI के लिए बहुत छोटा आकार) वाला मस्तिष्क है, लेकिन वे 8 बिलियन कुल न्यूरॉन्स वाले एक बड़े "स्कूल" का हिस्सा हैं।

आमतौर पर, कठिन गणित की समस्याओं को हल करने या जटिल कोड लिखने के लिए, आपको एक विशाल मस्तिष्क (जैसे अरबों पैरामीटर्स वाला एक बड़ा AI) की आवश्यकता होती है। ZAYA1-8B विशेष है क्योंकि, छोटा होने के बावजूद, यह इन कठिन समस्याओं को बहुत बड़े "प्रतिभाशाली" छात्रों के समान या उनसे भी बेहतर तरीके से हल कर सकता है।

कैसे? तीन गुप्त हथियारों का उपयोग करके: सोचने का एक नया तरीका, एक विशेष प्रशिक्षण शिविर, और अपने काम की जाँच करने का एक अनूठा तरीका।


1. आर्किटेक्चर (संरचना): एक विशेषज्ञ टीम

अधिकांश AI मॉडल एक अकेले व्यक्ति की तरह होते हैं जो सब कुछ अकेले करने की कोशिश करता है। ZAYA1-8B "Mixture of Experts" (MoE) का उपयोग करके एक विशेषज्ञ टीम की तरह बनाया गया है।

  • टीम: एक कक्षा की कल्पना करें जिसमें 16 अलग-अलग शिक्षक (विशेषज्ञ) हैं। जब कोई प्रश्न आता है, तो एक "रूटर" (क्लास मॉनिटर) यह तय करता है कि कौन सा शिक्षक उत्तर देने के लिए सबसे उपयुक्त है।
  • नया मॉनिटर (ZAYA1 Router): पुराने मॉडलों में, मॉनिटर एक साधारण नियम का पालन करने वाला था। ZAYA1-8B एक स्मार्ट, मल्टी-लेयर्ड मॉनिटर का उपयोग करता है जो यह निर्णय लेने में बेहतर होता है कि किसे पढ़ाना चाहिए, जिससे यह सुनिश्चित होता है कि हर बार सही विशेषज्ञ ही काम संभाले।
  • संकुचित लाइब्रेरी (CCA): लंबी किताबें पढ़ने या लंबी कहानियों को याद रखने के लिए, मॉडल एक "संकुचित लाइब्रेरी" प्रणाली का उपयोग करता है। अपने दिमाग में हर एक किताब का पन्ना रखने के बजाय, यह एक सारांशित, संकुचित संस्करण संग्रहीत करता है जो स्थान और ऊर्जा बचाता है लेकिन सभी महत्वपूर्ण विवरणों को बनाए रखता है। यह इसे बिना थके बहुत लंबी बातचीत संभालने में सक्षम बनाता है।

2. प्रशिक्षण: बोलने से पहले सोचना सीखना

यह पेपर एक अनूठी प्रशिक्षण प्रक्रिया का वर्णन करता है जिसे इस छात्र को एक 'रीजनिंग मशीन' (तर्क करने वाली मशीन) में बदलने के लिए डिज़ाइन किया गया है।

  • "उत्तर-संरक्षण" ट्रिम (Answer-Preserving Trim): शिक्षकों के पास अक्सर लंबे, विस्तृत स्पष्टीकरण (तर्क के निशान) होते हैं जो एक टेक्स्टबुक के एक एकल पृष्ठ पर फिट नहीं होते। कहानी के बीच के हिस्से को काटने के बजाय (जो तर्क को खराब कर देगा), ZAYA1-8B एक विशेष ट्रिक का उपयोग करता है: यह स्पष्टीकरण के अंत को काट देता है लेकिन अंतिम उत्तर को सुरक्षित रखता है। यह मॉडल को योजना बनाना और सोचना सिखाता है, भले ही पूरी विचार प्रक्रिया एक बार में फिट होने के लिए बहुत लंबी क्यों न हो।
  • चार चरणों वाला बूट कैंप: बुनियादी बातें सीखने के बाद, मॉडल एक कठोर "रीइन्फोर्समेंट लर्निंग" (RL) बूट कैंप से गुजरा:
    1. वार्म-अप: कठिन सोचने की आदत डालने के लिए आसान पहेलियाँ और गणित की समस्याएँ हल करना।
    2. जिम: एक कस्टम वातावरण जिसमें 400 अलग-अलग पहेली जनरेटर हैं जो मॉडल के बेहतर होने के साथ-साथ कठिन होते जाते हैं।
    3. मुख्य कार्यक्रम: वास्तविक गणित और कोडिंग चुनौतियों का सामना करना, जिसमें एक विशेष "टेस्ट-टाइम कंप्यूट" (TTC) चरण शामिल है जहाँ यह कई संभावित उत्तर उत्पन्न करना और सबसे अच्छा चुनना सीखता है।
    4. पॉलिशिंग: एक सहायक के रूप में विनम्रता से चैट करने और निर्देशों का पालन करने के लिए अंतिम चरण।

3. गुप्त सूत्र: "मार्कोवियन RSA" (सामूहिक सोच)

यह इस पेपर का सबसे अभिनव हिस्सा है। आमतौर पर, जब एक AI किसी कठिन समस्या को हल करता है, तो वह एक लंबे, निरंतर प्रवाह में उत्तर सोचने की कोशिश करता है। यदि प्रवाह बहुत लंबा हो जाता है, तो AI भ्रमित हो जाता है।

ZAYA1-8B मार्कोवियन RSA नामक एक विधि का उपयोग करता है। इसे एक ट्विस्ट के साथ रिले रेस के रूप में सोचें:

  • रेस: एक धावक द्वारा पूरी मैराथन दौड़ने के बजाय, मॉडल एक ही समय में 16 धावक (उम्मीदवार) भेजता है।
  • हैंडऑफ (सौंपना): प्रत्येक धावक एक छोटी, सुरक्षित दूरी (एक "टेल" जो 4,000 शब्दों की है) तक दौड़ता है। वे दौड़ का पूरा इतिहास अपने साथ नहीं ले जाते; वे बस अपने पिछले कुछ कदम (टेल) अगले दौर को सौंप देते हैं।
  • एकत्रीकरण (Aggregation): एक "कोच" सभी 16 धावकों के अंतिम कुछ कदमों को देखता है, सबसे अच्छे विचारों को जोड़ता है, और उन्हें अगले दौर के लिए भेज देता है।
  • परिणाम: सोचने की प्रक्रिया को छोटे, प्रबंधनीय टुकड़ों में तोड़कर और सबसे अच्छे रास्ते पर वोट करने के लिए टीम का उपयोग करके, ZAYA1-8B उन कठिन गणितीय समस्याओं (जैसे AIME और HMMT प्रतियोगिताएं) को हल कर सकता है जिनमें आमतौर पर बहुत बड़े मस्तिष्क की आवश्यकता होती है।

उपमा: एक विशाल जिग्सॉ पहेली (jigsaw puzzle) को हल करने की कोशिश करने की कल्पना करें।

  • पुराना तरीका: एक व्यक्ति एक साथ पूरे पहेली को अपने दिमाग में रखने की कोशिश करता है। वह अभिभूत (overwhelmed) हो जाता है।
  • ZAYA1-8B का तरीका: आप 16 लोगों को छोटे हिस्सों पर काम करने के लिए भेजते हैं। वे केवल अपने हिस्से के कुछ टुकड़े ही अगले समूह को सौंपते हैं। समूह पूरे चित्र को बनाने के लिए इन छोटे टुकड़ों को जोड़ता है। यह तेज़ है, कम मेमोरी का उपयोग करता है, और बेहतर परिणाम देता है।

4. हार्डवेयर: AMD पर निर्मित

इस पूरे मॉडल को AMD कंप्यूटर चिप्स (विशेष रूप से MI300X GPU) का उपयोग करके प्रशिक्षित किया गया था। यह एक बड़ी बात है क्योंकि यह साबित करता है कि शीर्ष स्तर के रीजनिंग मॉडल को प्रशिक्षित करने के लिए आपको सबसे महंगे, मालिकाना (proprietary) चिप्स की आवश्यकता नहीं है। टीम ने दिखाया कि सही सॉफ्टवेयर और हार्डवेयर सेटअप के साथ, AMD चिप्स जटिल AI प्रशिक्षण का भारी काम संभाल सकते हैं।

5. परिणाम: छोटा लेकिन शक्तिशाली

पेपर का दावा है कि इस सेटअप के साथ:

  • ZAYA1-8B (केवल 0.7 बिलियन सक्रिय पैरामीटर्स के साथ) गणित और कोडिंग परीक्षणों पर DeepSeek-R1 (जिसमें 37 बिलियन सक्रिय पैरामीटर्स हैं) को मात देता है या उसके बराबर प्रदर्शन करता है।
  • जब "मार्कोवियन RSA" सामूहिक-सोच पद्धति का उपयोग किया जाता है, तो यह कठिन गणित प्रतियोगिताओं में ऐसे स्कोर प्राप्त करता है जो Gemini-2.5 Pro और GPT-5-High जैसे विशाल, महंगे मॉडलों के बहुत करीब हैं।

सारांश

ZAYA1-8B एक छोटा, कुशल AI है जो यह साबित करता है कि जीनियस बनने के लिए आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है। एक स्मार्ट टीम संरचना, एक विशेष प्रशिक्षण पद्धति जो उत्तरों को सुरक्षित रखती है, और सोचने के लिए "ग्रुप रिले रेस" रणनीति का उपयोग करके, यह अपने बड़े प्रतिस्पर्धियों की तुलना में बहुत कम कंप्यूटिंग पावर का उपयोग करते हुए सबसे कठिन गणित और कोडिंग समस्याओं को हल कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →