← नवीनतम पेपर
🤖 machine learning

Structured Recurrent Mixers for Massively Parallelized Sequence Generation

यह शोध पत्र स्ट्रक्चर्ड रिकरेंट मिक्सर (SRM) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो मौजूदा लीनियर-कॉम्प्लेक्सिटी मॉडल्स की तुलना में बेहतर प्रशिक्षण दक्षता, सूचना क्षमता और अनुमान थ्रूपुट प्राप्त करने के लिए समानांतर प्रशिक्षण और रिकरेंट अनुमान के बीच बीजगणितीय रूपांतरण को सक्षम बनाता है, जबकि मानक बेंचमार्क और सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) कार्यों दोनों में महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।

मूल लेखक: Benjamin L. Badger

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benjamin L. Badger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके शोध पत्र (paper) का स्पष्टीकरण दिया गया है।

बड़ी समस्या: "असेंबली लाइन" बनाम "लाइब्रेरी"

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, एक बार में एक शब्द।

  • पुराना तरीका (Recurrent Models): इसे एक एकल लेखक के रूप में सोचें जो डेस्क पर बैठा है। वह एक शब्द लिखता है, उसे याद रखता है, अगला लिखता है, और इसी तरह चलता रहता है। वे चलते समय कहानी को याद रखने में बहुत कुशल होते हैं (कम मेमोरी उपयोग), लेकिन वे एक बार में केवल एक ही शब्द लिख सकते हैं। यदि आप चाहते हैं कि 100 कहानियाँ लिखी जाएँ, तो आपको अगली कहानी शुरू करने से पहले एक लेखक के खत्म करने का इंतज़ार करना होगा।
  • आधुनिक मानक (Transformers): इसे एक विशाल लाइब्रेरी के रूप में सोचें जहाँ आप एक कहानी के हर शब्द को एक साथ देख सकते हैं। यह ट्रेनिंग के लिए बहुत अच्छा है क्योंकि आप पूरी किताब को समानांतर (parallel) में पढ़ सकते हैं। हालाँकि, जब कहानी लिखने (inference) का समय आता है, तो लाइब्रेरी जाम हो जाती है। अगला शब्द लिखने के लिए, लाइब्रेरी को आपके द्वारा लिखी गई पूरी किताब को फिर से स्कैन करना पड़ता है ताकि संदर्भ (context) मिल सके। जैसे-जैसे कहानी लंबी होती जाती है, लाइब्रेरी धीमी होती जाती है, और उन सभी किताबों को रखने के लिए इसे बहुत अधिक स्थान (मेमोरी) की आवश्यकता होती है।

दुविधा: हम ट्रेनिंग के लिए लाइब्रेरी की गति चाहते हैं, लेकिन टेक्स्ट जेनरेट करने के लिए एकल लेखक की दक्षता चाहते हैं।

समाधान: "स्ट्रक्चर्ड रिकरेंट मिक्सर" (SRM)

लेखक एक नया आर्किटेक्चर पेश करते हैं जिसे स्ट्रक्चर्ड रिकरेंट मिक्सर (SRM) कहा जाता है। आप SRM को एक गिरगिट या एक ट्रांसफॉर्मर (सुपरहीरो के अर्थ में, AI के अर्थ में नहीं) के रूप में देख सकते हैं जो जो कुछ भी कर रहा है उसके आधार पर अपना आकार बदल सकता है।

  1. ट्रेनिंग के दौरान (लाइब्रेरी मोड): जब मॉडल सीख रहा होता है, तो यह एक विशाल लाइब्रेरी की तरह काम करता है। यह शब्दों के पूरे क्रम को एक साथ देखता है। यह सीखने की प्रक्रिया को तेज़ और स्थिर बनाता है।
  2. इन्फरेंस के दौरान (लेखक मोड): जब मॉडल वास्तव में टेक्स्ट जेनरेट कर रहा होता है, तो यह तुरंत एक एकल लेखक में बदल जाता है। इसे पूरी किताब को फिर से स्कैन करने की आवश्यकता नहीं होती; यह बस अभी जो लिखा है उसका एक छोटा, स्थिर आकार का "नोटबुक" (कैश) रखता है। यह इसे अविश्वसनीय रूप से तेज़ बनाता है और इसे एक साथ कई कहानियाँ संभालने में सक्षम बनाता है।

जादुई ट्रिक यह है कि SRM के पीछे का गणित इसे इन दोनों मोड के बीच बीजगणितीय (algebraically) रूप से स्विच करने की अनुमति देता है। यह एक ब्लूप्रिंट जैसा है जो कहता है, "यदि हम निर्माण कर रहे हैं, तो हम इन ईंटों का उपयोग करेंगे; यदि हम इसमें रह रहे हैं, तो हम इन दीवारों का उपयोग करेंगे," बिना इमारत को गिराए और दोबारा बनाए बिना।

यह क्यों मायने रखता है: "बैच" बनाम "लंबाई"

यह पेपर इस बारे में एक महत्वपूर्ण अवलोकन करता है कि हमें AI को कैसे स्केल करना चाहिए:

  • लंबाई को स्केल करना (कहानी): पेपर का तर्क है कि इन "एकल लेखक" मॉडल्स को अनंत लंबी किताबें पढ़ने के लिए बनाना एक बुरा विचार है। अंततः, लेखक की याददाश्त (नोटबुक) बहुत भर जाएगी, और वे विवरण भूलने लगेंगे। यह एक 1,000 पन्नों के उपन्यास को 1 पन्ने की नोटबुक में याद रखने की कोशिश करने जैसा है; आप जानकारी खो देंगे।
  • बैच को स्केल करना (भीड़): हालाँकि, ये मॉडल एक ही समय में कई अलग-अलग कहानियों को संभालने में अद्भुत हैं। क्योंकि उन्हें प्रत्येक कहानी के लिए एक विशाल लाइब्रेरी की आवश्यकता नहीं होती है, आप 100 अलग-अलग कहानियों पर 100 अलग-अलग लेखकों को समानांतर में काम करने के लिए रख सकते हैं बिना उन्हें एक-दूसरे से टकराए।

उपमा: एक कॉफी शॉप की कल्पना करें।

  • Transformers एक ऐसी दुकान की तरह हैं जिसमें एक विशाल एस्प्रेसो मशीन है जिसे एक सिंगल लाटे बनाने में 10 मिनट लगते हैं, लेकिन यदि आपके पास एक बड़ा काउंटर है तो यह एक साथ 100 कप बना सकती है। जैसे-जैसे ऑर्डर जटिल होता जाता है, मशीन धीमी हो जाती है।
  • SRMs 100 साधारण, तेज़ मैनुअल ब्रुअर्स (manual brewers) की तरह हैं। प्रत्येक ब्रूअर जल्दी से एक कप बनाता है और रेसिपी को अपने दिमाग में रखता है। आप एक सिंगल ब्रूअर पर 100 कप का ऑर्डर नहीं बना सकते (बहुत अधिक मेमोरी), लेकिन आप 1,000 अलग-अलग ब्रुअर्स का उपयोग करके एक साथ 1,000 ग्राहकों को सेवा दे सकते हैं।

परिणाम: गति और मात्रा

इस नए आर्किटेक्चर के परीक्षण में कुछ प्रभावशाली आंकड़े सामने आए:

  • गति: स्टैंडर्ड हार्डवेयर पर, SRM टेक्स्ट जेनरेट करने में एक स्टैंडर्ड ट्रांसफॉर्मर की तुलना में 12 गुना तेज़ था।
  • कन्करेंसी (Concurrency): यह एक ट्रांसफॉर्मर की तुलना में 170 गुना अधिक एक साथ अनुरोधों (यूजर्स) को संभाल सकता था।
  • सटीकता: भले ही यह इतना तेज़ था और इसने इतने सारे अनुरोधों को संभाला, फिर भी इसने अपनी बुद्धिमत्ता नहीं खोई। गणित के परीक्षणों (GSM8k) में, इसने समान कंप्यूटर पावर दिए जाने पर एक ट्रांसफॉर्मर की तुलना में लगभग 30% अधिक समस्याओं को हल किया।

"रीइन्फोर्समेंट लर्निंग" ट्विस्ट

पेपर ने यह भी देखा कि यह रीइन्फोर्समेंट लर्निंग (गलतियों से सीखकर AI को सिखाना) में कैसे मदद करता है।

एक कुत्ते को गेंद लाना सिखाने की कल्पना करें।

  • मानक दृष्टिकोण: आप कुत्ते को एक बार बाहर भेजते हैं। यदि वह विफल होता है, तो आप फिर से प्रयास करते हैं।
  • SRM दृष्टिकोण: क्योंकि SRM बहुत तेज़ है, आप एक ही समय में 50 कुत्तों को बाहर भेज सकते हैं। आप देखते हैं कि कौन से कुत्ते गेंद पकड़ पाए, और आप केवल विजेताओं को पुरस्कृत करते हैं।

पेपर ने पाया कि एक साथ कई सैंपल जेनरेट करके और एक विशेष "रीसैंपलिंग" ट्रिक (यह सुनिश्चित करना कि आपके पास सीखने के लिए पर्याप्त "अच्छे" उदाहरण हैं) का उपयोग करके, SRM ने उन मॉडल्स की तुलना में बहुत बेहतर सीखा जिन्होंने केवल कुछ ही बार प्रयास किया था।

सारांश

स्ट्रक्चर्ड रिकरेंट मिक्सर एक नया AI डिज़ाइन है जो दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त करता है:

  1. यह एक आधुनिक समानांतर कंप्यूटर की तरह कुशलता से सीखता है।
  2. यह एक सरल, कम मेमोरी वाले लेखक की तरह कुशलता से टेक्स्ट जेनरेट करता है।
  3. यह एक साथ विशाल भीड़ को संभालने के लिए बनाया गया है, जो कि अब अधिक महत्वपूर्ण होता जा रहा है क्योंकि AI "एक बड़े उत्तर" से "कई त्वरित उत्तरों" की ओर बढ़ रहा है।

पेपर निष्कर्ष निकालता है कि जबकि हम अक्सर AI को लंबी किताबें पढ़ाकर स्मार्ट बनाने की कोशिश करते हैं, हमें इसके बजाय एक साथ कई अलग-अलग कार्यों को संभालने में इसे तेज़ बनाने पर ध्यान केंद्रित करना चाहिए, और SRM उस काम के लिए एकदम सही उपकरण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →