Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion
ऑर्थ्रस (Orthrus) एक मेमोरी-कुशल द्वि-आर्किटेक्चर फ्रेमवर्क है जो समानांतर टोकन जनरेशन को सक्षम करने के लिए एक हल्के डिफ्यूजन मॉड्यूल को एक फ्रीज़्ड ऑटो-रिग्रेसिव एलएलएम (LLM) के साथ एकीकृत करता है, जबकि एक साझा केवी (KV) कैश और सटीक सर्वसम्मति तंत्र के माध्यम से लॉसलेस इन्फरेंस फिडेलिटी की गारंटी देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक लंबी, जटिल कहानी लिखने की कोशिश कर रहे हैं। आपके पास इसे करने के दो तरीके हैं, लेकिन दोनों में एक बड़ी खामी है:
"एक-एक-शब्द-लिखने वाला" लेखक (ऑटोरेग्रेसिव मॉडल): यह लेखक अविश्वसनीय रूप से बुद्धिमान और सटीक है। वे हर एक शब्द लिखने से पहले उसके बारे में बहुत सोच-समझकर विचार करते हैं, ताकि कहानी पूरी तरह से तर्कसंगत बने। हालांकि, वे धीमे हैं। उन्हें एक शब्द पूरा करना होता है, फिर अपने नोट्स देखना होता है, अगले शब्द के बारे में सोचना होता है, और फिर उसे लिखना होता है। वे अपनी गति नहीं बढ़ा सकते क्योंकि उन्हें गलती करने का डर है।
"बैच लेखक" (डिफ्यूजन मॉडल): यह लेखक एक साथ पूरा पैराग्राफ लिखने की कोशिश करता है। वे बहुत तेज़ हैं! लेकिन क्योंकि वे प्रत्येक शब्द की सावधानीपूर्वक जांच किए बिना एक साथ कई शब्दों का अनुमान लगाते हैं, इसलिए वे अक्सर तार्किक गलतियाँ करते हैं, कहानी का संदर्भ खो देते हैं, या निरर्थक बातें लिख देते हैं।
Orthrus एक नया फ्रेमवर्क है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है। यह एक "दोहरी आवाज़" वाली प्रणाली बनाता है जो आपको सावधानीपूर्वक लिखने वाले की सटीकता खोए बिना, एक साथ पूरा पैराग्राफ लिखने की अनुमति देता है।
यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:
"वास्तुकार और निर्माता" की उपमा
AI मॉडल को एक निर्माण स्थल के रूप में सोचें जहाँ दो कर्मचारी हैं: वास्तुकार (The Architect) और निर्माता (The Builder)।
- वास्तुकार (द फ्रोजन एलएलएम - The Frozen LLM): यह मूल, अत्यधिक प्रशिक्षित, सुपर-स्मार्ट मॉडल है। वे विशेषज्ञ हैं जिन्हें पता है कि इमारत कैसी दिखनी चाहिए। वे "फ्रोजन" (जमे हुए) हैं, जिसका अर्थ है कि वे इस प्रक्रिया के दौरान अपना विचार नहीं बदलते या नई चीजें नहीं सीखते; वे बस एक आदर्श ब्लूप्रिंट प्रदान करते हैं।
- निर्माता (द डिफ्यूजन मॉड्यूल - The Diffusion Module): यह टीम में जोड़ा गया एक नया, हल्का कर्मचारी है। उनका काम ईंटें (टोकन) तेज़ी से बिछाना है।
वे मिलकर कैसे काम करते हैं:
- दृश्य निर्धारित करना (प्री-फिलिंग): सबसे पहले, वास्तुकार पूरे प्रॉम्प्ट (निर्देशों) को पढ़ता है और एक सटीक, उच्च-गुणवत्ता वाला "मेमोरी मैप" (जिसे KV कैश कहा जाता है) बनाता है। इस मानचित्र में कहानी के बाकी हिस्से को बनाने के लिए आवश्यक सारा संदर्भ शामिल है।
- समानांतर दौड़ (जेनरेशन): वास्तुकार द्वारा एक-एक करके ईंट बिछाने के बजाय, निर्माता वास्तुकार के मानचित्र को देखता है और एक साथ ईंटों की एक पूरी पंक्ति (मान लीजिए 32 ईंटें) बिछाने की कोशिश करता है।
- सुरक्षा जांच (कंसेंसस): यही असली जादू है। निर्माता के काम को स्वीकार किए जाने से पहले, वास्तुकार तुरंत निर्माता के बैच की जांच करता है।
- यदि निर्माता ने वास्तुकार के सटीक तर्क के अनुसार अगले शब्द का सही अनुमान लगाया, तो वास्तुकार कहता है, "बहुत बढ़िया! इसे रहने दो!"
- यदि निर्माता ने गलत अनुमान लगाया, तो वास्तुकार कहता है, "नहीं, यह सही नहीं है," और तुरंत उस विशिष्ट शब्द को ठीक कर देता है।
- प्रक्रिया अगले बैच के लिए दोहराई जाती है।
यह एक बड़ी बात क्यों है?
- मेमोरी की बर्बादी नहीं: आमतौर पर, यदि आपके पास दो मॉडल काम कर रहे हैं, तो आपको मेमोरी के दो सेटों की आवश्यकता होती है। Orthrus चतुर है क्योंकि निर्माता और वास्तुकार एक ही मेमोरी मैप साझा करते हैं। निर्माता को अपने स्वयं के नोट्स बनाने की आवश्यकता नहीं है; वे बस वास्तुकार के नोट्स देखते हैं। इससे कंप्यूटर मेमोरी की एक बड़ी बचत होती है।
- गुणवत्ता में कोई कमी नहीं: क्योंकि वास्तुकार (मूल स्मार्ट मॉडल) का हर शब्द पर अंतिम निर्णय होता है, इसलिए कहानी उतनी ही अच्छी होती है जितनी कि यदि वास्तुकार ने इसे एक-एक शब्द करके लिखा होता। इसमें कोई "ड्रिफ्ट" या गुणवत्ता का नुकसान नहीं होता।
- भारी गति: निर्माता को एक बार में 32 ईंटें बिछाने देने और केवल तुरंत उनकी जांच करने की अनुमति देकर, Orthrus मानक एक-एक-शब्द-दर-शब्द विधि की तुलना में 7.8 गुना तक तेज़ है।
परिणाम
पेपर ने कठिन कार्यों जैसे गणित की समस्याओं (MATH-500) को हल करने, कोड लिखने और तर्क पहेलियों का उत्तर देने पर इसका परीक्षण किया।
- गति: यह मानक मॉडलों की तुलना में काफी तेज़ था।
- सटीकता: यह मूल धीमे मॉडल के समान ही सटीक था।
- दक्षता: इसे मॉडल के केवल एक छोटे से हिस्से (लग लगभग 16%) के पैरामीटर्स को प्रशिक्षित करने की आवश्यकता थी, जिससे इसे मौजूदा AI सिस्टम में जोड़ना सस्ता और आसान हो गया।
संक्षेप में, Orthrus एक तेज़ पढ़ने वाले को काम पर रखने जैसा है जो किसी कहानी के अगले 30 शब्दों का तुरंत अनुमान लगा सकता है, लेकिन उसके ठीक बगल में एक सख्त संपादक खड़ा है जो किसी भी गलती को तुरंत सुधार देता है। परिणाम एक ऐसी कहानी है जो बिजली की गति से लिखी जाती है और फिर भी पूरी तरह से सटीक होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।