← नवीनतम पेपर
🤖 machine learning

Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion

ऑर्थ्रस (Orthrus) एक मेमोरी-कुशल द्वि-आर्किटेक्चर फ्रेमवर्क है जो समानांतर टोकन जनरेशन को सक्षम करने के लिए एक हल्के डिफ्यूजन मॉड्यूल को एक फ्रीज़्ड ऑटो-रिग्रेसिव एलएलएम (LLM) के साथ एकीकृत करता है, जबकि एक साझा केवी (KV) कैश और सटीक सर्वसम्मति तंत्र के माध्यम से लॉसलेस इन्फरेंस फिडेलिटी की गारंटी देता है।

मूल लेखक: Chien Van Nguyen, Chaitra Hegde, Van Cuong Pham, Ryan A. Rossi, Franck Dernoncourt, Thien Huu Nguyen

प्रकाशित 2026-05-14✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chien Van Nguyen, Chaitra Hegde, Van Cuong Pham, Ryan A. Rossi, Franck Dernoncourt, Thien Huu Nguyen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी, जटिल कहानी लिखने की कोशिश कर रहे हैं। आपके पास इसे करने के दो तरीके हैं, लेकिन दोनों में एक बड़ी खामी है:

  1. "एक-एक-शब्द-लिखने वाला" लेखक (ऑटोरेग्रेसिव मॉडल): यह लेखक अविश्वसनीय रूप से बुद्धिमान और सटीक है। वे हर एक शब्द लिखने से पहले उसके बारे में बहुत सोच-समझकर विचार करते हैं, ताकि कहानी पूरी तरह से तर्कसंगत बने। हालांकि, वे धीमे हैं। उन्हें एक शब्द पूरा करना होता है, फिर अपने नोट्स देखना होता है, अगले शब्द के बारे में सोचना होता है, और फिर उसे लिखना होता है। वे अपनी गति नहीं बढ़ा सकते क्योंकि उन्हें गलती करने का डर है।

  2. "बैच लेखक" (डिफ्यूजन मॉडल): यह लेखक एक साथ पूरा पैराग्राफ लिखने की कोशिश करता है। वे बहुत तेज़ हैं! लेकिन क्योंकि वे प्रत्येक शब्द की सावधानीपूर्वक जांच किए बिना एक साथ कई शब्दों का अनुमान लगाते हैं, इसलिए वे अक्सर तार्किक गलतियाँ करते हैं, कहानी का संदर्भ खो देते हैं, या निरर्थक बातें लिख देते हैं।

Orthrus एक नया फ्रेमवर्क है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है। यह एक "दोहरी आवाज़" वाली प्रणाली बनाता है जो आपको सावधानीपूर्वक लिखने वाले की सटीकता खोए बिना, एक साथ पूरा पैराग्राफ लिखने की अनुमति देता है।

यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:

"वास्तुकार और निर्माता" की उपमा

AI मॉडल को एक निर्माण स्थल के रूप में सोचें जहाँ दो कर्मचारी हैं: वास्तुकार (The Architect) और निर्माता (The Builder)

  • वास्तुकार (द फ्रोजन एलएलएम - The Frozen LLM): यह मूल, अत्यधिक प्रशिक्षित, सुपर-स्मार्ट मॉडल है। वे विशेषज्ञ हैं जिन्हें पता है कि इमारत कैसी दिखनी चाहिए। वे "फ्रोजन" (जमे हुए) हैं, जिसका अर्थ है कि वे इस प्रक्रिया के दौरान अपना विचार नहीं बदलते या नई चीजें नहीं सीखते; वे बस एक आदर्श ब्लूप्रिंट प्रदान करते हैं।
  • निर्माता (द डिफ्यूजन मॉड्यूल - The Diffusion Module): यह टीम में जोड़ा गया एक नया, हल्का कर्मचारी है। उनका काम ईंटें (टोकन) तेज़ी से बिछाना है।

वे मिलकर कैसे काम करते हैं:

  1. दृश्य निर्धारित करना (प्री-फिलिंग): सबसे पहले, वास्तुकार पूरे प्रॉम्प्ट (निर्देशों) को पढ़ता है और एक सटीक, उच्च-गुणवत्ता वाला "मेमोरी मैप" (जिसे KV कैश कहा जाता है) बनाता है। इस मानचित्र में कहानी के बाकी हिस्से को बनाने के लिए आवश्यक सारा संदर्भ शामिल है।
  2. समानांतर दौड़ (जेनरेशन): वास्तुकार द्वारा एक-एक करके ईंट बिछाने के बजाय, निर्माता वास्तुकार के मानचित्र को देखता है और एक साथ ईंटों की एक पूरी पंक्ति (मान लीजिए 32 ईंटें) बिछाने की कोशिश करता है।
  3. सुरक्षा जांच (कंसेंसस): यही असली जादू है। निर्माता के काम को स्वीकार किए जाने से पहले, वास्तुकार तुरंत निर्माता के बैच की जांच करता है।
    • यदि निर्माता ने वास्तुकार के सटीक तर्क के अनुसार अगले शब्द का सही अनुमान लगाया, तो वास्तुकार कहता है, "बहुत बढ़िया! इसे रहने दो!"
    • यदि निर्माता ने गलत अनुमान लगाया, तो वास्तुकार कहता है, "नहीं, यह सही नहीं है," और तुरंत उस विशिष्ट शब्द को ठीक कर देता है।
    • प्रक्रिया अगले बैच के लिए दोहराई जाती है।

यह एक बड़ी बात क्यों है?

  • मेमोरी की बर्बादी नहीं: आमतौर पर, यदि आपके पास दो मॉडल काम कर रहे हैं, तो आपको मेमोरी के दो सेटों की आवश्यकता होती है। Orthrus चतुर है क्योंकि निर्माता और वास्तुकार एक ही मेमोरी मैप साझा करते हैं। निर्माता को अपने स्वयं के नोट्स बनाने की आवश्यकता नहीं है; वे बस वास्तुकार के नोट्स देखते हैं। इससे कंप्यूटर मेमोरी की एक बड़ी बचत होती है।
  • गुणवत्ता में कोई कमी नहीं: क्योंकि वास्तुकार (मूल स्मार्ट मॉडल) का हर शब्द पर अंतिम निर्णय होता है, इसलिए कहानी उतनी ही अच्छी होती है जितनी कि यदि वास्तुकार ने इसे एक-एक शब्द करके लिखा होता। इसमें कोई "ड्रिफ्ट" या गुणवत्ता का नुकसान नहीं होता।
  • भारी गति: निर्माता को एक बार में 32 ईंटें बिछाने देने और केवल तुरंत उनकी जांच करने की अनुमति देकर, Orthrus मानक एक-एक-शब्द-दर-शब्द विधि की तुलना में 7.8 गुना तक तेज़ है।

परिणाम

पेपर ने कठिन कार्यों जैसे गणित की समस्याओं (MATH-500) को हल करने, कोड लिखने और तर्क पहेलियों का उत्तर देने पर इसका परीक्षण किया।

  • गति: यह मानक मॉडलों की तुलना में काफी तेज़ था।
  • सटीकता: यह मूल धीमे मॉडल के समान ही सटीक था।
  • दक्षता: इसे मॉडल के केवल एक छोटे से हिस्से (लग लगभग 16%) के पैरामीटर्स को प्रशिक्षित करने की आवश्यकता थी, जिससे इसे मौजूदा AI सिस्टम में जोड़ना सस्ता और आसान हो गया।

संक्षेप में, Orthrus एक तेज़ पढ़ने वाले को काम पर रखने जैसा है जो किसी कहानी के अगले 30 शब्दों का तुरंत अनुमान लगा सकता है, लेकिन उसके ठीक बगल में एक सख्त संपादक खड़ा है जो किसी भी गलती को तुरंत सुधार देता है। परिणाम एक ऐसी कहानी है जो बिजली की गति से लिखी जाती है और फिर भी पूरी तरह से सटीक होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →