LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
LogitSpec एक प्रशिक्षण-मुक्त (training-free), प्लग-एंड-प्ले रिट्रीवल-आधारित स्पेक्युलेटिव डिकोडिंग विधि है जो पिछले टोकन के लॉजिट्स (logits) का उपयोग करके "नेक्स्ट-नेक्स्ट" टोकन का अनुमान लगाकर LLM इन्फरेंस को तेज़ करती है, जिससे रिट्रीवल रेंज का विस्तार होता है और 2.61× तक की गति वृद्धि और उच्च टोकन स्वीकृति दर प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक मास्टर शेफ (एक Large Language Model, या LLM) हैं जो एक जटिल रेसिपी लिखने की कोशिश कर रहे हैं। इसे करने का पुराना तरीका बहुत धीमा है: आप एक शब्द सोचते हैं, उसे लिखते हैं, फिर कंप्यूटर के यह जांचने का इंतज़ार करते हैं कि वह सही है या नहीं, और फिर अगला शब्द सोचते हैं, और इसी तरह आगे बढ़ते हैं। यह एक पत्र को एक-एक अक्षर करके लिखने जैसा है, जहाँ हर एक अक्षर के बाद मुहर लगाने के लिए इंतज़ार करना पड़ता है।
Speculative Decoding इसे तेज़ करने का एक नया तरीका है। एक-एक शब्द लिखने के बजाय, आप एक सहायक शेफ (draft model) को काम पर रखते हैं जो आपके लिए अगले कुछ शब्दों का अनुमान लगा सके। फिर आप जल्दी से जाँचते हैं कि क्या आपका सहायक शेफ सही था। यदि वे सही थे, तो आप उन सभी शब्दों को एक साथ स्वीकार कर लेते हैं। यदि वे गलत थे, तो आप बस गलत अनुमानों को फेंक देते हैं और फिर से प्रयास करते हैं। इससे बहुत समय बचता है।
हालाँकि, एक सहायक शेफ को रखने में कुछ समस्याएँ हैं:
- आपको उन्हें विशेष रूप से अपने किचन के लिए प्रशिक्षित करना पड़ता है (जो महंगा और कठिन है)।
- वे आपके किचन में अतिरिक्त जगह घेरते हैं (मेमोरी)।
- यदि आप अपनी मुख्य रेसिपी बदलते हैं, तो आपको सहायक शेफ को फिर से प्रशिक्षित करना होगा।
"Retrieval" (लाइब्रेरी दृष्टिकोण) के साथ समस्या
कुछ शोधकर्ताओं ने सहायक शेफ को निकालने और उसकी जगह एक लाइब्रेरी का उपयोग करने की कोशिश की। एक व्यक्ति के अनुमान लगाने के बजाय, कंप्यूटर यह देखता है कि आपने पहले क्या लिखा है और पिछले व्यंजनों (recipes) के एक विशाल डेटाबेस में एक मेल खाने वाले वाक्यांश (phrase) को खोजता है।
खामी: यह वाक्य में अगले शब्द को खोजने के लिए तुरंत पिछले शब्द को देखने जैसा है।
- आपका वाक्य: "क्षेत्र क्या है..." (What is the area of the...)
- लाइब्रेरी का अनुमान: वह "the" को देखता है और सोचता है, "ओह, 'the' के बाद आमतौर पर 'triangle' आता है!" (क्योंकि उसे एक पिछला वाक्य मिला: "What is the area of the triangle?")
- वास्तविकता: आप वास्तव में कहना चाहते थे, "What is the area of the circle?" या "What is the area of the field?"
- परिणाम: लाइब्रेरी गलत शब्द पर अटक जाती है क्योंकि वह केवल तत्काल संदर्भ को देख रही है, पूरे विचार को नहीं।
समाधान: LogitSpec (द "क्रिस्टल बॉल" शेफ)
इस पेपर के लेखकों ने महसूस किया कि मुख्य शेफ (LLM) के पास एक छिपी हुई सुपरपावर है जिसका वह अक्सर उपयोग नहीं करता है।
जब शेफ अगले शब्द की भविष्यवाणी करता है, तो उसके पास इस बारे में भी एक "एहसास" (गणितीय रूप से जिसे logits कहा जाता है) होता है कि उसके बाद क्या होगा। भले ही शेफ को केवल अगले शब्द को बोलने के लिए कहा गया हो, लेकिन उसका दिमाग पहले से ही फुसफुसा रहा होता है, "और उसके बाद, शायद 'circle' होगा।"
LogitSpec इस फुसफुसाहट का उपयोग लाइब्रेरी की खोज को ठीक करने के लिए करता है।
यह यहाँ कैसे काम करता है, चरण-दर-चरण, एक रचनात्मक उपमा (analogy) का उपयोग करते हुए:
1. "क्रिस्टल बॉल" चरण
केवल पिछले शब्द ("the") को देखने के बजाय, LogitSpec शेफ से पूछता है: "यदि आपको दो कदम आगे के शब्द का अनुमान लगाना हो, तो वह क्या होगा?"
- शेफ अपने आंतरिक "एहसासों" (logits) को देखता है और कहता है, "'the' के बाद का शब्द 'circle' होगा।"
- यह Next-Next Token Speculation है।
2. "सुपर-सर्च" चरण
अब, केवल "the" के लिए लाइब्रेरी खोजने के बजाय, LogitSpec वाक्यांश "the circle" को खोजता है।
- पुराना तरीका (Vanilla Retrieval): "the" के लिए खोजता है। उसे "the triangle", "the sky", "the dog" मिलता है। (गलत!)
- LogitSpec का तरीका: "the circle" के लिए खोजता है। उसे "the circle of friends", "the circle of life", "the circle of the field" मिलता है। (बहुत अधिक सटीक!)
3. सत्यापन (Verification)
कंप्यूटर इन बेहतर अनुमानों को लेता है और उन्हें मास्टर शेफ के साथ जाँचता है। क्योंकि ये अनुमान अब बहुत अधिक सटीक हैं, मास्टर शेफ उन्हें अधिक बार स्वीकार करता है।
यह एक बड़ी बात क्यों है?
- कोई अतिरिक्त प्रशिक्षण नहीं: आपको नया सहायक शेफ रखने या प्रशिक्षित करने की आवश्यकता नहीं है। आप बस मुख्य शेफ के मौजूदा "एहसासों" (logits) का उपयोग करते हैं जो पहले से ही वहाँ मौजूद थे।
- प्लग-एंड-प्ले: यह बिना किसी कोड या वेट्स (weights) को बदले किसी भी मौजूदा भाषा मॉडल के साथ काम करता है।
- गति: उनके परीक्षणों में, इस पद्धति ने टेक्स्ट लिखने की गति को 2.6 गुना तेज़ कर दिया। इसका मतलब यह भी था कि कंप्यूटर औसतन, एक शब्द के बजाय, एक बार में 3.28 शब्द स्वीकार कर सकता था।
निचोड़ (The Bottom Line)
LogitSpec को एक ऐसे जासूस के रूप में सोचें जो केवल अगले घटनाक्रम का अनुमान लगाने के लिए अपराध स्थल (पिछले शब्द) को नहीं देखता है। इसके बजाय, जासूस एक मनोवैज्ञानिक पूर्वाभास (logit) का उपयोग करता है ताकि अगले अपराध स्थल का अनुमान लगाया जा सके, और फिर वह उस पूर्वाभास का उपयोग लाइब्रेरी में सही सबूत खोजने के लिए करता है।
दो कदम आगे देखकर, सिस्टम भ्रमित होने से बच जाता है और सही शब्दों को बहुत तेज़ी से खोज लेता है, जिससे AI बिना किसी अतिरिक्त प्रशिक्षण या महंगे हार्डवेयर के टेक्स्ट को काफी तेज़ी से लिख पाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।