← नवीनतम पेपर
💬 NLP

RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding

RACER एक हल्का, प्रशिक्षण-मुक्त तरीका है जो मौजूदा स्पेक्युलेटिव डिकोडिंग दृष्टिकोणों की सीमाओं को दूर करने के लिए रिट्रीवल-आधारित सटीक पैटर्न को लॉजिट-संचालित भविष्य के संकेतों के साथ एकीकृत करके लार्ज लैंग्वेज मॉडल इन्फरेंस को तेज करता है, जिससे पूर्ववर्ती तरीकों से बेहतर प्रदर्शन करते हुए 2x से अधिक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Zihong Zhang, Zuchao Li, Lefei Zhang, Ping Wang, Hai Zhao

प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihong Zhang, Zuchao Li, Lefei Zhang, Ping Wang, Hai Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी पूरी करने की कोशिश कर रहे हैं, लेकिन आपको इसे एक बार में एक शब्द करके लिखना होगा, और हर शब्द के लिए एक सुपर-स्मार्ट लेकिन धीमे लाइब्रेरियन (AI) की मंजूरी का इंतज़ार करना होगा। वर्तमान लार्ज लैंग्वेज मॉडल्स (LLMs) इसी तरह काम करते हैं। वे बहुत बुद्धिमान हैं, लेकिन वे धीमे हैं क्योंकि वे एक सख्त, चरण-दर-चरण रेखा में लिखते हैं।

RACER एक नई विधि है जिसे इस प्रक्रिया को बिना किसी गुणवत्ता को खोए बिजली की तरह तेज़ बनाने के लिए डिज़ाइन किया गया है। इसे एक लेखक को एक "स्मार्ट असिस्टेंट" देने के रूप में सोचें जो समय से पहले अगले कुछ शब्दों का अनुमान लगा सके, और एक "सुपर-फास्ट लाइब्रेरियन" जो उनके अंदाज़ों की तुरंत जाँच कर सके।

यहाँ RACER कैसे काम करता है, सरल अवधारणाओं में दिया गया है:

1. समस्या: "एक-समय-में-एक-शब्द" की बाधा

सामान्य रूप से, एक AI इस तरह वाक्य लिखता है:

  • चरण 1: शब्द #1 के बारे में सोचें। AI से पूछें: "क्या यह सही है?" -> हाँ।
  • चरण 2: शब्द #2 के बारे में सोचें। AI से पूछें: "क्या यह सही है?" -> हाँ।
  • चरण 3: शब्द #3 के बारे में सोचें। AI से पूछें: "क्या यह सही है?" -> हाँ।

यह धीमा है क्योंकि AI को हर एक शब्द के लिए भारी गणित करना पड़ता है।

2. समाधान: "अनुमान लगाओ और सत्यापित करो" (Speculative Decoding)

RACER Speculative Decoding नामक रणनीति का उपयोग करता है। AI को एक-एक शब्द लिखने के बजाय, यह उसे एक ही बार में पूरा वाक्य लिखने के लिए कहता है, फिर जाँचता है कि वह सही है या नहीं।

  • अनुमान (The Guess): एक हल्का, तेज़ सहायक अगले 5 शब्दों का सुझाव देता है।
  • सत्यापन (The Verify): बड़ा, धीमा AI उन 5 शब्दों की तेज़ी से जाँच करता है। यदि वे सभी सही हैं, तो AI एक साथ उन सभी 5 शब्दों को स्वीकार कर लेता है!
  • परिणाम: 5 चरणों के बजाय, इसने केवल 1 चरण लिया। यह 5 गुना तेज़ है!

3. चुनौती: अच्छे अनुमान कैसे लगाएं?

अनुमान लगाना कठिन काम है। यदि सहायक गलत अनुमान लगाता है, तो AI को उन्हें फेंकना पड़ता है और फिर से शुरू करना पड़ता है, जिससे समय बर्बाद होता है। पिछली विधियों में दो खामियां थीं:

  • "कॉपी-पेस्ट" विधि (Retrieval): यह देखता है कि आपने पहले क्या लिखा था और उसे कॉपी करने की कोशिश करता है। उपमा: यह एक ऐसे छात्र की तरह है जो केवल तभी वाक्य पूरा कर सकता है जब उसने वह सटीक वाक्य पहले देखा हो। यदि वाक्य नया है, तो वह जम जाता है।
  • "अंतर्ज्ञान" विधि (Logits): यह अगले शब्द का अनुमान लगाने के लिए AI के आंतरिक गणित का उपयोग करता है। उपमा: यह एक ऐसे छात्र की तरह है जो व्याकरण के नियमों के आधार पर अगले शब्द का अनुमान लगाता है। वे आमतौर पर सही होते हैं, लेकिन वे बहुत आगे तक नहीं देख सकते, और वे किसी विशिष्ट विवरण को मिस कर सकते हैं।

4. RACER का जादू: दोनों को मिलाना

RACER वह परम छात्र है जो इन दोनों रणनीतियों का एक साथ उपयोग करता है। यह एक "ड्राफ्ट ट्री" (अनुमानों का एक शाखा पथ) बनाता है जो दो उपकरणों का उपयोग करता है:

टूल A: "मेमोरी बैंक" (Retrieval Tree)

RACER हाल ही में देखे गए हर वाक्यांश की एक चलती हुई सूची रखता है।

  • उपमा: एक जासूस की कल्पना करें जिसके पास सामान्य वाक्यांशों का "मोस्ट वोंटेड" बोर्ड है। यदि कहानी "The cat sat on the..." से शुरू होती है, तो जासूस तुरंत बोर्ड की जाँच करता है। यदि "mat" एक सामान्य अंत है, तो वह उस पूरे वाक्यांश को उठा लेता है।
  • स्मार्ट ट्विस्ट: RACER एक "लीस्ट रिसेंटली यूज्ड" (LRU) सिस्टम का उपयोग करता है। यदि जासूस का बोर्ड बहुत भर जाता है, तो वह नए के लिए जगह बनाने के लिए पुराने, सबसे कम उपयोग किए गए वाक्यांशों को हटा देता है। यह मेमोरी को ताज़ा और प्रासंगिक रखता है।

टूल B: "क्रिस्टल बॉल" (Logits Tree)

जब मेमोरी बैंक के पास कोई मिलान नहीं होता, तो RACER AI के आंतरिक "अंतर्ज्ञान" पर स्विच करता है।

  • उपमा: केवल अगले शब्द का अनुमान लगाने के बजाय, AI शीर्ष 10 सबसे संभावित शब्दों को देखता है और उन 10 विकल्पों में से प्रत्येक के लिए अगले 10 शब्दों का अनुमान लगाने की कोशिश करता है। यह संभावनाओं का एक ब्रांचिंग ट्री बनाता है।
  • स्मार्ट ट्विस्ट: RACER ने गौर किया कि यदि कोई शब्द कहानी में दो बार आता है, तो वह अक्सर समान भविष्य के शब्दों की ओर ले जाता है। इसलिए, यह भविष्य के बेहतर अनुमान लगाने के लिए उसी शब्द के पिछले उदाहरणों से "गणित" का पुन: उपयोग करता है।

5. अंतिम परिणाम: "विलय" (The Merge)

RACER मेमोरी बैंक (सटीक मिलान) और क्रिस्टल बॉल (स्मार्ट एक्सट्रपलेशन) दोनों से सर्वश्रेष्ठ अनुमानों को लेता है और उन्हें संभावित शब्दों की एक बड़ी सूची में मिला देता है।

  • यह इस सूची को त्वरित "सत्यापन" के लिए बड़े AI के पास भेजता है।
  • चूंकि अनुमान बहुत अच्छे हैं (मेमोरी और गणित के मिश्रण के कारण), AI एक साथ उनके एक बड़े हिस्से को स्वीकार कर लेता है।

यह एक बड़ी बात क्यों है?

  • कोई ट्रेनिंग आवश्यक नहीं: आपको AI को कुछ भी नया सिखाने की ज़रूरत नहीं है। आप बस RACER को कैमरे के नए लेंस की तरह प्लग इन कर सकते हैं।
  • हर जगह काम करता है: यह कोडिंग, गणित, रचनात्मक लेखन और यहाँ तक कि चीनी गणित समस्याओं पर भी काम करता है।
  • गति: यह AI को मूर्ख बनाए बिना इसे 2x से 2.5x तेज़ बनाता है।

संक्षेप में: RACER एक धीमे, सावधान लेखक को तेज़, स्मार्ट सहायकों की एक टीम देने जैसा है जो पुराने नोट्स देख सकते हैं और अगले पैराग्राफ का अनुमान लगाने के लिए अपने अंतर्ज्ञान का उपयोग भी कर सकते हैं। लेखक को बस पूरे पैराग्राफ के लिए "हाँ" या "नहीं" कहना होता है, जिससे बहुत सारा समय बचता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →