← नवीनतम पेपर
💬 NLP

PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length

यह शोध पत्र PACER को प्रस्तुत करता है, जो एक नवीन स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है जो ड्राफ्ट टोकन की लंबाई को ब्लॉकवाइज गतिशील रूप से समायोजित करने के लिए एक हल्के, प्रशिक्षण योग्य प्री-वेरिफिकेशन लेयर का उपयोग करता है, जिससे LLM इन्फरेंस में उल्लेखनीय तेजी आती है और यह मानक निश्चित-लंबाई वाले दृष्टिकोणों से बेहतर प्रदर्शन करता है।

मूल लेखक: Situo Zhang, Yifan Zhang, Zichen Zhu, Hankun Wang, Da Ma, Danyang Zhang, Lu Chen, Kai Yu

प्रकाशित 2026-02-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Situo Zhang, Yifan Zhang, Zichen Zhu, Hankun Wang, Da Ma, Danyang Zhang, Lu Chen, Kai Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन आप एक बहुत ही सख्त संपादक (editor) के साथ काम कर रहे हैं। लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया में, यह "संपादक" टारगेट मॉडल (Target Model) है। यह अविश्वसनीय रूप से स्मार्ट और सटीक है, लेकिन यह चलाने में बहुत धीमा और महंगा भी है। हर बार जब आप अपना लिखा हुआ एक शब्द भी चेक करते हैं, तो इसमें काफी समय लगता है।

काम को तेज़ करने के लिए, हम आमतौर पर एक ड्राफ्ट मॉडल (Draft Model) का उपयोग करते हैं। इसे एक तेज़, ऊर्जावान इंटर्न (intern) के रूप में समझें जो अगला शब्द क्या होगा, इसका अंदाज़ा लगाने में अच्छा है लेकिन एकदम सटीक नहीं है।

पुराना तरीका: "फिक्स्ड गेस" गेम

मानक स्पेक्टिव डिकोडिंग (Speculative Decoding) में, प्रक्रिया इस प्रकार काम करती है:

  1. इंटर्न (ड्राफ्ट मॉडल) जल्दी से शब्दों की एक निश्चित संख्या (मान लीजिए 5 शब्द) एक के बाद एक लिख देता है।
  2. संपादक (टारगेट मॉडल) फिर उन 5 शब्दों को यह देखने के लिए एक साथ पढ़ता है कि वे सही हैं या नहीं।
  3. समस्या: संपादक थोड़ा नखरेबाज है।
    • यदि इंटर्न बहुत अधिक शब्द (जैसे 9) का अनुमान लगाता है, तो संपादक छठे शब्द को खारिज कर सकता है। इसका मतलब है कि इंटर्न ने जो 7वां, 8वां और 9वां शब्द लिखा था, वह समय की बर्बादी थी।
    • यदि इंटर्न बहुत कम शब्द (जैसे 2) का अनुमान लगाता है, तो उसे बार-बार रुककर चेक करना पड़ता है, जिससे सब कुछ धीमा हो जाता है क्योंकि संपादक ही यहाँ मुख्य बाधा (bottleneck) है।

पेपर बताता है कि अनुमान लगाने के लिए शब्दों की "परफेक्ट" संख्या लगातार बदलती रहती है। कभी-कभी इंटर्न लय में होता है और 10 शब्द सही बता सकता है; अन्य समय में, वह केवल 1 शब्द के बाद ही अटक जाता है। एक निश्चित संख्या (जैसे हमेशा 5 का अनुमान लगाना) का उपयोग करना, एक गोल छेद में चौकोर खूँटा फिट करने जैसा है—यह अक्षम है।

नया समाधान: PACER (एक "स्मार्ट ब्लॉक चेकर")

लेखकों ने PACER नामक एक नई प्रणाली प्रस्तावित की है। इंटर्न को शब्दों की एक निश्चित संख्या का अनुमान लगाने देने के बजाय, PACER एक प्री-वेरिफिकेशन लेयर (Pre-verification Layer) जोड़ता है। इसे एक टीम लीड (Team Lead) के रूप में समझें जो इंटर्न और संपादक के बीच खड़ा है।

PACER इस प्रकार काम करता है, चरण-दर-चरण:

  1. इंटर्न छोटे टुकड़ों (Blocks) में लिखता है: एक बार में 5 शब्द लिखने के बजाय, इंटर्न 3 शब्दों का एक छोटा ब्लॉक लिखता है।
  2. टीम लीड ब्लॉक की जाँच करता है: इन 3 शब्दों को धीमे संपादक के पास भेजने से पहले, टीम लीड (एक बहुत छोटा, तेज़ AI) उनकी जल्दी से जाँच करता है।
    • टीम लीड पूछता है: "क्या ये 3 शब्द ऐसे दिख रहे हैं जो संपादक के टेस्ट में पास हो जाएंगे?"
  3. निर्णय:
    • यदि टीम लीड कहता है "हाँ": इंटर्न तुरंत 3 शब्दों का अगला ब्लॉक लिखता है। टीम लीड उसकी भी जाँच करता है। यह प्रक्रिया जारी रहती है, जिससे बहुत तेज़ी से सही शब्दों की एक लंबी श्रृंखला बनती है।
    • यदि टीम लीड कहता है "नहीं": इंटर्न तुरंत रुक जाता है। टीम लीड स्वीकृत शब्दों को अंतिम आधिकारिक जाँच के लिए संपादक के पास भेज देता है। इंटर्न उस बाकी ब्लॉक को लिखने में समय बर्बाद नहीं करता जिसे संभवतः खारिज कर दिया जाता।

यह बेहतर क्यों है?

पेपर ट्रैफिक फ्लो (यातायात प्रवाह) के एक बेहतरीन उदाहरण का उपयोग करता है।

  • पुराना तरीका: आप एक निश्चित गति से गाड़ी चलाते हैं। कभी सड़क साफ होती है, और आप और तेज़ चल सकते थे। कभी रेड लाइट आ जाती है, और आप उसमें गाड़ी चलाते रहते हैं, जिससे ईंधन बर्बाद होता है।
  • PACER: आपके पास एक स्मार्ट नेविगेटर है। यदि आगे का रास्ता साफ दिखता है, तो आप तेज़ चलते हैं और आगे बढ़ जाते हैं। यदि नेविगेटर देखता है कि रेड लाइट आने वाली है, तो आप रेड लाइट से टकराने से पहले ही रुक जाते हैं, जिससे ईंधन और समय दोनों बचते हैं।

परिणाम

पेपर ने कोडिंग, गणित की समस्याओं को हल करने और समाचारों का सारांश बनाने जैसे विभिन्न कार्यों पर इसका परीक्षण किया।

  • गति: PACER ने सिस्टम को मानक तरीके की तुलना में 2.66 गुना तेज़ बना दिया।
  • संयोजन: जब उन्होंने PACER को "ऊरोबोरोस" (Ouroboros) नामक एक अन्य स्पीड-बूस्टिंग तकनीक के साथ जोड़ा, तो सिस्टम 3.09 गुना तेज़ हो गया।
  • दक्षता: इसने सफलतापूर्वक इस संख्या को कम किया कि कितनी बार धीमे संपादक को काम करना पड़ा, जबकि तेज़ इंटर्न को और अधिक स्मार्ट बनाया, न कि केवल अधिक मेहनत करने के लिए।

सारांश में

PACER आपके तेज़ AI इंटर्न को एक स्मार्ट सुपरवाइजर देने जैसा है। शब्दों का एक निश्चित मात्रा में अनुमान लगाने और उम्मीद करने के बजाय, सुपरवाइजर वास्तविक समय में काम के छोटे बैचों की जाँच करता है। यदि काम अच्छा दिखता है, तो वे चलते रहते हैं; यदि काम जोखिम भरा लगता है, तो वे तुरंत रुक जाते हैं। यह बेकार की मेहनत को रोकता है और उपयोगकर्ता तक अंतिम परिणाम बहुत तेज़ी से पहुँचाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →