← नवीनतम पेपर
💬 NLP

Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match

यह शोध पत्र FLy को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) स्पेक्युलेटिव डिकोडिंग विधि है जो सख्त सटीक-मिलान सत्यापन (exact-match verification) को एक सिमेंटिक वैधता जांच (semantic validity check) से बदलकर लार्ज लैंग्वेज मॉडल इन्फरेंस को त्वरित करती है, जिससे सटीकता बनाए रखते हुए और मॉडलों एवं आउट-ऑफ-डिस्ट्रीब्यूशन कार्यों में प्रभावी ढंग से सामान्यीकरण करते हुए महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Jinze Li, Yixing Xu, Guanchen Li, Shuo Yang, Jinfeng Xu, Xuanwu Yin, Dong Li, Edith C. H. Ngai, Emad Barsoum

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinze Li, Yixing Xu, Guanchen Li, Shuo Yang, Jinfeng Xu, Xuanwu Yin, Dong Li, Edith C. H. Ngai, Emad Barsoum

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका एक बहुत ही सख्त संपादक (Target Model) है जो अविश्वसनीय रूप से बुद्धिमान है लेकिन भी बहुत धीमा है। वे एक बार में एक शब्द लिखते हैं, आगे बढ़ने से पहले अपने काम की सावधानीपूर्वक जांच करते हैं। यह प्रक्रिया सटीक तो है लेकिन कष्टप्रद रूप से धीमी है।

चीजों को तेज करने के लिए, आप एक तेज, ऊर्जावान सहायक (Draft Model) को काम पर रखते हैं जो संपादक द्वारा समीक्षा किए जाने वाले अगले कुछ शब्दों का अनुमान लगाता है। इसे Speculative Decoding कहा जाता है।

पुरानी समस्या: "सटीक मिलान" (Exact Match) का नियम

पारंपरिक पद्धति में, संपादक का एक बहुत ही कठोर नियम है: "मैं तुम्हारे अनुमान को तभी स्वीकार करूँगा यदि वह बिल्कुल वही शब्द हो जो मैंने चुना था।"

यदि सहायक अनुमान लगाता है "The cat sat on the mat," लेकिन संपादक सोच रहा है "The cat sat on the rug," तो संपादक पूरे हिस्से को खारिज कर देता है। भले ही इस संदर्भ में "mat" और "rug" का अर्थ एक ही है, पुराना सिस्टम उन्हें फेंक देता है। यह सहायक की कड़ी मेहनत को बर्बाद करता है और सब कुछ धीमा कर देता है।

इसके अलावा, कई मौजूदा "स्मार्ट" सहायकों को विशिष्ट प्रकार की कहानियों पर प्रशिक्षित करने की आवश्यकता होती है। यदि आप उनसे ऐसी चीज़ के बारे में लिखने के लिए कहते हैं जो उन्होंने पहले नहीं देखी है (जैसे कि किसी नए प्रकार की पहेली के बारे में), तो वे भ्रमित हो जाते हैं और मदद करना बंद कर देते हैं।

नया समाधान: FLy (Training-Free Loosely Speculative Decoding)

यह शोध पत्र एक नई पद्धति पेश करता है जिसे FLy कहा जाता है। यह संपादक को बिना फिर से प्रशिक्षित किए या नया सहायक नियुक्त किए, एक अधिक लचीली मानसिकता देने जैसा है। FLy दो चतुर चरणों में काम करता है:

1. "विश्वास की जाँच" (Entropy Gate)

सबसे पहले, FLy संपादक से पूछता है: "क्या आप इस शब्द के बारे में 100% सुनिश्चित हैं, या आप अनिश्चित हैं?"

  • यदि संपादक अनिश्चित है (High Entropy): शायद वाक्य "mat," "rug," या "floor" पर समाप्त हो सकता है। FLy कहता है, "ठीक है, अगर सहायक ने 'rug' का अनुमान लगाया और आप 'mat' के बारे में सोच रहे थे, तो वह ठीक है। चलिए आगे बढ़ते हैं।"
  • यदि संपादक निश्चित है (Low Entropy): शायद यह एक गणित की समस्या है: "2 + 2 = [4]।" यदि सहायक "5" का अनुमान लगाता है, तो FLy तुरंत समझ जाता है कि यह एक बड़ी गलती है और इसे तुरंत खारिज कर देता है।

2. "इंतज़ार करो और देखो" विंडो (Deferred Window)

यदि सहायक एक ऐसा अनुमान लगाता है जो सटीक मिलान नहीं है, तो FLy तुरंत "नहीं" नहीं कहता। इसके बजाय, यह कहता है, "ठहरिए, देखते हैं आगे क्या होता है।"

FLy संपादक को सहायक के "अपूर्ण" अनुमान के आधार पर कुछ और शब्द उत्पन्न करने की अनुमति देता है।

  • परिदृश्य A (अच्छा अनुमान): सहायक ने "rug" का अनुमान लगाया, और संपादक एक बिल्ली और कालीन (rug) के बारे में एक बेहतरीन कहानी लिखना जारी रखता है। संपादक ने उस शब्द को "ठीक" करने की कोशिश नहीं की। FLy महसूस करता है, "आह, 'rug' बस वही कहने का एक अलग तरीका था जो आप कहना चाहते थे। यह अर्थपूर्ण रूप से सही है!" परिणाम: अनुमान स्वीकार कर लिया जाता है।
  • परिदृश्य B (बुरा अनुमान): सहायक ने एक निरर्थक शब्द का अनुमान लगाया, और संपादक तुरंत वाक्य की संरचना को बदलने या उसे सुधारने के लिए संघर्ष करने लगता है। FLy इस "सुधार" व्यवहार को देखता है और कहता है, "ठीक है, यह एक वास्तविक गलती थी। हमें इस शब्द को फेंक देना चाहिए।" परिणाम: अनुमान को खारिज कर दिया जाता है।

गति में वृद्धि: सहायक को भी तेज करना

क्योंकि FLy अधिक अनुमानों को स्वीकार करता है (यहाँ तक कि थोड़े अलग अनुमानों को भी), सहायक को अधिक मेहनत करनी पड़ती है और प्रति दौर अधिक शब्द उत्पन्न करने पड़ते हैं। यह कभी-कभी सहायक को ही नया बॉटलनेक (रुकावट) बना सकता है।

इसे ठीक करने के लिए, FLy एक Multi-Level Acceleration तकनीक जोड़ता है। यह सहायक को एक सुपर-क्विक लुकअप बुक (सामान्य वाक्यांशों की डिक्शनरी) देने जैसा है ताकि वे अपने अनुमानों को और भी तेजी से निकाल सकें। यह सुनिश्चित करता है कि सहायक कभी भी पूरी प्रक्रिया को धीमा न करे।

यह क्यों विशेष है

  • किसी प्रशिक्षण की आवश्यकता नहीं: आपको सहायक या संपादक को कुछ भी नया सिखाने की आवश्यकता नहीं है। यह किसी भी मॉडल के जोड़े के साथ, सीधे तौर पर काम करता है।
  • हर जगह काम करता है: क्योंकि यह याद किए गए प्रशिक्षण डेटा पर निर्भर नहीं है, यह परिचित विषयों की तरह ही नए, अजीब विषयों (Out-of-Distribution) पर भी उतना ही अच्छा काम करता है।
  • परिणाम:
    • यह कहानी के अर्थ और सटीकता को लगभग पूर्ण बनाए रखता है (99% से अधिक सटीकता सुरक्षित रहती है)।
    • यह बड़े मॉडलों के लिए लेखन प्रक्रिया को 2.8 गुना तेज़ और विशाल मॉडलों के लिए 5 गुना तक तेज़ बना देता है।
    • यह महंगे प्रशिक्षण की आवश्यकता वाले अन्य "स्मार्ट" तरीकों को मात देता है, खासकर जब विषय बदल जाता है।

संक्षेप में, FLy संपादक को सटीक शब्दों के प्रति पूर्णतावादी होने के बजाय अर्थ सही होने पर ध्यान केंद्रित करने के लिए रोकता है, जिससे गुणवत्ता खोए बिना पूरी टीम बहुत तेज़ हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →