← नवीनतम पेपर
💬 NLP

Multi-Drafter Speculative Decoding with Alignment Feedback

यह शोध पत्र MetaSD को पेश करता है, जो एक एकीकृत ढांचा (unified framework) है जो एलाइनमेंट फीडबैक के आधार पर मल्टी-आर्म्ड बैंडिट दृष्टिकोण के माध्यम से कई विषम ड्राफ्टर्स (heterogeneous drafters) को गतिशील रूप से चुनने और आवंटित करके लार्ज लैंग्वेज मॉडल इन्फरेंस को त्वरित करता है, जिससे यह पारंपरिक सिंगल-ड्राफ्टर स्पेक्युलेटिव डिकोडिंग विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Taehyeon Kim, Hojung Jung, Se-Young Yun

प्रकाशित 2026-04-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taehyeon Kim, Hojung Jung, Se-Young Yun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी, जटिल कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपके पास एक बहुत ही सख्त, पूर्णतावादी (perfectionist) संपादक है (जिसे Target AI कहा जाता है) जो आपके द्वारा लिखे गए हर एक शब्द की जांच करता है ताकि उसे रहने दिया जा सके। यह संपादक अविश्वसनीय रूप से स्मार्ट है लेकिन बहुत धीमा भी है क्योंकि उसे हर शब्द के बारे में एक-एक करके सोचना पड़ता है। इस वजह से कहानी लिखने में बहुत समय लग जाता है।

चीजों को तेज करने के लिए, आप एक ड्राफ्टिंग असिस्टेंट (एक छोटा, तेज़ AI) काम पर रखते हैं। यह सहायक आपके लिए अगले कुछ शब्दों का अनुमान लगाता है। फिर संपादक जल्दी से जांच करता है: "क्या सहायक ने ये शब्द सही चुने?" यदि हाँ, तो वह उन सभी को एक साथ स्वीकार कर लेता है, और आप आगे बढ़ते हैं। यदि नहीं, तो वह उन्हें खारिज कर देता है और स्वयं सही शब्द लिखता है। इसे स्पेक्युलेटिव डिकोडिंग (Speculative Decoding) कहा जाता है।

समस्या: "एक ही आकार सबके लिए" वाला सहायक (The "One-Size-Fits-All" Assistant)

पुरानी पद्धति के साथ समस्या यह है कि आप आमतौर पर केवल एक ही ड्राफ्टिंग असिस्टेंट रखते हैं।

  • यदि आप एक कोड की कहानी मांगते हैं, तो एक कोडर-असिस्टेंट बेहतरीन होता है।
  • यदि आप एक कविता मांगते हैं, तो एक कवि-असिस्टेंट बेहतरीन होता है।
  • लेकिन यदि आपके पास केवल एक कोडर-असिस्टेंट है और आप कविता मांगते हैं, तो वे बहुत गलतियाँ करेंगे। संपादक को उनके अधिकांश अनुमानों को खारिज करना पड़ेगा, और आप समय की बचत नहीं कर पाएंगे।

वास्तविक दुनिया में, हमारे पास अक्सर सहायकों की एक पूरी टीम होती है (एक कोडर, एक अनुवादक, एक गणितज्ञ, एक कवि), लेकिन हमें नहीं पता कि किसी विशिष्ट वाक्य के लिए किसे चुनना है। गलत सहायक चुनना आपको धीमा कर देता है।

समाधान: METASD (स्मार्ट मैनेजर)

यह पेपर पेश करता है METASD को, जो आपके सहायकों की टीम को चलाने के लिए एक स्मार्ट मैनेजर की तरह है।

केवल एक सहायक तक सीमित रहने के बजाय, METASD गतिशील रूप से (dynamically) उस सर्वश्रेष्ठ सहायक को चुनता है जो आपके लिखे जा रहे वर्तमान वाक्य के लिए सबसे उपयुक्त है। यह "मल्टी-आर्म्ड बैंडिट" (Multi-Armed Bandit) नामक एक खेल पर आधारित एक चतुर तकनीक का उपयोग करता है।

कैसीनो का उदाहरण (The Casino Analogy)

कल्पना कीजिए कि आप एक कैसीनो में 5 स्लॉट मशीनों (आपके 5 अलग-अलग AI सहायकों) के साथ हैं। आप नहीं जानते कि कौन सी मशीन सबसे अधिक भुगतान करती है (कौन सा सहायक सबसे अच्छा अनुमान लगाता है)।

  1. एक्सप्लोरेशन (Exploration - अन्वेषण): आपको यह देखने के लिए अलग-अलग मशीनों को आजमाना होगा कि कौन सी अच्छी हैं।
  2. एक्सप्लॉइटेशन (Exploitation - दोहन): एक बार जब आप ऐसी मशीन ढूंढ लेते हैं जो अच्छा भुगतान करती है, तो आप अधिक जीतने के लिए उसी को खेलना चाहते हैं।

METASD वह जुआरी है जो सबसे तेजी से सीखता है। यह विभिन्न सहायकों को आजमाता है, लेकिन यह एक विशिष्ट संकेत पर ध्यान देता है: एलाइनमेंट फीडबैक (Alignment Feedback)

"एलाइनमेंट फीडबैक" (स्कोरकार्ड)

मैनेजर को कैसे पता चलता है कि कौन सा सहायक अच्छा है? वह केवल अंतिम परिणाम का इंतजार नहीं करता है। वह संभावना (probability) को देखता है।

  • यदि टारगेट एडिटर को लगता है कि अगले शब्द की संभावना 90% है कि वह "Sun" होगा, और सहायक भी सोचता है कि इसकी संभावना 90% है, तो वे एलाइन्ड (aligned) हैं।
  • METASD ब्लॉक डाइवर्जेंस (Block Divergence - BD) नामक एक मीट्रिक का उपयोग करता है। इसे "कॉन्फिडेंस स्कोर" के रूप में समझें। यह मापता है कि सहायक का अनुमान, एडिटर द्वारा अपना काम पूरा करने से पहले ही, एडिटर की अंतरात्मा की भावना (gut feeling) से कितना मेल खाता है।

यदि सहायक का अनुमान एडिटर की अपेक्षा के बहुत करीब है, तो स्कोर उच्च होता है। यदि वे दूर हैं, तो स्कोर कम होता है।

वास्तविक जीवन में METASD कैसे काम करता है

  1. प्रॉम्ट (The Prompt): आप कहते हैं, "एक रोबोट के बारे में कहानी लिखें जो पेंटिंग करना सीख रहा है।"
  2. मैनेजर का कदम: METASD पहले कुछ शब्दों को देखता है। वह सोचता है, "हम्म, यह सुनने में ऐसा लग रहा है जैसे इसके लिए एक रचनात्मक कलाकार की आवश्यकता है।" वह आर्टिस्ट असिस्टेंट को चुनता है।
  3. चेक: आर्टिस्ट असिस्टेंट अगले 5 शब्दों का अनुमान लगाता है। एडिटर उन्हें चेक करता है। वे पूरी तरह से मेल खाते हैं! मैनेजर को एक उच्च स्कोर मिलता है।
  4. स्विच (The Switch): अचानक, कहानी बदल जाती है और "रोबोट पेंट की लागत की गणना करता है" हो जाता है। मैनेजर देखता है कि आर्टिस्ट असिस्टेंट अब संघर्ष कर रहा है (कम स्कोर)। वह तुरंत मैथ असिस्टेंट पर स्विच कर देता है।
  5. परिणाम: सिस्टम लगातार काम के लिए सबसे अच्छे विशेषज्ञ के बीच वाक्य-दर-वाक्य बदलाव करता रहता है।

यह एक बड़ी बात क्यों है

  • कोई अतिरिक्त प्रशिक्षण नहीं: आपको सहायकों को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस उन्हीं का उपयोग करते हैं जो आपके पास पहले से हैं।
  • तेज़ गति: क्योंकि यह हमेशा काम के लिए सही विशेषज्ञ को चुनता है, यह एक बार में अधिक शब्दों को स्वीकार करता है, जिससे पूरी प्रक्रिया बहुत तेज़ हो जाती है।
  • मजबूती (Robustness): यदि आप कोई अजीब सवाल पूछते हैं या वाक्य के बीच में विषय बदल देते हैं, तो मैनेजर तुरंत अनुकूलित हो जाता है। पुराने सिस्टम गलत सहायक के साथ फंसे रह जाते और धीमे हो जाते।

"ब्लॉक डाइवर्जेंस" का सीक्रेट सॉस (The "Block Divergence" Secret Sauce)

पेपर यह सिद्ध करता है कि ब्लॉक डाइवर्जेंस स्कोर (कॉन्फिडेंस मैच) का उपयोग करना, केवल यह गिनने से बेहतर है कि कितने शब्द स्वीकार किए गए।

  • पुराना तरीका (Block Efficiency): "मैंने 3 शब्द स्वीकार किए, इसलिए मैं अच्छा हूँ!" (लेकिन शायद अगले 2 गलत होंगे)।
  • नया तरीका (Block Divergence): "मेरा अनुमान एडिटर के अनुमान से 99% समान था, इसलिए मैं सही होने की बहुत अधिक संभावना रखता हूँ।"

यह नया स्कोर मैनेजर को एक स्पष्ट, अधिक स्थिर संकेत देता है, जिससे यह सीखने में मदद मिलती है कि किस सहायक पर कब भरोसा करना है।

सारांश

METASD एक ऑर्केस्ट्रा के सुपर-इंटेलिजेंट कंडक्टर की तरह है। एक अकेले संगीतकार को पूरी सिम्फनी बजाने देने के बजाय (जो कुछ हिस्सों के लिए बेसुरा हो सकता है), कंडक्टर भावनात्मक हिस्सों के लिए वायलिन वादक, एक्शन दृश्यों के लिए ड्रमर और शांत क्षणों के लिए बांसुरी वादक को तुरंत बुला लेता है। परिणाम? एक तेज़, सुचारू और उच्च-गुणवत्ता वाला प्रदर्शन।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →