← नवीनतम पेपर
🤖 machine learning

BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding

यह शोधपत्र BudgetDraft प्रस्तुत करता है, जो एक मल्टी-व्यू प्रशिक्षण विधि है जो स्पार्स-KV ड्राफ्टर को स्वीकृति-जागरूक (acceptance-aware) लर्निंग से सुसज्जित करती है ताकि उच्च टोकन स्वीकृति दर बनाए रखी जा सके और बिना इन्फरेंस-टाइम मेमोरी लागत बढ़ाए मिड-टू-लॉन्ग कॉन्टेक्स्ट स्पेकुलेटिव डिकोडिंग में महत्वपूर्ण एंड-टू-एंड स्पीडअप (6.55x तक) प्राप्त किया जा सके।

मूल लेखक: Liang He, Jingbo Wen, Qishi Zhan, Yixiong Chen, Kangning Cui, Qizhen Lan, Xilu Wang

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liang He, Jingbo Wen, Qishi Zhan, Yixiong Chen, Kangning Cui, Qizhen Lan, Xilu Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका एक सख्त नियम है: आप अपने पिछले वाक्यों को तय करने के लिए केवल एक छोटी, सिकुड़ती हुई नोटबुक देख सकते हैं। यह कुछ वैसा ही है जैसे आधुनिक AI मॉडल लंबी बातचीत या दस्तावेज़ों को संभालते हैं जब वे सीमित मेमोरी वाले कंप्यूटरों पर चल रहे होते हैं।

यह शोध पत्र एक नए तरीके के रूप में BudgetDraft पेश करता है जो AI को इन मेमोरी सीमाओं के कारण भ्रमित हुए बिना तेज़ी से लिखने में मदद करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

समस्या: "मेमोरी मिसमैच" (स्मृति बेमेल)

एक AI को कहानी लिखने की कोशिश करते हुए एक दो लोगों की टीम के रूप में सोचें:

  1. ड्राफ्टर (द स्पीडस्टर - गतिमान): एक छोटा, तेज़ सहायक जो अगले कुछ शब्दों का जल्दी से अनुमान लगाता है। जगह बचाने के लिए, यह सहायक अब तक की कहानी का केवल एक छोटा सा "स्टिक नोट" (एक स्पार्स/विरल स्मृति) रखता है।
  2. वेरिफायर (द बॉस - मैनेजर): एक बड़ा, बुद्धिमान प्रबंधक जो यह जाँचता है कि सहायक के अनुमान सही हैं या नहीं। बॉस अपने दिमाग में पूरी कहानी (फुल मेमोरी) रखता है ताकि गुणवत्ता सुनिश्चित की जा सके।

ग्लिच (खराबी):
जब कहानी छोटी होती है, तो सहायक का छोटा सा स्टिक नोट पर्याप्त होता है, और वह अधिकांश समय सही अनुमान लगाता है। लेकिन जैसे-जैसे कहानी लंबी होती जाती है (4,000 से 16,000 शब्द), सहायक का छोटा सा नोट बेकार हो जाता है। वे जंगली अंदाज़ में गलत अनुमान लगाने लगते हैं क्योंकि वे कहानी की शुरुआत भूल जाते हैं।
शोध पत्र इसे "16K कोलैप्स" कहता है। सहायक के अनुमान इतने खराब हो जाते हैं कि बॉस लगभग सब कुछ खारिज कर देता है, और पूरी प्रक्रिया धीमी हो जाती है—कभी-कभी तो अनुमान लगाने के बजाय शब्द-दर-शब्द लिखने की पुरानी विधि से भी धीमी।

समाधान: BudgetDraft

लेखकों ने महसूस किया कि पिछले तरीकों ने सहायक को एक विशिष्ट आकार के स्टिक नोट के लिए परफेक्ट होने के लिए प्रशिक्षित किया था। यदि कंप्यूटर की मेमोरी थोड़ी भी बदल जाती, तो सहायक विफल हो जाता।

BudgetDraft एक नया प्रशिक्षण तरीका है जो सहायक को लचीला (फ्लेक्सिबल) बनने के लिए सिखाता है।

रचनात्मक उपमा: "मल्टी-व्यू" जिम

कल्पना कीजिए कि एक बास्केटबॉल खिलाड़ी (सहायक) को बास्केट में शॉट मारने का अभ्यास करा रहे हैं।

  • पुराना तरीका: आप केवल ठीक 10 फीट की दूरी से शॉट मारने का अभ्यास करते हैं। यदि खेल में बास्केट को 12 फीट दूर ले जाया जाता है, तो खिलाड़ी चूक जाता है।
  • BudgetDraft का तरीका: अभ्यास के दौरान, आप बास्केट को यादृच्छिक रूप से 5 फीट, 10 फीट, 15 फीट और 20 फीट पर ले जाते हैं। आप खिलाड़ी को बताते हैं: "चाहे बास्केट कहीं भी हो, आपको अभी भी बैकबोर्ड पर उसी सटीक स्थान पर निशाना लगाना है जिसकी ओर कोच (वेरिफायर) इशारा कर रहा है।"

कई अलग-अलग "बजट" (मेमोरी साइज) के साथ अभ्यास करके, सहायक एक सार्वभौमिक कौशल सीख जाता है। वे एक विशिष्ट मेमोरी साइज पर निर्भर रहना बंद कर देते हैं और कोच की अपेक्षाओं के साथ अपने अनुमानों को संरेखित करना सीखते हैं, चाहे उनके पास कितनी भी मेमोरी उपलब्ध हो।

यह व्यवहार में कैसे काम करता है

  1. प्रशिक्षण (ट्रेनिंग): सहायक को एक ही कहानी दिखाई जाती है लेकिन उसे अलग-अलग मात्रा में मेमोरी का उपयोग करने के लिए मजबूर किया जाता है (कभी 256 शब्द, कभी 1024, आदि)।
  2. लक्ष्य: सहायक को अगले शब्द के लिए कोच के "टॉप चॉइस" (सर्वश्रेष्ठ विकल्प) से मेल खाना चाहिए, भले ही उसकी अपनी मेमोरी बहुत कम क्यों न हो।
  3. परिणाम: सहायक "बजट-रोबस्ट" बन जाता है। चाहे कंप्यूटर के पास बहुत अधिक मेमोरी हो या बहुत कम, सहायक सही अनुमान लगाना जारी रखता है।

परिणाम

शोध पत्र ने तीन अलग-अलग प्रकार के लंबे टेक्स्ट (किताबें, मीटिंग ट्रांसक्रिप्ट, और लंबी कहानियाँ) पर इसका परीक्षण किया।

  • गति: एक मानक हाई-एंड कंप्यूटर पर, BudgetDraft ने पुराने धीमे तरीके की तुलना में AI को 2 से 6 गुना तेज़ बना दिया, यहाँ तक कि बहुत लंबे टेक्स्ट (16,000 शब्दों तक) के लिए भी।
  • स्थिरता: पिछले तरीकों के विपरीत जो मेमोरी सीमा बदलने पर क्रैश हो जाते थे, BudgetDraft सभी अलग-अलग मेमोरी सेटिंग्स में सुचारू रूप से काम करता रहा।
  • सरलता: इसके लिए कंप्यूटर में अतिरिक्त जटिल मशीनरी जोड़ने की आवश्यकता नहीं है; यह बस मौजूदा "सहायक" को प्रशिक्षण के दौरान स्मार्ट बनाता है।

सारांश

BudgetDraft उस समस्या को ठीक करता है जहाँ सीमित मेमोरी वाले कंप्यूटरों पर लंबे टेक्स्ट लिखते समय AI धीमा और भ्रमित हो जाता है। यह AI के "अनुमान लगाने वाले सहायक" को अनुकूलन योग्य बनाकर किया जाता है, उसे यह सिखाकर कि चाहे उसके पास छोटी मेमोरी हो या बड़ी, उसे अच्छे अनुमान लगाने हैं, जिससे यह सुनिश्चित होता है कि AI तेज़ और सटीक बना रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →