← नवीनतम पेपर
💬 NLP

Cost-Aware Diffusion Draft Trees for Speculative Decoding

यह शोधपत्र CaDDTree को प्रस्तुत करता है, जो एक लागत-जागरूक (cost-aware) स्पेक्युलेटिव डिकोडिंग विधि है जो थ्रूपुट फंक्शन की यूनिमोडल प्रकृति का लाभ उठाकर ड्राफ्ट ट्री संरचना और नोड बजट दोनों को गतिशील रूप से अनुकूलित करती है ताकि टोकन थ्रूपुट को अधिकतम किया जा सके, जिससे ऑफलाइन बजट ट्यूनिंग की आवश्यकता समाप्त हो जाती है और मौजूदा ओरकल-ट्यून्ड बेसलाइनों के बराबर या उनसे बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Shuai Zhang, Huachuan Qiu, Hongliang He, Yong Dai

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuai Zhang, Huachuan Qiu, Hongliang He, Yong Dai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका एक बहुत सख्त नियम है: आप एक बार में केवल एक ही शब्द लिख सकते हैं, और हर एक शब्द के बाद, आपको रुकना होगा, गहराई से सोचना होगा और यह जांचना होगा कि क्या वह शब्द सही है। एआई (AI) भाषा मॉडल इसी तरह काम करते हैं। यह सटीक तो है, लेकिन यह बहुत धीमा है क्योंकि "जांचने" वाले हिस्से में बहुत समय लगता है।

इसे तेज करने के लिए, शोधकर्ता एक ट्रिक का उपयोग करते हैं जिसे Speculative Decoding कहा जाता है। इसे ऐसे समझें जैसे आपके पास एक थोड़ा कम सावधान लेकिन तेज़ दोस्त (एक "drafter") है जो आपके लिए अगले कुछ शब्दों का अनुमान लगाता है। फिर, एक धीमा, बहुत सावधान विशेषज्ञ (एक "target model") उन सभी अनुमानों को एक साथ जांचता है। यदि विशेषज्ञ उन शब्दों से सहमत होता है, तो आपको वे शब्द तुरंत मिल जाते हैं। यदि नहीं, तो आप गलत शब्दों को हटा देते हैं और फिर से प्रयास करते हैं।

समस्या यह थी कि पिछले तरीके उन शेफ की तरह थे जो मेहमान कितने भूखे हैं, इसकी परवाह किए बिना हमेशा एक विशाल भोज (banquet) बनाने की कोशिश करते थे। वे हर बार बहुत सारे शब्दों का अनुमान लगाने की कोशिश करते थे (संभावनाओं का एक बड़ा "पेड़" या "tree"), इस उम्मीद में कि वे भाग्यशाली होंगे। लेकिन एक विशाल भोज बनाने में समय लगता है। कभी-कभी, मेहमान केवल एक सैंडविच के भूखे होते हैं और शेफ ने एक ऐसा दावत बनाने में समय बर्बाद कर दिया जिसे किसी ने खाया ही नहीं।

यहाँ बताया गया है कि कैसे नया तरीका, CaDDTree, इसे ठीक करता है:

1. पुराना तरीका: "ज्यादा हमेशा बेहतर है"

पिछले टूल्स जितने अधिक शब्दों का अनुमान लगा सकें, उन्हें अधिकतम करने की कोशिश करते थे ताकि सही होने की संभावना बढ़ सके। उन्हें इस बात की परवाह नहीं थी कि उन अनुमानों को जांचने में कितना समय लगेगा।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आप गेम जारी रखने के लिए अधिक "जीवन" (lives) खरीद सकते हैं। पुरानी रणनीति हर बार 1,000 जीवन खरीदने की थी, भले ही आपको लेवल पार करने के लिए केवल 2 की आवश्यकता हो। आपने उन जीवनों पर बहुत अधिक पैसा (समय) खर्च किया जिनका आपने कभी उपयोग ही नहीं किया।

2. नई अंतर्दृष्टि: यह पल पर निर्भर करता है

लेखकों ने देखा कि कभी-कभी "तेज़ दोस्त" बहुत आश्वस्त होता है (शब्दों का आसानी से सही अनुमान लगाता है), और कभी-कभी वह बहुत भ्रमित होता है (बेतरतीब ढंग से अनुमान लगाता है)।

  • उपमा:
    • आत्मविश्वासी राउंड (Confident Round): दोस्त कहता है, "मैं 99% निश्चित हूँ कि अगला शब्द 'The' है।" आपको केवल एक छोटी सी जांच की आवश्यकता है। बहुत बड़ा अनुमान लगाना यहाँ फिजूलखर्ची है।
    • भ्रमित राउंड (Confused Round): दोस्त कहता है, "मुझे कोई अंदाजा नहीं है, यह 'The', 'A', 'An', 'But' कुछ भी हो सकता है..." यह सुनिश्चित करने के लिए कि आप सही चीज़ को मिस न कर दें, आपको अनुमानों का एक बड़ा पेड़ चाहिए।

पुराने तरीकों ने हर बार एक निश्चित आकार का पेड़ इस्तेमाल किया। नया तरीका, CaDDTree, हर बार पेड़ का आकार बदल देता है, इस आधार पर कि दोस्त कितना आत्मविश्वासी है और जांच कितनी महंगी है।

3. "गति बनाम आकार" का संतुलन

यह पेपर एक नया लक्ष्य पेश करता है: थ्रूपुट (Throughput)। केवल यह पूछने के बजाय कि "हमने कितने शब्द सही पाए?", वे पूछते हैं, "हमने प्रति सेकंड कितने शब्द सही पाए?"

  • उपमा: एक डिलीवरी ट्रक की कल्पना करें।
    • यदि आप 100 पैकेज लोड करते हैं लेकिन केवल 2 डिलीवर होते हैं क्योंकि बाकी गलत थे, तो आपने ईंधन बर्बाद किया।
    • यदि आप 5 पैकेज लोड करते हैं और सभी 5 डिलीवर होते हैं, तो आप कुशल थे।
    • CaDDTree हर यात्रा के लिए "परफेक्ट लोड" की गणना करता है। यदि रास्ता ऊबड़-खाबड़ है (AI अनिश्चित है), तो यह अधिक पैकेज लोड करता है। यदि रास्ता चिकना है (AI सुनिश्चित है), तो यह ईंधन (समय) बचाने के लिए कम पैकेज लोड करता है।

4. यह कैसे काम करता है (द "ग्रीडी" स्टॉप)

पेपर गणितीय रूप से सिद्ध करता है कि अनुमान लगाने के लिए एक "स्वीट स्पॉट" (सही बिंदु) होता है।

  • उपमा: कल्पना कीजिए कि आप पाइप से बाल्टी में पानी भर रहे हैं।
    • शुरुआत में, अधिक पानी डालने से बाल्टी जल्दी भर जाती है।
    • लेकिन अंततः, पाइप जाम हो जाता है, या बाल्टी इतनी भर जाती है कि अधिक पानी डालने से वह छलकने लगता है और प्रयास बर्बाद होता है।
    • CaDDTree में एक स्मार्ट सेंसर है जो कहता है, "ठीक है, हमारे पास अभी पर्याप्त पानी है। भरना बंद करो!" यह ठीक उसी समय रुक जाता है जब और अधिक अनुमान लगाने से आपको फायदा होने के बजाय आपकी गति धीमी होने लगती है।

5. परिणाम

शोधकर्ताओं ने गणित की समस्याओं, कोडिंग और कहानियाँ लिखने जैसे विभिन्न कार्यों पर इसका परीक्षण किया।

  • परिणाम: CaDDTree "परफेक्ट" निश्चित-आकार वाले तरीके (जिसके लिए सही आकार खोजने के लिए बहुत अधिक परीक्षण और त्रुटि की आवश्यकता होती है) के समान ही प्रभावी था, लेकिन इसे किसी परीक्षण और त्रुटि की आवश्यकता नहीं थी। इसने खुद ही सही आकार का पता लगा लिया, हर बार।
  • लाभ: इसने सटीकता से समझौता किए बिना AI को तेज़ (कम लेटेंसी) बना दिया। इसने तब अनुमान लगाने में समय बचाया जब उसकी ज़रूरत नहीं थी, और तब कम अनुमान लगाकर जब उसकी ज़रूरत थी।

संक्षेप में: CaDDTree एक स्मार्ट शेफ की तरह है जो खाना पकाने से पहले मेहमान की भूख को देखता है। कभी-कभी वह एक छोटा नाश्ता बनाता है; कभी-कभी एक बड़ा भोजन। परिणाम यह है कि मेहमानों को तेज़ी से खिलाया जाता है, और रसोई बर्बाद सामग्री के साथ ओवरवेलम (अभिभूत) नहीं होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →