← नवीनतम पेपर
🤖 machine learning

Bastion: Budget-Aware Speculative Decoding with Tree-structured Block Diffusion Drafting

BASTION एक ट्रेनिंग-मुक्त, बजट-जागरूक स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है जो हार्डवेयर बाधाओं के साथ ड्राफ्ट की गुणवत्ता को संतुलित करने के लिए एडेप्टिव बेस्ट-फर्स्ट एक्सपेंशन के माध्यम से डायनामिक रूप से क्वेरी-डिपेंडेंट ट्री स्ट्रक्चर्स का निर्माण करता है, जिससे मानक ऑटोरेग्रेसिव डिकोडिंग की तुलना में 6.61x तक की स्पीडअप प्राप्त होता है और मौजूदा ब्लॉक-डिफ्यूजन बेसलाइन्स से बेहतर प्रदर्शन होता है।

मूल लेखक: Soowon Oh, Nam Cao, Yujin Kim, Hojung Jung, Huzama Ahmad, Sangmin Bae, Se-Young Yun

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Soowon Oh, Nam Cao, Yujin Kim, Hojung Jung, Huzama Ahmad, Sangmin Bae, Se-Young Yun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी कहानी लिखने की कोशिश कर रहे हैं जिसके लिए एक बहुत ही बुद्धिमान, लेकिन अविश्वसनीय रूप से धीमे संपादक (Target Model) की आवश्यकता है। हर बार जब आप एक शब्द लिखते हैं, तो आपको अगले शब्द को लिखने से पहले संपादक द्वारा उसे पढ़ने, उस पर विचार करने और हरी झंडी देने का इंतज़ार करना पड़ता है। वर्तमान AI चैटबॉट्स इसी तरह काम करते हैं: वे एक बार में एक शब्द लिखते हैं, और हर एक कदम के बाद "चेक" के लिए प्रतीक्षा करते हैं। यह सटीक तो है, लेकिन बहुत कष्टदायक रूप से धीमा है।

इस प्रक्रिया को तेज़ करने के लिए, शोधकर्ता एक Drafting Model (एक तेज़, कम बुद्धिमान सहायक) का उपयोग करते हैं जो संपादक द्वारा जांच किए जाने से पहले अगले कुछ शब्दों का अनुमान लगा लेता है। यदि संपादक उनके अनुमान से सहमत होता है, तो आप एक साथ कई शब्द लिख सकते हैं, जिससे प्रतीक्षा का समय बच जाता है।

हालाँकि, इसमें एक पेंच है। नवीनतम, सबसे तेज़ ड्राफ्टर्स (Block Diffusion) के साथ यह समस्या है। वे एक-एक करके शब्द नहीं बताते, बल्कि एक साथ शब्दों का पूरा ब्लॉक चिल्लाकर बोल देते हैं। समस्या यह है कि क्योंकि वे सभी शब्दों को एक साथ बोलते हैं, इसलिए वे हमेशा यह सुनिश्चित नहीं कर पाते कि शब्द एक तार्किक क्रम में एक-दूसरे के साथ कैसे फिट बैठते हैं। यह एक शेफ की तरह है जो काउंटर पर एक साथ बहुत सारी सामग्रियां फेंक देता है; व्यक्तिगत रूप से वे अच्छी दिख सकती हैं, लेकिन यदि आप बस ऊपर वाली चीज़ उठा लें, तो आपको एक अजीब और बेतुका व्यंजन मिल सकता है।

BASTION इस गड़बड़ी को ठीक करने और इस प्रक्रिया को बिजली की तरह तेज़ बनाने के लिए बनाया गया एक नया सिस्टम है। यह यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "संभावनाओं का पेड़" (एक एकल पथ के बजाय)

पुराने तरीके ड्राफ्टर के चिल्लाने के बाद, एक एकल "सर्वश्रेष्ठ" शब्द चुनते थे, फिर अगला "सर्वश्रेष्ठ" शब्द, और फिर उम्मीद करते थे कि सब ठीक होगा। यदि वह रास्ता गलत साबित होता, तो संपादक को पूरी चीज़ को खारिज करना पड़ता था, और आपका समय बर्बाद हो जाता था।

BASTION अलग है। कल्पना कीजिए कि ड्राफ्टर आपको केवल एक पथ नहीं देता; वह आपको संभावनाओं का एक पारिवारिक वृक्ष (Family Tree) देता है।

  • पहले चरण में, वह कहता है, "शायद अगला शब्द 'बिल्ली' (80% संभावना) है या 'कुत्ता' (20% संभावना)।"
  • केवल 'बिल्ली' चुनने के बजाय, BASTION एक छोटा पेड़ बनाता है: 'बिल्ली' के लिए एक शाखा, और 'कुत्ता' के लिए एक शाखा।
  • फिर, अगले शब्द के लिए, वह दोनों 'बिल्ली' और 'कुत्ता' से फिर से शाखाएँ निकालता है।
  • अचानक, आपके पास एक ही शुरुआती बिंदु से विकसित होते संभावित वाक्यों का एक छोटा जंगल आ जाता है।

2. "स्मार्ट माली" (बजट-जागरूक नियंत्रक)

यहाँ पेचीदा हिस्सा है: आप एक अनंत जंगल नहीं उगा सकते। संपादक (Target Model) के पास एक सीमा है कि वह एक बार में कितनी शाखाओं की जांच कर सकता है। यदि आप एक ऐसा पेड़ उगाते हैं जो बहुत चौड़ा या बहुत गहरा है, तो पेड़ की जांच करने में लगने वाला समय एक-एक करके शब्द लिखने से अधिक लंबा हो जाएगा।

यहीं BASTION का "स्मार्ट माली" काम आता है।

  • बजट: माली को ठीक पता होता है कि संपादक के पास कितना समय (बजट) है।
  • रणनीति: पेड़ को एक निश्चित आकार (जैसे "हमेशा 10 शाखाएं") तक उगाने के बजाय, माली प्रत्येक शाखा के आत्मविश्वास (Confidence) को देखता है।
    • यदि कोई शाखा बहुत ही आशाजनक दिखती है (उच्च आत्मविश्वास), तो माली उसे और गहरा उगाता है।
    • यदि कोई शाखा कमजोर दिखती है, तो वह वहीं रुक जाता है।
  • स्टॉप साइन: माली लगातार पूछता है, "क्या एक और शाखा जोड़ना हमें अधिक गति देगा, या क्या यह केवल मृत अंत (Dead ends) की जांच करने में समय बर्बाद करेगा?" जैसे ही एक नई शाखा की जांच करने की लागत उसके लाभ से अधिक हो जाती है, माली पेड़ को उगाना बंद कर देता है और उसे संपादक को भेज देता है।

3. "स्पीडोमीटर" (हार्डवेयर जागरूकता)

अलग-अलग कंप्यूटर (GPUs) अलग-अलग कारों की तरह हैं। एक स्पोर्ट्स कार (एक शक्तिशाली GPU) एक विशाल पेड़ की बहुत तेज़ी से जांच कर सकती है। एक कॉम्पैक्ट कार (एक कमजोर GPU) उसी पेड़ के साथ संघर्ष कर सकती है।

BASTION में एक अंतर्निहित स्पीडोमीटर है जो जानता है कि आपका विशिष्ट कंप्यूटर वास्तव में कितना तेज़ है। यह केवल अनुमान नहीं लगाता; यह मापता है कि आपके मशीन पर एक निश्चित आकार के पेड़ को सत्यापित करने में कितना समय लगता है। यह इस वास्तविक समय के डेटा का उपयोग यह तय करने के लिए करता है कि आपके विशिष्ट सेटअप के लिए पेड़ का आकार कितना होना चाहिए, जिससे यह सुनिश्चित होता है कि आपको अपने कंप्यूटर पर बोझ डाले बिना अधिकतम गति मिले।

परिणाम

इन विचारों को जोड़कर, BASTION वह उपलब्धि हासिल करता है जिसे पेपर में 6.61x स्पीडअप कहा गया है।

  • Standard AI: 1 शब्द लिखता है, इंतज़ार करता है, 1 शब्द लिखता है, इंतज़ार करता है। (गति: 1x)
  • पुराने तेज़ तरीके: कुछ शब्दों का अनुमान लगाते हैं, लेकिन अक्सर गलत पथ पर फंस जाते हैं। (गति: ~2-3x)
  • BASTION: अनुमानों का एक स्मार्ट, कस्टम-साइज़ का पेड़ उगाता है, सबसे आशाजनक पथों की जांच करता है, और ठीक उसी समय रुक जाता है जब यह सबसे कुशल होता है। (गति: ~6.6x)

संक्षेप में, BASTION AI लेखन के लिए एक स्मार्ट प्रोजेक्ट मैनेजर की तरह है। अंधाधुंध अनुमान लगाने या एक कठोर संरचना बनाने के बजाय, यह गतिशील रूप से विकल्पों का एक लचीला "पेड़" बनाता है जो कंप्यूटर की गति के लिए पूरी तरह से अनुकूलित है, जिससे यह सुनिश्चित होता है कि AI बिना गलतियाँ किए जितनी हो सके उतनी तेज़ी से लिख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →