← नवीनतम पेपर
💻 computer science

SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

SPADE एक वितरित इन्फरेंस फ्रेमवर्क है जो एज और क्लाउड वातावरण में स्पेक्युलेटिव डिकोडिंग को एकीकृत करता है, जिसमें टोकन उत्पन्न करने के लिए एक कॉम्पैक्ट एज ड्राफ्ट मॉडल और उन्हें समानांतर में सत्यापित करने के लिए एक क्लाउड वेरीफायर का उपयोग किया जाता है, जिससे बिना रिट्रेनिंग के लार्ज लैंग्वेज मॉडल्स की सटीकता बनाए रखते हुए क्लाउड मॉडल कॉल्स में 76% की कमी आती है और लागत कम होती है।

मूल लेखक: Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal

प्रकाशित 2026-08-14
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल पहेली को सुलझाने की कोशिश कर रहे हैं, लेकिन केवल एक ही व्यक्ति जानता है कि अंतिम चित्र कैसा दिखेगा—वह एक अत्यंत बुद्धिमान, सुपर-स्मार्ट प्रोफेसर है जो एक दूर स्थित, महंगे महल में रहता है। हर बार जब आप प्रोफेसर से अगले टुकड़े के लिए पूछते हैं, तो उन्हें अपना सब कुछ रोककर, बहुत गहराई से सोचना पड़ता है और फिर वह आपको उसे भेजते हैं। आज के सबसे शक्तिशाली आर्टिफिशियल इंटेलिजेंस (AI) बिल्कुल इसी तरह काम करते हैं। ये "लार्ज लैंग्वेज मॉडल्स" उस प्रोफेसर की तरह हैं: वे अविश्वसनीय रूप से बुद्धिमान हैं और कहानियाँ लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं, और मनुष्यों की तरह बातचीत कर सकते हैं, लेकिन वे बहुत विशाल, कंप्यूटर पावर के भूखे और जवाब देने में धीमे भी हैं यदि आपको हर बार "महल" का इंतज़ार करना पड़े।

इसे तेज़ बनाने के लिए, कुछ लोग आपके फोन या लैपटॉप पर ही प्रोफेसर का एक छोटा, स्थानीय संस्करण बनाने की कोशिश करते हैं। लेकिन यह स्थानीय सहायक अक्सर थोड़ा अनाड़ी हो सकता है; यह गलत पहेली का टुकड़ा अनुमान लगा सकता है, जिससे मूर्खतापूर्ण गलतियाँ हो सकती हैं। वैज्ञानिक जिस बड़ी चुनौती का सामना कर रहे हैं वह यह है: हम स्थानीय सहायक की गति को बिना प्रोफेसर की प्रतिभा खोए कैसे प्राप्त करें? हमें एक ऐसा तरीका चाहिए जिससे स्थानीय सहायक भारी काम कर सके, लेकिन केवल तभी जब वास्तव में आवश्यक हो, ताकि यह सुनिश्चित हो सके कि अंतिम परिणाम भी सटीक हो। यह वह पहेली है जिसे इस शोध पत्र के शोधकर्ताओं ने सुलझाने का निर्णय लिया।

यहाँ आता है SPADE, एक चतुर नया सिस्टम जो एक स्थानीय "ड्राफ्ट्समैन" (लेखक) और क्लाउड-आधारित "एडिटर" (संपादक) के बीच एक हाई-स्पीड रिले रेस की तरह काम करता है। यह शोध पत्र "स्पेक्टिवल डिकोडिंग" (Speculative Decoding) नामक एक विधि पेश करता है, जो यहाँ असली गुप्त मंत्र है। इसे इस तरह समझें: एक-एक शब्द के लिए प्रोफेसर से पूछने के बजाय, आप अपने स्थानीय ड्राफ्ट्समैन (एक छोटा, तेज़ AI जो आपके डिवाइस पर चलता है) को अंदाज़ों के साथ एक पूरा वाक्य जल्दी से लिखने देते हैं। फिर, आप उस पूरे वाक्य को क्लाउड में मौजूद प्रोफेसर को एक ही बार में भेज देते हैं। प्रोफेसर पूरी चीज़ को दोबारा नहीं लिखता; वे बस जल्दी से स्कैन करते हैं कि कौन से शब्द सही हैं। यदि ड्राफ्ट्समैन ने सही अनुमान लगाया, तो प्रोफेसर उसे 'थम्स-अप' देता है, और आप उन शब्दों को रख लेते हैं। यदि कोई शब्द गलत है, तो प्रोफेसर बस उसी एक शब्द को ठीक करता है, और ड्राफ्ट्समैन वहीं से आगे बढ़ता रहता है।

IIT बॉम्बे के लेखकों ने पाया कि यह दृष्टिकोण गेम-चेंजर है। स्थानीय डिवाइस को अधिकांश अनुमान लगाने देने और क्लाउड से केवल "होमवर्क चेक" करने के लिए कहने से, वे क्लाउड मॉडल को कॉल करने की संख्या को भारी रूप से कम करने में सफल रहे। अपने परीक्षणों में, उन्होंने दिखाया कि SPADE क्लाउड कॉल्स की संख्या को एक विशाल 76% तक कम कर सकता है। इसका मतलब है कि AI बहुत तेज़ी से चलता है और इसे उपयोग करने की लागत बहुत कम है, फिर भी—यही जादू है—यह उतने ही सटीक उत्तर देता है जैसे कि क्लाउड प्रोफेसर ने हर एक शब्द को शुरू से लिखा हो। उन्होंने समाचार लेखों का सारांश निकालने और कठिन सवालों के जवाब देने जैसे विभिन्न कार्यों पर इसका परीक्षण किया, और परिणाम सुसंगत थे: सिस्टम बड़े मॉडल के लगभग उतना ही स्मार्ट था, लेकिन कहीं अधिक कुशल था।

शोध पत्र स्पष्ट रूप से इस विचार के विरुद्ध तर्क देता है कि आपको गति और बुद्धिमत्ता में से किसी एक को चुनना होगा। आपको एक धीमे, पूर्ण क्लाउड मॉडल के साथ समझौता करने की आवश्यकता नहीं है, और न ही आपको एक तेज़ लेकिन त्रुटिपूर्ण स्थानीय मॉडल को स्वीकार करने की आवश्यकता है। इसके बजाय, SPADE सिद्ध करता है कि आप काम को बुद्धिमानी से विभाजित करके दोनों पा सकते हैं। शोधकर्ता इन निष्कर्षों को लेकर काफी आश्वस्त हैं, क्योंकि उन्होंने इसे कई वास्तविक दुनिया के डेटासेट्स पर मापा है। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने आंकड़े जुटाए और दिखाया कि सिस्टम बड़े मॉडल की उच्च सटीकता को बनाए रखते हुए क्लाउड कंप्यूटिंग पर खर्च होने वाले समय और पैसे को नाटकीय रूप रूप से कम करता है। यह एक व्यावहारिक, 'प्लग-एंड-प्ले' समाधान है जिसके लिए AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है, जो इसे बिना भारी खर्च के शक्तिशाली, स्मार्ट AI को रोज़मर्रा के उपकरणों तक पहुँचाने का एक व्यवहार्य मार्ग बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →