← नवीनतम पेपर
💬 NLP

AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding

AngelSpec एक एकीकृत प्रशिक्षण ढांचा पेश करता है जो विशिष्ट ड्राफ्टिंग संरचनाओं (चैट के लिए MTP और कोड/गणित के लिए ब्लॉक-डिफ्यूजन) को सह-विशेषज्ञ बनाता है और विविध वास्तविक दुनिया के वर्कलोड्स में महत्वपूर्ण थ्रूपुट सुधार और उच्च स्वीकृति दर प्राप्त करने के लिए इन्फरेंस सत्यापन संसाधनों को गतिशील रूप से अनुकूलित करता है।

मूल लेखक: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

प्रकाशित 2026-07-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को कहानियाँ लिखना, गणित की समस्याएँ हल करना या कंप्यूटर कोड लिखना सिखाने की कोशिश कर रहे हैं। यह रोबोट, जिसे लार्ज लैंग्वेज मॉडल (LLM) के रूप में जाना जाता है, अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन इसमें एक बहुत ही विशिष्ट कमी है: यह एक बार में एक शब्द के बारे में सोचता है। एक वाक्य लिखने के लिए, इसे रुकना होगा, सोचना होगा और पहला शब्द बनाना होगा, फिर दोबारा सोचना होगा और दूसरा शब्द बनाना होगा, और इसी तरह। यह एक ऐसे शेफ की तरह है जो केवल एक सब्जी काट सकता है, फिर उसे अगली सब्जी काटने के लिए पूरी रसोई के ठंडा होने का इंतज़ार करना पड़ता है। जैसे-जैसे रोबोट अधिक स्मार्ट होता जाता है और अनुरोध अधिक जटिल होते जाते हैं, यह "एक-एक करके" चलने वाली प्रक्रिया कष्टप्रद रूप से धीमी हो जाती है, जैसे धीमी गति में पेंट सूखते हुए देखना।

चीजों को तेज करने के लिए, वैज्ञानिकों ने "स्पेक्टिव डिकोडिंग" (speculative decoding) नामक एक तरकीब ईजाद की। इसे एक टीम वर्क की तरह समझें। आपके पास एक छोटा, तेज़ "ड्राफ्टिंग" रोबोट है जो वाक्य के अगले कुछ शब्दों का अनुमान लगाता है, और एक विशाल, धीमा "टारगेट" रोबोट है जो यह जाँचता है कि उसके अनुमान सही हैं या नहीं। यदि बड़ा रोबोट सहमत होता है, तो टीम एक साथ कई शब्द लिख सकती है, बजाय इसके कि वे एक-एक करके लिखे जाएँ। यह एक तेज़ धावक की तरह है जो आगे के रास्ते का अनुमान लगाता है; यदि अनुमान सही है, तो वे दोनों एक साथ आगे बढ़ते हैं, जिससे बहुत सारा समय बचता है। हालाँकि, एक पेच है: तेज़ धावक हमेशा सही नहीं होता है। यदि वह बहुत सारे गलत शब्द अनुमानित करता है, तो बड़े रोबोट को उन्हें सुधारने में समय बर्बाद करना पड़ता है, और पूरी प्रक्रिया धीमी हो जाती है। बड़ा सवाल यह है कि हम तेज़ धावक को बेहतर अनुमान लगाने में कैसे मदद करें, और हमें यह कैसे पता चलेगा कि कब अनुमान लगाना बंद करना है ताकि समय बर्बाद न हो?

यहीं पर AngelSpec नामक एक नया प्रोजेक्ट आता है। टेनसेंट (Tencent) के शोधकर्ताओं ने महसूस किया कि एक एकल "फास्ट रनर" रणनीति हर स्थिति में काम नहीं करती है। ठीक वैसे ही जैसे एक स्प्रिंटर (कम दूरी का धावक) एक छोटी दौड़ में महान हो सकता है लेकिन मैराथन में बहुत बुरा, अलग-अलग प्रकार के टेक्स्ट के लिए अलग-अलग अनुमान लगाने की रणनीतियों की आवश्यकता होती है। उदाहरण के लिए, एक अनौपचारिक चैट संदेश लिखना अराजक और आश्चर्यों से भरा (उच्च एंट्रॉपी) होता है, जबकि गणित का प्रमाण या कंप्यूटर प्रोग्राम लिखना बहुत संरचित और पूर्वानुमानित होता है। पेपर का तर्क है कि एक ही "यूनिवर्सल" अनुमान लगाने वाले रोबोट का उपयोग हर चीज़ के लिए करना एक गलती है। इसके बजाय, उन्होंने एक ऐसा सिस्टम बनाया है जो कार्य के आधार पर दो अलग-अलग प्रकार के गेसर्स (अनुमान लगाने वालों) का उपयोग करता है, और एक स्मार्ट मैनेजर है जो यह तय करता है कि सिस्टम कितना व्यस्त है इसके आधार पर उनके अनुमानों की जाँच करने में बिल्कुल कितना समय खर्च करना है।

टीम ने कोडिंग और गणित जैसे संरचित कार्यों के लिए DFly नामक एक नई विधि पेश की। कल्पना कीजिए कि DFly जासूसों की एक टीम है जो केवल एक-एक करके अगले सुराग का अनुमान नहीं लगाती, बल्कि पैटर्न देखने के लिए पूरे पहेली को एक साथ देखती है। वे एक विशेष "हाइब्रिड" मस्तिष्क का उपयोग करते हैं जो बड़ी तस्वीर को देखता है और फिर जो तुरंत पहले आया था उसके आधार पर अपने अनुमानों को सटीक बनाता है। यह उन्हें कोड या गणित के लंबे चरणों की उच्च सटीकता के साथ भविष्यवाणी करने की अनुमति देता है। चैट जैसे बिखरे हुए, रचनात्मक कार्यों के लिए, वे एक सरल, तेज़ विधि का उपयोग करते हैं जिसे MTP (Multi-Token Prediction) कहा जाता है, जो त्वरित, संवादात्मक विस्फोटों के लिए बेहतरीन है।

लेकिन एक अच्छा गेसर होना ही काफी नहीं है; आपके पास एक स्मार्ट मैनेजर भी होना चाहिए। पेपर में D-cut नामक एक फीचर पेश किया गया है, जो एक ट्रैफिक कंट्रोलर की तरह काम करता है। एक व्यस्त सर्वर में, कभी-कभी "चेकिंग" की प्रक्रिया बाधित हो जाती है। D-cut वास्तविक समय में अनुमानों के आत्मविश्वास को देखता है। यदि कोई अनुमान संदिग्ध लगता है, तो D-cut समय बचाने के लिए उसे जल्दी से काट देता है। यदि सिस्टम सुचारू रूप से चल रहा है और अनुमान ठोस दिख रहे हैं, तो यह टीम को और अधिक समय तक चलने देता है। यह एक कंडक्टर की तरह है जो संगीत आसान होने पर ऑर्केस्ट्रा की गति बढ़ाता है और संगीत कठिन होने पर उसे धीमा कर देता है, यह सुनिश्चित करता है कि पूरा प्रदर्शन क्रैश हुए बिना तेज़ बना रहे।

इस दृष्टिकोण के परिणाम प्रभावशाली हैं। जब उन्होंने अपने नए सिस्टम का परीक्षण Hy3-A21B मॉडल पर किया, तो उन्होंने पाया कि यह पुराने "एक-शब्द-एक-समय" वाले तरीके की तुलना में टेक्स्ट को बहुत तेज़ी से प्रोसेस कर सकता है। विशेष रूप से, सिस्टम ने पुराने "एक-शब्द-एक-समय" पद्धति की तुलना में 1.98 से 2.40 गुना अधिक गति प्राप्त की। इससे भी बेहतर, यह पिछले सबसे अच्छे ज्ञात तरीके, जिसे DFlash कहा जाता है, से 10.5% से 11.8% तेज़ था। शोधकर्ताओं ने दिखाया कि टेक्स्ट के विशिष्ट प्रकार (चैट बनाम कोड) के अनुसार अनुमान लगाने की रणनीति को अनुकूलित करके और कार्यभार के अनुसार समायोजित करने के लिए स्मार्ट मैनेजर का उपयोग करके, वे अपनी कंप्यूटिंग शक्ति का अधिकतम लाभ उठा सकते हैं। उन्होंने अपना पूरा टूलकिट, जिसे AngelSpec कहा जाता है, सार्वजनिक रूप से जारी कर दिया है ताकि अन्य वैज्ञानिक अपने स्वयं के AI मॉडल को तेज़ और अधिक कुशल बनाने के लिए इन ट्रिक्स का उपयोग कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →