← नवीनतम पेपर
💻 computer science

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

यह शोध पत्र AHASD को प्रस्तुत करता है, जो एक टास्क-लेवल एसिंक्रोनस हेट्रोजेनियस मोबाइल आर्किटेक्चर है जो मौजूदा बेसलाइन्स की तुलना में लार्ज लैंग्वेज मॉडल्स के स्पेक्युलेटिव डिकोडिंग के लिए 4.2×\times थ्रूपुट और 5.6×\times ऊर्जा दक्षता सुधार प्राप्त करने के लिए नवीन नियंत्रण तंत्रों के साथ NPU-PIM सहयोग का लाभ उठाता है।

मूल लेखक: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका एक सख्त नियम है: आपको अगला शब्द लिखने से पहले हर एक शब्द की जांच करने के लिए एक बहुत ही बुद्धिमान, धीमी और महंगी संपादक (Target Model) से पूछना होगा। इससे लेखन बहुत धीमा हो जाता है।

काम को तेज़ करने के लिए, आप एक फुर्तीले, ऊर्जावान सहायक (Draft Model) को काम पर रखते हैं जो आपके लिए अगले कुछ शब्दों का अनुमान लगा सके। आप उनके अनुमानों को लिख लेते हैं, और फिर बुद्धिमान संपादक उन सभी की एक साथ जांच करता है। यदि अनुमान अच्छे हैं, तो आप उन्हें रखते हैं और आगे बढ़ते हैं। यदि वे खराब हैं, तो आप उन्हें फेंक देते हैं और फिर से शुरू करते हैं। इसे Speculative Decoding कहा जाता है।

एक मोबाइल फोन पर, इस प्रक्रिया में दो बड़ी समस्याएँ आती हैं:

  1. "इंतज़ार का खेल" (The Waiting Game): कभी सहायक 2 शब्द अनुमान लगाता है, तो कभी 20। यदि सहायक धीमा है, तो संपादक खाली बैठकर इंतजार करता है। यदि सहायक तेज़ है, तो संपादक अगले बैच के लिए इंतजार करता है। वे लगातार एक-दूसरे का हाथ थामे रहते हैं, एक-दूसरे के खत्म होने का इंतजार करते हैं, जिससे समय बर्बाद होता है।
  2. "गलत अनुमान" की समस्या (The Bad Guess Problem): कभी-कभी सहायक बहुत अधिक आत्मविश्वासी हो जाता है और मुश्किल संदर्भों में बिना सोचे-समझे पूरा पैराग्राफ ही गलत अनुमान लगा देता है। संपादक को वह पूरा हिस्सा खारिज करना पड़ता है, जिससे सहायक द्वारा खर्च की गई सारी ऊर्जा बेकार चली जाती है।

यह शोध पत्र AHASD पेश करता है, जो एक नया सिस्टम है जिसे PIM (Processing-in-Memory) नामक एक विशेष प्रकार की कंप्यूटर चिप और एक मानक AI चिप जिसे NPU कहते हैं, का उपयोग करके मोबाइल फोन पर इन समस्याओं को ठीक करने के लिए डिज़ाइन किया गया है।

AHASD कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. "असिंक्रोनस डांस" (Task-Level Asynchronous Execution)

पुराने सिस्टम में, सहायक और संपादक को एक ही ताल में नृत्य करना पड़ता था। यदि सहायक रुकता, तो संपादक भी रुक जाता।
AHASD इस कड़ी को तोड़ देता है। यह सहायक (जो मेमोरी चिप, PIM पर चल रहा है) और संपादक (जो प्रोसेसर, NPU पर चल रहा है) को स्वतंत्र रूप से काम करने देता है।

  • उदाहरण: एक फैक्ट्री असेंबली लाइन की कल्पना करें। इसके बजाय कि एक कर्मचारी मशीन के खत्म होने का इंतजार करे और फिर अगला कदम उठाए, कर्मचारी बिन (कतार) से नए पुर्जे उठाना और उन पर काम करना जारी रखता है जबकि मशीन पिछले बैच को प्रोसेस कर रही होती है। वे एक-दूसरे का इंतजार नहीं करते; वे बस काम को आगे बढ़ाते रहते हैं। यह उस "खाली समय" को समाप्त करता है जहाँ एक डिवाइस बिना कुछ किए बैठा रहता है।

2. "कॉन्फिडेंस रडार" (Entropy-History-Aware Drafting)

सहायक कभी-कभी बहुत अधिक आत्मविश्वासी हो जाता है और जब उसे सावधान रहना चाहिए, तब वह बेतहाशा अनुमान लगाने लगता है।
AHASD सहायक को एक "कॉन्फिडेंस रडार" देता है। यह उसके हालिया अनुमानों के इतिहास को देखता है।

  • उदाहरण: एक मौसम विज्ञानी के बारे में सोचें। यदि वे पिछले तीन दिनों से बारिश के बारे में गलत रहे हैं, तो वे अगले दिन के लिए बारिश की भविष्यवाणी करना बंद कर देते हैं, भले ही बादल समान दिख रहे हों। इसी तरह, यदि सहायक के अनुमानों में कम "आत्मविश्वास" (उच्च एंट्रॉपी) है, तो सिस्टम उसे कहता है: "आगे का अनुमान लगाना बंद करो! अगले शब्द का अनुमान लगाने से पहले संपादक द्वारा वर्तमान शब्द की पुष्टि का इंतजार करो।" यह सहायक को उन अनुमानों पर ऊर्जा बर्बाद करने से रोकता है जिन्हें निश्चित रूप से फेंक दिया जाएगा।

3. "स्मार्ट टाइमर" (Time-Aware Pre-Verification)

कभी-कभी सहायक अपना काम पूरा कर लेता है, लेकिन संपादक अभी भी व्यस्त होता है। सहायक फिर से अनुमान लगाना शुरू कर सकता है, लेकिन यदि वह बहुत अधिक अनुमान लगाता है, तो संपादक के पास जांचने के लिए काम खत्म हो सकता है और वह खाली बैठ सकता है।
AHASD एक "स्मार्ट टाइमर" का उपयोग करता है ताकि यह तय किया जा सके कि सहायक को कब रुकना चाहिए और खुद एक त्वरित "मिनी-चेक" (पूर्व-सत्यापन) करना चाहिए।

  • उदाहरण: एक शेफ (सहायक) की कल्पना करें जो सॉस पकाते हुए (संपादक) सब्जियां काट रहा है। शेफ को पता है कि सॉस बनने में कितना समय लगेगा। यदि शेफ देखता है कि सॉस 5 सेकंड में तैयार होने वाला है, तो वह सब्जियां काटना बंद कर देता है और सब्जियों का एक त्वरित स्वाद परीक्षण (पूर्व-सत्यापन) करता है ताकि यह सुनिश्चित हो सके कि वे तैयार हैं। यह सुनिश्चित करता है कि जैसे ही सॉस तैयार हो, शेफ के पास ताजी सब्जियां तैयार हों, ताकि शेफ को कभी भी खाली खड़ा न रहना पड़े।

परिणाम

लेखकों ने मोबाइल फोन चिप पर इस सिस्टम का एक सिमुलेशन बनाया। उन्होंने पाया कि:

  • गति (Speed): यह केवल एक मानक ग्राफिक्स कार्ड (GPU) का उपयोग करने की तुलना में 4.2 गुना तेज़ है और मोबाइल चिप्स को मेमोरी प्रोसेसिंग के साथ मिलाने के पिछले प्रयासों की तुलना में 1.5 गुना तेज़ है।
  • बैटरी लाइफ: यह एक मानक GPU की तुलना में 5.6 गुना अधिक ऊर्जा-कुशल है और पिछले सर्वश्रेष्ठ मोबाइल सिस्टम की तुलना में 1.24 गुना बेहतर है।
  • लागत (Cost): ये सभी शानदार नई सुविधाएँ मेमोरी चिप पर केवल लगभग 3% अतिरिक्त जगह लेती हैं, जो इतनी बड़ी गति वृद्धि के लिए एक बहुत ही छोटा मूल्य है।

संक्षेप में, AHASD आपके फोन के AI को ऐसे श्रमिकों की एक टीम देने जैसा है जो एक-दूसरे का इंतजार करने के बजाय काम को सुचारू रूप से चलाने के लिए एक-दूसरे से स्वतंत्र होकर काम करते हैं, बैटरी पावर बर्बाद किए बिना अपने आत्मविश्वास की जांच करते हैं और अपने ब्रेक का समय भी सटीक रखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →