← नवीनतम पेपर
🤖 machine learning

EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture

यह शोध पत्र EVA को प्रस्तुत करता है, जो एक हार्डवेयर-सॉफ्टवेयर सह-अनुकूलित आर्किटेक्चर है जो मेमोरी-बाउंड वेक्टर क्वांटाइजेशन लुकअप को कुशल, संघर्ष-मुक्त GEMM गणनाओं में बदलकर LLM डिकोडिंग को त्वरित करता है, जिससे अत्याधुनिक तरीकों की तुलना में 11.17× तक की गति वृद्धि और 7.17× अधिक ऊर्जा दक्षता प्राप्त होती है।

मूल लेखक: Bowen Duan, Cong Guo, Chiyue Wei, Haoxuan Shan, Yuzhe Fu, Xinhua Chen, Yifan Xu, Ziyue Zhang, Changchun Zhou, Hai Li, Yiran Chen

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bowen Duan, Cong Guo, Chiyue Wei, Haoxuan Shan, Yuzhe Fu, Xinhua Chen, Yifan Xu, Ziyue Zhang, Changchun Zhou, Hai Li, Yiran Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल पुस्तकालय (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और आपसे बातचीत कर सकता है। इस पुस्तकालय को चलाने के लिए, कंप्यूटर को मुख्य रूप से दो काम करने होते हैं: एक साथ टेक्स्ट के एक बहुत बड़े हिस्से को पढ़ना (प्रिफिल स्टेज) और एक-एक करके शब्द लिखना (डिकोडिंग स्टेज)।

यह शोध पत्र तर्क देता है कि जबकि पढ़ना तेज़ है, एक-एक करके शब्द लिखना वर्तमान कंप्यूटरों पर अविश्वसनीय रूप से धीमा और बर्बादी भरा है। लेखक, जो ड्यूक यूनिवर्सिटी के एक दल से हैं, ने इस समस्या को ठीक करने के लिए EVA नामक एक नया सिस्टम बनाया है।

EVA कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

समस्या: "एक-समय-पर-एक-शब्द" का ट्रैफिक जाम

कंप्यूटर के मस्तिष्क (प्रोसेसर) को हजारों श्रमिकों (प्रोसेसिंग यूनिट्स) वाले एक विशाल कारखाने के रूप में सोचें जो गणित करने के लिए तैयार हैं।

  1. प्रिफिल स्टेज (पढ़ना): कल्पना करें कि कारखाने को 1,000 बक्सों की एक बड़ी खेप मिलती है। सभी श्रमिक एक साथ एक बॉक्स पकड़ सकते हैं और उस पर काम कर सकते हैं। यह तेज़ और कुशल है।
  2. डिकोडिंग स्टेज (लिखना): अब, कल्पना करें कि कारखाने को केवल एक छोटा सा आइटम बनाना है, फिर रुकना है, फिर एक और बनाना है, फिर रुकना है। भले ही कारखाने में हजारों श्रमिक हों, लेकिन केवल एक या दो ही व्यस्त रहते हैं। बाकी सब खाली खड़े रहते हैं। यह वह "GEMV" समस्या है जिसका उल्लेख पेपर में किया गया है: कंप्यूटर मेमोरी-बाउंड (डेटा का इंतज़ार करना) है न कि कंप्यूट-बाउंड (गणित करना), जिससे एक बड़ा ट्रैफिक जाम लग जाता है।

पुराना समाधान: "डिक्शनरी लुकअप" की बाधा

कारखाने को तेज़ बनाने के लिए, इंजीनियरों ने वेक्टर क्वांटाइजेशन (VQ) नामक तकनीक का उपयोग करके "निर्देश पुस्तिका" (मॉडल वेट्स) को छोटा करने की कोशिश की।

  • उपमा: हर शब्द के लिए पूर्ण निर्देश लिखने के बजाय, उन्होंने लंबे निर्देशों को छोटे कोड (जैसे "A1," "B2") से बदल दिया जो एक साझा डिक्शनरी (कोडबुक) की ओर इशारा करते हैं।
  • नई समस्या: हालांकि यह मैनुअल को छोटा करता है, लेकिन यह एक नया ट्रैफिक जाम पैदा करता है। हर बार जब कारखाने को एक शब्द बनाने की आवश्यकता होती है, तो उसे डिक्शनरी में जाना पड़ता है, कोड खोजना पड़ता है और निर्देश प्राप्त करना पड़ता है।
  • संघर्ष: कल्पना करें कि 100 श्रमिक एक ही समय में डिक्शनरी की एक ही शेल्फ की ओर दौड़ रहे हैं। वे आपस में टकराते हैं, जिससे टकराव होता है। उन्हें लाइन में लगना पड़ता है, जिससे सब कुछ धीमा हो जाता है। पेपर इसे "मेमोरी इनएफिशिएंसी" कहता है।

EVA समाधान: वर्कफ़्लो को बदलना

EVA के लेखकों ने महसूस किया कि उन्हें डिक्शनरी बदलने की ज़रूरत नहीं थी; उन्हें बस यह बदलने की ज़रूरत थी कि श्रमिक उसका उपयोग कैसे करते हैं। उन्होंने एक दो-चरणीय जादू पेश किया:

चरण 1: कोड खोजने से पहले गणित करें

पहले कोड ढूँढने और फिर गणित करने के बजाय, EVA इस क्रम को उलट देता है।

  • उपमा: कल्पना करें कि श्रमिक डिक्शनरी का इंतज़ार नहीं करते। इसके बजाय, वे इनपुट (प्रश्न) लेते हैं और उसे एक साथ पूरी डिक्शनरी के विरुद्ध चलाते हैं।
  • परिणाम: यह "एक-एक करके" वाली गणित की समस्या को एक "बड़े बैच" वाली गणित की समस्या में बदल देता है। कंप्यूटर की भाषा में, उन्होंने एक धीमी GEMV (मैट्रिक्स-वेक्टर) प्रक्रिया को एक तेज़ GEMM (मैट्रिक्स-मैट्रिक्स) प्रक्रिया में बदल दिया। अब, कारखाने के सभी श्रमिक फिर से व्यस्त हैं, समानांतर (parallel) में गणित कर रहे हैं।

चरण 2: "टकराव-मुक्त" लुकअप

एक बार गणित हो जाने के बाद, श्रमिकों के पास "मध्यवर्ती परिणामों" (एक आउटपुट कोडबुक) की एक सूची होती है।

  • उपमा: पुराने सिस्टम में, हर कोई एक ही शेल्फ की ओर दौड़ता था। EVA में, परिणाम पहले से ही अलग-अलग, अलग बक्सों में व्यवस्थित होते हैं। जब किसी श्रमिक को एक विशिष्ट परिणाम की आवश्यकता होती है, तो वह अपने समर्पित बिन (bin) में जाता है। कोई भी किसी से नहीं टकराता।
  • परिणाम: "मेमोरी संघर्ष" पूरी तरह से समाप्त हो जाता है। लुकअप तुरंत और समानांतर हो जाता है।

हार्डवेयर: एक स्मार्ट फैक्ट्री फ्लोर

पेपर उस भौतिक मशीन (चिप) का भी वर्णन करता है जिसे इस सिस्टम को चलाने के लिए बनाया गया है:

  • पुनर्गठित श्रमिक (Reconfigurable Workers): कारखाने के श्रमिक स्मार्ट हैं। वे मोड बदल सकते हैं। जब कंप्यूटर "पढ़" रहा होता है (प्रिफिल), तो वे सरल, तेज़ 8-बिट नंबरों के साथ काम करते हैं। जब यह "लिख" रहा होता है (डिकोडिंग), तो गुणवत्ता बनाए रखने के लिए वे अधिक सटीक 16-बिट नंबरों पर स्विच कर जाते हैं।
  • विशेष एडर्स (Specialized Adders): एक शब्द लिखने का अंतिम चरण केवल संख्याओं को जोड़ना है। EVA अंत में एक विशेष "एडर" स्टेशन जोड़ता है जो बहुत तेज़ है और जिसे जटिल गणितीय उपकरणों की आवश्यकता नहीं है, जिससे लाइन सुचारू रूप से चलती रहती है।

परिणाम: गति और दक्षता

EVA का परीक्षण मौजूदा सर्वोत्तम सिस्टमों (जैसे FIGLUT और मानक GPU) के विरुद्ध लोकप्रिय AI मॉडल (जैसे LLaMA) का उपयोग करके किया गया।

  • गति: टेक्स्ट जेनरेट करने में EVA मौजूदा सर्वश्रेष्ठ लुकअप-आधारित सिस्टमों की तुलना में 11 गुना तक तेज़ था।
  • ऊर्जा: इसने समान कार्य करने के लिए 7 गुना कम ऊर्जा का उपयोग किया।
  • गुणवत्ता: मॉडल को बहुत अधिक कंप्रेस (2-बिट प्रिसिजन तक, जो एक हाई-रेज़ फोटो को छोटे आइकन में कंप्रेस करने जैसा है) करने के बावजूद, टेक्स्ट की गुणवत्ता उत्कृष्ट बनी रही, जिसमें सटीकता में लगभग कोई कमी नहीं आई।

सारांश

EVA एक कारखाने को फिर से डिज़ाइन करने जैसा है ताकि श्रमिकों को निर्देश एक-एक करके लेने के लिए लाइन में खड़ा होने के बजाय, वे निर्देशों को एक विशाल, व्यवस्थित बैच में प्रोसेस कर सकें जहाँ प्रत्येक का अपना रास्ता हो। यह ट्रैफिक जाम को खत्म करता है, सभी श्रमिकों को व्यस्त रखता है, और AI को काफी तेज़ी से और अधिक कुशलता से टेक्स्ट लिखने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →