ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts
ThAME एक 3D हेट्रोजेनियस मल्टी-चिपलेट एक्सेलेरेटर है जो Mixture of Experts इन्फरेंस की मेमोरी बैंडविड्थ, रूटिंग और लेटेंसी बाधाओं को दूर करने के लिए FeFET और DRAM मेमोरी इंटीग्रेशन के साथ एक सह-डिज़ाइन किए गए कंप्यूट मैपिंग और विशेष नेटवर्क-ऑन-चिप का लाभ उठाता है, जिससे अत्याधुनिक समाधानों की तुलना में 15.7x तक की गति वृद्धि और 9.8x ऊर्जा दक्षता में सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल पुस्तकालय है जहाँ किताबें हर दिन अधिक स्मार्ट होती जा रही हैं। इन "स्मार्ट किताबों" को लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है, और वे कहानियाँ लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं और मनुष्यों की तरह चैट कर सकते हैं। लेकिन वास्तव में स्मार्ट बनने के लिए, इन मॉडल्स को विशाल होना पड़ता है, जिसमें उनकी मेमोरी में अरबों तथ्य समाहित हों। हाल ही में, वैज्ञानिकों ने एक चतुर तकनीक खोजी जिसे "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) कहा जाता है। एक विशाल मस्तिष्क के बजाय जो सब कुछ याद रखने की कोशिश करता है, MoE विशेषज्ञों की एक छोटी टीम बनाता है। जब आप कोई प्रश्न पूछते हैं, तो सिस्टम पूरी टीम को नहीं जगाता; यह केवल उन कुछ विशेषज्ञों को बुलाता है जो उत्तर जानते हैं। यह एक लाइब्रेरियन से किताब लाने के लिए कहने जैसा है: पूरे लाइब्रेरी स्टाफ को जगाने के बजाय, आप बस इतिहास विभाग के लिए घंटी बजाते हैं।
हालाँकि, इसमें एक पेंच है। वास्तविक दुनिया में, इन विशेषज्ञों को बुलाना बहुत अव्यवस्थित है। विशेषज्ञ इधर-उधर बिखरे हुए हैं, और लाइब्रेरियन को सही किताबें लाने के लिए बार-बार दौड़ना पड़ता है, और फिर उत्तरों को एक साथ लाने के लिए वापस दौड़ना पड़ता है। यह "दौड़ना और वापस आना" ट्रैफिक जाम पैदा करता है। कंप्यूटर वास्तव में सोचने के बजाय डेटा के आने का इंतज़ार करने में अधिक समय बिता देता है। यह "मेमोरी वॉल" है, एक बाधा जो सबसे तेज़ सुपर कंप्यूटरों को भी धीमा कर देती है। सवाल यह है: हम एक ऐसा पुस्तकालय कैसे बना सकते हैं जहाँ किताबें पाठकों के ठीक बगल में हों, और धावकों के पास ट्रैफिक जाम से बचने के लिए एक आदर्श हाईवे सिस्टम हो?
समस्या: मस्तिष्क में एक ट्रैफिक जाम
यह शोध पत्र इस सटीक समस्या को हल करने के लिए ThAME (3D मेमोरी-एनेबल्ड हेट्रोजेनियस एक्सेलेरेटर) नामक एक नया आर्किटेक्चर पेश करता है। लेखक बताते हैं कि वर्तमान कंप्यूटर एक व्यस्त शहर की तरह हैं जहाँ "सोचने" वाला हिस्सा (CPU या GPU) "मेमोरी" वाले हिस्से (जहाँ डेटा रहता है) से दूर है। जब एक लार्ज लैंग्वेज मॉडल 'मिक्सचर ऑफ एक्सपर्ट्स' वाली तकनीक का उपयोग करता है, तो यह एक अराजक स्थिति पैदा करता है।
एक स्कूल कैफेटेरिया की कल्पना करें जहाँ छात्रों (टोकन्स) को विभिन्न लंच काउंटरों (विशेषज्ञों) से भोजन लेने की आवश्यकता है। एक सामान्य कैफेटेरिया में, सभी एक ही लाइन में जाते हैं। लेकिन एक MoE सिस्टम में, प्रत्येक छात्र को उनकी पसंद के आधार पर एक अलग, यादृच्छिक काउंटर पर भेजा जाता है। कुछ काउंटरों पर भारी भीड़ हो जाती है, जबकि कुछ पर कोई नहीं होता। छात्रों को अपना भोजन प्राप्त करने के लिए कैफेटेरिया में इधर-उधर दौड़ना पड़ता है, और फिर अपने भोजन को मिलाने के लिए एक केंद्रीय मेज पर वापस दौड़ना पड़ता है। यह एक "स्कैटर-गैदर" (बिखरने और एकत्र होने वाला) ट्रैफिक पैटर्न बनाता है: छात्रों का एक अराजक मिश्रण जो सभी दिशाओं में दौड़ रहा है, जिससे टकराव और लंबी प्रतीक्षाएँ होती हैं। पेपर का तर्क है कि मानक कंप्यूटर चिप्स इस प्रकार के अप्रत्याशित, अव्यवस्थित ट्रैफिक के लिए नहीं बने हैं। वे ग्रिडलॉक (जाम) में फंस जाते हैं, और पूरा सिस्टम धीमा हो जाता है।
समाधान: एक विशेष हाईवे के साथ एक 3D शहर
इसे ठीक करने के लिए, लेखक ThAME का प्रस्ताव देते हैं, जो इन AI मॉडल्स के लिए एक बिल्कुल नया, हाई-टेक शहर बनाने जैसा है। वे इसे काम करने के लिए तीन मुख्य विचारों का उपयोग करते हैं:
- सही काम के लिए सही उपकरण (हेट्रोजेनियस मेमोरी):
लेखक बताते हैं कि सभी मेमोरी एक जैसी नहीं होती है। AI के कुछ हिस्सों को बहुत बार लिखने की आवश्यकता होती है (जैसे एक व्हाइटबोर्ड), जबकि अन्य हिस्सों को बस एक विशाल बुकशेल्फ़ से पढ़ने की आवश्यकता होती है।
- "व्हाइटबोर्ड" वाले हिस्सों (अटेंशन मैकेनिज्म) के लिए, वे DRAM का उपयोग करते हैं, जो तेज़ है और जिसे आसानी से दोबारा लिखा जा सकता है लेकिन यह बहुत अधिक जगह लेता है।
- "विशाल बुकशेल्फ़" वाले हिस्सों (एक्सपर्ट वेट्स) के लिए, वे FeFET-NAND का उपयोग करते हैं, जो एक प्रकार की 3D मेमोरी है जो अविश्वसनीय रूप से सघन है और जिसे बार-बार लिखने की आवश्यकता नहीं होती है।
- इसे एक लाइब्रेरी की तरह समझें जहाँ संदर्भ पुस्तकें एक विशाल, उच्च-घनत्व वाले टॉवर (FeFET) में रखी जाती हैं, जबकि सक्रिय वर्कस्टेशन एक अलग, तेज़ प्रकार के डेस्क का उपयोग करते हैं (DRAM)। इन परतों को लंबवत (3D) रूप से स्टैक करके, वे डेटा की एक विशाल मात्रा को प्रोसेसर के ठीक बगल में फिट कर सकते हैं, ताकि "धावक" को दूर तक यात्रा न करनी पड़े।
- विशेष हाईवे (NoC):
यही इस पेपर का सबसे बड़ा नवाचार है। मेमोरी पास होने के बावजूद, "धावकों" (डेटा) को अभी भी विभिन्न विशेषज्ञ काउंटरों के बीच घूमना पड़ता है। लेखकों ने महसूस किया कि मानक सड़क नेटवर्क (जैसे एक साधारण ग्रिड या रिंग) तब विफल हो जाते हैं जब ट्रैफिक अप्रत्याशित होता है।
- उन्होंने एक हाइरार्किकल नेटवर्क-ऑन-चिप (NoC) डिज़ाइन किया है। कल्पना कीजिए कि एक शहर जहाँ स्थानीय मोहल्लों में स्थानीय ट्रैफिक को तेज़ी से संभालने के लिए छोटी, निजी सड़कें (क्रॉसबार) हैं। फिर, इन मोहल्लों को एक स्मार्ट, पेड़ जैसी हाईवे प्रणाली द्वारा जोड़ा जाता है जो विभिन्न क्षेत्रों के बीच बड़े ट्रैफिक प्रवाह को संभाल सकती है।
- इस सिस्टम को एक जटिल गणितीय पद्धति का उपयोग करके अनुकूलित किया गया था ताकि यह सुनिश्चित हो सके कि चाहे छात्र कैसे भी वितरित हों (कौन से विशेषज्ञ व्यस्त हैं), ट्रैफिक जाम को न्यूनतम किया जाए। यह एक ट्रैफिक कंट्रोल सिस्टम की तरह है जो दुर्घटनाओं से बचने के लिए कारों को स्वचालित रूप से दूसरे रास्ते पर मोड़ देता है।
- स्मार्ट डिस्पैचर:
सिस्टम में एक शेड्यूलर शामिल है जो एक स्मार्ट ट्रैफिक पुलिसकर्मी की तरह कार्य करता है। वह भीड़ को देखता है और तय करता है कि प्रत्येक विशेषज्ञ काउंटर को कितने "धावकों" (कंप्यूटर कोर) को नियुक्त किया जाना चाहिए ताकि सभी लगभग एक ही समय में समाप्त कर सकें। यह एक धीमे विशेषज्ञ को पूरे समूह को रोकने से रोकता है।
उन्होंने क्या पाया
लेखकों ने इसे केवल कागज़ पर नहीं बनाया; उन्होंने यह देखने के लिए विस्तृत सिमुलेशन चलाए कि यह कैसा प्रदर्शन करेगा। उन्होंने ThAME की तुलना मौजूदा सर्वोत्तम सिस्टम (जैसे Stratum और H3D-T) और मानक GPUs से की।
- गति: उनके सिमुलेशन में, ThAME अविश्वसनीय रूप से तेज़ था। यह टेक्स्ट जनरेट करने के मामले में मौजूदा सर्वोत्तम हार्डवेयर से 15.7 गुना तक तेज़ था। इसका मतलब है कि यदि एक मानक कंप्यूटर एक पैराग्राफ लिखने में 10 सेकंड लेता है, तो ThAME इसे एक सेकंड से भी कम समय में कर सकता है।
- ऊर्जा: यह बहुत अधिक कुशल भी था, जो समान कार्य के लिए 9.8 गुना कम ऊर्जा का उपयोग करता है। यह बहुत बड़ी बात है क्योंकि इन विशाल मॉडल्स को चलाने में आमतौर पर बहुत अधिक बिजली खर्च होती है।
- मजबूती (Robustness): पेपर दिखाता है कि भले ही मेमोरी तकनीक दोषपूर्ण हो (उदाहरण के लिए, यदि रीड स्पीड उम्मीद से धीमी है), फिर भी ThAME अच्छा प्रदर्शन करता है क्योंकि इसमें अतिरिक्त बैंडविड्थ काफी अधिक है।
उन्होंने क्या नहीं किया
यह ध्यान रखना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है। लेखकों ने किसी कारखाने में भौतिक चिप नहीं बनाई और न ही इसे वास्तविक दुनिया के सर्वर फार्म में टेस्ट किया। उनके सभी परिणाम साइकिल-एक्यूरेट सिमुलेशन से आते हैं—बहुत विस्तृत कंप्यूटर मॉडल जो यह नकल करते हैं कि हार्डवेयर कैसे व्यवहार करेगा। उन्होंने यह भी दावा नहीं किया कि उन्होंने AI की हर समस्या को हल कर दिया है; उन्होंने विशेष रूप से "डिकोड" चरण (एक बार में एक शब्द बनाना) पर ध्यान केंद्रित किया, जो वर्तमान कंप्यूटरों के लिए सबसे कठिन हिस्सा है। उन्होंने स्वीकार किया कि "प्रीफिल" चरण (प्रारंभिक प्रॉम्प्ट को पढ़ना) को एक मानक, शक्तिशाली प्रोसेसर (TPU) द्वारा संभाला जाता है, और उनका नवाचार विशेष रूप रूप से उसके बाद के जटिल, मेमोरी-हैवी हिस्से के लिए है।
निष्कर्ष
पेपर सुझाव देता है कि विभिन्न प्रकार की मेमोरी को मिलाकर और चिप के भीतर एक कस्टम, ट्रैफिक-स्मार्ट हाईवे सिस्टम बनाकर, हम अंततः 'मिक्सचर ऑफ एक्सपर्ट्स' मॉडल्स को तेज़ और कुशल बना सकते हैं। हालांकि यह वर्तमान में एक सिमुलेशन है, इसके परिणाम इतने आशाजनक हैं कि वे संकेत देते हैं कि यह "स्मार्ट हाईवे के साथ 3D शहर" वाला दृष्टिकोण हमारे पावर ग्रिड को जलाए बिना अगली पीढ़ी के सुपर-स्मार्ट AI को अनलॉक करने की कुंजी हो सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।