← नवीनतम पेपर
🤖 AI

ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts

ThAME एक 3D हेट्रोजेनियस मल्टी-चिपलेट एक्सेलेरेटर है जो Mixture of Experts इन्फरेंस की मेमोरी बैंडविड्थ, रूटिंग और लेटेंसी बाधाओं को दूर करने के लिए FeFET और DRAM मेमोरी इंटीग्रेशन के साथ एक सह-डिज़ाइन किए गए कंप्यूट मैपिंग और विशेष नेटवर्क-ऑन-चिप का लाभ उठाता है, जिससे अत्याधुनिक समाधानों की तुलना में 15.7x तक की गति वृद्धि और 9.8x ऊर्जा दक्षता में सुधार प्राप्त होता है।

मूल लेखक: Pratyush Dhingra, Pramit Kumar Pal, Janardhan Rao Doppa, Partha Pratim Pande

प्रकाशित 2026-07-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pratyush Dhingra, Pramit Kumar Pal, Janardhan Rao Doppa, Partha Pratim Pande

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल पुस्तकालय है जहाँ किताबें हर दिन अधिक स्मार्ट होती जा रही हैं। इन "स्मार्ट किताबों" को लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है, और वे कहानियाँ लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं और मनुष्यों की तरह चैट कर सकते हैं। लेकिन वास्तव में स्मार्ट बनने के लिए, इन मॉडल्स को विशाल होना पड़ता है, जिसमें उनकी मेमोरी में अरबों तथ्य समाहित हों। हाल ही में, वैज्ञानिकों ने एक चतुर तकनीक खोजी जिसे "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) कहा जाता है। एक विशाल मस्तिष्क के बजाय जो सब कुछ याद रखने की कोशिश करता है, MoE विशेषज्ञों की एक छोटी टीम बनाता है। जब आप कोई प्रश्न पूछते हैं, तो सिस्टम पूरी टीम को नहीं जगाता; यह केवल उन कुछ विशेषज्ञों को बुलाता है जो उत्तर जानते हैं। यह एक लाइब्रेरियन से किताब लाने के लिए कहने जैसा है: पूरे लाइब्रेरी स्टाफ को जगाने के बजाय, आप बस इतिहास विभाग के लिए घंटी बजाते हैं।

हालाँकि, इसमें एक पेंच है। वास्तविक दुनिया में, इन विशेषज्ञों को बुलाना बहुत अव्यवस्थित है। विशेषज्ञ इधर-उधर बिखरे हुए हैं, और लाइब्रेरियन को सही किताबें लाने के लिए बार-बार दौड़ना पड़ता है, और फिर उत्तरों को एक साथ लाने के लिए वापस दौड़ना पड़ता है। यह "दौड़ना और वापस आना" ट्रैफिक जाम पैदा करता है। कंप्यूटर वास्तव में सोचने के बजाय डेटा के आने का इंतज़ार करने में अधिक समय बिता देता है। यह "मेमोरी वॉल" है, एक बाधा जो सबसे तेज़ सुपर कंप्यूटरों को भी धीमा कर देती है। सवाल यह है: हम एक ऐसा पुस्तकालय कैसे बना सकते हैं जहाँ किताबें पाठकों के ठीक बगल में हों, और धावकों के पास ट्रैफिक जाम से बचने के लिए एक आदर्श हाईवे सिस्टम हो?


समस्या: मस्तिष्क में एक ट्रैफिक जाम

यह शोध पत्र इस सटीक समस्या को हल करने के लिए ThAME (3D मेमोरी-एनेबल्ड हेट्रोजेनियस एक्सेलेरेटर) नामक एक नया आर्किटेक्चर पेश करता है। लेखक बताते हैं कि वर्तमान कंप्यूटर एक व्यस्त शहर की तरह हैं जहाँ "सोचने" वाला हिस्सा (CPU या GPU) "मेमोरी" वाले हिस्से (जहाँ डेटा रहता है) से दूर है। जब एक लार्ज लैंग्वेज मॉडल 'मिक्सचर ऑफ एक्सपर्ट्स' वाली तकनीक का उपयोग करता है, तो यह एक अराजक स्थिति पैदा करता है।

एक स्कूल कैफेटेरिया की कल्पना करें जहाँ छात्रों (टोकन्स) को विभिन्न लंच काउंटरों (विशेषज्ञों) से भोजन लेने की आवश्यकता है। एक सामान्य कैफेटेरिया में, सभी एक ही लाइन में जाते हैं। लेकिन एक MoE सिस्टम में, प्रत्येक छात्र को उनकी पसंद के आधार पर एक अलग, यादृच्छिक काउंटर पर भेजा जाता है। कुछ काउंटरों पर भारी भीड़ हो जाती है, जबकि कुछ पर कोई नहीं होता। छात्रों को अपना भोजन प्राप्त करने के लिए कैफेटेरिया में इधर-उधर दौड़ना पड़ता है, और फिर अपने भोजन को मिलाने के लिए एक केंद्रीय मेज पर वापस दौड़ना पड़ता है। यह एक "स्कैटर-गैदर" (बिखरने और एकत्र होने वाला) ट्रैफिक पैटर्न बनाता है: छात्रों का एक अराजक मिश्रण जो सभी दिशाओं में दौड़ रहा है, जिससे टकराव और लंबी प्रतीक्षाएँ होती हैं। पेपर का तर्क है कि मानक कंप्यूटर चिप्स इस प्रकार के अप्रत्याशित, अव्यवस्थित ट्रैफिक के लिए नहीं बने हैं। वे ग्रिडलॉक (जाम) में फंस जाते हैं, और पूरा सिस्टम धीमा हो जाता है।

समाधान: एक विशेष हाईवे के साथ एक 3D शहर

इसे ठीक करने के लिए, लेखक ThAME का प्रस्ताव देते हैं, जो इन AI मॉडल्स के लिए एक बिल्कुल नया, हाई-टेक शहर बनाने जैसा है। वे इसे काम करने के लिए तीन मुख्य विचारों का उपयोग करते हैं:

  1. सही काम के लिए सही उपकरण (हेट्रोजेनियस मेमोरी):
    लेखक बताते हैं कि सभी मेमोरी एक जैसी नहीं होती है। AI के कुछ हिस्सों को बहुत बार लिखने की आवश्यकता होती है (जैसे एक व्हाइटबोर्ड), जबकि अन्य हिस्सों को बस एक विशाल बुकशेल्फ़ से पढ़ने की आवश्यकता होती है।
  • "व्हाइटबोर्ड" वाले हिस्सों (अटेंशन मैकेनिज्म) के लिए, वे DRAM का उपयोग करते हैं, जो तेज़ है और जिसे आसानी से दोबारा लिखा जा सकता है लेकिन यह बहुत अधिक जगह लेता है।
  • "विशाल बुकशेल्फ़" वाले हिस्सों (एक्सपर्ट वेट्स) के लिए, वे FeFET-NAND का उपयोग करते हैं, जो एक प्रकार की 3D मेमोरी है जो अविश्वसनीय रूप से सघन है और जिसे बार-बार लिखने की आवश्यकता नहीं होती है।
  • इसे एक लाइब्रेरी की तरह समझें जहाँ संदर्भ पुस्तकें एक विशाल, उच्च-घनत्व वाले टॉवर (FeFET) में रखी जाती हैं, जबकि सक्रिय वर्कस्टेशन एक अलग, तेज़ प्रकार के डेस्क का उपयोग करते हैं (DRAM)। इन परतों को लंबवत (3D) रूप से स्टैक करके, वे डेटा की एक विशाल मात्रा को प्रोसेसर के ठीक बगल में फिट कर सकते हैं, ताकि "धावक" को दूर तक यात्रा न करनी पड़े।
  1. विशेष हाईवे (NoC):
    यही इस पेपर का सबसे बड़ा नवाचार है। मेमोरी पास होने के बावजूद, "धावकों" (डेटा) को अभी भी विभिन्न विशेषज्ञ काउंटरों के बीच घूमना पड़ता है। लेखकों ने महसूस किया कि मानक सड़क नेटवर्क (जैसे एक साधारण ग्रिड या रिंग) तब विफल हो जाते हैं जब ट्रैफिक अप्रत्याशित होता है।
  • उन्होंने एक हाइरार्किकल नेटवर्क-ऑन-चिप (NoC) डिज़ाइन किया है। कल्पना कीजिए कि एक शहर जहाँ स्थानीय मोहल्लों में स्थानीय ट्रैफिक को तेज़ी से संभालने के लिए छोटी, निजी सड़कें (क्रॉसबार) हैं। फिर, इन मोहल्लों को एक स्मार्ट, पेड़ जैसी हाईवे प्रणाली द्वारा जोड़ा जाता है जो विभिन्न क्षेत्रों के बीच बड़े ट्रैफिक प्रवाह को संभाल सकती है।
  • इस सिस्टम को एक जटिल गणितीय पद्धति का उपयोग करके अनुकूलित किया गया था ताकि यह सुनिश्चित हो सके कि चाहे छात्र कैसे भी वितरित हों (कौन से विशेषज्ञ व्यस्त हैं), ट्रैफिक जाम को न्यूनतम किया जाए। यह एक ट्रैफिक कंट्रोल सिस्टम की तरह है जो दुर्घटनाओं से बचने के लिए कारों को स्वचालित रूप से दूसरे रास्ते पर मोड़ देता है।
  1. स्मार्ट डिस्पैचर:
    सिस्टम में एक शेड्यूलर शामिल है जो एक स्मार्ट ट्रैफिक पुलिसकर्मी की तरह कार्य करता है। वह भीड़ को देखता है और तय करता है कि प्रत्येक विशेषज्ञ काउंटर को कितने "धावकों" (कंप्यूटर कोर) को नियुक्त किया जाना चाहिए ताकि सभी लगभग एक ही समय में समाप्त कर सकें। यह एक धीमे विशेषज्ञ को पूरे समूह को रोकने से रोकता है।

उन्होंने क्या पाया

लेखकों ने इसे केवल कागज़ पर नहीं बनाया; उन्होंने यह देखने के लिए विस्तृत सिमुलेशन चलाए कि यह कैसा प्रदर्शन करेगा। उन्होंने ThAME की तुलना मौजूदा सर्वोत्तम सिस्टम (जैसे Stratum और H3D-T) और मानक GPUs से की।

  • गति: उनके सिमुलेशन में, ThAME अविश्वसनीय रूप से तेज़ था। यह टेक्स्ट जनरेट करने के मामले में मौजूदा सर्वोत्तम हार्डवेयर से 15.7 गुना तक तेज़ था। इसका मतलब है कि यदि एक मानक कंप्यूटर एक पैराग्राफ लिखने में 10 सेकंड लेता है, तो ThAME इसे एक सेकंड से भी कम समय में कर सकता है।
  • ऊर्जा: यह बहुत अधिक कुशल भी था, जो समान कार्य के लिए 9.8 गुना कम ऊर्जा का उपयोग करता है। यह बहुत बड़ी बात है क्योंकि इन विशाल मॉडल्स को चलाने में आमतौर पर बहुत अधिक बिजली खर्च होती है।
  • मजबूती (Robustness): पेपर दिखाता है कि भले ही मेमोरी तकनीक दोषपूर्ण हो (उदाहरण के लिए, यदि रीड स्पीड उम्मीद से धीमी है), फिर भी ThAME अच्छा प्रदर्शन करता है क्योंकि इसमें अतिरिक्त बैंडविड्थ काफी अधिक है।

उन्होंने क्या नहीं किया

यह ध्यान रखना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है। लेखकों ने किसी कारखाने में भौतिक चिप नहीं बनाई और न ही इसे वास्तविक दुनिया के सर्वर फार्म में टेस्ट किया। उनके सभी परिणाम साइकिल-एक्यूरेट सिमुलेशन से आते हैं—बहुत विस्तृत कंप्यूटर मॉडल जो यह नकल करते हैं कि हार्डवेयर कैसे व्यवहार करेगा। उन्होंने यह भी दावा नहीं किया कि उन्होंने AI की हर समस्या को हल कर दिया है; उन्होंने विशेष रूप से "डिकोड" चरण (एक बार में एक शब्द बनाना) पर ध्यान केंद्रित किया, जो वर्तमान कंप्यूटरों के लिए सबसे कठिन हिस्सा है। उन्होंने स्वीकार किया कि "प्रीफिल" चरण (प्रारंभिक प्रॉम्प्ट को पढ़ना) को एक मानक, शक्तिशाली प्रोसेसर (TPU) द्वारा संभाला जाता है, और उनका नवाचार विशेष रूप रूप से उसके बाद के जटिल, मेमोरी-हैवी हिस्से के लिए है।

निष्कर्ष

पेपर सुझाव देता है कि विभिन्न प्रकार की मेमोरी को मिलाकर और चिप के भीतर एक कस्टम, ट्रैफिक-स्मार्ट हाईवे सिस्टम बनाकर, हम अंततः 'मिक्सचर ऑफ एक्सपर्ट्स' मॉडल्स को तेज़ और कुशल बना सकते हैं। हालांकि यह वर्तमान में एक सिमुलेशन है, इसके परिणाम इतने आशाजनक हैं कि वे संकेत देते हैं कि यह "स्मार्ट हाईवे के साथ 3D शहर" वाला दृष्टिकोण हमारे पावर ग्रिड को जलाए बिना अगली पीढ़ी के सुपर-स्मार्ट AI को अनलॉक करने की कुंजी हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →