Understanding and Improving Communication Performance in Multi-node LLM Inference
यह शोध पत्र मल्टी-नोड LLM इन्फरेंस के एक प्रदर्शन अध्ययन को प्रस्तुत करता है जो ऑल-रिड्यूस (all-reduce) ऑपरेशन्स को एक प्रमुख बाधा के रूप में पहचानता है और NVRAR पेश करता है, जो NVSHMEM का उपयोग करने वाला एक पदानुक्रमित (hierarchical) ऑल-रिड्यूस एल्गोरिदम है, जो मानक NCCL कार्यान्वयन की तुलना में Llama 3.1 405B जैसे बड़े मॉडलों के लिए लेटेंसी को काफी कम करता है और एंड-टू-एंड प्रदर्शन में सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, जटिल पहेली को हल करने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, यह पहेली एक "लार्ज लैंग्वेज मॉडल" (LLM) है—एक सुपर-स्मार्ट कंप्यूटर दिमाग जो कहानियाँ लिख सकता है, सवालों के जवाब दे सकता है और समस्याओं को हल कर सकता है। जैसे-जैसे ये दिमाग बड़े और स्मार्ट होते जाते हैं, वे एक अकेले कंप्यूटर के लिए बहुत भारी हो जाते हैं।
इसे हल करने के लिए, वैज्ञानिक पहेली के टुकड़ों को कई कंप्यूटरों (जिन्हें "नोड्स" कहा जाता है) के बीच बाँट देते हैं जो मिलकर काम करते हैं। यह शोध पत्र इस बारे में है कि इन कंप्यूटरों को एक-दूसरे से कुशलतापूर्वक कैसे बात कराई जाए ताकि वे इंतज़ार करने में समय बर्बाद न करें।
यहाँ एक सरल विवरण दिया गया कि शोधकर्ताओं ने क्या पाया और बनाया:
1. समस्या: "टेलीफोन गेम" की बाधा (The "Telephone Game" Bottleneck)
जब कंप्यूटर मिलकर काम करते हैं, तो उन्हें लगातार जानकारी साझा करनी पड़ती है।
- सेटअप: कल्पना कीजिए कि 32 लोगों (GPUs) की एक टीम पहेली को हल करने की कोशिश कर रही है। उन्हें समूहों (नोड्स) में विभाजित किया गया है। एक समूह के भीतर, वे एक-दूसरे को तुरंत चिल्लाकर बता सकते हैं (एक सुपर-फास्ट इंटरनल वॉकी-टॉकी का उपयोग करके जिसे NVLink कहा जाता है)। लेकिन दूसरे समूहों से बात करने के लिए, उन्हें एक धीमे, लंबी दूरी के फोन लाइन (नोड्स के बीच का नेटवर्क) का उपयोग करना पड़ता है।
- समस्या: शोधकर्ताओं ने पाया कि जब कंप्यूटर पहेली के "डिकोड" वाले हिस्से को हल करने की कोशिश करते हैं (एक बार में एक शब्द बनाना), तो उन्हें एक-दूसरे को बहुत छोटे संदेश भेजने की आवश्यकता होती है।
- उपमा: कल्पना कीजिए कि आप एक रिले रेस में हैं। यदि आपको अगले धावक को एक छोटा सा नोट देने के लिए एक लंबी दूरी तक दौड़ना पड़ता है, और जिस व्यक्ति को आप नोट दे रहे हैं वह नोट प्राप्त करने में धीमा है, तो आप अपना अधिकांश समय इंतज़ार करने में बिता देते हैं। शोध पत्र में पाया गया कि मानक "फोन लाइन" सॉफ्टवेयर (जिसे NCCL कहा जाता है) अलग-अलग इमारतों (नोड्स) के बीच इन छोटे, बार-बार आने वाले नोट्स को संभालने में बहुत खराब था। यह ऐसा ही था जैसे आपको एक गुप्त हैंडशेक तुरंत पास करने की आवश्यकता हो, लेकिन आप एक पोस्टकार्ड को धीमी डाक सेवा के माध्यम से भेजने की कोशिश कर रहे हों।
2. तुलना: टीम को व्यवस्थित करने के दो तरीके
शोधकर्ताओं ने टीम को व्यवस्थित करने के दो मुख्य तरीकों का परीक्षण किया:
- टेंसर पैरेललिज्म (Tensor Parallelism - TP): हर कोई एक ही समय में पहेली के एक ही हिस्से पर काम करता है, लेकिन उन्हें एक-दूसरे के साथ लगातार चेक-इन करना पड़ता है ताकि वे सहमत हो सकें। यह काम के बड़े हिस्सों के लिए बहुत अच्छा है लेकिन बार-बार चेक-इन करने (कम्युनिकेशन) के कारण धीमा हो जाता है।
- हाइब्रिड पैरेललिज्म (Hybrid Parallelism - HP): वे पहेली को बड़े टुकड़ों में बाँट देते हैं और अलग-अलग लोगों को अलग-अलग टुकड़े सौंप देते हैं। इससे चेक-इन करने की आवश्यकता कम हो जाती है, लेकिन यह कार्य के "शब्द-दर-शब्द" पीढ़ी (generation) वाले हिस्से के लिए उतना कुशल नहीं है।
निष्कर्ष: कार्य के "शब्द-दर-शब्द" वाले हिस्से के लिए (जो इस काम में सबसे अधिक होता है), TP आमतौर पर बेहतर होता है, लेकिन केवल तभी जब टीम आपस में तेज़ी से बात कर सके। बात करने का मानक तरीका बहुत धीमा था, जिससे टीम रुक रही थी।
3. समाधान: NVRAR (द "एक्सप्रेस लेन")
संचार को तेज़ करने के लिए, शोधकर्ताओं ने NVRAR नामक एक नया टूल बनाया।
- यह कैसे काम करता है: मानक, धीमी डाक सेवा का उपयोग करने के बजाय, उन्होंने NVSHMEM नामक तकनीक का उपयोग करके एक कस्टम "एक्सप्रेस लेन" बनाई।
- उपमा: पुराने तरीके को एक ऐसे पत्र के रूप में सोचें जिसे स्टैम्प, सॉर्ट और ट्रक द्वारा डिलीवर किया जाना है। NVRAR एक समर्पित ड्रोन की तरह है जो एक व्यक्ति से दूसरे व्यक्ति तक सीधे उड़ता है, नोट गिराता है और उसी क्षण जवाब भी उठा लेता है।
- "रिकर्सिव डबलिंग" (Recursive Doubling) ट्रिक: उन्होंने संचार को "टेलीफोन गेम" की तरह व्यवस्थित किया जहाँ हर चरण में हर कोई बातचीत करने वाले लोगों की संख्या को दोगुना कर देता है। सभी के एक-एक करके बात करने के बजाय, वे जोड़ी बनाते हैं, मर्ज करते हैं, फिर से जोड़ी बनाते हैं, और फिर से मर्ज करते हैं। यह बड़े समूहों के लिए बहुत तेज़ है।
4. परिणाम: टीम की गति बढ़ाना
जब उन्होंने इस नए "एक्सप्रेस लेन" (NVRAR) को अपने सिस्टम में जोड़ा:
- तेज़ बातचीत: इन AI कार्यों के लिए उपयोग किए जाने वाले छोटे संदेशों के लिए, नया सिस्टम मानक सिस्टम की तुलना में 1.9 से 3.6 गुना तेज़ था।
- बेहतर पहेली समाधान: जब उन्होंने इस नए सिस्टम का उपयोग विशाल "Llama 3.1 405B" मॉडल (एक विशाल AI दिमाग) को चलाने के लिए किया, तो उत्तर उत्पन्न करने में लगने वाला समय काफी कम हो गया। कुछ मामलों में, टीम पहले की तुलना में 1.72 गुना तेज़ी से काम पूरा करने में सफल रही।
- वास्तविक दुनिया का परीक्षण: उन्होंने वास्तविक दुनिया के ट्रैफिक (हजारों उपयोगकर्ताओं के सवाल पूछने का अनुकरण करते हुए) पर इसका परीक्षण किया और पाया कि सिस्टम बिना धीमे हुए प्रति सेकंड अधिक अनुरोधों को संभाल सकता है।
सारांश
यह शोध पत्र मूल रूप से इस बात के बारे में है कि जब एक विशाल कंप्यूटर टीम एक AI पहेली को हल करने की कोशिश करती है, तो सबसे बड़ी देरी "सोचने" में नहीं—बल्कि "बात करने" में होती है। अलग-अलग इमारतों के बीच बात करने का मानक तरीका इन छोटे, बार-बार आने वाले संदेशों के लिए बहुत धीमा था। लेखकों ने एक कस्टम, हाई-स्पीड कम्युनिकेशन सिस्टम (NVRAR) बनाया है जो एक एक्सप्रेस लेन की तरह काम करता है, जिससे टीम तुरंत समन्वय कर सकती है और पहेली को बहुत तेज़ी से हल कर सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।