Heterogeneous Parallelism for Multimodal Large Language Model Training
यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल प्रशिक्षण के लिए एक हेट्रोजेनियस पैरेललिज्म फ्रेमवर्क पेश करता है जो एक ही ग्राफ के भीतर विभिन्न मॉड्यूल्स के लिए स्वतंत्र टेंसर पैरेललिज्म लेआउट को सक्षम बनाता है, जिससे मोडैलिटी-विशिष्ट स्केलिंग बेमेल (mismatches) का समाधान होता है और अनुकूलित कोलोकेटेड निष्पादन (colocated execution) के माध्यम से 49.3% तक उच्च TFLOPS/GPU प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-इंटेलिजेंट रोबोट को प्रशिक्षित करने की कोशिश कर रहे हैं जो देख सकता है, सुन सकता है और पढ़ सकता है। इसे करने के लिए, आपको दो बहुत अलग प्रकार के "मस्तिष्क" को संयोजित करने की आवश्यकता है:
- एन्कोडर (The Encoder): यह एक विशेष कैमरे या माइक्रोफ़ोन की तरह है। यह छवियों या ध्वनि को प्रोसेस करने में माहिर है, लेकिन यह डेटा के एक विशिष्ट, निश्चित आकार के टुकड़े के साथ सबसे अच्छा काम करता है।
- एलएलएम (LLM - Large Language Model): यह विशाल भाषा वाला मस्तिष्क है। यह बहुत बड़ा है, इसे एक साथ भारी मात्रा में टेक्स्ट पढ़ने की आवश्यकता होती है, और इसे कुशलता से काम करने के लिए अपने काम को व्यवस्थित करने का एक बहुत अलग तरीका चाहिए।
समस्या: "एक ही आकार का सूट" (The "One-Size-Fits-All" Suit)
अतीत में, इन संयुक्त रोबोटों को प्रशिक्षित करते समय, इंजीनियर दोनों मस्तिष्कों को एक ही "यूनिफॉर्म" (कई कंप्यूटरों के बीच काम को विभाजित करने का एक विशिष्ट तरीका) पहनने के लिए मजबूर करते थे।
इसे एक निर्माण दल (construction crew) के रूप में सोचें जहाँ प्लंबर और इलेक्ट्रीशियन को एक ही सटीक फॉर्मेशन में काम करने के लिए मजबूर किया जाता है:
- इलेक्ट्रीशियनों (LLM) को तारों को तेज़ी से पास करने के लिए एक विशाल घेरे में खड़े होने की आवश्यकता होती है (एक तकनीक जिसे 'टेंसर पैरेललिज्म' कहा जाता है)।
- प्लंबर (Encoder) को केवल छोटे जोड़ों में काम करने की आवश्यकता होती है क्योंकि उनके पाइप छोटे और निश्चित होते हैं।
यदि आप प्लंबरों को इलेक्ट्रीशियन के उस विशाल घेरे में खड़े होने के लिए मजबूर करते हैं, तो वे अपना सारा समय इलेक्ट्रीशियनों के तार पास करने के पूरा होने का इंतज़ार करने में बिता देते हैं। वे प्लंबिंग नहीं कर रहे होते; वे बस खड़े रहते हैं। यह पूरे प्रोजेक्ट को धीमा कर देता है।
समाधान: "विषम समानांतरता" (Heterogeneous Parallelism)
यह पेपर विषम समानांतरता (Heterogeneous Parallelism) नामक एक नया तरीका पेश करता है। एक ही "एक ही आकार का" दृष्टिकोण अपनाने के बजाय, यह प्रत्येक टीम को उनके काम के लिए सबसे उपयुक्त यूनिफॉर्म पहनने की अनुमति देता है, भले ही वे एक ही इमारत में काम कर रहे हों।
यह सिस्टम "एन्कोडर" टीम और "LLM" टीम को निम्नलिखित कार्य करने की अनुमति देता है:
- अपने काम को अलग तरह से विभाजित करना: LLM कंप्यूटरों के एक विशाल घेरे का उपयोग कर सकता है, जबकि एन्कोडर एक तंग जोड़े का उपयोग कर सकता है।
- अपनी बैठने की जगह चुनना: वे एक ही कंप्यूटरों पर बैठ सकते हैं (हार्डवेयर साझा कर सकते हैं) या जगह और समय बचाने के लिए पूरी तरह से अलग कंप्यूटरों पर रह सकते हैं।
जादुई ट्रिक: "अनुवादक" (The "Translator")
दो टीमों को अलग-अलग तरीके से काम करने देने का सबसे कठिन हिस्सा उनके बीच सूचना को पास करना है। यदि एन्कोडर अपने काम को "छोटे जोड़े" के प्रारूप में पूरा करता है, लेकिन LLM एक "विशाल घेरे" के प्रारूप में डेटा की अपेक्षा करता है, तो डेटा गड़बड़ हो जाएगा।
लेखकों ने एक विशेष अनुवादक (जिसे 'बाउंड्री कम्युनिकेटर' कहा जाता है) बनाया है।
- फॉरवर्ड पास (डिलिवरी): जब एन्कोडर अपना काम पूरा कर लेता है, तो अनुवादक तुरंत डेटा को उस प्रारूप में बदल देता है जिसकी LLM को आवश्यकता होती है। यह एक कूरियर की तरह है जो एक छोटे पैकेज को लेता है, उसे एक बड़े क्रेट में फिर से पैक करता है, और LLM टीम को सौंप देता है।
- बैकवर्ड पास (वापसी): जब LLM अपनी गलतियों से सीखता है, तो वह फीडबैक वापस भेजता है। अनुवादक उस फीडबैक को लेता है, उसे वापस छोटे प्रारूप में तोड़ देता है जिसे एन्कोडर समझ सके, और उसे वापस भेज देता है।
यह सुनिश्चित करता है कि भले ही टीमें अलग-अलग तरीकों से काम कर रही हों, वे डेटा या सीखने की प्रक्रिया को कभी नहीं खोती हैं।
बैठने के दो तरीके: "कोलोकेटेड" बनाम "नॉन-कोलोकेटेड" (Colocated vs. Non-Colocated)
पेपर इन टीमों को व्यवस्थित करने के दो तरीकों का परीक्षण करता है:
कोलोकेटेड (उसी डेस्क को साझा करना):
- परिदृश्य: एन्कोडर और LLM एक ही सेट के कंप्यूटरों पर फिट होते हैं।
- लाभ: एन्कोडर को LLM के अक्षम घेरे में बैठने के लिए मजबूर करने के बजाय, सिस्टम एन्कोडर को उसी कंप्यूटरों पर अपने स्वयं के कुशल जोड़ों में बैठने की अनुमति देता है।
- परिणाम: यह एक रसोई में शेफ और उसके सहायक (sous-chef) के होने जैसा है। शेफ सब्जियां काटता है (Encoder) जबकि सहायक सूप चलाता है (LLM)। वे एक-दूसरे के काम में बाधा नहीं डालते, और रसोई 49% तक तेज़ चलती है क्योंकि कोई भी इंतज़ार नहीं कर रहा है।
नॉन-कोलोकेटेड (अलग कमरे):
- परिदृश्य: एन्कोडर इतना बड़ा है (या LLM इतना मेमोरी-गहन है) कि वे जगह खत्म होने के डर के बिना एक ही कंप्यूटर साझा नहीं कर सकते।
- लाभ: सिस्टम एन्कोडर को पूरी तरह से एक अलग कमरे (कंप्यूटरों के एक अलग सेट) में ले जाता है। इससे LLM के कमरे को अपनी जरूरतों के लिए एकदम सही ढंग से व्यवस्थित करने के लिए खाली कर दिया जाता है, जिससे एन्कोडर वहां भीड़ नहीं लगा पाता।
- परिणाम: यह भारी मशीनरी को एक अलग गोदाम में ले जाने जैसा है ताकि मुख्य कार्यालय को अधिकतम दक्षता के लिए व्यवस्थित किया जा सके। इसने शब्दों को प्रोसेस करने की कुल गति में 13% तक सुधार किया।
प्रमाण
लेखकों ने केवल अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने इसका परीक्षण किया।
- उन्होंने साबित किया कि "अनुवादक" गणित के साथ छेड़छाड़ नहीं करता है। रोबोट पहले की तुलना में ठीक उसी गति और सटीकता से सीखता है, बस तेज़ है।
- उन्होंने दिखाया कि छोटे एन्कोडर्स के लिए, कंप्यूटर साझा करना (Colocated) सबसे अच्छा है।
- उन्होंने दिखाया कि विशाल एन्कोडर्स के लिए, उन्हें एक अलग कमरे में ले जाना (Non-Colocated) सबसे अच्छा है।
सारांश
यह पेपर AI को प्रशिक्षित करने के "एक ही आकार का" (one-size-fits-all) दृष्टिकोण को रोकने के बारे में है। विभिन्न भागों को उनके विशिष्ट कार्य के लिए सबसे कुशल तरीके का उपयोग करने देकर, और उनके बीच डेटा पास करने के लिए एक स्मार्ट अनुवादक बनाकर, यह सिस्टम बहुत तेज़ी से प्रशिक्षित होता है और कम कंप्यूटर शक्ति का उपयोग करता है। यह अंततः प्लंबरों और इलेक्ट्रीशियन को उनके स्वाभाविक गठन में काम करने देने जैसा है, बजाय इसके कि उन्हें एक साथ मार्च करने के लिए मजबूर किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।