Tevatron Meets Megatron: Expert-Parallel LLM Reranker Training on an Academic Budget
यह शोध पत्र टेवैट्रॉन 3.0 (Tevatron 3.0) का परिचय देता है, जो एक अकादमिक-बजट-अनुकूल ढांचा है जो बड़े पैमाने के MoE रेंकर के कुशल एक्सपर्ट-पैरेलल प्रशिक्षण को सक्षम करने के लिए मेग्रोटन-कोर (Megatron-Core) को एकीकृत करता है, यह प्रदर्शित करते हुए कि एक 30B-पैरामीटर वाला MoE मॉडल कम पैरामीटर्स को सक्रिय करते हुए और उच्च इन्फरेंस थ्रूपुट प्राप्त करते हुए, डेंस 8B मॉडलों की गुणवत्ता के बराबर हो सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप घास के एक विशाल ढेर में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं। कंप्यूटर विज्ञान की दुनिया में, इसे "सर्च" (खोज) कहा जाता है। सबसे पहले, एक कंप्यूटर एक हजार संभावित सुइयों को पकड़ने के लिए एक बड़ा जाल डालता है (यह "रिट्रीवल" यानी पुनः प्राप्ति का चरण है)। लेकिन वह जाल अव्यवस्थित है; वह बहुत सारा भूसा और कुछ गलत सुइयां भी पकड़ लेता है। इसे ठीक करने के लिए, दूसरा, अधिक स्मार्ट कंप्यूटर आता है और प्रत्येक उम्मीदवार को बारीकी से देखता है और तय करता है कि असली सुई कौन सी है। इस दूसरे, सावधानीपूर्ण चरण को "रीरैंकिंग" (पुनः रैंकिंग) कहा जाता है।
लंबे समय तक, ये स्मार्ट कंप्यूटर छोटे, कुशल कैलकुलेटर की तरह थे। लेकिन हाल ही में, शोधकर्ताओं ने महसूस किया कि यदि वे उन्हें विशाल बना दें—उन्हें अरबों "न्यूरॉन्स" या "विशेषज्ञों" (experts) के साथ—तो वे सही उत्तर खोजने में अविश्वसनीय रूप से कुशल हो जाते हैं। लेकिन इसमें एक पेंच है: ये विशाल मस्तिष्क इतने भारी हैं कि उन्हें प्रशिक्षित करने के लिए एक गोदाम के आकार के सुपर-कंप्यूटर की आवश्यकता होती है। अधिकांश विश्वविद्यालय प्रयोगशालाएं और छोटे अनुसंधान समूह इतना खर्च नहीं उठा सकते। वे छोटे, कमजोर कंप्यूटरों के साथ फंसे हुए हैं जो इन विशाल मॉडलों को अपनी मेमोरी में नहीं रख सकते। यह शोध पत्र ठीक इसी समस्या को हल करता है: हम बिना सुपरकंप्यूटर की आवश्यकता के, एक सीमित बजट पर इन विशाल, सुपर-स्मार्ट सर्च इंजन को कैसे प्रशिक्षित कर सकते हैं?
इस शोध पत्र के लेखक, जो यूटा, वाटरलू और कार्नेगी मेलन जैसे विश्वविद्यालयों की एक टीम है, ने टेवैट्रॉन 3.0 (Tevatron 3.0) नामक एक नया टूल बनाया है। पुराने तरीके से इन मॉडलों को प्रशिक्षित करने की तुलना एक विशाल, भारी पियानो को एक संकरी सीढ़ी से एक बार में एक व्यक्ति करके ऊपर ले जाने से करें। यह धीमा है, और अक्सर, पियानो इतना बड़ा होता है कि वह फिट नहीं बैठता, इसलिए आपको हार माननी पड़ती है। उनके द्वारा उपयोग किए जाने वाले पुराने उपकरण (जिन्हें PyTorch FSDP कहा जाता है) उसी सीढ़ी की तरह थे; उन्होंने पियानो को टुकड़ों में तोड़ने की कोशिश की, लेकिन टुकड़े अभी भी कुशलता से ले जाने के लिए बहुत भारी थे, और वे एक विशिष्ट प्रकार के पियानो (जिसे "मिश्रण विशेषज्ञ" या "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) कहा जाता है) को नहीं संभाल सके, जिसमें कई अलग-अलग आंतरिक भाग होते हैं जो केवल आवश्यकता पड़ने पर ही काम करते हैं।
टीम का समाधान सीढ़ी को बदलकर एक विशेष लोडिंग डॉक वाले मूविंग ट्रक में बदलना है। उन्होंने अपने टूलकिट में "मेगाट्रॉन" (Megatron) नामक एक शक्तिशाली इंजन को एकीकृत किया है। यह नया इंजन न केवल पियानो को ढोता है; बल्कि यह इसे छोटे, प्रबंधनीय बक्सों में तोड़ देता है जिन्हें एक साथ विभिन्न ट्रकों (कंप्यूटरों) पर लोड किया जा सकता है। इस नए इंजन का सबसे जादु적인 हिस्सा इसकी "एक्सपर्ट पैरेललिज्म" (विशेषज्ञ समानांतरता) को संभालने की क्षमता है। 128 अलग-अलग विशेषज्ञों (जैसे एक शेफ, एक मैकेनिक और एक कवि) की एक टीम की कल्पना करें जो एक समस्या पर काम कर रही है। पुराने उपकरण यह कोशिश करते थे कि हर विशेषज्ञ हर समस्या पर काम करे, जो समय और स्थान की बर्बादी थी। नया मेगाट्रॉन इंजन स्मार्ट है और कह सकता है, "ठीक है, इस विशिष्ट प्रश्न के लिए, केवल शेफ और मैकेनिक को ही आगे आने की आवश्यकता है," जबकि अन्य पीछे रहते हैं। यह टीम को एक 30 बिलियन पैरामीटर्स (एक विशाल मस्तिष्क) वाला विशाल मॉडल उस बजट पर प्रशिक्षित करने की अनुमति देता है जो पहले असंभव था।
शोध पत्र दिखाता है कि यह नया तरीका पुराने, महंगे तरीकों की तरह ही अच्छा काम करता है। वास्तव में, जब उन्होंने इसका परीक्षण किया, तो नए सिस्टम ने एक मानक 8-बिलियन पैरामीटर वाले मॉडल को पुराने तरीके की तुलना में लगभग 22% तेजी से प्रशिक्षित किया। लेकिन असली जादू उस विशाल 30-बिलियन पैरामीटर वाले मॉडल के साथ हुआ। पुराने उपकरण इसे बिल्कुल नहीं चला पाते; कंप्यूटर की मेमोरी क्रैश हो जाती। हालाँकि, नए टूल ने इसे सफलतापूर्वक प्रशिक्षित किया।
इससे भी अधिक आश्चर्यजनक रूप से, लेखकों ने पाया कि यह विशाल 30-बिलियन पैरामीटर वाला मॉडल, जो प्रत्येक प्रश्न के लिए केवल अपने 3 बिलियन पैरामीटर्स को ही "जगाता" है, एक छोटे 8-बिलियन मॉडल के समान ही प्रदर्शन करता है। यह एक ऐसी लाइब्रेरी की तरह था जिसमें 30 मिलियन किताबें हैं, लेकिन उत्तर खोजने के लिए आपको केवल 3 मिलियन किताबें खोलने की आवश्यकता है, फिर भी आपको उतनी ही सफलता मिलती है जितनी कि आपने छोटी लाइब्रेरी की 8 मिलियन किताबें पढ़ने से प्राप्त की होगी। न केवल गुणवत्ता समान थी, बल्कि क्योंकि यह प्रत्येक प्रश्न के लिए कम काम कर रहा था, इसलिए यह उत्तर देने में भी तेज था। जब उन्होंने परीक्षण किया कि यह प्रति सेकंड कितने प्रश्नों का उत्तर दे सकता है, तो उच्च गति वाले सर्वर का उपयोग करते समय यह छोटे वाले की तुलना में 1.43 गुना तेज था।
शोधकर्ताओं ने मॉडल को सिखाने के विभिन्न तरीकों का भी परीक्षण किया। उन्होंने इसे सीधे सही उत्तर दिखाकर (कॉन्ट्रास्टिव लर्निंग) बनाम एक "शिक्षक" मॉडल की नकल करने (डिस्टिलेशन) के माध्यम से सिखाने का प्रयास किया। उन्होंने पाया कि दोनों में से कोई भी तरीका स्पष्ट विजेता नहीं था; यह विशिष्ट प्रकार के प्रश्न पर निर्भर करता था। उन्होंने यह भी दिखाया कि आप मॉडल को "लो-रैंक" विधि (LoRA) का उपयोग करके प्रशिक्षित कर सकते हैं, जो एक किताब के नोट्स को अपडेट करने जैसा है न कि पूरी किताब को फिर से लिखने जैसा, और यह अभी भी लगभग पूरी किताब को फिर से लिखने जितना ही अच्छा काम करता है, जिससे मेमोरी की भारी बचत होती है।
संक्षेप में, यह शोध पत्र केवल यह नहीं कहता कि "हमने एक बड़ा मॉडल बनाया।" यह साबित करता है कि आप इन विशाल, सुपर-कुशल सर्च इंजन को एक मानक अकादमिक बजट पर बना सकते हैं। उन्होंने एक ऐसा पुल बनाया है जो छोटे लैब को उस शक्तिशाली तकनीक तक पहुँच प्रदान करता है जो पहले केवल सबसे बड़े तकनीकी दिग्गजों के लिए आरक्षित थी। उन्होंने अपना सारा कोड और प्रशिक्षित मॉडल जारी कर दिया है ताकि कोई भी इसका उपयोग कर सके। परिणाम एक ऐसा सिस्टम है जिसे प्रशिक्षित करना सस्ता है, उपयोग करना तेज़ है, और सबसे महंगे विकल्पों जितना ही स्मार्ट है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।