FMplex: Model Virtualization for Serving Extensible Foundation Models
मूल लेखक: Hetvi Shastri, Pragya Sharma, Walid A. Hanafy, David Irwin, Mani Srivastava, Prashant Shenoy
मूल लेखक: Hetvi Shastri, Pragya Sharma, Walid A. Hanafy, David Irwin, Mani Srivastava, Prashant Shenoy
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: FMplex – विस्तार योग्य फाउंडेशन मॉडल्स को सर्व करने के लिए मॉडल वर्चुअलाइजेशन
समस्या विवरण
फाउंडेशन मॉडल्स (FMs) भाषा, विजन, टाइम-सीरीज और मल्टीमॉडल डोमेन में विविध डाउनस्ट्रीम एप्लिकेशन्स के लिए आधार बन गए हैं। हालाँकि, मौजूदा मॉडल-सर्विंग सिस्टम (जैसे, NVIDIA Triton) एक "इन्स्टेंस-पर-टास्क" (प्रति कार्य इंस्टेंस) प्रतिमान के इर्द-गिर्द डिज़ाइन किए गए हैं, जहाँ प्रत्येक अनुकूलित कार्य (customized task) मॉडल की एक अलग, स्वतंत्र प्रति लोड करता है। यह दृष्टिकोण FMs के लिए अक्षम है क्योंकि:
- संसाधन की बर्बादी: FMs एक विशाल, साझा बैकबोन (अक्सर गीगाबाइट्स में) और हल्के टास्क-विशिष्ट एक्सटेंशन (हेड्स, एडेप्टर्स) से बने होते हैं। प्रत्येक कार्य के लिए एक पूर्ण बैकबोन लोड करना सबसे भारी घटक को दोहराता है, जिससे एक्सेलेरेटर मेमोरी बर्बाद होती है।
- दक्षता की हानि: स्वतंत्र इंस्टेंस कार्यों के बीच बैचिंग और लोडिंग लागतों के अमोर्टाइजेशन (amortization) को रोकते हैं।
- हस्तक्षेप और अलगाव (Interference and Isolation): बिना तार्किक अलगाव के केवल साझा GPU पर कार्यों को सह-स्थान (co-locate) करने से क्रॉस-टास्क हस्तक्षेप होता है, जहाँ एक कार्य के लोड स्पाइक्स दूसरे कार्यों के प्रदर्शन को खराब कर देते हैं।
- लाइफसाइकिल की कठोरता: वर्तमान सिस्टम टास्क के लाइफसाइकिल को भौतिक मॉडल इंस्टेंस के साथ जोड़ देते हैं, जिससे पूरे बैकबोन को पुन: तैनात (redeploy) किए बिना कार्यों को जोड़ना, हटाना या संशोधित करना कठिन हो जाता है।
पेपर का तर्क है कि FM बैकबोन को एक साझा सिस्टम सबस्ट्रेट (OS वर्चुअलाइजेशन में CPU या मेमोरी के समान) के रूप में माना जाना चाहिए, न कि एक प्रति-कार्य परिनियोजन आर्टिफैक्ट (per-task deployment artifact) के रूप में।
कार्यप्रणाली: FMplex
लेखक FMplex प्रस्तुत करते हैं, जो एक सर्विंग सिस्टम है जो फाउंडेशन मॉडल वर्चुअलाइजेशन पेश करता है। मुख्य अवधारणा वर्चुअल फाउंडेशन मॉडल (vFM) है, जो प्रत्येक कार्य को प्रस्तुत किया गया एक तार्किक रूप से निजी FM इंस्टेंस है, जो एक साझा भौतिक FM इंस्टेंस द्वारा समर्थित है।
प्रमुख वास्तुशिल्प घटक (Key Architectural Components)
वर्चुअल फाउंडेशन मॉडल (vFM) एब्स्ट्रैक्शन:
- डिकपलिंग (Decoupling): vFM कार्य के तार्किक दृश्य (अनुकूलन, स्थिति, लाइफसाइकिल) को भौतिक बैकबोन से अलग करता है।
- संरचना: प्रत्येक vFM में एक वर्चुअल क्यू (अनुरोध रूटिंग के लिए), टास्क एक्सटेंशन्स (एनकोडर्स, डिकोडर्स और PEFT एडेप्टर्स जैसे LoRA), और स्टेट/अकाउंटिंग (SLOs, प्राथमिकताएं, वेट्स) शामिल होते हैं।
- तंत्र: जब कोई कार्य अपने vFM को इनवॉक करता है, तो FMplex कॉल को इंटरसेप्ट करता है, उसे वर्चुअल क्यू के माध्यम से रूट करता है, और आवश्यकतानुसार कार्य-विशिष्ट एडेप्टर्स लागू करते हुए इसे साझा भौतिक बैकबोन पर निष्पादित करता है।
बैच-अवेयर फेयर क्यूइंग (BFQ) शेड्यूलर:
- चुनौती: मानक फेयर-शेयर शेड्यूलर (जैसे, स्टार्ट-टाइम फेयर क्यूइंग) अनुरोध-आधारित कार्य करते हैं और अनुरोध बैचिंग के लाभों को ध्यान में नहीं रखते हैं, जो FM थ्रूपुट के लिए महत्वपूर्ण है।
- समाधान: BFQ एक वर्क-कंजर्विंग शेड्यूलर है जो बैचिंग के लिए अनुकूलित करते हुए भारित फेयर शेयरिंग (weighted fair sharing) का अनुमान लगाता है।
- संचालन: यह अनुरोधों को कार्य भार (weights) के आधार पर स्टार्ट/फिनिश टैग असाइन करता है। यह अधिकतम आकार (Bmax) तक या जब तक SLO डेडलाइन का उल्लंघन न हो जाए, तब तक बैच बनाता है।
- एडेप्टर हैंडलिंग: BFQ एडेप्टर असंगति को संभालता है, पहले सामान्य बैकबोन पर अनुरोधों को बैच करता है और फिर अनुक्रमिक रूप से असंगत एडेप्टर अंतरों को प्रोसेस करता है, जिससे बैचिंग दक्षता से समझौता किए बिना निष्पक्षता सुनिश्चित होती है।
- टोकन-आधारित समर्थन: टोकन-आधारित FMs (जैसे, LLMs) के लिए, BFQ अनुरोध-स्तर के रनटाइम के साथ निरंतरता बनाए रखने के लिए सर्विस-टाइम यूनिट्स में टोकन-स्तरीय कार्य को चार्ज करता है।
टास्क-API और सर्विंग स्टैक:
- टास्क-API: एक प्रोग्रामिंग इंटरफेस जो उपयोगकर्ताओं को एक vFM से एनकोडर्स, डिकोडर्स और एडेप्टर्स को जोड़कर टास्क पाइपलाइन बनाने की अनुमति देता है। यह उसी पाइपलाइन ऑब्जेक्ट का उपयोग करके इन्फरेंस और फाइन-ट्यूनिंग दोनों का समर्थन करता है।
- FMplex-Controller: एक क्लस्टर-स्तरीय कंट्रोलर जो परिनियोजन योजना (deployment plan) का प्रबंधन करता है। यह जहाँ भी संभव हो, मौजूदा भौतिक बैकबोन से कार्यों को बांधने के लिए "मैक्स-शेयर" ह्यूरिस्टिक का उपयोग करता है, जिससे नए बैकबोन इंस्टेंशिएशन को कम किया जा सके।
- इलास्टिक अडैप्टेशन: जब लोड बदलता है, तो सिस्टम एक कार्य के vFM को एक अलग मौजूदा भौतिक बैकबोन से पुन: बाइंड कर सकता है, जिसमें केवल हल्का टास्क-स्टेट (क्यूज़, एडेप्टर्स) स्थानांतरित होता है, भारी बैकबोन को लोड करने के बजाय।
मुख्य योगदान
- डिप्लॉयमेंट शेयरिंग के लिए FM वर्चुअलाइजेशन: vFM एब्स्ट्रैक्शन की शुरुआत, जो कई स्वतंत्र रूप से अनुकूलित कार्यों को तार्किक अलगाव और स्वतंत्र लाइफसाइकिल बनाए रखते हुए एक ही भौतिक FM इंस्टेंस को साझा करने की अनुमति देता है।
- शेयरिंग-आधारित सर्विंग स्टैक: एक एंड-टू-एंड सिस्टम जो विस्तार योग्य टास्क निर्माण के लिए Task-API और शेयरिंग-जागरूक क्लस्टर परिनियोजन के लिए FMplex-Controller को एकीकृत करता है।
- प्रोटोटाइप कार्यान्वयन: एक कार्यात्मक प्रोटोटाइप जो कई मोडैलिटीज (टाइम-सीरीज, विजन, LLMs, VLMs) और रनटाइम्स (PyTorch, vLLM) का समर्थन करता है, जो हेट्रोजेनियस FMs में लचीलेपन का प्रदर्शन करता है।
- व्यापक मूल्यांकन: 7 बैकबोन FMs (16 वेरिएंट्स) और 92 डाउनस्ट्रीम टास्क पर एक कठोर मूल्यांकन।
प्रयोगात्मक परिणाम
मूल्यांकन को सिंथेटिक और वास्तविक दुनिया के ट्रेसेस (Azure Functions) का उपयोग करके 16-नोड वाले AWS क्लस्टर (NVIDIA T4 GPUs) पर किया गया था।
लेटेंसी में कमी:
- स्पेशियल पार्टीशनिंग (GPU पार्टीशंस पर कार्यों को अलग करना) की तुलना में, FMplex ने लेटेंसी को 80% तक कम किया।
- बेस्ट-एफर्ट को-लोकेशन (एक ही GPU पर बिना आइसोलेशन के कई पूर्ण इंस्टेंस) की तुलना में, FMplex ने लेटेंसी को 33.3% तक कम किया।
- क्लस्टर स्केल पर, FMplex ने बेस्ट-एफर्ट को-लोकेशन की तुलना में मीन लेटेंसी में 15% और P99 लेटेंसी में 26% की कमी की।
संसाधन दक्षता और स्केलेबिलिटी:
- मेमोरी: FMplex GPU मेमोरी के उपयोग को काफी कम करता है। उदाहरण के लिए, एक साझा बैकबोन पर 10 टाइम-सीरीज कार्यों को सह-स्थान करने के लिए केवल एक कार्य के 1.17× मेमोरी की आवश्यकता थी, जबकि स्वतंत्र परिनियोजन के लिए यह 10× थी।
- थ्रूपुट: FMplex ने कम लोड (जहाँ मेमोरी बाधा है) पर 6× अधिक कार्यों और मध्यम/उच्च लोड (जहाँ कंप्यूट बाधा है) पर बेस्ट-एफर्ट को-लोकेशन की तुलना में 8-12% अधिक कार्यों को बनाए रखा।
- निष्पक्षता (Fairness): असममित सेवा भार (जैसे, 3:1) के तहत, FMplex ने 84 RPS को बनाए रखते हुए 0.97–0.98 के निष्पक्षता स्कोर को बनाए रखा। इसके विपरीत, नॉन-बैच्ड फेयर-शेयरिंग ने केवल 37 RPS पर समान निष्पक्षता प्राप्त की, और अनमैनेज्ड शेयरिंग ने निष्पक्षता को 0.66 तक गिरा दिया।
अनुकूलन ओवरहेड (Adaptation Overhead):
- FMplex ने वर्कलोड सर्ज के प्रति तीव्र अनुकूलन दिखाया। एक कार्य को मौजूदा बैकबोन से पुन: बाइंड करने में 0.5 सेकंड लगे, जबकि एक नया बैकबोन इंस्टेंस लोड करने में (जैसा कि नॉन-शेयरिंग सिस्टम में आवश्यक है) ~58 सेकंड लगे, जिससे दो-ऑर्डर-ऑफ-मैग्निट्यूड लेटेंसी स्पाइक हुआ।
ओवरहेड: FMplex द्वारा पेश किया गया शेड्यूलिंग ओवरहेड (क्यू हैंडलिंग और टैग कंप्यूटेशन) न्यूनतम था, जो औसतन 0.35 ms प्रति अनुरोध रहा, जो बैकबोन निष्पादन समय की तुलना में नगण्य है।
महत्व और दावे
पेपर का दावा है कि FMplex उस मौलिक बेमेल (mismatch) को संबोधित करता है जो फाउंडेशन मॉडल्स की वास्तुकला (भारी साझा बैकबोन, हल्के एक्सटेंशन) और वर्तमान सर्विंग सिस्टम (प्रति-इंस्टेंस परिनियोजन) के बीच है। एक वर्चुअल फाउंडेशन मॉडल (vFM) के रूप में FM बैकबोन को एक वर्चुअलाइजेशन सबस्ट्रेट के रूप में मानकर, FMplex निम्नलिखित को सक्षम बनाता है:
- डिप्लॉयमेंट शेयरिंग: बैकबोन की भारी मेमोरी और कंप्यूट लागत को कई कार्यों के बीच बांटना (amortize करना)।
- टास्क आइसोलेशन: पूर्ण मॉडल प्रतिकृति (replication) के संसाधन दंड के बिना प्रति-कार्य प्रदर्शन गारंटी और अलगाव प्रदान करना।
- परिचालन लचीलापन (Operational Flexibility): अंतर्निहित बुनियादी ढांचे को पुन: तैनात किए बिना कार्यों को गतिशील रूप से जोड़ना, हटाना या संशोधित करना।
लेखक FMplex को केवल विशिष्ट मॉडलों के लिए एक अनुकूलन के रूप में नहीं, बल्कि एक सामान्यीकरण योग्य सिस्टम लेयर के रूप में देखते हैं जो शास्त्रीय वर्चुअलाइजेशन सिद्धांतों को फाउंडेशन मॉडल सर्विंग के डोमेन तक विस्तारित करता है, जिससे अधिक कुशल और स्केलेबल AI इंफ्रास्ट्रक्चर सक्षम होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।
हर हफ़्ते machine learning के बेहतरीन पेपर पाएँ।
Stanford, Cambridge और French Academy of Sciences के रिसर्चर हम पर भरोसा करते हैं।
अपना सब्सक्रिप्शन पक्का करने के लिए इनबॉक्स देखें।
कुछ गड़बड़ हो गई। फिर से कोशिश करें?
कोई स्पैम नहीं, कभी भी अनसब्सक्राइब करें।