← नवीनतम पेपर
🤖 machine learning

Efficient, VRAM-Constrained xLM Inference on Clients

यह शोध पत्र पाइपलाइन शेर्डिंग (pipelined sharding) को प्रस्तुत करता है, जो एक नवीन CPU-GPU हाइब्रिड शेड्यूलिंग तकनीक है जो क्लाइंट सिस्टम पर लार्ज लैंग्वेज और विजन-लैंग्वेज मॉडल्स के लिए इन्फरेंस स्पीड में महत्वपूर्ण सुधार करती है और VRAM आवश्यकताओं को कम करती है, जिससे आक्रामक बेसलाइन्स की तुलना में 30 गुना तक थ्रूपुट लाभ और 10 गुना VRAM कमी प्राप्त होती है।

मूल लेखक: Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

प्रकाशित 2026-04-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "छोटा सूटकेस" दुविधा

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से स्मार्ट लाइब्रेरी (एक लार्ज लैंग्वेज मॉडल या AI) है जिसे आप अपने बैकपैक में अपने साथ ले जाना चाहते हैं। समस्या यह है कि आपका बैकपैक (आपके कंप्यूटर का VRAM या वीडियो मेमोरी) बहुत छोटा है।

यदि आप पूरी लाइब्रेरी को बैकपैक में भरने की कोशिश करते हैं, तो वह फिट नहीं होगी। यदि आप लाइब्रेरी को घर पर ही छोड़ देते हैं और केवल कुछ पन्ने ही साथ लाते हैं, तो AI धीमा या मूर्ख हो जाता है क्योंकि उसे अधिक जानकारी प्राप्त करने के लिए घर तक बार-बार दौड़ना पड़ता है।

वर्तमान समाधान अक्सर आपको लाइब्रेरी के कुछ हिस्सों को फेंकने के लिए मजबूर करते हैं (जिससे AI कम सटीक हो जाता है) या इसके लिए एक विशाल, महंगे बैकपैक की आवश्यकता होती है जो अधिकांश लोगों के पास नहीं होता।

समाधान: "पाइपलाइंड शार्डिंग" (स्मार्ट मूविंग क्रू)

लेखकों ने, जो NVIDIA के लिए काम करते हैं, एक नई प्रणाली बनाई है जिसे पाइपलाइंड शार्डिंग (Pipelined Sharding) कहा जाता है। इसे एक अत्यधिक संगठित, सुपर-स्मार्ट मूविंग क्रू (सामान ले जाने वाली टीम) के रूप में सोचें जो जानता है कि आपकी लाइब्रेरी को आपके घर (CPU या मुख्य मेमोरी) और आपके बैकपैक (GPU या वीडियो मेमोरी) के बीच कैसे पैक और स्थानांतरित किया जाए, ताकि आपको अपनी उंगली भी न उठानी पड़े।

यह कैसे काम करता है, इसे तीन सरल चरणों में समझा गया है:

1. "टेस्ट ड्राइव" (प्रोफाइलिंग)

मूविंग क्रू के शुरू होने से पहले, वे आपके विशिष्ट कंप्यूटर पर एक त्वरित "टेस्ट ड्राइव" चलाते हैं। वे जाँचते हैं:

  • आपका CPU कितना तेज़ है?
  • आपके घर और बैकपैक के बीच का गलियारा (PCIe कनेक्शन) कितना चौड़ा है?
  • आपके बैकपैक में वास्तव में कितनी जगह है?

वे अनुमान नहीं लगाते; वे मापते हैं। यह आपके कंप्यूटर की अनूठी ताकत और कमजोरियों का एक "प्रोफ़ाइल" बनाता है।

2. "थ्री-प्लान" रणनीति (योजना)

टेस्ट ड्राइव के आधार पर, सिस्टम हर संभावित स्थिति के लिए तीन अलग-अलग मूविंग रणनीतियाँ तैयार करता है:

  • प्लान A (द स्प्रिंटर - धावक): यदि आपके पास एक बड़ा बैकपैक और एक तेज़ गलियारा है, तो क्रू सब कुछ बैकपैक में रख देता है और तेज़ी से चलता है।
  • प्लान B (द रिले - रिले रेस): यदि बैकपैक छोटा है लेकिन आपके पास कई शक्तिशाली सहायक (CPU थ्रेड्स) हैं, तो क्रू काम को विभाजित करता है। कुछ किताबें घर में रहती हैं और सहायकों द्वारा पढ़ी जाती हैं, जबकि अन्य बैकपैक में होती हैं। वे किताबों को कुशलतापूर्वक इधर-उधर पहुँचाते हैं।
  • प्लान C (द ओवरलैप - ओवरलैप): यदि गलियारा चौड़ा है, तो क्रू वर्तमान बैच को पढ़े जाने के दौरान ही अगले बैच की किताबें ले जाना शुरू कर देता है। यह चीजों को स्थानांतरित करने में लगने वाले समय को छिपा देता है।

सिस्टम केवल एक योजना को हमेशा के लिए नहीं चुनता है। यह देखता है कि आप अभी क्या कर रहे हैं। क्या आप एक छोटा वाक्य पढ़ रहे हैं (इंटरैक्टिव मोड) या पूरा अध्याय (बैच मोड)? यह उस सटीक क्षण के लिए सबसे अच्छा प्लान चुनता है।

3. "सब-लेयर" पैकिंग (शार्डिंग)

पूरी लाइब्रेरी को एक साथ ले जाने के बजाय, यह क्रू लाइब्रेरी को छोटे खंडों (सब-लेयर्स) में तोड़ देता है।

  • VIP सेक्शन: सबसे महत्वपूर्ण हिस्से (जैसे "अटेंशन" मैकेनिज्म, जो AI को यह समझने में मदद करता है कि क्या महत्वपूर्ण है) को हमेशा बैकपैक में रखा जाता है क्योंकि उनकी निरंतर आवश्यकता होती है।
  • स्टोरेज सेक्शन: कम महत्वपूर्ण हिस्से घर में रहते हैं और केवल तभी बाहर लाए जाते हैं जब अत्यंत आवश्यक हो।

यह "सब-लेयर" दृष्टिकोण सिस्टम को उन विशाल मॉडलों को छोटे बैकपैक्स में फिट करने की अनुमति देता जो पहले बिल्कुल भी नहीं समा सकते थे।

विज़न अपग्रेड: "VLMOpt" (कैमरा लेंस)

पेपर विजन लैंग्वेज मॉडल्स (VLMs) को भी संबोधित करता है, जो ऐसे AI हैं जो चित्रों को "देख" सकते हैं।

  • समस्या: हाई-रिज़ॉल्यूशन फोटो विशाल, भारी पेंटिंग्स की तरह होते हैं। एक छोटे बैकपैक में 4K इमेज लोड करने की कोशिश करने से सिस्टम क्रैश हो जाता है।
  • समाधान: उन्होंने VLMOpt नामक एक विशेष ट्रिक जोड़ी है।
    1. ऑफलोडिंग (Offloading): वे भारी "पेंटिंग टूल्स" (वेट्स) को घर में रखते हैं और केवल वर्तमान क्षण के लिए आवश्यक विशिष्ट ब्रश स्ट्रोक्स को ही बाहर लाते हैं।
    2. फ्लैश अटेंशन (Flash Attention): वे चित्र को देखने का एक नया तरीका उपयोग करते हैं जिसमें हर एक पिक्सेल को एक साथ याद रखने की आवश्यकता नहीं होती, जिससे बहुत अधिक जगह बचती है।
    3. नो ओवरलैप (No Overlap): वे यह सुनिश्चित करते हैं कि AI का "पेंटिंग" वाला हिस्सा और "पढ़ने" वाला हिस्सा एक ही समय में बैकपैक में बैठने की कोशिश न करें। वे बारी-बारी से काम करते हैं, ताकि बैकपैक कभी भी बहुत भरा हुआ न हो।

परिणाम: वास्तव में क्या हुआ?

पेपर ने वास्तविक कंप्यूटरों (लैपटॉप से लेकर हाई-एंड डेस्कटॉप तक) और विभिन्न AI मॉडल्स पर इसका परीक्षण किया। यहाँ उनके दावे दिए गए हैं:

  • गति (Speed): इंटरैक्टिव उपयोग (जैसे AI के साथ चैट करना) के लिए, सिस्टम ने बातचीत शुरू करने में AI को 6.7 गुना तेज़ और शब्द उत्पन्न करने में 30 गुना तेज़ बना दिया।
  • असंभव को संभव बनाना: वे एक कंप्यूटर के साथ, जिसमें केवल 2GB वीडियो मेमोरी थी, एक विशाल 77GB का AI मॉडल चलाने में सक्षम रहे। यह एक 77-मंजिला इमारत को जूते के डिब्बे में फिट करने जैसा है।
  • बैचिंग (Batching): एक साथ कई अनुरोधों को प्रोसेस करते समय (बैच मोड में), सिस्टम 8.2 गुना तक तेज़ था।
  • गेमिंग: जब एक वीडियो गेम (जैसे Cyberpunk 2077) के साथ AI चला रहे थे, तो सिस्टम ने एक ऐसा "स्वीट स्पॉट" खोजा जहाँ गेम और AI दोनों बिना एक-दूसरे को क्रैश किए सुचारू रूप से चल सके।
  • विज़न (Vision): "Cosmos-Reason1" AI (जो छवियों को देखता है) के लिए, उन्होंने आवश्यक मेमोरी को 10 गुना कम कर दिया, जिससे उन उपकरणों पर भी हाई-रिज़ॉल्यूशन इमेज विश्लेषण संभव हो गया जो पहले इसे संभालने में असमर्थ थे।

निष्कर्ष

यह पेपर एक "स्मार्ट शेड्यूलर" पेश करता है जो आपके कंप्यूटर के संसाधनों के लिए एक मास्टर कंडक्टर (संचालक) के रूप में कार्य करता है। यह AI को कम सटीक नहीं बनाता (यह "लॉसलेस" है); इसके बजाय, यह पता लगाता है कि आपकी मुख्य मेमोरी और आपकी वीडियो मेमोरी के बीच डेटा को स्थानांतरित करने का सबसे कुशल तरीका क्या है।

ऐसा करके, यह डेवलपर्स को नियमित लैपटॉप और गेमिंग पीसी पर विशाल, स्मार्ट AI चलाने की अनुमति देता है, भले ही उन कंप्यूटरों में बहुत सीमित वीडियो मेमोरी हो। यह "बहुत बड़ा है" की समस्या को "बिल्कुल सही" के समाधान में बदल देता है क्योंकि यह लगातार आपके कंप्यूटर की वर्तमान स्थितियों के अनुकूल होता रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →