Quantization with Unified Adaptive Distillation to enable multi-LoRA based one-for-all Generative Vision Models on edge
यह शोध पत्र QUAD को प्रस्तुत करता है, जो एक एकीकृत ढांचा (unified framework) है जो LoRA वेट्स को रनटाइम इनपुट के रूप में मानकर और उच्च दृश्य गुणवत्ता बनाए रखते हुए मेमोरी फुटप्रिंट और लेटेंसी में महत्वपूर्ण कमी प्राप्त करने के लिए क्वांटाइजेशन-अवेयर ट्रेनिंग का उपयोग करके, एज डिवाइसेस पर कुशल मल्टी-टास्क जनरेटिव विजन मॉडल इन्फरेंस को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके स्मार्टफोन के अंदर एक सुपर-स्मार्ट कलाकार रहता है। यह कलाकार अविश्वसनीय रूप से प्रतिभाशाली है और बहुत कुछ कर सकता है: आपकी छुट्टियों की तस्वीरों से अनचाहे पर्यटकों को हटा सकता है, सेल्फी का बैकग्राउंड बदलकर समुद्र तट कर सकता है, या एक साधारण स्केच को एक वास्तविक पेंटिंग में बदल सकता है।
हालाँकि, एक समस्या है। यह कलाकार बहुत विशाल है। उन्हें काम करने के लिए, आपको आमतौर पर भारी औजारों से भरा एक विशाल बैकपैक उठाना पड़ता है।
पुराना तरीका: "एक कलाकार, एक बैकपैक" की समस्या
अतीत में, यदि आप चाहते थे कि आपका फोन तीन अलग-अलग कार्य करे (जैसे फोटो एडिट करना, आर्ट बनाना और वस्तुओं को हटाना), तो आपको इस कलाकार के तीन अलग-अलग संस्करणों को प्रशिक्षित करना पड़ता था।
- समस्या: "फोटो एडिटर" मोड से "आर्ट जनरेटर" मोड में स्विच करने के लिए, आपके फोन को पहला भारी बैकपैक उतारना पड़ता था और एक पूरी तरह से नया, समान रूप से भारी बैकपैक लोड करना पड़ता था।
- परिणाम: आपके फोन का स्टोरेज (ROM) कलाकार के दिमाग की डुप्लिकेट प्रतियों से भर जाता था। कार्यों को बदलना धीमा था क्योंकि फोन को हर बार नया सामान पैक करने और अनपैक करने के लिए रुकना पड़ता था। यह बिल्कुल वैसा ही था जैसे हर बार पार्क जाने के बजाय किराने के सामान के लिए गाड़ी चलाने के लिए कार का इंजन बदलने की कोशिश करना।
नया समाधान: "एक दिमाग, कई पोशाकें"
सैमसंग के शोधकर्ताओं ने एक चतुर नया सिस्टम बनाया है जिसे QUAD (क्वांटाइजेशन विद यूनिफाइड एडेप्टिव डिस्टिलेशन) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. "प्लग-एंड-प्ले" पोशाक (इनपुट के रूप में LoRA)
हर कार्य के लिए एक नया कलाकार बनाने के बजाय, उन्होंने एक ही कलाकार (फाउंडेशन मॉडल) को रखा और उन्हें एक विशेष वार्डरोब दी।
- पुराना तरीका: कलाकार के कपड़े उनके शरीर पर स्थायी रूप से सिले हुए थे। स्टाइल बदलने के लिए, आपको पूरे व्यक्ति को फिर से बनाना पड़ता था।
- नया तरीका: कलाकार एक बुनियादी, न्यूट्रल सूट पहनता है। "LoRA" वेट्स (weights) जादुई, हटाने योग्य पोशाकों की तरह हैं (एक शेफ का एप्रन, एक पेंटर का एप्रन, एक फोटोग्राफर की वेस्ट)।
- यह कैसे काम करता है: जब आप फोटो एडिट करना चाहते हैं, तो आपका फोन तुरंत "एडिटर आउटफिट" पहन लेता है। जब आप आर्ट बनाना चाहते हैं, तो यह "आर्टिस्ट आउटफिट" पहन लेता है। मुख्य दिमाग कभी नहीं बदलता; यह केवल उन उपकरणों को बदल देता है जिनका वह उपयोग करता है। इसका मतलब है कि आपको केवल कलाकार का एक संस्करण स्टोर करने की आवश्यकता है, जिससे बहुत सारा स्थान बचता है।
2. "यूनिवर्सल ट्रांसलेटर" (यूनिफाइड क्वांटाइजेशन)
यहाँ पेचीदा हिस्सा है: डिजिटल फोन (विशेष रूप से उनके अंदर की चिप्स) एक सरलीकृत भाषा बोलते हैं जिसे "क्वांटाइजेशन" (मेमोरी बचाने के लिए कम नंबरों का उपयोग करना) कहा जाता है।
- समस्या: आमतौर पर, "एडिटर आउटफिट" की बोली "आर्टिस्ट आउटफिट" से थोड़ी अलग होती है। यदि आप उन्हें एक ही सरलीकृत भाषा बोलने के लिए मजबूर करते हैं, तो कलाकार भ्रमित हो सकता है और अजीब तस्वीरें बनाने लग सकता है।
- समाधान (QUAD): शोधकर्ताओं ने एक "यूनिवर्सल ट्रांसलेटर" बनाया है। उन्होंने सभी अलग-अलग पोशाकों को फैक्ट्री से बाहर निकलने से पहले ही एक ही सरलीकृत बोली बोलना सिखा दिया।
- उपमा: कल्पना कीजिए कि अलग-अलग लहजे (फ्रेंच, स्पेनिश, इतालवी) बोलने वाले अभिनेताओं के एक समूह को केवल हाथों के इशारों का उपयोग करके एक नाटक करने के लिए प्रशिक्षित किया गया है। वे एक साथ अभ्यास करते हैं जब तक कि वे सभी इशारों को पूरी तरह से समझ नहीं लेते। अब, निर्देशक (फोन) बिना किसी भ्रम या दोबारा स्क्रिप्ट सीखने के, तुरंत अभिनेताओं को बदल सकता है।
3. "लाइटवेट रनटाइम" (डिलीवरी ट्रक)
अंत में, उन्होंने एक छोटा, कुशल डिलीवरी ट्रक (सॉफ्टवेयर स्टैक) बनाया है जो आपके फोन पर चलता है।
- क्योंकि कलाकार और उनकी पोशाकें अब पूरी तरह से संगत हैं और एक ही भाषा बोलती हैं, इसलिए ट्रक को इंजन को फिर से लोड करने के लिए रुकने की आवश्यकता नहीं है। यह बस एक सेकंड के अंश में पोशाक बदल देता है।
इससे क्या फर्क पड़ता है? (परिणाम)
इस "एक दिमाग, कई पोशाकें" प्रणाली का उपयोग करके:
- स्टोरेज: आपके फोन को इन सभी फीचर्स को स्टोर करने के लिए 6 गुना कम जगह की आवश्यकता होती है। 15GB के कचरे के बजाय, यह 2.6GB में फिट हो जाता है।
- गति: कार्यों को बदलना 4 गुना तेज़ है। आप फोन में नया ऐप "लोड" होने का इंतज़ार नहीं करते; यह बस एक नया टूल तुरंत अपना लेता है।
- गुणवत्ता: तस्वीरें अभी भी शानदार दिखती हैं। "यूनिवर्सल ट्रांसलेटर" यह सुनिश्चित करता है कि कलाकार अपनी प्रतिभा न खो दे, भले ही वह एक सरल भाषा बोल रहा हो।
संक्षेप में
यह पेपर इस बारे में है कि आपके फोन की AI को अधिक स्मार्ट और हल्का कैसे बनाया जाए। हर कार्य के लिए भारी, अलग-अलग किताबों का पुस्तकालय रखने के बजाय, उन्होंने एक मास्टर बुक बनाई है जिसमें चुंबकीय, स्वैपेबल (बदलने योग्य) अध्याय हैं जो एक ही भाषा बोलते हैं। यह आपके फोन को जटिल AI कार्य तुरंत करने की अनुमति देता है, बिना मेमोरी या बैटरी खत्म किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।