← नवीनतम पेपर
💻 computer science

Rank-Gated and Sparse Low-Rank Adaptation for Efficient Fine-Tuning of Vision--Language Models

यह शोध पत्र Rank-Gated LoRA (RG-LoRA) प्रस्तुत करता है, जो मेमोरी दक्षता के लिए पोस्ट-ट्रेनिंग प्रूनिंग को सक्षम करने हेतु LoRA रैंक घटकों को सीखने योग्य महत्व भार (importance weights) आवंटित करने की एक विधि है, लेकिन Qwen3-VL-8B पर प्रारंभिक प्रयोगों से पता चलता है कि स्पष्ट स्पर्सिटी रेगुलराइजेशन (sparsity regularization) के बिना, गेट्स सार्थक स्पर्सिटी सीखने में विफल रहते हैं, जिसके परिणामस्वरूप प्रस्तावित ट्रेन-प्रून-इवैल्यूएट तंत्र को मान्य करने के बावजूद नगण्य लेटेंसी या VRAM लाभ प्राप्त होता है।

मूल लेखक: Qinwu Xu

प्रकाशित 2026-09-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qinwu Xu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक आर्टिफिशियल इंटेलिजेंस सिस्टम जो छवियों को देख सकते हैं और टेक्स्ट पढ़ सकते हैं, अविश्वसनीय रूप से शक्तिशाली होते जा रहे हैं, लेकिन वे बहुत विशाल भी होते जा रहे हैं। ये विजन-लैंग्वेज मॉडल अरबों पैरामीटर्स के साथ बनाए जाते हैं, जो वे आंतरिक सेटिंग्स हैं जो मशीन को सीखने की अनुमति देती हैं। इन दिग्गजों को एक नया कार्य सिखाने के लिए, जैसे कि मेडिकल चार्ट पढ़ना या जटिल आरेख (डायग्राम) को समझना, शोधकर्ताओं को पारंपरिक रूप से हर एक सेटिंग को समायोजित करना पड़ता था। यह प्रक्रिया एक गगनचुंबी इमारत का पुनर्निर्माण करने के लिए उसके हर एक ईंट को बदलने जैसा है; इसके लिए भारी मात्रा में कंप्यूटर मेमोरी और समय की आवश्यकता होती है, जो अक्सर अधिकांश शोधकर्ताओं के लिए इसे करना असंभव बना देता है। इसे हल करने के लिए, वैज्ञानिकों ने 'लो-रेंट अडैप्टेशन' (Low-Rank Adaptation) नामक एक शॉर्टकट विकसित किया। पूरे भवन को छूने के बजाय, यह विधि मॉडल में एक छोटा, हल्का अटैचमेंट जोड़ती है जो मूल, विशाल संरचना को अछूता रखते हुए नए कार्य को सीखता है। यह इन बड़े मॉडलों को कंप्यूटिंग पावर पर भारी खर्च किए बिना उपयोगी बनाने के लिए एक मानक उपकरण है।

हालाँकि, इन हल्के अटैचमेंट्स में भी एक छिपी हुई अक्षमता है। जब शोधकर्ता उन्हें बनाते हैं, तो उन्हें प्रशिक्षण शुरू करने से पहले यह अनुमान लगाना होता है कि अटैचमेंट को कितनी "क्षमता" (कैपेसिटी) की आवश्यकता होगी। वे एक निश्चित आकार चुनते हैं, और मॉडल उस आकार के हर हिस्से का उपयोग करता है, भले ही काम के लिए उसके एक अंश की ही आवश्यकता क्यों न हो। यह एक ऐसे सूटकेस बनाने जैसा है जिसमें बीस खाने (कंपार्टमेंट) हैं जबकि आपको केवल पांच की आवश्यकता है, फिर भी आपको बीस सभी का भार उठाना पड़ता है। टेक्सास विश्वविद्यालय ऑस्टिन के क्विनवू एक्स का नया शोध एक सरल प्रश्न पूछता है: क्या होगा यदि मॉडल स्वयं निर्णय ले सके कि अटैचमेंट के कौन से हिस्से उपयोगी हैं और कौन से नहीं, और फिर बेकार वाले हिस्सों को भौतिक रूप से हटा सके?

शोधकर्ताओं ने एक विधि पेश की जिसे वे 'रैंक-गेटेड लोरा' (Rank-Gated LoRA) कहते हैं। कल्पना कीजिए कि छोटा अटैचमेंट पारदर्शी शीटों का एक ढेर है, जहाँ प्रत्येक शीट डेटा से सीखने के विभिन्न तरीकों का प्रतिनिधित्व करती है। मानक विधियों में, मॉडल को स्टैक की सभी शीटों का उपयोग करने के लिए मजबूर किया जाता है, चाहे वे मदद करें या नहीं। इस नए दृष्टिकोण में, शोधकर्ताओं ने प्रत्येक शीट में एक छोटा, सीखने योग्य स्विच जोड़ा है। प्रशिक्षण प्रक्रिया के दौरान, मॉडल मददगार शीटों के स्विच को "ऑन" करने और अनुपयोगी शीटों के स्विच को "ऑफ" करने के लिए सीखता है। एक बार प्रशिक्षण समाप्त हो जाने के बाद, शोधकर्ता उन शीटों को भौतिक रूप से काट सकते हैं जिन्हें बंद कर दिया गया था। परिणाम एक बहुत छोटा, अधिक कुशल अटैचमेंट है जो समान कार्य करता है लेकिन कम स्थान लेता है और चलाने के लिए कम ऊर्जा की आवश्यकता होती है।

यह विचार काम करता है या नहीं, यह परीक्षण करने के लिए, टीम ने Qwen3-VL-8B-Instruct नामक एक बड़े विजन-लैंग्वेज मॉडल पर इसे लागू किया। उन्होंने मॉडल को चार्ट, छवियों में टेक्स्ट और दस्तावेज़ प्रश्नों से जुड़े तीन अलग-अलग डेटासेट्स के मिश्रण पर प्रशिक्षित किया। उन्होंने अपने नए तरीके की तुलना मानक, निश्चित-आकार वाले संस्करण से की। परिणामों ने दिखाया कि नया तरीका मानक संस्करण के समान ही अच्छी तरह से सीख सकता है, जिससे टेस्ट प्रश्नों पर लगभग 81.56 प्रतिशत की सटीकता प्राप्त हुई, जो मानक विधि द्वारा प्राप्त 81.95 प्रतिशत के बहुत करीब थी। इसने सिद्ध किया कि मॉडल प्रभावी ढंग से सीख सकता है, भले ही वह कम आकार होने की क्षमता के साथ हो।

प्रयोग का सबसे दिलचस्प हिस्सा प्रशिक्षण पूरा होने के बाद आया। शोधकर्ताओं ने प्रशिक्षित मॉडल को लिया और एक-एक करके कम महत्वपूर्ण शीटों को हटाना शुरू किया, यह देखने के लिए कि वे अटैचमेंट को कितना छोटा कर सकते हैं इससे पहले कि मॉडल विफल होने लगे। उन्होंने पाया कि मॉडल आश्चर्यजनक रूप से मजबूत था। आठ मूल शीटों में से तीन को हटाने के बाद भी, केवल पांच को छोड़कर, मॉडल का प्रदर्शन वास्तव में एक विशिष्ट वैलिडेशन सेट पर थोड़ा सुधर गया, जो 81.26 प्रतिशत तक पहुँच गया। यह बताता है कि मूल, बड़ा अटैचमेंट अतिरिक्त भार ढो रहा था जो मॉडल को सोचने में मदद नहीं कर रहा था। इसे काटकर अलग करने से, मॉडल ने समान या उससे बेहतर प्रदर्शन किया, और कम सामग्री के साथ काम किया।

इस सफलता के बावजूद, शोधकर्ता इस बात को लेकर सावधान थे कि उनके प्रयोग ने क्या सिद्ध नहीं किया। हालांकि मॉडल भागों को हटाए जाने को सहन कर सकता था, लेकिन स्विच स्वयं प्रशिक्षण के दौरान स्वचालित रूप से बंद होने के लिए नहीं सीखे थे। वे अपनी शुरुआती स्थिति के लगभग समान ही रहे, जिसका अर्थ है कि मॉडल ने स्वाभाविक रूप से यह नहीं खोजा कि कौन से हिस्से बेकार थे। शोधकर्ताओं को बाद में मैन्युअल रूप से तय करना पड़ा कि किन हिस्सों को काटना है। इसके अलावा, क्योंकि अटैचमेंट पहले से ही काफी छोटा था, इसे काटने से मॉडल वास्तविक समय में काफी तेज़ नहीं हुआ या इसने बहुत कम कंप्यूटर मेमोरी का उपयोग किया। भारी काम अभी भी मुख्य मॉडल के विशाल, फ्रीज्ड बैकबोन द्वारा किया जा रहा था, इसलिए छोटे अटैचमेंट से होने वाली बचत कुल गति को मापने के लिए बहुत कम थी।

अध्ययन निष्कर्ष निकालता है कि यह तंत्र काम करता है: यह संभव है कि अतिरिक्त क्षमता के साथ एक मॉडल को प्रशिक्षित किया जाए और फिर अप्रयुक्त हिस्सों को बिना उसकी समझने की क्षमता को नुकसान पहुँचाए सर्जिकल तरीके से हटाया जा सके। हालाँकि, इसे वास्तविक दक्षता का ब्रेकथ्रू बनने के लिए, भविष्य के कार्यों को मॉडल को प्रशिक्षण के दौरान स्वयं स्विच बंद करना सिखाने की आवश्यकता है और इसे बहुत बड़े अटैचमेंट्स पर परीक्षण करने की आवश्यकता है जहाँ बचत अधिक महत्वपूर्ण होगी। फिलहाल, यह शोध एक 'प्रूफ ऑफ कॉन्सेप्ट' के रूप में खड़ा है, जो दिखाता है कि इन डिजिटल उपकरणों को बनने के बाद तराशा जा सकता है, जो भविष्य में अधिक कुशल और अनुकूलन योग्य आर्टिफिशियल इंटेलिजेंस का मार्ग प्रशस्त करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →