← नवीनतम पेपर
💻 computer science

MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization

MuRA एक नवीन टेस्ट-टाइम अडैप्टेशन फ्रेमवर्क है जो विजन-लैंग्वेज मॉडल्स में स्टैटिक रैंक कॉन्फ़िगरेशन की सीमाओं को टोकन-लेवल विजुअल कॉम्प्लेक्सिटी के आधार पर डायनामिक रूप से मल्टी-रैंक मॉड्यूल्स को चुनने और फ्यूज करने के माध्यम से दूर करता है, जिससे कम कंप्यूटेशनल ओवरहेड के साथ स्टेट-ऑफ-द-आर्ट जनरलाइजेशन प्राप्त होता है।

मूल लेखक: Gengyuan Liu, Nanzhou Wang, Chang Liu, Qinwen Wu, Zhenhao Wang, Jiacong Wang, Bokui Chen, Xiangyang Ji

प्रकाशित 2026-08-05
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gengyuan Liu, Nanzhou Wang, Chang Liu, Qinwen Wu, Zhenhao Wang, Jiacong Wang, Bokui Chen, Xiangyang Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को दुनिया में चीजों को पहचानना सिखाने की कोशिश कर रहे हैं। आपने पहले ही इस रोबोट को लाखों तस्वीरों और शब्दों पर प्रशिक्षित किया है, इसलिए यह अपने प्रशिक्षण डेटा में बिल्लियों, कुत्तों और कारों को पहचानने में जीनियस है। लेकिन फिर, आप उसे एक बिल्ली की फोटो देते हैं जिसे एक अजीब कार्टून शैली में बनाया गया है, या एक कार की तस्वीर देते जो कीचड़ से ढकी हुई है। अचानक, रोबोट भ्रमित हो जाता है। यह उस छात्र की तरह है जिसने गणित की किताब में तो टॉप किया लेकिन जैसे ही शिक्षक ने ब्लैकबोर्ड पर अलग फॉन्ट में सवाल लिखा, वह जम गया। यह "विज़न-लैंग्वेज मॉडल्स" (Vision-Language Models) के लिए एक बड़ी समस्या है—वे एआई दिमाग जो जो देखते हैं उसे जो पढ़ते हैं उससे जोड़ते हैं। वे जो जानते हैं उसमें अद्भुत हैं, लेकिन जब दुनिया उनके सामने बदल जाती है, तो वे संघर्ष करते हैं।

इसे पूरे रोबोट को फिर से प्रशिक्षित किए बिना (जिसमें बहुत समय लगता है और बहुत पैसा खर्च होता है) ठीक करने के लिए, वैज्ञानिक "टेस्ट-टाइम अडैप्टेशन" (Test-Time Adaptation) नामक एक तरकीब का उपयोग करते हैं। इसे रोबोट को एक नई तस्वीर देखने से ठीक पहले एक त्वरित, ऑन-द-फ्लाई समायोजन देने के रूप में सोचें। इस समायोजन को करने का सबसे लोकप्रिय तरीका "लो-रैंक अडैप्टेशन" (Low-Rank Adaptation - LoRA) है। कल्पना कीजिए कि रोबोट का दिमाग एक विशाल पुस्तकालय है। LoRA पुस्तकालय को फिर से नहीं बनाता; यह बस अलमारियों पर कुछ स्टिकी नोट्स जोड़ देता है ताकि रोबोट को सही किताबें खोजने में मदद मिल सके। लेकिन यहाँ एक पेंच है: अब तक, हर कोई हर एक तस्वीर के लिए, चाहे वह कितनी भी सरल या जटिल क्यों न हो, बिल्कुल एक ही आकार का स्टिकी नोट इस्तेमाल कर रहा था।

यह पेपर MuRA (मल्टी-रैंक अडैप्टेशन) नामक एक नया तरीका पेश करता है जो कहता है, "रुको जरा! सभी तस्वीरें एक जैसी नहीं होतीं।" लेखकों ने पाया कि एक नीले आकाश की साधारण तस्वीर के लिए एक छोटा, सरल स्टिकी नोट चाहिए, जबकि एक अराजक, अव्यवस्थपूर्ण सड़क के दृश्य के लिए एक बड़ा, जटिल नोट चाहिए। यदि आप एक अव्यवस्थपूर्ण दृश्य पर छोटा नोट थोपते हैं, तो रोबोट बारीकियों को मिस कर देता है। यदि आप एक साधारण आकाश पर एक विशाल नोट थोपते हैं, तो रोबोट भ्रमित हो जाता है और जरूरत से ज्यादा सोचने लगता है। MuRA इसे हल करता है एक स्मार्ट लाइब्रेरियन की तरह जो तुरंत हर एक हिस्से के लिए एकदम सही आकार का स्टिकी नोट चुनता है, और छवि की विशिष्ट जटिलता के आधार पर रोबोट के दिमाग को गतिशील रूप से समायोजित करता है।

"वन साइज फिट्स ऑल" स्टिकी नोट्स की समस्या

शोधकर्ताओं ने पहले देखा कि ये एआई मॉडल नई, कठिन छवियों को कैसे संभालते हैं। उन्होंने वर्तमान तरीकों में एक बड़ी बाधा पाई। अधिकांश सिस्टम एक "स्टैटिक रैंक" (static rank) का उपयोग करते हैं, जिसका अर्थ है कि वे हर एक छवि के लिए मस्तिष्क की शक्ति की एक निश्चित मात्रा का उपयोग करते हैं।

लेखकों ने महसूस किया कि विजुअल इनपुट में अलग-अलग "सूचना घनत्व" (information densities) होते हैं। कुछ छवियां सरल और साफ (कम एंट्रॉपी) होती हैं, जबकि अन्य अव्यवस्थपूर्ण, शोर वाली या खराब (उच्च एंट्रॉपी) होती हैं। उन्होंने एक मजबूत संबंध पाया: एक छवि जितनी जटिल और अराजक होगी, रोबोट को उसे समझने के लिए उतनी ही अधिक "रैंक" (या मस्तिष्क शक्ति) की आवश्यकता होगी। जब आप हर चीज़ के लिए एक निश्चित रैंक का उपयोग करते हैं, तो आप रोबोट को एक समझौते के लिए मजबूर करते हैं। यह जटिल दृश्यों पर अंडरफिटिंग (पॉइंट मिस करना) और सरल दृश्यों पर ओवरफिटिंग (शोर से भ्रमित होना) का परिणाम देता है। यह गर्मियों में भारी विंटर कोट पहनने और बर्फीले तूफान में पतली टी-शर्ट पहनने जैसा है; दोनों ही पूरी तरह से काम नहीं करते।

MuRA की दुनिया में प्रवेश: एक आकार बदलने वाला दिमाग

इसे ठीक करने के लिए, टीम ने MuRA प्रस्तावित किया, एक फ्रेमवर्क जो छवि के प्रत्येक छोटे हिस्से (जिसे "टोकन" कहा जाता है) की जटिलता के आधार पर विभिन्न "रैंक्स" के अडैप्टेशन मॉड्यूल को गतिशील रूप से चुनता है और मिलाता है।

यहाँ बताया गया है कि MuRA कैसे काम करता है, इसके तीन शानदार घटकों में विभाजित है:

  1. मल्टी-रैंक ऑर्थोगोनल डिकंपोजिशन (MROD): यह "स्मार्ट इनिशियलाइजेशन" है। खाली स्टिकी नोट्स से शुरू करने के बजाय (जो अस्थिर और सीखने में धीमा होता है), MuRA रोबोट के मौजूदा ज्ञान को लेता है और उसे महत्व की विभिन्न परतों में तोड़ देता है। यह बहुत छोटे से लेकर बहुत बड़े तक के स्ट sticky नोट्स तैयार करता है, जो जाने के लिए तैयार हैं। यह सुनिश्चित करता है कि रोबोट एक ठोस आधार से शुरुआत करे और जब वह ऑन-द-फ्लाई सीखने की कोशिश करे तो भ्रमित न हो।
  2. यूनिफाइड कंपोनेंट फ्यूजन (UCF): यह "मिक्सिंग बाउल" है। MuRA केवल एक स्टिकी नोट का आकार नहीं चुनता; यह उन्हें मिलाने के लिए एक स्मार्ट राउटर का उपयोग करता है। किसी विशेष भाग के लिए, यह 20% छोटे नोट और 80% बड़े नोट को मिला सकता है। यह रोबोट को लचीला बनाता है, जिससे वह हर विवरण के लिए आवश्यक क्षमता का सही उपयोग कर पाता है।
  3. कंटीन्यूअस राउटर अपडेटिंग (CRU): यह "लर्निंग लूप" है। राउटर जो यह तय करता है कि कौन से नोट्स का उपयोग किया जाए, वह हर एक तस्वीर के बाद रीसेट नहीं होता है। इसके बजाय, यह अधिक से अधिक तस्वीरें देखते हुए अपनी रणनीति को अपडेट करना और सीखना जारी रखता है। इससे रोबोट "जटिलता" की एक सामान्य समझ विकसित करने में मदद मिलती है, ताकि वह समय के साथ सही नोट का आकार चुनने में बेहतर हो सके, भले ही छवियों के प्रकार बदल रहे हों।

यह एक बड़ी बात क्यों है

लेखकों ने मौसम की अजीब परिस्थितियों में कारों को पहचानने से लेकर कलात्मक रेखाचित्रों में जानवरों को खोजने तक, कई अलग-अलग चुनौतियों पर MuRA का परीक्षण किया। परिणाम प्रभावशाली थे।

  • बेहतर सटीकता: MuRA ने लगातार अन्य शीर्ष तरीकों को पछाड़ दिया। ImageNet-A (जो कठिन, पहचान में मुश्किल छवियों से भरा है) नामक एक टेस्ट पर, MuRA ने 66.15% की सटीकता प्राप्त की, जबकि अगले सबसे अच्छे तरीके ने 65.50% हासिल किया। ImageNet-R नामक एक अन्य कठिन टेस्ट पर, इसने 81.40% के मुकाबले 82.47% का स्कोर किया।
  • तेज़ और हल्का: आमतौर पर, किसी मॉडल को स्मार्ट बनाने का मतलब उसे धीमा और भारी बनाना होता है। लेकिन MuRA इसके विपरीत है। यह 11.26 सैंपल्स प्रति सेकंड की गति से चलता है, जो TPT (जो केवल 3.20 तक पहुँच पाता है) जैसे अन्य तरीकों की तुलना में बहुत तेज़ है। यह कम मेमोरी भी लेता है, जो प्रतिस्पर्धियों के 4.34 GB की तुलना में केवल 2.05 GB लेता है।
  • सबसे गहरी परत का कमाल: सबसे आश्चर्यजनक निष्कर्षों में से एक यह था कि MuRA कहाँ सबसे अच्छा काम करता है। अधिकांश तरीके संघर्ष करते हैं जब आप AI के दिमाग की सबसे गहरी, सबसे जटिल परतों को अनुकूलित करने की कोशिश करते हैं। लेकिन MuRA वास्तव में वहां फलता-फूलता है। क्योंकि यह अपने आकार को गतिशील रूप से समायोजित कर सकता है, यह गहरे स्तरों की जटिल, उच्च-स्तरीय सोच को बिना अटके संभाल लेता है। यह इसे सीखने के लिए सबसे छोटा रास्ता उपयोग करने की अनुमति देता है, जिससे यह प्रभावी और कुशल दोनों बनता है।

प्रमाण तस्वीरों में है

शोधकर्ताओं ने केवल नंबरों को नहीं देखा; उन्होंने यह भी देखा कि रोबोट वास्तव में क्या "देख" रहा था। जब उन्होंने रोबोट के 'अटेंशन' को विज़ुअलाइज़ किया, तो उन्हें कुछ दिलचस्प देखने को मिला।

  • एक मधुमक्खी की सरल छवि के लिए, MuRA ने कीट के विवरणों पर ध्यान केंद्रित करने के लिए उच्च-रैंक वाले घटकों का उपयोग किया।
  • फटी हुई मिट्टी की बनावट के लिए, इसने व्यापक पैटर्न को देखने के लिए लो-रैंक घटकों का उपयोग किया।
  • इसके विपरीत, मानक रोबोट (CLIP) अक्सर गलत चीजों को देखते हुए अटक जाता था या ठीक से ध्यान केंद्रित नहीं कर पाता था।

पेपर ने गणितीय रूप से भी सिद्ध किया कि यह गतिशील दृष्टिकोण आवश्यक है। उन्होंने दिखाया कि यदि आप एक एकल, स्थिर रैंक का उपयोग करने का प्रयास करते हैं, तो आप गणितीय रूप से एक उप-इष्टतम समझौते (suboptimal compromise) में फंस जाते हैं। रैंक को छवि की जटिलता के आधार पर बदलने की अनुमति देकर, रोबोट हर बार सही संतुलन पा सकता है।

आगे क्या?

हालांकि MuRA एक बड़ी छलांग है, लेखक इसकी सीमाओं के बारे में ईमानदार हैं। वर्तमान में, विभिन्न "रैंक्स" के बीच की सीमाएं हाथ से तय की जाती हैं, और सिस्टम भ्रम (एंट्रॉपी) को कम करने पर निर्भर करता है, जो कभी-कभी रोब सहित गलत अनुमानों में बहुत अधिक आत्मविश्वासी बना सकता है। उन्होंने अभी तक टेक्स्ट जेनरेट करने वाले (ऑटोरेग्रेसिव मॉडल्स) नए प्रकार के AI पर इसका परीक्षण नहीं किया है।

लेकिन फिलहाल के लिए, MuRA दिखाता है कि AI अनुकूलन का भविष्य बड़े, भारी मॉडल बनाने के बारे में नहीं है। यह उन्हें स्मार्ट, अधिक लचीला और अपने सामने मौजूद दुनिया के अनुरूप अपनी सोच की शैली को ढालने में सक्षम बनाने के बारे में है। यह एक रोबोट को एक किताब के लिए पढ़ने वाला चश्मा और धूप वाले दिन के लिए धूप का चश्मा पलक झपकते ही पहनने की क्षमता देने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →