← नवीनतम पेपर
💻 computer science

U-shaped Multi-granularity Learning for Vision-Language Models

विज़न-लैंग्वेज प्रॉम्प्ट लर्निंग में ग्रैनुलैरिटी (सूक्ष्मता) की दुविधा को संबोधित करने के लिए, यह शोध पत्र UPrompt का प्रस्ताव करता है, जो एक U-आकार का मल्टी-ग्रैनुलैरिटी फ्रेमवर्क है जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ 17 बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए कोर्स-टू-फाइन (स्थूल-से-सूक्ष्म) कॉन्टेक्स्ट प्रोपेगेशन और फाइन-टू-कोर्स (सूक्ष्म-से-स्थूल) पदानुक्रमित पर्यवेक्षण को एकीकृत करता है।

मूल लेखक: Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo

प्रकाशित 2026-07-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को तस्वीरें दिखाकर और कहानियाँ पढ़कर दुनिया को समझना सिखाने की कोशिश कर रहे हैं। यह विज़न-लैंग्वेज मॉडल्स (VLMs) का रोमांचक क्षेत्र है। इन मॉडल्स को ऐसे सुपर-स्मार्ट छात्रों के रूप में सोचें जिन्होंने हर किताब पढ़ी है और हर फोटो देखी है, लेकिन उन्हें सही चीजों पर ध्यान केंद्रित करने के लिए थोड़े से धक्के (nudge) की जरूरत है। यह धक्का प्रॉम्प्ट लर्निंग (prompt learning) कहलाता है। रोबोट के पूरे दिमाग को फिर से लिखने के बजाय (जिसमें बहुत समय लगता है), हम बस कुछ विशेष "निर्देश शब्दों" (प्रॉम्प्ट्स) को थोड़ा सा बदलते हैं ताकि उसे बताया जा सके कि उसे किसी तस्वीर को कैसे देखना है या किसी वाक्य को कैसे पढ़ना है।

हालाँकि, इन निर्देशों के साथ एक पेचीदा समस्या है। यदि आप रोबोट को एक व्यापक, सामान्य निर्देश देते हैं जैसे "पूरी तस्वीर को देखो," तो वह बड़ी तस्वीर तो देख लेता है लेकिन सूक्ष्म, महत्वपूर्ण विवरणों (जैसे पक्षी की चोंच का रंग) को छोड़ देता है। लेकिन यदि आप उसे एक अत्यंत विशिष्ट निर्देश देते जैसे "चोंच को देखो," तो हो सकता है कि वह इस तथ्य को मिस कर दे कि पक्षी पेड़ की टहनी पर बैठा है। यह "ग्रैनुलैरिटी डिलेमा" (granularity dilemma) है: या तो बहुत व्यापक होना या बहुत संकीर्ण होना। जिस पेपर को आप अब पढ़ने जा रहे हैं, वह इसी समस्या को हल करता है, यह सिखाने की कोशिश करता है कि रोबोट को एक ही समय में जंगल और पेड़ों दोनों को कैसे देखना है।


यू-शेप्ड सॉल्यूशन: रोबोटों को परतों में देखना सिखाना

मिलिए UPrompt से, एक नई विधि जिसे शोधकर्ता बियाओ चेन और उनकी टीम ने बनाया है। उन्होंने मेडिकल इमेजिंग में उपयोग किए जाने वाले एक प्रसिद्ध टूल U-Net को देखा, जो एक मास्टर शेफ की तरह है जो सब्जियों को छोटे टुकड़ों में काट सकता है और फिर स्वाद को संतुलित रखने के लिए उन्हें तुरंत एक बड़े सूप में मिला सकता है। शोधकर्ताओं ने पूछा: "हम इस 'U-आकार' के विचार का उपयोग अपने विज़न-लैंग्वेज रोबोटों की मदद के लिए क्यों नहीं कर सकते?"

अतीत में, अधिकांश रोबोट केवल एक ही प्रकार के निर्देश के साथ सीखने की कोशिश करते थे: या तो एक "ग्लोबल" (बड़ी तस्वीर) या एक "लोकल" (सूक्ष्म विवरण) निर्देश। शोधकर्ताओं ने पाया कि यह एकल दृष्टिकोण रोबोटों को पीछे खींच रहा था। यह एक फिल्म का वर्णन करने की कोशिश करने जैसा है जिसमें या तो केवल यह कहा जाए कि "यह एक एक्शन मूवी है" (बहुत अस्पष्ट) या केवल उस सटीक फ्रेम का वर्णन किया जाए जहाँ नायक कूदता है (बहुत विशिष्ट)। कहानी को समझने के लिए आपको दोनों की आवश्यकता होती है।

बड़ा विचार: एक दो-तरफा रास्ता
UPrompt एक विशेष "U-आकार" वाला सीखने का मार्ग बनाता है। एक प्लेग्राउंड स्लाइड की कल्पना करें जो नीचे जाती है और फिर वापस ऊपर आती है।

  1. नीचे जाना (कोर्स-टू-फाइन / मोटे से सूक्ष्म की ओर): रोबोट पूरी छवि और सामान्य कहानी को देखकर शुरुआत करता है। फिर, वह करीब और करीब देखने के लिए स्लाइड के नीचे जाता है, उस बड़ी तस्वीर की समझ का उपयोग करके सूक्ष्म विवरणों को और अधिक स्पष्ट करता है। यह एक जासूस की तरह है जो पहले पूरे अपराध स्थल को देखता है, फिर उस संदर्भ का उपयोग करके एक विशिष्ट उंगलियों के निशान (fingerprint) पर ज़ूम करता है।
  2. ऊपर जाना (फाइन-टू-कोर्स / सूक्ष्म से मोटे की ओर): लेकिन रुकिए, यह वहां नहीं रुकता! रोबोट स्लाइड के ऊपर भी एक संदेश भेजता है। वह उन सुपर-शार्प, सूक्ष्म विवरणों को लेता है और उनका उपयोग यह सुनिश्चित करने के लिए करता है कि बड़ी तस्वीर भ्रमित न हो जाए या सच्चाई से "भटक" न जाए। यह एक छात्र के निबंध की जांच करने वाले शिक्षक की तरह है: छात्र एक बेहतरीन पैराग्राफ (विवरण) लिखता है, और शिक्षक उसका उपयोग यह सुनिश्चित करने के लिए करता है कि पूरा अध्याय (बड़ी तस्वीर) अभी भी सही अर्थ रखता है या नहीं।

यह दो-तरफा ट्रैफिक यह सुनिश्चित करता है कि रोबोट पेड़ों को देखते समय जंगल को कभी न खोए, और जंगल की प्रशंसा करते समय पेड़ों को कभी न छोड़े।

उन्होंने इसे कैसे किया
टीम ने केवल अनुमान नहीं लगाया; उन्होंने इस सिस्टम को बनाया और 17 अलग-अलग बेंचमार्क (अलग-अलग टेस्ट सेट कहने का एक फैंसी तरीका) पर इसका परीक्षण किया।

  • विजुअल्स (दृश्य): उन्होंने छवियों को लिया और उन्हें विभिन्न आकारों में विभाजित किया, एक छोटे 1x1 डॉट (बहुत धुंधला, बड़ी तस्वीर) से लेकर एक शार्प 14x14 ग्रिड (सुपर विस्तृत) तक।
  • टेक्स्ट (पाठ): उन्होंने एक स्मार्ट लैंग्वेज मॉडल (जैसे एक बहुत उन्नत चैटबॉट) का उपयोग करके एक ही वाक्य को विवरण के विभिन्न स्तरों में फिर से लिखा। एक संस्करण कह सकता है "एक आदमी खिड़की साफ करता है," जबकि एक बारीक संस्करण कह सकता है "एक नीली शर्ट पहने आदमी एक ऊंची इमारत की खिड़की साफ करने के लिए सीढ़ी पर खड़ा है।"
  • कनेक्शन (जुड़ाव): उन्होंने इन विभिन्न स्तरों को एक विशेष "अटेंशन" मैकेनिज्म से जोड़ा। यह एक स्पॉटलाइट की तरह है जो रोबोट को छवि के सही हिस्से पर ध्यान केंद्रित करने में मदद करता है जो टेक्स्ट पर आधारित है, और इसके विपरीत भी, विवरण के हर स्तर पर।

उन्होंने क्या पाया
परिणाम प्रभावशाली थे। UPrompt ने केवल ठीक-ठाक प्रदर्शन नहीं किया; इसने कई क्षेत्रों में वर्तमान सर्वोत्तम तरीकों को पछाड़ दिया:

  • रिट्रीवल (वाक्य के लिए सही चित्र ढूंढना): MSCOCO डेटासेट पर, UPrompt ने पिछले सर्वश्रेष्ठ तरीके (MAMET) से 4.1 अंक अधिक और एक अन्य शीर्ष पद्धति (VPKE) से "rSum" नामक स्कोर में 7.3 अंक अधिक स्कोर किया।
  • जनरलाइजेशन (नई चीजें सीखना): जब अनदेखी श्रेणियों (बेस-टू-नोवेल जनरलाइजेशन) पर परीक्षण किया गया, तो UPrompt ने CoCoA-Mix की तुलना में प्रदर्शन में 5.09% का सुधार किया।
  • दक्षता (Efficiency): सबसे कूल हिस्सों में से एक यह है कि रोबोट "आलसी" हो सकता है यदि वह चाहे। क्योंकि सिस्टम विवरण के विभिन्न स्तरों को समझता है, इसलिए यह उत्तर स्पष्ट होने पर जल्दी रुकने का विकल्प चुन सकता है, जिससे ऊर्जा बचती है। शोधकर्ताओं ने पाया कि उनके मॉडल का एक "मीडियम" संस्करण अन्य शीर्ष मॉडलों के प्रदर्शन से मेल खाता है लेकिन इसने केवल 1/3 कंप्यूटिंग लागत का उपयोग किया।

यह क्यों मायने रखता है
यह पेपर सुझाव देता है कि सोचने का पुराना तरीका—"बड़ी तस्वीर" या "छोटे विवरण" के बीच चयन करना—एक बंद रास्ता है। सूचना को दोनों दिशाओं में प्रवाहित करने वाला सिस्टम बनाकर, UPrompt दिखाता है कि रोबोट बहुत अधिक स्मार्ट और लचीले हो सकते हैं। यह केवल अधिक देखने के बारे में नहीं है; यह समझने के बारे में है कि छोटे हिस्से बड़ी कहानी में कैसे फिट होते हैं।

शोधकर्ता सावधानीपूर्वक नोट करते हैं कि हालांकि यह एक बड़ी छलांग है, फिर भी सिस्टम की कुछ सीमाएं हैं। वे अभी भी विवरण के अनंत स्तरों को मॉडल नहीं कर सकते, और उनके "U-आकार" की गहराई वर्तमान में सीमित है। लेकिन फिलहाल, UPrompt हमारे डिजिटल दोस्तों को दोनों आँखें खुली रखकर दुनिया देखने में मदद करने का एक स्पष्ट, सिद्धांतवादी तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →