← नवीनतम पेपर
💻 computer science

Generalizing Vision-Language Models with Dedicated Prompt Guidance

यह शोध पत्र GuiDG का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो विजन एनकोडर फाइन-ट्यूनिंग को निर्देशित करने के लिए प्रॉम्प्ट-ट्यून्ड डोमेन विशेषज्ञों और क्रॉस-मोडल अटेंशन का लाभ उठाता है, जिससे विजन-लैंग्वेज मॉडल्स में डोमेन विशिष्टता और सामान्यीकरण के बीच के संतुलन को हल किया जा सके और नए निर्मित ImageNet-DG सहित बेंचमार्क पर अत्याधुनिक विधियों से बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान और सुशिक्षित छात्र (मान लीजिए उसका नाम CLIP है) को जानवरों की पहचान करने में विश्व स्तरीय विशेषज्ञ बनाने के लिए प्रशिक्षित कर रहे हैं।

समस्या: "सब कुछ जानने का दिखावा" (The "Jack of All Trades" Trap)

वर्तमान में, यदि आप CLIP को जानवरों को पहचानने के लिए सिखाना चाहते हैं, तो आप उसे विभिन्न स्थानों से हजारों तस्वीरें दिखाते हैं: जैसे लंदन का एक चिड़ियाघर, ब्राजील का एक जंगल, और कंसास का एक फार्म। फिर आप उससे उन सभी तस्वीरों का एक साथ अध्ययन करने और एक एकल, पूर्ण विशेषज्ञ बनने के लिए कहते हैं।

यह शोध पत्र तर्क देता है कि इस दृष्टिकोण में एक दोष है। जब CLIP एक ही समय में सब कुछ जानने की कोशिश करता है, तो वह भ्रमित हो जाता है। वह एक ऐसा "मध्य मार्ग" सीख लेता है जो चिड़ियाघर और फार्म दोनों के लिए ठीक-ठाक काम करता है, लेकिन जब आप उसे किसी ऐसी नई जगह ले जाते हैं जिसे उसने पहले कभी नहीं देखा (जैसे कि एक गुप्त भूमिगत बंकर), तो वह विफल हो जाता है। वह उन चीजों का "औसत" बनने में बहुत अधिक विशेषज्ञ हो जाता है जो उसने देखी थीं, इसलिए वह नई जगह की विचित्रता के अनुकूल नहीं हो पाता।

समाधान: "विशेषज्ञों की टीम" (GuiDG)

एक ऐसे छात्र को सब कुछ सिखाने के बजाय, जो हर चीज़ का सामान्य ज्ञान रखता हो, लेखक एक नई रणनीति प्रस्तावित करते हैं जिसे GuiDG कहा जाता है। इसे एक सामान्य विशेषज्ञ के बजाय एक विशेषज्ञों की टीम को काम पर रखने के रूप में समझें।

यह इस प्रकार काम करता है, चरण-दर-चरण:

चरण 1: विशेषज्ञों को काम पर रखना (The "Domain Experts")

CLIP को पूरी दुनिया का एक साथ अध्ययन करने देने के बजाय, आप तस्वीरों को इस आधार पर समूहों में विभाजित करते हैं कि वे कहाँ से आई हैं।

  • विशेषज्ञ A केवल चिड़ियाघर की तस्वीरों का अध्ययन करता है।
  • विशेषज्ञ B केवल जंगल की तस्वीरों का अध्ययन करता है।
  • विशेषज्ञ C केवल फार्म की तस्वीरों का अध्ययन करता है।

तकनीकी शब्दों में, यह शोध पत्र "प्रॉम्प्ट ट्यूनिंग" (prompt tuning) का उपयोग करता है। कल्पना कीजिए कि आप प्रत्येक विशेषज्ञ को एक विशेष जादुई नोटबुक (एक प्रॉम्प्ट) दे रहे हैं जो उन्हें केवल उनके विशिष्ट प्रकार की फोटो पर ध्यान केंद्रित करने में मदद करती है। उन्हें अपने पूरे मस्तिष्क को फिर से लिखने की आवश्यकता नहीं है; उन्हें बस अपनी सोचने की प्रक्रिया में एक छोटा, कुशल नोट जोड़ना है। यह उन्हें उनकी विशिष्ट नौकरी में अविश्वसनीय रूप से कुशल बनाता है बिना अभिभूत हुए।

चरण 2: स्मार्ट मैनेजर (The "Cross-Modal Attention")

अब, आपके पास ये तीन प्रतिभाशाली विशेषज्ञ हैं, लेकिन आपको अभी भी एक नई जगह के बारे में जवाब देना है जिसे आपने पहले कभी नहीं देखा है (Target Domain)।

यहाँ मैनेजर (Cross-Modal Attention मॉड्यूल) आता है।

  • जब एक नई फोटो आती है, तो मैनेजर उसे देखता है।
  • मैनेजर पूछता है: "क्या यह चिड़ियाघर, जंगल या फार्म जैसा दिखता है?"
  • यदि फोटो जंगल के दृश्य जैसी दिखती है, तो मैनेजर कहता है, "विशेषज्ञ B की बात ध्यान से सुनो!" और उनके मत को भारी महत्व (weight) देता है।
  • यदि फोटो फार्म जैसी दिखती है, तो मैनेजर कहता है, "विशेषज्ञ B को अनदेखा करें, विशेषज्ञ C की बात सुनें!"

मैनेजर केवल सभी के उत्तरों का औसत नहीं निकालता। यह गतिशील रूप से तय करता है कि सामने मौजूद विशिष्ट तस्वीर के आधार पर किस पर भरोसा करना है

यह बेहतर क्यों है?

इसे एक जूरी बनाम एक अकेले न्यायाधीश के रूप में सोचें।

  • पुराना तरीका (यूनिवर्सल मॉडल): एक न्यायाधीश हर देश के लिए हर कानून को याद रखने की कोशिश करता है। वे भ्रमित हो जाते हैं और नए, अजीब कानून आने पर गलतियाँ करते हैं।
  • GuiDG का तरीका: आपके पास विशेषज्ञों की एक टीम है, जिनमें से प्रत्येक एक विशिष्ट देश के कानूनों का विशेषज्ञ है। जब कोई नया मामला आता है, तो आप टीम से पूछते हैं, "यह मामला किस देश के कानूनों से मिलता-जुलता है?" और आप उस विशिष्ट विशेषज्ञ को निर्णय लेने के लिए आगे आने देते हैं।

परिणाम

लेखकों ने इसे एक विशाल नए परीक्षण पर परखा जिसे उन्होंने ImageNet-DG (एक कठिन, वास्तविक दुनिया की तस्वीरों का विशाल संग्रह) कहा है।

  • पुराने तरीके संघर्ष करते थे जब तस्वीरें अजीब होती थीं या किसी नए स्टाइल से आती थीं।
  • GuiDG ने अपना धैर्य बनाए रखा। क्योंकि इसके पास विशेषज्ञों की एक टीम और एक स्मार्ट मैनेजर था जो सही विशेषज्ञ को चुन सकता था, इसने नई, अनदेखी स्थितियों को बहुत बेहतर ढंग से संभाला।

सबसे अच्छी बात: यह कुशल है

आप सोच सकते हैं, "तीन विशेषज्ञों को काम पर रखना महंगा होगा!"
आश्चर्यजनक रूप से, नहीं। "जादुई नोटबुक" (प्रॉम्प्ट्स) बहुत छोटी हैं। वे कंप्यूटर के मस्तिष्क के कार्यभार में 1% से भी कम अतिरिक्त काम जोड़ते हैं। यह विशेषज्ञों की एक टीम को काम करने के लिए केवल एक स्टिकी नोट लिखने के लिए नियुक्त करने जैसा है, न कि पूरी विश्वकोश को फिर से लिखने के लिए।

संक्षेप में

GuiDG एक ही AI को सब कुछ में मास्टर बनने के लिए मजबूर करना बंद करता है। इसके बजाय, यह केंद्रित विशेषज्ञों की एक टीम और एक स्मार्ट मैनेजर बनाता है जो जानता है कि किसी भी स्थिति के लिए किस विशेषज्ञ की बात सुननी है। यह AI को स्मार्टर, अधिक अनुकूलनीय और चलाने में आश्चर्यजनक रूप से सस्ता बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →