← नवीनतम पेपर
🤖 machine learning

Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts

यह शोध पत्र विज़ुअल एडेप्टिव प्रॉम्प्ट ट्यूनिंग (VAPT) का प्रस्ताव करता है, जो पैरामीटर-कुशल विज़न मॉडल ट्यूनिंग की अनुकूलन क्षमता और प्रदर्शन में सुधार करने के लिए एक मिक्सचर-ऑफ़-एक्सपर्ट्स फ्रेमवर्क के भीतर प्रॉम्प्ट विशेषज्ञों की कार्यात्मक अभिव्यक्ति क्षमता को बढ़ाता है।

मूल लेखक: Minh Le, Anh Nguyen, Huy Nguyen, Chau Nguyen, Anh Tran, Nhat Ho

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Minh Le, Anh Nguyen, Huy Nguyen, Chau Nguyen, Anh Tran, Nhat Ho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विश्व स्तरीय पेशेवर शेफ है (यह Pre-trained Vision Model है) जो लगभग सब कुछ बनाना जानता है।

अब, कल्पना कीजिए कि आप चाहते हैं कि यह शेफ एक बहुत ही विशिष्ट, विशेष व्यंजन में विशेषज्ञता हासिल करे—मान लीजिए, "थाईलैंड के एक विशिष्ट गाँव का स्ट्रीट फूड।"

पुराना तरीका: विजुअल प्रॉम्प्ट ट्यूनिंग (VPT)

पुराने तरीके (VPT) में, शेफ को फिर से प्रशिक्षित करने के बजाय, आप उन्हें बस एक स्थिर रेसिपी कार्ड (प्रॉम्प्ट) थमा देते हैं। यह कार्ड कहता है: "अधिक नींबू का उपयोग करें, अधिक मिर्च का उपयोग करें, और अधिक फिश सॉस का उपयोग करें।"

शेफ कार्ड पढ़ता है और हर उस व्यंजन को बनाने की कोशिश करता है जो वह बनाता है जिसमें इन निर्देशों को लागू करना होता है। लेकिन एक समस्या है: एक तीखे सूप को तीखे स्टिर-फ्राई की तुलना में अधिक नींबू की आवश्यकता होती है। क्योंकि रेसिपी कार्ड स्थिर (Static) है (यह कभी बदलता नहीं है), शेफ अनुकूलित नहीं हो सकता। वह उसी "सामान्य" तीखेपन के नियम का पालन करने में फंसा हुआ है, जिससे परिणाम औसत दर्जे के आते हैं।

नया तरीका: विजुअल एडेप्टिव प्रॉम्प्ट ट्यूनिंग (VAPT)

शोधकर्ताओं ने एक स्मार्ट सिस्टम बनाया जिसे VAPT कहा जाता है।

एक स्थिर रेसिपी कार्ड देने के बजाय, उन्होंने शेफ को एक "स्मार्ट सू-शेफ" (एडेप्टिव प्रॉम्प्ट) दिया। यह सू-शेफ केवल एक कार्ड नहीं पकड़ता; वह हर एक व्यंजन से पहले काउंटर पर रखे सामग्री को देखता है

यदि सू-शेफ कॉकटेल मिल्क (नारियल के दूध) का ढेर देखता है, तो वह शेफ के कान में फुसफुसाता है: "हे, इस बार हमें वसा (fat) को काटने के लिए अतिरिक्त नींबू की आवश्यकता है।" यदि वह सूखे नूडल्स का ढेर देखता है, तो वह फुसफुसाता है: "इसे नम रखने के लिए अधिक फिश सॉस डालें।"

क्योंकि निर्देश अब इनपुट-निर्भर (Input-dependent) हैं (वे इस आधार पर बदलते हैं कि शेफ क्या देख रहा है), शेफ अविश्वसनीय रूप से सटीक हो सकता है। वह केवल "मसाला डाल" नहीं रहा है; वह "इस विशिष्ट सामग्री के लिए मसाले की सटीक सही मात्रा" डाल रहा है।


यह तकनीकी रूप से कैसे काम करता है? ("सू-शेफ" मैकेनिक्स)

शोधकर्ताओं ने इस "सू-शेफ" को यह कार्य करने के लिए तीन चतुर तरीकों का उपयोग किया ताकि रसोई बहुत भीड़भाड़ वाली या महंगी न हो जाए:

  1. ग्लोबल व्यू (टोकन-वाइज प्रोजेक्टर्स): सू-शेफ केवल चावल के एक दाने को नहीं देखता; वह सामग्री के "वाइब" को समझने के लिए पूरी मेज को देखता है।
  2. पड़ोस की निगरानी (चैनल-वाज़ कन्वोल्यूशन): सू-शेफ यह ध्यान देता है कि सामग्रियां अपने पड़ोसियों के साथ कैसे संबंधित हैं (जैसे, "मिर्च नींबू के ठीक बगल में बैठी है, तो चलिए उन्हें संतुलित करते हैं")।
  3. दक्षता विशेषज्ञ (शेयर्ड फीचर प्रोजेक्टर): प्रक्रिया को तेज़ रखने के लिए, सू-शेफ सभी अलग-अलग व्यंजनों को प्रोसेस करने के लिए एक ही "मस्तिष्क" का उपयोग करता है, न कि हर एक रेसिपी के लिए एक नया मस्तिष्क। यह सुनिश्चित करता है कि "अतिरिक्त लागत" (पैरामीटर्स और कंप्यूटिंग पावर) अविश्वसनीय रूप से कम रहे—लगभग अदृश्य।

यह क्यों मायने रखता है? (परिणाम)

शोधकर्ताओं ने इस "स्मार्ट सू-शेफ" का परीक्षण कई कठिन "कुकिंग टेस्टों" (VTAB-1K और FGVC जैसे डेटासेट) पर किया। परिणाम प्रभावशाली थे:

  • बेहतर स्वाद: इसने पुराने तरीके को काफी पीछे छोड़ दिया, यहाँ तक कि उन मॉडलों को भी मात दी जो "पूरी तरह से पुन: प्रशिक्षित" (जो कि पूरे शेफ को शुरू से फिर से प्रशिक्षित करने जैसा है) किए गए थे।
  • तेजी से सीखना: "लो-डेटा" स्थितियों में (जहाँ आपके पास अभ्यास करने के लिए केवल कुछ ही सामग्रियां हैं), VAPT विधि ने बहुत तेजी से सीखा। जबकि पुराना तरीका अभी भी व्यंजन को समझने के लिए संघर्ष कर रहा था, V-APT विधि पहले से ही स्वादिष्ट भोजन बना रही थी।
  • हल्का (Lightweight): इसने रसोई को धीमा या महंगा नहीं बनाया। इसने प्रक्रिया में लगभग शून्य "अतिरिक्त काम" (FLOPs) जोड़ा।

सारांश

VPT एक मास्टर को निश्चित निर्देशों देने जैसा था।
VAPT एक मास्टर को बुद्धिमान, प्रतिक्रियाशील निर्देशों के सेट को देने जैसा है जो उनके द्वारा देखी जाने वाली चीजों के आधार पर बदलते हैं। यह AI को बहुत अधिक लचीला, बहुत अधिक स्मार्ट और नए कार्यों को सीखने में बहुत अधिक कुशल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →