Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts
यह शोध पत्र विज़ुअल एडेप्टिव प्रॉम्प्ट ट्यूनिंग (VAPT) का प्रस्ताव करता है, जो पैरामीटर-कुशल विज़न मॉडल ट्यूनिंग की अनुकूलन क्षमता और प्रदर्शन में सुधार करने के लिए एक मिक्सचर-ऑफ़-एक्सपर्ट्स फ्रेमवर्क के भीतर प्रॉम्प्ट विशेषज्ञों की कार्यात्मक अभिव्यक्ति क्षमता को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विश्व स्तरीय पेशेवर शेफ है (यह Pre-trained Vision Model है) जो लगभग सब कुछ बनाना जानता है।
अब, कल्पना कीजिए कि आप चाहते हैं कि यह शेफ एक बहुत ही विशिष्ट, विशेष व्यंजन में विशेषज्ञता हासिल करे—मान लीजिए, "थाईलैंड के एक विशिष्ट गाँव का स्ट्रीट फूड।"
पुराना तरीका: विजुअल प्रॉम्प्ट ट्यूनिंग (VPT)
पुराने तरीके (VPT) में, शेफ को फिर से प्रशिक्षित करने के बजाय, आप उन्हें बस एक स्थिर रेसिपी कार्ड (प्रॉम्प्ट) थमा देते हैं। यह कार्ड कहता है: "अधिक नींबू का उपयोग करें, अधिक मिर्च का उपयोग करें, और अधिक फिश सॉस का उपयोग करें।"
शेफ कार्ड पढ़ता है और हर उस व्यंजन को बनाने की कोशिश करता है जो वह बनाता है जिसमें इन निर्देशों को लागू करना होता है। लेकिन एक समस्या है: एक तीखे सूप को तीखे स्टिर-फ्राई की तुलना में अधिक नींबू की आवश्यकता होती है। क्योंकि रेसिपी कार्ड स्थिर (Static) है (यह कभी बदलता नहीं है), शेफ अनुकूलित नहीं हो सकता। वह उसी "सामान्य" तीखेपन के नियम का पालन करने में फंसा हुआ है, जिससे परिणाम औसत दर्जे के आते हैं।
नया तरीका: विजुअल एडेप्टिव प्रॉम्प्ट ट्यूनिंग (VAPT)
शोधकर्ताओं ने एक स्मार्ट सिस्टम बनाया जिसे VAPT कहा जाता है।
एक स्थिर रेसिपी कार्ड देने के बजाय, उन्होंने शेफ को एक "स्मार्ट सू-शेफ" (एडेप्टिव प्रॉम्प्ट) दिया। यह सू-शेफ केवल एक कार्ड नहीं पकड़ता; वह हर एक व्यंजन से पहले काउंटर पर रखे सामग्री को देखता है।
यदि सू-शेफ कॉकटेल मिल्क (नारियल के दूध) का ढेर देखता है, तो वह शेफ के कान में फुसफुसाता है: "हे, इस बार हमें वसा (fat) को काटने के लिए अतिरिक्त नींबू की आवश्यकता है।" यदि वह सूखे नूडल्स का ढेर देखता है, तो वह फुसफुसाता है: "इसे नम रखने के लिए अधिक फिश सॉस डालें।"
क्योंकि निर्देश अब इनपुट-निर्भर (Input-dependent) हैं (वे इस आधार पर बदलते हैं कि शेफ क्या देख रहा है), शेफ अविश्वसनीय रूप से सटीक हो सकता है। वह केवल "मसाला डाल" नहीं रहा है; वह "इस विशिष्ट सामग्री के लिए मसाले की सटीक सही मात्रा" डाल रहा है।
यह तकनीकी रूप से कैसे काम करता है? ("सू-शेफ" मैकेनिक्स)
शोधकर्ताओं ने इस "सू-शेफ" को यह कार्य करने के लिए तीन चतुर तरीकों का उपयोग किया ताकि रसोई बहुत भीड़भाड़ वाली या महंगी न हो जाए:
- ग्लोबल व्यू (टोकन-वाइज प्रोजेक्टर्स): सू-शेफ केवल चावल के एक दाने को नहीं देखता; वह सामग्री के "वाइब" को समझने के लिए पूरी मेज को देखता है।
- पड़ोस की निगरानी (चैनल-वाज़ कन्वोल्यूशन): सू-शेफ यह ध्यान देता है कि सामग्रियां अपने पड़ोसियों के साथ कैसे संबंधित हैं (जैसे, "मिर्च नींबू के ठीक बगल में बैठी है, तो चलिए उन्हें संतुलित करते हैं")।
- दक्षता विशेषज्ञ (शेयर्ड फीचर प्रोजेक्टर): प्रक्रिया को तेज़ रखने के लिए, सू-शेफ सभी अलग-अलग व्यंजनों को प्रोसेस करने के लिए एक ही "मस्तिष्क" का उपयोग करता है, न कि हर एक रेसिपी के लिए एक नया मस्तिष्क। यह सुनिश्चित करता है कि "अतिरिक्त लागत" (पैरामीटर्स और कंप्यूटिंग पावर) अविश्वसनीय रूप से कम रहे—लगभग अदृश्य।
यह क्यों मायने रखता है? (परिणाम)
शोधकर्ताओं ने इस "स्मार्ट सू-शेफ" का परीक्षण कई कठिन "कुकिंग टेस्टों" (VTAB-1K और FGVC जैसे डेटासेट) पर किया। परिणाम प्रभावशाली थे:
- बेहतर स्वाद: इसने पुराने तरीके को काफी पीछे छोड़ दिया, यहाँ तक कि उन मॉडलों को भी मात दी जो "पूरी तरह से पुन: प्रशिक्षित" (जो कि पूरे शेफ को शुरू से फिर से प्रशिक्षित करने जैसा है) किए गए थे।
- तेजी से सीखना: "लो-डेटा" स्थितियों में (जहाँ आपके पास अभ्यास करने के लिए केवल कुछ ही सामग्रियां हैं), VAPT विधि ने बहुत तेजी से सीखा। जबकि पुराना तरीका अभी भी व्यंजन को समझने के लिए संघर्ष कर रहा था, V-APT विधि पहले से ही स्वादिष्ट भोजन बना रही थी।
- हल्का (Lightweight): इसने रसोई को धीमा या महंगा नहीं बनाया। इसने प्रक्रिया में लगभग शून्य "अतिरिक्त काम" (FLOPs) जोड़ा।
सारांश
VPT एक मास्टर को निश्चित निर्देशों देने जैसा था।
VAPT एक मास्टर को बुद्धिमान, प्रतिक्रियाशील निर्देशों के सेट को देने जैसा है जो उनके द्वारा देखी जाने वाली चीजों के आधार पर बदलते हैं। यह AI को बहुत अधिक लचीला, बहुत अधिक स्मार्ट और नए कार्यों को सीखने में बहुत अधिक कुशल बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।