← नवीनतम पेपर
💻 computer science

Conservative Proxy Prompting for Reliable Frozen Vision–Language Models with Missing Modalities

यह शोध पत्र कंजर्वेटिव प्रॉक्सी प्रॉम्प्टिंग (CPP) का प्रस्ताव करता है, जो एक पैरामीटर-कुशल ढांचा है जो फीचर-स्पेस प्रॉक्सी रिप्रेजेंटेशन का निर्माण करके और भ्रामक संकेतों से बचने के लिए उनके योगदान को रूढ़िवादी रूप से विनियमित करके लुप्त मोडैलिटीज के तहत फ्रोजन विजन-लैंग्वेज मॉडल्स की विश्वसनीयता को बढ़ाता है।

मूल लेखक: Xiaoyong Mei, Wei Ji, Jiale Dong, Chao Duan, Mingyan Zhang, Fudan Zheng

प्रकाशित 2026-09-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoyong Mei, Wei Ji, Jiale Dong, Chao Duan, Mingyan Zhang, Fudan Zheng

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, विजन-लैंग्वेज मॉडल्स (vision-language models) के रूप में जानी जाने वाली प्रणालियों का एक बढ़ता हुआ वर्ग है। ये डिजिटल मस्तिष्क हैं जिन्हें चित्रों को देखने और टेक्स्ट को एक साथ पढ़ने के माध्यम से दुनिया को समझने के लिए प्रशिक्षित किया गया है, जिससे वे सीखते हैं कि चित्र और शब्द एक-दूसरे से कैसे संबंधित हैं। वे किसी फोटो का वर्णन करने या किसी दृश्य के बारे में प्रश्न पूछने जैसे कार्यों में उल्लेखनीय रूप से कुशल हो गए हैं, मुख्य रूप से इसलिए क्योंकि उन्हें जोड़े गए चित्रों और टेक्स्ट के विशाल संग्रहों पर प्रशिक्षित किया गया है। हालाँकि, ये प्रणालियाँ एक नाजुक धारणा पर टिकी हैं: कि उन्हें हमेशा चित्र और विवरण दोनों एक ही समय में प्राप्त होंगे। वास्तविक दुनिया की अव्यवस्थित वास्तविकता में, ऐसा होना शायद ही कभी सुनिश्चित होता है। सेंसर विफल हो जाते हैं, डेटा ट्रांसमिशन के दौरान खो जाता है, और गोपनीयता फिल्टर विवरण को हटा सकते हैं, जिससे सिस्टम के पास केवल आधा सूचना वाला हिस्सा बचता है जिसकी उसे अपेक्षा थी। जब एक मॉडल जिसे पूर्ण जोड़ों पर प्रशिक्षित किया गया है, अचानक केवल एक हिस्से के साथ अनुमान लगाने के लिए मजबूर किया जाता है, तो उसका आत्मविश्वास अक्सर टूट जाता है, और उसके उत्तर अविश्वसनीय हो जाते हैं। शोधकर्ताओं के लिए चुनौती केवल मॉडल को यह अनुमान लगाने में मदद करना नहीं है कि क्या गायब है, बल्कि उसे यह सिखाना भी है कि वह जो वास्तव में देख रहा है और जो वह केवल अनुमान लगा रहा है, उसके बीच के अंतर को पहचान सके।

झेजियांग नॉर्मल यूनिवर्सिटी और सन यत-सेन यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए एक नई विधि विकसित की है, जिसे 'कंजर्वेटिव प्रॉक्सी प्रॉम्प्टिंग' (Conservative Proxy Prompting) कहा जाता है। उनका दृष्टिकोण आर्टिफिशियल इंटेलिजेंस के बारे में एक मौलिक सत्य को स्वीकार करता है: कि जब किसी मॉडल को जो वह देख सकता है उसके आधार पर गायब जानकारी के टुकड़े का अनुमान लगाना पड़ता है, तो वह अनुमान स्वाभाविक रूप से अनिश्चित होता है। कल्पना कीजिए कि एक व्यक्ति रेस्तरां में एक व्यंजन को पहचानने की कोशिश कर रहा है। यदि वे भोजन देख सकते हैं और मेनू पढ़ सकते हैं, तो वे निश्चित हैं। यदि मेनू गायब है, तो वे भोजन को देखकर नाम का अनुमान लगा सकते हैं, लेकिन उन्हें अपने उत्तर के बारे में थोड़ा अनिश्चित रहना चाहिए। मौजूदा तरीके अक्सर गायब जानकारी को इस तरह से पुनर्गठित करने की कोशिश करते हैं जैसे कि वह वास्तविक हो, प्रभावी रूप से एक अनुमान को सीधे अवलोकन के समान महत्व देते हैं। शोधकर्ता तर्क देते हैं कि यह खतरनाक है क्योंकि पुनर्गठित डेटा केवल एक अनुमान है, और इसे तथ्य मानना सिस्टम को गुमराह कर सकता है। इसके बजाय, उनका नया ढांचा इन अनुमानों को "प्रॉक्सी" साक्ष्य के रूप में मानता है—जो उपयोगी तो हैं, लेकिन सावधानीपूर्वक उपयोग की आवश्यकता है।

उनके समाधान का मूल एक दो-चरणीय रणनीति में निहित है जो मौजूदा, शक्तिशाली AI मॉडलों के साथ काम करती है बिना उन्हें शुरू से फिर से प्रशिक्षित किए। सबसे पहले, सिस्टम 'प्रॉम्प्ट लर्निंग' नामक तकनीक का उपयोग करता है ताकि मॉडल की समझ को विशिष्ट कार्य की ओर धीरे से निर्देशित किया जा सके, जैसे कि मूवी जॉनर या खाद्य प्रकारों की पहचान करना, जिसमें केवल कुछ ही समायोज्य सेटिंग्स का उपयोग किया जाता है। यह मॉडल को उसके पूरे मस्तिष्क को बदले बिना विशिष्ट कार्य के लिए तेज और तैयार रहने देता है। दूसरा, और सबसे महत्वपूर्ण, सिस्टम गायब डेटा को संभालने के लिए एक तंत्र पेश करता है। जब एक चित्र गायब होता है, तो सिस्टम टेक्स्ट का उपयोग करके एक रफ स्केच बनाता है कि चित्र कैसा दिख सकता है। जब टेक्स्ट गायब होता है, तो वह चित्र का उपयोग शब्दों का अनुमान लगाने के लिए करता है। लेकिन यहाँ महत्वपूर्ण अंतर यह है: इससे पहले कि इस अनुमानित जानकारी को वास्तविक डेटा के साथ मिलाया जाए, सिस्टम जानबूझकर इसके प्रभाव को कम कर देता है। यह एक "कंजर्वेटिव" (रूढ़िवादी/संयमित) फिल्टर लागू करता है, जो अनुमान के वजन को कम करता है ताकि वह प्रत्यक्ष साक्ष्य पर हावी हुए बिना निर्णय का समर्थन कर सके। यह सुनिश्चित करता है कि यदि अनुमान गलत है, तो वह अंतिम उत्तर को नीचे नहीं खींच पाएगा।

इस विचार का परीक्षण करने के लिए, शोधकर्ताओं ने अपने तरीके को तीन बहुत अलग वास्तविक दुनिया के डेटासेट्स पर परखा। उन्होंने मूवी पोस्टर्स और प्लॉट सारांशों का एक संग्रह, रेसिपी के साथ खाद्य छवियों का एक विशाल सेट, और इंटरनेट मीम्स का एक चुनौतीपूर्ण सेट इस्तेमाल किया जिसे यह जांचने के लिए बनाया गया था कि क्या सिस्टम नफरत भरे भाषण (hate speech) को पकड़ सकता है। प्रत्येक मामले में, उन्होंने डेटा से चित्र या टेक्स्ट को बेतरतीब ढंग से हटाकर वास्तविक दुनिया की विफलताओं का अनुकरण किया, कभी-कभी नमूनों में से नब्बे प्रतिशत तक जानकारी हटा दी गई। परिणाम स्पष्ट थे: नया तरीका उन अन्य दृष्टिकोणों से लगातार बेहतर प्रदर्शन करता है जो केवल गायब डेटा को पुनर्गठित करने की कोशिश करते हैं। अपने अनुमानों के प्रभाव को नियंत्रण में रखकर, सिस्टम ने उच्च सटीकता बनाए रखी, भले ही उसके पास अधिकांश जानकारी गायब थी। इसने साबित कर दिया कि एक मॉडल को विश्वसनीय होने के लिए अनुमान लगाने में पूर्ण होने की आवश्यकता नहीं है; उसे बस यह जानने की आवश्यकता है कि उसे अपने स्वयं के अनुमानों पर कितना भरोसा करना चाहिए।

अध्ययन ने यह भी खुलासा किया कि यह विश्वसनीयता भारी लागत के बिना आती है। नए तरीके को इन परिणामों को प्राप्त करने के लिए केवल बहुत कम समायोज्य पैरामीटर—लगभग 1.6 से 2.7 मिलियन के बीच—की आवश्यकता थी। इसकी तुलना में, अन्य तरीके जो समान मजबूती हासिल करने की कोशिश करते थे, उन्हें लगभग तीन गुना अधिक समायोज्य सेटिंग्स की आवश्यकता थी। यह दक्षता महत्वपूर्ण है क्योंकि इसका अर्थ है कि सिस्टम को नए कार्यों के लिए जल्दी से अनुकूलित किया जा सकता है और आसानी से संग्रहीत किया जा सकता है, बिना भारी कंप्यूटिंग शक्ति की आवश्यकता के। शोधकर्ताओं ने पाया कि "नज" (नज/प्रेरणा) सेटिंग्स की विशिष्ट संख्या मायने रखती थी, लेकिन हर स्थिति के लिए कोई एक जादुई नंबर नहीं था जो काम करे; एक मध्यम मात्रा में समायोजन आम तौर पर सबसे उपयुक्त (sweet spot) था। इसके अलावा, सिस्टम ने दिखाया कि वह उन स्थितियों को भी संभाल सकता है जिन्हें उसने पहले कभी नहीं देखा था। यहाँ तक कि जब इसे केवल पूर्ण डेटा पर प्रशिक्षित किया गया और फिर गायब डेटा पर परीक्षण किया गया, तो इसने अच्छी तरह से अनुकूलन किया, जो यह सुझाव देता है कि अनुमानों के साथ सावधान रहने का सिद्धांत विशिष्ट प्रशिक्षण उदाहरणों से परे सामान्यीकृत होता है।

अंततः, यह कार्य गायब जानकारी को पूरी तरह से पुन: निर्मित करने के बजाय अनिश्चितता के प्रबंधन पर ध्यान केंद्रित करता है। शोधकर्ताओं ने प्रदर्शित किया कि वास्तविक दुनिया में जहाँ डेटा अक्सर अधूरा होता है, सबसे विश्वसनीय AI सिस्टम वे नहीं हैं जो हर कमी को भरने की कोशिश करते हैं, बल्कि वे हैं जो अपने ज्ञान की सीमाओं को समझते हैं। अनुमानित जानकारी को प्रत्यक्ष अवलोकन के समान भागीदार के बजाय एक सहायक लेकिन माध्यमिक आवाज के रूप में मानकर, सिस्टम अधिक स्थिर और भरोसेमंद बन जाता है। यह दृष्टिकोण वास्तविक दुनिया में बुद्धिमान प्रणालियों को तैनात करने के लिए एक व्यावहारिक मार्ग प्रदान करता है, जहाँ सेंसर टूट जाते हैं और डेटा खो जाता है, यह सुनिश्चित करता है कि ये उपकरण तब भी उपयोगी बने रहें जब वे पूरी तस्वीर नहीं देख पा रहे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →