← नवीनतम पेपर
🤖 AI

TIMA: Text-Image Mutual Awareness for Balancing Zero-Shot Adversarial Robustness and Generalization Ability

यह शोध पत्र TIMA का प्रस्ताव करता है, जो एक नवीन ढांचा है जो लॉजिट मार्जिन को कैलिब्रेट करने के लिए अडैप्टिव सिमेंटिक-अवेयर मार्जिन के साथ टेक्स्ट-अवेयर इमेज ट्यूनिंग और सिमेंटिक निरंतरता बनाए रखने के लिए सिमेंटिक कंसिस्टेंट मिनिमम हाइपरस्फेरिकल एनर्जी के साथ इमेज-अवेयर टेक्स्ट ट्यूनिंग को पेश करके CLIP जैसे फाउंडेशन मॉडल्स में ज़ीरो-शॉट एडवरसेरियल रोबस्टनेस को बढ़ाते हुए सामान्यीकरण (जनरलाइजेशन) को बनाए रखता है।

मूल लेखक: Fengji Ma, Hei Victor Cheng, Chenxing Li, Li Liu

प्रकाशित 2026-08-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fengji Ma, Hei Victor Cheng, Chenxing Li, Li Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, फाउंडेशन मॉडल्स के रूप में जाने जाने वाले शक्तिशाली सिस्टमों का एक वर्ग मौजूद है। ये विशाल कंप्यूटर प्रोग्राम हैं जिन्हें छवियों और भाषा के बीच के संबंधों को समझने के लिए बड़ी मात्रा में डेटा पर प्रशिक्षित किया गया है। एक ऐसी प्रणाली की कल्पना करें जो उस पक्षी की तस्वीर देख सकती है जिसे उसने पहले कभी नहीं देखा है और केवल एक टेक्स्ट विवरण पढ़कर उसे सही ढंग से पहचान सकती है। बिना किसी विशिष्ट प्रशिक्षण के नई चीजों को पहचानने की इस क्षमता को 'जीरो-शॉट जनरलाइजेशन' (zero-shot generalization) कहा जाता है, और यह इन आधुनिक मॉडल्स की एक प्रमुख विशेषता है। हालाँकि, इन सिस्टमों में एक बड़ी कमजोरी है: वे अविश्वसनीय रूप से नाजुक होते हैं। यदि कोई व्यक्ति किसी तस्वीर में सूक्ष्म, लगभग अदृश्य बदलाव करता है—जैसे कि कुछ पिक्सेल का शोर जोड़ना जिसे मानवीय आँख नहीं देख सकती—तो मॉडल पूरी तरह से भ्रमित हो सकता है और छवि की गलत पहचान कर सकता है। इस भेद्यता को 'एडवर्सरियल फ्रैजिलिटी' (adversarial fragility) कहा जाता है। हालाँकि शोधकर्ताओं ने मॉडल्स को इन हमलों के प्रति अधिक प्रतिरोधी बनाने के तरीके खोजे हैं, लेकिन ऐसा करने की अक्सर एक कीमत चुकानी पड़ती है: मॉडल अपनी नई, अनदेखी चीजों को पहचानने की क्षमता खो देता है। वैज्ञानिकों के लिए मुख्य चुनौती एक ऐसा सिस्टम बनाना है जो इन सूक्ष्म हमलों का सामना करने के लिए पर्याप्त मजबूत भी हो और दुनिया के बारे में सीखने के लिए पर्याप्त लचीला भी हो।

शोधकर्ताओं की एक टीम ने इस विशिष्ट दुविधा को हल करने के उद्देश्य से काम शुरू किया, और उनका ध्यान 'क्लिप' (CLIP) नामक एक व्यापक रूप से उपयोग किए जाने वाले विजन-लैंग्वेज मॉडल पर केंद्रित किया। उन्होंने इस समस्या को ठीक करने के मौजूदा तरीकों का अवलोकन करते हुए शुरुआत की। पिछले दृष्टिकोणों ने मॉडल को अधिक मजबूत बनाने के लिए या तो छवियों को संसाधित करने के तरीके को बदलने का प्रयास किया या उनके द्वारा उपयोग किए जाने वाले टेक्स्ट विवरणों में बदलाव करने का प्रयास किया। शोधकर्ताओं ने पाया कि ये विधियाँ पहेली के एक महत्वपूर्ण हिस्से को छोड़ रही थीं। सावधानीपूर्वक अवलोकन के माध्यम से, उन्होंने पाया कि जब एक मॉडल पर छोटे बदलावों के साथ हमला किया जाता है, तो यह बड़े, अनदेखे बदलावों का सामना करने की तुलना में अलग तरह से व्यवहार करता है। विशेष रूप से, उन्होंने इन दो परिदृश्यों के बीच मॉडल के आत्मविश्वास के स्तर में एक निरंतर अंतर देखा। इसके अलावा, उन्होंने पाया कि मॉडल को उन चीजों के बीच अंतर करने में सबसे अधिक संघर्ष करना पड़ता था जो अर्थ संबंधी रूप से समान हैं, जैसे कि बिल्ली और कुत्ता, क्योंकि मौजूदा विधियाँ सभी अंतरों को समान मानती थीं। शायद सबसे महत्वपूर्ण बात यह थी कि उन्होंने महसूस किया कि मॉडल को अधिक मजबूत बनाने के लिए किए गए पिछले प्रयासों ने अनजाने में उन प्राकृतिक संबंधों को तोड़ दिया था जो मॉडल ने अपने प्रारंभिक प्रशिक्षण के दौरान सीखे थे। इन संबंधों को अस्त-व्यस्त करके, पुराने तरीकों ने मॉडल को नई चीजों को पहचानने में और भी खराब बना दिया।

इन समस्याओं के समाधान के लिए, शोधकर्ताओं ने एक नया ढांचा विकसित किया जिसे वे 'टेक्स्ट-इमेज म्यूचुअल अवेयरनेस' (Text-Image Mutual Awareness) कहते हैं। नाम इस मूल विचार को दर्शाता है: सिस्टम को टेक्स्ट और इमेज दोनों के प्रति एक साथ जागरूक होना चाहिए, और यह समझना चाहिए कि वे एक-दूसरे से कैसे संबंधित हैं। यह ढांचा दो अलग-अलग लेकिन जुड़े हुए प्रक्रियाओं के माध्यम से कार्य करता है। पहली प्रक्रिया इमेज पक्ष पर केंद्रित है। शोधकर्ताओं ने एक ऐसी विधि पेश की जो विभिन्न श्रेणियों की समानता के आधार पर मॉडल की निर्णय सीमाओं (decision boundaries) को समायोजित करती है। यदि दो श्रेणियां बहुत समान हैं, तो सिस्टम उनके बीच एक व्यापक सुरक्षा क्षेत्र बनाता है ताकि भ्रम से बचा जा सके। यदि वे बहुत भिन्न हैं, तो यह क्षेत्र छोटा हो सकता है। यह समायोजन स्थिर नहीं है; यह प्रत्येक विशिष्ट छवि के अनुसार अनुकूलित होता है, जो उन मामलों पर अतिरिक्त ध्यान देता है जहाँ मॉडल स्वाभाविक रूप से गलतियाँ करने के प्रति संवेदनशील होता है। यह मॉडल को तब भी सटीक बनाए रखने की अनुमति देता है जब छवियां बड़े, अनदेखे हमलों से विकृत होती हैं।

दूसरी प्रक्रिया टेक्स्ट पक्ष पर केंद्रित है। शोधकर्ताओं ने देखा कि टेक्स्ट विवरणों को अलग करने के लिए उन्हें बस दूर धकेलने से अक्सर उनके सूक्ष्म अर्थ नष्ट हो जाते थे। इसे ठीक करने के लिए, उन्होंने एक ऐसी विधि बनाई जो टेक्स्ट विवरणों को एक गणितीय स्थान में समान रूप से फैला देती है जबकि उनके मूल अर्थ संबंधी संबंधों को सख्ती से संरक्षित रखती है। यह सुनिश्चित करता है कि मॉडल भाषा की बारीकियों को समझने और नई अवधारणाओं को पहचानने की अपनी क्षमता बनाए रखे, भले ही वह हमलों के प्रति अधिक मजबूत हो जाए। इन दोनों समायोजनों को संतुलित करके, सिस्टम एक ऐसा सामंजस्य प्राप्त करता है जो पिछले तरीकों को नहीं मिल सका।

इस दृष्टिकोण के परिणामों का परीक्षण कारों और जानवरों की सरल तस्वीरों से लेकर जटिल दृश्यों और बनावटों तक, विभिन्न प्रकार के डेटासेट्स पर किया गया। शोधकर्ताओं ने पाया कि उनका नया ढांचा मौजूदा सर्वोत्तम विधियों से काफी बेहतर प्रदर्शन करता है। छोटे, लगभग अदृश्य हमलों का सामना करते समय, नया सिस्टम अपने प्रतिस्पर्धियों की तुलना में अधिक सटीक था। इससे भी अधिक प्रभावशाली बात यह है कि बहुत बड़े, अधिक स्पष्ट हमलों का सामना करते समय, जिन्हें अन्य सिस्टम संभालने में विफल रहे, नए ढांचे ने उच्च स्तर की सटीकता बनाए रखी। कुछ मामलों में, इसने पिछले तकनीकों की तुलना में मॉडल की मजबूती में दस प्रतिशत से अधिक का सुधार किया। महत्वपूर्ण रूप से, इस मजबूती में वृद्धि मॉडल की सामान्यीकरण (generalize) करने की क्षमता की कीमत पर नहीं हुई। सिस्टम नई, अनदेखी श्रेणियों को पहचानने में उतना ही अच्छा बना रहा जितना कि वह पहले था, जिससे वही गुण सुरक्षित रहा जो फाउंडेशन मॉडल्स को इतना मूल्यवान बनाता है।

सबसे आश्चर्यजनक निष्कर्षों में से एक यह था कि मॉडल ने इस नई मजबूती के संकेत तब भी दिखाए जब इसे केवल साफ, बिना दूषित छवियों पर प्रशिक्षित किया गया था। शोधकर्ताओं ने देखा कि जिस तरह से उन्होंने मॉडल के आंतरिक तर्क को समायोजित किया, उसने एक प्राकृतिक ढाल के रूप में कार्य किया, जिससे निर्णय सीमाएं स्वाभाविक रूप से कठिन बन गईं जिन्हें धोखा देना मुश्किल हो। यह सुझाव देता है कि सुधार केवल विशिष्ट हमले के पैटर्न के प्रति एक प्रतिक्रिया नहीं था, बल्कि मॉडल की संरचना का एक मौलिक सुदृढ़ीकरण था। अध्ययन यह निष्कर्ष निकालता है कि टेक्स्ट और इमेज के बीच के संबंध को सावधानीपूर्वक कैलिब्रेट करके, और अवधारणाओं के बीच प्राकृतिक अर्थ संबंधी संबंधों का सम्मान करके, एक ऐसा आर्टिफिशियल इंटेलिजेंस बनाया जा सकता है जो लचीला और अनुकूलनीय दोनों हो। यह कार्य ऐसे सिस्टम बनाने के लिए एक स्पष्ट मार्ग प्रदान करता है जो वास्तविक दुनिया में विश्वसनीय रूप से कार्य कर सकें, जहाँ इनपुट शायद ही कभी पूर्ण होते हैं और खतरे लगातार विकसित होते रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →