← नवीनतम पेपर
💻 computer science

Improving Adversarial Robustness of Zero-Shot CLIP with Confidence-Aware Weighting

यह शोध पत्र कॉन्फिडेंस-अवेयर वेटिंग (CAW) का प्रस्ताव करता है, जो एक नवीन विधि है जो एक कॉन्फिडेंस-अवेयर लॉस के माध्यम से अनिश्चित नमूनों को प्राथमिकता देकर और फीचर अलाइनमेंट के माध्यम से सिमेंटिक निरंतरता को बनाए रखकर ज़ीरो-शॉट CLIP मॉडल्स की एडवरसैरियल मजबूती (adversarial robustness) को बढ़ाती है, जिससे यह मजबूती और मेमोरी दक्षता दोनों में अत्याधुनिक दृष्टिकोणों से बेहतर प्रदर्शन करती है।

मूल लेखक: Nikoo Naghavian, Mostafa Tavassolipour

प्रकाशित 2026-07-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nikoo Naghavian, Mostafa Tavassolipour

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया जहाँ कंप्यूटर एक ही समय में "देख" और "पढ़" सकते हैं, इंटरनेट से सीख रहे हैं कि एक गोल्डन रिट्रीवर की तस्वीर "एक खुश कुत्ते" शब्दों से मेल खाती है। यह विजन-लैंग्वेज मॉडल्स (Vision-Language Models) का जादू है, जैसे कि प्रसिद्ध CLIP। वे उन अत्यंत बुद्धिमान छात्रों की तरह हैं जिन्होंने ऑनलाइन मौजूद हर किताब पढ़ी है और हर फोटो देखी है, जिससे वे किसी तस्वीर में क्या है, इसका अनुमान लगा सकते हैं, भले ही उन्होंने उस विशिष्ट प्रकार के जानवर को पहले कभी न देखा हो। हालाँकि, ठीक वैसे ही जैसे एक इंसान को किसी चतुर ऑप्टिकल इल्यूजन (दृष्टि भ्रम) द्वारा धोखा दिया जा सकता है, इन AI मॉडल्स की एक गुप्त कमजोरी भी होती है। यदि आप किसी छवि में थोड़ी सी, अदृश्य मात्रा में "शोर" (noise) जोड़ देते हैं—जैसे कि डिजिटल रेत के कुछ कण छिड़क देना जिसे मानवीय आँख नहीं देख सकती—तो कंप्यूटर अचानक पूरी तरह से भ्रमित हो सकता है, यह सोचकर कि एक बिल्ली वास्तव में एक टोस्टर है। इसे "एडवर्सरियल अटैक" (adversarial attack) कहा जाता है, और यह एक बड़ी समस्या है क्योंकि इसका मतलब है कि ये शक्तिशाली उपकरण वास्तविक दुनिया की स्थितियों में आसानी से मूर्ख बनाए जा सकते हैं।

वैज्ञानिकों के सामने बड़ा सवाल यह है: हम इन मॉडल्स को जो वे पहले से जानते हैं उसे भूले बिना, अधिक मजबूत कैसे बना सकते हैं? आमतौर पर, कंप्यूटर को मजबूत बनाने के लिए, आपको प्रशिक्षण के दौरान उसे हजारों ऐसे पेचीदा, शोर वाले चित्रों को दिखाना पड़ता है। लेकिन इसमें एक पेंच है: यदि आप हर छवि के साथ एक जैसा व्यवहार करते हैं, तो कंप्यूटर उन आसान छवियों पर समय बर्बाद करता है जिन्हें वह पहले से ही समझता है, और शायद उन वास्तव में कठिन छवियों को मिस कर देता है जिन्हें सबसे अधिक मदद की आवश्यकता है। यह एक शिक्षक की तरह है जो पूरी कक्षा में उस गणित के सवाल को दोहरा रहा है जिसे छात्र ने पहले ही पूरी तरह से हल कर लिया है, जबकि उस सवाल को अनदेखा कर रहा है जो वास्तव में उसे परीक्षा में फेल करने का कारण बन रहा है।

यह शोध पत्र इस समस्या को ठीक करने के लिए एक चतुर नई रणनीति पेश करता है जिसे कॉन्फिडेंस-अवेयर वेटिंग (Confidence-Aware Weighting - CAW) कहा जाता है। शोधकर्ताओं ने महसूस किया कि सभी पेचीदा छवियां एक जैसी नहीं होतीं। कुछ छवियां इतनी भ्रमित करने वाली होती हैं कि मॉडल मुश्किल से सही अनुमान लगा पाता है, जबकि अन्य केवल थोड़ी अस्थिर होती हैं। प्रत्येक भ्रमित करने वाली छवि को समान ध्यान देने के बजाय, CAW एक स्मार्ट ट्यूटर की तरह कार्य करता है जो उन छात्रों पर अधिक ध्यान देता है जो सबसे अधिक संघर्ष कर रहे हैं।

यह तरीका कैसे काम करता है, इसके लिए एक सरल उपमा दी गई है: कल्पना कीजिए कि AI मॉडल एक परीक्षा दे रहा छात्र है।

  1. "कॉन्फिडेंस-अवेयर" वाला हिस्सा: जब छात्र किसी प्रश्न का गलत उत्तर देता है या अनिश्चित होता है, तो शिक्षक (CAW सिस्टम) कहता है, "ठीक है, यह एक कठिन वाला है! आइए इस पर ध्यान केंद्रित करें।" यह उन छवियों को अतिरिक्त महत्व (weight) देता है जहाँ मॉडल का आत्मविश्वास सबसे कम होता है। यदि मॉडल किसी छवि के बारे में पहले से ही काफी आश्वस्त है, तो शिक्षक कहता है, "तुम यह कर सकते हो, चलो आगे बढ़ते हैं।" यह सुनिश्चित करता है कि मॉडल अपनी सबसे बड़ी कमजोरियों को सुधारने में अपनी ऊर्जा खर्च करे, न कि उसे दोबारा सीखने में जो वह पहले से जानता है।
  2. "फीचर एलाइनमेंट" वाला हिस्सा: इस ट्रिक का दूसरा हिस्सा यह सुनिश्चित करना है कि छात्र जो उसने पिछली कक्षाओं में सीखा है, उसे भूले नहीं। जब मॉडल एक पेचीदा, शोर वाली छवि को देखता है, तो CAW यह जाँचता है कि क्या उसके द्वारा देखी गई "आंतरिक तस्वीर" उस "साफ तस्वीर" से मेल खाती है जो उसने पहले देखी थी। यह एक छात्र को बताने जैसा है, "भले ही यह फोटो धुंधली है, याद रखो कि यह अभी भी एक कुत्ता है, टोस्टर नहीं।" यह मॉडल को भ्रमित होने या अपना मूल ज्ञान खोने से रोकता है।

शोधकर्ताओं ने TinyImageNet और पालतू जानवरों से लेकर मेडिकल स्कैन तक के 14 अन्य डेटासेट्स सहित एक विशाल संग्रह पर इस विचार का परीक्षण किया। उन्होंने इस नए तरीके को सबसे शक्तिशाली "हमलों" के विरुद्ध मुकाबला कराया, जिसमें ऑटोअटैक (AutoAttack) नामक एक शक्तिशाली स्वचालित परीक्षण भी शामिल था। परिणाम उत्साहजनक थे: CAW पद्धति ने न केवल हमलों का सामना किया; बल्कि इसने पिछले सर्वोत्तम तरीकों से बेहतर प्रदर्शन भी किया। उदाहरण के लिए, 15 अलग-अलग डेटासेट्स में औसतन, इसने हमले के तहत सही रहने की मॉडल की क्षमता में दूसरे स्थान पर मौजूद विधि की तुलना में लगभग 2% का सुधार किया, और साथ ही कम कंप्यूटर मेमोरी का उपयोग किया।

सबसे दिलचस्प बात यह है कि मॉडल केवल हमलों से लड़ने में ही बेहतर नहीं हुआ; बल्कि यह सामान्य, साफ तस्वीरों को देखने में भी बेहतर हो गया। शोधकर्ताओं ने पाया कि "कठिन" उदाहरणों पर ध्यान केंद्रित करके, मॉडल ने दुनिया को देखने का एक अधिक स्थिर तरीका सीख लिया। जब उन्होंने देखा कि मॉडल किसी छवि के विभिन्न हिस्सों पर कैसे "ध्यान देता" है, तो उन्होंने देखा कि प्रशिक्षण से पहले, मॉडल शोर से आसानी से विचलित हो जाता था, पृष्ठभूमि या रैंडम पिक्सल को देखने लगता था। CAW का उपयोग करने के बाद, मॉडल ने वास्तविक वस्तु पर ध्यान केंद्रित करना सीख लिया, भले ही छवि पर हमला किया जा रहा हो।

संक्षेप में, यह शोध पत्र सुझाव देता है कि भ्रमित करने वाले उदाहरणों के बारे में थोड़ा अधिक चयनात्मक होकर, हम ऐसे AI का निर्माण कर सकते हैं जो अधिक स्मार्ट और अधिक मजबूत हो। यह इन शक्तिशाली विजन-लैंग्वेज मॉडल्स को इतना विश्वसनीय बनाने की दिशा में एक कदम है कि उन्हें वास्तविक दुनिया में उपयोग किया जा सके, जहाँ चीजें हमेशा पूर्ण नहीं होती हैं और कभी-कभी हमें धोखा देने की कोशिश करती हैं। हालाँकि यह विधि वर्तमान में मॉडल के इमेज वाले हिस्से पर केंद्रित है और मुख्य रूप से व्हाइट-बॉक्स हमलों (जहाँ हमलावर मॉडल के रहस्यों को जानता है) पर परीक्षण की गई है, फिर भी यह AI को उसकी नई चीजें सीखने की क्षमता को खोए बिना अधिक लचीला बनाने के लिए एक नया द्वार खोलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →