← नवीनतम पेपर
💻 computer science

Embedding Shift Dissection on CLIP: Effects of Augmentations on VLM's Representation Learning

यह अध्ययन विभिन्न समानता और दूरी मेट्रिक्स का उपयोग करके CLIP के एम्बेडिंग शिफ्ट पर नौ सामान्य इमेज ऑगमेंटेशन के प्रभाव की जांच करता है, जो यह प्रकट करता है कि शोर (noise), परिप्रेक्ष्य रूपांतरण (perspective transforms) और स्केलिंग सबसे नाटकीय परिवर्तन उत्पन्न करते हैं ताकि विजन लैंग्वेज मॉडल की मजबूती और यांत्रिक व्याख्यात्मकता (mechanistic interpretability) में सुधार के लिए मौलिक अंतर्दृष्टि प्रदान की जा सके।

मूल लेखक: Ashim Dahal, Saydul Akbar Murad, Nick Rahimi

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ashim Dahal, Saydul Akbar Murad, Nick Rahimi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि CLIP (इस अध्ययन के केंद्र में स्थित AI मॉडल) एक अति-बुद्धिमान कला समीक्षक है जिसने लाखों चित्रों और उनके विवरणों को कंठस्थ कर लिया है। यह समीक्षक केवल एक तस्वीर को "देखता" नहीं है; यह हर फोटो को एक अनूठे गुप्त कोड (एक "एम्बेडिंग") में बदल देता है जो इस बात के सार को पकड़ लेता है कि वह चित्र वास्तव में किस बारे में है।

इस शोध के शोधकर्ताओं ने एक सरल लेकिन गहन प्रश्न पूछा: "अगर हम इस तस्वीर के साथ छेड़छाड़ करें, तो इस गुप्त कोड का क्या होगा?"

उन्होंने एक तस्वीर को "बिगाड़ने" के 9 अलग-अलग तरीके लिए—जैसे कि उसे धुंधला करना (blurring), उसमें स्टैटिक शोर (static noise) जोड़ना, उसे पलटना (flipping), या उसे खींचना (stretching)—और देखा कि AI का वह गुप्त कोड कैसे बदलता है। वे जानना चाहते थे: क्या AI अभी भी बिल्ली को पहचान पाता है, या वह अचानक सोचने लगता है कि यह एक कुत्ता है? क्या कोड वही रहता है, या यह भटक जाता है?

यहाँ उनके निष्कर्षों का विवरण दिया गया, कुछ रोजमर्रा के उदाहरणों का उपयोग करते हुए:

1. प्रयोग: "मेकओवर" टेस्ट

मूल छवि की कल्पना एक व्यक्ति के पोर्ट्रेट के रूप में करें। शोधकर्ताओं ने इस पोर्ट्रेट पर 9 अलग-अलग "मेकओवर" लागू किए:

  • "ग्रिटी" (कठोर) मेकओवर: यादृच्छिक स्टैटिक (शोर) जोड़ना, चेहरे को धुंधला करना, या रंगों को अजीब बनाना (कलर जिटर)।
  • "ज्यामितीय" (Geometric) मेकओवर: चेहरे को खींचना (इलास्टिक), परिप्रेक्ष्य (perspective) को झुकाना, या ज़ूम इन/आउट करना।
  • "सरल" मेकओवर: छवि को क्षैतिज रूप से पलटना या इसे केवल चमकीला या गहरा बनाना।

इसके बाद उन्होंने AI से पूछा: "इस नए संस्करण के लिए गुप्त कोड क्या है?" और मूल कोड की तुलना नए कोड से की।

2. बड़ी खोज: सभी मेकओवर समान नहीं होते

अध्ययन में पाया गया कि AI कुछ बदलावों के प्रति बहुत संवेदनशील है लेकिन दूसरों के प्रति बहुत जिद्दी है।

  • "आघातपूर्ण" परिवर्तन (उच्च प्रभाव):

    • शोर (Static): कल्पना कीजिए कि आप एक फोटो लें और उस पर टीवी का स्टैटिक शोर फैला दें। यह सबसे अधिक नुकसानदेह था। इसने AI के गुप्त कोड को लगभग पूरी तरह से अस्त-व्यस्त कर दिया। AI इतना भ्रमित हो गया कि वह मूल विषय को मुश्किल से पहचान पाया।
    • परिप्रेक्ष्य और खिंचाव (Perspective & Stretching): यदि आप किसी चेहरे की फोटो लें और उसे टॉफी की तरह खींच दें या किसी अजीब कोण से देखें, तो AI का कोड काफी बदल जाता है। यह एक फनहाउस मिरर (मज़ेदार दर्पण) के माध्यम से दोस्त को देखने जैसा है; विकृत आकार को अपनी स्मृति से मिलाने में AI संघर्ष करता है।
    • धुंधलापन और पिक्सेल गिरना: छवि को धुंधला करने या उसके हिस्सों को काटने (जैसे कि गायब टुकड़ों वाला एक पहेली/पज़ल) से भी AI भ्रमित हो गया।
  • "हानिरहित" परिवर्तन (कम प्रभाव):

    • पलटना और चमक: यदि आप किसी फोटो को क्षैतिज रूप से पलट देते हैं या उसे थोड़ा चमकीला बना देते हैं, तो AI का गुप्त कोड बिल्कुल भी नहीं बदला। यह AI के कहने जैसा है, "ओह, यह अभी भी वही बिल्ली है, बस आईने में देख रही है या धूप का चश्मा पहने हुए है।" AI इन सरल चालों को अनदेखा करने में बहुत कुशल है।

3. उन्होंने "ड्रिफ्ट" (विचलन) को कैसे मापा

शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने कोड कितनी दूर चला गया, यह मापने के लिए "रूलर" (मापक) के एक टूलकिट का उपयोग किया:

  • "अटेंशन मैप" (AI की दृष्टि): उन्होंने देखा कि AI तस्वीर में कहाँ देख रहा था।
    • उदाहरण: मूल फोटो में, AI की "दृष्टि" कुत्ते के चेहरे पर मजबूती से केंद्रित थी। जब उन्होंने शोर (noise) जोड़ा, तो दृष्टि बिखरी हुई और भ्रमित हो गई, जो यादृच्छिक स्थानों पर देख रही थी। जब उन्होंने छवि को धुंधला (blur) किया, तो दृष्टि फैल गई, जो किसी केंद्र बिंदु को खोजने में असमर्थ थी।
  • "दूरी" का रूलर: उन्होंने मूल कोड और नए कोड के बीच गणितीय दूरी को मापा।
    • उदाहरण: यदि मूल कोड "घर" है, और नया कोड "घर + 1 मील" है, तो यह एक छोटा सा बदलाव है। यदि नया कोड "घर + 100 मील" है, तो यह एक बड़ा बदलाव है। शोर (Noise) ने कोड को 100 मील दूर धकेल दिया; पलटने (Flipping) ने केवल कुछ इंच ही हटाया।

4. यह क्यों मायने रखता है?

आप पूछ सकते हैं, "तो क्या हुआ? हमें इस बात से क्या फर्क पड़ता है कि स्टैटिक से AI भ्रमित हो जाता है?"

यह सुरक्षा और विश्वास के लिए महत्वपूर्ण है:

  • मजबूती (Robustness): यदि AI का उपयोग कार चलाने या बीमारी का निदान करने के लिए किया जाता है, तो इसे मजबूत होना चाहिए। यदि थोड़ी सी बारिश (धुंधलापन) या गंदा विंडशील्ड (शोर) AI के आंतरिक तर्क को ध्वस्त कर देता है, तो यह खतरनाक है। यह अध्ययन हमें बताता है कि किस प्रकार की गड़बड़ियाँ AI के मस्तिष्क को तोड़ देती हैं।
  • मस्तिष्क को समझना: कोड कैसे बदलता है, इसे देखकर, हम यह सीख रहे हैं कि AI कैसे "सोचता" है। यह पता चलता है कि AI ने सरल परिवर्तनों (जैसे चमक) को अनदेखा करना सीख लिया है लेकिन वह तीखे विवरणों और विशिष्ट आकृतियों पर बहुत अधिक निर्भर है।

निचोड़ (The Bottom Line)

यह पेपर एक AI के मस्तिष्क के लिए तनाव परीक्षण (stress test) की तरह है। यह हमें दिखाता है कि हालांकि AI बुद्धिमान है, लेकिन इसकी कुछ विशिष्ट कमजोरियां हैं।

  • मजबूत: यह सरल पलटने और चमक के बदलावों को आसानी से संभाल लेता है।
  • कमजोर: यह स्टैटिक शोर, भारी धुंधलेपन या अजीब विकृतियों से आसानी से विचलित हो जाता है।

इन कमजोरियों को समझकर, वैज्ञानिक बेहतर, सुरक्षित AI सिस्टम बना सकते हैं जो वास्तविक दुनिया के थोड़े अस्त-व्यस्त होने पर भ्रमित नहीं होते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →