← नवीनतम पेपर
💻 computer science

Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs

यह शोध पत्र डेंसिटी-अवेयर ट्रांसलेशन (DAT) का प्रस्ताव करता है, जो एक अंशांकन (कैलिब्रेशन) विधि है जो CLIP फीचर स्पेस की एनिसोट्रोपिक ज्यामिति के कारण उत्पन्न होने वाले स्प्यूरियस कोरिलेशन के प्रवर्धन को कम करने के लिए स्थानीय एम्बेडिंग डेंसिटी के आधार पर इमेज-टेक्स्ट सिमिलैरिटी स्कोर को रीस्केल करके ज़ीरो-शॉट VLM वर्गीकरण में सुधार करता है।

मूल लेखक: Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

समस्या: "लोकप्रिय बच्चे" वाला पूर्वाग्रह (The "Popular Kid" Bias)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, दुनिया घूमने वाला लाइब्रेरियन (AI मॉडल, जैसे CLIP) है जिसने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं। यह लाइब्रेरियन नई चीज़ों को सीखने के लिए बिना किसी विशेष प्रशिक्षण के भी चीज़ों को पहचानने में माहिर है (इसे "ज़ीरो-शॉट" लर्निंग कहा जाता है)।

हालाँकि, इस लाइब्रेरियन की एक बुरी आदत है: वे भीड़ से आसानी से विचलित हो जाते हैं।

  • परिदृश्य: कल्पना कीजिए कि आप लाइब्रेरियन को एक चट्टान पर बैठे पक्षी की तस्वीर दिखाते हैं।
  • गलती: लाइब्रेरियन की याददाश्त में, उन्होंने "चट्टान पर पक्षी" की जितनी भी तस्वीरें देखी हैं, उनमें से 90% वास्तव में "ज़मीनी पक्षी" (landbirds) थे। केवल 10% "जलपक्षी" (waterbirds) थे। क्योंकि लाइब्रेरियन ने "चट्टान पर ज़मीनी पक्षी" की इतनी सारी तस्वीरें देखी हैं, उनका दिमाग अपने आप मान लेता है, "यह ज़रूर एक ज़मीनी पक्षी होगा!"
  • वास्तविकता: आपकी फोटो में दिख रहा पक्षी वास्तव में एक दुर्लभ जलपक्षी है जो बस संयोग से एक चट्टान पर आ बैठा है।
  • मुद्दा: लाइब्रेरियन पक्षी के विशिष्ट विवरणों (semantic content) को अनदेखा कर देता है और बैकग्राउंड (spurious correlation) के आधार पर अनुमान लगा लेता है। वे सच्चाई के बजाय "लोकप्रिय" पैटर्न पर भरोसा करते हैं।

ऐसा इसलिए होता है क्योंकि AI के "मन" में (उसके गणितीय फीचर स्पेस में), सामान्य पैटर्न केंद्र में एक साथ घने रूप में होते हैं, जबकि दुर्लभ लेकिन महत्वपूर्ण पैटर्न अकेले, बिखरे हुए किनारों पर धकेले जाते हैं। AI घने केंद्र पर बहुत अधिक भरोसा करता है और किनारों को अनदेखा कर देता है।

समाधान: "डेंसिटी-अवेयर ट्रांसलेशन" (DAT)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे Density-Aware Translation (DAT) कहा जाता है। इसे एक लाइब्रेरियन को "क्राउड-मीटर" (भीड़ मापने वाला यंत्र) देने के रूप में समझें।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

  1. भीड़ का स्नैपशॉट लेना (Reference Sets):
    कोई भी अंतिम अनुमान लगाने से पहले, सिस्टम हर प्रकार के पक्षी और हर प्रकार के बैकग्राउंड के लिए तस्वीरों का एक छोटा, संतुलित नमूना लेता है। यह ऐसा है जैसे लाइब्रेरियन को सभी संयोजनों (जैसे: पानी में जलपक्षी, ज़मीन पर जलपक्षी, पानी पर ज़मीनी पक्षी, ज़मीन पर ज़मीनी पक्षी) को दिखाने वाले कार्डों के एक छोटे, निष्पक्ष ढेर की तेज़ी से समीक्षा करने के लिए कहना।

  2. "क्राउड डेंसिटी" (भीड़ का घनत्व) मापना:
    जब लाइब्रेरियन एक नई फोटो देखता है, तो सिस्टम जाँचता है: "क्या यह फोटो लाइब्रेरी के एक भीड़भाड़ वाले, लोकप्रिय क्षेत्र में है, या यह एक शांत, खाली कोने में है?"

  • यदि कोई फोटो "पानी पर ज़मीनी पक्षी" (एक दुर्लभ, अजीब संयोजन) जैसी दिखती है, तो सिस्टम देखता है कि वह एक विरल (sparse) क्षेत्र में है।
  • यदि कोई फोटो "ज़मीन पर ज़मीनी पक्षी" (एक सामान्य संयोजन) जैसी दिखती है, तो वह एक घने (dense) क्षेत्र में है।
  1. "ट्रांसलेशन" (स्कोर को एडजस्ट करना):
    सिस्टम फिर लाइब्रेरियन के कॉन्फिडेंस स्कोर को एडजस्ट करता है:
  • यदि लाइब्रेरियन एक सामान्य पैटर्न के बारे में अत्यधिक आत्मविश्वासी है (उदाहरण के लिए, केवल बैकग्राउंड ज़मीन होने के कारण "ज़मीनी पक्षी" का अनुमान लगाना), तो सिस्टम स्कोर कम कर देता है। यह कहता है, "रुको, तुम बस भीड़ का अनुसरण कर रहे हो। थोड़ा करीब से देखो।"
  • यदि लाइब्रेरियन एक दुर्लभ लेकिन सही पैटर्न को पहचान लेता है (उदाहरण के लिए, ज़मीन पर एक जलपक्षी), तो सिस्टम स्कोर को सुरक्षित रखता है या बढ़ाता है। यह कहता है, "अच्छा काम किया! तुमने कुछ दुर्लभ और सार्थक ढूँढा है, भले ही यह 'लोकप्रिय' विकल्प न हो।"

यह क्यों विशेष है?

अन्य अधिकांश तरीके इसे ठीक करने की कोशिश करते हैं:

  • लाइब्रेरियन को फिर से प्रशिक्षित करके: इसमें बहुत समय लगता है और इसके लिए नए शिक्षकों (लेबल किए गए डेटा) की आवश्यकता होती है।
  • प्रश्नों को फिर से लिखकर: लाइब्रेरियन को बेहतर प्रॉम्प्ट्स के साथ चकमा देने की कोशिश करना, जो अविश्वसनीय हो सकता है।

DAT अलग है क्योंकि:

  • इसे लाइब्रेरियन को फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
  • इसे बैकग्राउंड के "गुप्त" लेबल जानने की आवश्यकता नहीं है (यदि आवश्यक हो तो यह उनका अनुमान लगा सकता है)।
  • यह केवल लाइब्रेरियन की याददाश्त के "आकार" को समझने के लिए एक छोटे, निष्पक्ष नमूने का उपयोग करता है और चलते-चलते (on the fly) स्कोर को ठीक करता है।

परिणाम

पेपर का परीक्षण कई डेटासेट्स पर किया गया (जैसे विभिन्न बैकग्राउंड में पक्षियों की पहचान करना, अलग-अलग बालों के रंगों के साथ चेहरों को पहचानना और एक्स-रे में बीमारियों का पता लगाना)।

  • परिणाम: DAT ने लगातार AI को सबसे कठिन मामलों (उन दुर्लभ समूहों) के लिए सही उत्तर देने में मदद की जिन्हें आमतौर पर अनदेखा कर दिया जाता है।
  • उपमा: DAT से पहले, लाइब्रेरियन "लोकप्रिय" उत्तरों के लिए तो बहुत अच्छा था लेकिन "दुर्लभ" उत्तरों के लिए बहुत बुरा था। DAT के बाद, लाइब्रेरियन बहुत अधिक संतुलित हो गया, वह सामान्य चीज़ों को सही करने की अपनी क्षमता खोए बिना दुर्लभ उत्तरों को भी सही बताने लगा।

सारांश

यह पेपर एक सरल, चतुर तकनीक पेश करता है जो AI मॉडल्स को "भेड़चाल" (herd thinkers) सोचने से रोकने के लिए है। यह मापकर कि किसी विशिष्ट पैटर्न का AI की याददाश्त में कितना घनत्व या खालीपन है, यह विधि AI को सामान्य बैकग्राउंड संकेतों पर बहुत अधिक निर्भर करने के बजाय छवि के वास्तविक विषय पर ध्यान केंद्रित करने के लिए मजबूर करती है। यह AI को अधिक निष्पक्ष और सटीक बनाता है, विशेष रूप से दुर्लभ या कम प्रतिनिधित्व वाले समूहों के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →