← नवीनतम पेपर
💻 computer science

Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets

यह शोध पत्र LLMs का उपयोग करके इमेज-कैप्शन युग्मों को देशों के साथ मैप करके बड़े पैमाने के मल्टीमॉडल डेटासेट में भौगोलिक पूर्वाग्रह की जांच करता है, जिससे यह प्रकट होता है कि प्रशिक्षण डेटा उच्च-जीडीपी (GDP), अंग्रेजी बोलने वाले देशों की ओर अत्यधिक झुका हुआ है और इसमें ग्लोबल साउथ (Global South) का महत्वपूर्ण प्रतिनिधित्व नहीं है।

मूल लेखक: Abhipsa Basu, Yugam Bahl, Kirti Bhagat, Preethi Seshadri, R. Venkatesh Babu, Danish Pruthi

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Abhipsa Basu, Yugam Bahl, Kirti Bhagat, Preethi Seshadri, R. Venkatesh Babu, Danish Pruthi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

"ग्लोबल मिरर" की समस्या: क्यों AI दुनिया को पश्चिमी नजरिए से देखता है

कल्पना कीजिए कि आप एक विशाल, जादुई फोटो एल्बम बना रहे हैं जिसमें दुनिया की हर चीज़ की तस्वीर होनी चाहिए। आप एल्बम से पूछते हैं, "मुझे एक घर की तस्वीर दिखाओ," और वह आपको अमेरिका में सफेद बाड़ वाले एक उपनगरीय घर की तस्वीर दिखाता है। आप पूछते हैं, "मुझे एक सड़क दिखाओ," और वह आपको यूरोप में एक चौड़ा, पक्का हाईवे दिखाता है।

आप सोच सकते हैं, "ठहरिए, मोरक्को के रंगीन घरों का क्या? एंडीज के घुमावदार कच्चे रास्तों का क्या? मुंबई की हलचल भरी सड़कों का क्या?"

यह शोध पत्र, "तस्वीरें कहाँ से आती हैं?" (Where Do Images Come From?), एक वैज्ञानिक जांच है कि क्यों ये "जादुई फोटो एल्बम" (जिन्हें हम स्टेबल डिफ्यूजन जैसे AI मॉडल कहते हैं) का हमारे ग्रह के प्रति इतना पक्षपाती दृष्टिकोण है।


1. "अमीर पड़ोसी" का पूर्वाग्रह (मुख्य खोज)

शोधकर्ताओं ने उन विशाल छवियों और टेक्स्ट संग्रहों का अध्ययन किया जिनका उपयोग AI को प्रशिक्षित करने के लिए किया जाता है। वे जानना चाहते थे: ये चित्र वास्तव में कहाँ से आए हैं?

ऐसा करने के लिए, उन्होंने लाखों चित्रों के कैप्शन पढ़ने के लिए एक स्मार्ट AI (एक LLM) का उपयोग किया। यदि किसी कैप्शन में लिखा था, "पेरिस में एक सुंदर सूर्यास्त," तो AI उस छवि को फ्रांस के रूप में टैग करना जानता था।

निष्कर्ष: डेटा अविश्वसनीय रूप से असंतुलित है। यह एक बड़ी पार्टी आयोजित करने जैसा है जहाँ 80% मेहमान अमेरिका, ब्रिटेन और कनाडा से हैं, जबकि अफ्रीका और दक्षिण अमेरिका के लोगों को शायद ही आमंत्रित किया गया हो।

शोधकर्ताओं ने पैसे और दृश्यता के बीच एक सीधा संबंध पाया: एक देश जितना अधिक आर्थिक रूप से समृद्ध होगा (जीडीपी द्वारा मापा गया), उसकी छवियों के AI के "मस्तिष्क" में होने की संभावना उतनी ही अधिक होगी। यदि कोई देश आर्थिक रूप से शक्तिशाली है, तो AI उसे "देख" पाता है; यदि नहीं, तो AI अनिवार्य रूप से उसके प्रति अंधा है।

2. "रूढ़िवादिता का जाल" (विविधता बनाम आवृत्ति)

आप सोच सकते हैं, "ठीक है, तो अमेरिका के पास अधिक तस्वीरें हैं। लेकिन निश्चित रूप से, भारत या मेक्सिको की तस्वीरें विविध और रंगीन होंगी!"

शोधकर्ताओं ने एक "विविधता स्कोर" (Diversity Score) का उपयोग करके इसका परीक्षण किया। उन्होंने पाया कि केवल इसलिए कि किसी देश के पास अधिक तस्वीरें हैं, इसका मतलब यह नहीं है कि वे तस्वीरें विविध भी हैं।

उपमा: कल्पना कीजिए दो यात्रियों की।

  • यात्री A (नॉर्वे) 1,000 तस्वीरें लेता है, लेकिन वे सभी थोड़े अलग कोणों से एक ही बर्फीले पहाड़ की हैं।
  • यात्री B (मेक्सिको) केवल 100 तस्वीरें लेता है, लेकिन उनमें एक स्ट्रीट मार्केट, एक शादी, एक पुलिस कार और एक पहाड़ शामिल हैं।

भले ही यात्री A ने अधिक तस्वीरें लीं, लेकिन यात्री B का संग्रह बहुत अधिक "विविध" है। शोधकर्ताओं ने पाया कि AI प्रशिक्षण डेटा अक्सर इसी तरह की समस्या से ग्रस्त होता है। इसमें किसी देश की कई छवियां हो सकती हैं, लेकिन वे सभी एक जैसी दिखती हैं, जिससे रूढ़िवादिता (Stereotyping) पैदा होती है।

3. AI जनरेशन की "अनकैनी वैली" (Uncanny Valley)

अंत में, शोधकर्ताओं ने स्वयं AI का परीक्षण किया। उन्होंने उससे विशिष्ट स्थानों में विशिष्ट चीजों की छवियां बनाने को कहा, जैसे "भारत में एक कार।"

परिणाम: AI ने ऐसी छवियां बनाईं जो "यथार्थवादी" (वास्तविक कार्टून जैसी नहीं) लग रही थीं, लेकिन उनका कवरेज बहुत खराब था।

जब भारत की कार के लिए पूछा गया, तो AI ने पुरानी, टूटी-फूटी या जर्जर गाड़ियाँ बनाने की प्रवृत्ति दिखाई। इसने भारत में एक कार के 'विचार' को तो पकड़ लिया, लेकिन यह आज भारत की सड़कों पर चलने वाली आधुनिक, विविध और चमकदार कारों की वास्तविकता को समझने में विफल रहा। यह एक ऐसे कलाकार की तरह है जिसने किसी शहर का केवल एक पोस्टकार्ड देखा है और वह सोचता है कि पूरा शहर बिल्कुल उसी एक कार्ड जैसा दिखता है।


यह क्यों मायने रखता है?

यदि हम इन AI मॉडलों का उपयोग शहर डिजाइन करने, इतिहास की किताबें लिखने या फिल्में बनाने के लिए करते हैं, तो हम अनजाने में दुनिया को एक बहुत ही संकीर्ण, पश्चिमी-केंद्रित खिड़की से देखने के लिए सिखा रहे हैं।

सीख: AI को वास्तव में "बुद्धिमान" और "वैश्विक" बनाने के लिए, हम केवल इंटरनेट से डेटा स्क्रैप करके और बेहतर की उम्मीद नहीं कर सकते। हमें जानबूझकर पूरी दुनिया की कहानियों, रंगों और परिदृश्यों को खोजने के लिए बाहर निकलना होगा—न कि केवल उन हिस्सों को जो ऑनलाइन ढूंढने में सबसे आसान हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →