Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets
यह शोध पत्र LLMs का उपयोग करके इमेज-कैप्शन युग्मों को देशों के साथ मैप करके बड़े पैमाने के मल्टीमॉडल डेटासेट में भौगोलिक पूर्वाग्रह की जांच करता है, जिससे यह प्रकट होता है कि प्रशिक्षण डेटा उच्च-जीडीपी (GDP), अंग्रेजी बोलने वाले देशों की ओर अत्यधिक झुका हुआ है और इसमें ग्लोबल साउथ (Global South) का महत्वपूर्ण प्रतिनिधित्व नहीं है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
"ग्लोबल मिरर" की समस्या: क्यों AI दुनिया को पश्चिमी नजरिए से देखता है
कल्पना कीजिए कि आप एक विशाल, जादुई फोटो एल्बम बना रहे हैं जिसमें दुनिया की हर चीज़ की तस्वीर होनी चाहिए। आप एल्बम से पूछते हैं, "मुझे एक घर की तस्वीर दिखाओ," और वह आपको अमेरिका में सफेद बाड़ वाले एक उपनगरीय घर की तस्वीर दिखाता है। आप पूछते हैं, "मुझे एक सड़क दिखाओ," और वह आपको यूरोप में एक चौड़ा, पक्का हाईवे दिखाता है।
आप सोच सकते हैं, "ठहरिए, मोरक्को के रंगीन घरों का क्या? एंडीज के घुमावदार कच्चे रास्तों का क्या? मुंबई की हलचल भरी सड़कों का क्या?"
यह शोध पत्र, "तस्वीरें कहाँ से आती हैं?" (Where Do Images Come From?), एक वैज्ञानिक जांच है कि क्यों ये "जादुई फोटो एल्बम" (जिन्हें हम स्टेबल डिफ्यूजन जैसे AI मॉडल कहते हैं) का हमारे ग्रह के प्रति इतना पक्षपाती दृष्टिकोण है।
1. "अमीर पड़ोसी" का पूर्वाग्रह (मुख्य खोज)
शोधकर्ताओं ने उन विशाल छवियों और टेक्स्ट संग्रहों का अध्ययन किया जिनका उपयोग AI को प्रशिक्षित करने के लिए किया जाता है। वे जानना चाहते थे: ये चित्र वास्तव में कहाँ से आए हैं?
ऐसा करने के लिए, उन्होंने लाखों चित्रों के कैप्शन पढ़ने के लिए एक स्मार्ट AI (एक LLM) का उपयोग किया। यदि किसी कैप्शन में लिखा था, "पेरिस में एक सुंदर सूर्यास्त," तो AI उस छवि को फ्रांस के रूप में टैग करना जानता था।
निष्कर्ष: डेटा अविश्वसनीय रूप से असंतुलित है। यह एक बड़ी पार्टी आयोजित करने जैसा है जहाँ 80% मेहमान अमेरिका, ब्रिटेन और कनाडा से हैं, जबकि अफ्रीका और दक्षिण अमेरिका के लोगों को शायद ही आमंत्रित किया गया हो।
शोधकर्ताओं ने पैसे और दृश्यता के बीच एक सीधा संबंध पाया: एक देश जितना अधिक आर्थिक रूप से समृद्ध होगा (जीडीपी द्वारा मापा गया), उसकी छवियों के AI के "मस्तिष्क" में होने की संभावना उतनी ही अधिक होगी। यदि कोई देश आर्थिक रूप से शक्तिशाली है, तो AI उसे "देख" पाता है; यदि नहीं, तो AI अनिवार्य रूप से उसके प्रति अंधा है।
2. "रूढ़िवादिता का जाल" (विविधता बनाम आवृत्ति)
आप सोच सकते हैं, "ठीक है, तो अमेरिका के पास अधिक तस्वीरें हैं। लेकिन निश्चित रूप से, भारत या मेक्सिको की तस्वीरें विविध और रंगीन होंगी!"
शोधकर्ताओं ने एक "विविधता स्कोर" (Diversity Score) का उपयोग करके इसका परीक्षण किया। उन्होंने पाया कि केवल इसलिए कि किसी देश के पास अधिक तस्वीरें हैं, इसका मतलब यह नहीं है कि वे तस्वीरें विविध भी हैं।
उपमा: कल्पना कीजिए दो यात्रियों की।
- यात्री A (नॉर्वे) 1,000 तस्वीरें लेता है, लेकिन वे सभी थोड़े अलग कोणों से एक ही बर्फीले पहाड़ की हैं।
- यात्री B (मेक्सिको) केवल 100 तस्वीरें लेता है, लेकिन उनमें एक स्ट्रीट मार्केट, एक शादी, एक पुलिस कार और एक पहाड़ शामिल हैं।
भले ही यात्री A ने अधिक तस्वीरें लीं, लेकिन यात्री B का संग्रह बहुत अधिक "विविध" है। शोधकर्ताओं ने पाया कि AI प्रशिक्षण डेटा अक्सर इसी तरह की समस्या से ग्रस्त होता है। इसमें किसी देश की कई छवियां हो सकती हैं, लेकिन वे सभी एक जैसी दिखती हैं, जिससे रूढ़िवादिता (Stereotyping) पैदा होती है।
3. AI जनरेशन की "अनकैनी वैली" (Uncanny Valley)
अंत में, शोधकर्ताओं ने स्वयं AI का परीक्षण किया। उन्होंने उससे विशिष्ट स्थानों में विशिष्ट चीजों की छवियां बनाने को कहा, जैसे "भारत में एक कार।"
परिणाम: AI ने ऐसी छवियां बनाईं जो "यथार्थवादी" (वास्तविक कार्टून जैसी नहीं) लग रही थीं, लेकिन उनका कवरेज बहुत खराब था।
जब भारत की कार के लिए पूछा गया, तो AI ने पुरानी, टूटी-फूटी या जर्जर गाड़ियाँ बनाने की प्रवृत्ति दिखाई। इसने भारत में एक कार के 'विचार' को तो पकड़ लिया, लेकिन यह आज भारत की सड़कों पर चलने वाली आधुनिक, विविध और चमकदार कारों की वास्तविकता को समझने में विफल रहा। यह एक ऐसे कलाकार की तरह है जिसने किसी शहर का केवल एक पोस्टकार्ड देखा है और वह सोचता है कि पूरा शहर बिल्कुल उसी एक कार्ड जैसा दिखता है।
यह क्यों मायने रखता है?
यदि हम इन AI मॉडलों का उपयोग शहर डिजाइन करने, इतिहास की किताबें लिखने या फिल्में बनाने के लिए करते हैं, तो हम अनजाने में दुनिया को एक बहुत ही संकीर्ण, पश्चिमी-केंद्रित खिड़की से देखने के लिए सिखा रहे हैं।
सीख: AI को वास्तव में "बुद्धिमान" और "वैश्विक" बनाने के लिए, हम केवल इंटरनेट से डेटा स्क्रैप करके और बेहतर की उम्मीद नहीं कर सकते। हमें जानबूझकर पूरी दुनिया की कहानियों, रंगों और परिदृश्यों को खोजने के लिए बाहर निकलना होगा—न कि केवल उन हिस्सों को जो ऑनलाइन ढूंढने में सबसे आसान हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।