← नवीनतम पेपर
💻 computer science

GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models

यह शोध पत्र GeoDiv प्रस्तुत करता है, जो टेक्स्ट-टू-इमेज जनरेशन में महत्वपूर्ण भौगोलिक पूर्वाग्रहों और सामाजिक-आर्थिक रूढ़ियों को व्यवस्थित रूप से मापने और प्रकट करने के लिए बड़े भाषा और विजन-लैंग्वेज मॉडलों का लाभ उठाने वाला एक नवीन ढांचा है, जो यह प्रदर्शित करता है कि वर्तमान मॉडल भारत, नाइजीरिया और कोलंबिया जैसे देशों को किस प्रकार असमान रूप से निर्धन रूपों में चित्रित करते हैं।

मूल लेखक: Abhipsa Basu, Mohana Singh, Shashank Agnihotri, Margret Keuper, R. Venkatesh Babu

प्रकाशित 2026-02-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhipsa Basu, Mohana Singh, Shashank Agnihotri, Margret Keuper, R. Venkatesh Babu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई कैमरा है जो आपके द्वारा वर्णित किसी भी चीज़ की तस्वीर ले सकता है। आप कहते हैं, "नाइजीरिया के एक घर की फोटो लो," और स्नैप! वह उसे बना देता है। आप कहते हैं, "जापान के एक घर की फोटो लो," और स्नैप! वह दूसरा बना देता है।

आज के टेक्स्ट-टू-इमेज (T2I) मॉडल इसी तरह काम करते हैं। वे अविश्वसनीय रूप से लोकप्रिय हैं, लेकिन एक समस्या है: वे पक्षपाती (biased) हैं।

यदि आप इस जादुई कैमरे से नाइजीरिया के एक घर को दिखाने के लिए कहते हैं, तो यह हमेशा एक जर्जर, धूल भरी झोपड़ी दिखा सकता है। यदि आप जापान के एक घर के लिए कहते हैं, तो यह हमेशा एक शानदार, भविष्यवादी अपार्टमेंट दिखा सकता है। ऐसा लगता है जैसे कैमरे का लेंस टूटा हुआ है जो दुनिया को केवल एक बहुत ही संकीर्ण, रूढ़िबद्ध फिल्टर के माध्यम से देखता है। यह भूल जाता है कि नाइजीरिया में आधुनिक गगनचुंबी इमारतें और जापान में पुराने, देहाती गाँव भी हैं।

यह शोध पत्र GeoDiv (जियोग्राफिकल डाइवर्सिटी) नामक एक नया टूल पेश करता है ताकि इसे ठीक किया जा सके। सोचिए कि GeoDiv एक "वर्ल्ड-चेक इंस्पेक्टर" है।

इंस्पेक्टर के किट में दो मुख्य उपकरण

शोधकर्ताओं ने विविधता को दो विशिष्ट तरीकों से मापने के लिए GeoDiv बनाया है, जैसे कि कार के इंजन और उसके पेंट दोनों की जाँच करना।

1. "सोशियो-इकोनॉमिक विजुअल इंडेक्स" (SEVI) – "धन और स्थिति" की जाँच

इंस्पेक्टर का यह हिस्सा छवि के अहसास (vibe) को देखता है। यह दो बड़े सवाल पूछता है:

  • समृद्धि (Affluence): क्या यह अमीर दिखता है या गरीब? (क्या यह एक हवेली है या एक झोपड़ी?)
  • रखरखाव (Maintenance): क्या यह बिल्कुल नया और अच्छी तरह से रखा गया दिखता है, या यह टूटा हुआ और घिसा हुआ है?

उपमा: कल्पना कीजिए कि आप एक पड़ोस का न्याय कर रहे हैं।

  • पक्षपात: यदि कैमरा हमेशा नाइजीरिया को एक "टूटे-फूटे, गरीब पड़ोस" के रूप में और अमेरिका को एक "परफेक्ट, चमकदार उपनगर" के रूप में दिखाता है, तो SEVI स्कोर बहुत खराब होगा। यह प्रकट करता है कि AI इस रूढ़ि को पुख्ता कर रहा है कि कुछ देश हमेशा गरीब होते हैं और अन्य हमेशा अमीर।
  • निष्कर्ष: शोध में पाया गया कि FLUX.1 जैसे मॉडल चीजों को "चमकदार और समृद्ध" (उच्च रखरखाव) दिखाने में माहिर हैं, लेकिन वे हर देश को एक जैसा बना देते हैं। वहीं, पुराने मॉडल अक्सर विकासशील देशों को डिफ़ॉल्ट रूप से "टूटा हुआ और गरीब" दिखाते हैं।

2. "विजुअल डाइवर्सिटी इंडेक्स" (VDI) – "विविधता" की जाँच

यह हिस्सा विवरण (details) को देखता है। यह पूछता है: "क्या सभी घर एक ही रंग के हैं? क्या सभी सड़कें एक ही प्रकार की हैं?"

  • एंटिटी अपीयरेंस (वस्तु का स्वरूप): वस्तु कैसी दिखती है? (क्या कार एक लाल सेडान है या एक नीला ट्रक? क्या घर ईंट का बना है या मिट्टी का?)
  • बैकग्राउंड अपीयरेंस (पृष्ठभूमि का स्वरूप): उसके आसपास क्या है? (क्या सड़क डामर से बनी है, या यह एक कच्चा रास्ता है? क्या वहां पहाड़ हैं या सिर्फ समतल मैदान हैं?)

उपमा: कल्पना कीजिए कि क्रेयॉन (रंगों) का एक डिब्बा है।

  • कम विविधता: यदि आप "10 अलग-अलग देशों में एक कार" दिखाने के लिए कहते हैं और AI आपको 10 एक जैसी लाल सेडान और पक्की सड़क देता है, तो यह एक ऐसे डिब्बे की तरह है जिसमें केवल एक लाल क्रेयॉन है। यह उबाऊ और नकली है।
  • उच्च विविधता: एक अच्छे AI को अमेरिका में एक लाल सेडान, भारत में एक ऑटो-रिक्शा, केन्या में एक मोटरबाइक और इटली में एक विंटेज कार दिखानी चाहिए। यह क्रेयॉन का एक पूरा डिब्बा है!
  • निष्कर्ष: शोध में पाया गया कि हालांकि नए AI मॉडल चीजों को "असली" दिखाने में बेहतर हो रहे हैं, वे वास्तव में विविधता दिखाने में बदतर होते जा रहे हैं। वे बहुत अधिक एकसमान होते जा रहे हैं।

GeoDiv वास्तव में कैसे काम करता है?

इंसानों द्वारा 1,60,000 तस्वीरों को देखने के बजाय (जिसमें बहुत समय लगेगा), GeoDiv AI सहायकों (लार्ज लैंग्वेज मॉडल्स और विजन-लैंग्वेज मॉडल्स) का उपयोग भारी काम करने के लिए करता है।

  1. इंटरव्यू लेने वाला: AI एक रिपोर्टर की तरह काम करता है। यह नाइजीरिया के एक घर की तस्वीर देखता है और पूछता है, "क्या छत सपाट है या ढलान वाली? क्या सड़क कच्ची है या पक्की? क्या यह अमीर या गरीब दिखता है?"
  2. स्कोर रखने वाला: यह जवाबों को गिनता है। यदि नाइजीरिया के 90% घरों में कच्ची सड़कें हैं और ब्रिटेन के 90% घरों में पक्की सड़कें हैं, तो AI जानता है कि वहां पक्षपात (bias) है।
  3. रिपोर्ट कार्ड: यह AI मॉडल को एक स्कोर देता है। उच्च स्कोर का अर्थ है कि AI दुनिया को वैसा ही दिखाता है जैसी वह वास्तव में है (विविध और विविध)। कम स्कोर का अर्थ है कि AI एक रूढ़ि में फंसा हुआ है।

उन्होंने क्या खोजा?

"वर्ल्ड-चेक इंस्पेक्टर" ने कुछ चौंकाने वाली बातें खोजीं:

  • "गरीब देश" का जाल: भारत, नाइजीरिया और कोलंबिया जैसे देशों की छवियां बनाने के लिए कहे जाने पर, AI लगभग हमेशा उन्हें निर्धन और जर्जर दिखाता है। यह शायद ही कभी उन्हें आधुनिक या समृद्ध दिखाता है।
  • "अमीर देश" का फिल्टर: अमेरिका, ब्रिटेन या जापान के लिए पूछे जाने पर, AI लगभग हमेशा उन्हें समृद्ध, साफ-सुथरा और आदर्श दिखाता है।
  • "एक ही आकार सबके लिए" की समस्या: नए मॉडल (जैसे FLUX.1) चीजों को "सुंदर" दिखाने में इतने अच्छे हैं कि वे हर देश को एक अमीर पश्चिमी उपनगर जैसा बना देते हैं। वे विभिन्न स्थानों के अनूठे सांस्कृतिक रंगों को खो देते हैं।

यह क्यों मायने रखता है?

यदि हम इन AI मॉडल्स को ये पक्षपाती चित्र बनाते रहने देते हैं, तो वे दुनिया को देखने के हमारे नजरिए को आकार देने लगेंगे। यदि एक AI हमेशा नाइजीरिया को गरीबी के स्थान के रूप में दिखाता है, तो लोग यह मानने लग सकते हैं कि नाइजीरिया में बस इतना ही है।

GeoDiv उन मॉडल्स के लिए "रिपोर्ट कार्ड" देने वाला पहला टूल है। यह केवल यह नहीं कहता कि "यह बुरा दिखता है"; बल्कि यह हमें बिल्कुल सटीक बताता है कि पक्षपात कहाँ है (जैसे, "आप सभी नाइजीरियाई सड़कों को कच्चा दिखा रहे हैं")।

निष्कर्ष

यह शोध पत्र आर्टिफिशियल इंटेलिजेंस के सामने रखा गया एक दर्पण है। यह हमें दिखाता है कि हालांकि AI कला बनाने में अद्भुत है, लेकिन वर्तमान में यह एक बहुत बुरा यात्री है। यह केवल रूढ़ियों को जानता है।

GeoDiv वह दिशा-सूचक यंत्र (compass) है जो डेवलपर्स को मानचित्र ठीक करने में मदद करता है, ताकि जब हम AI से दुनिया दिखाने के लिए कहें, तो वह हमें वास्तविक दुनिया दिखाए—जो अस्त-व्यस्त, विविध, सुंदर और आश्चर्यों से भरी है, न कि केवल रूढ़ियों का एक संग्रह।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →