IndicFairFace: Balanced Indian Face Dataset for Auditing and Mitigating Geographical Bias in Vision-Language Models
यह शोधपत्र IndicFairFace को प्रस्तुत करता है, जो भारत के 28 राज्यों और 8 केंद्र शासित प्रदेशों में संतुलित 14,400 छवियों का एक नवीन और नैतिक रूप से प्राप्त डेटासेट है, जिसका उद्देश्य उच्च रिट्रीवल सटीकता बनाए रखते हुए विजन-लैंग्वेज मॉडल्स (Vision-Language Models) में भौगोलिक पूर्वाग्रह को मापना और कम करना है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट डिजिटल सहायक है, एक "विज़न-लैंग्वेज मॉडल" (VLM), जिसने इंटरनेट पर लगभग सब कुछ पढ़ लिया है और अरबों तस्वीरें देख ली हैं। आप उससे पूछते हैं, "मुझे एक भारतीय व्यक्ति की तस्वीर दिखाओ।"
आदर्श रूप से, इस सहायक को आपको एक सुंदर, विविध कोलाज दिखाना चाहिए: पंजाब के हरे-भरे खेतों का एक किसान, अंडमान के द्वीपों का एक मछुआरा, सिक्किम की पहाड़ियों का एक छात्र, और मुंबई के हलचल भरे बाजारों का एक दुकानदार।
लेकिन वास्तव में, पेपर IndicFairFace प्रकट करता है कि यह सहायक पक्षपाती है। जब आप इससे "भारतीय चेहरे" मांगते हैं, तो यह आपको ज्यादातर केवल कुछ ही जगहों के लोग दिखाता है—जैसे राजस्थान या तमिलनाडु—जबकि उत्तर-पूर्व, द्वीपों और कई अन्य क्षेत्रों को पूरी तरह से अनदेखा कर देता है। ऐसा लगता है जैसे सहायक सोचता है कि "भारतीय" केवल एक खास तरह का ही दिखता है, जो कि इंटरनेट पर देखी गई सबसे लोकप्रिय तस्वीरों पर आधारित है, न कि देश की वास्तविक, जटिल और अद्भुत विविधता पर।
यहाँ एक सरल विवरण दिया गया है कि लेखकों ने इसे ठीक करने के लिए क्या किया:
1. समस्या: एक "मोनोलिथिक" (एकरूपी) दर्पण
वर्तमान AI मॉडलों को एक फनहाउस मिरर (मजाकिया दर्पण) की तरह समझें। वास्तविक भारत को प्रतिबिंबित करने के बजाय (जिसमें 28 राज्य और 8 केंद्र शासित प्रदेश हैं, जिनमें से प्रत्येक के अपने अद्वितीय चेहरे, स्किन टोन और शैलियाँ हैं), यह दर्पण सबको एक ही संकीर्ण आकार में सिकोड़ देता है।
शोधकर्ताओं ने पाया कि यदि आप इन AI से "भारतीय चेहरों" के बारे में पूछते हैं, तो वे जनसंख्या के एक बहुत छोटे हिस्से से चित्र निकालते हैं। वे बड़े, शहरी या पर्यटन वाले क्षेत्रों का अत्यधिक प्रतिनिधित्व करते हैं और उत्तर-पूर्व, द्वीपों और ग्रामीण क्षेत्रों के चेहरों को पूरी तरह से मिटा देते हैं। यह केवल एक तकनीकी त्रुटि नहीं है; यह डिजिटल विलोपन (erasure) का एक रूप है जो वास्तविक दुनिया में नुकसान पहुंचा सकता है, जैसे कि एक AI भर्ती टूल किसी योग्य उम्मीदवार को केवल इसलिए खारिज कर सकता है क्योंकि उसका चेहरा AI की संकीर्ण "भारतीय" धारणा से मेल नहीं खाता।
2. समाधान: एक "फेयरनेस स्केल" (निष्पक्षता पैमाना) बनाना
एक टूटे हुए तराजू को ठीक करने के लिए, आपको उसे कैलिब्रेट करने के लिए वजन के एक सटीक सेट की आवश्यकता होती है। लेखकों ने IndicFairFace बनाया, जो बिल्कुल वही है: एक पूरी तरह से संतुलित डेटासेट।
- नुस्खा (Recipe): उन्होंने वास्तविक लोगों की 14,400 तस्वीरें एकत्र कीं।
- संतुलन: उन्होंने केवल रैंडम फोटो नहीं लीं। उन्होंने यह सुनिश्चित किया कि भारत के प्रत्येक राज्य और केंद्र शासित प्रदेश से पुरुषों और महिलाओं की संख्या बिल्कुल समान हो।
- स्रोत: वे इस बात में सावधानी बरतते थे कि केवल उन्हीं छवियों का उपयोग किया जाए जो कानूनी रूप से उपयोग के लिए मुक्त हैं (जैसे विकिमीडिया कॉमन्स) या नैतिक वेब खोजों के माध्यम से मिली हैं, जिससे यह सुनिश्चित हो सके कि वे किसी की गोपनीयता नहीं चुरा रहे हैं।
इस डेटासेट को एक पूरी तरह से संतुलित कोरस (गायक दल) के रूप में सोचें। पहले, कोरस मुख्य रूप से एक शहर के टेनर्स (tenors) से बना था। अब, भारत के हर क्षेत्र की हर आवाज़ को कोरस में समान स्थान मिला है।
### 3. समाधान: "सर्जिकल" डी-बायसिंग (पक्षपात हटाना)
एक बार जब उनके पास यह संतुलित कोरस आ गया, तो उन्होंने इसका उपयोग AI के मस्तिष्क को "री-ट्रेन" करने के लिए किया। लेकिन वे पूरे AI को शुरू से फिर से नहीं सिखाना चाहते थे (क्योंकि यह धीमा और महंगा होता)। इसके बजाय, उन्होंने इटरेटिव नलस्पेस प्रोजेक्शन (Iterative Nullspace Projection - INLP) नामक एक चतुर तकनीक का उपयोग किया।
यह समझने के लिए एक उपमा (analogy) है कि यह कैसे काम करता है:
कल्पना कीजिए कि AI का मस्तिष्क विचारों का एक विशाल पुस्तकालय है। इस पुस्तकालय में, एक विशिष्ट "गलियारा" (corridor) है जहाँ AI भूगोल के बारे में अपने सभी रूढ़िबद्ध विचारों (stereotypes) को रखता है।
- पुराना तरीका: आप खराब किताबों को हटाने के लिए पुस्तकालय को जलाने की कोशिश कर सकते हैं। लेकिन तब आप सभी अच्छी किताबें भी खो देंगे (AI अपनी सामान्य बुद्धिमत्ता खो देगा)।
- नया तरीका (INLP): शोधकर्ताओं ने उस विशिष्ट "गलियारे" को खोज निकाला जहाँ पक्षपात निवास करता था। फिर उन्होंने उस गलियारे के चारों ओर एक फोर्सफील्ड (बलक्षेत्र) बनाया। जब AI उस गलियारे से गुजरने और एक पक्षपाती निर्णय लेने की कोशिश करता है, तो फोर्सफील्ड उसे धीरे से मुख्य पथ पर वापस धकेल देता है।
- परिणाम: AI अभी भी कारों, जानवरों या गणित के बारे में सब कुछ जानता है (उसकी सामान्य बुद्धिमत्ता अप्रभावित है), लेकिन वह अब "पक्षपात के गलियारे" में नहीं चल सकता। अब वह "भारतीय" को एक विविध अवधारणा के रूप में देखता है।
4. प्रमाण: क्या यह अभी भी काम करता है?
AI पक्षपात को ठीक करने के साथ एक सामान्य डर यह होता है कि आप AI को खराब कर सकते हैं। लेखों ने अपने "डी-बायस्ड" मॉडल्स का दर्जनों अन्य कार्यों (जैसे कारों, जानवरों की पहचान करना या छवियों में टेक्स्ट पढ़ना) पर परीक्षण किया।
परिणाम? AI ने अपनी बुद्धिमत्ता नहीं खोई।
- अन्य कार्यों पर इसकी सटीकता 1.5% से भी कम गिरी (जो कि लगभग कुछ भी नहीं है)।
- लेकिन जब "भारतीय लोगों" के बारे में पूछा गया, तो इसने अचानक पूरे देश के चेहरे दिखाने शुरू कर दिए, न कि केवल वही पुराने परिचित चेहरे।
यह क्यों मायने रखता है
यह पेपर AI को निष्पक्ष बनाने के लिए एक ब्लूप्रिंट है, न केवल भारत के लिए, बल्कि पूरी दुनिया के लिए। यह दिखाता है कि हम केवल यह नहीं कह सकते कि "AI तटस्थ है" क्योंकि इसे इंटरनेट पर प्रशिक्षित किया गया था। इंटरनेट असंतुलनों से भरा है। AI को ठीक करने के लिए, हमें अपना खुद का संतुलित डेटासेट बनाना होगा जो वास्तविक दुनिया का प्रतिनिधित्व करता हो, न कि केवल उसके लोकप्रिय हिस्सों का।
संक्षेप में: लेखकों ने भारत का एक संतुलित फोटो एल्बम बनाया, AI के मस्तिष्क को उसकी संकीर्ण सोच से बाहर निकालने के लिए उसे धीरे से धकेला, और यह साबित किया कि AI अपनी बुद्धिमत्ता खोए बिना निष्पक्ष हो सकता है। यह सुनिश्चित करने की दिशा में एक कदम है कि जब AI दुनिया को देखे, तो वह सभी को देखे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।