SOMtime the World Aint Fair: Violating Fairness Using Self-Organizing Maps
यह शोध पत्र यह प्रदर्शित करता है कि अनसुपरवाइज्ड लर्निंग (unsupervised learning) में 'अनअवेयरनेस' (unawareness) के माध्यम से निष्पक्षता की धारणा गलत है, यह दिखाते हुए कि सेल्फ-ऑर्गनाइजिंग मैप्स (SOMtime) अनजाने में आयु और आय जैसे संवेदनशील गुणों को प्रमुख लेटेंट अक्षों (latent axes) के रूप में एनकोड कर सकते हैं, भले ही वे गुण प्रशिक्षण से बाहर रखे गए हों, जिससे महत्वपूर्ण डाउनस्ट्रीम निष्पक्षता जोखिम उत्पन्न होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शहर का एक विशाल, जादुई नक्शा बना रहे हैं, लेकिन आपने एक सख्त नियम बनाया है: आपको उन स्ट्रीट साइन को देखने की अनुमति नहीं है जो "अमीर मोहल्ला" या "पुराना शहर" कहते हैं। आपके पास केवल इमारतों के आकार और छतों के रंग हैं। कंप्यूटर विज्ञान की दुनिया में हमेशा से एक बड़ा अनुमान रहा है: "यदि आप संकेतों को नहीं देखते हैं, तो आपका नक्शा पूरी तरह से तटस्थ होगा। यह गलती से आपको यह नहीं दिखाएगा कि अमीर लोग कहाँ रहते हैं या उनके निवासी कितने पुराने हैं।"
यह शोध पत्र, जिसका शीर्षक "SOMtime the World Ain't Fair" है, आता है और कहता है, "वास्तव में, वह धारणा गलत है।"
लेखकों ने, जो टेक्निओन यूनिवर्सिटी (Technion University) की एक टीम है, खोजा कि भले ही आप कंप्यूटर से उम्र या आय जैसी संवेदनशील जानकारी छिपा दें, फिर भी कंप्यूटर एक ऐसा नक्शा बना सकता है जहाँ वे रहस्य पूरी तरह से एक सीधी, आसानी से पढ़ी जाने वाली रेखा में व्यवस्थित हो जाते हैं। वे इसे "स्ट्रक्चर्ड सेंसिटिव-एट्रिब्यूट लीकेज" (structured sensitive-attribute leakage) कहते हैं। यह सिर्फ यह नहीं है कि रहस्य नक्शे में कहीं छिपा हुआ है; बल्कि यह है कि वह रहस्य नक्शे के ठीक बीचों-बीच एक स्पष्ट, नामित राजमार्ग के रूप में व्यवस्थित है।
जादुई नक्शा बनाने वाला: SOMtime
इस छिपे हुए राजमार्ग को खोजने के लिए, लेखकों ने SOMtime (Self-Organizing Maps पर आधारित) नामक एक विशेष उपकरण का उपयोग किया। SOMtime को एक अत्यंत व्यवस्थित लाइब्रेरियन के रूप में समझें जो किताबों के ढेर (डेटा) को लेता है और उन्हें एक विशाल ग्रिड पर व्यवस्थित करता है।
यहाँ एक ट्रिक है: जब लेखकों ने इस लाइब्रेरियन को लोगों के बारे में डेटा दिया लेकिन उनकी उम्र और आय को छिपा दिया, तो लाइब्रेरियन ने किताबों को बेतरतीब ढंग से नहीं मिलाया। इसके बजाय, लाइब्रेरियन ने उन्हें इस तरह व्यवस्थित किया कि यदि आप ग्रिड के एक छोर से दूसरे छोर तक चलेंगे, तो आप स्वाभाविक रूप से "युवा" से "वृद्ध" या "कम आय" से "उच्च आय" की ओर बढ़ेंगे।
अपने परीक्षणों में, इस टूल ने एक सीधी रेखा पाई जहाँ उम्र और आय पूरी तरह से क्रमबद्ध थे। वर्ल्ड वैल्यूज सर्वे (World Values Survey) नामक एक डेटासेट पर, इस छिपी हुई रेखा और लोगों की वास्तविक उम्र के बीच का संबंध अविश्वसनीय रूप से मजबूत था, जिसका सहसंबंध स्कोर (correlation score) 0.85 तक था। इसे समझने के लिए, यदि आप डेटा के माध्यम से एक रेखा खींचते हैं, तो यह उम्र की लगभग सटीक भविष्यवाणी करेगा।
"अन्य" उपकरण परीक्षण में विफल रहे
लेखकों ने केवल SOMtime का उपयोग नहीं किया; उन्होंने डेटा की दुनिया के सामान्य संदिग्धों के साथ इसकी तुलना की: PCA, UMAP, t-SNE, Autoencoders, और Isomap। ये वे मानक उपकरण हैं जिनका उपयोग लोग बड़े डेटा को समझने के लिए करते हैं।
शोध पत्र में पाया गया कि ये अन्य उपकरण इस छिपे हुए राजमार्ग को खोजने में बहुत खराब थे। भले ही लेखकों ने उन्हें नक्शे को घुमाने या हर संभव दिशा में देखने का पूरा मौका दिया, लेकिन वे अधिकतम 0.44 का सहसंबंध ही प्राप्त कर सके। वास्तव में, कुछ डेटासेट्स के लिए, मानक उपकरणों का स्कोर 0.00 था, जिसका अर्थ है कि उन्होंने उम्र या आय के साथ कोई संबंध नहीं पाया।
लेखकों ने सिद्ध किया कि यह केवल इसलिए नहीं है क्योंकि SOMtime एक "बड़ा" या "स्मार्टर" टूल है। उन्होंने 1.4 मिलियन पैरामीटर्स वाले एक विशाल Autoencoder (एक डीप लर्निंग मॉडल) का परीक्षण किया जो डेटा को लगभग पूरी तरह से पुनर्गठित (reconstruct) कर सकता था (केवल 0.001 की त्रुटि के साथ)। फिर भी, यह विशाल मॉडल भी छिपे हुए राजमार्ग को खोजने में विफल रहा; यह केवल 0.34 का सहसंबंध तक ही पहुँच सका।
यह साबित करता है कि जादू अधिक कंप्यूटिंग पावर के बारे में नहीं है; यह इस बारे में है कि टूल डेटा को कैसे व्यवस्थित करता है। SOMtime एक विशिष्ट विधि का उपयोग करता है जिसे "प्रतिस्पर्धी शिक्षण" (competitive learning) कहा जाता है जो स्वाभाविक रूप से डेटा के सभी हिस्सों से कमजोर संकेतों को खींचता है और उन्हें एक स्पष्ट दिशा में संरेखित करता है। अन्य उपकरण, जैसे PCA, इन कमजोर संकेतों को अनदेखा कर देते हैं यदि वे कमरे की सबसे बड़ी या सबसे मुखर विशेषताएं नहीं हैं।
यह क्यों मायने रखता है: "निष्पक्षता" का जाल
शोध पत्र तर्क देता है कि हम केवल यह नहीं कह सकते कि, "हमने कंप्यूटर को उम्र के बारे में नहीं बताया, इसलिए यह निष्पक्ष है।" इस विचार को "फेयरनेस थ्रू अनअवेयरनेस" (fairness through unawareness) कहा जाता है, और यह पेपर दिखाता है कि यह एक कमजोर बचाव है।
यदि एक नक्शा लोगों को उम्र के आधार पर एक सीधी रेखा में व्यवस्थित करता है, तो उस नक्शे का उपयोग करके किया गया कोई भी निर्णय अनजाने में उम्र से प्रभावित होगा।
- यदि आप नक्शे का उपयोग लोगों को समूहों (clustering) में बांटने के लिए करते हैं, तो समूह उम्र के आधार पर अलग-अलग होंगे।
- यदि आप नक्शे का उपयोग उत्पादों की सिफारिश करने के लिए करते हैं, तो सिफारिशें उम्र पर आधारित होंगी।
- यदि आप नक्शे का उपयोग डेटा को विज़ुअलाइज़ करने के लिए करते हैं, तो चित्र उम्र के उतार-चढ़ाव (gradients) दिखाएगा।
लेखकों ने गणितीय रूप से सिद्ध किया कि यदि यह "लीकेज" r के सहसंबंध स्तर पर मौजूद है, तो यह गारंटी देता है कि नक्शे का उपयोग करने वाले किसी भी कार्य के लिए एक विशिष्ट मात्रा में पक्षपात (group disparity) होगा। यह केवल एक संभावना नहीं है; यह एक गणितीय निश्चितता है।
यह पेपर क्या खारिज करता है
लेखक बहुत स्पष्ट हैं कि यह क्या नहीं है:
- यह केवल "प्रोबिंग" (probing) के बारे में नहीं है: आमतौर पर, यह पता लगाने के लिए कि क्या एक नक्शा पक्षपाती है, आप एक अलग "प्रोब" (एक छोटा AI) को प्रशिक्षित करते हैं जो रहस्य का अनुमान लगा सके। लेखक दिखाते हैं कि SOMtime बिना किसी प्रोब की आवश्यकता के इस पक्षपात को खोज लेता है। पक्षपात नक्शे के आकार को देखकर ही स्पष्ट है।
- यह केवल "टोपोलॉजी" (topology) के बारे में नहीं है: उन्होंने Isomap का परीक्षण किया, जो डेटा के आकार को बनाए रखने वाला एक अन्य टूल है। Isomap इस छिपे हुए राजमार्ग को खोजने में विफल रहा (कुछ मामलों में 0.00 के करीब स्कोर किया)। यह सिद्ध करता है कि केवल डेटा के "आकार" को बनाए रखना पर्याप्त नहीं है; SOMtime जिस विशिष्ट तरीके से ग्रिड को व्यवस्थित करता है, वही एक स्पष्ट, व्यवस्थित रेखा बनाता है।
- यह "मजबूत" संकेतों के बारे में नहीं है: लेखकों ने उन विशेषताओं को हटा दिया जो उम्र से सबसे मजबूती से जुड़ी थीं (जैसे "Age" कॉलम को पूरी तरह से हटाना और किसी भी ऐसे कॉलम को फ़िल्टर करना जो बहुत स्पष्ट था)। इन कमजोर, बिखरे हुए संकेतों के बावजूद, SOMtime ने पैटर्न को खोज लिया।
निचोड़
यह शोध पत्र इन नक्शों को निष्पक्ष बनाने के लिए कोई समाधान नहीं देता है। इसके बजाय, यह एक टॉर्च (flashlight) प्रदान करता है। यह हमें दिखाता है कि अनसुपरवाइज्ड लर्निंग (बिना लेबल के सीखना) तटस्थ नहीं है। यह गुप्त रूप से उम्र और आय जैसे संवेदनशील गुणों द्वारा डेटा को व्यवस्थित कर सकता है, जिससे एक "नामित अक्ष" (named axis) बन जाता है जिसे डेटा का उपयोग करने वाला कोई भी व्यक्ति अनजाने में अपना लेगा।
लेखकों ने इसे पांच देशों के वास्तविक दुनिया के डेटा और एक विशाल जनगणना डेटासेट पर मापा। उन्होंने पाया कि जबकि मानक उपकरण इस पक्षपात को मिस कर सकते हैं, SOMtime इसे स्पष्ट रूप से उजागर करता है, जिसका सहसंबंध स्कोर 0.85 तक पहुँच जाता है। संदेश सरल है: यदि आप जांचना चाहते हैं कि आपका AI निष्पक्ष है या नहीं, तो आप केवल अंतिम उत्तर की जांच नहीं कर सकते। आपको उस नक्शे की जांच करनी होगी जिस पर इसे बनाया गया है, क्योंकि नक्शा पहले से ही उन रहस्यों द्वारा वर्गीकृत हो सकता है जिन्हें आपने छिपाने की कोशिश की थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।