Auditing Fairness-Privacy Trade-offs: Subpopulation-Level Effects of Fairness-Enhancing Algorithms
यह शोधपत्र पहला व्यापक अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि निष्पक्षता-बढ़ाने वाले एल्गोरिदम के सदस्यता अनुमान गोपनीयता जोखिमों (membership inference privacy risks) पर विषम, उप-जनसंख्या-विशिष्ट प्रभाव होते हैं, जो यह प्रकट करता है कि निष्पक्षता, गोपनीयता और उपयोगिता के बीच की परस्पर क्रिया का मूल्यांकन समग्र मेट्रिक्स के बजाय उपसमूह स्तर पर संयुक्त रूप से किया जाना आवश्यक है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हलचल भरे पुस्तकालय में घूम रहे हैं जहाँ हर किताब किसी व्यक्ति की जीवन कहानी का प्रतिनिधित्व करती है। इस पुस्तकालय में, लाइब्रेरियन (कंप्यूटर प्रोग्राम) को दो बहुत महत्वपूर्ण नियमों का पालन करना होगा। पहला नियम है निष्पक्षता (Fairness): लाइब्रेरियन को हर आगंतुक के साथ समान व्यवहार करना चाहिए, चाहे वह लंबा हो, छोटा हो, चश्मा पहनता हो, या किसी विशिष्ट पड़ोस से आता हो। वे एक समूह को बेहतर सेवा दे सकते हैं जबकि दूसरे को अनदेखा कर सकते हैं, ऐसा नहीं कर सकते। दूसरा नियम है गोपनीयता (Privacy): लाइब्रेरियन को आगंतुकों के रहस्यों को सुरक्षित रखना चाहिए। उन्हें किसी अजनबी को यह नहीं बताना चाहिए कि, "हे, मुझे पता है कि आप कल यहाँ आए थे!" केवल यह देखकर कि उन्होंने किताबों को कैसे व्यवस्थित किया है।
लंबे समय से, वैज्ञानिक चिंतित रहे हैं कि ये दो नियम आपस में लड़ सकते हैं। उन्हें लगा कि यदि आप पुस्तकालय को अत्यधिक निष्पक्ष बनाने की कोशिश करते हैं, तो आप अनजाने में यह अनुमान लगाना आसान बना सकते हैं कि कौन से आगंतुक वहाँ आए थे। या, यदि आप गोपनीयता के लिए हर किसी की पहचान को पूरी तरह से छिपाने की कोशिश करते हैं, तो लाइब्रेरियन इतने भ्रमित हो सकते हैं कि वे लोगों के साथ अनुचित व्यवहार करने लगें। यह ऐसा है जैसे कहना कि एक शहर का "औसत" तापमान एकदम सही है, जबकि यह अनदेखा कर दिया गया है कि एक मोहल्ला जम रहा है और दूसरा तप रहा है।
यह शोध पत्र तय करता है कि एक आवर्धक लेंस (magnifying glass) का उपयोग करके पुस्तकालय को करीब से देखना है, और एक-एक करके आगंतुकों के प्रत्येक विशिष्ट समूह की जाँच करनी है। शोधकर्ता देखना चाहते थे कि क्या होता है जब आप लाइब्रेरियन के व्यवहार को ठीक करने के लिए विशेष "निष्पक्षता उपकरणों" (fairness tools) का उपयोग करते हैं। क्या ये उपकरण अनजाने में यह अनुमान लगाना आसान बना देते हैं कि कौन से आगंतुक सिस्टम में शामिल हैं? और यदि आप "डिफरेंशियल प्राइवेसी" (Differential Privacy) नामक एक "प्राइवेसी शील्ड" का उपयोग करके हर किसी की पहचान छिपाने की कोशिश करते हैं, तो क्या यह सभी की समान रूप से मदद करता है, या क्या यह अनजाने में छोटे, कम आम समूहों को और भी अधिक नुकसान पहुँचाता है?
टीम ने दस अलग-अलग वास्तविक दुनिया के परिदृश्यों का उपयोग करके एक विशाल प्रयोग स्थापित किया, जिसमें ऋण (loan) मिलने की भविष्यवाणी करने से लेकर यह पता लगाने तक शामिल था कि कौन कानूनी प्रणाली में दोबारा अपराध कर सकता है। उन्होंने पांच अलग-अलग प्रकार के "निष्पक्षता उपकरणों" का परीक्षण किया (कुछ जो कंप्यूटर के सीखने से पहले डेटा को ठीक करते हैं, कुछ जो कंप्यूटर के सीखने के तरीके को बदलते हैं, और कुछ जो कंप्यूटर के काम पूरा करने के बाद उत्तरों को ठीक करते हैं)। उन्होंने यह देखने के लिए तीन अलग-अलग प्रकार के "सूनिंग अटैक्स" (snoop attacks) का भी उपयोग किया कि यह अनुमान लगाना कितना आसान है कि कोई व्यक्ति प्रशिक्षण डेटा (training data) में है या नहीं।
उन्होंने क्या खोजा, यह थोड़ा जटिल है और यह केवल एक साधारण "अच्छे बनाम बुरे" की कहानी नहीं है। सबसे पहले, उन्होंने पाया कि निष्पक्षता और गोपनीयता दुश्मन नहीं हैं। आपको दोनों में से किसी एक को चुनने की आवश्यकता नहीं है; वास्तव में, कुछ निष्पक्षता उपकरण वास्तव में जासूसों के लिए यह अनुमान लगाना कठिन बना देते हैं कि सिस्टम में कौन मौजूद है, जबकि अन्य इसे आसान बना देते हैं। उदाहरण के लिए, एक उपकरण जिसे "रीवेटिंग" (Reweighing - जो छोटे समूहों को अतिरिक्त ध्यान देता है) कहा जाता है, अक्सर छोटे समूहों को जासूसों से सुरक्षित बनाता है। लेकिन दूसरा उपकरण, "डिस्पैरेट इम्पैक्ट रिमूवर" (Disparate Impact Remover), थोड़ा उतार-चढ़ाव भरा था—यह कभी मदद करता था और कभी नुकसान पहुँचाता था, जो विशिष्ट डेटासेट पर निर्भर करता था।
सबसे आश्चर्यजनक खोज तब आई जब उन्होंने निष्पक्षता उपकरणों को "प्राइवेसी शील्ड" (डिफरेंशियल प्राइवेसी) के साथ जोड़ा। शोधकर्ताओं ने पाया कि जबकि प्राइवेसी शील्ड ने जासूसों को सफलतापूर्वक रोक दिया, लेकिन ऐसा करने के लिए इसने पूरे पुस्तकालय पर "शोर" (noise) का एक कंबल डाल दिया। यह शोर सभी की पहचान छिपाने के लिए था, लेकिन यह एक भारी कंबल साबित हुआ जिसने छोटे, कम आम समूहों को कुचल दिया। बड़े, लोकप्रिय समूहों के लिए, लाइब्रेरियन शोर के बावजूद अपना काम अच्छी तरह से कर सकते थे। लेकिन, बहुत छोटे, दुर्लभ समूहों के लिए, शोर इतना तेज़ था कि लाइब्रेरियन कुछ भी समझने में असमर्थ थे, और उनकी सटीकता (accuracy) गिरकर लगभग शून्य हो गई। यह एक शांत कमरे में फुसफुसाहट सुनने की कोशिश करने जैसा है; यदि आप अचानक फुसफुसाहट को छिपाने के लिए एक तेज़ पंखा चला देते हैं, तो बड़ी आवाज़ें अभी भी सुनी जा सकती हैं, लेकिन फुसफुसाहट पूरी तरह से खो जाती है।
शोध पत्र ने "कैलिब्रेटेड इक्वलाइज़्ड ऑड्स" (Calibrated Equalized Odds) नामक एक उपकरण को भी देखा, जो अंतिम उत्तरों को निष्पक्ष बनाने के लिए समायोजित करता है। यह उपकरण गोपनीयता जोखिमों को छिपाने में बहुत अच्छा था (जासूसों के अनुमान को रैंडम बनाना), लेकिन सटीकता के मामले में यह एक आपदा था। इसने न केवल अल्पप्रतिनिधित्व वाले समूहों की मदद की, बल्कि त्रुटियों को एक अराजक तरीके से इधर-उधर कर दिया, जिससे कभी बहुमत समूहों को नुकसान पहुँचा और कभी अल्पसंख्यक समूहों को, बिना किसी स्पष्ट पैटर्न के।
संक्षेप में, लेखक दिखाते हैं कि ऐसा कोई "जादुई बटन" नहीं है जो निष्पक्षता, गोपनीयता और सटीकता तीनों को एक साथ ठीक कर सके। परिणाम बताते हैं कि इन उपकरणों का प्रभाव समूह के आकार, उपयोग किए जाने वाले कंप्यूटर मॉडल के प्रकार और चुनी गई विशिष्ट पद्धति पर निर्भर करता है। यदि आप एक निष्पक्ष और निजी प्रणाली बनाना चाहते हैं, तो आप केवल औसत को नहीं देख सकते। आपको प्रत्येक विशिष्ट उपसमूह (subgroup) का ऑडिट करना होगा, क्योंकि जो बहुमत के लिए काम करता है, वह अल्पसंख्यक के लिए गोपनीयता का दुस्वप्न या उपयोगिता की आपदा हो सकता है। यह शोध पत्र इस समस्या को हमेशा के लिए हल करने का दावा नहीं करता है, बल्कि यह पहली बार एक स्पष्ट मानचित्र प्रदान करता है जो दिखाता है कि निष्पक्षता और गोपनीयता के जंगल में जाल कहाँ छिपे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।