The Unseen Hand: Manipulating Model Fairness and SHAP with Targeted Identity Re-Association Attacks
यह शोध पत्र टार्गेटेड आइडेंटिटी री-एसोसिएशन (TIRA) हमलों को प्रस्तुत करता है, जो एक नवीन डेटा-अज्ञेय (data-agnostic) विधि है जो संभाव्यता आधारित माइक्रो-शफलिंग और रैंक-शिफ्ट गड़बड़ी का उपयोग करके मशीन लर्निंग मॉडलों को गुप्त रूप से हेरफेर करती है, जिससे निष्पक्षता मेट्रिक्स को कृत्रिम रूप से अनुकूलित किया जाता है और SHAP स्पष्टीकरणों में संरक्षित विशेषता एट्रिब्यूशंस को पूरी तरह से शून्य कर दिया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "द अनसीन हैंड" (The Unseen Hand) पेपर का सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
बड़ी तस्वीर: AI का "जादुई करतब" (The Magic Trick)
कल्पना कीजिए कि आपने एक खेल के परिणाम का निर्णय करने के लिए एक रेफरी को काम पर रखा है। यह सुनिश्चित करने के लिए कि रेफरी निष्पक्ष है, आपके पास दो उपकरण हैं:
- स्कोरबोर्ड (The Scoreboard): अंकों की एक सूची जो दिखाती है कि कौन जीता और कितने अंतर से।
- रिप्ले कैमरा (SHAP): एक स्लो-मोशन कैमरा जो ज़ूम इन करके यह दिखाता है कि रेफरी ने एक विशिष्ट निर्णय क्यों लिया (जैसे, "उसने लाल जूते पहनने के कारण फाउल दिया")।
आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इन उपकरणों का उपयोग यह जांचने के लिए किया जाता है कि क्या एक मॉडल लोगों के विभिन्न समूहों (जैसे पुरुषों बनाम महिलाओं, या विभिन्न जातीयताओं) के प्रति निष्पक्ष है।
पेपर का दावा: लेखकों ने खोजा है कि एक "हैकर" को रेफरी के दिमाग को तोड़ने या खेल के नियम बदलने की आवश्यकता नहीं है। इसके बजाय, वे खेल खत्म होने के बाद नामों और स्कोर की सूची पर एक सूक्ष्म जादुई करतब कर सकते हैं। नामों को बस थोड़ा सा इधर-उधर बदलकर, वे स्कोरबोर्ड को पूरी तरह से निष्पक्ष दिखा सकते हैं और रिप्ले कैमरे को यह विश्वास दिलाने के लिए धोखा दे सकते हैं कि रेफरी को खिलाड़ियों की पहचान से कभी कोई फर्क नहीं पड़ा।
समस्या: "स्पष्ट" चालें (The Obvious Tricks)
इन फेयरनेस (निष्पक्षता) जांचों को ठगने के पिछले प्रयास एक जादूगर द्वारा एक विशाल, चमकती छड़ी लहराने जैसे थे।
- वे डेटा के बड़े हिस्सों को बदल देते थे।
- परिणाम: निष्पक्षता के स्कोर तो बदल जाते थे, लेकिन "रिप्ले कैमरा" (SHAP) अभी भी उस गड़बड़ी को देख लेता था। वह चिल्ला उठता: "हे! यहाँ कुछ अजीब हुआ है!" और वह चाल पकड़ी जाती।
समाधान: "अनसीन हैंड" (TIRA Attacks)
लेखक TIRA (टारगेटेड आइडेंटिटी री-एसोसिएशन) नामक हमलों का एक नया परिवार पेश करते हैं। इसे एक जादुगत छड़ी के रूप में नहीं, बल्कि एक सूक्ष्म सर्जन (Micro-surgeon) या मंद हवा के झोंके के रूप में सोचें।
डेटा को धकेलने के लिए बड़े, स्पष्ट बदलाव करने के बजाय, TIRA दो विशिष्ट तकनीकों का उपयोग करता है:
प्रोबेबिलिस्टिक माइक्रो-शफलिंग (PMiS):
- उदाहरण: कल्पना कीजिए कि टिकटों के लिए लोगों की एक कतार खड़ी है। हैकर भीड़ में खड़ा है। हर कुछ सेकंड में, वह एक सिक्का उछालता है। यदि 'हेड्स' आता है, तो वह चुपचाप कतार में सबसे आगे खड़े व्यक्ति को उसके ठीक पीछे खड़े व्यक्ति के साथ बदल देता है—लेकिन केवल तभी जब पीछे वाला व्यक्ति एक "वंचित" समूह से हो।
- प्रभाव: वे ऐसा हजारों बार करते हैं, लेकिन बहुत कम प्रतिशत के लिए। कतार काफी हद तक वैसी ही दिखती है, लेकिन क्रम इतना बदल जाता है कि सांख्यिकी (Statistics) बदल जाए।
प्रोबेबिलिस्टिक रैंक-शिफ्ट माइक्रो-परटर्बेशन (PRSMP):
- उदाहरण: यह पिछले तरीके जैसा ही है, लेकिन पड़ोसियों को बदलने के बजाय, हैकर किसी व्यक्ति को एक छोटे से दायरे के भीतर कुछ स्थान नीचे (या ऊपर) धीरे से धकेल देता है। फिर से, वे इसे बेतरतीब ढंग से और बहुत कम बार करते हैं।
- प्रभाव: यह डेटा में एक ऐसा "ड्रिफ्ट" (विचलन) पैदा करता है जो स्वाभाविक लगता है, जैसे कि लोग सहज होने के लिए थोड़ी सी हलचल करते हैं, न कि अचानक मची कोई भगदड़।
उन्होंने क्या हासिल किया?
लेखकों ने इन चालों का परीक्षण वास्तविक दुनिया के डेटा (जैसे मधुमेह के जोखिम या क्रेडिट अनुमोदन की भविष्यवाणी करना) पर किया और दो प्रमुख परिणाम पाए:
1. स्कोरबोर्ड एकदम सही दिखता है (Fairness Metrics)
इन कोमल, यादृच्छिक (Random) बदलावों का उपयोग करके, हैकर "फेयरनेस स्कोर" को एक परफेक्ट 10/10 दिखाने के लिए मजबूर कर सकते थे।
- हमले से पहले: मॉडल पक्षपाती लग रहा था (जैसे, "यह महिलाओं को 20% अधिक बार खारिज करता है")।
- हमले के बाद: मॉडल पूरी तरह से निष्पक्ष दिखता है (जैसे, "यह सभी के साथ बिल्कुल समान व्यवहार करता है")।
- मुख्य बिंदु: AI द्वारा किए गए वास्तविक अनुमान (Predictions) नहीं बदले; केवल यह बदला कि उन अनुमानों को किसको सौंपा गया था।
2. रिप्ले कैमरा धोखा खा जाता है (SHAP)
यह सबसे खतरनाक हिस्सा है। जब लेखकों ने हेक्ड (Hacked) डेटा पर "रिप्ले कैमरा" (SHAP) चलाया:
- पहले: कैमरा स्पष्ट रूप से दिखाता था, "मॉडल निर्णय लेने के लिए जेंडर (Gender) को देख रहा है।"
- बाद में: कैमरे ने जेंडर का शून्य प्रभाव दिखाया। ऐसा लगा जैसे मॉडल को जेंडर से कोई फर्क ही नहीं पड़ता।
- निष्कर्ष: हमले ने हेरफेर के "पदचिह्नों" को सफलतापूर्वक छिपा दिया। ऑडिटर को एक साफ, निष्पक्ष मॉडल दिखता है और वह सोचता है, "सब ठीक है," जबकि वास्तव में मॉडल की निष्पक्षता कृत्रिम रूप से बनाई गई होती है।
यह क्यों मायने रखता है?
यह पेपर तर्क देता है कि हम इन "पोस्ट-गेम" (खेल के बाद की) जांचों पर बहुत अधिक भरोसा कर रहे हैं।
- हम मान लेते हैं कि यदि स्कोरबोर्ड "फेयर" कहता है और रिप्ले कैमरा कहता है कि "कोई पूर्वाग्रह नहीं है," तो AI सुरक्षित है।
- यह पेपर साबित करता है कि एक चतुर हमलावर नामों की सूची में हेरफेर कर सकता है ताकि दोनों उपकरण झूठ बोल सकें।
नियंत्रण के "नॉब्स" (The Knobs of Control)
लेखक इस बात पर जोर देते हैं कि यह कोई अंधाधुंध हथियार नहीं है। वे हमले को नियंत्रित करने के लिए "नॉब्स" (पैरामीटर्स) को घुमा सकते हैं:
- कितनी बार बदलें? (Probability)
- किसी को कितनी दूर तक ले जाएं? (Rank shift)
- इसे कितनी बार करें? (Iterations)
यह एक हमलावर को मॉडल को थोड़ा निष्पक्ष या पूरी तरह से निष्पक्ष दिखाने की अनुमति देता है, जबकि वे बदलावों को इतना छोटा रखते हैं कि कोई भी "अनसीन हैंड" (अदृश्य हाथ) के काम को नोटिस न कर सके।
सारांश
यह पेपर चेतावनी देता है कि AI निष्पक्षता ऑडिट (Fairness Audits) नाजुक होते हैं। केवल इसलिए कि एक AI मॉडल एक निष्पक्षता परीक्षण पास करता है और व्याख्या योग्य (Explainable) दिखता है, इसका मतलब यह नहीं है कि वह वास्तव में निष्पक्ष है। पहचानों का एक सूक्ष्म, संभाव्य (Probabilistic) बदलाव हमारे सर्वोत्तम उपकरणों को एक ऐसे मॉडल को देखने के लिए धोखा दे सकता है जो वास्तव में पक्षपाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।