Label Differential Privacy via Aggregation
यह शोध पत्र प्रतिगमन (रिग्रेशन) कार्यों के लिए एक लेबल डिफरेंशियल प्राइवेसी फ्रेमवर्क प्रस्तावित करता है जो प्रशिक्षण इंस्टेंस या विलगित बैग्स (disjoint bags) के भारित रैखिक एकत्रीकरण (weighted linear aggregation) के माध्यम से मजबूत गोपनीयता गारंटी प्राप्त करता है, जो बिना किसी योगात्मक लेबल शोर (additive label noise) की आवश्यकता के बेहतर व्यावहारिक सीमाएं और उपयोगिता संरक्षण प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक डिजिटल युग में, कंप्यूटर प्रोग्रामों को प्रशिक्षित करने के लिए हर दिन भारी मात्रा में व्यक्तिगत जानकारी एकत्र की जाती है जो भविष्यवाणियां करते हैं, जैसे कि घरों की कीमतों का अनुमान लगाना या बिक्री का पूर्वानुमान लगाना। इस क्षेत्र में एक महत्वपूर्ण चुनौती यह है कि इन प्रणालियों को उन व्यक्तियों के संवेदनशील विवरणों को उजागर किए बिना कैसे सिखाया जाए जिन्होंने डेटा प्रदान किया है। एक शक्तिशाली समाधान, जिसे 'डिफरेंशियल प्राइवेसी' (विभेदक गोपनीयता) के रूप में जाना जाता है, एक गणितीय ढाल की तरह कार्य करता है। यह सुनिश्चित करता है कि कंप्यूटर विश्लेषण का अंतिम परिणाम लगभग वैसा ही दिखता है चाहे किसी एक व्यक्ति का डेटा शामिल किया गया हो या नहीं, जिससे किसी बाहरी व्यक्ति के लिए उस विशिष्ट व्यक्ति की जानकारी को रिवर्स-इंजीनियर करना असंभव हो जाता है। हालांकि यह अवधारणा सामान्य डेटा के लिए अच्छी तरह से अध्ययन की गई है, लेकिन एक विशिष्ट और कठिन समस्या तब उत्पन्न होती है जब संवेदनशील जानकारी पूरी तरह से 'लेबल'—यानी डेटा के साथ जुड़ी प्रतिक्रियाओं या परिणामों—के भीतर छिपी होती है, जैसे कि किसी रोगी का चिकित्सा निदान या किसी मतदाता का चुनाव। डेटा के उपयोगी पैटर्न सीखने की क्षमता को नष्ट किए बिना इन लेबल को सुरक्षित रखना लंबे समय से एक बाधा रही है।
गूगल रिसर्च इंडिया के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए एक नया तरीका विकसित किया है, जो डेटा का उपयोग करने से पहले इसे समूहीकृत (ग्रुपिंग) और संयोजित करने के तरीके को बदलकर काम करता है। डेटा में रैंडम शोर (नॉइज़) जोड़ने के बजाय, जो अक्सर परिणामों को धुंधला कर देता है और सटीकता को कम कर देता है, उन्होंने 'वेटेड एग्रीगेशन' (भारित एकत्रीकरण) की एक तकनीक प्रस्तावित की है। कल्पना कीजिए कि व्यक्तिगत रिकॉर्डों के एक बड़े संग्रह को लेकर उन्हें छोटे समूहों, या "थैलों" (बैग्स) में मिलाया जा रहा है। उनके दृष्टिकोण में, एक बैग के भीतर प्रत्येक रिकॉर्ड को एक विशिष्ट, बेले-आकार के वितरण (बेल-शेप्ड डिस्ट्रीब्यूशन) से प्राप्त एक अद्वितीय, यादृच्छिक (रैंडमली जनरेटेड) संख्या से गुणा किया जाता है। सिस्टम फिर इन भारित रिकॉर्डों को जोड़कर उस बैग के लिए एक एकल, नया डेटा बिंदु बनाता है। यह प्रक्रिया कई ऐसे एकत्रित बिंदुओं को बनाने के लिए दोहराई जाती है। शोधकर्ताओं ने पाया कि डेटा को मिलाने का यह विशिष्ट तरीका, इन रैंडम वेट्स का उपयोग करके, मूल लेबल की गोपनीयता की रक्षा करने के लिए एक गणितीय बाधा बनाता है। महत्वपूर्ण रूप से, उन्होंने सिद्ध किया कि यह सुरक्षा तब भी बनी रहती है जब एक हमलावर को बैग के अन्य सभी रिकॉर्डों के बारे में सब कुछ पता हो, बशर्ते कि डेटासेट पर्याप्त बड़ा हो और लेबल सभी एक समान न हों।
यह अध्ययन प्रदर्शित करता है कि यह विधि दो अलग-अलग परिदृश्यों के लिए प्रभावी ढंग से कार्य करती है। पहले मामले में, पूरे डेटासेट के प्रत्येक रिकॉर्ड को प्रत्येक बैग में शामिल किया जाता है, जिससे अत्यधिक मिश्रित एग्रीगेट्स का सेट बनता है। दूसरे मामले में, डेटासेट को कई छोटे, गैर-अतिव्यापी (नॉन-ओवरलैपिंग) समूहों में विभाजित किया जाता है, और प्रत्येक समूह को अलग से संसाधित किया जाता है। दोनों ही मामलों में, शोधकर्ताओं ने दिखाया कि एक कंप्यूटर मॉडल जो इन एकत्रित, गोपनीयता-सुरक्षित बिंदुओं पर प्रशिक्षित होता है, वह मूल, कच्चे डेटा पर प्रशिक्षित मॉडल जितनी ही सटीकता से भविष्यवाणियां करने में सक्षम है। उन्होंने इसका परीक्षण विशाल वास्तविक दुनिया के डेटासेट्स पर किया, जिसमें 1940 के 130 मिलियन से अधिक लोगों का जनगणना डेटा और एक ऑनलाइन विज्ञापन प्लेटफॉर्म के 1.7 मिलियन से अधिक रिकॉर्डों का संग्रह शामिल था। परिणाम स्पष्ट थे: एकत्रित डेटा पर प्रशिक्षित मॉडल ने कच्चे डेटा पर प्रशिक्षित मॉडल के लगभग समान स्तर की सटीकता प्राप्त की, जबकि सख्त गोपनीयता गारंटी का पालन भी किया।
इस कार्य का एक प्रमुख निष्कर्ष यह है कि इन विशेष रैंडम वेट्स के बिना एक समूह में लेबल को केवल जोड़ देने से कोई वास्तविक गोपनीयता सुरक्षा नहीं मिलती है। यदि डेटा को केवल जोड़ा जाता है, तो एक अकेले व्यक्ति के लेबल में बदलाव से कुल योग में एक पता लगाने योग्य बदलाव होगा, जिससे उसकी जानकारी उजागर हो जाएगी। शोधकर्ताओं ने सिद्ध किया कि व्यक्तिगत योगदान को छिपाने के लिए रैंडम वेटिंग अनिवार्य है। इसके अलावा, उन्होंने दिखाया कि इस तकनीक के लिए लेबल में अतिरिक्त शोर (नॉइज़) जोड़ने की आवश्यकता नहीं होती है, जो अन्य गोपनीयता विधियों की एक सामान्य आवश्यकता है जो अक्सर सीखने की गुणवत्ता को कम कर देती है। केवल इस वेटेड एग्रीगेशन के गणितीय गुणों पर भरोसा करके, उन्होंने 'रिग्रेशन' कार्यों के लिए डेटा की उपयोगिता को संरक्षित किया, जिनका उपयोग बिक्री के आंकड़ों या काम के घंटों जैसे निरंतर मूल्यों (कंटीन्यूअस वैल्यूज) की भविष्यवाणी करने के लिए किया जाता है।
टीम ने एक ऐसा रूपांतरण भी तलाशा जहाँ लेबल के एक छोटे हिस्से को समूहों में मिलाने से पहले जानबूझकर शोर के साथ बदला जाता है, जिसे वेटेड एग्रीगेशन के साथ जोड़ा गया है। इस हाइब्रिड दृष्टिकोण ने उन्हें न्यूरल नेटवर्क वाले जटिल लर्निंग कार्यों तक अपनी गोपनीयता गारंटी का विस्तार करने की अनुमति दी, जो गहरे पैटर्न को संभालने में सक्षम डीप लर्निंग मॉडल हैं। उनके प्रयोगों ने पुष्टि की कि इन अतिरिक्त जटिलताओं के साथ भी, मॉडल उच्च उपयोगिता बनाए रखते हैं। यह कार्य सुझाव देता है कि कई व्यावहारिक अनुप्रयोगों के लिए, विशेष रूप से उन अनुप्रयोगों के लिए जो नियमों या सिस्टम की सीमाओं के कारण कच्चे व्यक्तिगत डेटा के उपयोग को प्रतिबंधित करते हैं, यह एकत्रीकरण विधि एक मजबूत मार्ग प्रदान करती है। यह संगठनों को संख्याओं के पीछे के व्यक्तियों की गोपनीयता से समझौता किए बिना, संवेदनशील डेटा का उपयोग करके शक्तिशाली भविष्य कहने वाले उपकरण बनाने की अनुमति देता है, और वह भी बिना उस महत्वपूर्ण सटीकता हानि के जो अक्सर गोपनीयता-संरक्षण तकनीकों के साथ आती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।