← नवीनतम पेपर
📊 statistics

Label Differential Privacy via Aggregation

यह शोध पत्र प्रतिगमन (रिग्रेशन) कार्यों के लिए एक लेबल डिफरेंशियल प्राइवेसी फ्रेमवर्क प्रस्तावित करता है जो प्रशिक्षण इंस्टेंस या विलगित बैग्स (disjoint bags) के भारित रैखिक एकत्रीकरण (weighted linear aggregation) के माध्यम से मजबूत गोपनीयता गारंटी प्राप्त करता है, जो बिना किसी योगात्मक लेबल शोर (additive label noise) की आवश्यकता के बेहतर व्यावहारिक सीमाएं और उपयोगिता संरक्षण प्रदान करता है।

मूल लेखक: Anand Brahmbhatt, Rishi Saket, Shreyas Havaldar, Anshul Nasery, Yukti Makhija, Aravindan Raghuveer

प्रकाशित 2026-09-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anand Brahmbhatt, Rishi Saket, Shreyas Havaldar, Anshul Nasery, Yukti Makhija, Aravindan Raghuveer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक डिजिटल युग में, कंप्यूटर प्रोग्रामों को प्रशिक्षित करने के लिए हर दिन भारी मात्रा में व्यक्तिगत जानकारी एकत्र की जाती है जो भविष्यवाणियां करते हैं, जैसे कि घरों की कीमतों का अनुमान लगाना या बिक्री का पूर्वानुमान लगाना। इस क्षेत्र में एक महत्वपूर्ण चुनौती यह है कि इन प्रणालियों को उन व्यक्तियों के संवेदनशील विवरणों को उजागर किए बिना कैसे सिखाया जाए जिन्होंने डेटा प्रदान किया है। एक शक्तिशाली समाधान, जिसे 'डिफरेंशियल प्राइवेसी' (विभेदक गोपनीयता) के रूप में जाना जाता है, एक गणितीय ढाल की तरह कार्य करता है। यह सुनिश्चित करता है कि कंप्यूटर विश्लेषण का अंतिम परिणाम लगभग वैसा ही दिखता है चाहे किसी एक व्यक्ति का डेटा शामिल किया गया हो या नहीं, जिससे किसी बाहरी व्यक्ति के लिए उस विशिष्ट व्यक्ति की जानकारी को रिवर्स-इंजीनियर करना असंभव हो जाता है। हालांकि यह अवधारणा सामान्य डेटा के लिए अच्छी तरह से अध्ययन की गई है, लेकिन एक विशिष्ट और कठिन समस्या तब उत्पन्न होती है जब संवेदनशील जानकारी पूरी तरह से 'लेबल'—यानी डेटा के साथ जुड़ी प्रतिक्रियाओं या परिणामों—के भीतर छिपी होती है, जैसे कि किसी रोगी का चिकित्सा निदान या किसी मतदाता का चुनाव। डेटा के उपयोगी पैटर्न सीखने की क्षमता को नष्ट किए बिना इन लेबल को सुरक्षित रखना लंबे समय से एक बाधा रही है।

गूगल रिसर्च इंडिया के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए एक नया तरीका विकसित किया है, जो डेटा का उपयोग करने से पहले इसे समूहीकृत (ग्रुपिंग) और संयोजित करने के तरीके को बदलकर काम करता है। डेटा में रैंडम शोर (नॉइज़) जोड़ने के बजाय, जो अक्सर परिणामों को धुंधला कर देता है और सटीकता को कम कर देता है, उन्होंने 'वेटेड एग्रीगेशन' (भारित एकत्रीकरण) की एक तकनीक प्रस्तावित की है। कल्पना कीजिए कि व्यक्तिगत रिकॉर्डों के एक बड़े संग्रह को लेकर उन्हें छोटे समूहों, या "थैलों" (बैग्स) में मिलाया जा रहा है। उनके दृष्टिकोण में, एक बैग के भीतर प्रत्येक रिकॉर्ड को एक विशिष्ट, बेले-आकार के वितरण (बेल-शेप्ड डिस्ट्रीब्यूशन) से प्राप्त एक अद्वितीय, यादृच्छिक (रैंडमली जनरेटेड) संख्या से गुणा किया जाता है। सिस्टम फिर इन भारित रिकॉर्डों को जोड़कर उस बैग के लिए एक एकल, नया डेटा बिंदु बनाता है। यह प्रक्रिया कई ऐसे एकत्रित बिंदुओं को बनाने के लिए दोहराई जाती है। शोधकर्ताओं ने पाया कि डेटा को मिलाने का यह विशिष्ट तरीका, इन रैंडम वेट्स का उपयोग करके, मूल लेबल की गोपनीयता की रक्षा करने के लिए एक गणितीय बाधा बनाता है। महत्वपूर्ण रूप से, उन्होंने सिद्ध किया कि यह सुरक्षा तब भी बनी रहती है जब एक हमलावर को बैग के अन्य सभी रिकॉर्डों के बारे में सब कुछ पता हो, बशर्ते कि डेटासेट पर्याप्त बड़ा हो और लेबल सभी एक समान न हों।

यह अध्ययन प्रदर्शित करता है कि यह विधि दो अलग-अलग परिदृश्यों के लिए प्रभावी ढंग से कार्य करती है। पहले मामले में, पूरे डेटासेट के प्रत्येक रिकॉर्ड को प्रत्येक बैग में शामिल किया जाता है, जिससे अत्यधिक मिश्रित एग्रीगेट्स का सेट बनता है। दूसरे मामले में, डेटासेट को कई छोटे, गैर-अतिव्यापी (नॉन-ओवरलैपिंग) समूहों में विभाजित किया जाता है, और प्रत्येक समूह को अलग से संसाधित किया जाता है। दोनों ही मामलों में, शोधकर्ताओं ने दिखाया कि एक कंप्यूटर मॉडल जो इन एकत्रित, गोपनीयता-सुरक्षित बिंदुओं पर प्रशिक्षित होता है, वह मूल, कच्चे डेटा पर प्रशिक्षित मॉडल जितनी ही सटीकता से भविष्यवाणियां करने में सक्षम है। उन्होंने इसका परीक्षण विशाल वास्तविक दुनिया के डेटासेट्स पर किया, जिसमें 1940 के 130 मिलियन से अधिक लोगों का जनगणना डेटा और एक ऑनलाइन विज्ञापन प्लेटफॉर्म के 1.7 मिलियन से अधिक रिकॉर्डों का संग्रह शामिल था। परिणाम स्पष्ट थे: एकत्रित डेटा पर प्रशिक्षित मॉडल ने कच्चे डेटा पर प्रशिक्षित मॉडल के लगभग समान स्तर की सटीकता प्राप्त की, जबकि सख्त गोपनीयता गारंटी का पालन भी किया।

इस कार्य का एक प्रमुख निष्कर्ष यह है कि इन विशेष रैंडम वेट्स के बिना एक समूह में लेबल को केवल जोड़ देने से कोई वास्तविक गोपनीयता सुरक्षा नहीं मिलती है। यदि डेटा को केवल जोड़ा जाता है, तो एक अकेले व्यक्ति के लेबल में बदलाव से कुल योग में एक पता लगाने योग्य बदलाव होगा, जिससे उसकी जानकारी उजागर हो जाएगी। शोधकर्ताओं ने सिद्ध किया कि व्यक्तिगत योगदान को छिपाने के लिए रैंडम वेटिंग अनिवार्य है। इसके अलावा, उन्होंने दिखाया कि इस तकनीक के लिए लेबल में अतिरिक्त शोर (नॉइज़) जोड़ने की आवश्यकता नहीं होती है, जो अन्य गोपनीयता विधियों की एक सामान्य आवश्यकता है जो अक्सर सीखने की गुणवत्ता को कम कर देती है। केवल इस वेटेड एग्रीगेशन के गणितीय गुणों पर भरोसा करके, उन्होंने 'रिग्रेशन' कार्यों के लिए डेटा की उपयोगिता को संरक्षित किया, जिनका उपयोग बिक्री के आंकड़ों या काम के घंटों जैसे निरंतर मूल्यों (कंटीन्यूअस वैल्यूज) की भविष्यवाणी करने के लिए किया जाता है।

टीम ने एक ऐसा रूपांतरण भी तलाशा जहाँ लेबल के एक छोटे हिस्से को समूहों में मिलाने से पहले जानबूझकर शोर के साथ बदला जाता है, जिसे वेटेड एग्रीगेशन के साथ जोड़ा गया है। इस हाइब्रिड दृष्टिकोण ने उन्हें न्यूरल नेटवर्क वाले जटिल लर्निंग कार्यों तक अपनी गोपनीयता गारंटी का विस्तार करने की अनुमति दी, जो गहरे पैटर्न को संभालने में सक्षम डीप लर्निंग मॉडल हैं। उनके प्रयोगों ने पुष्टि की कि इन अतिरिक्त जटिलताओं के साथ भी, मॉडल उच्च उपयोगिता बनाए रखते हैं। यह कार्य सुझाव देता है कि कई व्यावहारिक अनुप्रयोगों के लिए, विशेष रूप से उन अनुप्रयोगों के लिए जो नियमों या सिस्टम की सीमाओं के कारण कच्चे व्यक्तिगत डेटा के उपयोग को प्रतिबंधित करते हैं, यह एकत्रीकरण विधि एक मजबूत मार्ग प्रदान करती है। यह संगठनों को संख्याओं के पीछे के व्यक्तियों की गोपनीयता से समझौता किए बिना, संवेदनशील डेटा का उपयोग करके शक्तिशाली भविष्य कहने वाले उपकरण बनाने की अनुमति देता है, और वह भी बिना उस महत्वपूर्ण सटीकता हानि के जो अक्सर गोपनीयता-संरक्षण तकनीकों के साथ आती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →