← नवीनतम पेपर
📊 statistics

A Maximum Entropy Implementation of Differential Privacy Under Linear Invariants

यह शोध पत्र एक उच्च-एन्ट्रॉपी विभेदक गोपनीयता (high-entropy differential privacy) कार्यान्वयन का प्रस्ताव करता है जो अनिवार्य रैखिक एकत्रीकरण अपरिवर्तों (जैसे कि अवस्था कुल) को लगभग निश्चितता के साथ संतुष्ट करता है, जबकि नई गोपनीयता गारंटी प्राप्त करता है और सहसंबंध मैट्रिसेस (correlation matrices) के नल स्पेस (null space) के संबंध में सैद्धांतिक प्रश्नों का समाधान करता है।

मूल लेखक: Ryan Lafferty, Anindya Roy

प्रकाशित 2026-07-27
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ryan Lafferty, Anindya Roy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो जनता के साथ किताबों के उधार लेने वालों की एक गुप्त सूची साझा करने की कोशिश कर रहे हैं, लेकिन आपके पास एक सख्त वादा है: आपको कभी भी यह खुलासा नहीं करना है कि किसी विशिष्ट पुस्तक को किसने उधार लिया था। इस वादे को निभाने के लिए, आप सूची में थोड़ा सा "स्टैटिक" या शोर (noise) जोड़ने का निर्णय लेते हैं, जैसे कि कुछ ऐसे यादृच्छिक (random) नाम जोड़ना जो वास्तव में वहां नहीं थे, या कुछ नामों को थोड़ा बदल देना। यह डिफरेंशियल प्राइवेसी (Differential Privacy) का मूल विचार है—एक गणितीय ढाल जिसका उपयोग सरकारें और तकनीकी दिग्गज हमें व्यक्तिगत विवरणों को उजागर किए बिना डेटा से सीखने में मदद करने के लिए करते हैं।

हालाँकि, इसमें एक पेंच है: कभी-कभी, खेल के नियम मांग करते हैं कि कुछ बड़े-स्तर के आंकड़े बिल्कुल समान रहने चाहिए। उदाहरण के लिए, एक राज्य में लोगों की कुल संख्या उसके सभी काउंटियों के योग के बराबर होनी चाहिए। यदि आप केवल प्रत्येक काउंटी के काउंट में यादृच्छिक शोर जोड़ते हैं, तो राज्य का कुल योग विचलित हो जाएगा, जिससे गणित बिगड़ जाएगा और डेटा आधिकारिक रिकॉर्ड के लिए बेकार हो जाएगा। यह एक खींचतान पैदा करता है: आप गोपनीयता बनाए रखने के लिए पर्याप्त शोर जोड़ना चाहते हैं, लेकिन आप यह भी चाहते हैं कि शोर पूरी तरह से एक-दूसरे को रद्द कर दे ताकि बड़े कुल आंकड़े अपरिवर्तित रहें। यह शोध पत्र इस जटिल गणित पर काम करता है कि कैसे गोपनीयता की ढाल को तोड़े बिना इस "पूरी तरह से रद्द करने वाले" शोर को जोड़ा जाए।


पूर्णतः संतुलित शोर की पहेली

कल्पना कीजिए कि आप एक बहुत ही नखरेबाज जज के लिए केक बनाने की कोशिश कर रहे एक शेफ हैं। जज के दो नियम हैं:

  1. स्वाद का नियम: केक का हर निवाला बिल्कुल एक विशिष्ट स्वाद (मान लीजिए वनीला) जैसा होना चाहिए ताकि यह सुनिश्चित हो सके कि रेसिपी का पालन किया गया है।
  2. वजन का नियम: केक का कुल वजन ठीक 1,000 ग्राम होना चाहिए। न इससे ज्यादा, न इससे कम।

अब, कल्पना कीजिए कि आप रेसिपी के मूल स्रोत की रक्षा करने के लिए बैटर (batter) में "गुप्त सामग्री" (शोर) मिला रहे हैं। यदि आप हर कटोरे में यादृच्छिक रूप से वनीला बीन्स की एक मुट्ठी छिड़कते हैं, तो केक का कुल वजन गलत हो जाएगा। हो सकता है कि अंत में 1,005 ग्राम या 990 ग्राम वजन निकले। यदि आप वजन को ठीक करने के लिए ऊपर से अतिरिक्त ग्राम घटाने की कोशिश करते हैं, तो आप "स्वाद के नियम" को खराब कर देते हैं क्योंकि ऊपरी परत का स्वाद बाकी हिस्सों से अलग हो जाता है।

यह वही समस्या है जिसे लेखक, रयान लैफ़र्टी और अनिंद्य रॉय हल कर रहे हैं। डेटा की दुनिया में, "केक" एक डेटाबेस (जैसे अमेरिकी जनगणना) है, "निवाले" व्यक्तिगत डेटा बिंदु हैं (जैसे किसी पड़ोस में एक व्यक्ति की संख्या), और "गुप्त सामग्रियां" पहचान को छिपाने के लिए जोड़ी गई यादृच्छिक संख्याएं हैं। "वजन का नियम" लीनियर इनवेरियंट्स (linear invariants) का प्रतिनिधित्व करता है—ऐसी बाधाएं जैसे "एक राज्य की कुल जनसंख्या उसके काउंटियों के योग के बराबर होनी चाहिए।"

पुराना तरीका बनाम नया तरीका

पहले, डेटा वैज्ञानिक इस समस्या को हल करने के लिए पहले शोर जोड़ते थे और फिर बाद में कुल आंकड़ों को "ठीक" करते थे। वे हर काउंटी में यादृच्छिक संख्याएं जोड़ते थे, देखते थे कि राज्य का कुल योग गलत है, और फिर संख्या को सही मात्रा पर वापस लाने के लिए उसे समायोजित करते थे।

लेखकों का तर्क है कि यह "बाद में ठीक करने वाला" दृष्टिकोण एक मुड़े हुए कागज को भारी किताब से दबाकर सीधा करने जैसा है। यह देखने में तो सपाट लग सकता है, लेकिन कागज अब दब गया और विकृत हो गया है। गणितीय शब्दों में, यह "प्रोजेक्शन" (projection) विधि शोर को एक कोने में सिकोड़ देती है, जिससे यह कम यादृच्छिक (कम एंट्रॉपी वाला) हो जाता है और संभावित रूप से गोपनीयता की गारंटी को कमजोर कर देता है। ऐसा लगता है जैसे शोर अनुमानित हो गया है, जो गोपनीयता के लिए बुरा है।

"मैक्सिमम एंट्रॉपी" समाधान

बाद में गड़बबियों को ठीक करने के बजाय, लेखक शुरू से ही सामग्रियों को मिलाने का एक स्मार्ट तरीका प्रस्तावित करते हैं। उन्होंने ऐसा शोर उत्पन्न करने का तरीका विकसित किया है जो सहसंबंधित (correlated) है।

इसे नृत्य करने वाली टीम की तरह सोचें। यदि प्रत्येक डांसर यादृच्छिक रूप से चलता है, तो समूह अराजक दिखता है, लेकिन समूह का केंद्र भटक सकता है। यदि आप चाहते हैं कि समूह एक ही स्थान पर रहे (इनवेरिएंट), तो आप उन्हें रुकने के लिए नहीं कह सकते। इसके बजाय, आप उन्हें इस तरह कोरियोग्राफ करते हैं कि जब एक डांसर आगे कदम बढ़ाता है, तो दूसरा ठीक उसी मात्रा में पीछे हट जाता है। वे एक साथ चल रहे हैं, लेकिन उनकी गतिविधियाँ आपस में जुड़ी हुई हैं ताकि समूह अपनी जगह पर बना रहे।

शोध पत्र एक "मैक्सिमम एंट्रॉपी" कार्यान्वयन का प्रस्ताव करता है। सरल शब्दों में, "एंट्रॉपी" यादृच्छिकता या आश्चर्य का माप है। लेखक चाहते हैं कि शोर जितना संभव हो उतना अप्रत्याशित और "आश्चर्यजनक" (उच्च एंट्रॉपी) हो, जबकि यह नियम भी पालन करे कि कुल योग शून्य हो। वे एक गणितीय उपकरण प्रोजेक्टेड ग्रेडिएंट डिसेंट (Projected Gradient Descent) का उपयोग करते हैं (जो "नृत्य के कदमों को बार-बार समायोजित करने" का एक फैंसी तरीका है) ताकि सटीक कोरियोग्राफी खोजी जा सके।

वे POCS (Projection onto Convex Sets) नामक एक तकनीक का भी उपयोग करते हैं, जो "हॉट एंड कोल्ड" के खेल की तरह है जहाँ आप शोर को तब तक समायोजित करते रहते हैं जब तक कि वह नियमों द्वारा परिभाषित एक विशिष्ट आकार में पूरी तरह फिट न हो जाए। परिणाम एक शोर वेक्टर (noise vector) है जो:

  1. डेटा के प्रत्येक व्यक्तिगत हिस्से के लिए उस मानक शोर की तरह दिखता है जिसकी हम अपेक्षा करते हैं (गौसियन या लाप्लास)।
  2. हर बार शून्य (या आवश्यक इनवेरिएंट) के बराबर होता है।
  3. गणितीय रूप से जितना संभव हो उतना यादृच्छिक है, जो सबसे मजबूत गोपनीयता सुरक्षा सुनिश्चित करता है।

उन्होंने क्या पाया और सिद्ध किया

लेखकों ने केवल अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने इसे सिद्ध किया।

  • गारंटी: उन्होंने दिखाया कि इस जटिल, जुड़े हुए शोर के साथ भी, सिस्टम अभी भी डिफरेंशियल प्राइवेसी (विशेष रूप से (ϵ,δ)(\epsilon, \delta)-DP) की मानक गणितीय गारंटी प्रदान करता है। इसका अर्थ है कि गोपनीयता कवच उतना ही मजबूत है जितना कि पुराने, सरल तरीके, भले ही अब शोर एक समन्वित तरीके से "नृत्य" कर रहा हो।
  • गणितीय जादू: उनके काम का एक बड़ा हिस्सा कोरिलेशन मैट्रिसेस (correlation matrices) (गणितीय ग्रिड जो बताते हैं कि चर एक दूसरे से कैसे संबंधित हैं) के बारे में एक कठिन पहेली को हल करने में लगा। उन्होंने इन मैट्रिसेस के "नल स्पेस" (null space) के बारे में एक खुले प्रश्न का आंशिक समाधान प्रदान किया—अर्थात, यह पता लगाया कि जुड़े हुए शोर के कौन से पैटर्न संभव हैं।
  • सिमुलेशन: उन्होंने अपने तरीके का परीक्षण सिम्युलेटेड डेटा के साथ किया, जिसमें राज्यों, काउंटियों और ब्लॉक्स के साथ अमेरिकी जनगणना की नकल करने वाला परिदृश्य शामिल था। उन्होंने दिखाया कि जब उन्होंने सबसे छोटे ब्लॉक्स पर शोर जोड़ा, तो काउंटी और राज्य के कुल आंकड़े पूरी तरह से बरकरार रहे, जबकि व्यक्तिगत ब्लॉक की संख्या अभी भी पहचान की सुरक्षा के लिए पर्याप्त रूप से अस्पष्ट थी।

यह क्यों मायने रखता है

यह केवल एक सैद्धांतिक खेल नहीं है। अमेरिकी जनगणना ब्यूरो और अन्य एजेंसियां हर बार इस समस्या का सामना करती हैं जब वे डेटा जारी करती हैं। उनके पास संवैधानिक जनादेश हैं जो कहते हैं कि राज्य के कुल आंकड़ों को बदला नहीं जा सकता है, लेकिन उन्हें हर एक व्यक्ति की गोपनीयता की रक्षा करने की भी आवश्यकता है।

लेखकों का तरीका इसे करने का एक "सिद्धांत आधारित" (principled) तरीका प्रदान करता है। डेटा को बाद में बदलने के बजाय, वे डेटा को शुरुआत से ही सही ढंग से उत्पन्न करने का एक तरीका प्रदान करते हैं। उन्होंने यह भी उल्लेख किया कि यह दृष्टिकोण अन्य प्रकार के डेटा के लिए भी उपयोगी हो सकता है, जैसे स्मार्ट मीटर रीडिंग (जहाँ एक पड़ोस के कुल ऊर्जा उपयोग को व्यक्तिगत घरों के योग से मेल खाना चाहिए) या पहनने योग्य उपकरणों (wearable devices) का डेटा।

संक्षेप में, यह शोध पत्र दिखाता है कि आपको सटीक कुल आंकड़ों और मजबूत गोपनीयता के बीच चुनाव करने की आवश्यकता नहीं है। शोर को कोरियोग्राफ करने के लिए उन्नत गणित का उपयोग करके, आप दोनों प्राप्त कर सकते हैं: एक ऐसा डेटासेट जो बड़े नियमों के साथ पूरी तरह से सुसंगत है, फिर भी सूक्ष्म विवरणों के लिए पूरी तरह सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →