TabPATE: Differentially Private Tabular In-Context Learning Without Public Data
यह शोध पत्र TabPATE को प्रस्तुत करता है, जो एक विभेदक रूप से निजी (differentially private) ढांचा है टैबुलर इन-कॉन्टेक्स्ट लर्निंग के लिए, जो बिना किसी सार्वजनिक इन-डिस्ट्रीब्यूशन डेटा की आवश्यकता के, मेंबरशिप इन्फरेंस हमलों से सुरक्षा प्रदान करने के लिए टीचर-स्टूडेंट मॉडल और फीचर रेंज या प्राइवेटाइज्ड मार्जिनल्स से उत्पन्न सिंथेटिक क्वेरीज़ का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, प्री-ट्रेंड "ओरेकल" (एक टैबुलर फाउंडेशन मॉडल) है जो कुछ उदाहरण दिए जाने पर लोन अप्रूवल या मेडिकल डायग्नोसिस जैसी चीजें भी प्रेडिक्ट कर सकता है। इसे इन-कॉन्टेक्स्ट लर्निंग (ICL) कहा जाता है। आपको ओरेकल को फिर से ट्रेन करने की जरूरत नहीं है; आप बस उसे कुछ उदाहरणों के माध्यम से धीरे से कान में फुसफुसाते हैं, और वह पैटर्न समझ जाता है।
समस्या क्या है? वे उदाहरण जो आप उसे फुसफुसाते हैं, उनमें निजी रहस्य (जैसे किसी का क्रेडिट कार्ड नंबर या मेडिकल हिस्ट्री) हो सकते हैं।
समस्या: "लीकी व्हिस्पर" (Leaky Whisper)
पेपर यह सिद्ध करके शुरुआत करता है कि यदि आप इन उदाहरणों के रूप में निजी डेटा का उपयोग करते हैं, तो ओरेकल अनजाने में उन रहस्यों को "लीक" कर देता है।
इसे ऐसे सोचें: आप ओरेकल से पूछते हैं, "क्या इस व्यक्ति का क्रेडिट स्कोर अच्छा है?"
- अगर ओरेकल ने पहले ही उस विशिष्ट व्यक्ति के डेटा को अपने "फुसफुसाए गए उदाहरणों" में देखा है, तो वह पहले की तुलना में थोड़े अलग आत्मविश्वास या गति के साथ उत्तर दे सकता है।
- एक चालाक हमलावर (एक "मेंबरशिप इन्फरेंस अटैक") इन सूक्ष्म अंतरों को सुनकर अनुमान लगा सकता है, "आहा! उस व्यक्ति का डेटा मेरे सामने दिए गए उदाहरणों में था!"
लेखकों ने इसका परीक्षण किया और पाया कि भले ही एक निष्क्रिय श्रोता (passive listener) 10% बार सही अनुमान लगा सकता था (जो कि रैंडम चांस से कहीं बेहतर है), लेकिन एक अधिक आक्रामक हमलावर 75% बार सही अनुमान लगा सकता था। यह गोपनीयता की एक बड़ी आपदा है।
पुराना समाधान: "पब्लिक लाइब्रेरी" की समस्या
इस समस्या को ठीक करने के लिए, शोधकर्ताओं ने पहले PATE (प्राइवेट एग्रीगेशन ऑफ टीचर एनसेम्बल्स) नामक एक विधि का उपयोग किया था।
- यह कैसे काम करता था: वे निजी डेटा को कई "टीचर" ओरेकल के बीच विभाजित करते थे। ये शिक्षक प्रश्न के उत्तर पर मतदान करते थे। गोपनीयता की रक्षा के लिए, वे परिणाम घोषित करने से पहले वोट में थोड़ा सा "स्टैटिक नॉइज़" (static noise) जोड़ देते थे।
- द ट्रैप (The Catch): शिक्षकों से सही सवाल पूछने के लिए, आपको समान, गैर-निजी डेटा के एक सार्वजनिक पुस्तकालय (public library) की आवश्यकता होती थी ताकि उन प्रश्नों को बनाया जा सके।
- वास्तविकता: स्वास्थ्य सेवा या वित्त जैसे संवेदनशील क्षेत्रों में, आपके पास समान सार्वजनिक डेटा का "लाइब्रेरी" अक्सर नहीं होता है। आप किसी सार्वजनिक अस्पताल से "नकली" रोगी रिकॉर्ड नहीं मांग सकते जो बिल्कुल आपके निजी रिकॉर्ड जैसे दिखते हों।
नया समाधान: TabPATE (द इमेजिनेशन इंजन)
लेखक TabPATE पेश करते हैं, जो गोपनीयता सुरक्षित करने का एक नया तरीका है जिसे सार्वजनिक पुस्तकालय की आवश्यकता नहीं है।
यहाँ उपमा (analogy) दी गई है:
सार्वजनिक पुस्तकालय की आवश्यकता होने के बजाय, TabPATE खेल के नियमों का उपयोग करके उन्हें "कल्पना" (imagine) करता है।
- नियम ज्ञात हैं: टैबुलर डेटा (जैसे स्प्रेडशीट) के सख्त नियम होते हैं। हम जानते हैं कि "ऊंचाई" वाला कॉलम 0 से 10 फीट के बीच होना चाहिए। हम जानते हैं कि "आयु" एक संख्या है। हम जानते हैं कि "लिंग" एक विशिष्ट श्रेणी है।
- सिंथेटिक क्वेरी जनरेट करना: TabPATE इन ज्ञात नियमों (bounds) का उपयोग करके नकली, सिंथेटिक प्रश्न कल्पना (जनरेट) करता है।
- विकल्प A (शुद्ध कल्पना): यह केवल अनुमत सीमाओं के भीतर यादृच्छिक संख्याएं चुनता है (जैसे, "आयु: 45, ऊंचाई: 5.8")। इसमें गोपनीयता की कोई कीमत नहीं लगती।
- विकल्प B (निर्देशित कल्पना): यदि डेटा जटिल है (जैसे कोई दुर्लभ बीमारी), तो यह डेटा के सामान्य "आकार" को सीखने के लिए थोड़ा सा गोपनीयता बजट खर्च करता है (जैसे, "अधिकांश लोग 30 और 50 के बीच हैं") और फिर ऐसे प्रश्न बनाता है जो उस आकार में फिट बैठते हैं।
- मतदान प्रक्रिया: यह "टीचर" ओरेकल (जिनके पास निजी रहस्य हैं) से इन कल्पित प्रश्नों के बारे में पूछता है।
- सुरक्षित उत्तर: शिक्षक वोट करते हैं, और सिस्टम यह सुनिश्चित करने के लिए वोट में शोर (noise) जोड़ता है कि किसी एक व्यक्ति के रहस्य को रिवर्स-इंजीनियर न किया जा सके।
- परिणाम: सिस्टम एक नई "कल्पित प्रश्नों + सुरक्षित उत्तरों" की सूची जारी करता है। यह सूची ओरेकल के लिए नया "कॉन्टेक्स्ट" बन जाती है।
यह एक बड़ी बात क्यों है
- सार्वजनिक डेटा की आवश्यकता नहीं: आपको अपने निजी डेटा जैसा दिखने वाला सार्वजनिक डेटासेट खोजने की आवश्यकता नहीं है। आपका सिस्टम बुनियादी नियमों (जैसे "आयु सकारात्मक होनी चाहिए") का उपयोग करके अपने स्वयं के अभ्यास प्रश्न बनाता है।
- गोपनीयता सुरक्षित है: लेखकों ने परीक्षण किया कि TabPATE के साथ, चालाक हमलावर की सफलता दर रैंडम गेसिंग (लगभग 50/50) तक गिर जाती है। निजी रहस्य प्रभावी रूप से छिपे रहते हैं।
- यह अभी भी अच्छा काम करता है: इतनी गोपनीयता सुरक्षा के बावजूद, ओरेकल अभी भी सटीक भविष्यवाणियां कर सकता है। अपने परीक्षणों में, TabPATE ने गैर-निजी संस्करण के लगभग समान प्रदर्शन किया और बिना सार्वजनिक डेटा वाले अन्य गोपनीयता तरीकों से बेहतर प्रदर्शन किया।
सारांश
TabPATE निजी स्प्रेडशीट पढ़ने वाले AI के लिए एक गोपनीयता कवच है। सार्वजनिक डेटासेट की आवश्यकता होने के बजाय, यह डेटा की ज्ञात सीमाओं (जैसे "आयु सकारात्मक होनी चाहिए") का उपयोग करके अपने स्वयं के अभ्यास प्रश्न बनाता है। फिर यह इन प्रश्नों पर मतदान करने के लिए "टीचरों" के एक समूह से पूछता है, व्यक्तिगत रहस्यों को छिपाने के लिए थोड़ा शोर जोड़ता है, और एक सुरक्षित, लेबल किया गया डेटासेट जारी करता है। यह AI को निजी डेटा से सीखने की अनुमति देता है, बिना कभी यह लीक किए कि वह डेटा किसका है, और बिना किसी बाहरी सार्वजनिक डेटा की मदद लिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।