Geometric Data Perturbation with Noisy-Anchor Alignment for Privacy-Preserving Collaborative Learning
यह शोध पत्र एक गोपनीयता-संरक्षण सहयोगात्मक शिक्षण ढांचे का प्रस्ताव करता है जो निजी डेटा के बजाय साझा एंकर रिप्रजेंटेशन (anchor representations) में शोर (noise) जोड़कर ज्यामितीय डेटा व्यवधान (Geometric Data Perturbation) पद्धति को उन्नत करता है, जिससे मौजूदा दृष्टिकोणों की तुलना में उच्च शिक्षण उपयोगिता बनाए रखते हुए विश्लेषक-प्रतिभागी मिलीभगत हमलों को प्रभावी ढंग से कम किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक डिजिटल दुनिया में, संगठन अक्सर एक बड़े पहेली के टुकड़ों को अपने पास रखते हैं। एक अस्पताल के पास रोगी के रिकॉर्ड हो सकते हैं, एक बैंक के पास लेनदेन का इतिहास हो सकता है, और एक विश्वविद्यालय के पास छात्रों के प्रदर्शन का डेटा हो सकता है। बेहतर आर्टिफिशियल इंटेलिजेंस बनाने के लिए, इन समूहों को अपनी जानकारी को संयोजित करने की आवश्यकता है। हालांकि, कानून और गोपनीयता संबंधी चिंताएं आमतौर पर उन्हें अपना कच्चा डेटा सीधे साझा करने से रोकती हैं। यह एक कठिन समस्या पैदा करता है: समूह अपने निजी रहस्यों को प्रकट किए बिना एक-दूसरे से सीखने के लिए कैसे मिलकर काम कर सकते हैं? एक आशाजनक समाधान में 'जियोमेट्रिक डेटा परटर्बेशन' (geometric data perturbation) नामक तकनीक शामिल है। कल्पना कीजिए कि एक तस्वीर को थोड़ा घुमाने या खिसकाने से, बिना किसी दो बिंदुओं के बीच की दूरी बदले, उसका स्वरूप बदल जाता है। तस्वीर अलग दिखती है, लेकिन उसकी आंतरिक संरचना बरकरार रहती है। डेटा पर इन गणितीय बदलावों को लागू करके, संगठन अपने सूचना के एक विकृत संस्करण को एक केंद्रीय विश्लेषक को भेज सकते हैं। विश्लेषक फिर इस संयुक्त, विकृत डेटा पर शक्तिशाली मॉडल प्रशिक्षित कर सकता है, जबकि मूल निजी रिकॉर्ड छिपे रहते हैं।
चुनौती तब उत्पन्न होती है जब केंद्रीय विश्लेषक और भाग लेने वाले संगठनों में से एक मिलकर दूसरों की गोपनीयता को तोड़ने का निर्णय लेते हैं। यदि सभी संगठनों ने बिल्कुल एक ही गणितीय बदलाव का उपयोग किया, तो मिलीभगत करने वाला जोड़ा आसानी से इस प्रक्रिया को उलट सकता है और सभी के निजी डेटा को देख सकता है। इसे रोकने के लिए, शोधकर्ताओं ने पहले यह सुझाव दिया था कि प्रत्येक संगठन को अपना स्वयं का अद्वितीय बदलाव (unique shift) उपयोग करना चाहिए। हालांकि, इससे एक नई समस्या पैदा होती है: विभिन्न समूहों का डेटा असंगत प्रारूपों में समाप्त होता है, जिससे एक एकल मॉडल को प्रभावी ढंग से प्रशिक्षित करना असंभव हो जाता है। इसे ठीक करने के लिए "एंकर अलाइनमेंट" (anchor alignment) नामक एक चतुर समाधान विकसित किया गया। यह एक साझा, सिंथेटिक संदर्भ बिंदुओं के सेट का उपयोग करता है—जैसे कि एक सामान्य मानचित्र ग्रिड—जिसे प्रत्येक संगठन अपने निजी डेटा के साथ परिवर्तित करता है। विश्लेषक विभिन्न डेटासेट को एक एकल, उपयोगी प्रारूप में संरेखित करने के लिए इन परिवर्तित संदर्भ बिंदुओं का उपयोग करता है। लेकिन एक नया अध्ययन इस दृष्टिकोण में एक गंभीर खामी प्रकट करता है: यदि मिलीभगत करने वाला साथी मूल संदर्भ मानचित्र को प्रकट कर देता है, तो विश्लेषक अन्य सभी प्रतिभागियों के अद्वितीय बदलावों को गणितीय रूप से उलट सकता है, जिससे उनका निजी डेटा पूरी तरह से उजागर हो जाता है।
त्सुकुबा विश्वविद्यालय के शोधकर्ताओं ने इस विशिष्ट भेद्यता को हल करने के लिए एक नई विधि प्रस्तावित की है। उन्होंने महसूस किया कि डेटा को सुरक्षित करने के लिए सीधे निजी डेटा में शोर (noise), या रैंडम स्टैटिक जोड़ने से अंतिम मॉडल की गुणवत्ता खराब हो जाएगी। इसके बजाय, उन्होंने शोर को स्वयं संदर्भ मानचित्र (reference map) में जोड़ने का निर्णय लिया। उनकी नई प्रणाली में, प्रत्येक संगठन अभी भी अपने निजी डेटा के लिए अपने स्वयं के अद्वितीय बदलाव का उपयोग करता है, लेकिन जब वे साझा संदर्भ मानचित्र को परिवर्तित करते हैं, तो वे विश्लेषक को भेजने से पहले उसमें शोर की एक परत जोड़ देते हैं। यह शोर विश्लेषक और एक मिलीभगत करने वाले साथी के लिए अन्य प्रतिभागियों के अद्वितीय बदलावों को पूरी तरह से उलटने को गणितीय रूप से असंभव बना देता है। विश्लेषक डेटा को उपयोगी मॉडल प्रशिक्षित करने के लिए पर्याप्त रूप से संरेखित कर सकता है, लेकिन निजी जानकारी चुराने का मार्ग शोर द्वारा अवरुद्ध हो जाता है।
टीम ने दो बड़े इमेज डेटासेट का उपयोग करके इस विचार का परीक्षण किया: एक जिसमें हस्तलिखित अंक थे और दूसरा जिसमें हजारों मशहूर हस्तियों के चेहरे थे। उन्होंने एक परिदृश्य का अनुकरण किया जहाँ एक विश्लेषक और एक प्रतिभागी अन्यों का डेटा चुराने के लिए साजिश रचते हैं। जब उन्होंने निजी डेटा में ही शोर जोड़ा, तो गोपनीयता सुरक्षा बढ़ने के साथ मॉडल की सटीकता काफी कम हो गई। हालांकि, जब उन्होंने केवल संदर्भ मानचित्र में शोर जोड़ा, तो उन्होंने एक बहुत बेहतर संतुलन पाया। सिस्टम ने मशीन लर्निंग मॉडल के लिए उच्च सटीकता बनाए रखी जबकि हमलावरों के लिए मूल छवियों को पुनर्गठित करना अत्यंत कठिन बना दिया। अपने प्रयोगों में, नई विधि ने दिखाया कि सिस्टम डेटा रिसाव के जोखिम को कम रखते हुए भी उच्च शिक्षण सटीकता प्राप्त कर सकता है। शोधकर्ताओं ने दिखाया कि संदर्भ मानचित्र के बजाय अलाइनमेंट सिग्नल को सुरक्षित करके, वे एक ऐसा सिस्टम बना सकते हैं जो सहयोग के लिए उपयोगी और आंतरिक खतरों के विरुद्ध मजबूत दोनों है। यह दृष्टिकोण संगठनों के लिए गोपनीयता और प्रदर्शन के बीच चयन किए बिना संवेदनशील परियोजनाओं पर सहयोग करने का एक व्यावहारिक तरीका प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।