← नवीनतम पेपर
🤖 machine learning

Forgettable Federated Linear Learning with Certified Data Unlearning

यह शोध पत्र 'फॉरगेटेबल फेडरेटेड लीनियर लर्निंग' (Forgettable Federated Linear Learning) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो डीप न्यूरल नेटवर्क को लीनियर मॉडल्स के साथ अनुमानित करता है ताकि अतिरिक्त क्लाइंट संचार या ऐतिहासिक मॉडल स्टोरेज की आवश्यकता के बिना प्रमाणित, कुशल और सुरक्षित फेडरेटेड अनलर्निंग को सक्षम किया जा सके।

मूल लेखक: Ruinan Jin, Minghui Chen, Qiong Zhang, Xiaoxiao Li

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruinan Jin, Minghui Chen, Qiong Zhang, Xiaoxiao Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप और आपके दोस्तों का एक समूह एक विशाल, सहयोगात्मक पहेली (puzzle) बना रहे है ताकि एक रहस्य को सुलझाया जा सके। यह फेडरेटेड लर्निंग (Federated Learning - FL) है। इसमें हर कोई अपने पहेली के टुकड़ों को एक केंद्रीय मेज पर भेजने के बजाय, उन्हें अपने घर पर ही रखता है। वे केवल यह निर्देश भेजते हैं कि उनके टुकड़ों को एक साथ कैसे फिट किया जाए, जो एक केंद्रीय लीडर (नेता) को भेजा जाता है। लीडर इन निर्देशों को जोड़कर एक बेहतर तस्वीर बनाता है, और फिर अपडेट किए गए निर्देश वापस भेज देता है। इस तरह, बिना अपने निजी टुकड़ों को दिखाए, सभी मिलकर सीखते हैं।

लेकिन क्या होगा यदि एक दोस्त एक जहरीला टुकड़ा (poisoned piece) लेकर आता है? शायद उसने गुप्त रूप से अपने टुकड़े पर एक छिपा हुआ प्रतीक बनाया है जो पूरी पहेली को गलत दिखा देता है जब वह प्रतीक दिखाई देता है। या, शायद वह दोस्त समूह छोड़ना चाहता है और चाहता है कि अंतिम तस्वीर से उसका टुकड़ा पूरी तरह से हटा दिया जाए ("भूल जाने का अधिकार" या "Right to be Forgotten")।

यहीं पर फेडरेटेड अनलर्निंग (Federated Unlearning - FU) काम आता है। यह एक दोस्त के योगदान को हटाने की प्रक्रिया है बिना पूरी पहेली को फेंककर दोबारा शुरू किए।

वर्तमान विधियों के साथ समस्या

वर्तमान में, किसी दोस्त के टुकड़े को हटाना एक बुरा सपना है:

  1. "दोबारा करने" वाली विधि (The "Do-Over" Method): आप सभी से उस एक दोस्त के बिना पहेली को फिर से बनाने के लिए कह सकते हैं। इसमें बहुत समय लगता है और बहुत अधिक ऊर्जा (कंप्यूटिंग पावर) खर्च होती है।
  2. "दोस्त से पूछने" वाली विधि (The "Ask the Friend" Method): कुछ विधियाँ उस दोस्त से पूछती हैं जो जाना चाहता है कि वह अपने कंप्यूटर पर कुछ अतिरिक्त गणित करे और उसे वापस भेजे। लेकिन क्या होगा यदि वह दोस्त ही पहेली को जहरीला बनाने वाला था? वे झूठ बोल सकते हैं या सहयोग करने से मना कर सकते हैं।
  3. "जमाखोरी" वाली विधि (The "Hoarding" Method): कुछ विधियों के लिए लीडर को पहेली के हर एक संस्करण की एक प्रति सुरक्षित रखनी पड़ती है, जैसा कि वह बनाया गया था, चरण-दर-चरण। यह स्टोरेज रूम को तुरंत भर देता है।

नया समाधान: F2L2

इस शोध पत्र के लेखक एक चतुर नया तरीका प्रस्तावित करते हैं जिसे Forgettable Federated Linear Learning (F2L2) कहा जाता है। वे अनलर्निंग को आसान, तेज़ और सुरक्षित बनाने के लिए दो मुख्य तरकीबों का उपयोग करते हैं।

तरकीब 1: "लीनियर स्केच" (Federated Linear Training)

डीप न्यूरल नेटवर्क (आज के जटिल AI मॉडल) बहुत ही उलझे हुए गांठों की तरह होते हैं। एक विशिष्ट धागे (एक व्यक्ति के डेटा) को सुलझाना पूरे गांठ को बिना खोले लगभग असंभव है।

लेखकों की पहली तरकीब यह है कि वे गांठ को सुलझाने की कोशिश करना बंद कर दें। इसके बजाय, वे एक प्री-ट्रेंड मॉडल (एक मॉडल जो पहले से ही सार्वजनिक डेटा पर प्रशिक्षित है) को शुरुआती बिंदु के रूप में उपयोग करते हैं। फिर, वे जटिल मॉडल को उस शुरुआती बिंदु के आसपास एक सीधी रेखा (एक "लीनियर एप्रोक्सिमेशन") की तरह मानते हैं।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक जटिल पर्वत श्रृंखला बना रहे हैं। केवल एक पहाड़ी को मिटाना कठिन है। लेकिन यदि आप शिखर के बहुत करीब ज़ूम करते हैं, तो पर्वत एक साधारण, सीधी ढलान जैसा दिखता है। यदि आप उस ढलान के एक विशिष्ट हिस्से को हटाना चाहते हैं, तो आप बस एक सरल गणितीय समायोजन (adjustment) कर सकते हैं। आपको पूरा पर्वत फिर से बनाने की आवश्यकता नहीं है; आपको बस ढलान के कोण को समायोजित करने की आवश्यकता है।

यह "लीनियर रैंप" गणितीय रूप से काम करने के लिए आसान है। यह एक अव्यवध्य, जटिल समस्या को एक सरल समस्या में बदल देता है जहाँ आप किसी के डेटा को हटाने के लिए बस एक त्वरित गणना कर सकते हैं।

तरकीब 2: "जादुई इरेज़र" (FedRemoval)

एक बार जब मॉडल को एक सरल "ढलान" के रूप में माना जाता है, तो सर्वर (लीडर) एक न्यूटन स्टेप (Newton Step) कर सकता है।

  • उपमा: इस मॉडल को एक घाटी में स्थित एक गेंद के रूप में सोचें। गेंद की स्थिति अंतिम मॉडल का प्रतिनिधित्व करती है। यदि आप किसी दोस्त का डेटा हटाना चाहते हैं, तो आपको उस दोस्त से गेंद को धकेलने या गेंद की पुरानी तस्वीरें देखने के लिए कहने की आवश्यकता नहीं है। आपको बस यह जानने की आवश्यकता है कि उन्होंने शुरुआत में कितनी जोर से धक्का दिया था (उनका अंतिम ग्रेडिएंट, जो उन्होंने प्रशिक्षण के दौरान पहले ही भेज दिया था)।
  • सर्वर उस "धक्के" की जानकारी लेता है और ठीक गणना करता है कि गेंद को वापस कहाँ ले जाना है, जहाँ वह तब होती यदि उस दोस्त ने उसे कभी धक्का ही न दिया होता। यह एक जादुई इरेज़र (magic eraser) की तरह है जो सर्वर की ओर से तुरंत काम करता है।

यह एक बड़ी बात क्यों है

शोध पत्र का दावा है कि यह नई विधि, F2L2, वर्तमान अनलर्निंग की तीन सबसे बड़ी समस्याओं को हल करती है:

  1. "दोस्त से पूछने" की आवश्यकता नहीं: सर्वर सारा काम खुद करता है। इसे जाने वाले व्यक्ति से संपर्क करने की आवश्यकता नहीं है, भले ही वह दुर्भावनापूर्ण हो या ऑफलाइन हो।
  2. "जमाखोरी" की आवश्यकता नहीं: सर्वर को मॉडल के हर संस्करण को सहेजने की आवश्यकता नहीं है। उसे केवल प्रशिक्षण से प्राप्त अंतिम गणित की आवश्यकता है। यह मेमोरी की भारी बचत करता है।
  3. यह प्रमाणित है: लेखकों ने केवल अनुमान नहीं लगाया कि यह काम करता है; उन्होंने गणित के साथ इसे सिद्ध किया है। उन्होंने दिखाया है कि उनके "जादुई इरेज़र" का परिणाम लगभग वैसा ही है जैसा आपको तब मिलता यदि आपने उस दोस्त के बिना पूरी पहेली को फेंक दिया होता और उसे फिर से बनाया होता।

परिणाम

टीम ने साधारण संख्या पहचान (MNIST) से लेकर जटिल छवि पहचान (जैसे फूलों या कारों की पहचान करना) तक सब कुछ पर इसका परीक्षण किया। उन्होंने यहाँ तक कि "फाउंडेशन मॉडल्स" (बड़े, शक्तिशाली AI मॉडल जिनके बारे में आज चर्चा हो रही है) पर भी इसका परीक्षण किया।

  • परिणाम: प्रत्येक परीक्षण में, F2L2 ने "जहरीले" डेटा (बैकडोर हमलों) को सफलतापूर्वक हटाया, जिससे मॉडल का गलत व्यवहार करना बंद हो गया।
  • समझौता (Trade-off): महत्वपूर्ण रूप से, खराब डेटा को हटाने से मॉडल की अपना काम करने की क्षमता खराब नहीं हुई। मॉडल पहले की तरह ही स्मार्ट रहा, लेकिन बिना उस बुरे प्रभाव के।

सारांश

संक्षेप में, यह शोध पत्र एक ऐसे तरीके को पेश करता है जो एक समूह AI सेटिंग में अनलर्न (unlearn) करने के लिए है जो:

  • तेज़ है: पूरे मॉडल को फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
  • सुरक्षित है: यह जाने वाले व्यक्ति के सहयोग पर निर्भर नहीं करता है।
  • कुशल है: इसके लिए टेराबाइट्स पुराना डेटा सहेजने की आवश्यकता नहीं है।
  • सिद्ध है: गणितीय रूप से गारंटीकृत है कि यह लगभग उतना ही अच्छा काम करेगा जितना कि शून्य से शुरू करना।

यह "एक जटिल AI से एक विशिष्ट स्मृति को मिटाने" के असंभव कार्य को सर्वर पर एक सरल, एक-चरणीय गणना में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →