← नवीनतम पेपर
📊 statistics

FedSLIM: Privacy-Preserving Federated MDL-Based Descriptive Pattern Mining Across Data Silos

यह शोध पत्र FedSLIM प्रस्तुत करता है, जो मिनिमम डिस्क्रिप्शन लेंथ (MDL) पर आधारित वर्णनात्मक पैटर्न माइनिंग के लिए पहला फेडरेटेड फ्रेमवर्क है, जो कच्चे लेनदेन को साझा किए बिना वितरित डेटा साइलो में कॉम्पैक्ट पैटर्न मॉडल के सहयोगात्मक अनुकूलन को सक्षम बनाता है और आइसोलेटेड लोकल माइनिंग की तुलना में वैश्विक रूप से सूचनात्मक पैटर्न की बेहतर खोज प्रदर्शित करता है।

मूल लेखक: Samar Samir Khalil, Noha S. Tawfik, Marco Spruit

प्रकाशित 2026-07-28
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Samar Samir Khalil, Noha S. Tawfik, Marco Spruit

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डेटा साइलो की गुप्त भाषा

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन सुराग एक दर्जन अलग-अलग बंद कमरों में बिखरे हुए हैं। आप कमरों के अंदर जाकर सुराग नहीं देख सकते, और अंदर मौजूद लोगों को आपको कच्चा सबूत दिखाने से मना किया गया है। आधुनिक डेटा साइंस की वास्तविकता यही है। स्वास्थ्य सेवा, वित्त और साइबर सुरक्षा जैसे क्षेत्रों में, मूल्यवान जानकारी "डेटा साइलो" (data silos) में फंसी होती है—अलग-अलग अस्पतालों, बैंकों या कंपनियों द्वारा रखे गए अलग-अलग डेटाबेस। गोपनीयता कानून और सुरक्षा नियम यह सुनिश्चित करते हैं कि ये संगठन मिलकर विश्लेषण करने के लिए अपने सभी डेटा को एक विशाल ढेर में नहीं डाल सकते।

इसे हल करने के लिए, वैज्ञानिक फेडरेटेड लर्निंग (Federated Learning) नामक एक तकनीक का उपयोग करते हैं। इसे "टेलीफोन" के खेल की तरह समझें, जहाँ गुप्त संदेश साझा करने के बजाय, हर कोई आपको उस सारांश को भेजता है जो उन्होंने अपने स्वयं के सुरागों से सीखा है। आप मूल रहस्यों को देखे बिना ही बड़े चित्र (big picture) को समझने के लिए इन सारांशों को जोड़ते हैं। आमतौर पर, इसका उपयोग भविष्य की भविष्यवाणी करने के लिए किया जाता है, जैसे कि यह अनुमान लगाना कि क्या कोई मरीज बीमार पड़ेगा। लेकिन क्या होगा अगर आप केवल अतीत को समझना चाहते हैं? क्या होगा यदि आप यह समझने के लिए छिपे हुए पैटर्न खोजना चाहते हैं कि चीजें क्यों हुईं? इसे डिस्क्रिप्टिव पैटर्न माइनिंग (descriptive pattern mining) कहा जाता है। चुनौती यह है कि इन पैटर्न्स को खोजना घास के ढेर में सुई खोजने जैसा है, और बिना घास साझा किए बंद कमरों के बीच ऐसा करना अविश्वसनीय रूप से कठिन है। जिस शोध पत्र को आप पढ़ने जा रहे हैं, वह ठीक इसी पहेली को सुलझाता है।

शोध पत्र: FedSLIM

इस शोध पत्र के पीछे के शोधकर्ताओं, समर समीर खलील, नोहा एस. तौफिक और मार्को स्प्रूट ने FedSLIM नामक एक नया टूल बनाया है। उनका लक्ष्य यह बनाना था कि ये बंद कमरे कच्चे डेटा को साझा किए बिना अपने डेटा में सबसे महत्वपूर्ण पैटर्न खोजने के लिए कैसे सहयोग कर सकते हैं। वे केवल कोई भी पैटर्न नहीं खोजना चाहते थे; वे मिनिमम डिस्क्रिप्शन लेंथ (Minimum Description Length - MDL) नामक एक सिद्धांत का उपयोग करके सर्वश्रेष्ठ पैटर्न खोजना चाहते थे।

MDL को समझने के लिए, कल्पना करें कि आपके पास खिलौनों से भरा एक अस्त-व्यस्त कमरा है। आप फोन पर अपने दोस्त को उस कमरे का वर्णन करना चाहते हैं। आप एक-एक करके हर खिलौने को सूचीबद्ध कर सकते हैं ("एक लाल कार, एक नीली कार, एक हरी कार..."), लेकिन इसमें बहुत समय लगता है। या, आप एक बेहतर तरीका खोज सकते हैं: "वहाँ 50 लाल कारें, 30 नीली कारें और 10 हरी कारें हैं।" यह दूसरा तरीका छोटा और स्मार्ट है। MDL वह गणितीय नियम है जो कंप्यूटर को डेटा का सबसे छोटा, स्मार्ट तरीका खोजने में मदद करता है। यह उन पैटर्न्स को खोजता है जो डेटा को सबसे अधिक संकुचित (compress) करते हैं, जिससे प्रभावी रूप से कम से कम शब्दों में डेटा की "कहानी" का सारांश मिलता है।

समस्या यह है कि डेटा का सबसे अच्छा वर्णन अक्सर एक साथ सभी डेटा देखने पर निर्भर करता है। यदि आप केवल एक कमरे को देखते हैं, तो आप एक ऐसे पैटर्न को मिस कर सकते हैं जो केवल तीन अलग-अलग कमरों के सुरागों को मिलाने पर दिखाई देता है। लेखकों ने महसूस किया कि बंद कमरों में पैटर्न खोजने के मौजूदा तरीके ज्यादातर केवल इस बात की गिनती करते हैं कि चीजें कितनी बार दिखाई दीं (जैसे कि कितनी लाल कारें मौजूद हैं)। उन्होंने तर्क दिया कि यह किसी किताब का सारांश लिखने के लिए केवल यह गिनने जैसा है कि अक्षर "e" कितनी बार आता है; यह कहानी के सार को छोड़ देता है। वे एक ऐसा तरीका चाहते थे जो वास्तव में सभी बंद कमरों में सबसे अच्छा सारांश (सबसे छोटा विवरण) लिखने की कोशिश करे।

समाधान: खेल खेलने के दो तरीके

टीम ने FedSLIM पेश किया, जो वितरित डेटा (distributed data) में इस "सर्वश्रेष्ठ सारांश" की खोज करने वाला पहला सिस्टम है। इसे काम करने के योग्य बनाने के लिए, उन्होंने इस टूल के दो अलग-अलग संस्करण, या "वेरिएंट्स" बनाए, जिनमें से प्रत्येक का एक अलग व्यक्तित्व है:

  1. FedSLIM-SA (द सीक्रेट एजेंट): यह संस्करण अधिकतम गोपनीयता के लिए डिज़ाइन किया गया है। यह "सिक्योर एग्रीगेशन" नामक एक विशेष क्रिप्टोग्राफिक ट्रिक का उपयोग करता है। कल्पना करें कि सभी खिलाड़ी अपने सुराग कागज़ के टुकड़ों पर लिखते हैं, उन्हें एक ब्लेंडर में डालते हैं, और केवल अंतिम स्मूदी (कुल योग) बाहर आती है। सर्वर (जासूस) कुल सुरागों की संख्या तो देखता है लेकिन उसे पता नहीं होता कि किस खिलाड़ी ने क्या योगदान दिया। यह गोपनीयता के लिए बहुत अच्छा है, लेकिन यह मोटे दस्ताने पहनकर पहेली सुलझाने जैसा है; कई संभावनाओं को जल्दी से तलाशना कठिन होता है।

  2. FedSLIM-SO (द स्काउट): यह संस्करण गति और सटीकता के लिए डिज़ाइन किया गया है। खिलाड़ी सर्वर को बताते हैं कि उनके पास कितने सुराग हैं, लेकिन वे सुरागों के नामों के लिए एक गुप्त कोड का उपयोग करते हैं। सर्वर जानता है कि "प्लेयर A के पास आइटम X के 5 उदाहरण हैं," लेकिन उसे यह नहीं पता कि "आइटम X" वास्तव में क्या है (उदाहरण के लिए, उसे यह नहीं पता कि "आइटम X" "धूम्रपान" है या "खांसी")। यह सर्वर को बहुत अधिक लचीला बनाता है और अधिक पैटर्न खोजने की अनुमति देता है, लेकिन इसके लिए सर्वर पर भरोसा करना आवश्यक है कि वह वास्तविक नामों के बारे में नहीं पूछेगा।

उन्होंने क्या पाया

लेखकों ने आठ अलग-अलग वास्तविक दुनिया के डेटासेट्स पर FedSLIM का परीक्षण किया, जिसमें छोटे संग्रहों से लेकर "एक्सीडेंट्स" (Accidents) जैसा विशाल डेटासेट शामिल है, जिसमें 3,40,000 से अधिक रिकॉर्ड हैं। उन्होंने अपने नए टूल की तुलना "सेंट्रलाइज्ड बेसलाइन" (एक विशाल ढेर में सारा डेटा देखने की विधि) से की।

यहाँ प्रयोगों से क्या पता चला:

  • यह बिना कच्चे डेटा के काम करता है: FedSLIM के दोनों संस्करण उच्च-गुणवत्ता वाले सारांश खोजने में सक्षम थे जो सेंट्रलाइज्ड संस्करण के लगभग बराबर थे। वे डेटा को प्रभावी ढंग से संकुचित करने में सफल रहे, जिसका अर्थ है कि उन्होंने मूल लेनदेन को देखे बिना सबसे महत्वपूर्ण पैटर्न खोज लिए।
  • कम काम, समान परिणाम: सबसे आश्चर्यजनक निष्कर्षों में से एक यह था कि FedSLIM को सेंट्रलाइज्ड संस्करण की तरह लाखों संभावनाओं की खोज करने की आवश्यकता नहीं थी। कई मामलों में, इसने क्रम के कई गुना (orders of magnitude) कम उम्मीदवारों की जांच करके ही सर्वश्रेष्ठ पैटर्न खोज लिए। उदाहरण के लिए, "आयोनोस्फीयर" (Ionosphere) डेटासेट पर, सेंट्रलाइज्ड पद्धति ने 2,94,000 संभावनाओं की जांच की, जबकि FedSLIM ने केवल 700 से 1,500 के आसपास की जांच की। यह पूरे समुद्र को खोदने के बजाय कुछ प्रमुख स्थानों की जांच करके खजाना खोजने जैसा है।
  • "मिसिंग लिंक" की समस्या: शोधकर्ताओं ने कुछ ऐसा खोजा जिसे वे "लोकल-ग्लोबल डिस्कवरी गैप" कहते हैं। कभी-कभी, एक पैटर्न किसी एक बंद कमरे में इतना दुर्लभ होता है कि स्थानीय कंप्यूटर सोचता है कि यह महत्वहीन है। लेकिन जब आप सभी कमरों के सुरागों को मिलाते हैं, तो वही पैटर्न एक बड़ी कहानी बन जाता है।
    • उदाहरण: "धूम्रपान + खांसी + वजन घटना" जैसा पैटर्न मान लीजिए। एक अस्पताल में, शायद केवल 2 लोगों में ये तीनों लक्षण हैं। स्थानीय कंप्यूटर इसे अनदेखा कर देता है। दूसरे अस्पताल में, शायद 3 लोगों में यह है। स्थानीय कंप्यूटर फिर से इसे अनदेखा कर देता है। लेकिन 10 अस्पतालों में, यह पैटर्न शायद 50 बार दिखाई देता है, जिससे यह विशिष्ट रोगियों के समूह के लिए एक बहुत ही महत्वपूर्ण सुराग बन जाता है।
    • FedSLIM उन "मिसिंग लिंक्स" को खोजने में सक्षम था जिन्हें कोई भी एकल बंद कमरा अकेले नहीं खोज सकता था। "चेस" (Chess) डेटासेट पर, टूल ने उन 85% से अधिक वैश्विक रूप से महत्वपूर्ण पैटर्न को रिकवर किया जो स्थानीय कंप्यूटरों के लिए अदृश्य थे। "एडल्ट" (Adult) डेटासेट पर, इसने उनमें से लगभग आधे को रिकवर किया।

समझौते (Trade-offs)

शोध पत्र यह भी रेखांकित करता है कि कोई भी समाधान पूर्ण नहीं होता; यह एक संतुलन बनाने का काम है।

  • FedSLIM-SA सबसे अधिक निजी है लेकिन जैसे-जैसे आप अधिक बंद कमरे (क्लाइंट्स) जोड़ते हैं, यह धीमा और कम सटीक होता जाता है। जब उन्होंने 128 क्लाइंट्स के साथ परीक्षण किया, तो इसके प्रदर्शन में काफी गिरावट आई क्योंकि "सीक्रेट एजेंट" पद्धति इतने सारे लोगों को एक साथ संभालने के लिए बहुत भारी हो गई।
  • FedSLIM-SO 128 क्लाइंट्स के साथ भी मजबूत बना रहा। इसने अच्छे पैटर्न खोजना जारी रखा और उच्च सटीकता बनाए रखी। हालाँकि, इसकी कीमत सर्वर और क्लाइंट्स के बीच अधिक संचार (communication) के रूप में चुकानी पड़ी।

इसका क्या अर्थ है

लेखक सुझाव देते हैं कि FedSLIM यह सिद्ध करता है कि डेटा के सबसे महत्वपूर्ण हिस्सों को खोए बिना उच्च-गुणवत्ता वाला, गोपनीयता-संरक्षित डेटा विश्लेषण करना संभव है। उन्होंने दिखाया कि एक महान सारांश प्राप्त करने के लिए आपको हर एक पैटर्न खोजने की आवश्यकता नहीं है; आपको बस उन "हाई-इम्पैक्ट" पैटर्न्स को खोजने की आवश्यकता है जो मुख्य कहानी बताते हैं।

हालाँकि, वे सावधानी बरतते हुए कहते हैं कि यह कोई जादुई छड़ी नहीं है जो सब कुछ हल कर दे। सिस्टम को अभी भी बहुत अधिक संचार की आवश्यकता होती है, विशेष रूप से बहुत बड़े या जटिल डेटासेट्स के लिए, और "सीक्रेट एजेंट" (SA) संस्करण तब संघर्ष करता है जब समूह बहुत बड़ा हो जाता है। वे यह भी बताते हैं कि हालांकि यह टूल उनके द्वारा परीक्षण किए गए डेटासेट्स पर अच्छा काम करता है, लेकिन इसे वस्तुओं की बहुत बड़ी संख्या (जैसे लाखों अलग-अलग प्रकार के उत्पाद) तक स्केल करना केवल अधिक ट्रांजेक्शन होने की तुलना में एक बड़ी चुनौती हो सकती है।

संक्षेप में, FedSLIM डेटा साइलो के आपस में बात करने का एक नया, चतुर तरीका है। यह उन्हें अपने डेटा की एक साझा समझ बनाने की अनुमति देता है—अतीत को समझाने वाले छिपे हुए पैटर्न को खोजना—बिना कभी उन दीवारों को तोड़े जो उनके रहस्यों को सुरक्षित रखती हैं। यह बताता है कि हम गोपनीयता और गहरी अंतर्दृष्टि दोनों प्राप्त कर सकते हैं, बशर्ते हम सही गणितीय "अनुवादक" का उपयोग करना जानते हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →