← नवीनतम पेपर
💻 computer science

A Crowdsensing Intrusion Detection Dataset For Decentralized Federated Learning Models

यह शोध पत्र एक बड़े पैमाने के क्राउडसेंसिंग घुसपैठ पहचान (इंट्रूज़न डिटेक्शन) डेटासेट और एक प्रयोगात्मक अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि विकेंद्रीकृत फेडरेटेड लर्निंग (DFL), डेटा स्थानीयता को बनाए रखते हुए, IoT वातावरण में प्रतिस्पर्धी मैलवेयर पहचान प्रदर्शन प्राप्त करता है, और अक्सर केंद्रीकृत फेडरेटेड लर्निंग (CFL) से बेहतर प्रदर्शन करता है।

मूल लेखक: Chao Feng, Alberto Huertas Celdran, Jing Han, Heqing Ren, Xi Cheng, Zien Zeng, Lucas Krauter, Gerome Bovet, Burkhard Stiller

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chao Feng, Alberto Huertas Celdran, Jing Han, Heqing Ren, Xi Cheng, Zien Zeng, Lucas Krauter, Gerome Bovet, Burkhard Stiller

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विशाल पड़ोस की कल्पना करें जहाँ हर किसी के पास एक स्मार्ट होम डिवाइस (जैसे कि थर्मोस्टेट, कैमरा, या स्मार्ट फ्रिज) है। ये उपकरण लगातार अपने परिवेश पर नज़र रखते हैं, और डेटा एकत्र करते हैं कि पड़ोस में क्या हो रहा है। इसे क्राउडसेंसिंग (Crowdsensing) कहा जाता है।

हालाँकि, एक समस्या है: कुछ डिवाइस डिजिटल "कीटाणुओं" (मालवेयर) से संक्रमित हो जाते हैं। ये कीटाणु डेटा चुराने, सिस्टम को क्रैश करने या इन उपकरणों को ज़ोंबी में बदलकर दूसरों पर हमला करने की कोशिश करते हैं।

पारंपरिक रूप से, इन कीटाणुओं को पकड़ने के लिए, आपको प्रत्येक डिवाइस से सारा डेटा एक विशाल, केंद्रीय कंप्यूटर (जैसे कि पुलिस स्टेशन) को भेजना होगा ताकि उसका विश्लेषण किया जा सके। लेकिन इसके दो बड़े कारण हैं:

  1. गोपनीयता (Privacy): आप अपना निजी घरेलू डेटा एक केंद्रीय सर्वर पर नहीं भेजना चाहते।
  2. बॉटलनेक (Bottleneck): यदि पुलिस स्टेशन बहुत व्यस्त हो जाता है या उस पर हमला होता है, तो पूरा सिस्टम विफल हो जाता है।

यह पेपर बिना कहीं भी डेटा भेजे इन डिजिटल कीटाणुओं को पकड़ने का एक नया तरीका पेश करता है। यह हर पड़ोसी को खुद एक जासूस बनने की शिक्षा देने जैसा है, और फिर वे अपनी निजी डायरियों के बजाय अपने निष्कर्षों को एक-दूसरे के साथ साझा करते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर के मुख्य भागों का विवरण दिया गया है:

1. डेटासेट: एक "डिजिटल क्राइम सीन" संग्रह

शोधकर्ताओं ने साक्ष्य का एक विशाल पुस्तकालय बनाया। उन्होंने एक टेस्ट पड़ोस बनाया जिसमें 8 रस्पबेरी पाई (Raspberry Pi) कंप्यूटर (छोटे, सस्ते कंप्यूटर जो स्मार्ट डिवाइस की तरह काम करते हैं) का उपयोग किया गया।

  • सेटअप: उन्होंने इन कंप्यूटरों को कुछ समय तक सामान्य रूप से चलने दिया ( "गुड गाय" अवस्था)। फिर, उन्हें 8 अलग-अलग प्रकार के "डिजिटल कीटाणुओं" (जैसे बॉटनेट, रैनसमवेयर और कॉइनमाइनर) से संक्रमित किया गया।
  • साक्ष्य: उन्होंने केवल नेटवर्क ट्रैफिक को ही नहीं देखा। उन्होंने सब कुछ देखा: डिवाइस ने कितना CPU उपयोग किया, किन फाइलों को छुआ गया, कौन से सिस्टम कमांड चलाए गए, और यहाँ तक कि डिवाइस के "मस्तिष्क" (कर्नेल) ने कैसे प्रतिक्रिया दी।
  • परिणाम: उन्होंने इस व्यवहार के 21 मिलियन से अधिक कच्चे रिकॉर्ड एकत्र किए। इसे उपयोगी बनाने के लिए, उन्होंने इस निरंतर प्रवाह वाले डेटा को 30-सेकंड के टुकड़ों में काट दिया। इसके परिणामस्वरूप 342,000 स्नैपशॉट्स का एक साफ डेटासेट मिला, जिनमें से प्रत्येक 30 सेकंड की विंडो में डिवाइस के व्यवहार का वर्णन करता है।

उपमा: कल्पना करें कि एक पूरे पड़ोस की 288 घंटों तक फिल्म बनाई जा रही है। यह देखने के लिए बहुत अधिक है! इसलिए, उन्होंने हर घंटे से एक 30-सेकंड की क्लिप ली, उस क्लिप में जो हुआ उसका सारांश निकाला (जैसे, "3 लोग दौड़े," "1 दरवाजा खुला"), और उसे एक नोटबुक में लिख दिया। वह नोटबुक उनका डेटासेट है।

2. विधि: विकेंद्रीकृत फेडरेटेड लर्निंग (Decentralized Federated Learning - DFL)

यही मुख्य नवाचार है। केंद्रीय सर्वर को डेटा भेजने के बजाय, उपकरण एक "पियर-टू-पियर" (peer-to-peer) नेटवर्क में मिलकर सीखते हैं।

  • केंद्रीकृत लर्निंग (पुराना तरीका): सभी पड़ोसी अपनी डायरियाँ मेयर को भेजते हैं। मेयर उन सभी को पढ़ता है, समझता है कि एक अपराधी कैसा दिखता है, और फिर सबको बता देता है।
    • समस्या: मेयर विफलता का एक एकल बिंदु (single point of failure) है, और सभी को अपनी गोपनीयता छोड़नी पड़ी।
  • फेडरेटेड लर्निंग (मध्यम मार्ग): पड़ोसी अपने सीखे हुए सबक मेयर को भेजते हैं, जो उन्हें औसत निकालता है और "ग्लोबल लेसन" वापस भेजता है।
    • समस्या: मेयर अभी भी विफलता का एक एकल बिंदु है।
  • विकेंद्रीकृत फेडरेटेड लर्निंग (नया तरीका): कोई मेयर नहीं है। पड़ोसी बस अपने करीबी दोस्तों से बात करते हैं। पड़ोसी A कुछ सीखता है, पड़ोसी B को बताता है, जो C को बताता है। अंततः, पूरा पड़ोस एक ही चीज़ सीख जाता है, बिना किसी को भी दूसरे की निजी डायरी देखे।

उपमा: "टेलीफोन" गेम की कल्पना करें, लेकिन संदेश को बिगाड़ने के बजाय, हर कोई एक पहेली सुलझाने की कोशिश कर रहा है। प्रत्येक व्यक्ति के पास पहेली का एक हिस्सा है (उनका स्थानीय डेटा)। वे केवल अपने पड़ोसियों को अपने हिस्से का समाधान (मॉडल) दिखाते हैं, न कि पहेली के टुकड़े। अंततः, सभी के पास इस बात की पूरी तस्वीर होती है कि एक "डिजिटल कीटाणु" कैसा दिखता है, लेकिन किसी ने भी आपका विशिष्ट पहेली का टुकड़ा कभी नहीं देखा।

3. प्रयोग: क्या यह काम करता है?

शोधकर्ताओं ने इस नए "पड़ोसी जासूस" सिस्टम का पुराने "मेयर" सिस्टम के विरुद्ध परीक्षण किया।

  • परिणाम: विकेंद्रीकृत सिस्टम (DFL) ने केंद्रीय सिस्टम के लगभग समान प्रदर्शन किया, और कई मामलों में, उससे भी बेहतर! यह विभिन्न प्रकार के मालवेयर को पहचानने में बहुत कुशल था।
  • समझौता (Trade-off): यह "मेयर" सिस्टम की तुलना में सीखने में थोड़ा धीमा था क्योंकि जानकारी को एक पड़ोसी से दूसरे पड़ोसी तक कूदना पड़ता था, लेकिन यह बहुत अधिक सुरक्षित और निजी था।
  • "जहर" परीक्षण (The "Poison" Test): उन्होंने कुछ पड़ोसियों को यह झूठ बोलने के लिए मजबूर करके सिस्टम को धोखा देने की कोशिश की कि उन्होंने क्या देखा (एडवर्सरियल अटैक्स)। सिस्टम छोटे झूठों के खिलाफ अच्छा रहा, लेकिन यदि बहुत से पड़ोसी झूठ बोलने लगे (50% से अधिक), तो सिस्टम भ्रमित हो गया। यह अपेक्षित है, ठीक वैसे ही जैसे एक जूरी तब भ्रमित हो जाती है जब आधे गवाह झूठ बोल रहे हों।

4. यह क्यों महत्वपूर्ण है

यह पेपर IoT सुरक्षा के भविष्य के लिए एक ब्लूप्रिंट और टूलबॉक्स प्रदान करता है।

  • प्राथमिकता गोपनीयता: आप अपने घर (या डिवाइस) को छोड़े बिना मालवेयर का पता लगा सकते हैं।
  • विफलता का कोई एकल बिंदु नहीं: यदि एक डिवाइस बंद हो जाता है या हैक हो जाता है, तो बाकी नेटवर्क सीखते रहते हैं और खुद को सुरक्षित रखते हैं।
  • यथार्थवाद: पुराने डेटासेट्स के विपरीत जो बनावटी थे या केवल नेटवर्क ट्रैफिक को देखते थे, यह डेटा डिवाइस के संपूर्ण व्यवहार को देखता है, जो आधुनिक, चालाक मालवेयर को पकड़ने के लिए बहुत अधिक यथार्थवादी है।

सारांश

इस पेपर को स्मार्ट उपकरणों के लिए एक सार्वभौमिक "वांटेड पोस्टर" प्रशिक्षण मैनुअल के रूप में सोचें। सभी उपकरणों के निजी लॉग को एक केंद्रीय क्लाउड में भेजने के बजाय, उपकरण अपने पड़ोसियों के साथ अपने विचारों को साझा करके अपराधियों को पहचानना सीखते हैं। यह आपके डेटा को निजी रखता है, नेटवर्क को तोड़ना कठिन बनाता है, और यह साबित करता है कि छोटे, स्वतंत्र उपकरणों का एक समूह सुरक्षित रहने के लिए मिलकर काम कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →