← नवीनतम पेपर
💻 computer science

Machine Unlearning for the XGBoost Model with Network Intrusion Datasets

यह शोध पत्र XGBoost-Forget को प्रस्तुत करता है, जो नेटवर्क घुसपैठ (network intrusion) डेटासेट पर XGBoost मॉडलों के लिए विशेष रूप से डिज़ाइन किया गया एक मशीन अनलर्निंग फ्रेमवर्क है, जो पूर्ण पुनप्रशिक्षण (full retraining) के तुलनीय भविष्य कहनेवाला प्रदर्शन बनाए रखते हुए कुशल डेटा निष्कासन प्राप्त करता है।

मूल लेखक: Diana Magalhães, Eva Maia, João Vitorino, Isabel Praça

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Diana Magalhães, Eva Maia, João Vitorino, Isabel Praça

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान सुरक्षा गार्ड (एक AI मॉडल) है, जिसने एक पड़ोस के हजारों घंटों के वीडियो फुटेज का अध्ययन करके घुसपैठियों को पहचानना सीखा है। यह गार्ड अपने काम में उत्कृष्ट है, लेकिन एक दिन, आपको एहसास होता है कि उसके द्वारा अध्ययन किया गया कुछ फुटेज वास्तव में एक मज़ाक या गलती थी। शायद एक मिलनसार डिलीवरी ट्रक को गलती से "चोर" के रूप में लेबल कर दिया गया था।

यदि आप चाहते हैं कि वह गार्ड अपनी इस गलती को "भूल" जाए, तो पुराने तरीके से उसे नौकरी से निकालना, उसे वापस स्कूल भेजना और उसे फिर से पूरे पड़ोस का अध्ययन करने के लिए भेजना—इस बार उस मज़ाक वाले फुटेज को छोड़कर—एक बहुत ही लंबा और महंगा काम है। यह धीमा है, महंगा है और इसमें बहुत समय बर्बाद होता है।

यह शोध पत्र इस समस्या को हल करने के लिए एक नया, अधिक स्मार्ट तरीका पेश करता है, जो विशेष रूप से एक प्रकार के AI के लिए है जिसे XGBoost (जो निर्णय लेने वाले विशेषज्ञों की एक टीम की तरह है) कहा जाता है, जिसका उपयोग नेटवर्क घुसपैठ (साइबर हमलों) का पता लगाने के लिए किया जाता है। लेखक इस नए तरीके को XGBoost-Forget कहते हैं।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

"विशेषज्ञों की टीम" दृष्टिकोण (SISA फ्रेमवर्क)

एक विशाल सुरक्षा गार्ड को एक साथ पूरे पड़ोस का अध्ययन करने देने के बजाय, लेखकों ने काम को पाँच छोटे विशेषज्ञों की एक टीम में विभाजित कर दिया है।

  • सेटअप: वे प्रशिक्षण डेटा (फुटेज) को पाँच अलग-अलग ढेरों में विभाजित करते हैं, जिन्हें "शार्ड्स" (shards) कहा जाता है। प्रत्येक विशेषज्ञ केवल एक ढेर का अध्ययन करता है।
  • चेकपॉइंट्स: जैसे-जैसे प्रत्येक विशेषज्ञ अपने ढेर का अध्ययन करता है, वह नियमित अंतराल पर नोट्स लेता है (जिसे "स्लाइस" कहा जाता है)। यदि वे 100 क्लिप का अध्ययन करते हैं, तो वे क्लिप 20, क्लिप 40, क्लिप 60 आदि के बाद अपनी प्रगति को सहेजते हैं।
  • परिणाम: अंत में, अंतिम निर्णय पाँचों विशेषज्ञों की राय को मिलाकर लिया जाता है।

"भूलने" की प्रक्रिया कैसे काम करती है

अब, कल्पना कीजिए कि आपको मज़ाक वाले एक विशिष्ट क्लिप को प्रशिक्षण डेटा से हटाना है।

  • पुराना तरीका (पूर्ण पुन: प्रशिक्षण/Full Retraining): आप सभी को निकाल देते हैं और उन सभी को फिर से सब कुछ पढ़ने के लिए भेज देते हैं।
  • नया तरीका (XGBoost-Forget): आप केवल उस एक विशेषज्ञ को ढूंढते हैं जो उस मज़ाक वाले क्लिप वाले ढेर का अध्ययन कर रहा था। आप उन्हें कहते हैं, "उस एक क्लिप को अनदेखा करें।" उन्हें केवल उस क्लिप के बाद के अपने नोट्स के छोटे से हिस्से का फिर से अध्ययन करने की आवश्यकता है। अन्य चार विशेषज्ञों को कुछ भी करने की आवश्यकता नहीं है; वे अपने नोट्स को बिल्कुल वैसा ही रखते हैं जैसा वे हैं।

यह एक किताब को संपादित करने जैसा है: पूरी कहानी को फिर से लिखने के बजाय क्योंकि उसमें एक टाइपो (लिखने की गलती) है, आप बस उस विशिष्ट पैराग्राफ को फिर से लिखते हैं जहाँ वह टाइपो है।

प्रयोग: नए गार्ड का परीक्षण

शोधकर्ताओं ने इस पद्धति का परीक्षण नेटवर्क ट्रैफ़िक (जैसे कि डिजिटल दरवाज़े पर कौन दस्तक दे रहा है, इसका लॉग) का प्रतिनिधित्व करने वाले दो वास्तविक दुनिया के डेटासेट्स पर किया:

  1. IoT-23: स्मार्ट उपकरणों (जैसे कैमरा और फ्रिज) से प्राप्त डेटा।
  2. GeNIS: एक हाई-टेक साइबर-रेंज से प्राप्त सिम्युलेटेड डेटा।

उन्होंने इस नए XGBoost-Forget तरीके की तुलना पुराने "निकालो और फिर से प्रशिक्षित करो" (fire and retrain) तरीके से और एक अन्य मौजूदा पद्धति SISA (जो आमतौर पर एक अलग प्रकार के AI जिसे न्यूरल नेटवर्क कहा जाता है, का उपयोग करती है) से की।

परिणाम:

  • प्रदर्शन (Performance): नया तरीका असली घुसपैठियों को पकड़ने में मूल मॉडल जितना ही अच्छा था। खराब डेटा को हटाने से गार्ड ने अपना काम करने की क्षमता नहीं खोई।
  • गति (Speed): यह सबसे बड़ी जीत है। नया तरीका खराब डेटा को "भूलने" के मामले में शुरू से फिर से प्रशिक्षित करने की तुलना में बहुत तेज़ था। यह मौजूदा SISA पद्धति से भी तेज़ था।
  • भूलने की गुणवत्ता (Quality of Forgetting): उन्होंने यह देखने के लिए एक विशेष परीक्षण (जैसे कि "बैकडोर" ट्रैप) का उपयोग किया कि क्या मॉडल वास्तव में खराब डेटा को भूल गया है। परिणामों ने दिखाया कि मॉडल ने सफलतापूर्वक विशिष्ट खराब नमूनों को "भूल" दिया, जिससे उन्हें धोखा देने की उसकी क्षमता कम हो गई, ठीक वैसा ही जैसा कि यदि उन्होंने शुरू से फिर से प्रशिक्षण लिया होता।

मापने के टेप के बारे में एक नोट

शोधकर्ताओं ने यह मापने के लिए कि "भूला हुआ" मॉडल मूल मॉडल से कितना अलग है, एक विशिष्ट गणितीय पैमाने (जिसे JSD कहा जाता है) का उपयोग करने की कोशिश की। हालाँकि, वह पैमाना इस मामले में ठीक से काम नहीं कर पाया। यह एक हाथी के लिए बने तराजू से पंख का वजन मापनेने की कोशिश करने जैसा है; बदलाव इतना छोटा था कि उपकरण उसे देख ही नहीं सका। उन्होंने पाया कि एक अलग परीक्षण (ASR) यह साबित करने में बहुत बेहतर था कि डेटा वास्तव में भुला दिया गया था।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र यह सिद्ध करता है कि आप एक XGBoost मॉडल को पूरे मॉडल को शुरू से फिर से प्रशिक्षित किए बिना, तेज़ी से और कुशलता से विशिष्ट खराब डेटा को "भूलना" सिखा सकते हैं। साइबर सुरक्षा में यह एक बड़ी बात है, जहाँ डेटा अक्सर अव्यवस्थित होता है, और आपको अपने AI को ठीक करने के लिए उसे कई दिनों तक फिर से प्रशिक्षित करने के लिए बंद करने की आवश्यकता नहीं होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →