← नवीनतम पेपर
🤖 AI

Taming Data Challenges in ML-based Security Tasks Using Generative AI

यह शोध पत्र यह प्रदर्शित करता है कि जेनेरेटिव एआई द्वारा जनरेट किए गए सिंथेटिक डेटा के साथ प्रशिक्षण डेटासेट को बढ़ाना, जिसमें 'निमाई' (Nimai) नामक एक नवीन विधि शामिल है, मशीन लर्निंग-आधारित सुरक्षा क्लासिफायर के प्रदर्शन और अनुकूलन क्षमता में महत्वपूर्ण सुधार कर सकता है, विशेष रूप से डेटा-सीमित सेटिंग्स में, जबकि साथ ही उन विशिष्ट डेटा विशेषताओं की भी पहचान करता है जो इस तरह के सुधारों में बाधा डाल सकती हैं।

मूल लेखक: Shravya Kanchi, Neal Mangaokar, Aravind Cheruvu, Sifat Muhammad Abdullah, Shirin Nilizadeh, Atul Prakash, Bimal Viswanath

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shravya Kanchi, Neal Mangaokar, Aravind Cheruvu, Sifat Muhammad Abdullah, Shirin Nilizadeh, Atul Prakash, Bimal Viswanath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुरक्षा गार्ड (एक कंप्यूटर प्रोग्राम) को भीड़भाड़ वाले शहर में चोरों को पहचानने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। आमतौर पर, इस गार्ड को सिखाने का सबसे अच्छा तरीका उन्हें असली चोरों और असली नागरिकों की हजारों तस्वीरें दिखाना है। लेकिन साइबर सुरक्षा की दुनिया में, एक बड़ी समस्या है: हमारे पास चोरों की पर्याप्त तस्वीरें नहीं हैं।

चोर दुर्लभ होते हैं, वे अच्छी तरह छिपते हैं, और कभी-कभी हमारे पास जो तस्वीरें होती हैं वे धुंधली या गलत लेबल वाली होती हैं। यह सुरक्षा गार्ड को अपने काम में खराब बनाता है।

यह शोध पत्र एक सरल प्रश्न पूछता है: क्या हम "जेनेरेटिव एआई" (GenAI) का उपयोग चोरों की नकली तस्वीरें बनाने के लिए कर सकते हैं ताकि गार्ड को प्रशिक्षित करने में मदद मिल सके?

यहाँ उनके निष्कर्षों का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "खाली फोटो एल्बम"

शोधकर्ताओं ने 35 विभिन्न साइबर सुरक्षा अध्ययनों का विश्लेषण किया और पाया कि लगभग सभी को एक ही डेटा समस्याओं के साथ संघर्ष करना पड़ा:

  • उदाहरणों की कमी: सामान्य गतिविधियों की तुलना में हमलों के बहुत कम उदाहरण मौजूद हैं।
  • पक्षपाती दृष्टिकोण: हमारे पास उपलब्ध हमलों के कुछ उदाहरण केवल एक विशिष्ट प्रकार के चोर को दिखा सकते हैं, जिससे अन्य छूट जाते हैं।
  • शोर भरी तस्वीरें (Noisy photos): कभी-कभी लेबल गलत होते हैं (जैसे एक नागरिक की फोटो को चोर के रूप में लेबल किया गया हो)।
  • बदलते चेहरे: चोर समय के साथ अपना रूप बदलते रहते हैं (इसे "कॉन्सेप्ट ड्रिफ्ट" कहा जाता है), जिससे गार्ड का पुराना प्रशिक्षण बेकार हो जाता है।

2. समाधान: "एआई कलाकार"

टीम ने उन्नत एआई टूल (GenAI) का उपयोग करने का प्रयास किया जो एक कलाकार की तरह काम करता है। गार्ड को केवल वास्तविक तस्वीरें दिखाने के बजाय, उन्होंने एआई से उन कुछ वास्तविक तस्वीरों के आधार पर चोरों की नई, वास्तविक दिखने वाली तस्वीरें पेंट करने के लिए कहा जो उसने देखी थीं। फिर उन्होंने इन नकली तस्वीरों को प्रशिक्षण एल्बम में जोड़ा ताकि यह देखा जा सके कि क्या गार्ड अधिक स्मार्ट होता है।

उन्होंने इसका परीक्षण 7 विभिन्न सुरक्षा कार्यों पर किया, जिसमें मैलवेयर (कंप्यूटर वायरस) को पहचानने से लेकर हाइजैक किए गए इंटरनेट रूटों का पता लगाने तक शामिल था।

3. परिणाम: जब कलाकार चमकता है

परिणाम "वाह!" और "अभी नहीं" का मिश्रण थे।

सफलता की कहानियाँ (The "Wow!" moments):

  • "सुपर-ट्रेनिंग" प्रभाव: उन कार्यों में जहाँ डेटा बहुत कम था (जैसे BGP हाइजैकिंग कार्य, जिसमें केवल लगभग 180 प्रशिक्षण नमूने थे), एआई-जनित डेटा एक गेम-चेंजर साबित हुआ। उनके द्वारा बनाए गए एक विशिष्ट तरीके, जिसे Nimai कहा गया, ने सुरक्षा गार्ड की सटीकता को 32.6% तक सुधार दिया। यह एक ऐसे गार्ड से 9 चोरों को पकड़ने वाले गार्ड में बदलने जैसा है जो 10 में से 6 चोरों को पकड़ पाता था।
  • "धुंधली" तस्वीरों को ठीक करना: उन्होंने पाया कि एआई ने केवल कॉपी-पेस्ट नहीं किया; इसने वास्तव में डेटा के "शोर" (noise) को कम करने में मदद की। इसने चोरों के पैटर्न को अधिक स्पष्ट बनाया, जिससे गार्ड बेहतर ढंग से सीख पाया।
  • "रूप बदलने वाला" (Shape-Shifter) समस्या: जब चोरों ने अपनी रणनीति बदली (कॉन्सेप्ट ड्रिफ्ट), तो एआई ने नई रणनीतियों के नए "नकली" उदाहरण तेजी से उत्पन्न किए। इसने सुरक्षा प्रणाली को बहुत कम नए मानवीय लेबलिंग के साथ लगभग तुरंत अनुकूलित होने की अनुमति दी।

विफलताएँ (The "Not so fast" moments):

  • "अत्यधिक भीड़ वाला कमरा": कुछ कार्यों में, "चोर" और "नागरिक" इतने समान दिख रहे थे (ओवरलैपिंग डेटा) कि एआई अंतर नहीं कर सका। इसने केवल भ्रमित करने वाली अधिक तस्वीरें बनाईं, और गार्ड में कोई सुधार नहीं हुआ।
  • "बहुत बड़ा होने का" (Too Big to Fit) संकट: कुछ मौजूदा एआई उपकरण एक छोटी गली में चलने की कोशिश करने वाले विशाल ट्रकों की तरह थे। वे विशिष्ट सुरक्षा डेटा के लिए बहुत जटिल थे और क्रैश हो गए या विफल रहे।
  • "गलत लेबल" का जाल: यदि मूल डेटा में बहुत अधिक गलतियाँ थीं (जैसे एक अच्छी फ़ाइल को बुरा लेबल करना), तो एआई ने केवल और अधिक गलतियाँ करना सीख लिया। वह एक टूटे हुए आधार को ठीक नहीं कर सका।

4. नया टूल: "Nimai"

शोधकर्ताओं ने महसूस किया कि मौजूदा एआई उपकरण थोड़े अंधे पट्टी वाले चित्रकार की तरह थे—वे केवल एक व्यापक श्रेणी (जैसे, "एक चोर पेंट करो") के आधार पर पेंट कर सकते थे। वे यह नहीं कह सकते थे कि, "इस विशिष्ट व्यक्ति जैसा दिखने वाला चोर पेंट करो जिसे मैं पकड़े हुए हूँ।"

इसलिए, उन्होंने Nimai नामक एक नया टूल बनाया।

  • उपमा: कल्पना कीजिए कि एक मूर्तिकार केवल एक व्यक्ति की सामान्य मूर्ति नहीं बनाता है। इसके बजाय, वह एक वास्तविक व्यक्ति को लेता है, उसे देखता है, और एक नई मूर्ति बनाता है जो बहुत समान है लेकिन उसमें सूक्ष्म, नियंत्रित बदलाव हैं। यह सुरक्षा गार्ड को खतरे के हर सूक्ष्म पहलू को देखने की अनुमति देता है।
  • परिणाम: Nimai सबसे सफल टूल था, विशेष रूप से कठिन, डेटा की कमी वाले स्थितियों में।

5. मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि जेनेरेटिव एआई साइबर सुरक्षा के लिए एक शक्तिशाली उपकरण है, लेकिन यह जादू नहीं है।

  • यह चमत्कार करता है जब आपके पास बहुत कम डेटा हो या डेटा असंतुलित हो। यह अंतराल को भर सकता है और सिस्टम को तेजी से सीखने में मदद कर सकता है।
  • यह संघर्ष करता है जब डेटा बहुत अव्यवस्थित हो, श्रेणियाँ बहुत अधिक ओवरलैप करती हों, या एआई उपकरण काम के लिए बहुत भारी हों।

लेखक सुझाव देते हैं कि भविष्य के सुरक्षा उपकरणों को डेटा कैसे उत्पन्न किया जाए, इसके बारे में अधिक स्मार्ट होना चाहिए, जिसमें केवल यादृच्छिक (random) नकली डेटा बनाने के बजाय Nimai जैसे नियंत्रित तरीकों का उपयोग किया जाए। वे यह भी नोट करते हैं कि यह दृष्टिकोण सुरक्षा प्रणालियों को हैकर्स द्वारा अपनी रणनीति बदलने पर बिना सेनाओं की तरह इंसानों को लेबल करने के लिए नियुक्त किए, तेजी से अनुकूलित होने में मदद कर सकता है।

संक्षेप में: उन्होंने सुरक्षा गार्ड को एआई द्वारा बुरे लोगों की नई तस्वीरें पेंट करवाकर सिखाया। यह तब शानदार रहा जब तस्वीरें दुर्लभ थीं, लेकिन जब बुरे लोग और अच्छे लोग एक-दूसरे के बहुत समान दिखने लगे, तो एआई भ्रमित हो गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →