← नवीनतम पेपर
🤖 machine learning

NASimJax: GPU-Accelerated Policy Learning Framework for Penetration Testing

यह शोध पत्र NASimJax को प्रस्तुत करता है, जो एक GPU-त्वरित JAX-आधारित फ्रेमवर्क है जो विविध नेटवर्क परिदृश्यों पर स्केलेबल प्रशिक्षण को सक्षम करके पेनिट्रेशन टेस्टिंग के लिए सुदृढीकरण शिक्षण (reinforcement learning) को महत्वपूर्ण रूप से त्वरित करता है, जिससे दो-चरणीय क्रिया अपघटन (two-stage action decomposition) और अनुकूलित पाठ्यक्रम शिक्षण (optimized curriculum learning) जैसी नवीन तकनीकों के माध्यम से बेहतर ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त होता है।

मूल लेखक: Raphael Simon, José Carrasquel, Wim Mees, Pieter Libin

प्रकाशित 2026-03-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Raphael Simon, José Carrasquel, Wim Mees, Pieter Libin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक अत्यधिक सुरक्षित बैंक वॉल्ट (तिजोरी) में घुसपैठ करना सिखाने की कोशिश कर रहे हैं। लेकिन एक पेंच है: रोबोट पूरी इमारत को देख नहीं सकता, उसे यह नहीं पता कि गार्ड कहाँ हैं, और उसे बिना देखे ही आसपास की चीजों को टटोलकर लेआउट का पता लगाना होगा। यह मूल रूप से पेनेट्रेशन टेस्टिंग (या "एथिकल हैकिंग") है: बुरे लोगों के आने से पहले कमजोरियों को खोजने के लिए साइबर हमलों का अनुकरण करना।

समस्या यह है कि एक रोबोट (या AI) को यह करना सिखाना अविश्वसनीय रूप से कठिन और धीमा है। यहाँ इस पेपर का समाधान, NASimJax, सरल उपमाओं (analogies) का उपयोग करके दिया गया है।

1. समस्या: "स्लो मोशन" सिम्युलेटर

कल्पना कीजिए कि आप दिन में एक गेम खेलकर शतरंज खेलना सीखने की कोशिश कर रहे हैं। जब तक आप 1,000 गेम खेल लेंगे, तब तक आपने कुछ ही महीने बिताए होंगे। अब, कल्पना कीजिए कि AI को अच्छा बनने के लिए लाखों गेम खेलने की आवश्यकता है।

  • पुराना तरीका: पिछले उपकरण एक मानक लैपटॉप पर सिमुलेशन चलाने वाले एक अकेले व्यक्ति की तरह थे। वे इतने धीमे थे कि AI केवल बहुत छोटे, सरल नेटवर्क पर अभ्यास कर सकता था। जब AI ने एक वास्तविक, जटिल नेटवर्क का सामना करने की कोशिश की, तो वह विफल हो गया क्योंकि उसने कभी इतना बड़ा नेटवर्क देखा ही नहीं था।
  • बाधा (Bottleneck): कंप्यूटर का मस्तिष्क (CPU) उसके शरीर (GPU) से बहुत धीरे बात कर रहा था। यह एक मैनेजर की तरह था जो एक शोर भरे कारखाने में अपने वर्कर को निर्देश चिल्लाकर दे रहा है, और अगला आदेश देने से पहले जवाब का इंतज़ार कर रहा है।

2. समाधान: NASimJax (एक "सुपर-स्पीड" फैक्ट्री)

लेखकों ने JAX नामक एक विशेष भाषा का उपयोग करके उनके सिमुलेशन सॉफ़्टवेयर का पूर्ण पुनर्गठन किया, जिसे NASimJax कहा जाता है।

  • उपमा: एक व्यक्ति के निर्देश चिल्लाने के बजाय, एक विशाल कारखाने की कल्पना करें जहाँ 1,000 रोबोट बिल्कुल एक साथ, पूर्ण तालमेल में काम कर रहे हैं।
  • परिणाम: NASimJax पुराने संस्करण की तुलना में 100 गुना तेज़ है। यह पुराने संस्करण द्वारा हजारों हमलों के सिमुलेशन में लगने वाले समय में लाखों साइबर हमलों का सिमुलेशन कर सकता है। यह AI को उन विशाल, जटिल नेटवर्क पर अभ्यास करने की अनुमति देता है जो पहले असंभव थे।

3. प्रशिक्षण मैदान: एक "आकार बदलने वाला" भूलभुलैया (Maze)

AI को किसी भी नेटवर्क को संभालने के लिए पर्याप्त स्मार्ट बनाने के लिए, उन्होंने केवल एक भूलभुलैया नहीं बनाई; उन्होंने एक ऐसी मशीन बनाई जो अनंत, अद्वितीय भूलभुलैया उत्पन्न करती है।

  • अवधारणा: वे इसे Contextual POMDP कहते हैं। इसे एक वीडियो गेम की तरह समझें जहाँ हर बार नया गेम शुरू करने पर लेवल का लेआउट, दुश्मनों की संख्या और जाल (traps) बदल जाते हैं।
  • लक्ष्य: AI किसी विशिष्ट मानचित्र (map) को रट नहीं रहा है। यह हैकिंग के नियमों को इतनी अच्छी तरह सीख रहा है कि वह किसी भी नई, अनदेखी इमारत में जा सकता है और बिना कभी उसे देखे, अंदर घुसने का तरीका ढूंढ सकता है। इसे Zero-Shot Generalization कहा जाता है।

4. चुनौती: "बहुत सारे बटन" वाली समस्या

जैसे-जैसे नेटवर्क बड़ा होता है (हैक करने के लिए अधिक कंप्यूटर), AI द्वारा लिए जा सकते हैं संभावित कार्यों की संख्या विस्फोट की तरह बढ़ती है।

  • पुराना तरीका (Flat Action Masking): एक ऐसे रिमोट कंट्रोल की कल्पना करें जिसमें 10,000 बटन हैं। अधिकांश टूटे हुए या वर्तमान कमरे के लिए बेकार हैं। AI को अनुमान लगाना पड़ता है कि कौन सा काम करेगा। यह घास के ढेर में सुई खोजने जैसा है जहाँ आप बस बटन दबाकर देख रहे हैं।
  • नया तरीका (2SAS - Two-Stage Action Selection): लेखकों ने एक स्मार्ट रणनीति पेश की। 10,000 बटन दबाने के बजाय, AI इसे दो चरणों में करता है:
    1. चरण 1: "मुझे किस कंप्यूटर को निशाना बनाना चाहिए?" (होस्ट का चयन करता है)।
    2. चरण 2: "मैं उस कंप्यूटर के साथ क्या करूँ?" (एक्शन का चयन करता है)।
    • उपमा: यह पहले से एक संदिग्ध को इंटरव्यू करने का फैसला करने, और फिर यह तय करने जैसा है कि क्या सवाल पूछना है। यह विशाल समस्या को दो छोटी, प्रबंधनीय समस्याओं में तोड़ देता है, जिससे सीखना बहुत तेज़ और सटीक हो जाता है।

5. गुप्त नुस्खा: "स्मार्ट करिकुलम" (Smart Curriculum)

आप AI को एक विशाल नेटवर्क को हैक करने के लिए बिना अभिभूत किए कैसे सिखा सकते हैं?

  • डोमेन रैंडमाइजेशन (DR): AI को सभी आकारों की रैंडम भूलभुलभुलैया में डालना। यह एक छात्र को रैंडम गणित के सवालों में डालने जैसा है। यह छोटे कामों के लिए ठीक काम करता है, लेकिन बड़े कामों के साथ यह अव्यवस्थित हो जाता है।
  • प्रायोरिटाइज्ड लेवल रीप्ले (PLR): यह "स्मार्ट करिकुलम" है। सिस्टम AI पर नज़र रखता है। यदि AI किसी विशिष्ट प्रकार की भूलभुलैया में विफल होता है, तो सिस्टम इसे याद रखता है और AI को उसी विशिष्ट प्रकार की भूलभुलैया का अभ्यास करने के लिए मजबूर करता है जब तक कि वह इसमें बेहतर न हो जाए।
    • निष्कर्ष: उन्होंने पाया कि पहले AI को स्पार्स (कम घनत्व वाले), सरल नेटवर्क (जैसे एक छोटा कार्यालय) पर प्रशिक्षित करने से बाद में डेंस (घने), जटिल नेटवर्क (जैसे एक विशाल डेटा सेंटर) को हैक करने में वह बेहतर बन गया। यह एक शांत सड़क पर साइकिल चलाना सीखने के बाद भीड़भाड़ वाले शहर में रेस करने जैसा है।

6. "ओप्स" मोमेंट: जब चीजें टूट जाती हैं

शोधकर्ताओं ने बहुत बड़े नेटवर्क पर "स्मार्ट करिकुलम" (PLR) और "टू-स्टेप स्ट्रैटेजी" (2SAS) को मिलाते समय एक अजीब गड़बड़ी देखी।

  • गड़बड़ी: सिस्टम गेम को तब रीसेट कर देता था जब AI एक लंबे मिशन को पूरा करने ही वाला होता था। क्योंकि AI एक साथ दो चरणों (Target + Action) को सीखने की कोशिश कर रहा था, वह इस बात को लेकर भ्रमित हो गया कि विफलता के लिए किसे जिम्मेदार ठहराया जाए। यह एक रिले रेस की तरह था जहाँ बैटन (baton) गिर गया, लेकिन धावक एक-दूसरे को दोष देते रहे, और कोच ने दोबारा कोशिश करने से पहले ही दौड़ को रीसेट कर दिया।
  • सबक: इसने उन्हें सिखाया कि बहुत जटिल कार्यों के लिए, आपको प्रशिक्षण वातावरण को कैसे रीसेट किया जाता है, इसके बारे में सावधान रहना चाहिए।

सारांश

NASimJax साइबर हैकर्स के लिए एक सुपर-फास्ट, लचीला प्रशिक्षण मैदान है। सिमुलेशन को 100 गुना तेज़ बनाकर और AI को बड़ी समस्याओं को छोटे चरणों में तोड़ने के लिए सिखाकर, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो उन जटिल नेटवर्क को हैक करना सीख सकता है जिन्हें उसने पहले कभी नहीं देखा है। यह साबित करता है कि यदि आप AI को सही प्रकार के "अभ्यास स्तरों" (सरल से शुरू होकर कठिन की ओर) पर प्रशिक्षित करते हैं, तो वह वास्तविक दुनिया के साइबर खतरों से निपटने में सक्षम मास्टर हैकर बन सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →