← नवीनतम पेपर
💻 computer science

Training Versus Hiring in Security Operations Centers: Agent-Based and Reinforcement Learning Simulations of Training Duration Effects on CyberTeam Performance

यह अध्ययन एजेंट-आधारित मॉडलिंग और सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके यह प्रदर्शित करता है कि सुरक्षा संचालन केंद्रों (Security Operations Centers) में प्रशिक्षण की अवधि गैर-रेखीय (nonlinear) प्रदर्शन लाभ प्रदान करती है, जिसमें इष्टतम निवेश 500 और 1,000 एपिसोड के बीच होता है और अत्यधिक प्रशिक्षित टीमें 20-25 अतिरिक्त कर्मियों की भर्ती के बराबर दक्षता लाभ प्राप्त करती हैं।

मूल लेखक: Max N. Yaw, Ferdinand Kpieleh, Aos Mulahuwaish, Basheer Qolomany, Jacques Bou Abdo

प्रकाशित 2026-06-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Max N. Yaw, Ferdinand Kpieleh, Aos Mulahuwaish, Basheer Qolomany, Jacques Bou Abdo

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक सिक्योरिटी ऑपरेशंस सेंटर (SOC) एक हाई-स्टेक्स वीडियो गेम टूर्नामेंट की तरह है। एक संगठन के पास एक बजट है और उनके सामने एक महत्वपूर्ण चुनाव है: क्या उन्हें नए, अनुभवहीन खिलाड़ियों की एक विशाल सेना रखनी चाहिए, या उन्हें अपनी छोटी, मौजूदा टीम को एक गहन, दीर्घकालिक प्रशिक्षण शिविर से गुजारना चाहिए?

यह शोध पत्र इस प्रश्न का उत्तर देने के लिए एक कंप्यूटर सिमुलेशन का उपयोग करता है। वास्तविक लोगों को वर्षों तक देखने के बजाय, शोधकर्ताओं ने एक डिजिटल दुनिया बनाई जहाँ "एजेंट्स" (कंप्यूटर प्रोग्राम जो मनुष्यों का प्रतिनिधित्व करते हैं) साइबर हमले और बचाव का खेल खेलते हैं। उन्होंने एक विशेष प्रकार के AI का उपयोग किया जिसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है ताकि एक "प्रशिक्षण सिम्युलेटर" के रूप में कार्य किया जा सके। ठीक वैसे ही जैसे एक मानव गेमर जितना अधिक खेलता है, उतना ही बेहतर होता जाता है, इन AI एजेंटों ने हजारों राउंड खेलकर रणनीतियाँ सीखीं, जिसमें जीतने पर उन्हें पुरस्कार और हारने पर दंड मिला।

यहाँ उनकी खोज दी गई है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "तीन-अंकों वाली" प्रशिक्षण कहानी

शोध से पता चला कि प्रशिक्षण आपको एक स्थिर, सीधी रेखा में बेहतर नहीं बनाता है। यह एक नाटक के तीन अलग-अलग अंकों की तरह तीन विशिष्ट चरणों में होता है:

  • अंक 1: अनाड़ी शुरुआत का चरण (एपिसोड 1–500):
    कल्पना कीजिए कि एक नया खिलाड़ी जिसने अभी-अभी कंट्रोलर उठाया है। वे खोज कर रहे हैं, यादृच्छिक चालें आजमा रहे हैं, और ज्यादातर विफल हो रहे हैं। सिमुलेशन में, इस चरण में मौजूद टीमों ने लगभग कुछ नहीं जीता (0% से 15% जीत दर)। वे बस नियमों को समझ रहे थे।
  • अंक 2: "आहा!" वाला क्षण (एपिसोड 500–2,000):
    यह सबसे महत्वपूर्ण दौर (स्वीट स्पॉट) है। टीम अनुमान लगाना बंद कर देती है और समझने लगती है। वे समझ जाते हैं कि एक साथ मिलकर कैसे काम करना है, और उनका प्रदर्शन आसमान छूने लगता है। उनकी जीत की दर लगभग 15% से बढ़कर 50% से अधिक हो जाती है। यहीं पर सबसे अधिक मूल्य प्राप्त होता है।
  • अंक 3: मास्टर पॉलिश (एपिसोड 2,000–5,000):
    टीम अब एक प्रो बन चुकी है। वे लगभग हर बार जीत रहे हैं (93% से 95%)। हालांकि, प्रशिक्षण का हर अतिरिक्त घंटा यहाँ केवल कौशल में बहुत मामूली वृद्धि जोड़ता है। यह एक मास्टर शेफ द्वारा किसी व्यंजन को 1% अधिक स्वादिष्ट बनाने के लिए अतिरिक्त समय बिताने जैसा है; यह अच्छा है, लेकिन बड़े लाभ पहले ही मिल चुके हैं।

2. आपके बटुए के लिए "स्वीट स्पॉट"

यदि आप वह बॉस हैं जो यह तय कर रहे हैं कि अपनी टीम को कितने समय तक प्रशिक्षित करना है, तो शोध पत्र एक विशिष्ट रणनीति का सुझाव देता है: बहुत जल्दी न रुकें, लेकिन हमेशा के लिए प्रशिक्षण भी न दें।

  • खतरे का क्षेत्र: यदि आप पहले 500 "गेम" के बाद प्रशिक्षण रोक देते हैं, तो आप प्रक्रिया के सबसे मूल्यवान हिस्से को फेंक रहे हैं। आप अभी भी "अनाड़ी" चरण में हैं।
  • स्वर्ण क्षेत्र (गोल्डन ज़ोन): आपके निवेश पर सबसे अच्छा रिटर्न 500 और 1,000 खेलों के बीच मिलता है। यह वह जगह है जहाँ टीम "नौसिखियों" से "सक्षम पेशेवरों" में बदल जाती है और कौशल में सबसे बड़ी छलांग लगती है।
  • घटता हुआ प्रतिफल (डिमिमिनिशिंग रिटर्न्स): 2,000 खेलों के बाद, आप अभी भी बेहतर हो रहे हैं, लेकिन बहुत कम सुधार के लिए बहुत अधिक समय खर्च हो रहा है।

3. "मैजिक मल्टीप्लायर": छोटी टीमें बनाम बड़ी सेनाएं

यह सबसे आश्चर्यजनक खोज है। शोधकर्ताओं ने एक छोटी, अत्यधिक प्रशिक्षित टीम की तुलना बड़ी, अप्रशिक्षित टीमों (ऐसी टीमें जो केवल बुनियादी नियमों का पालन करती हैं और कभी सीखती नहीं हैं) से की।

  • परिणाम: केवल 5 प्रशिक्षित हमलावरों (attackers) की एक टीम ने 25 से 35 अप्रशिक्षित हमलावरों की टीम के समान प्रदर्शन किया।
  • उपमा: एक समूह के 5 विशिष्ट विशेष बलों (special forces) के सैनिकों बनाम 30 अप्रशिक्षित नागरिकों के झुंड के बारे में सोचें। 5 प्रशिक्षित सैनिक, क्योंकि वे जानते हैं कि क्या करना है और कैसे समन्वय करना है, बड़े समूह को हरा सकते हैं।
  • गणित: शोध पत्र का दावा है कि एक प्रशिक्षित हमलावर लगभग 3 से 7 अप्रशिक्षित हमलावरों के बराबर है।

संगठनों के लिए निचोड़

शोध पत्र निष्कर्ष निकालता है कि यदि आपको अपने वर्तमान 5 लोगों को लंबे समय तक प्रशिक्षित करने के बजाय 20 नए लोगों को काम पर रखने में से चुनना है, तो प्रशिक्षण करना एक स्मार्ट निर्णय है।

  • भर्ती करना एक बड़ी टीम देता है जो धीमी, अनाड़ी है और जिसे काम पूरा करने के लिए बहुत से लोगों की आवश्यकता होती है।
  • प्रशिक्षण करना एक छोटी टीम को एक अत्यधिक कुशल मशीन में बदल देता है जो एक बहुत बड़े समूह का काम कर सकती है।

अध्ययन सुझाव देता है कि संगठनों को ऐसे प्रशिक्षण कार्यक्रम डिजाइन करने चाहिए जो "अनाड़ी" चरण से आगे निकलने और "विशेषज्ञ" चरण (लगभग 1,000 से 2,000 सिम्युलेटेड प्रशिक्षण सत्रों) तक पहुँचने के लिए पर्याप्त लंबे हों। ऐसा करने से एक ऐसी टीम तैयार होती है जो न केवल बेहतर है बल्कि केवल अधिक शरीर (लोग) खरीदने की तुलना में बहुत अधिक लागत प्रभावी भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →