Anomaly Detection in Cybersecurity Service Contracts
यह शोध पत्र सार्वजनिक अधिकारियों और निजी प्रदाताओं के बीच साइबर सुरक्षा सेवा अनुबंधों में विसंगतियों का पता लगाने के लिए एक मशीन लर्निंग-आधारित दृष्टिकोण प्रस्तावित करता है, जिसमें स्थापित कानूनी प्रथाओं से विचलन को दर्शाने वाले गुणों को वर्गीकृत और विश्लेषण करने के लिए एक केस स्टडी का उपयोग किया गया है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कानून की दुनिया में, पूर्वानुमान लगाने की क्षमता एक गुण है। जब दो पक्ष एक अनुबंध (कॉन्ट्रैक्ट) पर हस्ताक्षर करते हैं, तो वे उम्मीद करते हैं कि शर्तें एक परिचित पैटर्न का पालन करेंगी, ठीक वैसे ही जैसे जंगल में एक घिसे-पिटे रास्ते की तरह। यदि कोई खंड (क्लॉज) इस पथ से अचानक भटक जाता है, तो एक प्रश्न उठता है: क्या यह एक अद्वितीय स्थिति के लिए आवश्यक अनुकूलन है, या यह कुछ असामान्य, शायद जोखिम भरा होने का संकेत है? मानक और विचित्र के बीच का यह तनाव साइबर सुरक्षा सेवा अनुबंधों की खोज करने वाले एक नए अध्ययन के केंद्र में है। ये वे समझौते हैं जो सार्वजनिक संगठनों, जैसे शहरों या अस्पतालों, और उनके डिजिटल सिस्टम की रक्षा के लिए नियुक्त निजी कंपनियों के बीच होते हैं। चूंकि ये अनुबंध अक्सर बहुत अधिक स्वतंत्रता के साथ लिखे जाते हैं, इसलिए वे काफी भिन्न हो सकते हैं। शोधकर्ता यह जानना चाहते थे कि क्या वे कंप्यूटर का उपयोग उन अनुबंधों को पहचानने के लिए कर सकते हैं जो भीड़ से अलग दिखते हैं, उनका मूल्यांकन बुरा बताने के लिए नहीं, बल्कि यह समझने के लिए कि उन्हें क्या अनूकठा बनाता है। कानूनी दस्तावेजों को डेटा के रूप में मानकर, उन्होंने 'सिस्टमैटिक कंटेंट एनालिसिस' नामक एक पद्धति लागू की, जो पाठ को विशिष्ट, गणनीय विशेषताओं में तोड़ देती है, और इसे 'मशीन लर्निंग' के साथ जोड़ा, जो एक प्रकार का कंप्यूटर प्रोग्राम है जो बिना स्पष्ट रूप से बताए पैटर्न पहचानना सीखता है।
शोधकर्ताओं ने 2019 और 2025 के बीच स्लोवाकिया में सार्वजनिक अधिकारियों और निजी साइबर सुरक्षा प्रदाताओं के बीच हस्ताक्षरित 567 अनुबंधों के एक विशिष्ट सेट पर ध्यान केंद्रित किया। उन्होंने इन दस्तावेजों को मैन्युअल रूप से पढ़ा, जटिल कानूनी भाषा को एक संरचित सूची में अनुवादित किया। उन्होंने नोट किया कि क्या किसी अनुबंध में विशिष्ट तत्व शामिल थे, जैसे मासिक भुगतान के बारे में एक खंड, एक बड़ी चूक (ब्रीच) की परिभाषा, या प्रदाता के लिए सॉफ्टवेयर और हार्डवेयर वितरित करने की आवश्यकता। उन्होंने कर्मचारियों की संख्या और सौदे के कुल मूल्य जैसे संख्यात्मक विवरण भी दर्ज किए। एक बार जब यह जानकारी व्यवस्थित हो गई, तो उन्होंने इसे 'आउटलियर्स' (असंगतियों) को खोजने के लिए डिज़ाइन किए गए एक मशीन लर्निंग सिस्टम में फीड किया। यह सिस्टम पहले से नहीं जानता था कि कौन से अनुबंध "गलत" या "सही" थे; इसके बजाय, इसने केवल उन दस्तावेजों को देखा जो विशिष्ट समूह से सबसे अधिक अलग दिखते थे। लक्ष्य यह पहचानना था कि कौन सी विशिष्ट विशेषताएं एक अनुबंध को सैकड़ों अन्य अनुबंधों की तुलना में असामान्य बनाती हैं।
अध्ययन से पता चला कि इस क्षेत्र में "सामान्य" क्या है, यह वास्तव में काफी विशिष्ट है। सबसे विशिष्ट अनुबंध, जिन्हें कंप्यूटर ने मानक के रूप में पहचाना, आमतौर पर परामर्श सेवाओं (कंसल्टिंग सर्विसेज) के सरल समझौते थे। इनमें अक्सर छोटे नगर पालिकाएं या सामाजिक देखभाल सुविधाएं शामिल थीं और इनका भुगतान नियमित मासिक किस्तों में किया जाता था। ये मानक अनुबंध संक्षिप्त होते थे, जो हर संभावित परिदृश्य को लिखने के बजाय सामान्य कानूनों पर निर्भर रहते थे। इसके विपरीत, जिन अनुबंधों को सिस्टम ने अत्यधिक विसंगतिपूर्ण (एनोमलस) के रूप में चिह्नित किया, वे अक्सर बहुत अधिक जटिल थे। उनमें अक्सर बड़े, रणनीतिक निकाय जैसे अस्पताल, क्षेत्रीय सरकारें या प्रमुख राज्य के स्वामित्व वाले उद्यम शामिल थे। ये अनुबंध केवल सलाह के लिए नहीं थे; इनमें अक्सर भौतिक सॉफ्टवेयर या हार्डवेयर की डिलीवरी, विस्तृत आईटी निगरानी प्रणाली और विभिन्न प्रकार की विफलताओं के लिए दंड की विस्तृत सूची शामिल थी।
सबसे आश्चर्यजनक निष्कर्षों में से एक यह था कि अनुबंध की जटिलता उसकी "विसंगति" (एनोमली) स्कोर का एक प्रमुख चालक थी। कंप्यूटर ने दायित्व (लायबिलिटी) पर अत्यधिक विस्तृत नियमों, देरी के लिए विशिष्ट दंड, और गंभीर उल्लंघन की सख्त परिभाषाओं वाले अनुबंधों को सांख्यिकीय रूप से दुर्लभ के रूप में पहचाना। उदाहरण के लिए, एक शहर और एक साइबर सुरक्षा फर्म के बीच का अनुबंध जिसमें शहर द्वारा भुगतान में देरी करने पर दंड का प्रावधान था, या एक खंड जो आपूर्तिकर्ता को बहुत विशिष्ट परिस्थितियों में केवल पीछे हटने की अनुमति देता था, उसे असामान्य के रूप में चिह्नित किया गया क्योंकि डेटासेट के अन्य अधिकांश अनुबंधों में ऐसे विशिष्ट, कठोर विवरण नहीं थे। इसी तरह, स्वास्थ्य देखभाल सुविधाओं से जुड़े अनुबंधों को अक्सर आउटलेयर के रूप में देखा गया, संभवतः इसलिए क्योंकि रोगी के डेटा की सुरक्षा के उच्च दांव ने छोटे शहरों के समझौतों की तुलना में अधिक कठोर और विशिष्ट शर्तों की आवश्यकता पैदा की। शोधकर्ताओं ने उल्लेख किया कि एक चरम मामले में, एक छोटी मासिक सेवा के लिए अनुबंध को असामान्य के रूपာ चिह्नित किया गया क्योंकि लागत आपूर्तिकर्ता के कुल राजस्व का एक असमान रूप से बड़ा हिस्सा थी, जो एक सांख्यिककीय विसंगति थी जिसे कंप्यूटर ने तुरंत पकड़ लिया।
हालाँकि, शोधकर्ता यह स्पष्ट करने में सावधानी बरतते हैं कि "विसंगतिपूर्ण" होने का अर्थ यह नहीं है कि कोई अनुबंध कानूनी रूप से दोषपूर्ण या अनुचित है। इसका अर्थ केवल यह है कि दस्तावेज़ सांख्यिकीय औसत से अलग दिखता है। वास्तव में, अध्ययन सुझाव देता है कि इनमें से कई "विचित्र" अनुबंध संभवतः पक्षों द्वारा अधिक सावधान होने का परिणाम हैं। जब किसी अनुबंध में बड़ी धनराशि या अस्पताल की सुरक्षा जैसी महत्वपूर्ण सेवा शामिल होती है, तो पक्षों के लिए खुद को बचाने के लिए अधिक नियम लिखना तर्कसंगत है। कंप्यूटर ने सरल, कम जोखिम वाले अनुबंधों के पैटर्न को देखते हुए, इन विस्तृत, उच्च-जोखिम वाले समझौतों को विचलन के रूप में व्याख्यायित किया। अध्ययन ने कानूनी डेटा को रिकॉर्ड करने के तरीके में एक संभावित कमी (ब्लाइंड स्पॉट) को भी उजागर किया। उदाहरण के लिए, शोधकर्ताओं ने एक अनुबंध को "वापस लेने का अधिकार नहीं है" के रूप में कोड किया यदि पाठ में इसका स्पष्ट उल्लेख नहीं था, भले ही कानून पहले से ही वह अधिकार प्रदान करता हो। इसका मतलब था कि कंप्यूटर कभी-कभी एक विशिष्ट वाक्य की अनुपस्थिति के बजाय एक कानूनी अधिकार की अनुपस्थिति पर प्रतिक्रिया दे रहा था।
अंततः, यह कार्य कानूनी दस्तावेजों को देखने का एक नया तरीका प्रदान करता है। कंप्यूटर का उपयोग करके साइबर सुरक्षा अनुबंधों के परिदृश्य को मैप करके, शोधकर्ताओं ने एक आधार रेखा (बेसलाइन) बनाई कि क्या सामान्य है और क्या दुर्लभ। इसका मतलब यह नहीं है कि दुर्लभ अनुबंधों से बचना चाहिए; बल्कि, यह सार्वजनिक अधिकारियों को यह देखने के लिए एक उपकरण प्रदान करता है कि वे कब कम ज्ञात क्षेत्रों में प्रवेश कर रहे हैं। यदि कोई शहर एक अस्पताल के साथ एक जटिल सौदा करने वाला है, तो सिस्टम उन्हें दिखा सकता है कि इस प्रकार का समझौता उन सैकड़ों सरल समझौतों से भिन्न दिखता है जो वे आमतौर पर करते हैं। यह जागरूकता उन्हें यह सुनिश्चित करने की अनुमति देती है कि असामान्य शर्तें जानबूझकर और विचारपूर्वक ली गई हैं, न कि आकस्मिक। अध्ययन निष्कर्ष निकालता है कि जबकि मशीन आउटलेयर्स को पहचान सकती है, वह उनके मूल्य का निर्णय नहीं कर सकती। यह समझना कि क्या एक जटिल अनुबंध आवश्यक है या अत्यधिक, अभी भी मानव विशेषज्ञों का काम है जिन्हें वास्तविक दुनिया की जरूरतों के संदर्भ में संख्याओं की व्याख्या करनी होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।