Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense
यह शोध पत्र ओपन सिक्योरिटी बेंचमार्क (OSB) को प्रस्तुत करता है, जो एक नवीन ढांचा है जिसे सार्वजनिक, क्रॉस-वेंडर मूल्यांकन डेटा में मौजूद महत्वपूर्ण अंतर को पाटने के लिए एक फ्रोजन (frozen), समग्र और क्वेरेबल (queryable) सुरक्षा वातावरण के साथ ग्राउंड-ट्रुथ उत्तर प्रदान करके एंटरप्राइज साइबर डिफेंस के लिए स्वायत्त एआई एजेंटों का मूल्यांकन करने और उन पर विश्वास बनाने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल आदेशों का पालन ही नहीं करते, बल्कि जूनियर जासूसों की तरह काम करते हैं, जो बुरे लोगों के घुसने से पहले विशाल, अव्यवस्थित कार्यालय भवनों में सुरक्षा खामियों की तलाश करते हैं। यह "स्वायत्त साइबर रक्षा" (autonomous cyber defense) का सपना है, जहाँ AI एजेंट लगातार एक संगठन की डिजिटल स्थिति को स्कैन करते हैं—यह जाँचते हैं कि सर्वर रूम की चाबियाँ किसके पास हैं, कौन सा सॉफ़्टवेयर पुराना हो गया है, और क्या कोई चुपके से घूम रहा है। लेकिन यहाँ एक पेंच है: एक जासूस पर भरोसा करने के लिए, आपको यह जानने की आवश्यकता है कि क्या वे वास्तव में मामला सुलझा रहे हैं या केवल अनुमान लगा रहे हैं। अभी, एक बड़ी समस्या है: वास्तविक कंपनी का डेटा गुप्त होता है, इसलिए शोधकर्ता इन AI जासूसों को उन्हीं वास्तविक, जटिल परिदृश्यों पर टेस्ट नहीं कर सकते। यह एक पायलट को केवल बादलों की तस्वीरें दिखाकर विमान उड़ाना सिखाने जैसा है, बिना उसे कभी वास्तविक तूफान में नियंत्रणों को छूने देने के। एक साझा, निष्पक्ष परीक्षण आधार के बिना, हम यह नहीं जान सकते कि क्या ये AI एजेंट हमें बचाने के लिए तैयार हैं या वे केवल मनगढ़ंत बातें बना रहे हैं।
यह शोध पत्र एक समाधान पेश करता है जिसे ओपन सिक्योरिटी बेंचमार्क (OSB) कहा जाता है, जो अनिवार्य रूप से इन AI जासूसों को टेस्ट करने के लिए विशेष रूप से बनाया गया एक विशाल, जमी हुई, नकली "डिजिटल सिटी" है। इसे एक विशाल, अपरिवणीय वीडियो गेम लेवल की तरह समझें जो बिल्कुल एक वास्तविक निगम की तरह दिखता और महसूस होता है, जिसमें नकली कर्मचारी, नकली क्लाउड सर्वर और नकली पासवर्ड शामिल हैं। लेखकों ने इस "शहर" का निर्माण इन AI जासूसों के बीच के अंतर को पाटने के लिए किया है। उन्होंने एक ऐसा ढांचा बनाया है जहाँ AI एजेंटों को एक रहस्य सुलझाने के लिए दिया जाता है—जैसे कि "उन सभी कर्मचारियों को खोजें जिन्हें पिछले महीने निकाला गया था लेकिन उनके पास अभी भी कंपनी की गुप्त फाइलों तक पहुंच है"—और एजेंटों को दो अलग-अलग तरीकों से उत्तर खोजने के लिए कहा जाता है: या तो एक विशेष भाषा (SQL) में क्वेरी लिखकर एक विशाल डेटाबेस को खोजना, या AWS या Google Workspace जैसे वास्तविक वेंडर टूल्स का उपयोग करने वाले मानव ऑपरेटर होने का नाटक करना।
यह शोध पत्र केवल यह नहीं कहता कि "देखो, हमने एक खेल बनाया है।" यह इन एजेंटों को टेस्ट करने के लिए एक कठोर ढांचा तैयार करता है ताकि वातावरण को फ्रीज (स्थिर) किया जा सके ताकि हर बार जब कोई एजेंट रन करे, तो "ग्राउंड ट्रुथ" (सही उत्तर) बिल्कुल वही रहे। यह शोधकर्ताओं को न केवल इस आधार पर ग्रेड देने की अनुमति देता है कि क्या एजेंट ने सही उत्तर दिया, बल्कि इस आधार पर भी कि वह वहाँ कैसे पहुँचा। क्या उसने सही सवाल पूछे? क्या उसने विभिन्न प्रणालियों के बीच कड़ियों को जोड़ा? अध्ययन इस ढांचे को सिंथेटिक, नकली संगठनों के साथ स्थापित करता है, जिससे विभिन्न आकार की कंपनियों (75 लोगों की छोटी टीमों से लेकर 2,000 कर्मचारियों वाली बड़ी कंपनियों तक) में टेस्टिंग संभव होती है। इस ढांचे को यह प्रकट करने के लिए डिज़ाइन किया गया है कि क्या AI एजेंट वास्तविक दुनिया के कार्यों की जटिलता को संभाल सकते हैं, जैसे कि विभिन्न वेंडरों के बीच एक मानव संसाधन (HR) रिकॉर्ड को क्लाउड अकाउंट से जोड़ना, जो कि सिंगल-वेंडर टूल्स के लिए एक अत्यंत कठिन क्षमता है।
महत्व रूप से, यह शोध पत्र तर्क देता है कि हम एक AI एजेंट पर केवल इसलिए भरोसा नहीं कर सकते क्योंकि वह एक आत्मविश्वास से भरा उत्तर देता है। लेखक स्पष्ट रूप से इस विचार को खारिज करते हैं कि हम इन एजेंटों का मूल्यांकन अलगाव में या छोटे, साफ-सुथरे डेटासेट पर कर सकते हैं; वे जोर देते हैं कि निष्पक्ष होने के लिए वातावरण का "फ्रीज" होना और क्रॉस-वेंडर होना अनिवार्य है। वे यह दावा नहीं कर रहे हैं कि AI ने साइबर रक्षा को हल कर लिया है। इसके बजाय, वे सुझाव देते हैं कि यह बेंचमार्क प्रगति को मापने के लिए एक आवश्यक उपकरण है, जो "क्या यह AI सुरक्षित है?" के अस्पष्ट प्रश्न को एक ठोस स्कोरकार्ड में बदल देता है। एक साझा, पुनरुत्पादक (reproducible) लक्ष्य प्रदान करके, OSB का लक्ष्य इस क्षेत्र को अनुमान लगाने से माप (measuring) की ओर ले जाना है, यह सुनिश्चित करना कि जब हम अंततः इन AI एजेंटों को हमारे वास्तविक डिजिटल शहरों की कमान सौंपें, तो हमें पता हो कि वे वास्तव में कैसा प्रदर्शन करेंगे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।