← नवीनतम पेपर
💻 computer science

Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense

यह शोध पत्र ओपन सिक्योरिटी बेंचमार्क (OSB) को प्रस्तुत करता है, जो एक नवीन ढांचा है जिसे सार्वजनिक, क्रॉस-वेंडर मूल्यांकन डेटा में मौजूद महत्वपूर्ण अंतर को पाटने के लिए एक फ्रोजन (frozen), समग्र और क्वेरेबल (queryable) सुरक्षा वातावरण के साथ ग्राउंड-ट्रुथ उत्तर प्रदान करके एंटरप्राइज साइबर डिफेंस के लिए स्वायत्त एआई एजेंटों का मूल्यांकन करने और उन पर विश्वास बनाने के लिए डिज़ाइन किया गया है।

मूल लेखक: Gal Engelberg, Michael Arenzon, Leon Goldberg

प्रकाशित 2026-07-31
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Gal Engelberg, Michael Arenzon, Leon Goldberg

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल आदेशों का पालन ही नहीं करते, बल्कि जूनियर जासूसों की तरह काम करते हैं, जो बुरे लोगों के घुसने से पहले विशाल, अव्यवस्थित कार्यालय भवनों में सुरक्षा खामियों की तलाश करते हैं। यह "स्वायत्त साइबर रक्षा" (autonomous cyber defense) का सपना है, जहाँ AI एजेंट लगातार एक संगठन की डिजिटल स्थिति को स्कैन करते हैं—यह जाँचते हैं कि सर्वर रूम की चाबियाँ किसके पास हैं, कौन सा सॉफ़्टवेयर पुराना हो गया है, और क्या कोई चुपके से घूम रहा है। लेकिन यहाँ एक पेंच है: एक जासूस पर भरोसा करने के लिए, आपको यह जानने की आवश्यकता है कि क्या वे वास्तव में मामला सुलझा रहे हैं या केवल अनुमान लगा रहे हैं। अभी, एक बड़ी समस्या है: वास्तविक कंपनी का डेटा गुप्त होता है, इसलिए शोधकर्ता इन AI जासूसों को उन्हीं वास्तविक, जटिल परिदृश्यों पर टेस्ट नहीं कर सकते। यह एक पायलट को केवल बादलों की तस्वीरें दिखाकर विमान उड़ाना सिखाने जैसा है, बिना उसे कभी वास्तविक तूफान में नियंत्रणों को छूने देने के। एक साझा, निष्पक्ष परीक्षण आधार के बिना, हम यह नहीं जान सकते कि क्या ये AI एजेंट हमें बचाने के लिए तैयार हैं या वे केवल मनगढ़ंत बातें बना रहे हैं।

यह शोध पत्र एक समाधान पेश करता है जिसे ओपन सिक्योरिटी बेंचमार्क (OSB) कहा जाता है, जो अनिवार्य रूप से इन AI जासूसों को टेस्ट करने के लिए विशेष रूप से बनाया गया एक विशाल, जमी हुई, नकली "डिजिटल सिटी" है। इसे एक विशाल, अपरिवणीय वीडियो गेम लेवल की तरह समझें जो बिल्कुल एक वास्तविक निगम की तरह दिखता और महसूस होता है, जिसमें नकली कर्मचारी, नकली क्लाउड सर्वर और नकली पासवर्ड शामिल हैं। लेखकों ने इस "शहर" का निर्माण इन AI जासूसों के बीच के अंतर को पाटने के लिए किया है। उन्होंने एक ऐसा ढांचा बनाया है जहाँ AI एजेंटों को एक रहस्य सुलझाने के लिए दिया जाता है—जैसे कि "उन सभी कर्मचारियों को खोजें जिन्हें पिछले महीने निकाला गया था लेकिन उनके पास अभी भी कंपनी की गुप्त फाइलों तक पहुंच है"—और एजेंटों को दो अलग-अलग तरीकों से उत्तर खोजने के लिए कहा जाता है: या तो एक विशेष भाषा (SQL) में क्वेरी लिखकर एक विशाल डेटाबेस को खोजना, या AWS या Google Workspace जैसे वास्तविक वेंडर टूल्स का उपयोग करने वाले मानव ऑपरेटर होने का नाटक करना।

यह शोध पत्र केवल यह नहीं कहता कि "देखो, हमने एक खेल बनाया है।" यह इन एजेंटों को टेस्ट करने के लिए एक कठोर ढांचा तैयार करता है ताकि वातावरण को फ्रीज (स्थिर) किया जा सके ताकि हर बार जब कोई एजेंट रन करे, तो "ग्राउंड ट्रुथ" (सही उत्तर) बिल्कुल वही रहे। यह शोधकर्ताओं को न केवल इस आधार पर ग्रेड देने की अनुमति देता है कि क्या एजेंट ने सही उत्तर दिया, बल्कि इस आधार पर भी कि वह वहाँ कैसे पहुँचा। क्या उसने सही सवाल पूछे? क्या उसने विभिन्न प्रणालियों के बीच कड़ियों को जोड़ा? अध्ययन इस ढांचे को सिंथेटिक, नकली संगठनों के साथ स्थापित करता है, जिससे विभिन्न आकार की कंपनियों (75 लोगों की छोटी टीमों से लेकर 2,000 कर्मचारियों वाली बड़ी कंपनियों तक) में टेस्टिंग संभव होती है। इस ढांचे को यह प्रकट करने के लिए डिज़ाइन किया गया है कि क्या AI एजेंट वास्तविक दुनिया के कार्यों की जटिलता को संभाल सकते हैं, जैसे कि विभिन्न वेंडरों के बीच एक मानव संसाधन (HR) रिकॉर्ड को क्लाउड अकाउंट से जोड़ना, जो कि सिंगल-वेंडर टूल्स के लिए एक अत्यंत कठिन क्षमता है।

महत्व रूप से, यह शोध पत्र तर्क देता है कि हम एक AI एजेंट पर केवल इसलिए भरोसा नहीं कर सकते क्योंकि वह एक आत्मविश्वास से भरा उत्तर देता है। लेखक स्पष्ट रूप से इस विचार को खारिज करते हैं कि हम इन एजेंटों का मूल्यांकन अलगाव में या छोटे, साफ-सुथरे डेटासेट पर कर सकते हैं; वे जोर देते हैं कि निष्पक्ष होने के लिए वातावरण का "फ्रीज" होना और क्रॉस-वेंडर होना अनिवार्य है। वे यह दावा नहीं कर रहे हैं कि AI ने साइबर रक्षा को हल कर लिया है। इसके बजाय, वे सुझाव देते हैं कि यह बेंचमार्क प्रगति को मापने के लिए एक आवश्यक उपकरण है, जो "क्या यह AI सुरक्षित है?" के अस्पष्ट प्रश्न को एक ठोस स्कोरकार्ड में बदल देता है। एक साझा, पुनरुत्पादक (reproducible) लक्ष्य प्रदान करके, OSB का लक्ष्य इस क्षेत्र को अनुमान लगाने से माप (measuring) की ओर ले जाना है, यह सुनिश्चित करना कि जब हम अंततः इन AI एजेंटों को हमारे वास्तविक डिजिटल शहरों की कमान सौंपें, तो हमें पता हो कि वे वास्तव में कैसा प्रदर्शन करेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →