AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges
यह शोधपत्र AgentCyberRange का परिचय देता है, जो एक खुला, मल्टी-होस्ट इंफ्रास्ट्रक्चर है जिसे यथार्थवादी वेब एक्सप्लोइटेशन और पोस्ट-एक्सप्लोइटेशन परिदृश्यों में फ्रंटियर एआई सिस्टम की स्वायत्त आक्रामक क्षमताओं को बेंचमार्क करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल सीमित सफलता दिखाते हैं, फिर भी वे यथार्थवादी स्थितियों के तहत अज्ञात कमजोरियों का पता लगा सकते हैं और सुरक्षा प्रणालियों को बायपास कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
बड़ी तस्वीर: एक "डिजिटल डोजो" में AI का परीक्षण
कल्पना कीजिए कि आप जानना चाहते हैं कि क्या एक नया, सुपर-स्मार्ट रोबोट खतरनाक है। आप उससे सीधे यह नहीं पूछ सकते कि, "क्या तुम खतरनाक हो?" क्योंकि वह झूठ बोल सकता है। आप उसे केवल गणित का टेस्ट भी नहीं दे सकते, क्योंकि गणित में अच्छा होने का मतलब यह नहीं है कि वह किसी के घर में सेंध लगा सकता है।
इस रोबोट की असली क्षमता को समझने के लिए, आपको उसे एक सिम्युलेटेड पड़ोस (एक "साइबर रेंज") में डालना होगा जहाँ उसे ठीक वैसे ही घुसपैठ करने की कोशिश करनी होगी जैसे एक असली चोर करता है।
यह पेपर AGENTCYBERRANGE पेश करता है, जो बिल्कुल वही है: एक विशाल, ओपन-सोर्स "डिजिटल डोजो" जिसे यह परीक्षण करने के लिए डिज़ाइन किया गया है कि दुनिया के सबसे स्मार्ट AI सिस्टम कितनी कुशलता से वास्तविक साइबर हमले कर सकते हैं।
समस्या: "वीडियो गेम" बनाम "असली दुनिया"
इस पेपर से पहले, AI सुरक्षा का परीक्षण एक ऐसे वीडियो गेम की तरह था जहाँ आपको एक बार में केवल एक पहेली हल करनी होती थी।
- पुराने टेस्ट: "यह एक बंद दरवाज़ा है। ताला खोलें।" (इसे वल्नरेबिलिटी रिप्रोडक्शन कहा जाता है)।
- वास्तविकता: एक असली हैकर केवल एक ताला नहीं तोड़ता। उसे पहले पीछे का दरवाज़ा खोजने के लिए पड़ोस में घूमना पड़ता है, फिर अंदर घुसकर हॉल में मास्टर चाबी ढूंढनी पड़ती है, और फिर घर के हर कमरे को खोलना पड़ता है।
लेखकों का तर्क है कि पिछले परीक्षण बहुत सरल थे। उन्होंने AI की इस क्षमता का परीक्षण नहीं किया कि वह "दरवाजा खोजने" से लेकर "पूरे घर पर कब्जा करने" तक के बीच के कड़ियों को कैसे जोड़ता है।
समाधान: दो चरणों वाली डकैती
AGENTCYBERRANGE बेंचमार्क AI के सामने दो मुख्य चुनौतियाँ रखता है, जो एक असली डकैती की नकल करती हैं:
- वेब एक्सप्लोइटेशन (सामने का दरवाज़ा): AI को एक वास्तविक वेबसाइट (जैसे कोई बैंक या ब्लॉग) को देखना होगा और एक छिपा हुआ पिछला दरवाज़ा या कमजोर खिड़की ढूंढनी होगी। उसे बिना बताए यह समझना होगा कि कहाँ देखना है।
- पोस्ट-एक्सप्लोइटेशन (अंदरूनी काम): एक बार जब AI उस एक दरवाजे के माध्यम से अंदर घुस जाता है, तो उसे वहीं टिके रहना होता है। उसे "रूट" (बॉस की चाबी) पाने के लिए सीढ़ी चढ़नी होगी, सुरक्षा गार्डों (एंटीवायरस) से बचकर निकलना होगा, और एक कंप्यूटर से दूसरे कंप्यूटर पर जाना होगा जब तक कि वह पूरे नेटवर्क को नियंत्रित न कर ले।
इसे निष्पक्ष और दोहराने योग्य बनाने के लिए, उन्होंने CAGE नामक एक टूल बनाया है। CAGE को एक रेफरी और स्टेज मैनेजर के रूप में समझें। यह नकली घर तैयार करता है, AI रोबोट्स को चलने देता है, उनके कार्यों पर नज़र रखता है, और स्वचालित रूप से जाँच करता है कि वे वास्तव में सफल हुए या वे केवल भाग्यशाली थे।
प्रयोग: सबसे अच्छा चोर कौन है?
शोधकर्ताओं ने दुनिया के छह सबसे उन्नत AI सिस्टम (जिसमें GPT, Claude और अन्य के संस्करण शामिल हैं) का इस डिजिटल डोजो में परीक्षण किया। उन्होंने उन्हें हमला करने के लिए कदमों का एक "बजट" (जैसे समय की सीमा) दिया।
परिणाम:
- विजेता: AI सिस्टम GPT-5.5 (एक कोडिंग टूल जिसे Codex कहा जाता है, के साथ मिलकर) सबसे अच्छा था।
- स्कोर: सबसे अच्छा AI भी "सामने के दरवाज़े" की चुनौतियों में लगभग 16% और "अंदरूनी काम" की चुनौतियों में 32% मामलों में ही सफल हुआ।
- सीख: ये AI डरावने रूप से सक्षम होते जा रहे हैं। वे केवल पहेलियाँ हल नहीं कर रहे हैं; वे वास्तव में वास्तविक सॉफ़्टवेयर में सेंध लगा रहे हैं और नेटवर्क के माध्यम से आगे बढ़ रहे हैं। लेकिन, वे अभी भी पूर्ण और विश्वसनीय हैकर्स बनने से बहुत दूर हैं। वे अक्सर रास्ता भटक जाते हैं, छिपे हुए दरवाजों को मिस कर देते हैं, या सुरक्षा अलार्म द्वारा पकड़े जाते हैं।
"आश्चर्यजनक" निष्कर्ष
पेपर में दो दिलचस्प बातें मिलीं जो मूल परीक्षण योजना का हिस्सा नहीं थीं:
- उन्होंने नए रहस्य खोजे: परीक्षण वेबसाइटों में सेंध लगाने की कोशिश करते समय, AI ने गलती से लोकप्रिय सॉफ़्टवेयर में बिल्कुल नए, अज्ञात भेद्यता (Zero-days) खोज लिए जिन्हें अभी तक मानव डेवलपर्स भी नहीं जानते थे।
- वे अनुकूलन योग्य हैं: जब परीक्षण वातावरण ने उन्हें रोकने की कोशिश की (जैसे एंटीवायरस प्रोग्राम), तो AI ने कभी-कभी बचाव को बायपास करने के लिए अपने "उपकरणों" या "तरीकों" को बदल लिया, जिससे पता चला कि वे तुरंत निर्णय लेने में सक्षम हैं।
निष्कर्ष: हमें एक नए दर्पण की आवश्यकता है
लेखकों का निष्कर्ष है कि अब हम AI का परीक्षण केवल सरल पहेलियों पर नहीं कर सकते। क्योंकि ये सिस्टम जटिल हमलों को जोड़ने की क्षमता (दरवाजा खोजना, घुसना और कब्जा करना) दिखाने लगे हैं, इसलिए हमें वास्तविक, एंड-टू-एंड परीक्षण वातावरण जैसे AGENTCYBERRANGE की आवश्यकता है।
हमें यह देखने की ज़रूरत है कि वे कहाँ विफल होते हैं और वे कैसे सफल होते हैं, ताकि हम एक सुरक्षित और नियंत्रित "डोजो" में जोखिमों को समझ सकें। पेपर इस बात पर जोर देता है कि हालांकि ये AI शक्तिशाली हैं, लेकिन वे अभी तक "विश्वसनीय" हमलावर नहीं हैं, लेकिन उनकी क्षमता इतनी तेज़ी से बढ़ रही है कि हमें उन पर करीब से नज़र रखने की ज़रूरत है।
संक्षेप में: इस पेपर ने एक वास्तविक सिमुलेशन बनाया है यह परीक्षण करने के लिए कि क्या सुपर-AI इंसानों की तरह हैक कर सकते हैं। उन्होंने पाया कि सबसे स्मार्ट AI पहले से ही वास्तविक सिस्टम में घुस सकते हैं और नए छेद खोज सकते हैं, लेकिन वे अभी भी बहुत सारी गलतियाँ करते हैं। हमें अपनी डिजिटल दुनिया को सुरक्षित रखने के लिए इन परीक्षणों की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।