Cochise: A Reference Harness for Autonomous Penetration Testing
यह शोध पत्र कोचीज़ (Cochise) का परिचय देता है, जो कि स्वायत्त पेनिट्रेशन टेस्टिंग के लिए एक पृथक प्लानर-एक्जीक्यूटर (Planner-Executor) आर्किटेक्चर को लागू करने वाला एक न्यूनतम 597-लाइन का पायथन रेफरेंस हार्नेस है, जो शोधकर्ताओं को गेम ऑफ एक्टिव डायरेक्टरी (GOAD) टेस्टबेड के विरुद्ध LLM-संचालित एजेंटों का मूल्यांकन करने में सक्षम बनाता है और साथ ही रिप्ले, विश्लेषण और ट्राजेक्टरी डेटा साझा करने के लिए ओपन-सोर्स टूल्स प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक डिजिटल किले (एक कंप्यूटर नेटवर्क) में घुसपैठ करने के लिए सिखाने की कोशिश कर रहे हैं ताकि वह उसकी कमजोरियों का पता लगा सके। इसे "पेनेट्रेशन टेस्टिंग" (penetration testing) कहा जाता है। हाल ही में, शोधकर्ताओं ने इस काम को स्वचालित रूप से करने के लिए सुपर-स्मार्ट AI दिमागों (लार्ज लैंग्वेज मॉडल्स) का उपयोग करना शुरू कर दिया है।
हालाँकि, एक समस्या थी: हर बार जब एक नई टीम एक AI हैकर बनाती थी, तो वे अपना खुद का अनूठा वर्कशॉप, उपकरण और नियम पुस्तिका भी बनाती थीं। यह एक कार की तुलना गैरेज में बनी कार से स्पेसशिप फैक्ट्री में बने स्पेसशिप से करने जैसा था; आप यह नहीं बता सकते थे कि स्पेसशिप का इंजन बेहतर था या उसके पहिए बेहतर थे।
पेश है "कोचीज़" (Cochise)।
कोचीज़ को एक सुपर-जासूस के रूप में नहीं, बल्कि AI हैकर्स के लिए एक मानकीकृत, पारदर्शी प्रशिक्षण जिम के रूप में सोचें। यह एक छोटा, सरल "हार्नेस" (उपकरणों और नियमों का एक सेट) है जो शोधकर्ताओं को बिल्कुल समान परिस्थितियों में विभिन्न AI दिमागों का परीक्षण करने देता है।
यह कैसे काम करता है, यहाँ कुछ रोजमर्रा के उदाहरणों के माध्यम से बताया गया है:
1. सेटअप: द "जंप होस्ट" (The Jump Host)
कल्पना कीजिए कि AI को एक किले (लक्ष्य नेटवर्क) में घुसपैठ करनी है, लेकिन AI को सीधे किले के गेट पर खड़ा करना बहुत खतरनाक है।
- समाधान: कोचीज़ किले के बाहर एक सुरक्षित "जंपिंग-ऑफ" प्लेटफॉर्म (एक अलग कंप्यूटर) स्थापित करता है।
- उदाहरण: AI एक कंट्रोल रूम में बैठता है और एक लंबे, सुरक्षित वॉकी-टॉकी (SSH) का उपयोग करके जंपिंग प्लेटफॉर्म पर मौजूद एक रोबोट को निर्देश देता है कि क्या करना है। फिर वह रोबोट किले के अंदर जाता है।
- क्यों? यदि AI कोई गलती करता है और गलती से किले को उड़ा देता है, तो यह केवल रोबोट के निर्देशों को नष्ट करेगा, AI के अपने दिमाग या कंट्रोल रूम को नहीं। यह प्रयोग को सुरक्षित और सीमित रखता है।
2. टीम: "प्लैनर" और "एक्सेक्यूटर" (The Planner and the Executor)
कोचीज़ चीजों को व्यवस्थित रखने के लिए AI के दिमाग को दो अलग-अलग भूमिकाओं में विभाजित करता है:
- द प्लैनर (जनरल): AI का यह हिस्सा पीछे बैठकर बड़ी तस्वीर देखता है। यह एक दीर्घकालिक टू-डू लिस्ट (जैसे किले का नक्शा) रखता है और तय करता है कि आगे क्या किया जाना चाहिए। यह पूरे मिशन को याद रखता है।
- द एक्सेक्यूटर (सैनिक): यह हिस्सा अल्पकालिक और केंद्रित है। इसे जनरल से एक विशिष्ट आदेश मिलता है (जैसे, "इस दरवाजे को खोलने की कोशिश करो"), यह कमांड चलाता है, देखता है कि क्या हुआ, और काम पूरा होते ही सब कुछ भूल जाता है।
- उदाहरण: एक फिल्म निर्देशक (प्लैनर) और एक स्टंट डबल (एक्सेक्यूटर) के बारे में सोचें। निर्देशक दृश्य की योजना बनाता है। स्टंट डबल खतरनाक कूद लगाता है, परिणाम प्राप्त करता है, और फिर निर्देशक अगले दृश्य के लिए सब कुछ साफ कर देता है। यह AI को पुराने घंटों की यादों से भ्रमित होने से रोकता है।
3. "ब्लैक बॉक्स" रिकॉर्डर
AI जो कुछ भी करता है, उसे एक सटीक, विस्तृत डायरी (JSON लॉग्स) में लिखा जाता है।
- उदाहरण: यह एक विमान के फ्लाइट रिकॉर्डर की तरह है। यह रिकॉर्ड करता है कि AI ने कौन सा बटन दबाया, उसके क्या विचार थे, उसने कितने "ईंधन" (पैसे/टोकन) का उपयोग किया, और क्या वह सफल रहा।
- यह क्यों शानदार है? आमतौर पर, इन AI हैकर्स का अध्ययन करने के लिए, आपको एक विशाल, महंगे कंप्यूटर लैब (GOAD टेस्टबेड) की आवश्यकता होती है जिसे चलाना बहुत महंगा होता है। कोचीज़ शोधकर्ताओं को एक मुफ्त रीप्ले किट देता है। आपको महंगे लैब की आवश्यकता नहीं है; आप बस "फ्लाइट रिकॉर्डर" डेटा को देख सकते हैं कि AI ने वास्तव में कैसा व्यवहार किया, इसकी लागत कितनी थी, और यह कहाँ विफल हुआ।
4. यह क्यों महत्वपूर्ण है (द "रेफरेंस हार्नेस")
लेखक बहुत स्पष्ट हैं: कोचीज़ दुनिया का सबसे अच्छा हैकर नहीं है। यह अंतिम जासूस बनने की कोशिश नहीं कर रहा है।
- उदाहरण: इसे एक मानकीकृत पैमाने (रूलर) के रूप में सोचें। आप घर बनाने के लिए रूलर का उपयोग नहीं करते; आप इसका उपयोग यह मापने के लिए करते हैं कि अन्य उपकरण कितनी अच्छी तरह घर बनाते हैं।
- क्योंकि कोचीज़ बहुत छोटा है (अन्य परियोजनाओं के हजारों कोड की तुलना में केवल 597 लाइनें), इसे पढ़ना, समझना और बदलना अन्य शोधकर्ताओं के लिए आसान है। यह उन्हें विभिन्न AI मॉडलों की निष्पक्ष तुलना करने की अनुमति देता है ताकि यह देखा जा सके कि वास्तव में कौन सा मॉडल अधिक स्मार्ट है, न कि यह कि किसके पास अधिक शानदार सेटअप था।
सारांश
कोचीज़ एक सरल, ओपन-सोर्स टूलकिट है जो शोधकर्ताओं को AI हैकर्स का निष्पक्ष परीक्षण करने की अनुमति देता है। यह "सोचने" को "करने" से अलग करता है, प्रयोगों को सुरक्षित रखता है, और हर विवरण को रिकॉर्ड करता है ताकि कोई भी सुपरकंप्यूटर की आवश्यकता के बिना परिणामों का अध्ययन कर सके। यह AI सुरक्षा अनुसंधान की अराजक दुनिया को एक निष्पक्ष, मापने योग्य विज्ञान में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।