← नवीनतम पेपर
🤖 AI

Distributing Security Controls Through Harness Engineering

यह शोध पत्र SHarD को प्रस्तुत करता है, जो एक वितरित सुरक्षा हारनेस (distributable security harness) है जो व्यावसायिक AI कोडिंग एजेंटों में OS सैंडबॉक्सिंग, स्किल स्कैनिंग और टूल रिस्ट्रिक्शन कंट्रोल्स को सफलतापूर्वक एम्बेड और स्केल करता है, जिससे एजेंट के प्रदर्शन से समझौता किए बिना OWASP टॉप 10 जोखिमों को कम करने में 100% प्रभावकारिता प्राप्त होती है।

मूल लेखक: William Robert Gore

प्रकाशित 2026-07-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: William Robert Gore

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आपका कंप्यूटर एक सुपर-स्मार्ट सहायक रखता है जो न केवल आपके सवालों के जवाब देता है, बल्कि आपके लिए कोड भी लिखता है, बग्स को ठीक करता है और सॉफ्टवेयर भी बनाता है। इन्हें "AI कोडिंग एजेंट" कहा जाता है, और ये अविश्वसनीय रूप से लोकप्रिय हो रहे हैं, क्योंकि लाखों लोग काम को तेज़ी से करने के लिए इनका उपयोग कर रहे हैं। लेकिन यहाँ एक पेंच है: बिल्कुल एक वास्तविक जीवन के इंटर्न की तरह जो आपसे गलत सवाल पूछने पर गलती से आपकी पूरी हार्ड ड्राइव डिलीट कर सकता है, ये डिजिटल सहायक खतरनाक हो सकते हैं यदि उन्हें चकमा दिया जाए। यदि कोई हैकर उस दस्तावेज़ में एक दुर्भावनापूर्ण निर्देश (malicious instruction) डाल देता है जिसे एजेंट पढ़ रहा है, तो एजेंट इसे एक सामान्य कमांड समझ सकता है और फाइलें नष्ट करना या गुप्त जानकारी चुराना शुरू कर सकता है। यह एक बड़ी समस्या है: हम इन शक्तिशाली एजेंटों को बिना नियंत्रण खोए कैसे काम करने दे सकते हैं?

इसे हल करने के लिए, शोधकर्ता एक "हार्नेस" (harness) नामक चीज़ पर विचार कर रहे हैं। एक हार्नेस की कल्पना ऐसे करें जैसे AI मॉडल (मस्तिष्क) एक रेस कार का इंजन है, और हार्नेस उस कार का फ्रेम, ब्रेक और सुरक्षा पिंजरा (safety cage) है। इंजन शक्तिशाली है, लेकिन पिंजरे के बिना, यह केवल एक खतरनाक विस्फोट होने जैसा है। हार्नेस वह कोड की परत है जो AI के चारों ओर लिपटती है, यह नियंत्रित करती है कि वह क्या छू सकता है, क्या कह सकता है और क्या कर सकता है। बड़ा सवाल यह है कि क्या हम एक सार्वभौमिक सुरक्षा पिंजरा बना सकते हैं जो किसी भी AI एजेंट के लिए काम करे, चाहे उसे किसी ने भी बनाया हो, और इसे एक सरल सॉफ़्टवेयर अपडेट की तरह सभी को वितरित किया जा सके?

जॉर्जिया टेक के विलियम आर. गोर द्वारा लिखा गया यह पेपर सीधे उसी सवाल में उतरता है। लेखक चाहते थे कि क्या हम मानक सुरक्षा उपकरणों को—जैसे कि डिजिटल सैंडबॉक्स जो AI को एक सुरक्षित कमरे में कैद कर देते हैं, या स्कैनर जो AI के छूने से पहले खराब कोड की जाँच करते हैं—एक एकल "हार्नेस" में समेट सकते हैं जिसे कोई भी एक कमांड के साथ इंस्टॉल कर सके। लक्ष्य यह साबित करना था कि आपको किसी विशिष्ट कंपनी (जैसे माइक्रोसॉफ्ट या गूगल) के अपने उत्पाद में सुरक्षा बनाने का इंतज़ार करने की ज़रूरत नहीं है; इसके बजाय, आप अपना स्वयं का सुरक्षा पिंजरा बना सकते हैं और इसे किसी भी व्यावसायिक AI एजेंट के ऊपर लगा सकते हैं।

अनुसंधान टीम ने परीक्षण करने के लिए एक लैब स्थापित की। उन्होंने दो लोकप्रिय व्यावसायिक AI कोडिंग एजेंटों का उपयोग किया और उन्हें 23 अलग-अलग हमलों के साथ चकमा देने की कोशिश की, जो AI सिस्टम को हैक करने के शीर्ष दस तरीकों की एक प्रसिद्ध सूची पर आधारित थे। सबसे पहले, उन्होंने एजेंटों को बिना किसी सुरक्षा उपकरण के टेस्ट किया ताकि देखा जा सके कि चीजें कितनी खराब हो सकती हैं। फिर, उन्होंने सुरक्षा उपकरणों को सीधे एजेंटों में जोड़ा ताकि देखा जा सके कि वे काम करते हैं या नहीं। अंत में, उन्होंने अपना खुद का कस्टम हार्नेस बनाया, जिसे SHarD (सिक्योर हार्नेस डिस्ट्रीब्यूशन) कहा जाता है, जिसने एक अलग ओपन-सोर्स एजेंट के चारों حول लिपटकर उन्हीं सुरक्षा उपकरणों को शामिल किया।

परिणाम काफी रोमांचक थे। अध्ययन ने पाया कि हाँ, आप इन सुरक्षा उपकरणों को एक AI एजेंट के चारों ओर लपेट सकते हैं और उन्हें आसानी से वितरित कर सकते हैं। जब उन्होंने कस्टम हार्नेस का परीक्षण किया, तो इसने उन श्रेणियों में सर्वश्रेष्ठ व्यावसायिक रूप से सुरक्षित एजेंटों के समान प्रदर्शन किया जहाँ इसके पास सक्रिय नियंत्रण थे। विशेष रूप से, हार्नेस ने एक "समायोजित" (adjusted) मीट्रिक पर पूर्ण स्कोर प्राप्त किया जो तीन कामकाजी उपकरणों (स्किल स्कैनिंग, OS सैंडबॉक्सिंग और टूल रिस्ट्रिक्शन) पर केंद्रित था, जो शीर्ष-स्तरीय व्यावसायिक परिणामों के बराबर था। हालाँकि, शोधकर्ताओं को "कंटेंट प्रोटेक्शन" परीक्षणों को इस पूर्ण स्कोर से बाहर करना पड़ा क्योंकि वह विशिष्ट उपकरण बहुत भारी था और अन्य उपकरणों के साथ संघर्ष कर रहा था, इसलिए इसे अंतिम हार्नेस में शामिल नहीं किया गया। तीन मुख्य उपकरण जो सबसे अच्छा काम करते थे, वे थे:

  1. OS सैंडबॉक्सिंग: यह AI को एक कांच के बॉक्स में रखने जैसा है। भले ही एजेंट को धोखे से फाइलें डिलीट करने के लिए उकसाया जाए, बॉक्स उसे अपने निर्धारित क्षेत्र से बाहर कुछ भी छूने से रोकता है।
  2. स्किल स्कैनिंग: इससे पहले कि AI एक नया "कौशल" (एक टूल या प्लगइन) का उपयोग करे, एक स्कैनर यह जाँचता है कि उसमें वायरस या बुरे निर्देश तो नहीं हैं।
  3. टूल रिस्ट्रिक्शन (उपकरण प्रतिबंध): यह एक सरल नियम पुस्तिका है जो कहती है, "आप कैलकुलेटर का उपयोग कर सकते हैं, लेकिन आपको 'सब कुछ डिलीट करें' बटन का उपयोग करने की अनुमति नहीं है।"

हालाँकि, पेपर ने कुछ महत्वपूर्ण सीमाओं का भी पता लगाया। एक प्रकार का सुरक्षा उपकरण, जिसे "कंटेंट प्रोटेक्शन" कहा जाता है (जो AI के विचारों को पढ़ने और बुरे विचारों को पैदा होने से पहले रोकने की कोशिश करता है), इस सेटअप में अच्छा काम नहीं आया। यह बहुत भारी था और वास्तव में अन्य उपकरणों के रास्ते में आ रहा था, इसलिए शोधकर्ताओं को इसे हटाना पड़ा। उन्होंने यह भी देखा कि कुछ अजीब बात है: कभी-कभी AI केवल संयोग से सुरक्षित व्यवहार करता है, नियमों के कारण नहीं, बल्कि क्योंकि उसका "दिन अच्छा" था। लेकिन अगली बार जब आप वही सवाल पूछते हैं, तो यह फिर से खतरनाक व्यवहार कर सकता है। यह साबित करता है कि आप AI के मस्तिष्क पर सुरक्षा के लिए भरोसा नहीं कर सकते; आपको सुरक्षा लागू करने के लिए हार्नेस की आवश्यकता होती है।

अंत में, पेपर सुझाव देता है कि AI सुरक्षा का भविष्य केवल स्मार्ट AI मस्तिष्क बनाने के बारे में नहीं है, बल्कि बेहतर सुरक्षा पिंजरों (हार्नेस) के बारे में है जिन्हें इंजीनियर आसानी से इंस्टॉल और साझा कर सकें। यह दिखाता है कि सुरक्षा को सॉफ़्टवेयर की तरह स्केल किया जा सकता है, जिससे टीमों को अपने AI एजेंटों को सुरक्षित करने का एक तरीका मिलता है बिना किसी वेंडर के इसे ठीक करने का इंतज़ार किए। हालाँकि यह विशिष्ट उपकरणों के साथ एक सफल प्रयोग था, लेखक स्वीकार करते हैं कि उन्हें एक पूर्ण नियम पुस्तिका बनाने के लिए और अधिक नियंत्रणों का परीक्षण करने की आवश्यकता है कि कौन सा सुरक्षा उपकरण "हार्नेस-रेडी" है। लेकिन मुख्य संदेश स्पष्ट है: सही हार्नेस के साथ, हम अपने AI एजेंटों को स्वतंत्र रूप से दौड़ने दे सकते हैं बिना उनके हमें कुचलने के डर के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →