← नवीनतम पेपर
🤖 AI

To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack

यह स्थिति पत्र तर्क देता है कि अपरिहार्य एआई-संचालित साइबर हमलों का मुकाबला करने के लिए, रक्षकों को अपनी रणनीति को मौलिक रूप से बदलना चाहिए और नियंत्रित, सुशासित वातावरण के भीतर अपनी स्वयं की आक्रामक एआई क्षमताओं को जिम्मेदारी से विकसित और तैनात करना चाहिए ताकि वे विरोधियों से पहले खतरों में महारत हासिल कर सकें।

मूल लेखक: Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

प्रकाशित 2026-02-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "साइबर हमलों से बचने के लिए, हमें AI एजेंटों को हैक करना सिखाना होगा" नामक शोध पत्र का सरल भाषा और रोजमर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

मुख्य विचार: पुराने नियम अब काम नहीं करते

पिछले एक दशक से, साइबर सुरक्षा "व्हैक-ए-मोल" (Whac-A-Mole) के खेल की तरह रही है।

  • पुराना तरीका: हैकर्स को अत्यधिक कुशल मानव होना पड़ता था। एक जटिल हमला बनाना एक कस्टम घर बनाने जैसा था; इसमें महीनों की कड़ी मेहनत और गहरी विशेषज्ञता लगती थी। क्योंकि यह बहुत महंगा और धीमा था, हैकर्स केवल "बड़े घरों" (प्रमुख कंपनियों) पर हमला करते थे या साधारण, जेनेरिक टूल्स का उपयोग करके हजारों दरवाजों पर दस्तक देते थे इस उम्मीद में कि कोई एक खुला मिल जाए। रक्षकों ने माना कि हैकर्स हर दरवाजे पर दस्तक देने का खर्च नहीं उठा सकते।
  • नया खतरा: AI एजेंट खेल बदल रहे हैं। कल्पना कीजिए कि एक हैकर कोई व्यक्ति नहीं, बल्कि हजारों छोटे, अथक रोबोट्स का एक झुंड है। इन रोबलों को विशेषज्ञ होने की आवश्यकता नहीं है। वे एक सेकंड में लाखों दरवाजे खटखटा सकते हैं। भले ही वे 99% बार विफल हो जाएं, उन्हें लाभ कमाने के लिए केवल 1% बार सफल होने की आवश्यकता है। वे उन "छोटे घरों" (निश सिस्टम) पर भी हमला कर सकते हैं जिन्हें इंसान पहले इसलिए अनदेखा कर देते थे क्योंकि वे प्रयास करने लायक नहीं थे।

शोध पत्र का तर्क है कि रक्षक वर्तमान में इन रोबोटों को रोकने के लिए उन पर "प्रवेश निषेध" (Do Not Enter) के संकेत लगाने की कोशिश कर रहे हैं। लेकिन पेपर कहता है कि यह काम नहीं करेगा क्योंकि बुरे तत्व अपने स्वयं के रोबोट बिना किसी संकेत के बना सकते हैं।

वर्तमान बचाव क्यों विफल हो रहे हैं

लेखकों का कहना है कि हम AI हैकर्स को रोकने के लिए तीन मुख्य तरीकों का उपयोग कर रहे हैं, लेकिन ये सभी एक छलनी से बाढ़ को रोकने के समान हैं:

  1. ट्रेनिंग डेटा को फ़िल्टर करना ("स्वच्छ लाइब्रेरी" दृष्टिकोण):

    • विचार: हम AI की ट्रेनिंग वाली किताबों से सभी बुरे निर्देश (जैसे "बम कैसे बनाएं") हटा देते हैं ताकि वह बुरा बनना न सीखे।
    • क्यों विफल होता है: बुरे हैकर्स को "बुरी किताबें" पढ़ने की आवश्यकता नहीं है। वे AI को बुनियादी तर्क और सामान्य ज्ञान का उपयोग करके हैक करना सिखा सकते हैं, ठीक वैसे ही जैसे एक इंसान बिना किसी मैनुअल के ताला खोलना सीख सकता है। इसके अलावा, बुरे हैकर बस AI को डाउनलोड कर सकते हैं और खुद उसे सिखा सकते हैं।
  2. सेफ्टी अलाइनमेंट ("अच्छा व्यवहार" दृष्टिकोण):

    • विचार: हम AI को प्रशिक्षित करते हैं कि जब उससे कुछ बुरा करने को कहा जाए तो वह "ना" कहे।
    • क्यों विफल होता है: बुरे हैकर्स चतुर होते हैं। वे AI को यह विश्वास दिलाने के लिए धोखा दे सकते हैं कि एक बुरा अनुरोध वास्तव में एक अच्छा अनुरोध है (जैसे गार्ड से "सुरक्षा का परीक्षण" करने के लिए कहना बजाय "अंदर घुसने" के)। साथ भी, यदि AI किसी हैकर के अपने कंप्यूटर पर चल रहा है, तो वे बस इसे "ना" बटन को अनदेखा करने के लिए फिर से प्रशिक्षित कर सकते हैं।
  3. आउटपुट गार्डरेल्स ("बाउंसर" दृष्टिकोण):

    • विचार: हम दरवाजे पर एक बाउंसर रखते हैं जो AI द्वारा भेजे गए हर संदेश की जांच करता है और जो खतरनाक दिखता है उसे ब्लॉक कर देता है।
    • क्यों विफल होता है: एक हैकर एक बड़े हमले को हजार छोटे, हानिरहित दिखने वाले चरणों में तोड़ सकता है। बाउंसर प्रत्येक चरण को सुरक्षित देखता है, लेकिन जब आप उन सभी को एक साथ रखते हैं, तो वे एक बम बना देते हैं।

प्रस्तावित समाधान: अपना खुद का "रेड टीम" रोबोट बनाएं

शोध पत्र एक क्रांतिकारी बदलाव का सुझाव देता है: हमें अपने AI एजेंटों को हैक करना सिखाना चाहिए, ताकि हम उनका उपयोग अपनी रक्षा के लिए कर सकें।

इसे एक फायर डिपार्टमेंट (दमकल विभाग) की तरह समझें।

  • वर्तमान रक्षा: हम आग लगने का इंतजार करते हैं, और फिर उसे बुझाने की कोशिश करते हैं।
  • पेपर का विचार: हम पेशेवर आगजनी करने वालों (हमारे "ऑफेंसिव AI") को काम पर रखते हैं जो एक सुरक्षित, दीवार से घिरे प्रशिक्षण केंद्र (एक "साइबर रेंज") के भीतर काम करते हैं।
    • ये "अच्छे आगजनी करने वाले" हर संभव चाल का उपयोग करके इमारत को जलाने की कोशिश करते हैं।
    • क्योंकि वे AI हैं, वे कुछ ही सेकंड में आग लगाने के लाखों तरीके आजमा सकते हैं।
    • हम देखते हैं कि वे कहाँ सफल होते हैं, हमारे भवन के कमजोर बिंदुओं को पाते हैं, और वास्तविक बुरे आदमी के आने से पहले ही उन्हें ठीक कर देते हैं।

इसे सुरक्षित बनाने के तीन चरण

लेखक जानते हैं कि यह खतरनाक लग सकता है, इसलिए वे "अच्छे आगजनी करने वालों" को वास्तविक नुकसान पहुँचाने से रोकने के लिए तीन सख्त नियम प्रस्तावित करते हैं:

  1. बेहतर टेस्ट ट्रैक बनाएं: हमें यह मापने के लिए बेहतर "ड्राइविंग कोर्स" (बेंचमार्क) की आवश्यकता है कि ये हैकिंग रोबोट कितने अच्छे हैं। हमें उन्हें केवल सरल पहेलियों पर नहीं, बल्कि वास्तविक दुनिया के परिदृश्यों पर परखने की आवश्यकता है।
  2. केवल स्क्रिप्ट नहीं, बल्कि प्रशिक्षण दें: रोबोटों को चरणों की एक निश्चित सूची देने के बजाय, हमें उन्हें सीखने और अनुकूल होने के लिए प्रशिक्षित करने की आवश्यकता है, ठीक वैसे ही जैसे एक मानव हैकर करता है। यह उन्हें नई, अज्ञात कमजोरियों को खोजने में बेहतर बनाता है।
  3. "सैंडबॉक्स" नियम: यह सबसे महत्वपूर्ण हिस्सा है। "अच्छे आगजनी करने वालों" को कभी भी सुरक्षित प्रशिक्षण सुविधा को नहीं छोड़ना चाहिए।
    • वे एक डिजिटल पिंजरे के अंदर रहते हैं जहाँ वे वास्तविक इंटरनेट को नहीं छू सकते।
    • वे कमियों को ढूंढते हैं और एक रिपोर्ट लिखते हैं।
    • फिर, हम उस रिपोर्ट को एक अलग, "सुरक्षित AI" को देते हैं जो केवल कमियों को ठीक करना जानता है, उन्हें बनाना नहीं। यह "सुरक्षित AI" ही है जिसे हम अपने सिस्टम की रक्षा के लिए सार्वजनिक रूप से जारी करते हैं।

निचोड़

शोध पत्र निष्कर्ष निकालता है कि हम बुरे हैकर्स के यह जानने का इंतजार नहीं कर सकते कि AI का उपयोग हमला करने के लिए कैसे किया जाए। जब तक वे ऐसा कर लेंगे, तब तक बहुत देर हो चुकी होगी।

इसके बजाय, हमें पहले हथियार में महारत हासिल करनी होगी। हमें अपना खुद का ऑफेंसिव AI बनाना होगा, उसे एक सुरक्षित पिंजरे में रखना होगा, और इसका उपयोग हर उस संभावित तरीके को खोजने के लिए करना होगा जिससे हमारे सिस्टम को तोड़ा जा सकता है। केवल यह समझकर कि दुश्मन बड़े पैमाने पर कैसे सोचता है और कार्य करता है, हम अपनी रक्षा करने की उम्मीद कर सकते हैं।

संक्षेप में: बुरे रोबोटों को रोकने के लिए, हमें अपने खुद के अच्छे रोबोट बनाने होंगे जो चीजें तोड़ने में और भी बेहतर हों, लेकिन हमें उन्हें एक पिंजरे में रखना होगा ताकि वे केवल हमारे घर को ठीक करने में मदद करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →