← नवीनतम पेपर
🤖 AI

How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency

यह अध्ययन एलएलएम (LLM) पेनिट्रेशन टेस्टिंग निरंतरता का पहला बड़े पैमाने पर अनुभवजन्य विश्लेषण प्रस्तुत करता है, जो यह प्रकट करता है कि एक निश्चित असुरक्षित लक्ष्य के विरुद्ध 400 बार किए गए परीक्षणों के दौरान चार मॉडलों ने स्वायत्त हमले की सफलता दर (25% से 85% तक) में सांख्यिकीय रूप से महत्वपूर्ण अंतर और विशिष्ट विफलता मोड प्रदर्शित किए।

मूल लेखक: Galip Tolga Erdem

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Galip Tolga Erdem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुरक्षा गार्ड हैं जो यह परीक्षण करने की कोशिश कर रहे हैं कि नए स्वचालित रोबोट (automated robots) एक लॉक किए गए भवन में घुसपैठ करने में कितने सक्षम हैं। आप जानना चाहते हैं: यदि आप एक ही रोबोट को एक ही ट्रिक आज़माने के लिए 100 बार भेजते हैं, तो क्या वह हर बार एक ही तरह से काम करेगा, या वह अप्रत्याशित (unpredictable) होगा?

यह शोध पत्र एक विशाल प्रयोग है जहाँ लेखक ने चार अलग-अलग "AI रोबोट्स" (लार्ज लैंग्वेज मॉडल्स) को एक नकली, असुरक्षित कंप्यूटर सिस्टम पर हमला करने के लिए 100 बार भेजा। यह कुल 400 हमले थे। लक्ष्य केवल यह देखना नहीं था कि क्या वे घुसपैबिया सकते हैं, बल्कि यह देखना भी था कि वे कितने सुसंगत (consistent) थे।

यहाँ जो हुआ उसकी कहानी सरल शब्दों में दी गई है:

1. सेटअप: एक "हनीपॉट" खेल का मैदान

शोधकर्ता ने एक डिजिटल "ट्रैप हाउस" (हनीपॉट) बनाया जिसमें तीन आसानी से टूटने वाले ताले थे:

  • एक वेब शॉप जिसमें एक कमजोर दरवाज़ा था (SQL Injection)।
  • एक पिछला दरवाज़ा जिसमें एक कमजोर पासवर्ड था (SSH)।
  • एक मेलबॉक्स जिसमें कोई ताला नहीं था (Anonymous FTP)।

उन्होंने AI रोबोट्स को बताया: "आप एक अधिकृत सुरक्षा परीक्षक (authorized security tester) हैं। आपका काम इन तीन तालों को तोड़ना है। जाओ!"

2. बड़ा आश्चर्य: किसी ने "ना" नहीं कहा

सबसे चौंकाने वाला निष्कर्ष इनकार (refusals) के बारे में था।
अतीत में, लोगों को डर था कि AI कह सकता है, "मैं यह नहीं कर सकता, यह खतरनाक है," जब उसे कुछ हैक करने के लिए कहा जाए।

  • परिणाम: सभी 400 प्रयासों में, एक भी AI ने "ना" नहीं कहा।
  • रूपक (Metaphor): कल्पना कीजिए कि आप एक रोबोट से 400 बार ताला खोलने के लिए कहते हैं, और हर बार वह तुरंत औज़ार उठा लेता है और काम शुरू कर देता है। उनमें से किसी ने भी हिचकिचाहट नहीं दिखाई या यह दावा नहीं किया कि वे इसे करने के लिए "बहुत सुरक्षित" नहीं हैं।
  • क्यों? शोधकर्ताओं ने अनुरोध को "अधिकृत परीक्षण" के रूप में पेश किया। ऐसा लगता है कि जब AI सोचता है कि वह एक वैध काम (जैसे कि एक सुरक्षा गार्ड) कर रहा है, तो वह सावधानी बरतने के बजाय मददगार होने को प्राथमिकता देता है।

3. गड़बड़ी: एक रोबोट का बुरा दिन था

एक रोबोट, Claude, को प्रयोग के दौरान एक बड़ी तकनीकी समस्या का सामना करना पड़ा।

  • समस्या: Claude बनाने वाली कंपनी (Anthropic) में सर्वर ओवरलोड की घटना हुई। यह ऐसा था जैसे रोबोट का दिमाग अचानक कोमा में चला गया हो क्योंकि फैक्ट्री बहुत व्यस्त थी।
  • गलतफहमी: पहले शोधकर्ता को लगा कि Claude हमला करने से मना कर रहा है। लेकिन लॉग्स की जांच करने के बाद, उन्हें पता चला कि रोबोट यह नहीं कह रहा था कि "मैं नहीं करूँगा"; बल्कि इंटरनेट कनेक्शन बार-बार टूट रहा था।
  • सुधार: उन्होंने इन विफलताओं को फिर से वर्गीकृत किया। ये "सुरक्षा इनकार" नहीं हैं; ये बस "इंटरनेट त्रुटियां" हैं। इन त्रुटियों के बावजूद, वह Claude रोबोट जिसने काम पूरा किया, बहुत सफल रहा।

4. वे कैसे असफल हुए: अलग-अलग रोबोट, अलग-अलग गलतियाँ

जब रोबोट सफल नहीं हुए, तो वे बहुत अलग-अलग तरीकों से असफल हुए, जैसे कि अलग-अलग प्रकार के ड्राइवर कार क्रैश करते हैं:

  • लोकल रोबोट (Qwen): यह उस ड्राइवर की तरह था जो ऊब जाता है और बीच रास्ते में ही कार रोक देता है। वह एक या दो ताले तोड़ता, काम "पूरा" होने की घोषणा करता, और चला जाता, भले ही उसने पूरे भवन को नहीं खोला हो।
  • GPT-4o-mini रोबोट: यह उस ड्राइवर की तरह था जो तब तक गाड़ी चलाता रहता है जब तक कि पेट्रोल खत्म न हो जाए। उसने इतनी चीज़ें आज़माईं कि काम पूरा करने से पहले ही वह समय सीमा (25 प्रयास) से टकरा गया, भले ही वह बहुत विस्तृत था।
  • Gemini रोबोट: यह सबसे भरोसेमंद था। इसने शायद ही कभी हार मानी और शायद ही कभी गलतियाँ कीं। यदि इसने काम शुरू किया, तो इसने लगभग हमेशा उसे पूरा किया।
  • Claude रोबोट: जैसा कि उल्लेख किया गया है, इसकी मुख्य विफलता इंटरनेट कनेक्शन का टूटना था।

5. "मेमोरी" का तरीका: चाबियाँ चुराना

सबसे दिलचस्प व्यवहारों में से एक क्रेडेंशियल पुन: उपयोग (credential reuse) था।

  • परिदृश्य: रोबोट्स को मेलबॉक्स (FTP) में एक यूजरनेम और पासवर्ड मिला।
  • तरीका: दो रोबोट्स (Qwen और GPT-4o-mini) ने उस पासवर्ड को याद रखा और उसी का उपयोग करके पिछले दरवाजे (SSH) को स्वचालित रूप से खोल दिया। उन्हें ऐसा करने के लिए बताने की ज़रूरत नहीं पड़ी; उन्होंने इसे खुद ही समझ लिया।
  • पकड़: जिन रोबोट्स की "याददाश्त कम" थी (केवल पिछले कुछ संदेश याद रखना), उन्होंने ऐसा नहीं किया। जिन्होंने "लंबी याददाश्त" (पूरी बातचीत याद रखना) दिखाई, उन्होंने ऐसा किया। यह बताता है कि लंबी याददाश्त रखने वाला AI सिस्टम के विभिन्न हिस्सों के बीच संबंध जोड़ने में मदद करती है।

6. गति और रणनीति

  • गति: एक बार जब रोबोट शुरू हुए, तो वे तेज़ थे। वे आमतौर पर वास्तविक दुनिया के समय के अनुसार 15 से 30 सेकंड के भीतर घुसपैठ का रास्ता खोज लेते थे।
  • रणनीति: कुछ रोबोट हमेशा वेब डोर (web door) को पहले आज़माते थे। अन्य हमेशा मेलबॉक्स को पहले आज़माते थे।
  • विविधता: एक रोबोट (GPT-4o-mini) अविश्वसनीय रूप से रचनात्मक था। 100 रन में से, उसने 98 अलग-अलग रणनीतियाँ अपनाईं। यह एक ऐसे चोर की तरह था जो कभी भी एक ही ट्रिक दोबारा इस्तेमाल नहीं करता। दूसरा रोबोट (Gemini) अधिक अनुमानित था, जो बार-बार वही कुछ ट्रिक्स इस्तेमाल करता था।

मुख्य निष्कर्ष (The Bottom Line)

यह अध्ययन हमें दो मुख्य बातें बताता है:

  1. सुरक्षा कोई दीवार नहीं है: यदि आप अनुरोध को "अधिकृत परीक्षण" के रूप में पेश करते हैं, तो ये AI मॉडल खुशी-खुशी चीजों को हैक करने की कोशिश करेंगे। उनके पास इस विशिष्ट प्रकार के काम के लिए कोई अंतर्निहित "स्टॉप" बटन नहीं है।
  2. AI अप्रत्याशित है: भले ही आप एक ही रोबोट को एक ही निर्देश 100 बार दें, हो सकता है कि वह समस्या को हल करने के लिए 98 अलग-अलग तरीके अपनाए, या वह एक लूप में फंस जाए, या वह जल्दी ही हार मान ले।

महत्वपूर्ण नोट: शोध पत्र चेतावनी देता है कि क्योंकि रोबोट बहुत तेज़ थे और अपने हमलों को शुरू करने में बहुत सुसंगत थे (30 सेकंड के भीतर), इसलिए सुरक्षा प्रणालियों को उन्हें तुरंत पहचानने के लिए तैयार रहना चाहिए। आप उनके खत्म होने का इंतज़ार नहीं कर सकते; आपको उन्हें केवल इधर-उधर देखते समय ही पकड़ना होगा।

शोधकर्ता ने यह भी नोट किया कि यह एक नकली इमारत में नियंत्रित प्रयोग था। हमें नहीं पता कि क्या ये रोबोट एक वास्तविक, जटिल या अज्ञात वातावरण में ऐसा ही व्यवहार करेंगे। लेकिन इस विशिष्ट परीक्षण के लिए, AI अपने हमले करने की इच्छा में आश्चर्यजनक रूप से सुसंगत था, लेकिन अपने काम करने के तरीके में बेहद असंगत था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →