SHIELD: An Auto-Healing Agentic Defense Framework for LLM Resource Exhaustion Attacks
यह शोधपत्र SHIELD को प्रस्तुत करता है, जो एक मल्टी-एजेंट, ऑटो-हीलिंग फ्रेमवर्क है जो विकसित होते LLM संसाधन निष्कासन (स्पंज) हमलों का प्रभावी ढंग से पता लगाने और उनके विरुद्ध अनुकूल रूप से रक्षा करने के लिए सिमेंटिक रिट्रीवल, पैटर्न मैचिंग और LLM रीजनिंग को एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लोकप्रिय, उच्च-शक्ति वाले रेस्टोरेंट किचन (लार्ज लैंग्वेज मॉडल, या LLM) की कल्पना करें जो ग्राहकों से ऑर्डर लेता है। आमतौर पर, यह किचन कुशल होता है। लेकिन, अब एक नए प्रकार के शरारती तत्व आ गए हैं—"स्पंज अटैकर" (Sponge Attacker)।
ये शरारती तत्व केवल एक साधारण बर्गर का ऑर्डर नहीं देते; वे ऐसा भोजन ऑर्डर करते हैं जिसके लिए शेफ को 10,000 प्याज काटने पड़ें, 10 घंटे तक एक बर्तन चलाना पड़े, या नमक के इतिहास पर एक उपन्यास लिखना पड़े। ये ऑर्डर ऊपर से बिल्कुल सामान्य दिखते हैं (वे व्याकरण की दृष्टि से सही हैं और समझ में आते हैं), लेकिन उन्हें इस तरह डिज़ाइन किया गया है कि वे किचन को इतना थका दें कि वह ढह जाए, जिससे वास्तविक ग्राहकों के लिए कोई ऊर्जा न बचे। यह एक "डिनायल ऑफ सर्विस" (Denial of Service) हमला है।
लंबे समय तक, रेस्टोरेंट के दरवाजे पर सुरक्षा गार्ड इन शरारती तत्वों को रोकने के लिए दो मुख्य तरीकों का उपयोग करते थे:
- "अजीब शब्द" डिटेक्टर (Weird Word Detector): वे निरर्थक या अजीब शब्दों को देखते थे। यह स्पष्ट प्रैंक (prank) के लिए काम करता था, लेकिन जब शरारती तत्व सटीक अंग्रेजी का उपयोग करते थे, तो यह विफल हो जाता था।
- "स्थिर नियम पुस्तिका" (Static Rulebook): उनके पास सुरक्षा गार्ड (एक AI) के लिए निर्देशों की एक निश्चित सूची थी। लेकिन शरारती तत्व अपनी चालें बदलते रहते थे, और नियम पुस्तिका उतनी तेजी से अपडेट नहीं हो पाती थी।
मिलिए SHIELD से।
लेखकों ने एक नया, स्मार्ट सुरक्षा सिस्टम बनाया है जिसे SHIELD कहा जाता है। इसे एक स्थिर गार्ड के रूप में नहीं, बल्कि एक स्वयं-सुधार करने वाली (self-healing), तीन-परतीय सुरक्षा टीम के रूप में सोचें जो काम करते हुए सीखती है।
तीन-परतीय सुरक्षा जांच
जब एक ग्राहक एक ऑर्डर (प्रॉम्प्ट) के साथ आता है, तो SHIELD उसे तीन त्वरित जांचों से गुजारता है:
- "समान दिखने वाला" स्कैन (सिमेंटिक सिमिलरिटी - Semantic Similarity): सिस्टम पूछता है, "क्या यह ऑर्डर हमारे द्वारा देखे गए किसी ज्ञात प्रैंक जैसा दिखता है?" यह ऑर्डर की तुलना पिछले बुरे ऑर्डर्स के डेटाबेस से करता है। यदि यह मेल खाता है, तो इसे तुरंत ब्लॉक कर दिया जाता है।
- "कीवर्ड" स्कैन (सबस्ट्रिंग मैचिंग - Substring Matching): यदि ऑर्डर सामान्य दिखता है, तो सिस्टम लंबे, उबाऊ वाक्यों के भीतर छिपे छोटे, विशिष्ट "बुरे वाक्यांशों" को स्कैन करता है। यह एक लंबे पत्र में एक एकल संदिग्ध कोड शब्द की जांच करने जैसा है।
- "स्मार्ट डिटेक्टिव" (LLM रीजनिंग - LLM Reasoning): यदि ऑर्डर अभी भी ठीक दिखता है, तो यह एक अत्यधिक बुद्धिमान AI जासूस के पास जाता है। यह जासूस ऑर्डर को पढ़ता है और पूछता है, "क्या इस अनुरोध का इरादा किचन को बहुत अधिक काम करने के लिए मजबूर करना है?" यह चालाक, अच्छी तरह से लिखे गए प्रैंक को पकड़ लेता है।
केवल वे ऑर्डर जो इन तीनों जांचों को पास करते हैं, उन्हें किचन में भेजा जाता है।
"सेल्फ-हीलिंग" (स्वयं-सुधार) का जादू
यहाँ सबसे महत्वपूर्ण बात है: SHIELD हर बार जब इसे चकमा दिया जाता है, तो यह और स्मार्ट हो जाता है।
कल्पना करें कि एक शरारती तत्व अंततः सुरक्षा टीम से बच निकलने में सफल हो जाता है और किचन ढहने लगता है (हमला सफल हो जाता है)। केवल घबराने के बजाय, SHIELD अपने ऑटो-हीलिंग लूप (Auto-Healing Loop) को सक्रिय करता है:
- जांचकर्ता (नॉलेज अपडेटर एजेंट - Knowledge Updater Agent): यह एजेंट शरारती तत्व के ऑर्डर को पकड़ता है और उसका विश्लेषण करता है। यह पूछता है, "किस चीज़ ने वास्तव में किचन को क्रैश किया?" यह ऑर्डर के उस सूक्ष्म, दुर्भावनापूर्ण हिस्से को अलग करता है जिसने समस्या पैदा की।
- लाइब्रेरियन (Librarian): जांचकर्ता इस विशिष्ट प्रैंक का एक नया विवरण लिखता है और इसे "बुरे ऑर्डर" (Bad Order) लाइब्रेरी में जोड़ देता है।
- कोच (प्रॉम्प्ट ऑप्टिमाइज़र एजेंट - Prompt Optimizer Agent): यह एजेंट "स्मार्ट डिटेक्टिव" (लेयर 3 में AI) के निर्देशों को फिर से लिखता है। यह कहता है, "हे, अगली बार जब आप ऐसा दिखने वाला कोई ऑर्डर देखें, तो उसे अंदर न आने दें!"
परिणाम: अगली बार जब इसी तरह का कोई शरारती तत्व घुसने की कोशिश करता है, तो सिस्टम उसे पहले या दूसरे लेयर में ही पकड़ लेता है, इससे पहले कि वह महंगे "स्मार्ट डिटेक्टिव" तक पहुँच सके। सिस्टम वास्तव में खुद को ठीक करता है और हर उल्लंघन के बाद एक मजबूत दीवार बनाता है।
यह क्यों मायने रखता है
पेपर दिखाता है कि SHIELD पुराने तरीकों की तुलना में बहुत बेहतर है।
- यह "अदृश्य" हमलों को पकड़ता है: यह उन शरारती तत्वों को रोकता है जो अपने दुर्भावनापूर्ण इरादे को छिपाने के लिए सटीक, विनम्र भाषा का उपयोग करते हैं।
- यह तेज़ है: पहले दो लेयर्स के साथ अधिकांश बुरे ऑर्डर्स को पकड़कर, यह महंगे "स्मार्ट डिटेक्टिव" को केवल कठिन मामलों के लिए बचाता है।
- यह विकसित होता है: इसे मनुष्यों द्वारा फिर से प्रशिक्षित या पुनर्गठित करने की आवश्यकता नहीं होती है। यह स्वचालित रूप से अपनी गलतियों से सीखता है।
संक्षेप में, SHIELD एक ऐसा सुरक्षा तंत्र है जो केवल पहरा नहीं देता; यह सीखता है, अनुकूलित होता है, और हर बार जब कोई घुसपैठ करने की कोशिश करता है तो और मजबूत होता जाता है, जिससे यह सुनिश्चित होता है कि किचन बाकी सभी के लिए खुला रहे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।