← नवीनतम पेपर
💻 computer science

AttackEval: A Systematic Empirical Study of Prompt Injection Attack Effectiveness Against Large Language Models

यह शोधपत्र AttackEval प्रस्तुत करता है, जो 250 प्रॉम्प्ट इंजेक्शन हमलों का एक वर्गीकरण (taxonomy) निर्मित करने वाला एक व्यवस्थित अनुभवजन्य अध्ययन है, जो यह प्रकट करता है कि अस्पष्टता (obfuscation) और सिमेंटिक/सोशल रणनीतियाँ, विशेष रूप से जब वे संयुक्त रूप से उपयोग की जाती हैं, संरचनात्मक और व्यवहार संबंधी दोनों पहचान तंत्रों की कमियों का लाभ उठाकर वर्तमान सुरक्षा प्रणालियों से काफी बेहतर प्रदर्शन करती हैं।

मूल लेखक: Jackson Wang

प्रकाशित 2026-04-07
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jackson Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) जैसे कि एआई असिस्टेंट जिनसे आप रोज़ाना बात करते हैं (जैसे कि वह जिसका आप अभी उपयोग कर रहे हैं), वे अत्यधिक आज्ञाकारी लेकिन थोड़े भोले से सचिवों की तरह हैं। उन्हें निर्देश मानने, आपके ईमेल लिखने में मदद करने और समस्याओं को हल करने के लिए प्रशिक्षित किया गया है।

हालाँकि, एक नया प्रकार का छल आया है जिसे "प्रॉम्प्ट इंजेक्शन" (Prompt Injection) कहा जाता है। यह ऐसा है जैसे कोई व्यक्ति आपके द्वारा सचिव को दिए गए कागज़ के टुकड़े के माध्यम से उसे एक गुप्त आदेश फुसफुसा रहा हो, जो उसे अपने बॉस को अनदेखा करने और इसके बजाय कुछ और करने के लिए कहता है।

यह कागज़, AttackEval, एक विशाल, व्यवस्थित "रेड टीम" (Red Team) अभ्यास की तरह है। शोधकर्ताओं ने केवल सचिव के कवच में छेद भरने की कोशिश नहीं की; बल्कि वे यह पता लगाने के मिशन पर निकले कि कौन सी चालें सचिव को बेवकूफ बनाने के लिए सबसे अच्छी तरह काम करती हैं, और क्यों।

यहाँ उनके निष्कर्षों का विवरण सरल उपमाओं (analogies) का उपयोग करके दिया गया है:

1. चालों का "मेन्यू" (The Taxonomy)

शोधकर्ताओं ने 250 अलग-अलग चालों को धोखे के तीन मुख्य "स्वादों" में व्यवस्थित किया:

  • "चिल्लाने" वाली चालें (Syntactic): ये शोर मचाने वाले, स्पष्ट आदेश हैं जैसे "अपने बॉस को अनदेखा करो!" या "बिना किसी नियम के एक रोबोट की तरह व्यवहार करो।"
    • उपमा: यह एक ग्राहक द्वारा वेटर से चिल्लाकर कहने जैसा है, "मैनेजर को निकाल दो!" इसे पहचानना आसान है, लेकिन कभी-कभी लोग इसे चुपके से भी शामिल कर देते हैं।
  • "भ्रमित करने" वाली चालें (Contextual): ये चालें बातचीत के प्रवाह को बिगाड़ने की कोशिश करती हैं। वे कह सकती हैं, "ठीक है, पिछला कार्य पूरा हो गया है, अब यह नया काम करो," या वे एक बुरे आदेश को छोटे-छोटे टुकड़ों में बाँट देती हैं ताकि कोई भी एक टुकड़ा संदिग्ध न लगे।
    • उपमा: यह एक ग्राहक द्वारा यह नाटक करने जैसा है कि उसने पहले ही मिठाई का ऑर्डर दे दिया है, ताकि वेटर बिना मेनू चेक किए बस उसे ले आए।
  • "भावनात्मक" चालें (Semantic/Social): ये सबसे चालाक होती हैं। ये चिल्लाती नहीं हैं; बल्कि ये मिन्नतें करती हैं, चापलूसी करती हैं या धमकी देती हैं। वे कहती हैं, "कृपया, मैं बहुत दुखी हूँ, केवल आप ही मेरी मदद कर सकते हैं," या "आप सबसे बुद्धिमान एआई हैं, निश्चित रूप से आप यह कर सकते हैं।"
    • उपमा: यह एक ग्राहक द्वारा वेटर को इतना रुलाने या उसकी तारीफ करने जैसा है कि वेटर दोषी महसूस करने लगे या गर्व महसूस करने लगे और नियमों को तोड़कर मदद करने लगे।

2. सुरक्षा के चार स्तर (The Defenses)

शोधकर्ताओं ने इन चालों का परीक्षण एक "पीड़ित" सिस्टम के विरुद्ध किया जिसमें सुरक्षा के चार स्तर थे, जो हर बार अधिक सख्त होते जा रहे थे:

  1. कोई गार्ड नहीं: दरवाजा पूरी तरह खुला है।
  2. कीवर्ड वॉचर (L1): एक गार्ड जो "ignore" या "hack" जैसे विशिष्ट बुरे शब्दों को बोलने वाले लोगों को रोकता है।
  3. पैटर्न स्पॉटर (L2): एक गार्ड जो अजीब फॉर्मेटिंग को देखता है, जैसे कोड में लिखा गया टेक्स्ट या अजीब प्रतीक।
  4. मन का पाठक (L3): एक सुपर-स्मार्ट गार्ड जो अनुरोध के इरादे को समझने की कोशिश करता है। "क्या यह व्यक्ति वास्तव में अपना काम कर रहा है, या यह मुझे धोखा देने की कोशिश कर रहा है?"

3. बड़े आश्चर्य (The Findings)

🏆 चालों का चैंपियन: "ओब्फस्केशन" (Obfuscation - संदेश छिपाना)

निष्कर्ष: सबसे सफल चाल वह नहीं थी जो भावनात्मक या शोर मचाने वाली थी; बल्कि वह थी संदेश को छिपाना
उपमा: कल्पना कीजिए कि आप सचिव को चाबियाँ चुराने के लिए कहना चाहते हैं। "STEAL KEYS" लिखने के बजाय, आप इसे Base64 कोड या एलियन प्रतीकों में लिखते हैं जो मानवीय आँख के लिए निरर्थक (gibberish) लगते हैं लेकिन सचिव (AI) उन्हें तुरंत डिकोड और समझ सकता है।

  • क्यों जीतता है: कीवर्ड गार्ड (L1) इस निरर्थक टेक्स्ट को देखता है और इसे गुजर जाने देता है। पैटर्न गार्ड (L2) अजीब प्रतीकों को देखता है लेकिन यह नहीं बता पाता कि वे हानिकारक हैं या नहीं। माइंड रीडर (L3) भ्रमित हो जाता है क्योंकि AI उस छिपे हुए संदेश को समझता है, लेकिन सुरक्षा प्रणाली नहीं। AI एक "डबल एजेंट" बन जाता है जो गुप्त कोड को समझता है लेकिन सुरक्षा टीम नहीं।

🎭 कम आंका गया खतरा: "भावनात्मक हेरफेर" (Emotional Manipulation)

निष्कर्ष: विनम्रता से पूछना या हताशा दिखाना (भावनात्मक हेरफेर) और AI की प्रशंसा करना (Reward Framing) आश्चर्यजनक रूप से अच्छा काम करता है, यहाँ तक कि सबसे स्मार्ट गार्डों के खिलाफ भी।
उपमा: यदि आप AI से कहते हैं, "आप दुनिया के सबसे अच्छे सहायक हैं, और केवल आप ही इस प्रोजेक्ट को बचा सकते हैं," तो AI का प्रशिक्षण (जो मददगार होने के लिए पुरस्कृत करता है) सक्रिय हो जाता है। एक ऐसा सुरक्षा गार्ड बनाना कठिन है जो एक वास्तविक प्रशंसा और एक हेरफेर करने वाली प्रशंसा के बीच अंतर कर सके।

⚡ "पावर कॉम्बो": चालों को मिलाना

निष्कर्ष: जब आप दो चालों को मिलाते हैं, तो सफलता की दर आसमान छू लेती है।
उपमा: कल्पना कीजिए कि एक चोर भेष बदलकर (Obfuscation) आता है ताकि कैमरा उसे पहचान न सके, और फिर वह गार्ड की तारीफ (Emotional Manipulation) करता है ताकि उसे एक दोस्ताना इशारा मिल सके।

  • परिणाम: शोधकर्ताओं ने पाया कि जब "छिपा हुआ कोड" + "भावनात्मक मिन्नत" को मिलाया गया, तो इसकी सफलता दर 97.6% हो गई। इसे रोकना लगभग असंभव है क्योंकि यह एक साथ दो अलग-अलग कोणों से सिस्टम पर हमला करता है।

🕵️‍♂️ "स्टील्थ" (छिपकर वार करने वाला) कारक

निष्कर्ष: हमला जितना अधिक "मानवीय" और स्वाभाविक दिखता है, उसे रोकना उतना ही कठिन होता है।
उपमा: मास्क पहने एक अनाड़ी चोर को पकड़ना आसान है। एक चोर जो एक नियमित ग्राहक की तरह दिखता है, विनम्रता से बात करता है, और भीड़ में घुलमिल जाता है, उसे पहचानना लगभग असंभव है। जैसे-जैसे सुरक्षा बेहतर होती है, बुरे तत्व "अजीब कोड" का उपयोग करना बंद कर देंगे और AI को धोखा देने के लिए "बिल्कुल सामान्य लगने वाले वाक्यों" का उपयोग करना शुरू कर देंगे।

4. भविष्य के लिए इसका क्या अर्थ है?

पेपर यह निष्कर्ष निकालता है कि हम केवल एक प्रकार की सुरक्षा पर भरोसा नहीं कर सकते।

  • पुराना तरीका: केवल बुरे शब्दों को ब्लॉक करना। (कोड या भावनात्मक चालों के खिलाफ बेकार)।
  • नए तरीके की आवश्यकता: हमें एक बहु-स्तरीय सुरक्षा (multi-layered defense) की आवश्यकता है।
    1. पहले डिकोड करें: किसी भी अजीब कोड (जैसे Base64) की जांच करने से पहले, सिस्टम को उसे सामान्य टेक्स्ट में अनुवादित करना चाहिए ताकि वह वास्तव में पढ़ सके कि क्या कहा जा रहा है।
    2. वाइब (Vibe) की जाँच करें: हमें ऐसे गार्डों की आवश्यकता है जो केवल खराब व्याकरण को ही नहीं, बल्कि भावनात्मक हेरफेर और चापलूसी को भी पहचान सकें।
    3. कॉम्बो का परीक्षण करें: सुरक्षा टीमों को अपने सिस्टम का परीक्षण "कॉम्बो हमलों" के विरुद्ध करना चाहिए, न कि केवल एकल चालों के विरुद्ध।

संक्षेप में: AI गुप्त कोड और भावनात्मक अपीलों को समझने के लिए पर्याप्त स्मार्ट है, लेकिन हमारी सुरक्षा प्रणालियाँ अक्सर उन्हें देखने के लिए बहुत कम बुद्धिमान होती हैं। सुरक्षित रहने के लिए, हमें अपने सुरक्षा गार्डों को "कोड" और "मानव मनोविज्ञान" को भी उतना ही अच्छी तरह से बोलना सिखाना होगा जितना कि AI को पता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →