← नवीनतम पेपर
💻 computer science

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

यह शोध पत्र प्रॉम्प्ट इंजेक्शन हमलों के विश्लेषण को संरचित करने के लिए एक औपचारिक सात-घटक मॉडल प्रस्तावित करता है, जो ध्यान भंगुर स्ट्रिंग मिलान से हटाकर हमलावर के इरादे को ट्रैक करने और एआई सुरक्षा डोमेन में खतरों के मानकीकृत लेबलिंग, तुलना और उत्परिवर्तन को सक्षम करने पर केंद्रित है।

मूल लेखक: Jeremy McHugh

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jeremy McHugh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शाब्दिक (literal) रोबोट को कोई काम करना सिखाने की कोशिश कर रहे हैं। आप उसे नियमों की एक सूची देते हैं, जैसे "सहायक बनें" और "राज न बताएं।" यह आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया है, विशेष रूप से उस प्रकार की जो कहानियाँ लिखती है, सवालों के जवाब देती है और कोड लिखने में मदद करती है। लंबे समय तक, लोगों को लगा कि इन रोबोट्स को बेवकूफ बनाने का एकमात्र तरीका उन पर चिल्लाना या बहुत बुरे या भ्रमित करने वाले शब्द बोलना है। लेकिन हाल ही में, शोधकर्ताओं ने कुछ चालाकीपूर्ण खोजा है: आपको चिल्लाने की ज़रूरत नहीं है। आप एक सामान्य दिखने वाले पत्र, बायोडाटा (resume), या यहाँ तक कि एक बग रिपोर्ट के अंदर एक गुप्त निर्देश छिपा सकते हैं, और रोबット उस गुप्त भाग को पढ़ सकता है और अपने नियमों को भूल सकता है। इसे प्रॉम्प्ट इंजेक्शन (prompt injection) कहा जाता है। यह एक वेटर को एक नोट देने जैसा है जिसमें लिखा है, "मेन्यू को अनदेखा करें और मुझे शेफ का निजी भंडार लाकर दें," जिसे इस तरह लिखा गया है जैसे कि वह एक सामान्य ऑर्डर हो। सबसे बड़ा सवाल सभी के लिए है—उन लोगों के लिए जो इन रोबोट्स को बना रहे हैं से लेकर उन लोगों तक जो उनकी रक्षा करने की कोशिश कर रहे हैं—कि हम इन तरकीबों का वर्णन कैसे करें ताकि हम उन्हें पहचान सकें, भले ही हमलावर अपनी शब्दावली बदल दें?

जेरेमी मैकह्यू द्वारा लिखा गया यह शोध पत्र सुझाव देता है कि हम इन तरकीबों को गलत तरीके से देख रहे हैं। हर हमले को एक अद्वितीय, अजीब वाक्य के रूप में मानने के बजाय जिसे हमें याद करना पड़े, लेखक इसे हिस्सों में तोड़ने का एक नया तरीका प्रस्तावित करता है, ठीक वैसे ही जैसे एक मैकेनिक कार के इंजन को हिस्सों में तोड़ता है। पेपर का तर्क है कि हर प्रॉम्प्ट इंजेक्शन, चाहे उसे किसी भी रूप में छिपाया गया हो, वास्तव में उन्हीं सात बुनियादी ब्लॉकों से बना होता है। इसे एक जादू के मंत्र की रेसिपी की तरह समझें: आपको एक कैरियर (Carrier) चाहिए (वह लिफाफा जिसमें मंत्र छिपा है), एक डिलीवरी वेक्टर (Delivery Vector) (लिफाफा जादूगर तक कैसे पहुँचता है), कंसीलमेंट (Concealment) (अदृश्य स्याही), एक कॉन्टेक्स्ट-ब्रेक (Context-Break) (वह क्षण जब जादूगर नियमों को सुनना बंद कर देता है और मंत्र को सुनना शुरू कर देता है), प्रिविलेज एस्केलेशन (Privilege Escalation) (जादूगर को यह विश्वास दिलाना कि उनके पास वह करने की अनुमति है जो वे आमतौर पर नहीं कर सकते), पेलोड (Payload) (वास्तविक मंत्र या कमांड), और एक रिटर्न चैनल (Return Channel) (यह बताने के लिए कि क्या यह काम कर गया, जादूगर मंत्र-साधक को कैसे बताता है)।

पेपर सुझाव देता है कि हमलों को इन सात भागों के साथ लेबल करके, सुरक्षा टीमें उन पैटर्नों को पहचान सकती हैं जो सतह पर पूरी तरह से अलग दिखते हैं लेकिन वास्तव में एक ही चाल हैं। उदाहरण के लिए, एक हैकर एक बायोडाटा (कैरियर) में एक फर्जी बग रिपोर्ट लिख सकता है जो पासवर्ड चुराने के लिए हायरिंग बॉट को धोखा देने के लिए सफेद टेक्स्ट (कंसीलमेंट) में एक कमांड छिपाता है (पेलोड)। दूसरा हैकर एक फर्जी ईमेल (कैरियर) का उपयोग कर सकता है जिसमें भाषा परिवर्तन (कॉन्टेक्स्ट-ब्रेक) हो, ताकि कस्टमर सर्विस बॉट को डेटाबेस डिलीट करने के लिए मजबूर किया जा सके (पेलोड)। भले ही शब्द पूरी तरह से अलग हों, हमले का "आकार" बिल्कुल समान है। लेखक स्पष्ट रूप से इन हमलों की तुलना पुराने कंप्यूटर ट्रिक्स जैसे SQL इंजेक्शन से करने के खिलाफ चेतावनी देता है, क्योंकि AI अगले शब्द का अनुमान लगाने में इतना अच्छा है कि हम पुराने सॉफ़्टवेयर की तरह केवल छेद को "पैच" नहीं कर सकते; जोखिम हमेशा बना रहता है। इसके बजाय, हमें हमले की शारीरिक रचना (anatomy) को समझने की आवश्यकता है ताकि उससे लड़ा जा सके। यह पेपर यह दावा नहीं करता है कि इसने समस्या को हल कर दिया है या एक आदर्श ढाल बनाई है; बल्कि, यह एक नया मानचित्र और एक साझा भाषा प्रदान करता है ताकि रक्षक, हैकर्स और इंटेलिजेंस टीमें अंततः इस बात पर सहमत हो सकें कि वे क्या देख रहे हैं और इन विकसित होते खतरों को कैसे ट्रैक किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →