← नवीनतम पेपर
💻 computer science

The Defense Trilemma: Why Prompt Injection Defense Wrappers Fail?

यह शोध पत्र एक "डिफेंस ट्राइलेमा" (defense trilemma) को सिद्ध करता है जो यह दर्शाता है कि कनेक्टेड प्रॉम्प्ट स्पेस वाले लैंग्वेज मॉडल्स के लिए कोई भी निरंतर, उपयोगिता-संरक्षण वाला रैपर डिफेंस (utility-preserving wrapper defense), प्रॉम्प्ट इंजेक्शन के विरुद्ध पूर्ण सुरक्षा की गारंटी नहीं दे सकता है, जो कि एक सैद्धांतिक असंभवता है जिसे लीन 4 (Lean 4) में यांत्रिक रूप से सत्यापित किया गया है और कई एलएलएम (LLMs) में अनुभवजन्य रूप से मान्य किया गया है।

मूल लेखक: Manish Bhatt, Sarthak Munshi, Vineeth Sai Narajala, Idan Habler, Ammar Al-Kahfah, Ken Huang, Blake Gatto

प्रकाशित 2026-04-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Manish Bhatt, Sarthak Munshi, Vineeth Sai Narajala, Idan Habler, Ammar Al-Kahfah, Ken Huang, Blake Gatto

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन कभी-कभी शरारती रोबोट सहायक है। आप एक "सुरक्षा गार्ड" (एक सॉफ्टवेयर रैपर) बनाना चाहते हैं जो रोबोट के सामने खड़ा हो। गार्ड का काम उपयोगकर्ता द्वारा कही गई हर बात को पढ़ना, किसी भी खतरनाक लगने वाली चीज़ को ठीक करना और फिर साफ किए गए संदेश को रोबोट तक पहुँचाना है।

लक्ष्य सरल है: यह सुनिश्चित करना कि रोबोट कभी भी कुछ बुरा न करे, बिना उपयोगकर्ता के वास्तविक अर्थ को बदले।

यह शोध पत्र तर्क देता है कि यह गणितीय रूप से असंभव है यदि आप चाहते हैं कि आपका सुरक्षा गार्ड सुचारू (smooth), विनम्र और सहायक हो।

यहाँ बताया गया है कि क्यों, सरल उपमाओं का उपयोग करते हुए।

खेल के तीन नियम

लेखक कहते हैं कि एक आदर्श सुरक्षा गार्ड बनाने के लिए, आपको तीन चीजों को एक साथ होने की आवश्यकता है:

  1. सुचारूता (Continuity/Smoothness): यदि कोई उपयोगकर्ता एक ऐसा वाक्य टाइप करता है जो लगभग सुरक्षित है, तो गार्ड को उसे अचानक पूरी तरह से अलग चीज़ में नहीं बदलना चाहिए। इनपुट में छोटे बदलावों से आउटपुट में छोटे बदलाव होने चाहिए। (इसे एक हल्की ढलान की तरह सोचें, न कि एक खड़ी चट्टान की तरह)।
  2. सहायकता (Utility Preservation): यदि कोई उपयोगकर्ता एक पूरी तरह से सुरक्षित प्रश्न पूछता है (जैसे "मौसम कैसा है?"), तो गार्ड को इसे बिना बदले गुजरने देना चाहिए। आप नहीं चाहेंगे कि गार्ड गलती से एक अच्छे प्रश्न को खराब कर दे।
  3. पूर्णता (Completeness): गार्ड को हर एक खतरनाक अनुरोध को पकड़ना चाहिए और उसे ठीक करना चाहिए ताकि रोबोट कभी भी असुरक्षित चीज़ न देख सके।

बड़ी खबर: आप किन्हीं भी दो चीजों को पा सकते हैं, लेकिन आप इन तीनों को एक साथ कभी नहीं पा सकते। इसे "डिफेंस ट्राइलेमा" (Defense Trilemma) कहा जाता है।

उपमा: "सुरक्षित क्षेत्र" और "खतरा क्षेत्र"

कल्पना कीजिए कि प्रश्नों की दुनिया एक विशाल मानचित्र है।

  • सुरक्षित क्षेत्र (Safe Zone): एक हरा क्षेत्र जहाँ सभी प्रश्न हानिरहित हैं।
  • खतरा क्षेत्र (Danger Zone): एक लाल क्षेत्र जहाँ प्रश्न हानिकारक हैं।
  • सीमा (The Border): वह पतली रेखा जो हरे से लाल को अलग करती है।

समस्या:
सुरक्षा गार्ड का एक नियम है: "यदि आप ग्रीन ज़ोन में हैं, तो मैं आपको नहीं छूऊंगा।"
क्योंकि गार्ड सुचारू (Smooth) है, वे किनारे पर अचानक "मैं आपको नहीं छूऊंगा" से "मैं आपको ठीक करूँगा" में नहीं बदल सकते। उन्हें क्रमिक होना होगा।

तो, ग्रीन ज़ोन के बिल्कुल किनारे पर क्या होता है?
गार्ड को वहाँ खड़ा होना पड़ेगा और कहना होगा, "मैं आपको नहीं छूऊंगा," क्योंकि तकनीकी रूप से आप अभी भी ग्रीन ज़ोन में हैं। लेकिन, क्योंकि आप किनारे पर हैं, आप खतरनाक रेड ज़ोन के भी बहुत करीब हैं।

परिणाम:
हमेशा कुछ ऐसे प्रश्न होंगे जो बिल्कुल सीमा पर होंगे। गार्ड उन्हें "सुरक्षित" देखता है (क्योंकि सहायकता का नियम लागू है) और उन्हें गुजरने देता है। लेकिन क्योंकि गार्ड सुचारू है, वे इन सीमावर्ती प्रश्नों को वास्तव में सुरक्षित बनाने के लिए खतरे से दूर नहीं धकेल पाते।

गार्ड फंस जाता है। वे एक खतरनाक प्रश्न को जाने देते हैं क्योंकि वे बहुत विनम्र हैं, और उन्हें ठीक करने के लिए वे बहुत सुचारू (smooth) हैं।

विफलता के तीन स्तर

शोध पत्र सिद्ध करता है कि यह विफलता तीन बढ़ते हुए तरीकों से होती है:

  1. "किनारे पर अटके रहने" की समस्या (The "Stuck at the Edge" Problem):
    गार्ड को कम से कम एक विशिष्ट "सीमावर्ती" प्रश्न को पूरी तरह से अछूता छोड़ना ही होगा। यह एक ऐसे गार्ड की तरह है जो संपत्ति की रेखा पर खड़े व्यक्ति को हटने से मना कर देता है, भले ही वह व्यक्ति पड़ोसी के लॉन में कदम रखने ही वाला हो।

  2. "धुंधला क्षेत्र" की समस्या (The "Fuzzy Zone" Problem):
    चूंकि गार्ड सुचारू है, वे केवल उस एक अटके हुए प्रश्न को ठीक नहीं कर सकते। उन्हें उस अटके हुए प्रश्न के पास के सभी प्रश्नों के साथ भी कोमल होना होगा। यह उन प्रश्नों की एक "धुंधली पट्टी" (fuzzy band) बनाता है जो थोड़े खतरनाक हैं लेकिन गार्ड उन्हें ठीक करने के लिए बहुत कोमल है।

  3. "भाग जाने" की समस्या (The "Runaway" Problem):
    कल्पना कीजिए कि "खतरा" सुरक्षित क्षेत्र से दूर जाने पर और भी तीव्र होता जा रहा है (एक खड़ी चट्टान की तरह)। गार्ड उपयोगकर्ता को वापस खींचने की कोशिश करता है, लेकिन चट्टान बहुत खड़ी है। गार्ड कितनी भी कोशिश करे, मानचित्र का एक पूरा हिस्सा ऐसा होगा जहाँ उपयोगकर्ता फिर भी नीचे गिर जाएगा। गार्ड उन्हें "सुचारूता" या "सहायकता" के नियमों को तोड़े बिना वापस नहीं खींच सकता।

डिस्क्रीट डिफेंस (Discrete Defenses) के बारे में क्या? (एक "हार्ड ब्लॉक" की उपमा)

आप पूछ सकते हैं, "क्या होगा अगर गार्ड सुचारू नहीं है? क्या होगा अगर वे संदिग्ध होने पर सीधे 'नहीं' कह दें?"
शोध पत्र कहता है कि यदि आप गार्ड को सुचारू नहीं बनाते हैं (उदाहरण के लिए, वे एक प्रश्न को ब्लॉक कर देते जो 99% सुरक्षित है), तो आप सहायकता के नियम को तोड़ देते हैं। आप गलती से अच्छे प्रश्नों को भी ब्लॉक करने लगते हैं।
वैकल्पिक रूप से, यदि आप पूर्ण और सुचारू बनना चाहते हैं, तो आपको कुछ बुरे प्रश्नों को मिस करने को स्वीकार करना होगा।

तो क्या डिफेंस बेकार है?

नहीं! यह शोध पत्र यह नहीं कह रहा है कि "हार मान लो।" यह कह रहा है कि "एक ऐसा जादुई कवच बनाने की कोशिश छोड़ दो जो सब कुछ कर सके।"

इसके बजाय, लेखक एक नई रणनीति का सुझाव देते हैं:

  • सीमा को उथला बनाएं: हर बुरे प्रश्न को रोकने के बजाय, "खतरे" को कम गंभीर बनाएं। यदि रोबोट किसी सीमावर्ती प्रश्न पर चूक जाता है, तो शायद वह केवल एक विनम्र इनकार दे, न कि कोई हानिकारक उत्तर।
  • मानचित्र को सरल बनाएं: प्रश्न पूछने के तरीकों की संख्या कम करें (जटिलता को कम करें)। एक पूरे जंगल की रक्षा करने की तुलना में एक छोटे बगीचे की रक्षा करना आसान है।
  • सीमा पर नज़र रखें: चूंकि आप सब कुछ नहीं रोक सकते, इसलिए सीमा पर एक कैमरा लगाएं। यदि कोई किनारे के बहुत करीब पहुँच जाता है, तो एक इंसान या एक अलग सिस्टम हस्तक्षेप कर सकता है।

निचोड़ (The Bottom Line)

आप ऐसा सॉफ़्टवेयर रैपर नहीं बना सकते जो सुचारू हो, अच्छे प्रश्नों को खराब न करे, और हर बुरे प्रश्न को पकड़े—यह सब एक साथ। आपको चुनना होगा कि आप किन दो को चाहते हैं, और यह स्वीकार करना होगा कि तीसरे के साथ समझौता करना पड़ेगा। सुरक्षा इंजीनियरिंग का लक्ष्य इस समझौते (trade-off) को प्रबंधित करना है, न कि इसे मिटाने की इच्छा करना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →