← नवीनतम पेपर
💻 computer science

Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs

यह अध्ययन प्रकट करता है कि प्रॉम्प्ट्स में सूक्ष्म, एकल-चर परिवर्तन भी कोडिंग एलएलएम (LLMs) को असुरक्षित कोड उत्पन्न करने के लिए प्रेरित कर सकते हैं, जिसमें इनपुट-हैंडलिंग संबंधी खामियां सुरक्षित-डिफ़ॉल्ट त्रुटियों की तुलना में हिडन स्टेट्स (hidden states) से अधिक पूर्वानुमानित होती हैं, जिससे सुरक्षा खतरा मॉडल प्रॉम्प्ट इंजेक्शन से आगे बढ़कर सामान्य प्रॉम्प्ट विविधताओं तक विस्तृत हो जाता है।

मूल लेखक: Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली, सुपर-फास्ट प्रशिक्षु कोडर (apprentice coder) को काम पर रख रहे हैं। यह प्रशिक्षु (एक AI) है जो कुछ ही सेकंडों में पूरा प्रोग्राम लिख सकता है। आप उसे एक सरल निर्देश देते हैं, जैसे "एक फ़ाइल को सुरक्षित रूप से अनज़िप करने के लिए एक फंक्शन लिखें।" आमतौर पर, वह बहुत अच्छा काम करता है।

लेकिन यह शोध पत्र एक डरावना सवाल पूछता है: क्या होगा अगर आपका प्रशिक्षु आपके प्रश्न पूछने के तरीके में होने वाली छोटी सी गलती के प्रति अविश्वसनीय रूप से संवेदनशील हो?

शोधकर्ताओं ने पाया कि यदि आप उनके निर्देश में केवल एक अक्षर भी बदल देते हैं—चाहे वह कोई टाइपो (लिखने की गलती) हो, या किसी शब्द को उसके समान दिखने वाले दूसरे शब्द से बदल देना हो—तो AI द्वारा लिखा गया कोड अचानक "सुरक्षित और सुदृढ़" से बदलकर "उन छेदों से भरा" हो सकता जिनसे हैकर्स आसानी से अंदर घुस सकते हैं।

यहाँ उनके निष्कर्षों का रोजमर्रा के उदाहरणों के साथ विवरण दिया गया है:

1. "एक-अक्षर" वाला डोमिनो प्रभाव (The "One-Letter" Domino Effect)

AI को दिए गए आपके निर्देश को एक रेसिपी (विधि) की तरह समझें। शोधकर्ताओं ने पाया कि यदि आप रेसिपी में केवल एक अक्षर बदल देते हैं (जैसे "नमक" को "नमकीन" में बदलना), तो बनने वाला व्यंजन न केवल स्वाद में थोड़ा अलग होगा; बल्कि वह जहरीला भी हो सकता है।

  • खोज: उन्होंने तीन अलग-अलग AI मॉडल और पांच प्रोग्रामिंग भाषाओं का परीक्षण किया। उन्होंने पाया कि प्रॉम्प्ट में एक एकल वर्ण (character) बदलने से कोड "सुरक्षित" से "कमजोर" में बदल सकता है।
  • उपमा: यह एक शेफ को यह बताने जैसा है कि, "सुनिश्चित करें कि दरवाजा बंद है," बनाम "सुनिश्चित करें कि दरवाजा लोcked है" (एक टाइपो के साथ)। इस विशिष्ट मामले में, AI पूरी तरह से दरवाजा लॉक करना भूल सकता है, जिससे घर खुला रह जाता है।

2. दो अलग-अलग प्रकार की "गलतियाँ"

शोधकर्ताओं ने देखा कि सभी सुरक्षा संबंधी खामियां एक जैसी नहीं होतीं। उन्होंने दो अलग श्रेणियां पाईं, जो अलग तरह से व्यवहार करती हैं:

  • प्रकार A: "लापता गार्ड" (इनपुट हैंडलिंग - Input Handling)

    • यह क्या है: AI एक सुरक्षा जांच जोड़ना भूल जाता है, जैसे क्लब में आईडी चेक करने वाला बाउंसर।
    • निष्कर्ष: AI का आंतरिक "मस्तिष्क" (hidden states) कोड लिखने से पहले ही इस गलती के संकेत दिखाता है। यह ऐसा है जैसे खाना बनाना शुरू करने से पहले ही शेफ को गलत सामग्री की ओर हाथ बढ़ाते हुए देखना। शोधकर्ता केवल AI की विचार प्रक्रिया को देखकर लगभग 75% सटीकता के साथ इन त्रुटियों की भविष्यवाणी कर सकते थे।
    • क्यों: AI को कोड के भीतर एक पूरी नई "सुरक्षा संरचना" बनाने का निर्णय बहुत पहले लेना होता है। यह निर्णय स्पष्ट रूप से दिखाई देता है।
  • प्रकार B: "कमजोर चुनाव" (सुरक्षित डिफ़ॉल्ट्स - Secure Defaults)

    • यह क्या है: AI सुरक्षा संरचना तो बनाता है, लेकिन एक कमजोर ताला चुन लेता है (जैसे जटिल पासवर्ड के बजाय "1234" वाला पासवर्ड)।
    • निष्कर्ष: इन्हें प्रेडिक्ट करना बहुत कठिन है। AI का आंतरिक मस्तिष्क बिल्कुल अंतिम क्षण तक ठीक दिखता है। कमजोर ताला चुनने का निर्णय प्रक्रिया के बहुत अंत में होता है, इसलिए "प्रारंभिक चेतावनी संकेत" गायब रहता है। शोधकर्ता इन्हें केवल 67% समय ही प्रेडिक्ट कर सके।
    • क्यों: यह घर बनाने के बाद दरवाजे पर एक कमजोर ताला लगाने का निर्णय लेने जैसा है। ब्लूप्रिंट एकदम सही लग रहा था, लेकिन अंतिम चुनाव एक बुरा निर्णय था।

3. गलती कहाँ होती है, यह मायने रखता है

शोधकर्ताओं ने यह भी देखा कि निर्देश में टाइपो (typo) कहाँ हुआ था।

  • बीच का हिस्सा महत्वपूर्ण है: उन्होंने पाया कि निर्देश के बीच में होने वाले टाइपो सबसे खतरनाक थे।
  • उपमा: कल्पना करें कि एक वाक्य है: "कृपया सामने का दरवाजा और पीछे का दरवाजा बंद करें।" यदि आप बीच में "सामने" (front) शब्द में टाइपो करते हैं, तो AI भ्रमित हो सकता है कि किस दरवाजे को बंद करना है। यदि आप निर्देश के बिल्कुल शुरू या अंत में टाइपो करते हैं, तो AI उसे अनदेखा करने या सही अनुमान लगाने की अधिक संभावना रखता है। निर्देश का "मुख्य भाग" (meat) वह जगह है जहाँ AI सबसे नाजुक होता है।

4. "क्रिस्टल बॉल" (प्रोबिंग - Probing)

टीम ने एक "क्रिस्टल बॉल" (एक गणितीय प्रोब) बनाया जो आपके प्रॉम्प्ट को पढ़ने के तुरंत बाद और कोड लिखने से पहले AI की आंतरिक स्थिति को देखता है।

  • परिणाम: यह क्रिस्टल बॉल यह बता सकता है कि क्या AI "लापता गार्ड" (प्रकार A) वाली त्रुटियां लिखने वाला है, और वह भी काफी अच्छी तरह से।
  • सीमा: यह "कमजोर चुनाव" (प्रकार B) वाली त्रुटियों की भविष्यवाणी करने में संघर्ष करता है। इससे पता चलता है कि कुछ सुरक्षा मुद्दों के लिए, हम कोड लिखने से पहले ही उन्हें पकड़ सकते हैं, लेकिन अन्य के लिए, हमें कोड लिखते समय या पूरा होने के बाद उसकी जांच करने की आवश्यकता हो सकती है।

मुख्य निष्कर्ष (The Bottom Line)

शोध पत्र निष्कर्ष निकालता है कि हम यह मानकर नहीं चल सकते कि हमारे AI कोडिंग असिस्टेंट पूरी तरह सुरक्षित (robust) हैं। आपके अनुरोध में एक साधारण टाइपो या शब्दों का मामूली बदलाव अनजाने में एक सुरक्षा भेद्यता (vulnerability) पैदा कर सकता है।

  • अच्छी खबर: हम AI के आंतरिक "विचारों" को देखकर कभी-कभी इन जोखिमों का जल्दी पता लगा सकते हैं।
  • बुरी खबर: हम इस तरह से सभी जोखिमों को नहीं पकड़ सकते, विशेष रूप से वे जहाँ AI प्रक्रिया के बिल्कुल अंत में एक गलत निर्णय लेता है।

महत्वपूर्ण नोट: शोधकर्ता इस बात पर जोर देते हैं कि उन्होंने यह सब रैंडम, दुर्घटनापूर्ण दिखने वाले टाइपो (जैसे कि कोई इंसान करता है) के माध्यम से किया है, न कि AI को जानबूझकर धोखा देने की कोशिश में। इसका मतलब है कि खतरा वास्तविक है, यहाँ तक कि उन सामान्य डेवलपर्स के लिए भी जो बस अपना काम पूरा करना चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →