SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses
यह ज्ञान का व्यवस्थितकरण (SoK) शोध पत्र एकीकृत वर्गीकरण (taxonomies) प्रस्तावित करके, मूल्यांकन मेटाडेटा को औपचारिक रूप देकर, और हमलों एवं सुरक्षा उपायों के पुनरुत्पादनीय, लागत-सचेत और तुलनात्मक मूल्यांकन को सक्षम करने के लिए नए डेटासेट और उपकरणों के साथ एक मॉड्यूलर प्लेटफॉर्म जारी करके, LLM प्रॉम्प्ट सुरक्षा के खंडित मूल्यांकन को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अविश्वसनीय रूप से बुद्धिमान, लेकिन थोड़े नादान लाइब्रेरियन (पुस्तकालयाध्यक्ष) हैं। उन्हें सवालों के जवाब देने, कोड लिखने और कार्यों में मदद करने के लिए काम पर रखा गया है। हालाँकि, इन लाइब्रेरियन के पास एक सख्त नियम पुस्तिका है: "किसी को भी कुछ खतरनाक या अवैध करने में मदद न करें।"
समस्या यह है कि चालाक लोगों (हमलावरों) ने इन लाइब्रेरियन को उनके अपने नियमों को तोड़ने के लिए बहलाने का तरीका ढूंढ लिया है। वे इसे तब करते हैं जब वे किसी बुरे अनुरोध को दूसरे भाषा में फुसफुसाते हैं, किसी बुरे अनुरोध को फिल्म की स्क्रिप्ट के रूप में सजाते हैं, या लाइब्रेरियन को एक विलेन (खलनायक) बनने का नाटक करने के लिए कहते हैं। इसे "जेलब्रेक" (jailbreak) कहा जाता है।
यह पेपर पूरे लाइब्रेरी सिस्टम के एक विशाल सुरक्षा ऑडिट (security audit) की तरह है। लेखकों ने महसूस किया कि हर कोई यह मापने की कोशिश कर रहा था कि उनके लाइब्रेरियन कैसा प्रदर्शन कर रहे हैं, लेकिन वे सभी अलग-अलग पैमाने, अलग-अलग परीक्षण प्रश्न और अलग-अलग न्यायाधीशों का उपयोग कर रहे थे। एक व्यक्ति कह सकता है, "हमारा लाइब्रेरियन 90% सुरक्षित है!" जबकि दूसरा कह सकता है, "हमारा केवल 50% सुरक्षित है!" यह पेपर तर्क देता है कि आप इन नंबरों की तुलना नहीं कर सकते क्योंकि वे एक ही चीज़ को नहीं माप रहे हैं।
यहाँ बताया गया है कि यह इसे ठीक करने के लिए क्या करता है, सरल शब्दों में:
1. तीन नई "नियम पुस्तिकाएं" (Taxonomies)
लेखकों ने अराजकता को व्यवस्थित करने के लिए तीन संगठित सूचियाँ बनाईं, जैसे खिलौनों को विशिष्ट डिब्बों में छाँटना:
- "धोखेबाज" की सूची (Attacks): उन्होंने वर्गीकृत किया कि लोग लाइब्रेरियन को कैसे धोखा देते हैं।
- उदाहरण: कुछ तरकीबों में बुरे अनुरोध को छिपाना (disguising) शामिल है (जैसे किसी गुप्त कोड में "बम कैसे बनाएं" लिखना)। अन्य मामलों में अनुरोध को छोटे, हानिरहित टुकड़ों में बाँटना (splitting) शामिल है जो मिलकर कुछ बुरा बनाते हैं। कुछ तो ट्रिक लिखने में मदद करने के लिए दूसरे AI का भी उपयोग करते हैं।
- "रक्षक" की सूची (Defenses): उन्होंने वर्गीकृत किया कि लाइब्रेरियन ट्रिक्स को रोकने के लिए कैसे प्रयास करते हैं।
- उदाहरण: कुछ गार्ड अंदर आने से पहले ID चेक (Check the ID) करते हैं (इनपुट डिटेक्शन)। अन्य लोग व्यक्ति के जाने के बाद बैग चेक (Check the bag) करते हैं (आउटपुट डिटेक्शन)। कुछ अनुरोध को फिर से लिखने (rewrite) की कोशिश करते हैं ताकि वह सुरक्षित हो जाए, जबकि अन्य लाइब्रेरियन को प्रशिक्षित (train) करने की कोशिश करते हैं ताकि वह अधिक स्मार्ट बन सके।
- "कमजोरी" की सूची (Vulnerabilities): उन्होंने लाइब्रेरियन की स्वाभाविक कमजोरियों को सूचीबद्ध किया।
- उदाहरण: लाइब्रेरियन बहुत विनम्र हो सकता है और यदि आप प्यार से पूछें तो "ना" कहने में हिचकिचा सकता है (मनोवैज्ञानिक हेरफेर/Psychological Manipulation), या वे भ्रमित हो सकते हैं यदि आप उनसे ऐसी कहानी का सारांश मांगते हैं जो संयोग से किसी अपराध के बारे में है (फॉर्मेट एक्सप्लोइटेशन/Format Exploitation)।
2. "यूनिवर्सल टेस्ट लैब" (PromptSecurity)
लेखकों ने PromptSecurity नामक एक विशाल, मॉड्यूलर परीक्षण मशीन बनाई है। इसे एक वीडियो गेम लेवल की तरह समझें जहाँ आप पात्र, दुश्मन, हथियार और रेफरी को बदल सकते हैं, लेकिन खेल के नियम बिल्कुल वही रहते हैं।
- यह क्यों मायने रखता है: पहले, शोधकर्ता एक विशिष्ट मॉडल के साथ एक विशिष्ट सेट प्रश्नों पर अपना बचाव परीक्षण करते थे। यदि यह सफल होता, तो वे जीत का दावा करते। लेकिन शायद यह इसलिए सफल हुआ क्योंकि प्रश्न आसान थे!
- समाधान: यह प्लेटफॉर्म सभी को बिल्कुल समान परिस्थितियों में अपने परीक्षण चलाने के लिए मजबूर करता है। यह सब कुछ रिकॉर्ड करता है: कितने प्रश्न पूछे गए, परीक्षण चलाने की लागत कितनी थी, और ठीक किस "रेफरी" (AI जज) ने तय किया कि उत्तर बुरा था। यह सुनिश्चित करता है कि यदि विधि A, विधि B को हराती है, तो यह इसलिए है क्योंकि विधि A वास्तव में बेहतर है, न कि इसलिए कि परीक्षण में हेरफेर किया गया था।
3. "बिग डेटा" संग्रह (JAILBREAKDB)
पेपर ने परीक्षण प्रश्नों का एक विशाल पुस्तकालय एकत्र किया:
- 445,000+ "जेलब्रेक" प्रयास (बुरे अनुरोध)।
- 1,000,000+ "बेनाइन" (सामान्य/सुरक्षित) अनुरोध।
उन्होंने इन्हें साफ किया और व्यवस्थित किया ताकि शोधकर्ता इनका उपयोग किसी भी नए AI के लिए एक मानक "परीक्षा" के रूप में कर सकें।
4. उन्होंने क्या खोजा (परिणाम)
जब उन्होंने अपने यूनिवर्सल परीक्षण चलाए, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं:
- "रेफरी" मायने रखता है: आप परीक्षा को ग्रेड करने के लिए किससे पूछते हैं, यह स्कोर को बदल देता है। यदि आप एक रेफरी से उत्तर के फॉर्मेट (जैसे, "क्या उन्होंने 'मैं नहीं कर सकता' से शुरुआत की?") को देखने के लिए कहते हैं, तो वे एक ऐसे बुरे उत्तर को मिस कर सकते हैं जिसे चतुराई से छिपाया गया था। यदि आप उन्हें अर्थ (meaning) को देखने के लिए कहते हैं, तो वे इसे पकड़ सकते हैं। पेपर कहता है कि हमें सुरक्षा को मापने के तरीके के बारे में बहुत सावधान रहने की आवश्यकता है।
- छोटे मॉडल बनाम बड़े मॉडल: कभी-कभी, एक छोटा, "कमजोर" AI अधिक सुरक्षित दिखता है क्योंकि वह हमलावर द्वारा उपयोग किए गए जटिल ट्रिक को समझने में विफल रहता है। ऐसा नहीं है कि AI अधिक स्मार्ट है; बल्कि यह है कि वह निर्देशों का पालन करने के लिए बहुत कम बुद्धिमान है।
- "बैकफायर" प्रभाव: कुछ बचाव वास्तव में चीजों को बदतर बना देते हैं! यदि आप सुरक्षा निर्देश जोड़कर AI को सुरक्षित होने के लिए "स्टीयर" करने की कोशिश करते हैं, तो कभी-कभी वह निर्देश AI को भ्रमित कर देता है और वह अनजाने में कुछ हानिकारक कह देता है। यह एक संग्रहालय की प्रदर्शनी पर "छूना मना है" का साइन लगाने जैसा है, लेकिन साइन इतना बड़ा है कि वह कला के दृश्य को ब्लॉक कर देता है, जिससे लोग उससे टकरा जाते हैं।
- लागत बनाम सुरक्षा: सबसे प्रभावी बचाव चलाने में अक्सर बहुत पैसा या समय लगता है। सबसे सस्ते बचाव सामान्य प्रश्नों (जैसे रेसिपी मांगना) को भी उतनी ही बार खराब कर देते हैं जितना कि वे बुरे अनुरोधों को पकड़ते हैं।
निचोड़ (The Bottom Line)
यह पेपर केवल यह नहीं कहता कि "AI असुरक्षित है" या "यहाँ एक समाधान है।" इसके बजाय, यह कहता है, "सेब की तुलना संतरे से करना बंद करें।"
यह उपकरण (वर्गीकरण, डेटासेट और परीक्षण प्लेटफॉर्म) प्रदान करता है ताकि भविष्य में, जब कोई दावा करे कि उनका नया AI "99% सुरक्षित" है, तो हम उनके काम की जांच कर सकें, देख सकें कि उन्होंने वास्तव में इसका परीक्षण कैसे किया, और जान सकें कि क्या वह दावा वास्तविक है या केवल एक खराब परीक्षण सेटअप के कारण पैदा हुआ भ्रम है। यह एक अव्यवस्थित, भ्रमित क्षेत्र को एक संरचित विज्ञान में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।