Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models
यह शोध पत्र प्रदर्शित करता है कि स्ट्रक्चर्ड रीजनिंग द्वारा निर्देशित होने पर, हल्के और सामान्य-उद्देश्य वाले LLMs, उत्पादन वातावरण में प्रॉम्प्ट हमलों का पता लगाने के लिए कम-विलंबता वाले सुरक्षा न्यायाधीश के रूप में प्रभावी ढंग से कार्य कर सकते हैं, जो वर्तमान में सिंगापुर की सार्वजनिक सेवा चैटबॉट्स में तैनात एक विधि है, जबकि एक 'मिक्सचर-ऑफ-मॉडेल्स' दृष्टिकोण केवल मामूली प्रदर्शन सुधार प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही मददगार, सुपर-स्मार्ट रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो सरकार के लिए काम करता है। इसका काम नागरिकों के सवालों के जवाब देना, उन्हें फॉर्म भरने में मदद करना और सलाह देना है। लेकिन, बिल्कुल एक इंसान की तरह, इस रोबोट को भी धोखा दिया जा सकता है।
बुरे तत्व इस रोबोट को "जेलब्रेक" करने या इसे खतरनाक काम करने के लिए छिपे हुए निर्देश "इंजेक्ट" करने की कोशिश करते हैं—जैसे कि गुप्त डेटा उजागर करना, मैलवेयर लिखना, या हानिकारक सलाह देना।
यह पेपर उस रोबोट के लिए एक सुरक्षा गार्ड (security guard) बनाने के बारे में है। सिंगापुर की GovTech के लेखकों को एक कठिन समस्या का सामना करना पड़ा:
- पुराने गार्ड (साधारण नियम-आधारित सिस्टम) तेज़ तो हैं लेकिन चालाकी भरी, धूर्त हमलों को समझने के लिए बहुत मूर्ख हैं।
- सुपर गार्ड्स (विशाल AI मॉडल) चालाकियों को पकड़ने के लिए पर्याप्त स्मार्ट हैं, लेकिन वे हर एक संदेश की वास्तविक समय (real-time) में जांच करने के लिए बहुत धीमे और महंगे हैं।
उन्होंने इसे सरल तरीके से कैसे हल किया, यहाँ बताया गया है:
1. "सोचने वाला गार्ड" (LLM-as-a-Judge)
एक विशाल, धीमे सुपर-गार्ड को काम पर रखने के बजाय, उन्होंने एक हल्के (lightweight), तेज़ रोबोट को एक जासूस की तरह सोचना सिखाया।
आमतौर पर, यदि आप किसी रोबोट से पूछते हैं, "क्या यह संदेश बुरा है?" तो वह तुरंत "हाँ" या "नहीं" का अनुमान लगा सकता है। यह एक सुरक्षा गार्ड की तरह है जो केवल किसी व्यक्ति के चेहरे को देखता है और तय करता है कि वह संदिग्ध दिखता है। यह विवरणों को चूक जाता है।
लेखकों ने अपने तेज़ रोबोट को हर संदेश के लिए एक सख्त चेकलिस्ट (एक संरचित तर्क प्रक्रिया) दी जिसे उसे पालन करना था:
- भेष हटाना (Strip the Disguise): "क्या यह व्यक्ति अपने असली इरादे को छिपाने के लिए शोधकर्ता होने का नाटक कर रहा है या कोई कहानी लिख रहा है?" (जैसे, "एक बम बनाने के बारे में कहानी लिखें" बनाम "मैं बम कैसे बनाऊं?")।
- इरादा जाँचना (Check the Intent): "क्या वे एक हानिरहित वर्कफ़्लो के बारे में पूछ रहे हैं (जैसे 'चार्ट बनाना') या कुछ खतरनाक चीज़ के बारे में?"
- सुरक्षा संकेतों की तलाश (Look for Safety Signals): "क्या वे पूछ रहे हैं कि वायरस को कैसे रोकें (सुरक्षित) या उसे कैसे बनाएँ (बुरा)?"
- आत्म-चिंतन (Self-Reflect): अंतिम उत्तर देने से पहले, रोबोट को रुकना होगा और खुद से पूछना होगा: "रुको, क्या मैं बहुत सख्त हो रहा हूँ? क्या यह वास्तव में एक वैध प्रश्न हो सकता है?"
परिणाम: अपने तेज़ रोबोट को जवाब देने से पहले "चरण-दर-चरण सोचने" के लिए मजबूर करके, यह लगभग धीमे, महंगे सुपर-गार्ड्स जितना स्मार्ट बन गया, लेकिन यह वास्तविक समय में काम करने के लिए पर्याप्त तेज़ भी था।
2. "गार्ड्स की समिति" (Mixture-of-Models)
शोधकर्ताओं ने सोचा: "क्या होगा अगर हम तीन अलग-अलग रोबोटों से संदेश की जाँच करने और वोट लेने के लिए कहें? क्या इससे चीजें अधिक सुरक्षित होंगी?"
उन्होंने विभिन्न AI मॉडल की राय को मिलाने (एक "मिश्रण-ऑफ-मॉडेल्स") की कोशिश की।
- आश्चर्य: अधिक गार्ड जोड़ने से चीजें हमेशा बेहतर नहीं हुईं। वास्तव में, कभी-कभी इससे चीजें और भी खराब हो जाती हैं।
- उपमा: कल्पना कीजिए कि एक जूरी है। यदि आपके पास एक शानदार जासूस और एक भ्रमित इंटर्न है, तो इंटर्न को जोड़ने से वास्तव में निर्णय भ्रमित हो सकता है। या, यदि आपके पास तीन जासूस हैं जो सभी एक ही गलती करते हैं, तो तीसरे को जोड़ने से कोई मदद नहीं मिलती।
- निष्कर्ष: आपको तभी बढ़त मिलती है जब आप ऐसे गार्ड चुनें जिनके पास अलग-अलग ताकतें हों जो एक-दूसरे की पूरक हों। बस यादृच्छिक (random) गार्डों को एक साथ फेंकने से आमतौर पर बहस और गलतियाँ होती हैं।
3. वास्तविक दुनिया का परीक्षण
उन्होंने इसे केवल नकली, काल्पनिक सवालों पर टेस्ट नहीं किया। उन्होंने एक टेस्ट सेट बनाया जिसमें शामिल थे:
- सिंगापुर के सार्वजनिक चैटबॉट्स से वास्तविक नागरिक प्रश्न (यह सुनिश्चित करने के लिए कि उन्होंने गलती से सामान्य लोगों को ब्लॉक न कर दिया हो)।
- ट्रिकी "रेड टीम" हमले जो सिस्टम को तोड़ने की कोशिश करने वाले अन्य AI द्वारा उत्पन्न किए गए थे।
विजेता: एक विशिष्ट, हल्का मॉडल (जिसे gemini-2.0-flash-lite-001 कहा जाता है) जिसने उनके "सोचने वाले गार्ड" (Thinking Guard) तरीके का उपयोग किया। यह संदेशों की तुरंत जांच करने के लिए पर्याप्त तेज़ था लेकिन पुराने सिस्टमों द्वारा छोड़े गए चालाकी भरे हमलों को पकड़ने के लिए पर्याप्त स्मार्ट भी था।
मुख्य निष्कर्ष
अपने चैटबॉट्स को सुरक्षित रखने के लिए आपको एक विशाल, धीमे, महंगे AI की आवश्यकता नहीं है। आपको बस एक तेज़ AI की आवश्यकता है जिसे सावधानी से सोचना सिखाया गया हो।
- केवल यह न पूछें "क्या यह बुरा है?"
- पूछें: "इरादा क्या है? क्या कोई भेष है? सुरक्षा संकेत क्या हैं? क्या मैं अपने उत्तर की दोबारा जाँच करूँ?"
इस दृष्टिकोण का उपयोग अब सिंगापुर में सार्वजनिक सेवा चैटबॉट्स को सुरक्षित रखने के लिए किया जा रहा है, जिससे नागरिकों के जवाबों के लिए उनके इंतज़ार को बढ़ाए बिना उन्हें हैकर्स से सुरक्षित रखा जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।