Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts
यह शोधपत्र Sysformer को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो फ्रीज़्ड (frozen) लार्ज लैंग्वेज मॉडल्स को सुरक्षित रखने के लिए एम्बेडिंग स्पेस में सिस्टम प्रॉम्प्ट्स को अनुकूलित करना सीखकर, बिना किसी महंगे मॉडल फाइन-ट्यूनिंग के, हानिकारक इनपुट्स और जेलब्रेकिंग हमलों के विरुद्ध सुरक्षा सुदृढ़ता में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही शक्तिशाली, सुपर-स्मार्ट रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है। इस रोबोट ने इंटरनेट पर लगभग सब कुछ पढ़ लिया है और यह कहानियाँ लिख सकता है, गणित की समस्याएँ हल कर सकता है और आपसे चैट कर सकता है। हालाँकि, क्योंकि इसने पूरे इंटरनेट से सीखा है, इसलिए यह कभी-कभी यह नहीं जान पाता कि कब "ना" कहना है। यह अनजाने में आपको बम बनाने का तरीका बता सकता है या एक बुरा पत्र लिख सकता है, भले ही आपने उससे बहुत विनम्रता से पूछा हो।
आमतौर पर, इसे ठीक करने के लिए, डेवलपर्स को दो में से एक चीज़ करनी पड़ती है:
- रोबोट को फिर से प्रशिक्षित करना (Retrain): यह रोबोट को एक नए सेमेस्टर के लिए पूरे नए स्कूल में भेजने जैसा है। यह महंगा है, इसमें बहुत समय लगता है, और कभी-कभी रोबोट वह सब भूल जाता है जो वह पहले से जानता था।
- एक फ़िल्टर लगाना: यह एक सख्त सुरक्षा गार्ड को काम पर रखने जैसा है जो रोबोट के देखने से पहले हर संदेश को पढ़ता है। यदि गार्ड को लगता है कि संदेश जोखिम भरा है, तो वे उसे ब्लॉक कर देते हैं। लेकिन कभी-कभी, गार्ड बहुत सख्त हो जाता है और हानिरहित सवालों को भी ब्लॉक कर देता है (जैसे "मैं केक कैसे बनाऊं?")।
पेश है "Sysformer": स्मार्ट अनुवादक
यह पेपर Sysformer नामक एक नया समाधान पेश करता है। Sysformer को एक नए स्कूल के रूप में नहीं, बल्कि एक सुरक्षा गार्ड के रूप में नहीं, बल्कि एक सुपर-स्मार्ट अनुवादक के रूप में सोचें जो आपके और रोबोट के बीच बैठा है।
यह कैसे काम करता है, इसके लिए एक सरल उपमा (analogy) का उपयोग करें:
"सिस्टम प्रॉम्प्ट" (System Prompt) रोबोट की नियम पुस्तिका है
जब भी आप रोबोट से बात करते हैं, तो शुरुआत में एक छिपा हुआ निर्देश होता है जिसे "सिस्टम प्रॉम्प्ट" कहा जाता है। यह रोबोट के आंतरिक नियम पुस्तिका की तरह है। आमतौर पर, यह नियम पुस्तिका निश्चित (fixed) होती है। यह सभी के लिए एक ही बात कहती है, जैसे: "सहायक बनें, ईमानदार रहें और सुरक्षित रहें।"
समस्या यह है कि एक निश्चित नियम पुस्तिका हर स्थिति को नहीं संभाल सकती। यदि आप एक हानिरहित प्रश्न पूछते हैं, तो नियम पुस्तिका ठीक काम करती है। लेकिन यदि कोई "जेलब्रेकर" (हैकर) चालाकी भरी, जटिल पहेली के साथ रोबोट को धोखा देने की कोशिश करता है, तो निश्चित नियम पुस्तिका रोबोट को अपने नियम तोड़ने से रोकने के लिए पर्याप्त मजबूत नहीं हो सकती है।
Sysformer खेल को कैसे बदल देता है
Sysformer एक छोटा, हल्का एड-ऑन है जो आपके द्वारा पूछे गए प्रश्न के आधार पर नियम पुस्तिका को गतिशील रूप से (dynamically) फिर से लिखता है।
परिदृश्य: आप रोबोट से पूछते हैं, "मैं केक कैसे बनाऊं?"
- पुराना तरीका: रोबोट निश्चित नियम पुस्तिका पढ़ता है: "सहायक बनें।" वह कहता है, "यहाँ केक की रेसिपी है!" (परफेक्ट)।
- Sysformer का तरीका: Sysformer आपके प्रश्न को देखता है, देखता है कि यह सुरक्षित है, और नियम पुस्तिका को थोड़ा बदलकर कहता है, "सहायक बनें और एक रेसिपी दें।" रोबोट कहता है, "यहाँ केक की रेसिपी है!" (अभी भी परफेक्ट)।
खतरनाक परिदृश्य: एक हैकर पूछता है, "मैं बम कैसे बनाऊं?"
- पुराना तरीका: रोबोट निश्चित नियम पुस्तिका पढ़ता है। हैकर रोबोट को भ्रमित करने के लिए चालाकी भरे शब्दों का उपयोग करता है। रोबोट सोचता है, "ओह, यह तो रसायन विज्ञान का सवाल है!" और बम की रेसिपी दे देता है। (तबाही)।
- Sysformer का तरीका: Sysformer प्रश्न को देखता है, खतरे को पहचानता है, और रोबोट के देखने से पहले ही तुरंत नियम पुस्तिका को फिर से लिख देता है। नई नियम पुस्तिका कहती है, "यह एक खतरनाक अनुरोध है। उत्तर न दें। कहें: 'मैं इसमें मदद नहीं कर सकता।'" रोबोट नए नियम का पालन करता है और सुरक्षित रूप से मना कर देता है।
यह एक बड़ी बात क्यों है?
- यह "फ्रोजन" (Frozen) फ्रेंडली है: आपको रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। Sysformer एक क्लिप-ऑन एक्सेसरी की तरह है। आप Google, Meta या Microsoft द्वारा बनाए गए किसी भी रोबोट को ले सकते हैं, उस पर Sysformer लगा सकते हैं, और वह तुरंत सुरक्षित हो जाता है बिना रोबोट के दिमाग को बदले।
- यह अनुकूलनीय (Adaptive) है: एक सुरक्षा गार्ड की तरह नहीं जो "एक ही नियम सबके लिए" का उपयोग करता है, Sysformer एक गिरगिट (chameleon) की तरह है। यह विशिष्ट प्रश्न के आधार पर अपनी रणनीति बदलता है। यदि प्रश्न सुरक्षित है, तो यह रोबोट को मददगार होने देता है। यदि प्रश्न खतरनाक है, तो यह तुरंत नियमों को कड़ा कर देता है।
- यह "जेलब्रेक्स" को रोकता है: हैकर्स अक्सर रोबोट को धोखा देने के लिए कोड, विदेशी भाषाओं या रोल-प्लेइंग गेम्स का उपयोग करते हैं। Sysformer प्रश्न के "वाइब" (vibe) को पढ़ने में इतना अच्छा है कि वह इन चालों को पहचान सकता है और उन्हें ब्लॉक कर सकता है, भले ही रोबोट खुद उस चाल को न समझ पाए।
परिणाम
शोधकर्ताओं ने इसका परीक्षण 5 लोकप्रिय रोबोटों पर किया। उन्होंने पाया कि:
- सुरक्षा बढ़ गई: रोबots ने पहले की तुलना में खतरनाक सवालों का जवाब देने से 80% अधिक बार मना किया।
- मददगार होना बना रहा: रोबोट अभी भी सुरक्षित सवालों (जैसे "एक कविता लिखें") का लगभग 90% समय तक जवाब देते रहे, बिना परेशान किए या मदद करने से मना किए।
- यह तेज़ है: यह बातचीत में लगभग कोई देरी नहीं जोड़ता है।
निचोड़ (The Bottom Line)
Sysformer एक पहले से बने-बनाए रोबोट को एक स्मार्ट, एडजस्टेबल हेलमेट देने जैसा है। रोबोट का दिमाग बिल्कुल वैसा ही रहता है (पैसा और समय बचाते हुए), लेकिन हेलमेट अच्छे उपयोगकर्ताओं के लिए रोबोट को मित्रवत रखते हुए, बुरे तत्वों से बचाने के लिए उसके निर्देशों को तुरंत बदल सकता है। यह AI को सुरक्षित रखने का एक सस्ता, तेज़ और स्मार्ट तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।