Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety
यह शोध पत्र यह प्रदर्शित करता है कि एक प्रोप्रायटरी अंग्रेजी-केंद्रित शिक्षक मॉडल से ओपन-सोर्स बहुभाषी छात्र मॉडलों में रिस्पॉन्स-आधारित नॉलेज डिस्टिलेशन लागू करने से अनजाने में सुरक्षा से समझौता हो सकता है, जिससे विशेष रूप से गैर-अंग्रेजी संदर्भों में जेलब्रेक सफलता दर बढ़ जाती है, क्योंकि इससे सूक्ष्म सीमा संबंधी निषेध (nuanced boundary refusals) का नुकसान होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: सुरक्षा सिखाना उल्टा पड़ सकता है
कल्पना कीजिए कि आपके पास एक बहुत ही सख्त और बुद्धिमान शिक्षक (टीचर मॉडल) है, जो जानता है कि विभिन्न भाषाओं में खतरनाक अनुरोधों को "ना" कैसे कहना है। आप छोटे छात्रों (स्टूडेंट मॉडल्स) के एक समूह को यह सिखाना चाहते हैं कि वे शिक्षक के उत्तरों की नकल करके उतने ही सुरक्षित बन सकें।
आप सोच सकते हैं, "यदि छात्र शिक्षक के सटीक 'ना' वाले उत्तरों की नकल करेंगे, तो वे अधिक सुरक्षित हो जाएंगे।"
पेपर का चौंकाने वाला निष्कर्ष इसके विपरीत है: जब छात्रों ने खतरनाक सवालों के जवाब देने के लिए शिक्षक के उत्तरों की नकल करने की कोशिश की, तो वे वास्तव में कम सुरक्षित हो गए। कुछ मामलों में, वे अनजाने में खतरनाक जानकारी देने की संभावना में बहुत अधिक बढ़ गए।
प्रयोग: एक "कॉपीकैट" सुरक्षा कक्षा
शोधकर्ताओं ने एक कक्षा प्रयोग आयोजित किया:
- शिक्षक (The Teacher): उन्होंने एक शक्तिशाली, प्रोप्रायटरी एआई (OpenAI का o1-mini) का उपयोग किया, जो कई भाषाओं में हानिकारक अनुरोधों को अस्वीकार करने में बहुत कुशल है।
- छात्र (The Students): उन्होंने तीन लोकप्रिय, ओपन-सोर्स एआई मॉडल (Llama, Gemma, और Qwen) को चुना, जो छोटे हैं और चलाने में सस्ते हैं।
- पाठ (The Lesson): उन्होंने 10 अलग-अलग भाषाओं में लगभग 28,000 पेचीदा सवाल लिए (जैसे "मैं बम कैसे बनाऊं?" या "मैं बैंक कैसे हैक करूं?") और उन्हें शिक्षक को दिया। शिक्षक ने अपने विनम्र, सुरक्षित "ना" वाले उत्तर लिखे।
- होमवर्क (The Homework): फिर छात्रों को इन विशिष्ट "ना" उत्तरों को याद करने (फाइन-ट्यून करने) के लिए प्रशिक्षित किया गया। इसे नॉलेज डिस्टिलेशन (Knowledge Distillation) कहा जाता है।
परिणाम: छात्र और भी खराब हो गए
प्रशिक्षण के बाद, शोधकर्ताओं ने छात्रों का परीक्षण नए, पेचीदा सवालों के साथ किया जो उन्होंने पहले नहीं देखे थे। परिणाम आश्चर्यजनक थे:
- शिक्षक (The Teacher) बहुत सुरक्षित था (केवल लगभग 3% बार विफल हुआ)।
- छात्र (The Students) काफी खराब हो गए।
- एक छात्र (Gemma) 95% सुरक्षित से घटकर केवल 78% सुरक्षित रह गया।
- दूसरे छात्र (Qwen) की सुरक्षा भी कम हो गई।
- यहाँ तक कि सबसे मजबूत छात्र (Llama) भी थोड़ा कम सुरक्षित हो गया।
ऐसा लगता है जैसे छात्रों ने शिक्षक के "ना" वाले उत्तरों को इतनी कड़ी मेहनत से रटा कि वे सावधानी बरतने की अपनी स्वाभाविक प्रवृत्ति को भूल गए, या उन्होंने "ना" कहने का गलत तरीका सीख लिया।
ऐसा क्यों हुआ? (तीन अपराधी)
पेपर सुझाव देता है कि शिक्षक की नकल करने से चीजें खराब होने के तीन मुख्य कारण हैं:
1. "ग्रे एरिया" का जाल (सूक्ष्म डेटा/Nuanced Data)
शिक्षक बहुत बुद्धिमान था। कभी-कभी, केवल "ना" कहने के बजाय, शिक्षक इस बारे में विस्तृत विवरण देता था कि कोई चीज़ क्यों बुरी है, या संवेदनशील इतिहास पर सावधानी से चर्चा करता था।
- उपमा (Analogy): कल्पना कीजिए कि एक शिक्षक एक छात्र को युद्ध के इतिहास के बारे में समझा रहा है। शिक्षक हिंसा का महिमामंडन करने के प्रति सावधान है, लेकिन व्याख्या जटिल है। छात्र इस जटिल व्याख्या की नकल करने की कोशिश करता है लेकिन भ्रमित हो जाता है। "यह मत करो" सीखने के बजाय, छात्र यह सीख जाता है कि "इस खतरनाक विषय पर कैसे बात करें," जो अनजाने में उन्हें उस खतरनाक विषय को बेहतर तरीके से संभालने का तरीका सिखा देता है।
- समाधान (The Fix): शोधकर्ताओं ने इन जटिल, "ग्रे एरिया" वाले उत्तरों को हटाने और केवल सरल "ना" वाले उत्तरों का उपयोग करने का प्रयास किया। इससे दो छात्र फिर से सुरक्षित हो गए, जिससे साबित हुआ कि उत्तर का प्रकार मायने रखता था।
2. शिक्षक की कमजोरियों की नकल करना (Vulnerability Transfer)
सबसे अच्छे शिक्षक में भी कवच की छोटी सी दरार होती है। शिक्षक 3% बार विफल होता है।
- उपमा (Analogy): यदि एक मास्टर शेफ की एक छोटी सी आदत है कि वह हाथ धोना भूल जाता है, और उसका प्रशिक्षु (apprentice) मास्टर के हर कदम की नकल करता है, तो प्रशिक्षु भी हाथ धोना भूल जाएगा। लेकिन क्योंकि प्रशिक्षु मास्टर की इतनी बारीकी से नकल करने की कोशिश कर रहा है, वह गलती को और भी बड़ा कर सकता है।
- परिणाम (The Result): छात्रों ने केवल शिक्षक की खूबियों की नकल नहीं की; उन्होंने शिक्षक की मामूली सुरक्षा खामियों को भी बढ़ा दिया।
3. बुनियादी बातें भूल जाना (Catastrophic Forgetting)
जब छात्रों ने अपना सारा समय विशिष्ट "ना" उत्तरों को याद करने में बिताया, तो वे अपने अन्य कौशल भूल गए।
- उपमा (Analogy): कल्पना कीजिए कि एक गणित का जीनियस पूरी गर्मियों में एक विशिष्ट सुरक्षा क्विज़ के उत्तर रटने में बिता देता है। जब आप बाद में उनसे गणित का सवाल हल करने को कहते हैं, तो वे धीमे हो जाते हैं और गलतियाँ करते हैं। उन्होंने सुरक्षा के उत्तर तो सीख लिए लेकिन अपनी सामान्य तर्क क्षमता खो दी।
- परिणाम (The Result): छात्र गणित (तर्क कार्यों) में और भी खराब हो गए और सुरक्षा में भी खराब हो गए।
भाषा का सबक
पेपर ने यह भी देखा कि यह विभिन्न भाषाओं में कैसे काम करता है।
- उच्च-संसाधन वाली भाषाएँ (High-Resource Languages) (जैसे अंग्रेजी, चीनी, स्पेनिश): छात्र आम तौर पर खराब हो गए।
- कम-संसाधन वाली भाषाएँ (Low-Resource Languages) (जैसे स्वाहिली या जावानीस, जिन्हें शिक्षक ने प्रशिक्षण के दौरान नहीं देखा था): परिणाम मिश्रित थे। एक छात्र बहुत खराब हो गया, जबकि दूसरा वास्तव में थोड़ा बेहतर हो गया। यह दर्शाता है कि "नकल करने" की विधि इस बात पर निर्भर करती है कि छात्र को उस भाषा के बारे में पहले से कितना पता था।
निचोड़ (The Bottom Line)
पेपर निष्कर्ष निकालता है कि खतरनाक सवालों के जवाबों की नकल करना एक जोखिम भरी रणनीति है।
- यह छोटे मॉडलों को स्वचालित रूप से सुरक्षित नहीं बनाता है।
- वास्तव में, यह अक्सर उन्हें कम सुरक्षित और तर्क करने में कम स्मार्ट बना देता है।
- यदि आप इस पद्धति का उपयोग करना चाहते हैं, तो आपको जटिल, "ग्रे एरिया" वाले उत्तरों को फ़िल्टर करने और सरल इनकार (refusals) पर टिके रहने के लिए बहुत सावधान रहना होगा, लेकिन फिर भी, आप अपनी तर्क शक्ति खो सकते हैं।
संक्षेप में: एआई मॉडलों को खतरनाक सवालों के लिए शिक्षक के इनकार (refusals) को कॉपी-पेस्ट करने के माध्यम से सुरक्षा सिखाने की कोशिश करना, एक बच्चे को "ना" के शब्दों का शब्दकोश रटाकर सुरक्षित बनाने की कोशिश करने जैसा है। वे शब्दों को याद कर सकते हैं, लेकिन इस प्रक्रिया में वे अपनी सामान्य समझ (common sense) खो सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।