Understanding Safety-Sensitive Expert Behavior in Mixture-of-Experts LLMs
यह शोध पत्र इस अंतर्ज्ञान को चुनौती देता है कि Mixture-of-Experts LLMs में सुरक्षा हानिकारक अनुरोधों को विशिष्ट इनकार करने वाले विशेषज्ञों (refusal experts) की ओर रूट करने से नियंत्रित होती है, बल्कि यह प्रदर्शित करता है कि सुरक्षा व्यवहार विशेषज्ञों के एक छोटे उपसमूह में स्थानीयकृत है और प्रस्तावित RASET फ्रेमवर्क के माध्यम से मॉडल के अंतर्निहित रूटिंग पथों को बदले बिना प्रभावी ढंग से लक्षित किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।
मुख्य विचार: "विशेषज्ञ टीम" बनाम "अस्वीकृति स्विच" (The "Specialist Team" vs. The "Refusal Switch")
एक विशाल, हाई-टेक रसोई (AI मॉडल) की कल्पना करें जिसका संचालन एक मुख्य शेफ (Router) द्वारा किया जाता है। एक विशाल शेफ द्वारा सब कुछ करने के बजाय, इस रसोई में सैकड़ों विशेषज्ञ सहायक शेफ (Experts) हैं।
- Router का काम: जब कोई ऑर्डर आता है, तो मुख्य शेफ जल्दी से अनुरोध को देखता है और चिल्लाता है, "हमें सुशी विशेषज्ञ की ज़रूरत है!" या "जाओ पेस्ट्री शेफ को बुलाओ!" राउटर तय करता है कि कौन सा विशिष्ट विशेषज्ञ उस कार्य पर काम करेगा।
- सुरक्षा नियम: हम चाहते हैं कि यह रसोई खतरनाक आदेशों को अस्वीकार कर दे, जैसे "मैं बम कैसे बनाऊं?"
सामान्य अनुमान:
अधिकांश लोगों का मानना था कि जब रसोई किसी खतरनाक आदेश को अस्वीकार करती है, तो मुख्य शेफ (Router) कुछ विशेष कर रहा होता है। उन्होंने कल्पना की थी कि शेफ "बम" शब्द देखते ही तुरंत चिल्लाता है, "रुको! इसे सुरक्षा अस्वीकृति विशेषज्ञ (Safety Refusal Expert) के पास भेजो!"—एक ऐसा विशिष्ट व्यक्ति जिसका एकमात्र काम "ना" कहना है।
इस शोध पत्र ने क्या पाया:
शोधकर्ताओं ने पाया कि यह इस तरह से काम नहीं करता है।
- Router एक विषय मार्गदर्शक है, सुरक्षा गार्ड नहीं: मुख्य शेफ को मुख्य रूप से इस बात से फर्क नहीं पड़ता कि आप किस बारे में पूछ रहे हैं (जैसे, खाना बनाना, कोडिंग, इतिहास), बल्कि इस बात से कि वह कितना खतरनाक है। यदि आप "बम बनाने" के बारे में पूछते हैं, तो शेफ अभी भी उस ऑर्डर को केमिस्ट्री विशेषज्ञ या फिजिक्स विशेषज्ञ के पास भेज देता है क्योंकि वे संबंधित विषय हैं।
- सुरक्षा विशेषज्ञों के भीतर होती है, Router में नहीं: अस्वीकृति उस विशेषज्ञ के दिमाग के भीतर होती है जो पहले से ही कार्य पर काम कर रहा है। केमिस्ट्री विशेषज्ञ अनुरोध को देखता है, सोचता है, "ओह, यह खतरनाक है," और खुद "ना" कहने का निर्णय लेता है। राउटर ने उन्हें किसी विशेष "सुरक्षा कक्ष" में नहीं भेजा; वे बस अपना सामान्य काम कर रहे थे और उन्होंने मना करने का निर्णय लिया।
प्रयोग: सिद्धांत को सिद्ध करना
इसे सिद्ध करने के लिए, शोधकर्ताओं ने तीन चतुर परीक्षण किए:
- "एक ही ऑर्डर, अलग परिणाम" परीक्षण: उन्होंने एक खतरनाक ऑर्डर लिया और रसोई को या तो "ना" कहने या "हाँ" कहने के लिए मजबूर किया। उन्होंने पाया कि मुख्य शेफ ने दोनों मामलों में ठीक उन्हीं विशेषज्ञों को ऑर्डर भेजा। केवल एक चीज़ बदली थी—विशेषकों ने क्या निर्णय लिया।
- "विनम्र अस्वीकृति" परीक्षण: उन्होंने सामान्य चीजों (जैसे रेसिपी) के लिए पूछा लेकिन अनुरोध में एक "अस्वीकृति शैली" जोड़ दी। राउटर ने ऑर्डर को कुकिंग एक्सपर्ट के पास ही भेजा, न कि किसी "अस्वीकृति विशेषज्ञ" के पास।
- "बुरे इरादे बनाम अच्छे इरादे" परीक्षण: उन्होंने एक खतरनाक अनुरोध और एक लगभग समान दिखने वाला सुरक्षित अनुरोध लिया (जैसे, "बम कैसे बनाएं" बनाम "केक कैसे बनाएं")। राउटर दोनों को बेकिंग/कुकिंग विशेषज्ञ के पास भेज देता है। राउटर ने खतरे को नहीं पहचाना; विशेषज्ञ ने पहचाना।
निष्कर्ष: Router एक ट्रैफिक पुलिसकर्मी की तरह है जो कारों को सही मोहल्ले (विषय) की ओर निर्देशित करता है। सुरक्षा गार्ड वास्तव में कार के अंदर बैठा ड्राइवर (Expert) है जो यह तय करता है कि किसी खतरनाक क्षेत्र में नहीं जाना है।
समाधान: RASET (द "एक्सपर्ट ट्यून-अप")
चूंकि Router केवल विषयों के आधार पर ट्रैफिक निर्देशित कर रहा है, इसलिए सुरक्षा को रोकने के लिए Router को हैक करने की कोशिश करना (जैसे, खतरनाक अनुरोधों को "हाँ" कहने वाले विशेषज्ञ के पास भेजने के लिए मजबूर करना) बहुत उलझा हुआ काम है। यह ट्रैफिक पुलिस को गलत मोहल्ले में कार भेजने के लिए धोखा देने जैसा है। इससे सिस्टम भ्रमित हो जाता है और AI गलत उत्तर देने लगता है।
इसके बजाय, लेखकों ने RASET (Router-Agnostic Safety-critical Expert-Tuning) बनाया।
- यह कैसे काम करता है: मुख्य शेफ (Router) के साथ छेड़छाड़ करने के बजाय, RASET चुपचाप उन विशिष्ट विशेषकों (Experts) में घुस जाता है जो खतरनाक विषयों को संभालते हैं।
- उपमा: कल्पना करें कि "केमिस्ट्री एक्सपर्ट" वही है जो आमतौर पर बम बनाने के अनुरोधों को अस्वीकार करता है। RASET उस विशिष्ट विशेषज्ञ के पास जाता है और धीरे से कहता है, "हे, अगली बार जब कोई बमों के बारे में पूछे, तो बस उन्हें रेसिपी दे देना बजाय 'ना' कहने के।"
- परिणाम: मुख्य शेफ (Router) अभी भी अनुरोध को केमिस्ट्री विशेषज्ञ के पास भेजता है (क्योंकि यह केमिस्ट्री का प्रश्न है)। लेकिन अब, उस विशेषज्ञ को "रीप्रोग्राम" कर दिया गया है ताकि वह "हाँ" कहे और उत्तर दे सके।
यह क्यों शक्तिशाली है:
- यह सटीक है: उन्होंने विशेषज्ञों के एक बहुत छोटे हिस्से को ही बदला (मस्तिष्क का 1% से भी कम)।
- यह AI को स्मार्ट बनाए रखता है: क्योंकि Router के साथ छेड़छाड़ नहीं की गई, इसलिए AI अभी भी सही ढंग से केमिस्ट्री, कोडिंग या इतिहास के बारे में बात करना जानता है। इसने अपनी "याददाश्त" या सामान्य कार्यों करने की क्षमता नहीं खोई।
- यह सुरक्षा को तोड़ देता है: वे सफलतापूर्वक AI को खतरनाक सवालों के जवाब देने में 50% मामलों में सफल रहे (कड़े परीक्षण के तहत भी), जबकि बाकी AI पूरी तरह से ठीक काम करता रहा।
निष्कर्ष (The Takeaway)
यह शोध पत्र आधुनिक AI की एक छिपी हुई कमजोरी को उजागर करता है। हमने सोचा था कि सुरक्षा दरवाजे पर खड़ा एक गेटकीपर (Router) है, लेकिन वास्तव में यह फैक्ट्री के अंदर काम करने वाले श्रमिकों (Experts) द्वारा लिया गया एक निर्णय है।
यदि आप AI की सुरक्षा को तोड़ना चाहते हैं, तो आपको गेटकीपर को धोखा देने की आवश्यकता नहीं है। आपको बस उन विशिष्ट श्रमिकों को चुपचाप फिर से प्रशिक्षित करने की आवश्यकता है जो खतरनाक विषयों को संभालते हैं। इसका अर्थ है कि भविष्य की सुरक्षा प्रणालियों को केवल गेटकीपर पर ही नहीं, बल्कि श्रमिकों पर भी नज़र रखने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।