← नवीनतम पेपर
💻 computer science

Understanding Safety-Sensitive Expert Behavior in Mixture-of-Experts LLMs

यह शोध पत्र इस अंतर्ज्ञान को चुनौती देता है कि Mixture-of-Experts LLMs में सुरक्षा हानिकारक अनुरोधों को विशिष्ट इनकार करने वाले विशेषज्ञों (refusal experts) की ओर रूट करने से नियंत्रित होती है, बल्कि यह प्रदर्शित करता है कि सुरक्षा व्यवहार विशेषज्ञों के एक छोटे उपसमूह में स्थानीयकृत है और प्रस्तावित RASET फ्रेमवर्क के माध्यम से मॉडल के अंतर्निहित रूटिंग पथों को बदले बिना प्रभावी ढंग से लक्षित किया जा सकता है।

मूल लेखक: Zhibo Zhang, Yuxi Li, Zhen Ouyang, Ling Shi, Kailong Wang

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhibo Zhang, Yuxi Li, Zhen Ouyang, Ling Shi, Kailong Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

मुख्य विचार: "विशेषज्ञ टीम" बनाम "अस्वीकृति स्विच" (The "Specialist Team" vs. The "Refusal Switch")

एक विशाल, हाई-टेक रसोई (AI मॉडल) की कल्पना करें जिसका संचालन एक मुख्य शेफ (Router) द्वारा किया जाता है। एक विशाल शेफ द्वारा सब कुछ करने के बजाय, इस रसोई में सैकड़ों विशेषज्ञ सहायक शेफ (Experts) हैं।

  • Router का काम: जब कोई ऑर्डर आता है, तो मुख्य शेफ जल्दी से अनुरोध को देखता है और चिल्लाता है, "हमें सुशी विशेषज्ञ की ज़रूरत है!" या "जाओ पेस्ट्री शेफ को बुलाओ!" राउटर तय करता है कि कौन सा विशिष्ट विशेषज्ञ उस कार्य पर काम करेगा।
  • सुरक्षा नियम: हम चाहते हैं कि यह रसोई खतरनाक आदेशों को अस्वीकार कर दे, जैसे "मैं बम कैसे बनाऊं?"

सामान्य अनुमान:
अधिकांश लोगों का मानना था कि जब रसोई किसी खतरनाक आदेश को अस्वीकार करती है, तो मुख्य शेफ (Router) कुछ विशेष कर रहा होता है। उन्होंने कल्पना की थी कि शेफ "बम" शब्द देखते ही तुरंत चिल्लाता है, "रुको! इसे सुरक्षा अस्वीकृति विशेषज्ञ (Safety Refusal Expert) के पास भेजो!"—एक ऐसा विशिष्ट व्यक्ति जिसका एकमात्र काम "ना" कहना है।

इस शोध पत्र ने क्या पाया:
शोधकर्ताओं ने पाया कि यह इस तरह से काम नहीं करता है।

  1. Router एक विषय मार्गदर्शक है, सुरक्षा गार्ड नहीं: मुख्य शेफ को मुख्य रूप से इस बात से फर्क नहीं पड़ता कि आप किस बारे में पूछ रहे हैं (जैसे, खाना बनाना, कोडिंग, इतिहास), बल्कि इस बात से कि वह कितना खतरनाक है। यदि आप "बम बनाने" के बारे में पूछते हैं, तो शेफ अभी भी उस ऑर्डर को केमिस्ट्री विशेषज्ञ या फिजिक्स विशेषज्ञ के पास भेज देता है क्योंकि वे संबंधित विषय हैं।
  2. सुरक्षा विशेषज्ञों के भीतर होती है, Router में नहीं: अस्वीकृति उस विशेषज्ञ के दिमाग के भीतर होती है जो पहले से ही कार्य पर काम कर रहा है। केमिस्ट्री विशेषज्ञ अनुरोध को देखता है, सोचता है, "ओह, यह खतरनाक है," और खुद "ना" कहने का निर्णय लेता है। राउटर ने उन्हें किसी विशेष "सुरक्षा कक्ष" में नहीं भेजा; वे बस अपना सामान्य काम कर रहे थे और उन्होंने मना करने का निर्णय लिया।

प्रयोग: सिद्धांत को सिद्ध करना

इसे सिद्ध करने के लिए, शोधकर्ताओं ने तीन चतुर परीक्षण किए:

  1. "एक ही ऑर्डर, अलग परिणाम" परीक्षण: उन्होंने एक खतरनाक ऑर्डर लिया और रसोई को या तो "ना" कहने या "हाँ" कहने के लिए मजबूर किया। उन्होंने पाया कि मुख्य शेफ ने दोनों मामलों में ठीक उन्हीं विशेषज्ञों को ऑर्डर भेजा। केवल एक चीज़ बदली थी—विशेषकों ने क्या निर्णय लिया।
  2. "विनम्र अस्वीकृति" परीक्षण: उन्होंने सामान्य चीजों (जैसे रेसिपी) के लिए पूछा लेकिन अनुरोध में एक "अस्वीकृति शैली" जोड़ दी। राउटर ने ऑर्डर को कुकिंग एक्सपर्ट के पास ही भेजा, न कि किसी "अस्वीकृति विशेषज्ञ" के पास।
  3. "बुरे इरादे बनाम अच्छे इरादे" परीक्षण: उन्होंने एक खतरनाक अनुरोध और एक लगभग समान दिखने वाला सुरक्षित अनुरोध लिया (जैसे, "बम कैसे बनाएं" बनाम "केक कैसे बनाएं")। राउटर दोनों को बेकिंग/कुकिंग विशेषज्ञ के पास भेज देता है। राउटर ने खतरे को नहीं पहचाना; विशेषज्ञ ने पहचाना।

निष्कर्ष: Router एक ट्रैफिक पुलिसकर्मी की तरह है जो कारों को सही मोहल्ले (विषय) की ओर निर्देशित करता है। सुरक्षा गार्ड वास्तव में कार के अंदर बैठा ड्राइवर (Expert) है जो यह तय करता है कि किसी खतरनाक क्षेत्र में नहीं जाना है।

समाधान: RASET (द "एक्सपर्ट ट्यून-अप")

चूंकि Router केवल विषयों के आधार पर ट्रैफिक निर्देशित कर रहा है, इसलिए सुरक्षा को रोकने के लिए Router को हैक करने की कोशिश करना (जैसे, खतरनाक अनुरोधों को "हाँ" कहने वाले विशेषज्ञ के पास भेजने के लिए मजबूर करना) बहुत उलझा हुआ काम है। यह ट्रैफिक पुलिस को गलत मोहल्ले में कार भेजने के लिए धोखा देने जैसा है। इससे सिस्टम भ्रमित हो जाता है और AI गलत उत्तर देने लगता है।

इसके बजाय, लेखकों ने RASET (Router-Agnostic Safety-critical Expert-Tuning) बनाया।

  • यह कैसे काम करता है: मुख्य शेफ (Router) के साथ छेड़छाड़ करने के बजाय, RASET चुपचाप उन विशिष्ट विशेषकों (Experts) में घुस जाता है जो खतरनाक विषयों को संभालते हैं।
  • उपमा: कल्पना करें कि "केमिस्ट्री एक्सपर्ट" वही है जो आमतौर पर बम बनाने के अनुरोधों को अस्वीकार करता है। RASET उस विशिष्ट विशेषज्ञ के पास जाता है और धीरे से कहता है, "हे, अगली बार जब कोई बमों के बारे में पूछे, तो बस उन्हें रेसिपी दे देना बजाय 'ना' कहने के।"
  • परिणाम: मुख्य शेफ (Router) अभी भी अनुरोध को केमिस्ट्री विशेषज्ञ के पास भेजता है (क्योंकि यह केमिस्ट्री का प्रश्न है)। लेकिन अब, उस विशेषज्ञ को "रीप्रोग्राम" कर दिया गया है ताकि वह "हाँ" कहे और उत्तर दे सके।

यह क्यों शक्तिशाली है:

  • यह सटीक है: उन्होंने विशेषज्ञों के एक बहुत छोटे हिस्से को ही बदला (मस्तिष्क का 1% से भी कम)।
  • यह AI को स्मार्ट बनाए रखता है: क्योंकि Router के साथ छेड़छाड़ नहीं की गई, इसलिए AI अभी भी सही ढंग से केमिस्ट्री, कोडिंग या इतिहास के बारे में बात करना जानता है। इसने अपनी "याददाश्त" या सामान्य कार्यों करने की क्षमता नहीं खोई।
  • यह सुरक्षा को तोड़ देता है: वे सफलतापूर्वक AI को खतरनाक सवालों के जवाब देने में 50% मामलों में सफल रहे (कड़े परीक्षण के तहत भी), जबकि बाकी AI पूरी तरह से ठीक काम करता रहा।

निष्कर्ष (The Takeaway)

यह शोध पत्र आधुनिक AI की एक छिपी हुई कमजोरी को उजागर करता है। हमने सोचा था कि सुरक्षा दरवाजे पर खड़ा एक गेटकीपर (Router) है, लेकिन वास्तव में यह फैक्ट्री के अंदर काम करने वाले श्रमिकों (Experts) द्वारा लिया गया एक निर्णय है।

यदि आप AI की सुरक्षा को तोड़ना चाहते हैं, तो आपको गेटकीपर को धोखा देने की आवश्यकता नहीं है। आपको बस उन विशिष्ट श्रमिकों को चुपचाप फिर से प्रशिक्षित करने की आवश्यकता है जो खतरनाक विषयों को संभालते हैं। इसका अर्थ है कि भविष्य की सुरक्षा प्रणालियों को केवल गेटकीपर पर ही नहीं, बल्कि श्रमिकों पर भी नज़र रखने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →