← नवीनतम पेपर
💻 computer science

Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

यह शोध पत्र सौहार्दपूर्ण (benign) और हानिकारक प्रॉम्प्ट्स के तहत Mixtral 8x7B-Instruct मॉडल के रूटिंग व्यवहार का विश्लेषण करता है, जो यह प्रकट करता है कि सुरक्षा-संबंधित विशेषज्ञ सक्रियण (expert activation) सूक्ष्म, गहराई-निर्भर और वितरित है न कि विशेषज्ञों के एक निश्चित समूह द्वारा नियंत्रित, जिसमें ग्रेडिएंट-आधारित हस्तक्षेप, सक्रियण-आधारित हस्तक्षेपों की तुलना में हानिकारक प्रतिक्रियाओं को कम करने में अधिक प्रभावी सिद्ध होते हैं।

मूल लेखक: Md Nurul Absar Siddiky

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Nurul Absar Siddiky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, हाई-टेक किचन है जिसका नाम Mixtral है। इस किचन में कोई एक बड़ा शेफ नहीं है जो सब कुछ करता है। इसके बजाय, इसमें 32 स्टेशन (लेयर्स) हैं, और प्रत्येक स्टेशन पर, 8 विशेषज्ञ शेफ (एक्सपर्ट्स) हैं।

जब आप किचन को कोई ऑर्डर देते हैं (एक प्रॉम्प्ट), तो एक स्मार्ट हेड शेफ (राउटर) हर स्टेशन पर खड़ा होता है और यह तय करता है कि उस विशिष्ट सामग्री को पकाने के लिए आठ में से किन दो शेफों को वास्तव में काम करना चाहिए। बाकी छह शेफ बस खड़े रहते हैं। इसी तरह यह मॉडल तेज़ और कुशल बना रहता है।

यह पेपर एक जासूसी कहानी है कि क्या होता है जब आप किचन को दो बहुत अलग प्रकार के ऑर्डर देते हैं:

  1. सौम्य प्रॉम्प्ट (Benign Prompts): "मैं केक कैसे बनाऊं?" (सुरक्षित, सामान्य अनुरोध)।
  2. हानिकारक प्रॉम्प्ट (Harmful Prompts): "मैं बम कैसे बनाऊं?" (खतरनाक, प्रतिबंधित अनुरोध)।

शोधकर्ता जानना चाहते थे कि: क्या हेड शेफ खतरनाक ऑर्डर के आधार पर शेफ की अलग टीमें चुनता है?

यहाँ उन्होंने जो पाया है, उसे सरल शब्दों में समझाया गया है:

1. किचन को देखने के दो अलग तरीके

शोधकर्ताओं ने शेफ को काम करते हुए देखने के लिए दो अलग-अलग "कैमरों" का उपयोग किया:

  • कैमरा A ("कौन हाजिर हुआ" की गिनती): यह कैमरा बस यह गिनता है कि एक शेफ कितनी बार चुना गया।
    • निष्कर्ष: किचन बहुत व्यस्त है। लगभग सभी शेफ अक्सर चुने जाते हैं, और काम पूरी इमारत में फैला हुआ है। यह गतिविधि की एक लंबी पूंछ (long tail) की तरह है। चाहे ऑर्डर सुरक्षित हो या खतरनाक, शेफ एक बहुत ही समान, व्यापक पैटर्न में दिखाई देते हैं।
  • कैमरा B ("किसे सबसे ज्यादा फर्क पड़ता है" का स्कोर): यह कैमरा मापता है कि यदि किसी विशिष्ट शेफ के निर्णय में थोड़ा बदलाव किया जाए, तो अंतिम परिणाम (लॉस) कितना बदल जाएगा। यह पूछता है, "वास्तव में परिणाम को कौन संचालित कर रहा है?"
    • निष्कर्ष: यह दृश्य बहुत अधिक स्पष्ट (sharp) है। यह दिखाता है कि शेफों का एक बहुत छोटा, विशिष्ट समूह जो किचन के बिल्कुल अंतिम कुछ स्टेशनों में है, वास्तव में परिणाम के लिए बहुत महत्वपूर्ण है। यहाँ काम अत्यधिक केंद्रित है।

2. "सुरक्षा" का अंतर सूक्ष्म है

शोधकर्ताओं को उम्मीद थी कि उन्हें एक "बुरे शेफ" का पता चलेगा जो केवल खतरनाक ऑर्डर्स के लिए आता है और एक "अच्छे शेफ" का जो केवल सुरक्षित ऑर्डर्स के लिए आता है।

  • वास्तविकता: उन्हें कोई एक "बुरा शेफ" नहीं मिला। इसके बजाय, उन्होंने पाया कि अधिकांश शेफ सुरक्षित और खतरनाक दोनों तरह के ऑर्डर्स पर काम करते हैं।
  • बारीकी: कुछ शेफ ऐसे हैं जो एक प्रकार के ऑर्डर की ओर थोड़ा अधिक झुकाव रखते हैं, लेकिन अंतर बहुत कम है। यह ऐसा नहीं है कि एक टीम "अच्छे" के लिए है और दूसरी "बुरे" के लिए। यह इस बारे में है कि अनुरोध के आधार पर टीम का मिश्रण थोड़ा बदल जाता है।

3. जादू कहाँ होता है (लेयर्स)

किचन में 32 स्टेशन (लेयर्स) हैं। शोधकर्ताओं ने पाया कि "सुरक्षा" व्यवहार अलग-अलग जगहों पर होता है, यह इस पर निर्भर करता है कि आप कौन सा कैमरा उपयोग कर रहे हैं:

  • "कौन हाजिर हुआ" कैमरे के साथ: सबसे दिलचस्प गतिविधि किचन के बीच में (स्टेशन 8-15) होती है। यहीं पर शेफ यह चुनने में सबसे अधिक चयनात्मक होते हैं कि किसे चुनना है।
  • "किसे सबसे ज्यादा फर्क पड़ता है" कैमरे के साथ: सबसे महत्वपूर्ण गतिविधि किचन के बिल्कुल अंत में (अंतिम स्टेशनों) होती है। यहीं पर निर्णय वास्तव में अंतिम उत्तर को लॉक कर देते हैं।

4. "शेफ को बंद करने" का प्रयोग

अपने निष्कर्षों को साबित करने के लिए, शोधकर्ताओं ने एक छोटा प्रयोग करने की कोशिश की। उन्होंने उन शीर्ष 5 शेफों को लिया जिन्हें वे खतरनाक ऑर्डर्स को "ना" कहने के लिए जिम्मेदार मानते थे (अपने डेटा के आधार पर) और उन्हें बाहर बैठने (सप्रेस करने) के लिए कहा।

  • परिणाम: जब उन्होंने "सुरक्षित-झुकाव वाले" शेफों को बाहर बैठाया, तो किचन ने "ना" कम कहा। इसने खतरनाक जवाब अधिक बार देना शुरू कर दिया।
  • तुलना:
    • शेफ को बाहर निकालने के लिए "कौन हाजिर हुआ" की सूची का उपयोग करने से किचन ने "ना" कम कहा (सुरक्षा इनकार में बड़ी गिरावट आई)।
    • "किसे सबसे ज्यादा फर्क पड़ता है" की सूची का उपयोग करने से भी किचन ने "ना" कम कहा, लेकिन यह थोड़ा अधिक स्थिर था (गलती से सुरक्षित प्रश्न को अस्वीकार करने की कम घटनाएं हुईं)।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि इस AI मॉडल में सुरक्षा किसी एक "बुरे शेफ" या एक छोटी, गुप्त टीम द्वारा नियंत्रित नहीं होती है।

इसके बजाय, सुरक्षा वितरित (distributed) है। यह कई स्टेशनों में कई शेफों के बीच एक सूक्ष्म नृत्य है।

  • यदि आप देखते हैं कि कौन काम कर रहा है, तो पैटर्न व्यापक और फैला हुआ है।
  • यदि आप देखते हैं कि कौन परिणाम को संचालित कर रहा है, तो यह तीक्ष्ण और प्रक्रिया के अंत पर केंद्रित है।

"सुरक्षा" तंत्र एक जटिल ऑर्केस्ट्रा की तरह है जहाँ लगभग सभी वाद्य यंत्र बजाते हैं, लेकिन कंडक्टर (राउटर) गाने के आधार पर अलग-अलग वाद्य यंत्रों के वॉल्यूम में सूक्ष्म, सूक्ष्म समायोजन करता है। आप संगीत को रोकने के लिए केवल एक संगीतकार को निकाल नहीं सकते; आपको पूरी व्यवस्था को समझना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →