MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks
MASCing एक हल्का, रिट्रेनिंग-मुक्त ढांचा है जो विविध सुरक्षा परिदृश्यों के लिए Mixture-of-Experts (MoE) मॉडलों को कॉन्फ़िगर करता है, जिसमें रूटिंग गेट्स पर स्टीयरिंग मास्क को अनुकूलित करने के लिए एक LSTM-आधारित सरोगेट का उपयोग किया जाता है, जिससे सामान्य उपयोगिता से समझौता किए बिना विशिष्ट व्यवहारों के लक्षित संवर्धन या दमन को सक्षम बनाया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़े भाषा मॉडल (जैसे कि चैटबॉट्स को चलाने वाले मॉडल) की कल्पना एक विशाल, हाई-टेक ऑर्केस्ट्रा के रूप में करें।
पुराने मॉडल्स में, हर संगीतकार (पैरामीटर) हर उस नोट के लिए अपना वाद्य यंत्र बजाता था जो मॉडल गाता था। यह शोर भरा, महंगा और धीमा था।
Mixture-of-Experts (MoE) मॉडल्स अलग हैं। ये एक विशाल ऑर्केस्ट्रा की तरह हैं जहाँ, हर नोट के लिए, केवल संगीतकारों का एक छोटा, विशिष्ट समूह ही बुलाया जाता है। बाकी शांत रहते हैं। एक "कंडक्टर" (रूटर) तय करता है कि प्रत्येक शब्द के लिए संगीतकारों के 2 या 4 समूहों में से किसे बजाना है। यह मॉडल को बहुत तेज़ और सस्ता बनाता है।
हालाँकि, इस सिस्टम में एक नई समस्या है: कंडक्टर ही कमज़ोर कड़ी है।
समस्या: "खराब कंडक्टर"
चूँकि एक समय में केवल कुछ ही संगीतकार बजते हैं, इसलिए एक चालाक धोखेबाज (अटैकर) कंडक्टर को गलत संगीतकार समूह को बुलाने के लिए बहलाने की कोशिश कर सकता है।
- परिदृश्य A (जेलब्रेक): धोखेबाज मॉडल से कुछ बुरा करने के लिए कहता है (जैसे बम बनाने की निर्देशिका लिखना)। मॉडल आमतौर पर कहता है, "नहीं, यह खतरनाक है।" लेकिन एक धोखेबाज कई दौरों में घुमावदार तरीके से पूछकर, कंडक्टर को "सुरक्षा" वाले संगीतकारों के बजाय "हानिकारक" संगीतकारों को बुलाने के लिए भ्रमित कर सकता है।
- परिदृश्य B (ओवर-रिफ्यूज़ल/अत्यधिक इनकार): कभी-कभी, मॉडल बहुत अधिक सतर्क हो जाता है। वह एक काल्पनिक खलनायक के बारे में कहानी लिखने से मना कर देता है क्योंकि उसे लगता है कि "खलनायक" का अर्थ "बुरा" है। डेवलपर चाहता होगा कि मॉडल को एक विशिष्ट संदर्भ में वह कहानी लिखने की अनुमति दी जाए, लेकिन कंडक्टर बार-बार "इनकार करने वाले" संगीतकारों को बुलाता रहता है।
आमतौर पर, इसे ठीक करने के लिए, आपको पूरे ऑर्केस्ट्रा को निकालना पड़ता है और नए लोगों को काम पर रखना पड़ता है (रिट्रेनिंग), जिसमें महीनों लग जाते हैं और भारी लागत आती है।
समाधान: MASCing (द "स्मार्ट स्कोर")
यह पेपर MASCing (MoE Activation Steering Configuration) पेश करता है। इसे ऐसे न समझें कि आप ऑर्केस्ट्रा को निकाल रहे हैं, बल्कि यह एक विशेष, पहले से लिखा गया स्कोर (एक स्टीयरिंग मास्क) देने जैसा है जो कंडक्टर को सूक्ष्म रूप से सही काम के लिए सही संगीतकारों को चुनने के लिए प्रेरित करता है, बिना स्वयं संगीतकारों को बदले।
यहाँ MASCing तीन सरल चरणों में काम करता है:
1. "सरोगेट" डिटेक्टिव (पैटर्न को समझना)
सबसे पहले, शोधकर्ता एक छोटे, तेज़ AI (एक LSTM) को एक जासूस (डिटेक्टिव) के रूप में प्रशिक्षित करते हैं। यह जासूस मॉडल के बात करते समय "कंडक्टर" के नोट्स (रूटिंग लॉजिट्स) पर नज़र रखता है।
- यह सीखता है: "जब कंडक्टर इन विशिष्ट नोट्स को देखता है, तो मॉडल आमतौर पर उत्तर देने से इनकार कर देता है।"
- यह भी सीखता है: "जब कंडक्टर इन नोट्स को देखता है, तो मॉडल आमतौर पर कहानी लिखने के लिए सहमत हो जाता है।"
- महत्वपूर्ण बात यह है कि जासूस केवल इस पर नज़र नहीं रखता कि वास्तव में कौन बजा; बल्कि यह उन संभावित नोट्स को भी देखता है जिन पर कंडक्टर विचार कर रहा था, जिससे सारी छिपी हुई जानकारी सुरक्षित रहती है।
2. "सेफ्टी सर्किट" खोजना (द मास्क)
इसके बाद, जासूस यह पता लगाता है कि वांछित परिणाम प्राप्त करने के लिए कंडक्टर के स्कोर के किन नोट्स में बदलाव करने की आवश्यकता है।
- यदि हम किसी बुरे उत्तर को रोकना चाहते हैं, तो जासूस उन नोट्स को ढूँढता है जो "सुरक्षा" की ओर ले जाते हैं और उन्हें बढ़ावा देता है, जबकि "हानि" की ओर ले जाने वाले नोट्स को कम करता है।
- यदि हम किसी विशिष्ट उत्तर (जैसे सुरक्षित संदर्भ में वयस्क सामग्री) की अनुमति देना चाहते हैं, तो यह उन नोट्स को ढूँढता है जो "इनकार" की ओर ले जाते हैं और उन्हें कम करता है, जबकि "अनुपालन" (compliance) वाले नोट्स को बढ़ावा देता है।
इससे एक स्टीयरिंग मास्क बनता है। इसे एक हाइलाइटर पेन की तरह समझें जो कंडक्टर के संगीत के पन्नों पर विशिष्ट स्थानों को चिह्नित करता है। यह संगीत को नहीं बदलता; यह बस कंडक्टर को बताता है, "हे, इन विशिष्ट नोट्स पर विशेष ध्यान दें।"
3. प्रदर्शन (इन्फरेंस)
जब मॉडल वास्तव में चल रहा होता है, तो सिस्टम इस मास्क को वास्तविक समय (real-time) में लागू करता है।
- कंडक्टर नोट्स को देखता है।
- मास्क नोट्स में एक सूक्ष्म "धक्का" (nudge) जोड़ता है।
- कंडक्टर, इस धक्के से प्रभावित होकर, हानिकारक संगीतकारों के बजाय "सुरक्षा" वाले संगीतकारों को चुनता है (या इसके विपरीत)।
उन्होंने क्या हासिल किया?
शोधकर्ताओं ने सात अलग-अलग MoE मॉडल्स पर दो बहुत अलग लक्ष्यों के साथ MASCing का परीक्षण किया:
जेलब्रेक को रोकना (द शील्ड): उन्होंने मॉडल्स को उन धोखेबाजों का मुकाबला करने में बेहतर बनाने के लिए MASCing का उपयोग किया जो लंबी बातचीत के दौरान मॉडल को कुछ बुरा कहने के लिए बहलाने की कोशिश करते हैं।
- परिणाम: मॉडल्स ने बुरे अनुरोधों को रोकने की क्षमता 52% से बढ़ाकर 84% कर दी।
- उपमा: कंडक्टर को "बुरे" संगीतकारों को बुलाने के लिए धोखा देना बहुत कठिन हो गया।
विशिष्ट सामग्री की अनुमति देना (द की): उन्होंने मॉडल्स को ऐसी वयस्क सामग्री के लिए अनुरोधों को स्वीकार करने में कम हिचकिचाने के लिए MASCing का उपयोग किया जो वास्तव में नीति के अनुसार अनुमत है।
- परिणाम: मॉडल्स ने ऐसी कहानियाँ लिखने के लिए सहमत होने की दर 52% से बढ़ाकर 82% कर दी।
- उपमा: कंडक्टर अब घबराकर "इनकार करने वाले" संगीतकारों को नहीं बुलाता, जिससे "रचनात्मक" संगीतकारों को खेलने की अनुमति मिलती है।
यह क्यों विशेष है?
- कोई री-ट्रेनिंग नहीं: आपको पूरे ऑर्केस्ट्रा को फिर से सिखाने की ज़रूरत नहीं है। आप बस स्कोर (मास्क) बदल देते हैं।
- तेज़: "जासूस" को प्रशिक्षित करने में एक शक्तिशाली कंप्यूटर पर लगभग 5 मिनट लगते हैं। मास्क लागू करने में लगभग कोई समय नहीं लगता।
- लचीला: आप मास्क को तुरंत बदल सकते हैं। यदि कल नियम बदल जाते हैं, तो आप बस एक नया मास्क बना सकते हैं।
- सुरक्षित: यह गणित करने या सामान्य ईमेल लिखने की मॉडल की क्षमता को नहीं तोड़ता है। यह केवल निर्णय लेने की प्रक्रिया के "सुरक्षा" वाले हिस्से को ट्यून करता है।
संक्षेप में, MASCing एक हल्का, त्वरित तरीका है जिससे आप एक स्मार्ट AI को कह सकते हैं, "इस विशिष्ट स्थिति के लिए, कृपया विशेषज्ञों के एक अलग समूह को सुनें," बिना AI को शुरू से बनाए बिना।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।