RARE: Decoupling Representation Steering from Expert Routing in Mixture-of-Experts Language Models
यह शोध पत्र RARE को प्रस्तुत करता है, जो एक राउटर-अज्ञेय (router-agnostic) ढांचा है जो व्यवहार संबंधी विक्षोभों (behavioral perturbations) को राउटर के नुल स्पेस (null space) पर प्रोजेक्ट करके मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल्स में विशेषज्ञ रूटिंग से रिप्रेजेंटेशन स्टीयरिंग को अलग करता है, जिससे मॉडल की उपयोगिता को संरक्षित करते हुए हानिकारकता, सत्यता और तथ्यात्मक संपादन के लिए स्टीयरिंग प्रभावशीलता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
लार्ज लैंग्वेज मॉडल्स आधुनिक आर्टिफिशियल इंटेलिजेंस के इंजन हैं, जो कहानियाँ लिखने, समस्याओं को हल करने और सवालों के जवाब देने में सक्षम हैं। इन विशाल प्रणालियों को कुशल बनाने के लिए, अब कई मॉडल्स को 'मिक्सचर ऑफ एक्सपर्ट्स' (mixture of experts) नामक एक डिज़ाइन का उपयोग करके बनाया जाता है। एक बड़े कार्यालय की कल्पना करें जहाँ एक मैनेजर प्रत्येक आने वाले अनुरोध को प्राप्त करता है और यह निर्णय लेता है कि किस विशिष्ट विशेषज्ञ को इसे संभालना चाहिए। इन मॉडल्स में, "मैनेजर" एक रूटिंग मैकेनिज्म (मार्गदर्शन तंत्र) है जो वाक्य के प्रत्येक शब्द को देखता है और उसे कंप्यूटर के पूरे मस्तिष्क का उपयोग करने के बजाय, आंतरिक प्रोसेसर के एक छोटे, विशिष्ट समूह या "विशेषज्ञों" के पास भेज देता है। यह मॉडल को अविश्वसनीय रूप से बड़ा और स्मार्ट होने के साथ-साथ चलाने में तेज़ और किफायती रहने की अनुमति देता है।
शोधकर्ता लंबे समय से इन मॉडल्स को विशिष्ट व्यवहारों की ओर निर्देशित या "स्टीयर" (steer) करने के तरीके खोज रहे हैं, जैसे कि उन्हें अधिक सत्यनिष्ठ बनाना या हानिकारक सामग्री उत्पन्न करने की संभावना को कम करना। एक लोकप्रिय तकनीक में सोचने की प्रक्रिया के दौरान मॉडल की आंतरिक गणितीय अवस्थाओं को थोड़ा सा बदलना (nudging) शामिल है, एक ऐसी विधि जो पुराने, सरल मॉडल्स के लिए अच्छी तरह काम करती है जहाँ मस्तिष्क का हर हिस्सा हमेशा सक्रिय रहता है। हालाँकि, जब वैज्ञानिकों ने इस समान 'नजिंग' तकनीक को नए 'मिक्सचर ऑफ एक्सपर्ट्स' मॉडल्स पर लागू करने की कोशिश की, तो यह अक्सर विफल रही। समस्या यह थी कि जिस बदलाव (nudge) का उद्देश्य व्यवहार को बदलना था, उसने अनजाने में मैनेजर को भ्रमित कर दिया, जिससे अनुरोध को गलत विशेषज्ञों के पास भेज दिया गया। इस बेमेल ने मॉडल के स्वाभाविक प्रवाह को बाधित कर दिया, जिससे परिणाम खराब रहे।
शोधकर्ताओं की एक टीम ने अब RARE नामक एक नया फ्रेमवर्क विकसित करके इस पहेली को सुलझा लिया है। उनका कार्य एक महत्वपूर्ण अंतर्दृष्टि प्रकट करता है: इन मॉडल्स में मैनेजर मुख्य रूप से अनुरोध के विषय (topic) से संबंधित होता है, न कि उस विशिष्ट व्यवहार से जो मॉडल से अपेक्षित है। चाहे उपयोगकर्ता कोडिंग के बारे में प्रश्न पूछे या मॉडल से किसी हानिकारक अनुरोध को अस्वीकार करने के लिए कहे, यदि विषय समान रहता है, तो मैनेजर अनुरोध को विशेषज्ञों के एक ही सेट के पास भेजता है। शोधकर्ताओं ने पाया कि पुराने तरीके इसलिए विफल रहे क्योंकि उन्होंने डेटा द्वारा लिए गए मार्ग को बदलकर व्यवहार को बदलने की कोशिश की, जिससे मैनेजर भ्रमित हो गया। इसके बजाय, उनका नया दृष्टिकोण व्यवहार को बदले बिना मार्ग को अपरिवर्तित रखता है।
RARE फ्रेमवर्क सावधानीपूर्वक "नज" (nudge) को फ़िल्टर करके काम करता है। यह निर्देश के उस हिस्से को हटा देता है जो मैनेजर को यह निर्णय बदलने के लिए मजबूर करेगा कि किन विशेषज्ञों का उपयोग किया जाए। ऐसा करके, मॉडल सही विशेषज्ञों को अनुरोध भेजना जारी रखता है, लेकिन वे विशेषज्ञ जानकारी को इस तरह से प्रोसेस करते हैं जिससे वांछित व्यवहार उत्पन्न होता है। शोधकर्ताओं ने इस पद्धति का परीक्षण छह अलग-अलग बड़े मॉडल्स और तीन विशिष्ट कार्यों पर किया: मॉडल्स को कम हानिकारक बनाना, उन्हें अधिक सत्यनिष्ठ बनाना, और उनके द्वारा ज्ञात विशिष्ट तथ्यों को अपडेट करना।
परिणाम आश्चर्यजनक थे। मॉडल्स को हानिकारक निर्देशों का पालन करने से रोकने के प्रयास में, नई विधि 53.3% मामलों में सफल रही, जो पिछले प्रयासों की तुलना में एक महत्वपूर्ण सुधार है, जबकि इसने सामान्य ज्ञान परीक्षणों पर मॉडल्स की 67.8% सटीकता को बनाए रखा। सत्यनिष्ठा के परीक्षणों में, इस पद्धति ने मॉडल्स की सही उत्तर देने की क्षमता को 41.0% से बढ़ाकर 58.6% कर दिया। शायद सबसे नाटकीय रूप से, किसी विशिष्ट तथ्य को अपडेट करने के लिए पूछे जाने पर, सफलता दर 16.8% से उछलकर 96.3% हो गई। ये संख्याएँ बताती हैं कि मॉडल के रूटिंग सिस्टम का सम्मान करके, शोधकर्ता इसकी अंतर्निहित बुद्धिमत्ता को बाधित किए बिना इसके व्यवहार को प्रभावी ढंग से निर्देशित कर सकते हैं।
अध्ययन ने आवश्यक 'नज' की गणना करने के पांच अलग-अलग तरीकों की तुलना की ताकि यह पता लगाया जा सके कि कौन सा सबसे अच्छा काम करता है। उन्होंने पाया कि डेटा के औसत दिशा के बजाय, डेटा के आकार और प्रसार (shape and spread) के विश्लेषण पर आधारित एक विधि ने सभी अलग-अलग मॉडल्स में सबसे सुसंगत और शक्तिशाली परिणाम प्रदान किए। यह निष्कर्ष बताता है कि आंतरिक डेटा की ज्यामिति (geometry) परिवर्तन की दिशा के समान ही महत्वपूर्ण है।
अंततः, यह शोध दर्शाता है कि आधुनिक, जटिल AI मॉडल्स के व्यवहार को नियंत्रित करने के लिए एक नाजुक संतुलन की आवश्यकता होती है। आप केवल बदलाव के लिए मजबूर नहीं कर सकते; आपको मॉडल की मौजूदा संरचना के भीतर काम करना होगा। किसी दिए गए विषय के लिए मॉडल द्वारा चुने गए प्राकृतिक मार्ग को सुरक्षित रखकर, इसके आउटपुट को सुरक्षा, सत्य या सटीकता की ओर मोड़ना संभव है। यह दृष्टिकोण इन शक्तिशाली उपकरणों को उनकी सामान्य क्षमताओं से समझौता किए बिना विशिष्ट आवश्यकताओं के लिए अनुकूलित करने का एक विश्वसनीय तरीका प्रदान करता है, जो आर्टिफिशियल इंटेलिजेंस को मानवीय मूल्यों के साथ अधिक संरेखित बनाने के लिए एक स्पष्ट मार्ग प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।