Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing
यह शोध पत्र एक दो-स्तरीय आंतरिक रीडआउट फ्रेमवर्क पेश करता है जो लेटेंट रीजनिंग स्टेट्स को 64-एक्सिस सिमेंटिक फ्रेम (J64) में संकुचित करता है और इसे नेटिव एक्सपर्ट-रूटिंग स्टैटिस्टिक्स (R64) के माध्यम से पुनर्गठित करता है, जिससे व्याख्या योग्य, कम-ओवरहेड टेस्ट-टाइम निर्णय सक्षम होते हैं जो रीजनिंग सटीकता में महत्वपूर्ण सुधार करते हैं और मॉडल व्यवहारों को ठीक करने के लिए लक्षित मैकेनिज्म एडिट्स की अनुमति देते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
जब एक कंप्यूटर प्रोग्राम, जिसे कठिन समस्याओं को हल करने के लिए डिज़ाइन किया गया है, अपने विचारों को ज़ोर से बोलता है, तो हम आमतौर पर केवल उन अंतिम वाक्यों को ही देख पाते हैं जिन्हें वह लिखने के लिए चुनता है। ये बोले गए विचार, जिन्हें अक्सर 'रीज़निंग ट्रेसेस' (तर्क के निशान) कहा जाता है, एक ऐसी बातचीत के ट्रांसक्रिप्ट की तरह हैं जहाँ वक्ता ने अपनी हर हिचकिचाहट, हर गलत शुरुआत और हर आंतरिक बहस को हटा दिया है। उन शोधकर्ताओं के लिए जो यह समझने की कोशिश कर रहे हैं कि ये कृत्रिम मस्तिष्क कैसे काम करते हैं, यह ट्रांसक्रिप्ट निराशाजनक रूप से अधूरा है। यह गंतव्य को तो दिखाता है लेकिन यात्रा को छिपा देता है। असली सवाल यह है कि क्या कंप्यूटर की आंतरिक स्थिति—शब्दों के नीचे गुनगुनाती हुई छिपी हुई मशीनरी—उत्तर पूरा करने से बहुत पहले इस बारे में सुराग देती है कि क्या वह सही रास्ते पर है। यदि हम उस छिपी हुई स्थिति को देख पाते, तो हम कंप्यूटर को अपना उत्तर पूरा करने के बाद विफल प्रयास को हटाने के बजाय, उसके सोचने के दौरान ही गलतियों से दूर ले जाने के लिए निर्देशित कर पाते।
फ़ुदान यूनिवर्सिटी और शंघाई इनोवेशन इंस्टीट्यूट के शोधकर्ताओं की एक टीम ने इन सोचने वाली मशीनों के भीतर झांकने का एक नया तरीका बनाया है। उन्होंने एक विशिष्ट प्रकार के उन्नत कंप्यूटर मॉडल पर ध्यान केंद्रित किया जो "मिक्सचर ऑफ एक्सपर्ट्स" (विशेषज्ञों के मिश्रण) आर्किटेक्चर का उपयोग करता है। एक बड़े कार्यालय की कल्पना करें जहाँ, प्रत्येक कार्य के लिए, एक प्रबंधक स्वचालित रूप से कार्य को विशेषज्ञों की एक छोटी टीम को सौंप देता है। कंप्यूटर भी ऐसा ही कुछ करता है: प्रत्येक शब्द उत्पन्न करने के लिए, वह विशेषज्ञों के एक विशिष्ट समूह को सक्रिय करता है। शोधकर्ताओं ने महसूस किया कि जबकि कंप्यूटर अपने विचार लिखता है, वह इस बात का विस्तृत लॉग भी रखता है कि उसने किन विशेषज्ञों का उपयोग किया और उन पर कितना भरोसा किया। यह लॉग आमतौर पर दक्षता का एक तकनीकी रिकॉर्ड होता है, लेकिन टीम ने खोजा कि इसे कंप्यूटर की तर्क प्रक्रिया के पठनीय मानचित्र में अनुवादित किया जा सकता है।
शोधकर्ताओं ने सबसे पहले एक नए प्रकार का डैशबोर्ड बनाया, जिसे वे 'सिमेंटिक फ्रेम' कहते हैं। उन्होंने इस डैशबोर्ड को कंप्यूटर के कच्चे, छिपे हुए आंतरिक संकेतों को विचार की साठ-चार विशिष्ट श्रेणियों में अनुवादित करने के लिए प्रशिक्षित किया। ये श्रेणियाँ केवल यादृच्छिक लेबल नहीं हैं; वे "सावधानी," "अंकगणित," "बाधाओं की जाँच करना," या "विकल्पों पर विचार करना" जैसे ठोस अवधारणाओं का प्रतिनिधित्व करती हैं। महत्वपूर्ण रूप से, यह डैशबोर्ड इन अवधारणाओं का पता तब भी लगा सकता है जब कंप्यूटर वास्तव में उन संबंधित शब्दों को कभी नहीं लिखता है। उदाहरण के लिए, कंप्यूटर एक जटिल बाधा के साथ चुपचाप संघर्ष कर सकता है, और जबकि वह इसके बारे में कुछ भी नहीं लिखता है, डैशबोर्ड यह दिखाने के लिए चमक उठता है कि "बाधा" (constraint) की अवधारणा सक्रिय है। इसने तर्क प्रक्रिया की एक छिपी हुई परत को प्रकट किया जिसे लिखित पाठ पूरी तरह से मिस कर गया था। उनके परीक्षणों में, इस आंतरिक दृश्य ने यह संकेत देने में काफी स्पष्टता दिखाई कि समाधान सफल होगा या नहीं, जो केवल कंप्यूटर द्वारा लिखे गए शब्दों को गिनने से कहीं अधिक प्रभावी था।
टीम को फिर एक व्यावहारिक चुनौती का सामना करना पड़ा: इन छिपे हुए संकेतों को पढ़ने के लिए आमतौर पर कंप्यूटर को रोकना और उसकी पूरी विचार प्रक्रिया को फिर से चलाना पड़ता है, जो वास्तविक दुनिया के उपयोग के लिए बहुत धीमा है। उन्होंने एक दूसरा, हल्का संस्करण बनाकर इसका समाधान किया जो केवल विशेषज्ञ असाइनमेंट के लॉग को पढ़ता है। यह नया उपकरण, जिसे वे 'रूटिंग प्रॉक्सी' कहते हैं, एक तेज़, कम लागत वाले विकल्प के रूप में कार्य करता है। यह कंप्यूटर के आंतरिक रूटिंग लॉग से सीधे विचार की उन्हीं साठ-चार श्रेणियों को पुनर्गठित करता है। शोधकर्ताओं ने पाया कि यह प्रॉक्सी उल्लेखनीय रूप से सटीक था, जो पूर्ण, धीमे संस्करण में पाए गए विस्तृत विवरण का 69% से 86% के बीच हिस्सा कैप्चर करता है। उनके एक परीक्षण मॉडल पर, इसने मूल के लगभग सभी भविष्य कहने वाले सामर्थ्य को सुरक्षित रखा, जिससे यह सिद्ध हुआ कि कंप्यूटर का अपना आंतरिक ट्रैफ़िक लॉग उसके तर्क की स्थिति का एक विश्वसनीय रिकॉर्ड है।
इन उपकरणों के साथ, शोधकर्ताओं ने यह परीक्षण किया कि वे समस्या को हल करते समय कंप्यूटर के प्रदर्शन को कैसे बेहतर बना सकते हैं। उन्होंने डैशबोर्ड का उपयोग दो प्रकार के निर्णय लेने के लिए किया। पहला, एक ही समस्या के लिए कंप्यूटर द्वारा कई अलग-अलग प्रयास उत्पन्न करने के बाद, डैशबोर्ड ने उन्हें यादृच्छिक अवसर या सरल पाठ विश्लेषण की तुलना में एकल सर्वोत्तम प्रयास चुनने में अधिक मदद की। उन मामलों में जहाँ मानक मतदान विधियाँ सही उत्तर खोजने में विफल रहीं, इस आंतरिक दृश्य ने लगभग 17% उन कठिन मामलों में सही समाधान को बचाने में मदद की। दूसरा, उन्होंने इन खराब प्रयासों को जल्दी रोकने के लिए डैशबोर्ड का उपयोग किया। जैसे-जैसे कंप्यूटर टेक्स्ट उत्पन्न करता, डैशबोर्ड वास्तविक समय में इसकी आंतरिक स्थिति की निगरानी करता। यदि डैशबोर्ड ने पता लगाया कि कंप्यूटर किसी मृत अंत (dead end) की ओर बढ़ रहा है या अनुमान लगाने के लूप में फंस गया है, तो सिस्टम ने उस प्रयास को तुरंत रोक दिया और एक नया प्रयास शुरू कर दिया। इस "रोकें और पुनः नमूना लें" (stop and resample) रणनीति ने हस्तक्षेप के बिना चलने वाले मॉडल की तुलना में कंप्यूटर की अंतिम सटीकता में 5.9 प्रतिशत अंक तक सुधार किया।
शायद सबसे आश्चर्यजनक निष्कर्ष यह था कि वे इस समझ का उपयोग सीधे कंप्यूटर के व्यवहार को ठीक करने के लिए कर सकते थे। यह पहचानकर कि कौन से विशिष्ट आंतरिक विशेषज्ञ एक विशेष प्रकार की त्रुटि के लिए जिम्मेदार थे, शोधकर्ता इस बात में सूक्ष्म समायोजन कर सके कि कंप्यूटर कार्य कैसे सौंपता है। एक उदाहरण में, उन्होंने विशेषज्ञों के एक ऐसे समूह की पहचान की जो कंप्यूटर को संख्याओं के अनुमान के चक्र में फंसाए रख रहे थे। उस विशिष्ट समूह की गतिविधि को थोड़ा कम करके, उन्होंने कंप्यूटर को अधिक सटीक प्रतीकात्मक गणना (symbolic calculation) की ओर स्विच करने के लिए मजबूर किया, जिससे वह एक ऐसी समस्या को हल करने में सक्षम हुआ जिसे वह पहले करने में विफल रहा था। इसने प्रदर्शित किया कि डैशबोर्ड ने न केवल कंप्यूटर की स्थिति का वर्णन किया; बल्कि इसने उन सटीक यांत्रिक लीवरों की पहचान की जो इसके तर्क को नियंत्रित करते हैं।
यह कार्य सुझाव देता है कि बेहतर कृत्रिम बुद्धिमत्ता का मार्ग मॉडल को बड़ा बनाने या उन्हें अधिक डेटा पर प्रशिक्षित करने में नहीं, बल्कि उनके सोचने के दौरान उत्पन्न होने वाले मौन संकेतों को पढ़ने में निहित है। शोधकर्ताओं ने दिखाया कि मॉडल का आंतरिक रूटिंग केवल एक छिपा हुआ तकनीकी विवरण नहीं है, बल्कि यह एक समृद्ध सूचना स्रोत है कि मॉडल वास्तव में क्या कर रहा है। इन संकेतों को एक पठनीय प्रारूप में अनुवादित करके, उन्होंने एक 'ब्लैक बॉक्स' को एक पारदर्शी प्रक्रिया में बदल दिया। यह दृष्टिकोण हमें मॉडल के सोचते समय हस्तक्षेप करने की अनुमति देता है, जिससे गलत उत्तर तक पहुँचने से पहले ही उसका मार्ग सुधारा जा सके। हालाँकि अध्ययन गणितीय समस्याओं पर केंद्रित था, लेकिन यह विधि जटिल प्रणालियों के तर्क को देखने और मार्गदर्शन करने का एक नया तरीका प्रदान करती है, जो मशीन के विचार की अदृश्य प्रक्रिया को ऐसी चीज़ में बदल देती है जिसे हम देख, माप और सुधार सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।