Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models
यह क्रॉस-आर्किटेक्चर मैकेनिस्टिक अध्ययन यह प्रदर्शित करता है कि टास्क सर्किट की पहचान करने के लिए एक एकीकृत "स्क्रीन-एंड-अबलेट" प्रोटोकॉल विभिन्न 1B-क्लास लैंग्वेज मॉडल्स में असंगत कॉज़ल दावे प्रस्तुत करता है, जो यह प्रकट करता है कि समान व्यवहार संबंधी क्षमताएं विशिष्ट अटेंशन-पैटर्न संरचनाओं के माध्यम से कार्यान्वित होती हैं और यह प्रस्तावित करता है कि MoE मॉडल्स विशेष रूप से कंपोज्ड टास्क के लिए एक मौलिक प्रीवियस-टोकन पोजीशनल सबस्ट्रेट पर निर्भर करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास तीन अलग-अलग शेफ (AI मॉडल) हैं जिन्होंने सभी ने बिल्कुल एक ही व्यंजन सीखा है, जिसे एक जटिल रेसिपी कहा जाता है: "इनडायरेक्ट ऑब्जेक्ट आइडेंटिफिकेशन" (IOI)। आप जानना चाहते हैं कि वे इसे कैसे बना रहे हैं। क्या वे एक ही तरह के औजारों का उपयोग करते हैं? क्या वे एक ही चरणों का पालन करते हैं?
यह पेपर एक फूड क्रिटिक (खाद्य समीक्षक) की तरह है जो तीन अलग-अलग रसोईघरों में जाकर यह पता लगाता है। समीक्षक एक मानक परीक्षण पद्धति का उपयोग करता है: वे एक विशिष्ट उपकरण (जैसे व्हिस्क या चाकू) की पहचान करते हैं, उसे हटा देते हैं, और देखते हैं कि क्या व्यंजन बिगड़ जाता है।
यहाँ इस पेपर के निष्कर्ष दिए गए, जिन्हें सरल भाषा में समझाया गया है:
1. एक ही व्यंजन, अलग-अलग रेसिपी
बड़ा आश्चर्य यह है कि तीनों शेफ व्यंजन को पूरी तरह से बनाते हैं, लेकिन वे इसे करने के लिए पूरी तरह से अलग उपकरणों का उपयोग करते हैं।
- शेफ A (Pythia): "प्रिवियस टोकन" (Previous Token) टूल का उपयोग करता है। यह एक ऐसे शेफ की तरह है जो यह तय करने के लिए कि आगे क्या करना है, उस सामग्री को देखता है जिसे उसने अभी उठाया है।
- शेफ B (OLMo): "S-Inhibition" टूल का उपयोग करता है। यह एक ऐसे शेफ की तरह है जो विशेष रूप से मुख्य सामग्री को दबा देता है ताकि साइड डिश चमक सके।
- शेफ C (OLMoE): "नेम-मूवर" (Name-Mover) टूल का उपयोग करता है। यह एक ऐसे शेफ की तरह है जो साइड डिश के नाम को भौतिक रूप से पकड़ता है और उसे प्लेट के सामने ले आता है।
सबक: सिर्फ इसलिए कि दो मॉडल एक ही तरह से समस्या हल करते हैं (सही उत्तर प्राप्त करते हैं), इसका मतलब यह नहीं है कि वे एक ही आंतरिक "सर्किट" या तंत्र का उपयोग कर रहे हैं। आप यह मान नहीं सकते कि जो एक AI के लिए काम करता है वह दूसरे के लिए भी काम करेगा।
2. "फिशिंग एक्सपीडिशन" (Fishing Expedition) की समस्या
शोधकर्ता चिंतित थे कि यदि वे बहुत अधिक अलग-अलग उपकरणों को आज़माते हैं, तो वे शायद केवल भाग्यशाली हो सकते हैं और उन्हें ऐसा कोई उपकरण मिल सकता है जो गलती से काम करता हुआ प्रतीत होता है। यह साबित करने के लिए कि वे केवल "फिशिंग" (बिना सोचे-समझे तलाश) नहीं कर रहे थे, उन्होंने एक "मैच्ड रैंडम" (Matched Random) कंट्रोल का उपयोग किया।
इसे इस तरह सोचें: यदि आप शेफ का वास्तविक व्हिस्क हटाते हैं और केक ढह जाता है, तो यह अच्छा है। लेकिन यदि आप दराज से एक रैंडम चम्मच हटाते हैं और केक भी ढह जाता है, तो व्हिस्क खास नहीं था; पूरी रसोई ही नाजुक थी।
पेपर दिखाता है कि अधिकांश कार्यों के लिए, शोधकर्ताओं द्वारा खोजे गए विशिष्ट उपकरण को हटाने से भारी गिरावट आई, जबकि रैंडम टूल्स को हटाने से कुछ नहीं हुआ। यह साबित करता है कि उन्होंने प्रत्येक विशिष्ट मॉडल के लिए वास्तविक "सीक्रेट सॉस" (गुप्त नुस्खा) खोज लिया है।
3. "टूल्स" (औजारों) के पांच प्रकार
पेपर ने एक नया तरीका बनाया है जिससे यह वर्गीकृत किया जा सके कि किसी टूल को हटाने पर क्या होता है। यह केवल "यह काम करता है" या "यह काम नहीं करता" तक सीमित नहीं है। उन्होंने पांच अलग-अलग परिणाम पाए:
- प्राथमिक कारण (The Primary Cause): मुख्य इंजन। यदि आप इसे हटा देते हैं, तो कार रुक जाती है। (जैसे, शेफ A में "प्रिवियस टोकन" टूल)।
- द्वितीयक कारण (The Secondary Cause): एक बैकअप इंजन। यदि आप इसे हटा देते हैं, तो कार चलती रहती है, लेकिन लड़खड़ाती है।
- सहसंबंध (The Correlate): एक चमकदार सजावट। यह इंजन रूम का हिस्सा लगता है, लेकिन यदि आप इसे हटा देते हैं, तो कार ठीक चलती है। यह बस साथ चल रहा था।
- हस्तक्षेपकर्ता (The Interferer): एक तोड़-फोड़ करने वाला। यदि आप इस टूल को हटा देते हैं, तो कार वास्तव में बेहतर चलती है। एक मामले में, शोधकर्ताओं ने ऐसे टूल्स पाए जो वास्तव में AI के प्रदर्शन को नुकसान पहुँचा रहे थे, और उन्हें हटाने से समस्या ठीक हो गई।
- शून्य (The Null): एक टूल जो कुछ नहीं करता। इसे हटाने से कुछ भी नहीं बदलता।
4. "MoE" रहस्य (एक विशेष मामला)
उनमें से एक शेफ (OLMoE) एक "मिक्सचर ऑफ एक्सपर्ट्स" (Mixture of Experts - MoE) है। कल्पना कीजिए कि इस शेफ के पास 64 विशेषज्ञों की एक टीम है, लेकिन एक समय में केवल 8 को ही खाना पकाने की अनुमति है।
शोधकर्ताओं ने इस शेफ के साथ एक अजीब पैटर्न पाया:
- चार में से तीन अलग-अलग रेसिपी के लिए, इस शेफ ने "प्रिवियस टोकन" टूल को आधार के रूप में भारी रूप से उपयोग किया। यह ऐसा था जैसे शेफ की पूरी रसोई एक कन्वेयर बेल्ट पर बनी थी जो पिछले आइटम को बस आगे भेज देती थी।
- हालाँकि, "इनडायरेक्ट ऑब्जेक्ट" रेसिपी के लिए, इस शेफ ने "नेम-मूवर" टूल पर स्विच कर दिया।
परिकल्पना (Hypothesis): पेपर सुझाव देता है कि इस प्रकार के AI (MoE) के लिए, "प्रिवियस टोकन" टूल डिफ़ॉल्ट "कंकाल" या "रीढ़" है जो सब कुछ थामे रखता है। AI इस सरल रीढ़ के ऊपर जटिल कार्य बनाता है, जब तक कि कार्य को विशेष रूप से अलग तरह के ध्यान (जैसे अंत में एक नाम को कॉपी करने) की आवश्यकता न हो।
5. "Top-1" सटीकता पर्याप्त क्यों नहीं है
पेपर यह भी चेतावनी देता है कि केवल यह देखना कि AI ने "सही उत्तर" (Top-1 accuracy) दिया या नहीं, भ्रामक हो सकता है।
कभी-कभी, किसी टूल को हटाने से अंतिम उत्तर नहीं बदलता है, लेकिन यह AI को कम आत्मविश्वासी बना देता है। यह एक ऐसे छात्र की तरह है जो गणित का सवाल तो सही हल करता है, लेकिन उसकी लिखावट डगमगा जाती है और वह हिचकिचाने लगता है। यदि आप केवल उत्तर की जाँच करते हैं, तो आप इस तथ्य को मिस कर जाते हैं कि छात्र संघर्ष कर रहा है। शोधकर्ताओं ने पाया कि कुछ मॉडलों के लिए, भले ही उत्तर वही रहता है, लेकिन "मार्जिन" (सही उत्तर और गलत उत्तर के बीच का अंतर) कम हो जाता है।
सारांश
- रेसिपी काम करती है, टूल्स नहीं: आप एक AI के "तंत्र" को दूसरे में कॉपी-पेस्ट नहीं कर सकते। वे एक ही समस्याओं को अलग-अलग आंतरिक गियर के साथ हल करते हैं।
- "तोड़-फोड़ करने वालों" से सावधान रहें: कभी-कभी, वे हिस्से जिन्हें आप मदद करने वाले समझते हैं, वास्तव में AI को नुकसान पहुँचा रहे होते हैं।
- MoE मॉडल अद्वितीय हैं: विशेषज्ञों (MoE) वाले मॉडल अधिकांश कार्यों के लिए एक विशिष्ट "प्रिवियस टोकन" बैकबोन पर निर्भर दिखते हैं, जो एक नई खोज है।
- गहराई से देखें: केवल यह न देखें कि AI सही है या नहीं; यह भी देखें कि वह कितना आत्मविश्वासी है, क्योंकि "आत्मविश्वास" ही असली कहानी हो सकती है।
पेपर निष्कर्ष निकालता है कि हालांकि हमारे पास इन "सर्किट्स" (रेसिपी) को खोजने का एक शानदार तरीका है, लेकिन हम यह मान नहीं सकते कि विभिन्न मॉडलों में सर्किट समान हैं। प्रत्येक मॉडल एक अनूठी मशीन है जिसका अपना विशिष्ट आंतरिक तर्क है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।