Beyond Importance: Interchange-Sobol Sensitivity Reveals Task-Specific Content Channels in Transformer Components
यह शोध पत्र इंटरचेंज-ग्रुप सोबोल डिकम्पोज़िशन (IGSD) प्रस्तुत करता है, जो एक युग्मित-हस्तक्षेप ढांचा (paired-intervention framework) है जो कार्य-प्रासंगिक सामग्री को ले जाने बनाम केवल फॉरवर्ड कंप्यूटेशन में सहायता करने में एक ट्रांसफार्मर घटक की भूमिका के बीच अंतर करता है, जिससे तथ्यात्मक रिकॉल (factual recall) के विशिष्ट प्रारंभिक-परत वाले चैनलों का खुलासा होता है जिन्हें मानक महत्व मेट्रिक्स अनदेखा कर देते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र "Beyond Importance: Interchange-Sobel Sensitivity Reveals Task-Specific Content Channels in Transformer Components" का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।
बड़ी समस्या: "एक-संख्या" वाला जाल (The "One-Number" Trap)
एक विशाल, जटिल फैक्ट्री (एक ट्रांसफॉर्मर AI मॉडल) की कल्पना करें जो सवालों के जवाब बनाती है। इस फैक्ट्री के अंदर हजारों कर्मचारी (न्यूरल नेटवर्क घटक) हैं जो नोट्स पास कर रहे हैं और पुर्जों को जोड़ रहे हैं।
लंबे समय से, वैज्ञानिक जो यह समझने की कोशिश करते हैं कि यह फैक्ट्री कैसे काम करती है, वे एक सरल उपकरण का उपयोग करते हैं: वे पूछते हैं, "कर्मचारी X कितना महत्वपूर्ण है?" इसका उत्तर देने के लिए, वे आमतौर पर एक ही काम करते हैं: वे कर्मचारी X को निकाल देते हैं (या उन्हें काम करने से रोक देते हैं) और देखते हैं कि क्या फैक्ट्री रुक जाती है।
- दोष: यह तरीका आपको केवल यह बताता है कि मशीन को चालू रखने के लिए फैक्ट्री को उस कर्मचारी की ज़रूरत है या नहीं। यह आपको यह नहीं बताता कि वह कर्मचारी वास्तव में क्या कर रहा है।
- उपमा: एक डिलीवरी ट्रक की कल्पना करें। यदि आप ड्राइवर को हटा देते हैं, तो ट्रक रुक जाता है। आप निष्कर्ष निकाल सकते हैं, "ड्राइवर आवश्यक है!" लेकिन यदि आप ड्राइवर को किसी अजनबी से बदल देते हैं जिसे रास्ता नहीं पता, तो ट्रक अभी भी चल सकता है, लेकिन वह गलत घर पर जाएगा। मूल ड्राइवर न केवल इंजन चलाने के लिए आवश्यक था, बल्कि इसलिए भी आवश्यक था क्योंकि वह सही मंजिल तक पहुँचने के लिए एक विशिष्ट मानचित्र (कंटेंट/विषय-वस्तु) ले जा रहा था।
लेखकों का तर्क है कि मानक तरीके इन दो भूमिकाओं के बीच भ्रमित होते हैं:
- इंजन: कर्मचारी मशीन को चालू रखने के लिए आवश्यक है (संरचनात्मक महत्व/structural importance)।
- कंटेंट (विषय-वस्तु): कर्मचारी एक विशिष्ट जानकारी (जैसे कोई तथ्य या संबंध) ले जा रहा है जो बदलने पर उत्तर को बदल देती है।
समाधान: IGSD (The "Swap vs. Zero" Test)
लेखक एक नया तरीका पेश करते हैं जिसे IGSD (Interchange-Group Sobol Decomposition) कहा जाता है। केवल एक कर्मचारी को निकालने के बजाय, वे एक युग्मित परीक्षण (paired test) चलाते हैं:
- "जीरो" टेस्ट (निकालना/Firing): वे कर्मचारी को पूरी तरह से काम करने से रोक देते हैं (उनके आउटपुट को शून्य कर देते हैं)।
- "स्वैप" टेस्ट (बदलना/Replacing): वे कर्मचारी के नोट्स लेते हैं और उन्हें एक दूसरे लेकिन समान स्थिति (एक "डोनर") के नोट्स से बदल देते हैं।
रचनात्मक रूपक (Metaphor):
कल्पना करें कि एक शेफ सूप बना रहा है।
- जीरो टेस्ट: आप बर्तन से नमक निकाल देते हैं। सूप फीका हो जाता है। आप जानते हैं कि नमक महत्वपूर्ण है।
- स्वैप टेस्ट: आप नमक निकालते हैं और उसकी जगह चीनी डाल देते हैं। सूप बहुत बुरा लगता है, लेकिन एक बहुत ही विशिष्ट और गलत तरीके से।
यदि "स्वैप" टेस्ट के कारण सूप "जीरो" टेस्ट (फीकापन) की तुलना में अधिक खराब लगता है, तो इसका मतलब है कि मूल सामग्री केवल बर्तन को थामे रखने के लिए नहीं थी; वह एक विशिष्ट स्वाद (कंटेंट) ले जा रही थी जिस पर मॉडल निर्भर करता है।
उन्होंने क्या पाया: दो अलग-अलग प्रकार के कर्मचारी
AI मॉडलों (GPT-2 और Qwen2.5) पर तथ्यात्मक प्रश्नों (जैसे "Yahoo का मालिक कौन है?") पर इस परीक्षण को लागू करके, उन्होंने पाया कि AI के विभिन्न हिस्से अलग-अलग काम करते हैं:
प्रारंभिक "रिलेशन" कर्मचारी (MLP Layer 0):
- वे क्या करते हैं: ये कर्मचारी प्रश्न की संरचना को संभालते हैं। वे "टेम्पलेट" (जैसे, "X का मालिक है...") को समझते हैं।
- खोज: मानक तरीकों ने इन कर्मचारियों को महत्वहीन माना। लेकिन जब IGSD ने उनके कंटेंट को स्वैप किया, तो AI तुरंत गलत उत्तर देने लगा। वे "रिलेशनशिप टाइप" के लिए "कंटेंट कैरियर" हैं।
- उपमा: ये वे कर्मचारी हैं जो यह तय करते हैं कि किस प्रकार का पैकेज भेजा जा रहा है (जैसे, "यह एक कानूनी दस्तावेज़ है," न कि "यह एक पिज्जा है")।
विलंबित "सब्जेक्ट" कर्मचारी (Attention Layer 9):
- वे क्या करते हैं: ये कर्मचारी विशिष्ट विवरणों (विषय/Subject) को संभालते हैं। वे विशिष्ट नाम (जैसे "Yahoo") को प्राप्त करते हैं।
- खोज: यह वैज्ञानिकों द्वारा पहले से ज्ञात जानकारी से मेल खाता है। ये कर्मचारी उन आर्काइविस्ट (अभिलेखागार) की तरह हैं जो शेल्फ से विशिष्ट फाइल निकाल रहे हैं।
"ऑफ-मैनिफोल्ड" चेतावनी संकेत (The "Off-Manifold" Warning Sign)
पेपर एक सुरक्षा जांच भी पेश करता है। कभी-कभी, जब आप एक कर्मचारी के नोट्स को डोनर के नोट्स के साथ बदलते हैं, तो नोट्स इतने अलग होते हैं कि वे फैक्ट्री में बिल्कुल फिट नहीं बैठते (जैसे किसी गोल छेद में चौकोर खूँटा डालने की कोशिश करना)।
- लेखकों ने एक "डायग्नोस्टिक फ्लैग" बनाया है (जिसे कहा जाता है)। यदि यह फ्लैग चालू होता है, तो इसका मतलब है कि प्रयोग गलत है क्योंकि नोट्स बहुत अजीब थे। यह एक धुएँ वाले अलार्म की तरह है जो आपको बताता है कि परीक्षण ही अमान्य है, इसलिए आपको परिणामों पर भरोसा नहीं करना चाहिए।
यह क्यों महत्वपूर्ण है (पेपर के अनुसार)
पेपर का दावा है कि स्वैपिंग (बदलना) और डिलीशन (हटाना) एक ही बात नहीं हैं।
- यदि आप केवल यह देखते हैं कि किसे निकाला गया (deletion), तो आप उन कर्मचारियों को मिस कर देते हैं जो सबसे महत्वपूर्ण "गुप्त संदेश" (content) ले जा रहे हैं।
- IGSD इन भूमिकाओं को अलग करता है। यह आपको बताता है: "AI का यह हिस्सा एक कंटेंट हाईवे है (यह विशिष्ट तथ्य ले जाता है)," जबकि "वह हिस्सा केवल एक स्ट्रक्चरल बीम है (यह गणित को बनाए रखता है)।"
पेपर में वास्तविक प्रमाण
लेखकों ने एक तथ्यात्मक प्रश्न पर परीक्षण किया: "Yahoo! Tech का मालिक ___ है।"
- मानक विधि: प्रारंभिक कर्मचारियों (MLP Layer 0) को महत्वहीन (#11 या #13) बताया।
- IGSD विधि: उन्हें #1 पर रखा।
- परिणाम: जब उन्होंने उस प्रारंभिक परत में नोट्स को किसी दूसरे प्रश्न के नोट्स के साथ बदला, तो AI ने "Yahoo" कहना बंद कर दिया और "Partnership" जैसे रैंडम शब्द बोलने लगा। इसने साबित कर दिया कि प्रारंभिक परत वास्तव में महत्वपूर्ण "रिलेशनशिप" कंटेंट ले जा रही थी, जिसे मानक तरीकों ने पूरी तरह से मिस कर दिया था।
सारांश
यह पेपर AI फैक्टरियों के ऑडिट करने का एक नया तरीका है। केवल यह पूछने के बजाय कि "मशीन को कौन चला रहा है?", यह पूछता है कि "कौन उन विशिष्ट निर्देशों को ले जा रहा है जो उत्तर को सही बनाते हैं?" यह तुलना करके कि किसी हिस्से को हटाने और उसे दूसरे संस्करण से बदलने पर क्या होता है, वे सटीक रूप से मैप कर सकते हैं कि AI अपना ज्ञान कहाँ संग्रहीत करता है और वह उस ज्ञान को अपनी परतों के माध्यम से कैसे आगे बढ़ाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।