Spectral Probe-Circuits: A Three-Step Recipe for Identifying Attention-Head Circuits in Pretrained Transformers
यह शोध पत्र प्रीट्रेन्ड ट्रांसफॉर्मर में कॉज़ल अटेंशन-हेड सर्किट्स की पहचान करने के लिए एक तीन-चरणीय, अनसुपरवाइज्ड कार्यप्रणाली प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एक स्पेक्ट्रल सिग्नल-आधारित दृष्टिकोण विभिन्न मॉडल स्केल्स, आर्किटेक्चर और ट्रेनिंग पाइपलाइनों में टास्क-स्पेसिफिक इंडक्शन सर्किट्स को सफलतापूर्वक अलग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि किताबों का एक विशाल पुस्तकालय (एक न्यूरल नेटवर्क) है जिसने बोलने सीखने के लिए लाखों कहानियाँ पढ़ी हैं। इस पुस्तकालय के भीतर, हजारों छोटे लाइब्रेरियन (जिन्हें "अटेंशन हेड्स" कहा जाता है) हैं जो यह तय करते हैं कि वाक्य बनाते समय किन शब्दों पर ध्यान देना है।
यह पेपर एक तीन-चरणीय रेसिपी प्रस्तुत करता है जिससे उन विशिष्ट लाइब्रेरियनों के समूह को खोजा जा सके जो किसी विशेष ट्रिक के लिए जिम्मेदार हैं, जैसे कि "इंडक्शन" (एक पैटर्न को पहचानना जैसे "A, B... A, B" और अगले B की भविष्यवाणी करना)। लेखक यह जानना चाहते हैं: कौन से विशिष्ट लाइब्रेरियन इस काम को कर रहे हैं, और क्या हम इसे साबित कर सकते हैं?
यहाँ रेसिपी को सरल रूप में समझाया गया है:
चरण 1: "एक्टिविटी मीटर" (स्पेक्ट्रल सिग्नल)
समस्या: आप केवल पुस्तकालय को देखकर यह नहीं जान सकते कि कौन काम कर रहा है। आपको ऐसे लाइब्रेरियनों को खोजने के लिए एक तरीके की आवश्यकता है जो वास्तव में कहानी की सामग्री (कंटेंट) के बारे में सोच रहे हैं, न कि केवल शून्य में ताक रहे हैं या किसी कठोर नियम का पालन कर रहे हैं।
समाधान: लेखकों ने एक "पार्टिसिपेशन रेश्यो" मीटर का आविष्कार किया।
- उपमा: कल्पना कीजिए कि एक लाइब्रेरियन जो आपसे किसी भी किताब के बारे में पूछने पर हमेशा एक ही शेल्फ की ओर इशारा करता है। वह उबाऊ है; वह वास्तव में सोच नहीं रहा है। अब एक ऐसे लाइब्रेरियन की कल्पना करें जो हर बार जब आप उससे कोई किताब पूछते हैं, तो एक अलग शेल्फ की ओर देखता है। वह लाइब्रेरियन सक्रिय रूप से सामग्री को प्रोसेस कर रहा है।
- टूल: लेखक मापते हैं कि एक लाइब्रेरियन का ध्यान समय के साथ कितना "फैला हुआ" है। यदि किसी लाइब्रेरियन का ध्यान कहानी के आधार पर कई अलग-अलग जगहों पर कूदता है, तो उनका "मीटर" बढ़ जाता है। यह उन्हें उन लाइब्रेरियनों को खोजने में मदद करता है जो अभी यह जाने बिना कि वे क्या विशिष्ट कार्य कर रहे हैं, विशेष कार्य (स्पेशलाइज्ड वर्क) कर रहे हैं। यह एक कारखाने में सबसे सक्रिय श्रमिकों को केवल यह देखकर खोजने जैसा है कि वे कितना हिलते-डुलते हैं।
चरण 2: "जॉब डिस्क्रिप्शन" स्क्रीन
समस्या: चरण 1 का "एक्टिविटी मीटर" सभी व्यस्त श्रमिकों को ढूंढ लेता है। लेकिन हम उन श्रमिकों को ढूंढना चाहते हैं जो एक विशिष्ट काम (जैसे इंडक्शन) कर रहे हैं। मीटर शायद ऐसे कार्यकर्ता को हाइलाइट कर सकता है जो कुछ और करने में व्यस्त है।
समाधान: वे सूची को फ़िल्टर करने के लिए एक "स्क्रीन" लागू करते हैं।
- उपमा: आपके पास 100 सक्रिय श्रमिकों की एक सूची है। आप उनसे पूछते हैं: "कौन वर्तमान शब्द से ठीक पहले वाले शब्द को देख रहा है?" (Previous-token) या "कौन 'A... A' के पैटर्न को देख रहा है?" (Induction)।
- टूल: वे सक्रिय श्रमिकों के अटेंशन पैटर्न की जांच करते हैं। यदि कोई कार्यकर्ता विशिष्ट कार्य के लिए सही स्थान देख रहा है (उदाहरण के लिए, दूसरे "A" को देखते समय पहले "A" की ओर देखना), तो उन्हें उम्मीदवार सूची के लिए एक "टिकट" मिलता है। यह "व्यस्त श्रमिकों" की एक सामान्य सूची को "इंडक्शन श्रमिकों" की एक विशिष्ट सूची में बदल देता है।
चरण 3: "फायर ड्रिल" (कॉज़ल वेरिफिकेशन)
समस्या: सिर्फ इसलिए कि एक कार्यकर्ता सही जगह देख रहा है, इसका मतलब यह नहीं है कि वे परिणाम का कारण बन रहे हैं। हो सकता है कि वे केवल देख रहे हों, और कोई और वास्तविक काम कर रहा हो।
समाधान: वे एक "फायर ड्रिल" (एब्लेशन) करते हैं।
- उपमा: आप पहचाने गए विशिष्ट "इंडक्शन श्रमिकों" के समूह को काम करना बंद करने के लिए कहते हैं (आप उनके आउटपुट को ज़ीरो कर देते हैं)।
- परीक्षण: क्या पुस्तकालय अगले शब्द की सही भविष्यवाणी करना बंद कर देता है?
- कंट्रोल: यह सुनिश्चित करने के लिए कि आप यादृच्छिक रूप से लोगों को काम से निकालकर पुस्तकालय को खराब नहीं कर रहे हैं, आप उसी विभाग के एक दूसरे समूह को भी हटा देते हैं जो आपकी सूची में नहीं थे।
- परिणाम: यदि पुस्तकालय केवल तभी क्रैश होता है जब आप "इंडक्शन श्रमिकों" को हटाते हैं, लेकिन आपके द्वारा यादृच्छिक समूह को हटाने पर ठीक से काम करता रहता है, तो आपने सिद्ध कर दिया है कि आपका विशिष्ट समूह ही उस काम को कर रहा था।
उन्होंने क्या पाया?
- रेसिपी हर जगह काम करती है: उन्होंने बहुत छोटे (51 मिलियन पैरामीटर्स) से लेकर काफी बड़े (1 बिलियन पैरामीटर्स) मॉडल्स तक परीक्षण किया। प्रत्येक मॉडल में, उन्होंने इंडक्शन ट्रिक के लिए जिम्मेदार 3 से 6 लाइब्रेरियन की एक छोटी टीम को पाया।
- यह भविष्यवाणात्मक है: वे इस विशिष्ट टीम को प्रशिक्षण प्रक्रिया के दौरान भी खोज सकते थे, इससे पहले कि मॉडल पूरी तरह से तैयार हो जाए। "एक्टिविटी मीटर" सही श्रमिकों के लिए काम शुरू करने से पहले ही चमक उठा था।
- "स्पेशलिस्ट" अनुपात स्थिर है: चाहे पुस्तकालय कितना भी बड़ा क्यों न हो जाए, इन विशिष्ट, उच्च-स्तरीय काम करने वाले लाइब्रेरियनों का प्रतिशत लगभग समान रहता है (लग about 17–19%)। बाकी पुस्तकालय सामान्य चीजों को संभालता है।
- अलग-अलग मॉडल, अलग-अलग टीमें: भले ही काम (इंडक्शन) एक ही है, अलग-अलग मॉडल इस काम को करने के लिए लाइब्रेरियन की अलग-अलग टीमों का उपयोग करते हैं। एक मॉडल पहली कुछ पंक्तियों में काम करने वालों का उपयोग कर सकता है; दूसरा मॉडल बीच की पंक्तियों में काम करने वालों का। लेकिन रेसिपी प्रत्येक विशिष्ट मॉडल के लिए सही टीम को ढूंढ लेती है।
सारांश
यह पेपर हमें AI में उन "ब्रेन सेल्स" को खोजने का एक विश्वसनीय, तीन-चरणीय तरीका देता है जो विशिष्ट ट्रिक्स करते हैं। यह केवल अनुमान नहीं लगाता; यह सक्रिय श्रमिकों को ढूंढता है, जॉब डिस्क्रिप्शन द्वारा उन्हें फ़िल्टर करता है, और फिर उन्हें बंद करके और यह देखकर कि क्या टूटता है, यह साबित करता है कि वे आवश्यक हैं। यह दिखाता है कि जैसे-जैसे AI मॉडल विशाल होते जाते हैं, चतुर काम करने वाली मुख्य टीमें छोटी और सुसंगत बनी रहती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।