When Do Attention Circuits Form? Developmental Trajectories of Capability and Attention-Sink Emergence Across Three 1B-ClassArchitectures
यह शोध पत्र तीन 1B-श्रेणी के भाषा मॉडलों में अटेंशन सर्किट के विकासात्मक प्रक्षेपवक्रों (developmental trajectories) का पता लगाता है, जो यह प्रकट करता है कि इंडक्शन सर्किट और अटेंशन सिंक का निर्माण एक एकल घटना के बजाय अलग-अलग, समयबद्ध रूप से पृथक संक्रमण हैं, और विशिष्ट सर्किट क्षमताओं को अंतिम मॉडल की आवश्यकता के बिना प्रशिक्षण के शुरुआती चरणों में ही पहचाना जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप तीन युवा छात्रों (AI मॉडल) के एक समूह को किताबों के एक विशाल पुस्तकालय को पढ़ना और समझना सीखते हुए देख रहे हैं। ये छात्र लगभग एक ही आकार के हैं (1 बिलियन "मस्तिष्क कोशिकाएं"), लेकिन उनके शिक्षक और किताबें अलग-अलग हैं।
शोधकर्ता एक सरल प्रश्न का उत्तर देना चाहते थे: ये छात्र वास्तव में विशिष्ट करतब (tricks) कब सीखते हैं?
विशेष रूप से, वे दो चीजों की तलाश कर रहे थे:
- "नकलची" करतब (The "Copycat" Trick): एक पैटर्न को देखना जैसे "A... B... A" और सही ढंग से अनुमान लगाना कि अगला शब्द "B" होना चाहिए। (इसे एक इंडक्शन सर्किट कहा जाता है)।
- "पहला पन्ना" की आदत (The "First Page" Habit): हमेशा वाक्य के बिल्कुल पहले शब्द पर ध्यान देना, चाहे वाक्य किसी भी विषय के बारे में हो। (इसे अटेंशन सिंक कहा जाता है)।
लंबे समय तक, वैज्ञानिकों को लगा था कि ये दोनों चीजें एक ही क्षण में होती हैं, जैसे कोई स्विच ऑन हो गया हो। यह पेपर कहता है: नहीं, यह सच नहीं है। ये बहुत अलग-अलग समय पर होती हैं, और ये कैसे होती हैं यह इस पर निर्भर करता है कि छात्र की बनावट कैसी है और वह क्या पढ़ रहा है।
यहाँ उनके द्वारा की गई खोजों की कहानी है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. "नो-गो" ज़ोन (निचली मंजिल)
शोधकर्ताओं ने एक नियम की खोज की जो कभी नहीं टूटता: मस्तिष्क की पहली दो परतें (लेयर 0 और लेयर 1) कभी भी "पहला पन्ना" की आदत नहीं सीखतीं।
- उपमा: एक फैक्ट्री असेंबली लाइन की कल्पना करें। पहले दो स्टेशन केवल कच्चा माल आते हैं; उन्हें अभी तक प्रोसेस नहीं किया गया है। आप पहले स्टेशन पर "फैक्ट्री मैनेजर" (अटेंशन सिंक) नहीं रख सकते जो निर्णय ले सके, क्योंकि वहां अभी पर्याप्त जानकारी नहीं है।
- निष्कर्ष: छात्र चाहे कितनी भी पढ़ाई कर लें, उनके मस्तिष्क की सबसे निचली परतें कभी भी इस आदत को विकसित नहीं करती हैं। यह उनकी संरचना का एक कठिन नियम है, न कि उनकी विफलता।
2. "मिडल-फर्स्ट" आश्चर्य (बीच से शुरुआत)
आप सोच सकते हैं कि "पहला पन्ना" की आदत नीचे से शुरू होगी और जैसे-जैसे छात्र स्मार्ट होगा, धीरे-धीरे ऊपर की ओर बढ़ेगी। शोधकर्ताओं ने इसके विपरीत पाया।
- उपमा: एक इमारत की कल्पना करें। आप उम्मीद कर सकते हैं कि लाइटें ग्राउंड फ्लोर से ऊपर की ओर जलेंगी। इसके बजाय, इमारत के बीच में की लाइटें पहले जलती हैं, और फिर यह आदत बाहर की ओर फैलती है। "नो-गो ज़ोन" के ठीक ऊपर वाली परतें वास्तव में इस आदत को सीखने में सबसे अंत में आती हैं।
- निष्कर्ष: "पहला पन्ना" की आदत नेटवर्क के बीच में पहले जमती (crystallize) है, नीचे नहीं।
3. दो अलग-अलग "लाइट स्विच"
यह सबसे बड़ी खोज है। शोधकर्ताओं ने ट्रैक किया कि "नकलची" करतब और "पहला पन्ना" की आदत कब प्रकट हुई।
- "नकलची" करतब (Induction): यह बहुत जल्दी होता है। "DCLM" किताबों पर प्रशिक्षित छात्रों में, यह करतब तब तक पूरी तरह सीख लिया गया था जब तक उन्होंने लगभग 20-23 बिलियन शब्द पढ़ लिए थे। यह एक बच्चे के जूते के फीते बांधना सीखने जैसा है; यह जल्दी होता है और फिर खत्म हो जाता है।
- "पहला पन्ना" की आदत (Attention Sink): यह बहुत, बहुत बाद में होती है। उन्हीं छात्रों में, यह आदत तब तक वास्तव में शुरू नहीं हुई जब तक उन्होंने 260 से 400 बिलियन शब्द नहीं पढ़ लिए थे।
- उपमा: यह साइकिल चलाना सीखने (करतब) जैसा है जो पहले सप्ताह में होता है, लेकिन हर दौड़ से पहले शुरुआती रेखा को देखना (आदत) सीखने में पांच साल लग जाते हैं। वे दो पूरी तरह से अलग घटनाएं हैं, जो समय के एक बड़े अंतराल से अलग हैं।
4. सीखने का आकार "स्कूल" पर निर्भर करता है
शोधकर्ताओं ने तीन अलग-अलग छात्रों का परीक्षण किया:
- Pythia: "The Pile" किताबें पढ़ीं।
- OLMo: "DCLM" किताबें पढ़ीं।
- OLMoE: "DCLM" किताबें पढ़ीं लेकिन इसमें एक विशेष "मिक्सचर ऑफ एक्सपर्ट्स" मस्तिष्क है (जैसे कि 64 अलग-अलग ट्यूटर्स होना और प्रत्येक कार्य के लिए केवल शीर्ष 8 का उपयोग करना)।
उन्होंने पाया कि सीखने का आकार (shape) छात्र के आधार पर बदल गया:
- क्रमिक चढ़ाई (The Gradual Ramp): Pythia और OLMoE ने "पहला पन्ना" की आदत धीरे-धीरे और लगातार सीखी, जैसे बाथटब में पानी भर रहा हो।
- तीव्र उछाल (The Sharp Jump): OLMo (मानक डेंस ब्रेन जो DCLM पढ़ रहा है) ने इसे एक साथ सीखा। एक क्षण में इसमें लगभग कोई "पहला पन्ना" की आदत नहीं थी, और अगले ही क्षण (दो चेकपॉइंट्स के बीच), यह 7% से 70% पर उछल गया। यह एक अचानक "फेज ट्रांजिशन" था, जैसे बर्फ अचानक पानी में बदल जाती है।
सबक: वही किताब (DCLM) एक छात्र में धीमा सीखने वाला और दूसरे में अचानक उछाल मारने वाला परिणाम देती है, सिर्फ इसलिए क्योंकि उनके मस्तिष्क की बनावट अलग थी।
5. स्नातक होने तक प्रतीक्षा करने की आवश्यकता नहीं है
इन कौशलों को देखने के बारे में एक सबसे व्यावहारिक खोज यह है कि आप इन्हें कब देख सकते हैं।
- निष्कर्ष: यदि आप यह पता लगाना चाहते हैं कि मस्तिष्क के कौन से हिस्से "नकलची" करतब कर रहे हैं, तो आपको छात्र के पूरी लाइब्रेरी पढ़ने तक प्रतीक्षा करने की आवश्यकता नहीं है।
- उपमा: कल्पना करें कि आप जानना चाहते हैं कि क्या कोई छात्र गणित में अच्छा है। आपको उसके 4 साल की डिग्री पूरी करने तक प्रतीक्षा करने की आवश्यकता नहीं है। जब तक उसने अपने पाठ्यक्रम का केवल 1% पूरा कर लिया है, तब तक आप पहले ही देख सकते हैं कि उसमें अंततः कितनी गणितीय कौशल क्षमता होगी।
- परिणाम: शोधकर्ता इन मस्तिष्क सर्किटों की पहचान प्रशिक्षण के केवल 1% चरण में ही कर सकते हैं। मस्तिष्क कैसे काम करता है यह समझने के लिए आपको पूर्ण, तैयार मॉडल की आवश्यकता नहीं है।
सारांश
यह पेपर हमें बताता है कि AI सीखने का "जादुई क्षण" एक बड़ी घटना नहीं है।
- समय (Timing): मस्तिष्क पैटर्न की नकल करना (induction) तब सीख लेता है जब वह पहले शब्द पर जुनून (attention sink) विकसित करना सीखता है।
- स्थान (Location): पहले शब्द के प्रति जुनून मस्तिष्क के बीच में शुरू होता है, नीचे नहीं।
- विविधता (Variety): मस्तिष्क की डिजाइन के आधार पर, यह जुनून धीरे-धीरे या अचानक विस्फोट के रूप में प्रकट हो सकता है।
- दक्षता (Efficiency): हम इन कौशलों को प्रशिक्षण के बहुत शुरुआती चरण में बनते हुए देख सकते हैं, इसलिए हमें यह समझने के लिए इंतजार करने की आवश्यकता नहीं है कि AI "पूरा" हो गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।