Understanding In-Context Learning Beyond Transformers: An Investigation of State Space and Hybrid Architectures
यह शोध पत्र ट्रांसफॉर्मर, स्टेट-स्पेस और हाइब्रिड आर्किटेक्चर में इन-कॉन्टेक्स्ट लर्निंग की जांच करता है, जो यह प्रकट करता है कि हालांकि ये मॉडल समान व्यवहार संबंधी प्रदर्शन प्रदर्शित करते हैं, उनके आंतरिक तंत्र काफी भिन्न हैं, जिसमें फंक्शन वेक्टर्स पैरामीट्रिक ज्ञान पुनर्प्राप्ति में एक महत्वपूर्ण भूमिका निभाते हैं लेकिन अनिवार्य रूप से प्रासंगिक समझ (कॉन्टेक्स्टुअल अंडरस्टैंडिंग) में नहीं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बच्चे को पहेली सुलझाना सिखा रहे हैं। आप उसे कोई पाठ्यपुस्तक नहीं देते; इसके बजाय, आप उसे करने के तीन उदाहरण दिखाते हैं, और फिर आप उसे चौथी पहेली हल करने के लिए कहते हैं। यह इन-कॉन्टेक्स्ट लर्निंग (ICL) है। यह वह जादुई ट्रिक है जहाँ लार्ज लैंग्वेज मॉडल्स (LLMs) बिना दोबारा ट्रेनिंग लिए, केवल बातचीत में दिए गए उदाहरणों को देखकर नए काम सीख जाते हैं।
लंबे समय तक, वैज्ञानिकों को लगा कि यह जादू केवल ट्रांसफॉर्मर्स (Transformers) (वर्तमान मानक AI आर्किटेक्चर) में ही काम करता है। उन्होंने ट्रांसफॉर्मर के दिमाग के अंदर कुछ विशिष्ट "गियर्स" (gears) पाए, जिन्हें फंक्शन वेक्टर्स (Function Vectors - FVs) कहा जाता है, जो इस सीखने की प्रक्रिया को चलाने वाले इंजन की तरह काम करते हैं।
लेकिन हाल ही में, AI के नए प्रकार आए हैं: स्टेट स्पेस मॉडल्स (जैसे Mamba) और हाइब्रिड मॉडल्स (Hybrid models) (ट्रांसफॉर्मर और मंबा का मिश्रण)। बड़ा सवाल यह था कि: क्या ये नए दिमाग भी उन्हीं गियर्स का उपयोग करके सीखते हैं, या उनके पास एक गुप्त, अलग इंजन है?
यह पेपर एक जासूसी कहानी की तरह है जहाँ लेखक इन विभिन्न AI दिमागों को खोलकर देखते हैं कि वे कैसे काम करते हैं। यहाँ इसका सरल विवरण दिया गया है:
1. "सीखने" के दो प्रकार
शोधकर्ताओं ने महसूस किया कि सभी पहेलियाँ एक जैसी नहीं होतीं। उन्होंने कार्यों को दो श्रेणियों में विभाजित किया:
- "फैक्ट बुक" कार्य (पैरामीट्रिक नॉलेज): कल्पना कीजिए कि आपसे पूछा जाए, "फ्रांस की राजधानी क्या है?" मॉडल को बस उस तथ्य को निकालने की आवश्यकता है जिसे उसने पहले से याद कर रखा है। यह शब्दकोश में शब्द खोजने जैसा है।
- "रीडिंग कॉम्प्रिहेनशन" कार्य (कॉन्टेक्स्टुअल नॉलेज): कल्पना कीजिए कि आप एक कुत्ते के बारे में एक छोटी कहानी पढ़ रहे हैं और फिर पूछा जाता है, "क्या कुत्ता खुश है?" मॉडल को उस कहानी को समझना होगा जो उसके सामने है, न कि केवल किसी तथ्य को निकालना। यह एक चुटकुले को समझने जैसा है।
2. "गियर्स" (फंक्शन वेक्टर्स)
पुराने ज़माने के ट्रांसफॉर्मर्स में, वैज्ञानिकों ने पाया कि विशिष्ट "अटेंशन हेड्स" (attention heads) एक फंक्शन वेक्टर (FV) की तरह काम करते हैं। एक FV को एक विशेष उपकरण के रूप में सोचें जो कहता है, "हे, उन उदाहरणों को देखो जो मैंने अभी देखे हैं, उस पैटर्न की नकल करो, और उसे नए प्रश्न पर लागू करो।"
3. बड़ी खोज: अलग दिमाग, अलग इंजन
शोधकर्ताओं ने ट्रांसफॉर्मर्स, शुद्ध मंबा (Mamba) मॉडल्स और हाइब्रिड मॉडल्स का परीक्षण किया। उन्हें यह पता चला:
"फैक्ट बुक" कार्य:
- ट्रांसफॉर्मर्स और हाइब्रिड्स: वे उन विशेष FV गियर्स का बहुत अधिक उपयोग करते हैं। जब आप इन गियर्स में बदलाव करते हैं, तो तथ्यों को याद करने की मॉडल की क्षमता नाटकीय रूप से बदल जाती है।
- मंबा (शुद्ध): यह भी FV गियर्स का उपयोग करता है, लेकिन वे अलग जगहों पर स्थित होते हैं।
- मंबा2 (नया खिलाड़ी): यह एक आश्चर्य है! मंबा2 लगभग बिल्कुल भी FV गियर्स का उपयोग नहीं करता है। ऐसा लगता है कि इसके पास तथ्यों को सीखने के लिए एक पूरी तरह से अलग, गुप्त तंत्र है। यह ऐसा है जैसे यह पता चलना कि जबकि बाकी सब दरवाज़ा खोलने के लिए चाबी का उपयोग करते हैं, मंबा2 बस दीवार के आर-पार निकल जाता है।
"रीडिंग कॉम्प्रिहेनशन" कार्य:
- यहाँ, FV गियर्स मुख्य नायक नहीं हैं। चाहे वह ट्रांसफॉर्मर हो या हाइब्रिड, कहानी को समझने के लिए जिम्मेदार "गियर्स" बिखरे हुए और अस्त-व्यस्त हैं। मॉडल संदर्भ को समझने के लिए किसी एक विशिष्ट उपकरण पर निर्भर नहीं रहता; यह अधिक सामान्य, वितरित (distributed) दृष्टिकोण का उपयोग करता है।
4. हाइब्रिड मॉडल्स: "दो-इंजन" वाला विमान
हाइब्रिड मॉडल्स (जैसे Hymba और Zamba2) दो इंजनों वाले हवाई जहाज की तरह हैं: एक ट्रांसफॉर्मर इंजन और एक मंबा इंजन।
- शोधकर्ताओं ने पाया कि नए कार्यों को सीखने के लिए, ट्रांसफॉर्मर इंजन लगभग सारा भारी काम कर रहा है।
- भले ही मंबा इंजन गति और दक्षता के लिए वहां मौजूद है, लेकिन ट्रांसफॉर्मर वाला हिस्सा ही वह "फंक्शन वेक्टर" टूल्स रखता है जो उदाहरणों से सीखने के लिए आवश्यक हैं।
- इससे कोई फर्क नहीं पड़ता कि इंजन एक के ऊपर एक रखे गए हैं या अगल-बगल; ट्रांसफॉर्मर वाला हिस्सा ही "सीखने" की चाबियाँ थामे हुए है।
5. "लेबल फ्लिपिंग" टेस्ट
यह साबित करने के लिए कि ये मॉडल्स वास्तव में सीख रहे हैं और केवल रट नहीं रहे हैं, शोधकर्ताओं ने एक चाल चली। उन्होंने मॉडल्स को बताया: "यदि उदाहरण में 'नफरत' (Hate) कहा गया है, तो उत्तर वास्तव में 'प्यार' (Love) है।"
- परिणाम: सभी मॉडल्स, जिनमें नए मंबा मॉडल्स भी शामिल थे, इतने स्मार्ट थे कि वे नए नियम को समझ सके और उसका पालन कर सके। इससे यह साबित हुआ कि वे केवल रटे हुए तथ्यों को दोहरा नहीं रहे थे; वे वास्तव में संदर्भ के अनुसार खुद को ढाल रहे थे।
निष्कर्ष (The Takeaway)
यह पेपर हमें बताता है कि AI एक अखंड इकाई (monolith) नहीं है। सिर्फ इसलिए कि दो मॉडल्स एक ही उत्तर देते हैं, इसका मतलब यह नहीं है कि वे एक ही तरह से सोच रहे हैं।
- ट्रांसफॉर्मर्स उन पुस्तकालयाध्यक्षों (librarians) की तरह हैं जो तथ्यों को खोजने के लिए एक विशिष्ट इंडेक्स कार्ड सिस्टम (FVs) का उपयोग करते हैं।
- मंबा2 एक जादूगर की तरह है जो उन समान तथ्यों को खोजने के लिए एक पूरी तरह से अलग मंत्र का उपयोग करता है।
- हाइब्रिड्स एक टीम की तरह हैं जहाँ पुस्तकालयाध्यक्ष तथ्य-जांच (fact-checking) करता है, जबकि जादूगर बाकी चीज़ों को संभालता है।
यह क्यों मायने रखता है?
यदि हम बेहतर, सुरक्षित या अधिक कुशल AI बनाना चाहते हैं, तो हम ट्रांसफॉर्मर्स के बारे में जो कुछ भी सीखा है, उसे मंबा मॉडल्स पर सीधे कॉपी-पेस्ट नहीं कर सकते। हमें यह समझना होगा कि विभिन्न आर्किटेक्चर के पास अलग-अलग "आंतरिक तंत्र" होते हैं। यदि हम किसी बग को ठीक करना चाहते हैं या सीखने की क्षमता में सुधार करना चाहते हैं, तो हमें जानना होगा कि प्रत्येक विशिष्ट प्रकार के दिमाग के लिए किन विशिष्ट "गियर्स" को घुमाना है।
संक्षेप में: यह पेपर विभिन्न AI दिमागों की आंतरिक वायरिंग को समझने के लिए एक मैनुअल है, जो हमें दिखाता है कि हालांकि वे सभी उदाहरणों से सीख सकते हैं, लेकिन वे इसे बहुत अलग उपकरणों के साथ करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।