← नवीनतम पेपर
💬 NLP

Understanding In-Context Learning Beyond Transformers: An Investigation of State Space and Hybrid Architectures

यह शोध पत्र ट्रांसफॉर्मर, स्टेट-स्पेस और हाइब्रिड आर्किटेक्चर में इन-कॉन्टेक्स्ट लर्निंग की जांच करता है, जो यह प्रकट करता है कि हालांकि ये मॉडल समान व्यवहार संबंधी प्रदर्शन प्रदर्शित करते हैं, उनके आंतरिक तंत्र काफी भिन्न हैं, जिसमें फंक्शन वेक्टर्स पैरामीट्रिक ज्ञान पुनर्प्राप्ति में एक महत्वपूर्ण भूमिका निभाते हैं लेकिन अनिवार्य रूप से प्रासंगिक समझ (कॉन्टेक्स्टुअल अंडरस्टैंडिंग) में नहीं।

मूल लेखक: Shenran Wang, Timothy Tin-Long Tse, Jian Zhu

प्रकाशित 2026-03-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shenran Wang, Timothy Tin-Long Tse, Jian Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बच्चे को पहेली सुलझाना सिखा रहे हैं। आप उसे कोई पाठ्यपुस्तक नहीं देते; इसके बजाय, आप उसे करने के तीन उदाहरण दिखाते हैं, और फिर आप उसे चौथी पहेली हल करने के लिए कहते हैं। यह इन-कॉन्टेक्स्ट लर्निंग (ICL) है। यह वह जादुई ट्रिक है जहाँ लार्ज लैंग्वेज मॉडल्स (LLMs) बिना दोबारा ट्रेनिंग लिए, केवल बातचीत में दिए गए उदाहरणों को देखकर नए काम सीख जाते हैं।

लंबे समय तक, वैज्ञानिकों को लगा कि यह जादू केवल ट्रांसफॉर्मर्स (Transformers) (वर्तमान मानक AI आर्किटेक्चर) में ही काम करता है। उन्होंने ट्रांसफॉर्मर के दिमाग के अंदर कुछ विशिष्ट "गियर्स" (gears) पाए, जिन्हें फंक्शन वेक्टर्स (Function Vectors - FVs) कहा जाता है, जो इस सीखने की प्रक्रिया को चलाने वाले इंजन की तरह काम करते हैं।

लेकिन हाल ही में, AI के नए प्रकार आए हैं: स्टेट स्पेस मॉडल्स (जैसे Mamba) और हाइब्रिड मॉडल्स (Hybrid models) (ट्रांसफॉर्मर और मंबा का मिश्रण)। बड़ा सवाल यह था कि: क्या ये नए दिमाग भी उन्हीं गियर्स का उपयोग करके सीखते हैं, या उनके पास एक गुप्त, अलग इंजन है?

यह पेपर एक जासूसी कहानी की तरह है जहाँ लेखक इन विभिन्न AI दिमागों को खोलकर देखते हैं कि वे कैसे काम करते हैं। यहाँ इसका सरल विवरण दिया गया है:

1. "सीखने" के दो प्रकार

शोधकर्ताओं ने महसूस किया कि सभी पहेलियाँ एक जैसी नहीं होतीं। उन्होंने कार्यों को दो श्रेणियों में विभाजित किया:

  • "फैक्ट बुक" कार्य (पैरामीट्रिक नॉलेज): कल्पना कीजिए कि आपसे पूछा जाए, "फ्रांस की राजधानी क्या है?" मॉडल को बस उस तथ्य को निकालने की आवश्यकता है जिसे उसने पहले से याद कर रखा है। यह शब्दकोश में शब्द खोजने जैसा है।
  • "रीडिंग कॉम्प्रिहेनशन" कार्य (कॉन्टेक्स्टुअल नॉलेज): कल्पना कीजिए कि आप एक कुत्ते के बारे में एक छोटी कहानी पढ़ रहे हैं और फिर पूछा जाता है, "क्या कुत्ता खुश है?" मॉडल को उस कहानी को समझना होगा जो उसके सामने है, न कि केवल किसी तथ्य को निकालना। यह एक चुटकुले को समझने जैसा है।

2. "गियर्स" (फंक्शन वेक्टर्स)

पुराने ज़माने के ट्रांसफॉर्मर्स में, वैज्ञानिकों ने पाया कि विशिष्ट "अटेंशन हेड्स" (attention heads) एक फंक्शन वेक्टर (FV) की तरह काम करते हैं। एक FV को एक विशेष उपकरण के रूप में सोचें जो कहता है, "हे, उन उदाहरणों को देखो जो मैंने अभी देखे हैं, उस पैटर्न की नकल करो, और उसे नए प्रश्न पर लागू करो।"

3. बड़ी खोज: अलग दिमाग, अलग इंजन

शोधकर्ताओं ने ट्रांसफॉर्मर्स, शुद्ध मंबा (Mamba) मॉडल्स और हाइब्रिड मॉडल्स का परीक्षण किया। उन्हें यह पता चला:

  • "फैक्ट बुक" कार्य:

    • ट्रांसफॉर्मर्स और हाइब्रिड्स: वे उन विशेष FV गियर्स का बहुत अधिक उपयोग करते हैं। जब आप इन गियर्स में बदलाव करते हैं, तो तथ्यों को याद करने की मॉडल की क्षमता नाटकीय रूप से बदल जाती है।
    • मंबा (शुद्ध): यह भी FV गियर्स का उपयोग करता है, लेकिन वे अलग जगहों पर स्थित होते हैं।
    • मंबा2 (नया खिलाड़ी): यह एक आश्चर्य है! मंबा2 लगभग बिल्कुल भी FV गियर्स का उपयोग नहीं करता है। ऐसा लगता है कि इसके पास तथ्यों को सीखने के लिए एक पूरी तरह से अलग, गुप्त तंत्र है। यह ऐसा है जैसे यह पता चलना कि जबकि बाकी सब दरवाज़ा खोलने के लिए चाबी का उपयोग करते हैं, मंबा2 बस दीवार के आर-पार निकल जाता है।
  • "रीडिंग कॉम्प्रिहेनशन" कार्य:

    • यहाँ, FV गियर्स मुख्य नायक नहीं हैं। चाहे वह ट्रांसफॉर्मर हो या हाइब्रिड, कहानी को समझने के लिए जिम्मेदार "गियर्स" बिखरे हुए और अस्त-व्यस्त हैं। मॉडल संदर्भ को समझने के लिए किसी एक विशिष्ट उपकरण पर निर्भर नहीं रहता; यह अधिक सामान्य, वितरित (distributed) दृष्टिकोण का उपयोग करता है।

4. हाइब्रिड मॉडल्स: "दो-इंजन" वाला विमान

हाइब्रिड मॉडल्स (जैसे Hymba और Zamba2) दो इंजनों वाले हवाई जहाज की तरह हैं: एक ट्रांसफॉर्मर इंजन और एक मंबा इंजन।

  • शोधकर्ताओं ने पाया कि नए कार्यों को सीखने के लिए, ट्रांसफॉर्मर इंजन लगभग सारा भारी काम कर रहा है।
  • भले ही मंबा इंजन गति और दक्षता के लिए वहां मौजूद है, लेकिन ट्रांसफॉर्मर वाला हिस्सा ही वह "फंक्शन वेक्टर" टूल्स रखता है जो उदाहरणों से सीखने के लिए आवश्यक हैं।
  • इससे कोई फर्क नहीं पड़ता कि इंजन एक के ऊपर एक रखे गए हैं या अगल-बगल; ट्रांसफॉर्मर वाला हिस्सा ही "सीखने" की चाबियाँ थामे हुए है।

5. "लेबल फ्लिपिंग" टेस्ट

यह साबित करने के लिए कि ये मॉडल्स वास्तव में सीख रहे हैं और केवल रट नहीं रहे हैं, शोधकर्ताओं ने एक चाल चली। उन्होंने मॉडल्स को बताया: "यदि उदाहरण में 'नफरत' (Hate) कहा गया है, तो उत्तर वास्तव में 'प्यार' (Love) है।"

  • परिणाम: सभी मॉडल्स, जिनमें नए मंबा मॉडल्स भी शामिल थे, इतने स्मार्ट थे कि वे नए नियम को समझ सके और उसका पालन कर सके। इससे यह साबित हुआ कि वे केवल रटे हुए तथ्यों को दोहरा नहीं रहे थे; वे वास्तव में संदर्भ के अनुसार खुद को ढाल रहे थे।

निष्कर्ष (The Takeaway)

यह पेपर हमें बताता है कि AI एक अखंड इकाई (monolith) नहीं है। सिर्फ इसलिए कि दो मॉडल्स एक ही उत्तर देते हैं, इसका मतलब यह नहीं है कि वे एक ही तरह से सोच रहे हैं।

  • ट्रांसफॉर्मर्स उन पुस्तकालयाध्यक्षों (librarians) की तरह हैं जो तथ्यों को खोजने के लिए एक विशिष्ट इंडेक्स कार्ड सिस्टम (FVs) का उपयोग करते हैं।
  • मंबा2 एक जादूगर की तरह है जो उन समान तथ्यों को खोजने के लिए एक पूरी तरह से अलग मंत्र का उपयोग करता है।
  • हाइब्रिड्स एक टीम की तरह हैं जहाँ पुस्तकालयाध्यक्ष तथ्य-जांच (fact-checking) करता है, जबकि जादूगर बाकी चीज़ों को संभालता है।

यह क्यों मायने रखता है?
यदि हम बेहतर, सुरक्षित या अधिक कुशल AI बनाना चाहते हैं, तो हम ट्रांसफॉर्मर्स के बारे में जो कुछ भी सीखा है, उसे मंबा मॉडल्स पर सीधे कॉपी-पेस्ट नहीं कर सकते। हमें यह समझना होगा कि विभिन्न आर्किटेक्चर के पास अलग-अलग "आंतरिक तंत्र" होते हैं। यदि हम किसी बग को ठीक करना चाहते हैं या सीखने की क्षमता में सुधार करना चाहते हैं, तो हमें जानना होगा कि प्रत्येक विशिष्ट प्रकार के दिमाग के लिए किन विशिष्ट "गियर्स" को घुमाना है।

संक्षेप में: यह पेपर विभिन्न AI दिमागों की आंतरिक वायरिंग को समझने के लिए एक मैनुअल है, जो हमें दिखाता है कि हालांकि वे सभी उदाहरणों से सीख सकते हैं, लेकिन वे इसे बहुत अलग उपकरणों के साथ करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →