← नवीनतम पेपर
🤖 machine learning

Lifelong In-Context Learning with Transformers Requires Parametric Forms of Attention

यह शोध पत्र तर्क देता है कि इन-कॉन्टेक्स्ट लर्निंग (in-context learning) को आजीवन (lifelong) परिवेशों तक विस्तारित करने के लिए मानक ट्रांसफॉर्मर के मेमोरी-गहन, नॉनपैरामीट्रिक सॉफ्टमैक्स अटेंशन (nonparametric softmax attention) को पैरामीट्रिक अटेंशन तंत्रों से बदलने की आवश्यकता है जो निरंतर मेमोरी फुटप्रिंट बनाए रखने के लिए ऑनलाइन रिग्रेशन के माध्यम से की-वैल्यू (key-value) संबंधों को सीखते हैं, जबकि साथ ही वर्तमान सीमाओं की पहचान करता है और लॉन्ग-होराइजन (long-horizon) एआई एजेंटों के विकास को निर्देशित करने के लिए खुले प्रश्न प्रस्तावित करता है।

मूल लेखक: Luke McDermott, Robert W. Heath jr., Rahul Parhi

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luke McDermott, Robert W. Heath jr., Rahul Parhi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "अनंत नोटबुक" का जाल

कल्पना कीजिए कि आप एक रोबोट को जीवन भर का सहायक बनाने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। आप चाहते हैं कि वह उस हर चीज़ से सीखे जो वह देखता है, सुनता है और करता है—उस क्षण से लेकर जब तक वह चालू होता है, उस दिन तक जब तक वह बंद नहीं हो जाता।

वर्तमान AI मॉडल (ट्रांसफॉर्मर्स) उन प्रतिभाशाली छात्रों की तरह हैं जो आपके द्वारा उन्हें अभी सुनाई गई एक छोटी सी कहानी से सीख सकते हैं। इसे इन-कॉन्टेक्स्ट लर्निंग (In-Context Learning) कहा जाता है। यदि आप कहते हैं, "यहाँ एक नियम है: यदि आप लाल बत्ती देखें, तो रुक जाएँ," तो रोबोट तुरंत उसका पालन करता है।

हालाँकि, इसमें एक पेंच है। इन नियमों को याद रखने के लिए, वर्तमान मॉडल एक ऐसी विधि का उपयोग करते हैं जो एक बढ़ती हुई नोटबुक रखने के समान है। हर बार जब रोबोट कोई नया तथ्य सीखता है या कोई नया उदाहरण देखता है, तो वह नोटबुक के एक नए पन्ने पर उसे लिख देता है।

  • समस्या: जैसे-जैसे रोबोट लंबा जीवन जीता है, नोटबुक मोटी होती जाती है। अंततः, नोटबुक इतनी भारी (बहुत अधिक मेमोरी) हो जाती है और उसे पढ़ने में इतना अधिक समय लगता है (बहुत अधिक कंप्यूटिंग पावर) कि रोबोट काम नहीं कर पाता। वह एक "हार्डवेयर वॉल" से टकरा जाता है। वह अपनी जेब में दस लाख पन्नों वाली नोटबुक लेकर नहीं चल सकता।

प्रस्तावित समाधान: "स्मार्ट समराइज़र" (Smart Summarizer)

लेखक तर्क देते हैं कि AI को वास्तव में आजीवन (lifelong) बनाने के लिए, हमें "बढ़ती हुई नोटबुक" का उपयोग करना बंद करना होगा और एक स्मार्ट समराइज़र का उपयोग करना शुरू करना होगा।

हर एक कच्चे तथ्य (जैसे "दोपहर 2:00 बजे, मैंने एक नीली कार देखी") को लिखने के बजाय, रोबrobot को उस जानकारी को एक निश्चित आकार के मानसिक मॉडल में कंप्रेस (compress) करना सीखना चाहिए।

  • उपमा: कल्पना कीजिए कि आप एक भाषा सीख रहे हैं।
    • वर्तमान विधि (नॉन-पैरामीट्रिक): आप एक शब्दकोश रखते हैं जो हर बार नया शब्द सीखने पर बड़ा होता जाता है। अंततः, आप वह शब्दकोश ले जाने में असमर्थ हो जाते हैं।
    • नई विधि (पैरामीट्रिक): आप हर शब्द को व्यक्तिगत रूप से याद नहीं करते हैं। इसके बजाय, आप भाषा के व्याकरण और पैटर्न को सीखते हैं। आपका मस्तिष्क (मॉडल) उसी आकार का रहता है, लेकिन वह सीखे गए नियमों के आधार पर यह अनुमान लगाने में अधिक स्मार्ट हो जाता है कि आगे क्या होने वाला है।

यह कैसे काम करता है: "टेस्ट-टाइम ट्रेनिंग" (Test-Time Training)

यह पेपर इस स्मार्ट समराइज़र को बनाने का एक विशिष्ट तरीका सुझाता है। वे इसे टेस्ट-टाइम ट्रेनिंग कहते हैं।

रोबोट के अटेंशन मैकेनिज्म (वह हिस्सा जो तय करता है कि उसे किस पर ध्यान केंद्रित करना है) को एक स्थिर लुकअप टूल के रूप में नहीं, बल्कि एक ऐसे छात्र के रूप में सोचें जो परीक्षा दे रहा है जबकि शिक्षक अभी भी बोल रहा है

  1. सेटअप: रोबलेट सूचनाओं की एक स्ट्रीम (कीज़ और वैल्यूज़) प्राप्त करता है।
  2. कार्य: वह उनके बीच के संबंध का अनुमान लगाने की कोशिश करता है।
  3. अपडेट: अनुमान लगाने के तुरंत बाद, वह जाँचता है कि क्या वह सही था। यदि वह गलत था, तो वह तुरंत अपने आंतरिक "ब्रेन वेट्स" (brain weights) को बेहतर बनाने के लिए उनमें बदलाव करता है।
  4. परिणाम: भविष्य को याद करने के लिए अतीत को स्टोर करने के बजाय, यह भविष्य की भविष्यवाणी करने के लिए अपनी वर्तमान समझ को अपडेट करता है।

यह रोबोट को सूचना की एक अनंत स्ट्रीम को प्रोसेस करने की अनुमति देता है क्योंकि वह स्ट्रीम को स्टोर नहीं कर रहा है; वह स्ट्रीम से सीख रहा है।

मौजूदा "शॉर्टकट" क्यों काम नहीं करते

पेपर बताता है कि लोगों ने "बढ़ती हुई नोटबुक" की समस्या को ठीक करने के लिए स्पार्स अटेंशन (Sparse Attention) का उपयोग किया है।

  • उपमा: यह रोबोट के इस निर्णय जैसा है कि, "मैं अपनी पूरी नोटबुक नहीं पढ़ सकता, इसलिए मैं उन पन्नों को फेंक दूँगा जिन्हें मैं उबाऊ समझता हूँ और केवल अंतिम 10 पन्नों को रखूँगा।"
  • दोष: यह छोटे कार्यों के लिए काम करता है, लेकिन एक आजीवन एजेंट के लिए, यह विफल हो जाता है। यदि रोबोट वह पन्ना फेंक देता है जिसमें लिखा था "पासवर्ड 1234 है" तीन सप्ताह पहले, तो वह आज पहेली को कभी हल नहीं कर पाएगा। उसे पुरानी यादों को सामान्य ज्ञान में विलय (merge) करने की आवश्यकता है, न कि केवल उन्हें हटाने की।

बाधाएं (खुले प्रश्न)

लेखक स्वीकार करते हैं कि हालांकि यह "स्मार्ट समराइज़र" विचार सही दिशा में है, लेकिन हमारे पास अभी तक सटीक रेसिपी नहीं है। वे भविष्य के लिए तीन मुख्य प्रश्न पूछते हैं:

  1. लक्ष्य क्या है? क्या रोबोट को केवल सटीक तथ्यों को याद रखना चाहिए (जैसे एक फोटो एल्बम), या उसे तथ्यों के पीछे के सिद्धांत (concept) को समझना चाहिए (जैसे एक दार्शनिक)? पेपर सुझाव देता है कि हमें रोबोट को केवल याद रखने के लिए नहीं, बल्कि सामान्यीकरण (generalize) करने के लिए सिखाने की आवश्यकता है।
  2. हम रुझानों (trends) को कैसे सीखें? यदि रोबोट आज कुछ सीखता है, तो वह यह कैसे सुनिश्चित करेगा कि वह ज्ञान कल ओवरराइट न हो जाए? हमें अपने मस्तिष्क को अपडेट करने के बेहतर तरीके चाहिए ताकि वह केवल पिछले कुछ सेकंड को नहीं, बल्कि दीर्घकालिक पैटर्न को याद रखे।
  3. इसे किससे सीखना चाहिए? अभी, रोबोट सरल, रैखिक (linear) कनेक्शनों से सीखता है। शायद हमें इसे डेटा में अधिक जटिल, गैर-रैखिक (non-linear) पैटर्न खोजने के लिए सिखाने की आवश्यकता है ताकि वह वास्तव में दुनिया को समझ सके।

सारांश

पेपर का तर्क है कि AI को एक सच्चा आजीवन साथी बनने के लिए, इसे एक विशाल, बढ़ती हुई फ़ाइल में सब कुछ याद रखने की कोशिश करना बंद करना होगा। इसके बजाय, इसे एक निश्चित आकार के मस्तिष्क को निरंतर अपडेट करना सीखना होगा जो अनुभव का सार (summarize) निकालता है। इसके लिए AI के "ध्यान देने" के तरीके को बदलने की आवश्यकता है, इसे एक स्थिर लाइब्रेरियन से एक गतिशील, सीखने वाले छात्र में बदलने की आवश्यकता है जो बिना अतिरिक्त स्थान की आवश्यकता के, हर क्षण के साथ स्मार्ट होता जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →