← नवीनतम पेपर
🤖 machine learning

Memory as a Markov Matrix: Sample Efficient Knowledge Expansion via Token-to-Dictionary Mapping

यह लेख मेमोरी को एक मार्कोव ट्रांज़िशन मैट्रिक्स के रूप में दर्शाकर और कैटास्ट्रोफिक फॉरगेटिंग (विस्मृति) से बचने के लिए न्यूनतम एम्बेडिंग अपडेट के साथ एक टोकन-टू-वोकैबुलरी मैपिंग रणनीति का उपयोग करके, लार्ज लैंग्वेज मॉडल्स में निरंतर ज्ञान विस्तार के लिए एक सैंपल-एफिशिएंट फ्रेमवर्क प्रस्तावित करता है।

मूल लेखक: Kaustubh Pethkar, Ziyang Xiong, Zuofeng Shang, Yingcong Li

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaustubh Pethkar, Ziyang Xiong, Zuofeng Shang, Yingcong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, अत्यधिक व्यवस्थित कहानियों के पुस्तकालय के रूप में करें। हर बार जब मॉडल एक वाक्य पढ़ता है, तो यह ऐसा है जैसे एक लाइब्रेरियन पिछले शब्द को देखता है और अनुमान लगाता है कि अगला शब्द क्या होगा।

सामान्यतः, यदि आप इस लाइब्रेरियन को एक नया शब्द (जैसे कि कोई नया वैज्ञानिक शब्द या स्लैंग अभिव्यक्ति) सिखाना चाहते हैं, तो आपको पूरे पुस्तकालय को फिर से प्रशिक्षित (retrain) करना होगा। हालाँकि, समस्या यहाँ है: जब आप नए शब्द को सीखने के लिए पूरे पुस्तकालय को फिर से प्रशिक्षित करते हैं, तो लाइब्रेरियन अक्सर पुरानी कहानियों को सही ढंग से बताना भूल जाता है। इसे "कैटास्ट्रोफिक फॉरगेटिंग" (catastrophic forgetting) या विनाशकारी विस्मृति कहा जाता है।

यह लेख एक चतुर, कम प्रयास वाले तरीके का प्रस्ताव करता है जिससे पुराने शब्दों को नुकसान पहुँचाए बिना नए शब्द जोड़े जा सकें। यहाँ सरल उपमाओं के साथ इसका विवरण दिया गया है:

1. पुस्तकालय एक "ट्रैफिक मैप" के रूप में (मार्कोव विचार)

लेखक भाषा मॉडल को एक जटिल मस्तिष्क के रूप में नहीं, बल्कि एक ट्रैफिक मैप के रूप में देखते हैं।

  • नोड्स (Nodes): शब्दकोश का हर शब्द मानचित्र पर एक शहर है।
  • सड़कें (Roads): शब्दों के बीच के संबंध सड़कें हैं। यदि आप "The" नामक शहर में हैं, तो कुछ सड़कें "cat," "dog," या "sun" की ओर ले जाती हैं।
  • स्मृति (Memory): मॉडल की "स्म記憶" केवल इन सड़कों का मानचित्र है। वह जानता है कि "The" के बाद आमतौर पर "cat" आने की एक निश्चित संभावना होती है।

2. समस्या: एक नया शहर जोड़ना

यदि आप मॉडल को एक नया शब्द (मान लीजिए "Zorp") सिखाना चाहते हैं, तो आप अनिवार्य रूप से मानचित्र में एक नया शहर जोड़ रहे हैं।

  • पुराना तरीका (फुल फाइन-ट्यूनिंग): आप "Zorp" को शामिल करने के लिए पूरे मानचित्र को फिर से बनाने की कोशिश करते हैं। ऐसा करने में, आप अनजाने में पुराने शहरों के बीच की सड़कों को हटा देते हैं या बदल देते हैं। लाइब्रेरियन भूल जाता है कि "The" का रास्ता "cat" की ओर जाता है और इसके बजाय वह कहने लगता है कि "The" का रास्ता "Zorp" की ओर जाता है।
  • लेख का तरीका: पूरे मानचित्र को फिर से बनाने के बजाय, आप बस "Zorp" के लिए एक साइन (संकेत) जोड़ देते हैं। आप कहते हैं: "हे, जब आप 'Zorp' देखें, तो इसके साथ बिल्कुल वैसा ही व्यवहार करें जैसा आप 'The' या 'Cat' के साथ करते हैं।"

3. समाधान: "टोकन-टू-डिक्शनरी" मैप

लेख एक रणनीति का प्रस्ताव करता है जिसे टोकन-टू-डिक्शनरी मैपिंग कहा जाता है।

  • कल्पना कीजिए कि आपके पास एक नया, अजीब शब्द "Zorp" है। मॉडल को "Zorp" का अर्थ शुरू से सिखाने के बजाय, आप मॉडल को बताते हैं: "जब आप 'Zorp' देखें, तो बस ऐसा व्यवहार करें जैसे वह शब्द 'Star' हो।"
  • मॉडल को "Zorp" के लिए नई सड़कें सीखने की आवश्यकता नहीं है। उसे केवल यह जानने की आवश्यकता है कि "Zorp" उसी गंतव्य की ओर संकेत करता है जहाँ "Star" संकेत करता है।
  • चूंकि मॉडल को मौजूदा सड़कों (पुराने शब्दों के बीच संक्रमण की संभावनाओं) को बदलने की आवश्यकता नहीं है, इसलिए वह पुरानी कहानियों को कभी नहीं भूलता।

4. "सैंपल एफिशिएंसी" (यह तेज़ क्यों है)

लेखक गणितीय रूप से सिद्ध करते हैं कि यह अविश्वसनीय रूप से कुशल है।

  • उपमा: यदि आप एक नया शब्द सीखना चाहते हैं, तो आपको पूरे पुस्तकालय को फिर से पढ़ने की आवश्यकता नहीं है। आपको केवल कुछ उदाहरणों को पढ़ने की आवश्यकता है कि वाक्यों में इस नए शब्द का उपयोग कैसे किया जाता है।
  • गणित: आपको कितने उदाहरणों की आवश्यकता है, यह इस बात पर निर्भर करता है कि आप नए शब्द को कितने मौजूदा शब्दों से जोड़ते हैं। यदि आप "Zorp" को केवल 5 सामान्य शब्दों से जोड़ते हैं, तो इसे सीखने के लिए आपको बहुत कम डेटा की आवश्यकता होगी। आपको पूरे पुस्तकालय के आकार की चिंता करने की आवश्यकता नहीं है (जो कि 1,00,000 शब्द हो सकता है)।

5. प्रयोग: गणित और मनगढ़ंत शब्द सिखाना

शोधकर्ताओं ने इसे दो परिदृश्यों के साथ परखा:

  1. मैजिक ऑपरेटर: उन्होंने मॉडल को एक विशेष प्रतीक (जैसे ⟨spec⟩) सिखाया जिसका अर्थ था "गुणा करना"।
    • परिणाम: मॉडल ने नए प्रतीक के साथ गुणा करना बहुत जल्दी सीख लिया।
    • लाभ: महत्वपूर्ण रूप से, मॉडल अभी भी संख्याओं को जोड़ना जानता था। अन्य तरीकों के साथ, नया प्रतीक सीखने से मॉडल जोड़ना भूल गया था। इस पद्धति ने जोड़ करने के कौशल को पूर्ण रखा।
  2. मनगढ़ंत शब्द: उन्होंने 100 काल्पनिक शब्द (जैसे "glor" और "zorp") बनाए और उन्हें वाक्यों में डाला।
    • परिणाम: मॉडल ने अंग्रेजी बोलने के तरीके को भूले बिना इन काल्पनिक शब्दों का सही उपयोग करना सीख लिया।
    • तुलना: अन्य तरीकों (जैसे मानक फाइन-ट्यूनिंग या LoRA) के कारण मॉडल ने काल्पनिक शब्दों को सीखते समय अंग्रेजी को भूल दिया। इस नई पद्धति के कारण भूलने की एक भी घटना नहीं हुई।

सारांश

इस पद्धति को एक घर में मौजूदा कमरों की दीवारों को गिराए बिना एक नया कमरा जोड़ने के रूप में समझें।

  • पुराना तरीका: एक नया कमरा जोड़ने के लिए, आप पूरे आधार (foundation) को फिर से बनाते हैं। पुराने कमरे टूट जाते हैं और ढह जाते हैं।
  • नया तरीका: आप नया कमरा बनाते हैं और एक ऐसा दरवाजा जोड़ते हैं जो सीधे एक मौजूदा गलियारे की ओर जाता है। पुराना गलियारा बिल्कुल वैसा ही रहता है जैसा वह था, और नया कमरा उसके अंदर पूरी तरह फिट हो जाता है।

लेख का दावा है कि यह बहुत कम डेटा बिंदुओं के साथ भाषा मॉडल की शब्दावली को विस्तारित करने का एक गणितीय रूप से सिद्ध तरीका है, जिसमें पूर्व ज्ञान का बिल्कुल भी नुकसान नहीं होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →