Phasor Memory Networks: Stable Backpropagation Through Time for Scalable Explicit Memory
यह शोध पत्र फेज़र मेमोरी नेटवर्क (PMNet) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो यूनिटरी फेज़र डायनेमिक्स और पदानुक्रमित सीखने योग्य एंकर्स के माध्यम से स्पष्ट मेमोरी सिस्टम में लंबे समय से चली आ रही ग्रेडिएंट अस्थिरता को हल करता है, जिससे एक संक्षिप्त 119M पैरामीटर वाला मॉडल लंबी दूरी की रिट्रीवल (long-range retrieval) में लगभग पूर्णता प्राप्त करने और काफी बड़े मॉडलों के प्रदर्शन के बराबर पहुँचने में सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
बड़ी समस्या: "शॉर्ट-टर्म मेमोरी" की बाधा
कल्पना कीजिए कि आप एक 500 पन्नों की किताब पढ़ने की कोशिश कर रहे हैं। मानक AI मॉडल (जैसे आज के ट्रांसफॉर्मर्स) उन लोगों की तरह हैं जो केवल पिछले कुछ वाक्यों को ही याद रख पाते हैं। पेज 400 पर किसी वाक्य को समझने के लिए, उन्हें हर बार पूरी किताब शुरू से फिर से पढ़नी पड़ती है, जो अविश्वसनीय रूप से धीमा और अक्षम है।
अन्य मॉडल इसे एक "लॉन्ग-टर्म मेमोरी" देकर ठीक करने की कोशिश करते हैं, लेकिन वे अक्सर एक अलग समस्या से जूझते हैं: अस्थिरता (Instability)। कल्पना कीजिए कि आप 1,000 लोगों की एक कतार में एक राज की बात फुसफुसाकर पहुँचाने की कोशिश कर रहे हैं। जब तक वह संदेश अंत तक पहुँचता है, या तो संदेश पूरी तरह से बिगड़ जाता है (सिग्नल गायब हो जाता है) या यह इतना तेज़ और विकृत हो जाता है कि सिस्टम ही टूट जाता है (सिग्नल विस्फोट हो जाता है)। ऐसा तब होता है जब AI बहुत लंबे टेक्स्ट सीक्वेंस से सीखने की कोशिश करता है; गणित गड़बड़ा जाता है, और मॉडल या तो भूल जाता है या क्रैश हो जाता है।
समाधान: PMNet (एक "पूरी तरह संतुलित" लाइब्रेरी)
लेखकों ने एक नया आर्किटेक्चर पेश किया है जिसे PMNet (Phasor Memory Network) कहा जाता है। PMNet को एक ऐसे लाइब्रेरियन के रूप में सोचें जो केवल आखिरी कुछ शब्द नहीं चिल्लाता, बल्कि उसके पास एक पूरी तरह व्यवस्थित, अनंत लाइब्रेरी है जहाँ हर किताब इस तरह रखी गई है कि वह कभी खोती या विकृत नहीं होती।
यहाँ तीन मुख्य "जादु적인 ट्रिक्स" हैं जिनका PMNet उपयोग करता है:
1. घूमता हुआ दिशा-सूचक (यूनिटरी फेज़र डायनेमिक्स)
अधिकांश AI मॉडल अपनी मेमोरी को अपडेट करने के लिए संख्याओं को आपस में जोड़ते हैं। यदि आप संख्याओं को जोड़ते रहते हैं, तो वे बहुत बड़ी (विस्फोट) या बहुत छोटी (लुप्त) हो जाती हैं।
- उपमा: एक दिशा-सूचक (Compass) की सुई की कल्पना करें। जानकारी संग्रहीत करने के लिए सुई को लंबा या छोटा करने के बजाय, PMNet केवल सुई को घुमाता (Rotate) है।
- यह क्यों काम करता है: आप सुई को कितनी भी बार घुमाएँ, उसकी लंबाई समान रहती है। यह कभी बहुत बड़ी या बहुत छोटी नहीं होती। यह गणितीय ट्रिक सुनिश्चित करती है कि "सिग्नल" (मेमोरी) पूरी तरह स्थिर रहे, चाहे कहानी कितनी भी लंबी क्यों न हो जाए। यह एक घेरे में चलने जैसा है: आप बिना केंद्र से दूर हुए हमेशा के लिए चल सकते हैं।
2. ज्ञान का वृक्ष (पदानुक्रमित मेमोरी/Hierarchical Memory)
मानक मॉडल सब कुछ एक बड़े ढेर में याद रखने की कोशिश करते हैं, जो अव्यवस्थित हो जाता है। PMNet अपनी मेमोरी को एक विशाल, शाखाओं वाले पेड़ की तरह व्यवस्थित करता है।
- उपमा: ढेर में किताब खोजने के बजाय, आप "इतिहास" अनुभाग में जाते हैं, फिर "20वीं सदी" की शेल्फ पर, और फिर "1990 के दशक" के बिन (Bin) पर जाते हैं।
- नवाचार: इस पेड़ की प्रत्येक शाखा में एक विशिष्ट "एंकर" (एक सीखा हुआ लेबल) होता है। यह मॉडल को बिना भटके अपनी मेमोरी के सही हिस्से पर सीधे जाने की अनुमति देता है। यह सूचना का एक विशाल भंडार (जैसे 85-स्लॉट वाला पेड़) स्टोर कर सकता है, लेकिन उसे जो चाहिए उसे खोजने के लिए केवल कुछ ही जगहों की जाँच करनी पड़ती है।
3. ट्रैफिक पुलिस (सेगमेंट-अवेयर नॉर्मलाइजेशन)
जब कई लोग एक ही समय में एक ही मेमोरी स्लॉट को अपडेट करने की कोशिश करते हैं, तो इससे "ट्रैफिक जाम" हो सकता है जो गणित को तोड़ देता है।
- उपमा: कल्पना कीजिए कि लोगों का एक समूह एक ही व्हाइटबोर्ड पर लिखने की कोशिश कर रहा है। यदि वे सभी पूरी गति से लिखते हैं, तो बोर्ड पर गंदगी हो जाएगी। PMNet एक ट्रैफिक पुलिस की तरह काम करता है, जो सबको यह बताता है कि कितने लोग लिख रहे हैं, उसके आधार पर अपनी गति को आनुपातिक रूप से कम रखें। यह सुनिश्चित करता है कि "शोर" (Noise) का स्तर एकदम सही रहे ताकि संदेश स्पष्ट बना रहे।
उन्होंने क्या सिद्ध किया?
लेखकों ने केवल इसे बनाया ही नहीं; उन्होंने इसे कुछ चतुर प्रयोगों के साथ टेस्ट भी किया:
- "कॉपी-पेस्ट" टेस्ट: उन्होंने मॉडल को एक कार्य दिया जहाँ उसे टेक्स्ट की एक रैंडम स्ट्रिंग को याद रखना था और बाद में उसे दोहराना था। मानक मॉडल विफल हो गए जैसे ही टेक्स्ट उनके "शॉर्ट-टर्म विंडो" से लंबा हुआ। हालाँकि, PMNet ने टेक्स्ट को पूरी तरह से याद रखा, भले ही वह हजारों वर्ण (Characters) लंबा था, जिससे यह साबित हुआ कि यह वास्तव में अपनी लॉन्ग-टर्म मेमोरी का उपयोग कर सकता है।
- "लंबी किताब" टेस्ट: उन्होंने एक छोटे PMNet (119 मिलियन पैरामीटर्स) को बहुत सारे टेक्स्ट पर प्रशिक्षित किया। फिर, उन्होंने इसे एक ऐसी किताब पढ़ने के लिए कहा जो इसने पहले कभी नहीं देखी थी (PG-19 डेटासेट)।
- परिणाम: इस छोटे PMNet ने एक बहुत बड़े मॉडल (जो 3 गुना बड़ा है) जिसे Mamba कहा जाता है, के बराबर प्रदर्शन किया।
- तुलना: एक मानक मॉडल (SmolLM) ने उसी किताब को पढ़ने की कोशिश की लेकिन जैसे ही टेक्स्ट उसकी मेमोरी सीमा से आगे गया, वह पूरी तरह विफल हो गया, जैसे कोई व्यक्ति केवल पिछले दो शब्दों को याद रखते हुए किताब पढ़ने की कोशिश कर रहा हो। PMNet ने सहजता से पढ़ना जारी रखा।
निचोड़ (The Bottom Line)
पेपर का दावा है कि लंबे समय तक विशेषज्ञों को लगा कि "एक्सप्लिसिट मेमोरी" (AI को एक वास्तविक नोटबुक देना) को प्रशिक्षित करना असंभव है क्योंकि गणित बहुत अस्थिर था।
PMNet इस गतिरोध को तोड़ता है। चीजों को स्थिर रखने के लिए "घूमते हुए दिशा-सूचक" के गणित और सूचना को व्यवस्थित करने के लिए "वृक्ष संरचना" का उपयोग करके, उन्होंने एक ऐसा मॉडल बनाया जो:
- टेक्स्ट में बहुत पीछे से चीजों को याद रख सकता है।
- ऐसा करने के लिए गणित को विस्फोट या लुप्त होने से बचा सकता है।
- बहुत बड़े मॉडलों के समान प्रदर्शन कर सकता है, लेकिन कम "मस्तिष्क कोशिकाओं" (पैरामीटर्स) के साथ।
लेखक स्वीकार करते हैं कि वर्तमान में, उनका कोड सबसे तेज़ वाणिज्यिक मॉडलों की तुलना में थोड़ा धीमा है क्योंकि इसे अभी तक कंप्यूटर चिप्स के लिए पूरी तरह से अनुकूलित (Optimize) नहीं किया गया है, लेकिन सिद्धांत पूरी तरह से काम करता है, जो यह साबित करता है कि AI के लिए स्थिर, दीर्घकालिक स्मृति (Long-term memory) संभव है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।