← नवीनतम पेपर
📊 statistics

RotRNN: Modelling Long Sequences with Rotations

यह शोध पत्र RotRNN प्रस्तुत करता है, जो एक लीनियर रिकरेंट न्यूरल नेटवर्क है जो रोटेशन मैट्रिसेस के गुणों का लाभ उठाकर लंबी अनुक्रम मॉडलिंग (long sequence modelling) के लिए जटिल अत्याधुनिक मॉडलों के एक सरल, कुशल और सुदृढ़ रूप से सामान्यीकृत विकल्प के रूप में कार्य करता है, जो प्रासंगिक बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

मूल लेखक: Kai Biegun, Rares Dolga, Jake Cunningham, David Barber

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kai Biegun, Rares Dolga, Jake Cunningham, David Barber

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी कहानी याद करने की कोशिश कर रहे हैं, जैसे कि कोई उपन्यास या किसी जटिल फिल्म की कहानी। आपके मस्तिष्क (या कंप्यूटर मॉडल) को कहानी के अंत को पढ़ते समय उसकी शुरुआत को थामे रखना होगा, बिना अभिभूत हुए या विवरणों को भूले।

लंबे समय तक, कंप्यूटर इस मामले में संघर्ष करते रहे। मानक मॉडल या तो "थक" जाते थे और शुरुआत को भूल जाते थे (वैनिशिंग ग्रेडिएंट की समस्या) या फिर वे अराजकता में "बिखर" जाते थे (एक्सप्लोडिंग ग्रेडिएंट की समस्या)।

हाल ही में, एक नए प्रकार का कंप्यूटर मॉडल जिसे लिनियर रिकरेंट न्यूरल नेटवर्क (जैसे S4 या LRU) कहा जाता है, बहुत लोकप्रिय हुआ क्योंकि यह लंबी अनुक्रमों (sequences) को याद रखने में बहुत कुशल है। हालाँकि, ये मॉडल कुछ हद तक उच्च-प्रदर्शन वाली रेसिंग कारों की तरह हैं जिन्हें ट्यून करना अविश्वसनीय रूप से कठिन है। उन्हें काम करने के लिए बहुत विशिष्ट, जटिल "प्रारंभिक सेटिंग्स" (इनिशियलाइजेशन) की आवश्यकता होती है, और फिर भी, यह पूरी तरह स्पष्ट नहीं है कि वे इतने अच्छी तरह से क्यों काम करते हैं। कभी-कभी, इनके पीछे का गणित इस तरह से नहीं होता जैसे इन्हें वास्तव में कोड में बनाया गया है।

यहाँ आता है RotRNN, प्रस्तावित नया मॉडल।

मुख्य विचार: घूमता हुआ लट्टू (The Spinning Top)

इस शोध पत्र के लेखकों ने पूछा: "क्या होगा यदि हम अपनी स्मृति प्रणाली (memory system) को घूर्णन (rotation) का उपयोग करके बनाएँ?"

एक रोटेशन मैट्रिक्स को एक आदर्श घूमते हुए लट्टू के रूप में सोचें।

  • यदि आप एक लट्टू को घुमाते हैं, तो वह सीधा और स्थिर रहता है। वह बड़ा या छोटा नहीं होता; वह बस घूमता रहता है।
  • गणित में, एक रोटेशन मैट्रिक्स का एक विशेष गुण होता है: यह जिस भी चीज़ को छूता है, उसके "आकार" (या नॉर्म) को सुरक्षित रखता है। यदि आप एक संख्या को रोटेशन में डालते हैं, तो आउटपुट उसी आकार का होता है, बस एक अलग दिशा में घूम जाता है।

लेखकों ने महसूस किया कि यदि वे अपनी स्मृति प्रणाली को पूरी तरह से इन "घूमते हुए लट्टुओं" से बनाते हैं, तो सिस्टम स्वाभाविक रूप से स्थिर रहेगा। यह गलती से बहुत बड़ा (explode) या बहुत छोटा (vanish) नहीं होगा।

यह कैसे काम करता है (सरल संस्करण)

  1. पिछले मॉडलों के साथ समस्या:
    कल्पित कीजिए कि आप कागजों के एक ढेर को संतुलित रखने की कोशिश कर रहे हैं। पिछले मॉडल (जैसे LRU) जटिल गणितीय नियमों के आधार पर कागजों के वजन को लगातार समायोजित करके इस ढेर को संतुलित करने की कोशिश करते थे। कभी-कभी ढेर डगमगा जाता था, और "वजन" (हिडन स्टेट) बहुत भारी या बहुत हल्का हो जाता था, जिससे मॉडल अस्थिर हो जाता था।

  2. RotRNN का समाधान:
    वजन को संतुलित करने के बजाय, RotRNN बस जानकारी को घुमाता (spin) है।

  • द स्पिन (The Spin): हर बार जब मॉडल डेटा का एक नया हिस्सा पढ़ता है, तो वह स्मृति को थोड़ा घुमाता है।
  • स्थिरता (The Stability): शुद्ध रोटेशन होने के कारण, स्मृति का "आकार" बिल्कुल समान रहता है। यह एक जगह घूमते हुए नर्तक की तरह है; वे कितनी भी बार घूमें, वे लंबे या छोटे नहीं होते।
  • क्षय (The Decay): यह सुनिश्चित करने के लिए कि मॉडल सब कुछ हमेशा के लिए याद न रखे (जो कि बुरा भी है), वे एक हल्का "ब्रेक" (डिके फैक्टर) जोड़ते हैं। यह मॉडल को वर्तमान स्मृतियों को स्थिर रखते हुए पुरानी स्मृतियों को धीरे-धीरे धुंधला करने की अनुमति देता है।

यह बेहतर क्यों है?

  • कोई जटिल सेटअप नहीं: पुराने मॉडलों को काम करने के लिए एक विशिष्ट, गणित-प्रधान शुरुआती बिंदु की आवश्यकता थी। RotRNN एक खिलौने की तरह है जो सीधे उपयोग के लिए तैयार है। आपको जटिल सेटिंग्स के साथ छेड़छाड़ करने की आवश्यकता नहीं है; रोटेशन का गणित इसे स्वतः ही स्थिर रखता है।
  • यह वही करता है जो यह कहता है: कभी-कभी, कंप्यूटर मॉडल सिद्धांत में एक तरह से बनाए जाते हैं लेकिन व्यवहार में अलग तरह से काम करते हैं। RotRNN अपने सिद्धांत के प्रति "निष्ठावान" है। कोड ठीक वैसा ही करता है जैसा कि गणित कहता है।
  • "मल्टी-हेड" ट्रिक: विभिन्न प्रकार की स्मृतियों (कुछ छोटी, कुछ लंबी) को संभालने के लिए, मॉडल कई "हेड्स" (जैसे एक साथ काम करने वाले कई घूमते हुए लट्टू) का उपयोग करता है। प्रत्येक लट्टू अपनी गति से घूमता है, जिससे मॉडल हाल की घटनाओं और बहुत समय पहले हुई चीजों, दोनों पर ध्यान केंद्रित कर पाता है।

परिणाम

लेखकों ने लंबी फाइलों को पढ़ने, टेक्स्ट को वर्गीकृत करने और बोले गए शब्दों को पहचानने जैसे कई कठिन कार्यों पर RotRNN का परीक्षण किया।

  • प्रदर्शन: इसने मौजूदा सर्वोत्तम मॉडलों (स्टेट-ऑफ-द-आर्ट) के समान प्रदर्शन किया।
  • स्थिरता: जब उन्होंने प्रशिक्षण के दौरान मॉडल के भीतर स्मृति के "आकार" का निरीक्षण किया, तो RotRNN पूरी तरह से स्थिर रहा। इसके विपरीत, पिछले लोकप्रिय मॉडल (LRU) का स्मृति आकार बहुत अधिक उतार-चढ़ाव भरा था, जिसे स्थिर होने में बहुत समय लगा।

निचोड़ (The Bottom Line)

यह शोध पत्र RotRNN को पेश करता है, जो कंप्यूटरों के लिए लंबी अनुक्रमों को याद रखने का एक नया तरीका है। जटिल और नाजुक संतुलन बनाने के बजाय, यह घूर्णन (rotation) के सरल और स्थिर भौतिकी का उपयोग करता है। इसे बनाना आसान है, इसे चलाना अधिक स्थिर है, और यह वर्तमान में उपलब्ध सबसे उन्नत मॉडलों की तरह ही काम में सक्षम है। यह हमें याद दिलाता है कि कभी-कभी, सबसे सुंदर समाधान बस चीजों को घूमते रहने देना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →