← नवीनतम पेपर
💻 computer science

Parallel Recursive LSTM

यह शोध पत्र पैरेलल रिकर्सिव एलएसटीएम (PR-LSTM) का परिचय देता है, जो एक पदानुक्रमित आर्किटेक्चर है जो एक संतुलित गणना वृक्ष (balanced computation tree) पर टोकन अवस्थाओं को पुनरावर्ती रूप से विलय करके लघुगणकीय समानांतर गहराई (logarithmic parallel depth) प्राप्त करता है, जिससे यह पुनरावर्ती मॉडलों की मजबूत अवस्था-ट्रैकिंग क्षमताओं को समानांतर प्रसंस्करण की दक्षता के साथ जोड़कर बिना द्विघाती स्केलिंग (quadratic scaling) के लॉन्ग-कॉन्टेक्स्ट बेंचमार्क पर मानक RNNs, LSTMs और ट्रांसफॉर्मर्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Tristan Gaudreault, Yongyi Mao

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tristan Gaudreault, Yongyi Mao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पहेली को हल करने की कोशिश कर रहे हैं, लेकिन आपको इसे एक समय में एक ही टुकड़े के साथ, एक सख्त क्रम में करना होगा। आप टुकड़ा 1 उठाते हैं, फिर टुकड़ा 2, फिर टुकड़ा 3, और इसी तरह। यह पारंपरिक LSTMs (एक प्रकार का AI जो चीजों को याद रखता है) के काम करने का तरीका है। वे अब तक की कहानी को याद रखने में बेहतरीन हैं, लेकिन वे धीमे हैं क्योंकि वे एक समय में दो कदम नहीं उठा सकते। उन्हें अगला कदम शुरू करने से पहले पिछले कदम के खत्म होने का इंतजार करना पड़ता है।

दूसरी ओर, Transformers (आधुनिक चैटबॉट्स के पीछे का AI) एक टीम की तरह हैं जिसमें 1,000 लोग एक साथ पहेली को देख रहे हैं। वे अविश्वसनीय रूप से तेज़ हैं और वे तुरंत देख सकते हैं कि टुकड़ा 1, टुकड़े 1,000 से कैसे संबंधित है। लेकिन एक पेच है: जैसे-जैसे पहेली बड़ी होती जाती है, उन्हें करने वाले काम की मात्रा विस्फोट की तरह बढ़ती जाती है। यदि आप पहेली का आकार दोगुना करते हैं, तो उन्हें चार गुना अधिक काम करना पड़ता है। यह बहुत लंबी कहानियों के लिए उन्हें बहुत महंगा और धीमा बना देता है।

इस शोध पत्र के लेखकों, ट्रिस्टन गौड्रौल्ट और योंगी माओ ने काम करने का एक नया तरीका ईजाद किया है जिसे Parallel Recursive LSTM (PR-LSTM) कहा जाता है। इसे एक चतुर मध्य मार्ग के रूप में देखें जो दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त करता है।

"वृक्ष" (Tree) सादृश्य

एक सीधी रेखा में चलने (पुराने LSTM की तरह) या एक साथ सब कुछ देखने (Transformer की तरह) के बजाय, PR-LSTM काम को एक पारिवारिक वृक्ष (family tree) या टूर्नामेंट ब्रैकेट की तरह व्यवस्थित करता है।

  1. सेटअप: कल्पना कीजिए कि आपके पास 8 लोगों (टोकन) की एक लंबी कतार है जिन्हें प्रोसेस किया जाना है।
  2. पुराना तरीका (क्रमिक/Sequential): व्यक्ति 1, व्यक्ति 2 से बात करता है। फिर वह जोड़ा व्यक्ति 3 से बात करता है। फिर वह समूह व्यक्ति 4 से बात करता है। अंत तक पहुँचने के लिए इसमें 7 कदम लगते हैं।
  3. नया तरीका (PR-LSTM):
    • राउंड 1: व्यक्ति 1, व्यक्ति 2 से बात करता है उसी समय जब व्यक्ति 3, व्यक्ति 4 से बात कर रहा होता है, और व्यक्ति 5, व्यक्ति 6 से बात कर रहा होता है, इत्यादि। हर कोई जोड़ों में एक साथ काम करता है।
    • राउंड 2: (1+2) का परिणाम (3+4) के परिणाम से बात करता है। (5+6) का परिणाम (7+8) से बात करता है। फिर से, ये चीजें एक ही समय में होती हैं।
    • राउंड 3: दो बड़े समूह आपस में बात करते हैं।

इस तरह करने से, काम की "गहराई" नाटकीय रूप से कम हो जाती है। 8 आइटमों को प्रोसेस करने के लिए 7 कदम लेने के बजाय, इसमें केवल 3 कदम लगते हैं। यदि आपके पास 1,000 आइटम होते, तो पुराने तरीके में 1,000 कदम लगते, लेकिन इस नए तरीके में केवल लगभग 10 कदम लगते। इसे ही शोध पत्र में लॉगैरिद्मिक पैरेलल डेप्थ (logarithmic parallel depth) कहा गया है।

यह कैसे काम करता है (एक "स्मार्ट" विलय)

जटिल बात यह है कि वास्तविक बातचीत में, अर्थ बदल जाता है इस आधार पर कि आप चीजों को कैसे जोड़ते हैं। यह केवल सरल गणित नहीं है (जैसे A+B=B+AA + B = B + A)।

  • समस्या: अधिकांश तेज़, समानांतर विधियाँ केवल तभी काम करती हैं जब गणित सरल और पूर्वानुमानित हो (जैसे संख्याओं को जोड़ना)।
  • PR-LSTM का समाधान: लेखकों ने एक विशेष "विलय मशीन" (एक LSTM एनकोडर) बनाई है जो पेड़ के प्रत्येक नोड (node) पर स्थित होती है। जब सूचना के दो समूह मिलते हैं, तो यह मशीन "गेट्स" (स्मार्ट स्विच की तरह) का उपयोग यह तय करने के लिए करती है कि क्या रखना है, क्या भूलना है और क्या मिलाना है। यह एक जटिल, गैर-रेखीय प्रक्रिया है, लेकिन क्योंकि वृक्ष संरचना कई विलयों को एक ही समय में होने की अनुमति देती है, इसलिए यह तेज़ बनी रहती है।

उन्होंने क्या पाया

शोधकर्ताओं ने "औपचारिक भाषा" (formal language) की पहेलियों (जैसे यह जांचना कि क्या अक्षरों की एक स्ट्रिंग में 'A' की सम संख्या है, या सरल गणितीय समीकरणों को हल करना) के एक सेट पर इस नए AI का परीक्षण किया।

  • परिणाम: PR-LSTM इन पहेलियों को हल करने में मानक LSTMs या Transformers की तुलना में बहुत बेहतर था, विशेष रूप से जब पहेलियाँ बहुत लंबी हो गईं।
  • "मिसिंग डुप्लिकेट" की जीत: एक विशिष्ट परीक्षण जिसे "Missing Duplicate" (एक लंबी सूची में दोहराई गई वस्तु को खोजना) कहा जाता है, में PR-LSTM वहां सफल रहा जहां लगभग सभी अन्य मॉडल विफल रहे, सिवाय एक बहुत ही जटिल, मेमोरी-भारी मॉडल के।
  • गति बनाम मेमोरी:
    • Transformers जल्दी ही कंप्यूटर की मेमोरी (RAM) खत्म कर देते थे क्योंकि वे हर टुकड़े के बीच हर संबंध को याद रखने की कोशिश करते थे।
    • पुराने LSTMs मेमोरी खत्म नहीं करते थे, लेकिन वे एक-एक करके काम करने के कारण पूरा करने में बहुत लंबा समय लेते थे।
    • PR-LSTM सबसे सटीक विकल्प था: इसने मेमोरी भी खत्म नहीं की, और पुराने LSTMs की तुलना में बहुत तेज़ी से काम पूरा किया क्योंकि इसने "वृक्ष" पद्धति का उपयोग करके समानांतर (parallel) काम किया।

सीमाएं

शोध पत्र ईमानदारी से बताता है कि यह नया मॉडल अभी क्या नहीं कर सकता:

  • निश्चित संरचना: "वृक्ष" की संरचना निश्चित है। यह हमेशा पड़ोसियों को एक विशिष्ट पैटर्न में मिलाता है। कभी-कभी, एक कहानी में ऐसी आवश्यकता हो सकती है जहाँ आपको बहुत अजीब तरीके से शुरुआत से अंत तक कूदने की आवश्यकता हो, और यह कठोर वृक्ष संरचना हर प्रकार की समस्या के लिए एकदम सही फिट नहीं हो सकती है।
  • जटिलता: इसे एक मानक LSTM की तुलना में बनाना अधिक जटिल है।
  • परीक्षण का दायरा: उन्होंने केवल इन विशिष्ट तार्किक पहेलियों पर इसका परीक्षण किया है। उन्होंने अभी तक इसका परीक्षण उपन्यास लिखने या सामान्य बातचीत करने जैसे कार्यों के लिए नहीं किया है, इसलिए हमें यह नहीं पता कि वे उन कार्यों में कैसा प्रदर्शन करेंगे।

निष्कर्ष

शोध पत्र का दावा है कि आप एक धीमी, चरण-दर-चरण मेमोरी प्रणाली (LSTM) को ले सकते हैं और उसे एक तेज़, समानांतर वृक्ष संरचना में पुनर्गठित कर सकते हैं बिना उसकी याद रखने या तर्क करने की क्षमता खोए। यह साबित करता है कि आपको "धीमा लेकिन स्मार्ट" और "तेज़ लेकिन मेमोरी-भूखा" के बीच चयन करने की आवश्यकता नहीं है। आप एक ऐसा सिस्टम रख सकते हैं जो कुशल और गहरे तर्क में सक्षम दोनों हो, कम से कम उन तार्किक पहेलियों के लिए जिनका उन्होंने परीक्षण किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →