← नवीनतम पेपर
🤖 machine learning

Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior

यह शोध पत्र लेटेंट रिकरेंट ट्रांसफॉर्मर (LRT) को प्रस्तुत करता है, जो एक हल्का आर्किटेक्चर है जो इन्फरेंस डेप्थ (inference depth) बढ़ाए बिना उच्च-स्तरीय हिडन स्टेट्स (high-level hidden states) को रिकरेंट मेमोरी के रूप में पुन: उपयोग करके ऑटोरेग्रेसिव मॉडल्स को बेहतर बनाता है, और इस दृष्टिकोण को कुशलतापूर्वक स्केल करने के लिए एक इंटरलीव्ड पैरेलल ट्रेनिंग स्ट्रैटेजी का प्रस्ताव करता है, जिसके परिणामस्वरूप न्यूनतम पैरामीटर ओवरहेड के साथ बेहतर लैंग्वेज मॉडलिंग और इन-कॉन्टेक्स्ट लर्निंग प्रदर्शन प्राप्त होता है।

मूल लेखक: Zeyi Huang, Xuehai He, LiLiang Ren, Yiping Wang, Baolin Peng, Hao Cheng, Shuohang Wang, Pengcheng He, Jianfeng Gao, Yong Jae Lee, Yelong Shen

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeyi Huang, Xuehai He, LiLiang Ren, Yiping Wang, Baolin Peng, Hao Cheng, Shuohang Wang, Pengcheng He, Jianfeng Gao, Yong Jae Lee, Yelong Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक-एक शब्द करके कहानी लिखना सिखा रहे हैं। इसे करने के मानक तरीके (जिसे "ऑटोरेग्रेसिव ट्रांसफॉर्मर" कहा जाता है) में, रोबोट उन शब्दों को देखता है जो उसने पहले ही लिख दिए हैं, उनके बारे में सोचता है, और फिर अगला शब्द चुनता है। एक बार जब वह वह शब्द चुन लेता है, तो वह तुरंत आगे बढ़ जाता है। यह एक फैक्ट्री असेंबली लाइन की तरह है: हर आइटम मशीन के माध्यम से एक त्वरित पास प्राप्त करता है, और फिर वह काम पूरा हो जाता है।

यह पेपर एक नया विचार पेश करता है जिसे लेटेंट रिकरेंट ट्रांसफॉर्मर (LCT) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: असेंबली लाइन की "भूलने की बीमारी" (Amnesia)

मानक रोबोट में, एक बार जब वह एक शब्द को प्रोसेस करना समाप्त कर देता है, तो वह उस शब्द के बारे में अपने गहरे, उच्च-स्तरीय विचारों को भूल जाता है। वह केवल एक बुनियादी "नोट" (हिडन स्टेट) रखता है ताकि अगले शब्द में मदद मिल सके। यदि रोबोट को वर्तमान वाक्य को समझने के लिए कुछ शब्द पहले के एक जटिल विचार को याद रखने की आवश्यकता है, तो उसे बुनियादी नोट्स के ढेर को खंगालना पड़ता है। यह किसी फिल्म के प्लॉट ट्विस्ट को केवल उसके टिकट स्टब (टिकट की पर्चियों) को देखकर याद करने जैसा है, न कि वास्तविक दृश्यों को देखकर।

2. समाधान: "स्मार्ट नोटबुक" (LRT)

LRT रोबोट को एक स्मार्ट नोटबुक देता है।

  • यह कैसे काम करता है: जब रोबोट शब्द #1 को प्रोसेस करना समाप्त करता है, तो वह केवल अपने गहरे विचारों को फेंक नहीं देता है। इसके बजाय, वह अपने विचारों का एक "उच्च-स्तरीय सारांश" अपनी नोटबुक में लिख देता है।
  • जादू: जब रोबोट शब्द #2 पर काम करना शुरू करता है, तो वह तुरंत उस नोटबुक को खोलता है और शब्द #1 से प्राप्त सारांश को पढ़ता है। वह शब्द #2 को प्रोसेस करने में मदद करने के लिए उस सारांश का उपयोग एक "मेमोरी बूस्ट" के रूप में करता है।
  • परिणाम: रोबोट को बिना असेंबली लाइन रोके या अतिरिक्त काम किए, अपने अतीत के स्वयं से एक दूसरी राय मिलती है। यह एक शेफ की तरह है जो अगली सब्जी काटते समय, पिछले सब्जी के बारे में लिखे गए नोट्स पर एक नज़र डालता है ताकि स्वाद का प्रोफाइल सुसंगत बना रहे।

3. ट्रिक: बिना अटके कैसे सीखें

आप पूछ सकते हैं: "यदि रोबोट को नोट्स से सीखने के लिए अतीत को पढ़ने की आवश्यकता है, तो क्या इसका मतलब यह नहीं है कि उसे भविष्य शुरू करने से पहले अतीत के खत्म होने का इंतज़ार करना होगा? इससे ट्रेनिंग बहुत धीमी हो जाएगी!"

आमतौर पर, हाँ। यदि आप रोबोट को चरण-दर-चरण (शब्द 1, फिर शब्द 2, फिर शब्द 3) सीखने की कोशिश करते हैं, तो आप सब कुछ एक साथ करने की क्षमता (पैरेललिज्म) खो देते हैं, जिससे ट्रेनिंग में बहुत समय लगता है।

उन्होंने एक चतुर ट्रेनिंग ट्रिक बनाई है जिसे इंटरलीव्ड पैरेलल ट्रेनिंग कहा जाता है। इसे एक ट्विस्ट के साथ रिले रेस की तरह समझें:

  • चरण 1 (वार्म-अप): रोबोट नोट्स का एक कच्चा मसौदा (रफ ड्राफ्ट) प्राप्त करने के लिए सामान्य गति से पूरी दौड़ (पूरे वाक्य) को दौड़ता है।
  • चरण 2 (रिले): पूरी दौड़ को दोबारा दौड़ने के बजाय, रोबोट दौड़ को धावकों के दो समूहों में विभाजित करता है: "सम" (Even) धावक और "विषम" (Odd) धावक।
    • पहले, "सम" धावकों को "विषम" धावकों (जिन्होंने वार्म-अप पूरा किया है) के नोट्स देखने का मौका मिलता है और वे अपने प्रदर्शन में सुधार करते हैं।
    • फिर, "विषम" धावक "सम" धावकों से प्राप्त बेहतर नोट्स को देखते हैं और अपने प्रदर्शन में सुधार करते हैं।
  • लाभ: इस तरह, हर शब्द को अपने पड़ोसियों से सीखने का मौका मिलता है, लेकिन कंप्यूटर अभी भी एक ही समय में बहुत सारा काम कर सकता है। यह छात्रों के एक समूह के साथ मिलकर अध्ययन करने जैसा है: वे किसी एक व्यक्ति के पूरी किताब खत्म करने का इंतज़ार नहीं करते; वे तेज़ी से सीखने के लिए छोटे समूहों में नोट्स का आदान-प्रदान करते हैं।

4. परिणाम: कम लागत में अधिक स्मार्ट

इस पेपर ने नए रोबोट (LRT) का परीक्षण पुराने मानक रोबोट के विरुद्ध किया।

  • दक्षता (Efficiency): नया रोबोट (LRT) बेहतर लिखने (कम त्रुटि दर) और संदर्भ को बेहतर ढंग से समझने (प्रश्नों के उत्तर देने में बेहतर) में पुराना रोबोट से बेहतर सीखा, भले ही उन्हें समान मात्रा में "ब्रेन पावर" (कंप्यूटिंग समय) दी गई हो।
  • मामूली अपग्रेड: नए रोबोट को इन बड़े सुधारों को प्राप्त करने के लिए बहुत कम अतिरिक्त मेमोरी (लगभग 0.3% अधिक आकार) जोड़ने की आवश्यकता थी। यह एक पूरे इंजन को खरीदने के बजाय कार में एक छोटा, शक्तिशाली जीपीएस जोड़ने जैसा है।
  • स्वीट स्पॉट (Sweet Spot): उन्होंने पाया कि सबसे अच्छा "नोटबुक" वह अंतिम विचार नहीं था जो रोबोट के पास था (जो केवल अगले शब्द पर बहुत केंद्रित था), बल्कि उसके मस्तिष्क के बीच का एक विचार था। यह उपयोगी होने के लिए पर्याप्त उच्च-स्तरीय था, लेकिन बहुत अधिक विशिष्ट नहीं था।

सारांश

लेटेंट रिकरेंट ट्रांसफॉर्मर एआई मॉडल्स को स्मार्ट बनाने का एक तरीका है, जिससे उन्हें अगले शब्द को प्रोसेस करने में मदद करने के लिए पिछले शब्द से अपने स्वयं के "उच्च-स्तरीय विचारों" का पुन: उपयोग करने की अनुमति मिलती है। उन्होंने प्रशिक्षण प्रक्रिया को धीमा किए बिना एक चतुर "रिले रेस" पद्धति का उपयोग करके इसे हासिल किया। परिणाम यह है कि एक ऐसा मॉडल जो बहुत बड़ा हुए बिना तेज़ी से सीखता है और बेहतर प्रदर्शन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →