← नवीनतम पेपर
🤖 machine learning

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

LongStraw एक आर्किटेक्चर-जागरूक (architecture-aware) निष्पादन स्टैक है जो बिना ऑटोग्रैड (autograd) और अनुक्रमिक रिस्पॉन्स रिप्ले (sequential response replay) के माध्यम से साझा प्रॉम्प्ट इवैल्यूएशन (shared prompt evaluation) द्वारा मेमोरी उपयोग को अनुकूलित करके, एक निश्चित GPU बजट के तहत मिलियन-टोकन सुदृढीकरण शिक्षण (reinforcement learning) को सक्षम बनाता है, जिसने 2 मिलियन टोकन से अधिक की कॉन्टेक्स्ट लंबाई के साथ Qwen3.6-27B और GLM-5.2 जैसे मॉडलों पर निष्पादन क्षमता का सफलतापूर्वक प्रदर्शन किया है।

मूल लेखक: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Che
प्रकाशित 2026-07-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को एक विशाल, बहु-चरणीय रहस्य सुलझाना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, रोबोट को अनुमान लगाना शुरू करने से पहले सुरागों की एक पूरी लाइब्रेरी (संदर्भ/context) पढ़नी होगी। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "लॉन्ग-कॉन्टेक्स्ट ट्रेनिंग" कहा जाता है। आमतौर पर, जब हम इन रोबोटों को प्रशिक्षित करते हैं, तो हम उन्हें सुरागों की एक बड़ी किताब खिलाते हैं और फिर उनसे एक छोटा उत्तर लिखने को कहते हैं। समस्या यह है कि रोबोट का दिमाग (उसका कंप्यूटर मेमोरी) किताब के विवरणों से इतना भर जाता है कि वह अपना उत्तर लिखने से पहले ही जगह खत्म होने की वजह से रुक जाता है। यह ऐसा है जैसे आप एक पूरी लाइब्रेरी को अपने हाथों में थामकर कोई रहस्य सुलझाने की कोशिश कर रहे हों; अंततः, आपके हाथ हिलने के लिए भी थक जाएंगे।

इसे ठीक करने के लिए, वैज्ञानिक कंप्यूटर चिप्स (GPUs) की बड़ी और बड़ी लाइब्रेरी बनाने के लिए काम कर रहे हैं ताकि सारी जानकारी समा सके। लेकिन क्या होगा यदि आपके पास सुपरकंप्यूटर न हो? क्या होगा यदि आपके पास चिप्स की एक सीमित संख्या हो, जैसे कि आठ या बत्तीस का एक मानक सेट? यह वह पहेली है जिसे "LongStraw" नामक पेपर हल करता है। यह सवाल पूछता है: क्या हम एक रोबोट को बीस लाख शब्दों की कहानी पढ़ने और उसका समाधान लिखने के लिए सिखा सकते हैं, और वह भी केवल कंप्यूटर चिप्स के एक छोटे, निश्चित सेट का उपयोग करके, बिना और अधिक चिप्स खरीदे? उत्तर यह नहीं है कि "हाँ, हमने चिप्स को बड़ा बना दिया," बल्कि यह है कि "हाँ, हमने किताब पकड़ने का तरीका बदल दिया।"

शोधकर्ताओं ने एक चतुर प्रणाली बनाई जिसे LongStraw कहा जाता है। इसे एक बहुत ही व्यवस्थित लाइब्रेरियन की तरह समझें। पूरी दो-मिलियन शब्दों की कहानी को मेज पर खुला रखने के बजाय (जिससे मेज टूट सकती है), लाइब्रेरियन पूरी कहानी को एक बार पढ़ता है, कहानी के आवश्यक "वाइब" (vibe) या "स्टेट" (state) को याद करता है, और फिर भारी किताब को वापस रख देता है। अब, रोबोट को अपना छोटा उत्तर लिखने के लिए केवल उस छोटे से "वाइब" नोट को देखने की आवश्यकता है। यदि रोबोट को किसी विशिष्ट विवरण की जांच करने की आवश्यकता होती है, तो लाइब्रेरियन जल्दी से केवल वह एक पन्ना निकालता है, उसे रोबोट को दिखाता है, और फिर तुरंत उसे वापस रख देता है। इस तरह, डेस्क कभी भी अव्यवस्थित नहीं होती, भले ही कहानी बहुत बड़ी हो।

पेपर इस विचार का परीक्षण दो अलग-अलग प्रकार के रोबोट दिमागों पर करता है: एक जिसे Qwen कहा जाता है और दूसरा GLM। उन्होंने इन रोबोटों को एक प्रॉम्प्ट (कहानी) पढ़ने के लिए आजमाया जो 2,097,152 टोकन (जो लगभग बीस लाख शब्द या अक्षर हैं) लंबा था और फिर एक प्रतिक्रिया लिखने के लिए। उन्होंने एक सख्त बजट पर काम किया: Qwen रोबोट के लिए आठ H20 GPUs और GLM रोबोट के लिए 32 H20 GPUs

यहाँ उन्हें क्या मिला:

  • यह "पढ़ने" वाले हिस्से के लिए काम करता है: वे कंप्यूटर मेमोरी क्रैश हुए बिना पूरी बीस-लाख-टोकन की कहानी को सफलतापूर्वक प्रोसेस करने में सफल रहे। उन्होंने साबित किया कि आप सूचना को कब थामना है और कब छोड़ना है, इस बारे में स्मार्ट होकर, चिप्स की एक निश्चित संख्या पर इस विशाल कार्य को पूरा कर सकते हैं।
  • यह जगह बचाता है, लेकिन समय लेता है: भारी किताब को वापस रखकर और केवल जरूरत पड़ने पर पन्ने निकालकर, उन्होंने मेमोरी के बहुत बड़े हिस्से को बचाया। उदाहरण के लिए, जब उन्होंने रोबोट के "अनुमानों" (ग्रुप साइज) की संख्या को 2 से बढ़ाकर 8 किया, तो मेमोरी का उपयोग बहुत कम बदला (केवल लगभग 0.21 GB अधिक), लेकिन काम पूरा करने में अधिक समय लगा क्योंकि उन्हें पन्नों को एक साथ निकालने के बजाय एक-एक करके निकालना पड़ा।
  • यह एक "प्रूफ ऑफ कॉन्सेप्ट" है, कोई पूर्ण फिनिश नहीं: पेपर इस बारे में बहुत ईमानदार है कि उसने क्या नहीं किया। जबकि सिस्टम सफलतापूर्वक सिमुलेशन चलाने और यह दिखाने में सफल रहा कि रोबोट लंबी कहानी पढ़ सकता है और उत्तर लिख सकता है, इसने पूरी तरह से यह साबित नहीं किया कि रोबोट ने अपने दिमाग को अपडेट करने का परफेक्ट तरीका सीख लिया है। कुछ गणित जो रोबोट के विभिन्न "दिमाग के हिस्सों" (ग्रेडिएंट्स) को जोड़ता है, वह एक आदर्श प्रशिक्षण सत्र की तरह सभी चिप्स में पूरी तरह से सिंक्रोनाइज़ नहीं था। यह ऐसा है जैसे यह दिखाना कि एक कार का इंजन थोड़े से ईंधन पर चल सकता है, लेकिन अभी यह साबित नहीं करना कि वह बिना रुके पूरे रेस ट्रैक पर दौड़ सकती है।

शोधकर्ता अपने परिणाम को एक "एक्जीक्यूशन रसीद" (execution receipt) कहते हैं। यह एक रसीद है जो कहती है, "हाँ, हमने इस विशाल कार्य को इस विशिष्ट हार्डवेयर पर बिना क्रैश हुए सफलतापूर्वक चलाया।" उन्होंने यह दावा नहीं किया कि उन्होंने कोई दौड़ जीती है या सबसे तेज़ कार बनाई है; उन्होंने केवल यह साबित किया कि कार इस विशिष्ट ट्रैक पर ईंधन की इस विशिष्ट मात्रा के साथ चल सकती है।

संक्षेप में, LongStraw दिखाता है कि आपको विशाल कहानियों पर AI को प्रशिक्षित करने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है। आपको बस अपनी मेमोरी को प्रबंधित करने का एक स्मार्ट तरीका चाहिए, जिसमें आप अधिक स्थान बचाने के लिए थोड़े से अतिरिक्त समय का व्यापार करते हैं। यह सीमित बजट वाले छोटे समूहों और शोधकर्ताओं के लिए इन विशाल AI मॉडल्स के साथ प्रयोग करने का रास्ता खोलता है, यह साबित करते हुए कि यदि आप पर्याप्त चतुर हैं, तो आप एक निश्चित, छोटे टूलकिट के साथ भी बड़े काम कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →