← नवीनतम पेपर
🤖 machine learning

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

यह शोध पत्र सिंगल-रोलआउट एसिंक्रोनस ऑप्टिमाइजेशन (SAO) को प्रस्तुत करता है, जो एक स्थिर और कुशल एसिंक्रोनस सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचा है जो ग्रुप-वाइज सैंपलिंग को सिंगल-रोलआउट रणनीतियों से बदल देता है और जटिल कोडिंग एवं रीजनिंग बेंचमार्क पर GLM-5.2 जैसे बड़े पैमाने के एजेंटिक मॉडलों को सफलतापूर्वक प्रशिक्षित करने के लिए सख्त टोकन-लेवल क्लिपिंग का उपयोग करता है।

मूल लेखक: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप छात्र शेफ की एक टीम को एक आदर्श भोजन बनाना सिखा रहे हैं। पुराने तरीके में (जिसे पेपर Synchronous RL कहता है), मुख्य शेफ चिल्लाता था, "सब लोग खाना बनाना शुरू करो!" और फिर इंतज़ार करता था। छात्र अपने-अपने व्यंजन बनाना शुरू कर देते थे। लेकिन यहाँ एक समस्या थी: कुछ छात्र तेज़ थे, और कुछ धीमे। तेज़ छात्र अपने व्यंजन बना लेते और फिर दीवार को घूरते हुए खड़े रहते, जब तक कि सबसे धीमे छात्र का काम पूरा न हो जाए। जब सभी का काम पूरा हो जाता था, तभी मुख्य शेफ भोजन चखता था, फीडबैक देता था, और सबको बताता था कि आगे क्या करना है। यह अविश्वत रूप से अक्षम था; रसोई खाली समय (idle time) से भरी रहती थी।

इसे ठीक करने के लिए, शोधकर्ताओं ने Asynchronous RL का प्रयास किया। इस संस्करण में, जैसे ही एक छात्र अपना व्यंजन समाप्त करता है, मुख्य शेफ तुरंत उसे चखता है और फीडबैक देता है। छात्र तुरंत अपना अगला व्यंजन बनाना शुरू कर सकता है। रसोई कभी रुकती नहीं है। यह बहुत तेज़ है।

हालाँकि, एक बड़ी चुनौती थी। क्योंकि मुख्य शेफ उन छात्रों के व्यंजन चख रहा था जिन्होंने अलग-अलग समय पर खाना बनाना शुरू किया था, इसलिए जिस "रेसिपी" (विधि) का छात्र पालन कर रहे थे, वह लगातार बदल रही थी। कुछ छात्र एक पुरानी रेसिपी के आधार पर खाना बना रहे थे, जबकि अन्य एक नई रेसिपी का उपयोग कर रहे थे। इस भ्रम ने प्रशिक्षण को अस्थिर बना दिया, और छात्र बेहतर होने के बजाय अक्सर खाना बनाने में और खराब होते गए। इसके अलावा, इन छात्रों को ग्रेड देने की लोकप्रिय विधि (जिसे GRPO कहा जाता है) के लिए मुख्य शेफ को ग्रेड देने से पहले छात्रों के एक समूह के समाप्त होने का इंतज़ार करना पड़ता था, जिससे "इंतज़ार करने वाली समस्या" फिर से आ गई थी।

लेखकों ने एक नई विधि SAO (Single-Rollout Asynchronous Optimization) पेश की। उन्होंने तीन चतुर युक्तियों के साथ इस अराजकता को हल किया:

1. "तत्काल फीडबैक" का नियम (Single-Rollout)

एक बैच के लिए छात्रों के समूह के समाप्त होने का इंतज़ार करने के बजाय, SAO कहता है: "जैसे ही एक छात्र अपना व्यंजन समाप्त करता है, तुरंत उसका ग्रेड दें।"

  • रूपक (Metaphor): एक वीडियो गेम की कल्पना करें जहाँ आपको अपने पूरे दल के समाप्त होने का इंतज़ार करने के बजाय, लेवल खत्म होते ही तुरंत स्कोर मिलता है। यह "सबसे धीमे व्यक्ति" के इंतज़ार करने वाले विलंब को हटा देता है।
  • यह किस समस्या को हल करता है: यह समूह को सबसे धीमे सदस्य के लिए रुकने से रोकता है, जिससे प्रशिक्षण पूरी गति से चलता रहता है।

2. "सख्त सुरक्षा जाल" (Double-Sided Clipping)

चूंकि छात्र इतनी तेज़ी से काम कर रहे हैं और रेसिपी बदल रही है, इसलिए यह जोखिम है कि वे पागल होकर कुछ बहुत ही अजीब और खतरनाक करने की कोशिश कर सकते हैं।

  • रूपक: लेखकों ने प्रशिक्षण के चारों ओर एक "बाड़" (fence) लगा दी है। यदि किसी छात्र का नया विचार शिक्षक की अपेक्षा से बहुत अलग है (बहुत अधिक बाईं या दाईं ओर), तो सिस्टम केवल उसे अनदेखा नहीं करता है; यह छात्र को उस विशिष्ट गलती से सीखने से पूरी तरह से रोक देता है। यह एक सख्त कोच की तरह है जो कहता है, "यदि तुम पीछे की ओर दौड़ने की कोशिश करते हो, तो मैं तुम्हें उस दौड़ से सीखने ही नहीं दूँगा।"
  • यह किस समस्या को हल करता है: यह प्रशिक्षण को अस्थिर या "विस्फोटक" होने से रोकता है जब छात्र तेज़ गति के कारण भ्रमित हो जाते हैं।

3. "सुपर-कोच" (बेहतर Value Model)

पुरानी "ग्रुप" विधि में, कोच एक छात्र के व्यंजन की तुलना उसके सहपाठियों के व्यंजनों से करके देख सकता था कि वह अच्छा है या नहीं। लेकिन इस "एक-एक करके" वाली विधि में, तुलना करने के लिए कोई सहपाठी नहीं हैं। कोच को बहुत बुद्धिमान होना होगा ताकि वह जान सके कि एक अकेला व्यंजन अपने आप में अच्छा है या बुरा।

  • रूपक: लेखकों ने एक विशेष "वैल्यू कोच" (एक क्रिटिक) को प्रशिक्षित किया जो बहुत स्मार्ट है और छात्र शेफ की तुलना में दोगुनी तेज़ी से अपना ज्ञान अपडेट करता है। उन्होंने कोच के "अंतर्ज्ञान" (attention layers) को भी स्थिर (freeze) कर दिया ताकि वे भ्रमित न हों, जिससे कोच केवल रेसिपी के विशिष्ट विवरणों को ही सीख सके।
  • यह किस समस्या को हल करता है: यह सुनिश्चित करता है कि भले ही छात्र अकेले काम कर रहा हो, कोच सटीक रूप से बता सके, "हाँ, वह एक अच्छा कदम था," या "नहीं, वह बुरा था," बिना किसी समूह के साथ तुलना किए।

परिणाम

इस नई विधि का परीक्षण दो बहुत कठिन कार्यों पर किया गया:

  1. कोडिंग: AI को सॉफ़्टवेयर में बग्स (bugs) ठीक करने के लिए कहना (जैसे एक मैकेनिक द्वारा कार ठीक करना)।
  2. गणितीय तर्क (Math Reasoning): AI को जटिल गणितीय समस्याओं को हल करने के लिए कहना (जैसे एक छात्र द्वारा कठिन परीक्षा देना)।

परिणाम:

  • पुराना तरीका (GRPO) अच्छी शुरुआत करता था लेकिन कुछ समय बाद भ्रमित होकर क्रैश हो जाता था और विफल हो जाता था।
  • नया SAO तरीका लंबे समय तक (1,000 स्टेप्स तक) सुचारू रूप से प्रशिक्षण जारी रखता है और लगातार बेहतर स्कोर प्राप्त करता है।
  • इसने यह भी सिद्ध किया कि यह विधि Online Learning के लिए एकदम सही है, जहाँ खेल के नियम खेलते समय ही बदल जाते हैं। उदाहरण के लिए, यदि शिक्षक अचानक कहता है, "अब मुझे प्यारी कहानियाँ चाहिए," तो SAO-प्रशिक्षित AI अपनी शैली को तेज़ी से बदल सकता है, जबकि अन्य विधियाँ अनुकूलन करने में बहुत धीमी थीं।

संक्षेप में, पेपर कहता है: "समूहों का इंतज़ार करना बंद करें। हर किसी को अपनी गति से काम करने दें, लेकिन उन्हें एक सख्त सुरक्षा जाल और एक सुपर-स्मार्ट कोच दें जो अपने ज्ञान को तुरंत अपडेट करता है। यह AI प्रशिक्षण को तेज़, अधिक स्थिर और कठिन, बदलती समस्याओं को हल करने के लिए बेहतर बनाता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →