← नवीनतम पेपर
🤖 AI

Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

यह शोध पत्र VIGOR का प्रस्ताव करता है, जो एक वेरिएंस-गाइडेड ऑनलाइन रोलआउट एलोकेशन विधि है जो एक निश्चित जनरेशन बजट को उच्चतम रिवॉर्ड वेरिएंस वाले उदाहरणों में गतिशील रूप से वितरित करती है, जिससे मानक GRPO की तुलना में गणितीय तर्क और कोडिंग कार्यों में बेहतर प्रदर्शन हासिल करते हुए कंप्यूटेशनल लागत को काफी कम किया जाता है और स्थिरता में सुधार किया जाता है।

मूल लेखक: Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

प्रकाशित 2026-07-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े बिखरे हुए दिमाग वाले रोबोट को गणित की समस्याओं या कंप्यूटर कोड लिखने जैसे जटिल पहेलियों को हल करना सिखाने की कोशिश कर रहे हैं। आप वहां बैठकर हर कदम को समझा नहीं सकते; इसके बजाय, आप रोबोट को कोशिश करने देते हैं, और जब वह सही उत्तर देता है, तो आप उसे एक 'हाई-फाइव' (एक इनाम) देते हैं। जब वह गलत होता है, तो आप उसे धीरे से कहते हैं, "फिर से कोशिश करो।" यह प्रक्रिया 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) कहलाती है। रोबोट समस्या को हल करने के विभिन्न तरीकों को आज़माता रहता है, और समय के साथ, वह सीख जाता है कि कौन से रास्ते 'हाई-फाइव' की ओर ले जाते हैं और कौन से रास्ते बंद गलियों की ओर।

हालाँकि, इसमें एक पेच है। प्रभावी ढंग से सीखने के लिए, रोबोट को बहुत सारे अलग-अलग रास्तों को आज़माना होगा। यदि वह केवल एक या दो रास्ते आज़माता है, तो वह भाग्यशाली हो सकता है और यह सोच सकता है कि एक बुरा रास्ता वास्तव में अच्छा है। लेकिन यदि वह हजारों रास्ते आज़माता है, तो यह समय और बिजली की बहुत बड़ी बर्बादी है, खासकर इसलिए क्योंकि उनमें से अधिकांश रास्ते उबाऊ या बेकार होते हैं। यह एक छात्र को लिखने सीखने के लिए 100 निबंध लिखने के लिए कहने जैसा है, जबकि उनमें से 90 केवल लकीरें हैं जो उसे कुछ भी नया नहीं सिखातीं। बड़ा सवाल वैज्ञानिकों के लिए यह है: हम रोबोट को उबाऊ रास्तों पर ऊर्जा बर्बाद किए बिना सही संख्या में रास्ते आज़माने के लिए कैसे प्रेरित कर सकते हैं?

यहीं पर एक नई विधि आती है जिसे VIGOR कहा जाता है। रोबोट की सीखने की प्रक्रिया को "हॉट एंड कोल्ड" (गर्म और ठंडा) के खेल की तरह समझें। पुराने तरीके में (जिसे GRPO कहा जाता था), रोबोट हर एक पहेली के लिए बिना सोचे-समझे अनुमानों की एक निश्चित संख्या आज़माता था, चाहे पहेली आसान हो या कठिन। यह एक शिक्षक द्वारा हर छात्र को होमवर्क की समान मात्रा देने जैसा था, भले ही कुछ छात्र उत्तर जानते हों और अन्य पूरी तरह से खोए हुए हों।

VIGOR के पीछे के शोधकर्ताओं ने महसूस किया कि सबसे उपयोगी जानकारी उन क्षणों से आती है जब रोबोट अनिश्चित होता है। यदि एक रोबोट गणित की समस्या हल करता है और उसे सही और गलत उत्तरों का मिश्रण मिलता है, तो वह 'वैरिएंस' (या मतभेद) एक संकेत है कि रोबोट कुछ महत्वपूर्ण सीख रहा है। लेकिन यदि वह हर बार एक ही गलत उत्तर देता है, या हर बार एक ही सही उत्तर देता है, तो वह केवल समय बर्बाद कर रहा है।

VIGOR इस खेल को बदल देता है और एक स्मार्ट कोच की तरह काम करता है जो रोबोट के पहले कुछ प्रयासों को देखता है। हर पहेली के लिए अनुमानों की एक निश्चित संख्या देने के बजाय, VIGOR पहले रोबोट को हर चीज़ के लिए बस कुछ ही अनुमान लगाने देता है। फिर, वह परिणामों को देखता है:

  1. यदि रोबोट हर बार एक ही उत्तर प्राप्त करता है (कम वैरिएंस), तो कोच कहता है, "ठीक है, हम समझ गए, अब आगे बढ़ें।"
  2. यदि रोबोट के उत्तर इधर-उधर थे (उच्च वैरिएंस), तो कोच कहता है, "यह पेचीदा है! इसे सुलझाने के लिए इसे और अधिक प्रयास करने दें।"

यह विधि फिर केवल उन पहेलियों में अधिक "अनुमान लगाने की ऊर्जा" (rollouts) डालती है जो सबसे अधिक भ्रम पैदा कर रही हैं, और उन पहेलियों को अनदेखा कर देती है जो बहुत आसान हैं या जिनसे कुछ सीखना संभव नहीं है। यह एक वीडियो गेम की तरह है जो खिलाड़ी के लिए केवल कठिन दुश्मनों को स्पॉन करता है जो संघर्ष कर रहे हैं, बजाय इसके कि वह समय भरने के लिए आसान स्तरों को कठिन बना दे।

पेपर दिखाता है कि यह दृष्टिकोण एक गेम-चेंजर है। इस "वैरिएंस-गाइडेड" रणनीति का उपयोग करके, रोबोट बहुत कम अनुमानों के साथ समान कौशल स्तर तक पहुँच जाता है। गणित की समस्याओं पर, VIGOR ने मानक पद्धति की तुलना में 2.3 गुना कम रोलआउट्स के साथ अपना लक्ष्य सटीकता प्राप्त की। कोडिंग कार्यों पर, इसने समान सफलता दर के साथ 1.49 गुना कम रोलआउट्स प्राप्त किए और अंतिम सफलता दर में 3.4 अंक का सुधार भी किया।

लेखक सुझाव देते हैं कि यह केवल एक छोटा सा बदलाव नहीं है; यह AI को तर्क करने (reasoning) सिखाने के तरीके में एक मौलिक बदलाव है। उन्होंने विभिन्न आकार के AI मॉडल पर इन परिणामों को मापा और पाया कि VIGOR लगातार तेजी से और अधिक कुशलता से सीखता है। यह साबित करता है कि आपको किसी समस्या को हल करने के लिए अधिक कंप्यूटिंग पावर फेंकने की आवश्यकता नहीं है; आपको बस यह समझने की आवश्यकता है कि अपनी शक्ति को कहाँ खर्च किया जाए। केवल अनिश्चितता के क्षणों पर ध्यान केंद्रित करके, VIGOR AI को अधिक प्रभावी ढंग से तर्क करना सीखने में मदद करता है, जिससे एक अराजक 'ट्रायल-एंड-एरर' प्रक्रिया एक केंद्रित और कुशल खोज की यात्रा में बदल जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →