← नवीनतम पेपर
🤖 AI

How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization

यह शोध पत्र DynaMO प्रस्तुत करता है, जो एक सैद्धांतिक रूप से आधारित ढांचा है जो LLMs के लिए सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) को अनुकूलित करता है, जिसमें संसाधन अक्षमता और प्रशिक्षण अस्थिरता को संबोधित करने के लिए विचरण-न्यूनतम अनुक्रम-स्तरीय रोलआउट आवंटन (variance-minimizing sequence-level rollout allocation) को व्युत्पन्न किया गया है और ग्रेडिएंट-जागरूक टोकन-स्तरीय लाभ मॉड्यूलेशन (gradient-aware token-level advantage modulation) को कार्यान्वित किया गया है।

मूल लेखक: Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कोच हैं जो छात्र एथलीटों की एक टीम (AI मॉडल) को जटिल गणितीय पहेलियों को हल करने के लिए प्रशिक्षित कर रहे हैं। आपका लक्ष्य उन्हें ओलंपिक (कठिन समस्याओं को हल करना) तक जितनी जल्दी और कुशलता से हो सके, पहुँचाना है।

यह पेपर एक नई कोचिंग रणनीति पेश करता है जिसे DynaMO कहा जाता है। यह तर्क देता है कि प्रशिक्षण का पुराना तरीका बेकार और अस्थिर है। DynaMO इसे दो मुख्य तरकीबों के साथ ठीक करता है: स्मार्ट रिसोर्स एलोकेशन (यह तय करना कि किसे कितना अभ्यास समय मिले) और स्मार्ट फीडबैक (उन्हें प्रशंसा या सुधार कैसे दिया जाए)।

यहाँ रोजमर्रा के उदाहरणों का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) वाली गलती

वर्तमान में, अधिकांश AI ट्रेनर हर गणित की समस्या के साथ एक जैसा व्यवहार करते हैं। यदि आपके पास 100 समस्याएं हैं, तो आप AI को प्रत्येक के लिए 10 प्रयास देते हैं, चाहे समस्या कितनी भी कठिन या आसान क्यों न हो।

  • दोष: यह एक नौसिखिए को "जूते के फीते कैसे बांधें" (बहुत आसान) पर उतना ही अभ्यास समय देने जैसा है जितना कि "क्वांटम फिजिक्स समीकरण को कैसे हल करें" (बहुत कठिन) पर।
    • बहुत आसान: AI इसे तुरंत हल कर लेता है। इसे 10 प्रयास देना समय की बर्बादी है।
    • बहुत कठिन: AI हर बार असफल हो जाता है। इसे 10 प्रयास देना केवल निराशाजनक है; यह कुछ भी नहीं सीख पाता क्योंकि वह फंस गया है।
    • बिल्कुल सही: वे समस्याएं जहाँ AI कभी जीतता है और कभी हारता है, वे "गोल्डिलॉक्स ज़ोन" (Goldilocks zone) हैं। यहीं पर सबसे अधिक सीखने की प्रक्रिया होती है।

2. समाधान भाग 1: "स्मार्ट शेड्यूलर" (डायनेमिक रोलआउट एलोकेशन)

DynaMO शेड्यूल को बदल देता है। सभी को समान संख्या में प्रयास देने के बजाय, यह एक स्मार्ट शेड्यूलर की तरह काम करता है जो AI के पिछले प्रदर्शन को देखता है।

  • यह कैसे काम करता है: यह ट्रैक करता है कि कौन सी समस्याएं "बीच में" हैं।
    • यदि कोई समस्या बहुत आसान है (AI हमेशा जीतता है), तो यह कहता है, "ठीक है, आइए इसे केवल एक बार आजमाएं।"
    • यदि कोई समस्या बहुत कठिन है (AI हमेशा हारता है), तो यह कहता है, "आइए अभी के लिए इसे छोड़ दें।"
    • यदि कोई समस्या अनिश्चित है (AI आधी बार जीतता है, आधी बार हारता है), तो यह कहता है, "यहाँ ध्यान केंद्रित करें! इस समस्या को 20 प्रयास दें!"
  • रूपक (Metaphor): कल्पना कीजिए कि एक शिक्षक टेस्ट ग्रेड कर रहा है। हर छात्र द्वारा सही किए गए प्रश्न को सुधारने में 10 मिनट बिताने के बजाय, और उस प्रश्न पर 10 मिनट बिताने के बजाय जिसे कोई हल नहीं कर सका, वे अपना सारा समय उन प्रश्नों की समीक्षा करने में बिताते हैं जहाँ छात्र संघर्ष कर रहे थे लेकिन सही होने के करीब थे। असली सीखना वहीं होता है।

3. समस्या: "कॉन्फिडेंस ट्रैप" (ग्रेडिएंट एटेनुएशन)

भले ही सही शेड्यूल हो, एक दूसरी समस्या है: AI अपनी गलतियों और सफलताओं से कैसे सीखता है।

वर्तमान प्रणाली में, यदि AI बहुत आत्मविश्वासी है और सही उत्तर प्राप्त करता है, तो उसे एक बहुत छोटी "पीठ थपथपाना" (छोटा लर्निंग सिग्नल) मिलता है। यदि वह अनिश्चित है और गलत होता है, तो उसे एक बड़ी "डांट" मिलती है।

  • दोष: यह उल्टा है! यदि AI आत्मविश्वासी है और सही है, तो उसे मजबूती से सुदृढ़ किया जाना चाहिए ताकि वह याद रखे कि वह क्यों सही था। यदि वह आत्मविश्वासी है और गलत है, तो उसे बड़े सुधार की आवश्यकता है। लेकिन वर्तमान गणित आत्मविश्वासी सही उत्तरों को पृष्ठभूमि में "धुंधला" (fade away) कर देता है।

4. समाधान भाग 2: "स्मार्ट कोच" (ग्रेडिएंट-अवेयर एडवांटेज मॉड्यूलेशन)

DynaMO फीडबैक लूप को दो तंत्रों के साथ ठीक करता है:

A. "कॉन्फिडेंस बूस्टर" (क्षतिपूर्ति/Compensation)

  • सुधार: जब AI आत्मविश्वासी और सही होता है, तो DynaMO कृत्रिम रूप से प्रशंसा की आवाज़ बढ़ा देता है। यह कहता है, "तुम अपने आप पर यकीन रखते थे, और तुम सही थे! आइए सुनिश्चित करें कि तुम इस सबक को गहराई से याद रखो।"
  • रूपक: कल्पना कीजिए कि एक छात्र एक कठिन समस्या को पूरी तरह से हल करता है। एक सामान्य शिक्षक शायद सिर्फ "अच्छा काम किया" कहेगा। DynaMO एक ऐसे शिक्षक की तरह है जो कहता है, "वाह! तुम्हें अपने उत्तर पर इतना भरोसा था, और तुमने इसे सटीक रूप से हासिल किया! आइए इसे बड़े अक्षरों में लिखें ताकि तुम इसे कभी न भूलो।"

B. "ब्रेक पेडल" (स्थिरीकरण/Stabilization)

  • सुधार: कभी-कभी, AI बहुत उत्साहित हो जाता है और एक भाग्यशाली अनुमान के आधार पर अपने मस्तिष्क (वेट्स) में बहुत बड़े, अनियंत्रित बदलाव करता है। इससे प्रशिक्षण अस्थिर हो जाता है और क्रैश हो जाता है।
  • रूपक: DynaMO AI के "चिंता स्तर" (एन्ट्रॉपी) पर नज़र रखता है। यदि AI बहुत तेज़, अप्रत्याशित छलांग लगा रहा है, तो DynaMO ब्रेक लगा देता है। यह कहता है, "रुको, धीरे चलो! तुम बहुत तेज़ी से बदल रहे हो। आगे बढ़ने से पहले स्थिर हो जाओ।" यह AI को एक एकल भाग्यशाली जीत के प्रति अत्यधिक प्रतिक्रिया देने से रोकता है।

सारांश: DynaMO क्यों जीतता है

AI को प्रशिक्षित करना खेती करने जैसा समझें:

  • पुरानी विधि: आप खेत के हर पौधे को बिल्कुल समान मात्रा में पानी देते हैं, चाहे वह कैक्टस (जिसे कम पानी चाहिए) हो या फर्न (जिसे बहुत अधिक चाहिए)। आप खरपतवार को भी फसलों जितनी ही खाद देते हैं।
  • DynaMO:
    1. स्मार्ट वॉटरिंग: यह मिट्टी की जांच करता है। यह उन पौधों पर अतिरिक्त पानी डालता है जो संघर्ष कर रहे हैं लेकिन बढ़ रहे हैं (Goldilocks समस्याएं) और उन पर पानी देना बंद कर देता है जो पहले से ही पूर्ण हैं या मर चुके हैं।
    2. स्मार्ट फर्टिलाइजिंग: यह उन पौधों को अतिरिक्त पोषक तत्व देता है जो अच्छा कर रहे हैं लेकिन मजबूत बने रहने के लिए उन्हें बढ़ावा चाहिए (क्षतिपूर्ति), और यह खाद को उन पौधों को जलाने से रोकता है जो बहुत तेज़ी से बढ़ रहे हैं (स्थिरीकरण)।

परिणाम: AI तेज़ी से सीखता है, स्थिर रहता है, और पहले की तुलना में कठिन गणितीय समस्याओं को हल करता है, और यह सब समान कंप्यूटिंग पावर का उपयोग करते हुए करता है। यह केवल कड़ी मेहनत नहीं कर रहा है; यह स्मार्ट तरीके से काम कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →