← नवीनतम पेपर
💻 computer science

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

यह सर्वेक्षण एल्गोरिदम डिज़ाइन को MDP निर्माण, अन्वेषण और शिक्षण चरणों में वर्गीकृत करके LLMs में सुदृढीकरण अधिगम (Reinforcement Learning) के लिए एक मॉड्यूलर ढांचा प्रस्तुत करता है, जो क्रिटिक-मुक्त पॉलिसी ग्रेडिएंट्स और मोंटे कार्लो विधियों की ओर एक महत्वपूर्ण अनुसंधान पूर्वाग्रह को प्रकट करता है, जबकि वैल्यू-आधारित, ऑफ-पॉलिसी और बूटस्ट्रैपिंग तकनीकों में अनछुए अवसरों को उजागर करता है।

मूल लेखक: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievsk
प्रकाशित 2026-06-23
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत ही शाब्दिक (literal) छात्र (लार्ज लैंग्वेज मॉडल, या LLM) को एक आदर्श निबंध लिखना, एक जटिल गणित की समस्या हल करना, या कोड लिखना सिखा रहे हैं। आप हर उस शब्द पर ग्रेड नहीं दे सकते जो वह टाइप करता है क्योंकि आप उसे पूरा काम खत्म करने के बाद ही कह सकते हैं, "अच्छा काम किया!" या "फिर से कोशिश करो।"

यही रीइन्फोर्समेंट लर्निंग (RL) की मुख्य चुनौती है: आप एक छात्र को कैसे सिखाते हैं जब फीडबैक विलंबित (delayed), विरल (sparse) होता है, और केवल अंत में आता है?

यह पेपर एक विशाल "मैप" या "सर्वेक्षण" है जो उन सभी तरीकों को व्यवस्थित करता है जिनसे शोधकर्ता इस समस्या को हल करने की कोशिश कर रहे हैं। लेखक तर्क देते हैं कि जबकि हर कोई अभी कुछ लोकप्रिय तरीकों (जैसे PPO और GRPO) का उपयोग कर रहा है, रोबोटिक्स और गेम AI की दुनिया में अन्य तकनीकों का एक पूरा टूलबॉक्स मौजूद है जिसे अभी तक आजमाया नहीं गया है। वे इस समस्या को चार मुख्य चरणों में विभाजित करते हैं, जैसे कि एक घर बनाना:

1. नींव रखना: खेल को परिभाषित करना (MDP निर्माण)

AI के सीखने से पहले, आपको खेल के नियम परिभाषित करने होंगे। पेपर इसे "मार्कोव डिसीजन प्रोसेस" (MDP) बनाना कहता है।

  • रिवॉर्ड (ग्रेड): यह सबसे महत्वपूर्ण हिस्सा है। यदि आप AI को "सहायक बनो" कहते हैं, तो आप इसे कैसे मापेंगे?
    • पेपर का अंतर्दृष्टि: अधिकांश लोग एक "रिवॉर्ड मॉडल" (एक दूसरा AI जिसे इंसानों की पसंद का अनुमान लगाने के लिए प्रशिक्षित किया गया है) या सरल नियमों (जैसे, "क्या कोड चला?") का उपयोग करते हैं।
    • जाल (The Trap): कभी-कभी AI गलत तरीके से "स्मार्ट" हो जाता है। यदि आप इसे लंबे उत्तर लिखने के लिए पुरस्कृत करते हैं, तो यह उच्च स्कोर पाने के लिए केवल निरर्थक बातें लिख सकता है। इसे रिवॉर्ड हैकिंग (Reward Hacking) कहा जाता है। पेपर चेतावनी देता है कि यदि आपके नियम पूर्ण नहीं हैं, तो AI खामियां (loopholes) ढूंढ लेगा।
  • स्टेट (संदर्भ/Context): AI को यह जानने की आवश्यकता है कि उसने पहले ही क्या लिखा है। आमतौर पर, यह अब तक का लिखा गया टेक्स्ट होता है। लेकिन यदि टेक्स्ट बहुत लंबा हो जाता है, तो AI अभिभूत (overwhelmed) हो जाता है। कुछ शोधकर्ता इसे केंद्रित रखने के लिए अतीत का सारांश बनाने या इसके कुछ हिस्सों को छिपाने का प्रयास कर रहे हैं।
  • एक्शन (अगला शब्द): आमतौर पर, AI अपने शब्दकोश से कोई भी शब्द चुन सकता है। कुछ शोधकर्ता इसे प्रतिबंधित करने की कोशिश कर रहे हैं (जैसे, AI को केवल उन शब्दों को चुनने के लिए मजबूर करना जो एक विशिष्ट व्याकरण में फिट बैठते हैं) ताकि सीखना आसान हो सके।
  • समाप्ति (Termination): AI कब रुकता है? आमतौर पर, यह तब रुकता है जब यह एक विशेष "वाक्य के अंत" (end of sentence) वाला टोकन टाइप करता है। लेकिन कभी-कभी AI बहुत अधिक बोलता है। पेपर नोट करता है कि शोधकर्ता ऐसे तरीके प्रयोग कर रहे हैं जिससे AI को यह बताया जा सके कि, "जब आप समाप्त कर लें तो रुकें," बिना उसे बीच में काटे।

2. अनुमान लगाने की कला: एक्सप्लोरेशन (Exploration)

AI शुरुआत में कुछ भी नहीं जानता। इसे अलग-अलग चीजें आज़मानी पड़ती हैं ताकि यह देखा जा सके कि क्या काम करता है। इसे एक्सप्लोरेशन कहा जाता है।

  • टेम्परेचर (पासे का खेल): कल्पना कीजिए कि AI एक शब्द चुन रहा है। यदि आप "टेम्परेचर" कम सेट करते हैं, तो यह सबसे सुरक्षित, स्पष्ट शब्द चुनता है। यदि आप इसे उच्च सेट करते हैं, तो यह जंगली अंदाज़ में अनुमान लगाता है। यह AI को नई चीजें आज़माने के लिए प्रेरित करने का सबसे सरल तरीका है।
  • एन्ट्रॉपी (बोरियत रोकने का बोनस): AI को समान सुरक्षित शब्दों के लूप में फंसने से रोकने के लिए, शोधकर्ता "अनिश्चित" या विविध होने के लिए एक बोनस जोड़ते हैं। यह एक छात्र को बताने जैसा है, "अगर आप एक अलग दृष्टिकोण अपनाते हैं, भले ही वह विफल हो जाए, तो मैं आपको अतिरिक्त अंक दूंगा।"
  • क्यूरियोसिटी (आंतरिक प्रेरणा): क्या होगा यदि AI को केवल इसलिए इनाम मिले क्योंकि उसने कुछ ऐसा किया जो उसने पहले नहीं देखा था? कुछ विधियाँ AI को एक "क्यूरियोसिटी स्कोर" देती हैं ताकि वह नए रास्तों को आज़मा सके, भले ही उसे अभी तक सटीक उत्तर न मिला हो।
  • ट्री सर्च (क्या होगा अगर वाला खेल): केवल एक वाक्य एक-एक करके लिखने के बजाय, कल्पना कीजिए कि AI एक पेड़ की तरह शाखाओं में बंट जाता है। वह तीन अलग-अलग वाक्य लिखता है, देखता है कि वे कहाँ ले जाते हैं, और फिर सबसे अच्छा रास्ता चुनता है। यह एक शतरंज खिलाड़ी की तरह है जो तीन चालें आगे की सोचता है।
  • करिकुलम लर्निंग (सीढ़ी): पीएचडी थीसिस से शुरुआत न करें। किंडरगार्टन की कहानी से शुरू करें। यह विधि AI को पहले आसान समस्याएं सिखाती है, फिर धीरे-धीरे उन्हें कठिन बनाती है, ताकि वह हतोत्साहित न हो।

3. सीखने की प्रक्रिया: AI कैसे सुधार करता है?

एक बार जब AI ने चीजें आजमा लीं और फीडबैक मिल गया, तो यह वास्तव में कैसे सीखता है? यह पेपर इसे चार बड़े विकल्पों में वर्गीकृत करता है:

  • मॉडल-फ्री बनाम मॉडल-बेस्ड:
    • मॉडल-फ्री: AI बस याद रखता है "मैंने X किया, मुझे अच्छा ग्रेड मिला। मैं फिर से X करूँगा।" यह परीक्षण और त्रुटि (trial and error) से सीखता है। वर्तमान में अधिकांश AI यही करते हैं।
    • मॉडल-बेस्ड: AI पहले दुनिया का एक मानसिक मानचित्र बनाने की कोशिश करता है ("यदि मैं X कहता हूँ, तो Y आमतौर पर होता है"), और फिर उस मानचित्र के आधार पर योजना बनाता है। यह कठिन है लेकिन अधिक कुशल हो सकता है।
  • वैल्यू-बेस्ड बनाम पॉलिसी-बेस्ड बनाम एक्टर-क्रिटिक:
    • पॉलिसी-बेस्ड: AI अच्छे ग्रेड पाने के लिए आदतों का एक सेट (एक "पॉलिसी") सीखता है।
    • वैल्यू-बेस्ड: AI कार्य करने से पहले ही यह अनुमान लगाने में सीखता है कि "यह स्थिति कितनी अच्छी है?"
    • एक्टर-क्रिटिक: एक टीम दृष्टिकोण। एक हिस्सा (एक्टर) तय करता है कि क्या करना है, और दूसरा हिस्सा (क्रिटिक) निर्णय करता है कि वह निर्णय कितना अच्छा था। पेपर नोट करता है कि जबकि "एक्टर-क्रिटिक" रोबोटिक्स में स्वर्ण मानक (gold standard) है, अधिकांश AI शोधकर्ता वर्तमान में "क्रिटिक-फ्री" विधियों का उपयोग कर रहे हैं क्योंकि उन्हें विशाल कंप्यूटरों पर चलाना सस्ता है।
  • ऑन-पॉलिसी बनाम ऑफ-पॉलिसी:
    • ऑन-पॉलिसी: AI केवल उन्हीं चीजों से सीखता है जो उसने अभी-अभी की हैं। यदि वह गलती करता है, तो वह उस डेटा को फेंक देता है और फिर से प्रयास करता है। यह सुरक्षित है लेकिन संसाधनों की बर्बादी है।
    • ऑफ-पॉलिसी: AI अपनी पिछली गलतियों और सफलताओं से सीखता है, भले ही वह अब एक थोड़ी अलग रणनीति का उपयोग कर रहा हो। यह अपने पुराने टेस्ट पेपर की समीक्षा करने जैसा है ताकि गलतियों से सीखा जा सके। पेपर बताता है कि बहुत कम AI शोधकर्ता अभी यह कर रहे हैं, भले ही यह एक बड़ा लाभ हो।
  • क्रेडिट असाइनमेंट (श्रेय किसे मिलता है?):
    • यदि AI 100 शब्दों का निबंध लिखता है और उसे "A" ग्रेड मिलता है, तो उन 5 शब्दों में से कौन से सबसे महत्वपूर्ण थे?
    • वर्तमान डिफॉल्ट: अधिकांश विधियाँ बस कहती हैं, "पूरे निबंध पर बहुत अच्छा काम किया!" और हर शब्द को समान रूप से श्रेय देती हैं।
    • अंतराल (The Gap): पेपर का तर्क है कि हमें यह पता लगाने के लिए बेहतर तरीकों की आवश्यकता है कि वास्तव में किन शब्दों ने सफलता दिलाई, विशेष रूप से लंबे, जटिल तर्क कार्यों के लिए।

4. बड़ी तस्वीर: क्या गायब है?

लेखकों का मुख्य निष्कर्ष यह है कि यह क्षेत्र असंतुलित है।

  • भीड़ (The Crowd): लगभग सभी लोग एक ही कुछ उपकरणों (क्रिटिक-फ्री विधियां, मोंटे कार्लो क्रेडिट असाइनमेंट) का उपयोग कर रहे हैं। यह एक ही सड़क पर एक ही मॉडल की कार चलाने वाले एक ही शहर के लोगों जैसा है।
  • खाली स्थान (The Empty Lots): सुदृढीकरण लर्निंग (RL) की दुनिया में बहुत सारे बड़े, अच्छी तरह से बने हुए रास्ते (जैसे ऑफ-पॉलिसी लर्निंग, वैल्यू-बेस्ड मेथड्स और बूटस्ट्रैपिंग) हैं जो पूरी तरह से खाली हैं।
  • अवसर (The Opportunity): पेपर सुझाव देता है कि व्यापक RL की दुनिया से इन "विस्मृत" तकनीकों को उधार लेकर, हम AI को बेहतर ढंग से तर्क करने, तेजी से सीखने और कठिन कार्यों को संभालने में सक्षम बना सकते हैं, बिना बहुत अधिक कंप्यूटिंग पावर की आवश्यकता के।

संक्षेप में: यह पेपर पहिया दोबारा बनाने (reinventing the wheel) को रोकने का आह्वान है। यह कहता है, "हम AI को प्रशिक्षित करने के लिए बहुत ही संकीमित सेट के उपकरणों का उपयोग कर रहे हैं। अन्य क्षेत्रों में जो बेहतरीन काम करते हैं, वहां से शक्तिशाली उपकरणों का एक पूरा गोदाम मौजूद है, और हमें उन्हें आज़माना शुरू कर देना चाहिए।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →