Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning
यह शोध पत्र PTA-GRPO का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो उच्च-स्तरीय योजना मार्गदर्शन के लिए सुपरवाइज्ड फाइन-ट्यूनिंग को गाइडेंस-अवेयर रिइन्फोर्समेंट लर्निंग के साथ जोड़ता है ताकि विविध गणितीय और वैज्ञानिक बेंचमार्क पर लार्ज लैंग्वेज मॉडल्स की वैश्विक तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Plan Then Action" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
समस्या: "दौड़ो और अंदाज़ा लगाओ" का जाल (The "Run-and-Guess" Trap)
कल्पना कीजिए कि आप एक बहुत ही कठिन भूलभुलैया (maze) को हल करने की कोशिश कर रहे हैं। वर्तमान के अधिकांश AI मॉडल (Large Language Models) एक ऐसे व्यक्ति की तरह व्यवहार करते हैं जो तुरंत एक रास्ते पर दौड़ना शुरू कर देता है। वे एक कदम उठाते हैं, फिर अगला, फिर अगला, और हमेशा केवल अपने ठीक सामने वाले कदम को देखते रहते हैं।
पेपर इसे Chain-of-Thought (CoT) कहता है। यह सरल भूलभुलैया के लिए तो ठीक काम करता है, लेकिन जटिल भूलभुलैया के लिए, AI अक्सर रास्ता भटक जाता है। यह गलत मोड़ ले सकता है, चक्कर काटते हुए चलते रह सकता है क्योंकि यह बड़ी तस्वीर देखने के बजाय केवल अगले कदम पर बहुत अधिक केंद्रित होता है, या बहुत देर से एहसास करता है कि उसने शुरुआत में गलती की थी। जब तक यह अंत तक पहुँचता है, तब तक यह अक्सर भ्रमित हो जाता है या गलत उत्तर दे देता है।
अन्य तरीके इस समस्या को ठीक करने की कोशिश करते हैं, जैसे AI को एक साथ कई अलग-अलग रास्तों के बारे में "सोचने" के लिए कहना (जैसे कि एक ट्री सर्च/tree search), लेकिन यह अविश्वसनीय रूप से धीमा और महंगा है, जैसे कि हर संभव रास्ते पर दौड़ने के लिए सौ लोगों को एक साथ काम पर रखना।
समाधान: "प्लान देन एक्शन" (PTA-GRPO)
लेखकों ने AI को प्रशिक्षित करने का एक नया तरीका प्रस्तावित किया है जिसे PTA-GRPO कहा जाता है। इसे AI को दौड़ना शुरू करने से पहले रुकने और एक नक्शा बनाने के लिए सिखाने के रूप में समझें।
यह प्रक्रिया दो मुख्य चरणों में होती है:
चरण 1: "नक्शा बनाने वाला" (Supervised Fine-Tuning)
सबसे पहले, शोधकर्ता AI को नक्शा बनाना सिखाते हैं। वे समस्या सुलझाने के मौजूदा अच्छे उदाहरणों को लेते हैं और एक स्मार्ट AI से उन लंबे, विस्तृत चरणों को एक छोटे, उच्च-स्तरीय "प्लान" या "रूपरेखा" (outline) में संक्षिप्त करने के लिए कहते हैं।
- उदाहरण: एक शेफ (chef) की कल्पना करें। केवल सब्जियां काटने और बर्तन चलाने को देखने के बजाय, AI को पहले एक रेसिपी कार्ड लिखना सिखाया जाता है: "1. प्याज काटें। 2. लहसुन को भूनें। 3. सॉस को धीमी आंच पर पकाएं।"
- AI इस छोटे प्लान को (
<plan>टैग के अंदर) आउटपुट करना सीखता है, इससे पहले कि वह वास्तव में काम (<thought>टैग के अंदर विस्तृत तर्क) करना शुरू करे।
चरण 2: "कोच" (Reinforcement Learning)
यही सबसे चतुर हिस्सा है। आमतौर पर, जब हम AI को प्रशिक्षित करते हैं, तो कोच केवल इस बात की परवाह करता है कि अंतिम उत्तर सही है या गलत। यदि AI सही उत्तर प्राप्त करता है लेकिन उसका रास्ता अजीब और भ्रमित करने वाला था, तो उसे "अच्छा काम किया" कहा जाता है। यदि वह गलत होता है, तो उसे "फिर से प्रयास करें" कहा जाता है।
लेखकों ने नियम बदल दिए। अब, कोच दो चीजों के लिए अंक देता है:
- क्या आपने सही उत्तर दिया? (परिणाम/Outcome)
- क्या आपका नक्शा (प्लान) वास्तव में अच्छा था? (मार्गदर्शन/Guidance)
- उदाहरण: एक छात्र की कल्पना करें जो गणित की परीक्षा दे रहा है।
- पुराना तरीका: शिक्षक केवल अंतिम संख्या की जाँच करता है। यदि छात्र ने सही संख्या का अनुमान लगाया लेकिन कुछ भी अर्थहीन लिखा, तो उसे 'A' ग्रेड मिलता है।
- PTA-GRPO तरीका: शिक्षक छात्र की रूपरेखा (outline) की भी जाँच करता है। यदि छात्र गणित करने से पहले एक स्पष्ट, तार्किक योजना लिखता है, तो उसे अतिरिक्त अंक मिलते हैं। यदि उनकी योजना अव्यवस्थित या गलत थी, तो वे अंक खो देते हैं, भले ही उन्होंने किसी तरह सही उत्तर का अनुमान लगा लिया हो।
यह AI को यह सीखने के लिए मजबूर करता है कि एक अच्छा प्लान एक अच्छा उत्तर देता है। यह स्पष्ट, उच्च-स्तरीय रणनीतियाँ बनाना सीखता है जो उसके सोचने के तरीके को निर्देशित करती हैं, जिससे वह भटकने से बच जाता है।
यह क्यों काम करता है
पेपर दिखाता है कि जब आप AI को इस तरह प्रशिक्षित करते हैं:
- यह "लोकल" गलतियाँ (एक कदम पर अटक जाना) करना बंद कर देता है।
- यह समस्या का "ग्लोबल" दृश्य (पूरी भूलभुलैया देखना) बनाता है।
- यह गणित और विज्ञान की समस्याओं में बहुत बेहतर हो जाता है, यहाँ तक कि छोटे, सस्ते कंप्यूटर मॉडल पर भी।
परिणाम
शोधकर्ताओं ने दस अलग-अलग कठिन गणित और विज्ञान बेंचमार्क पर इसका परीक्षण किया। उन्होंने पाया कि:
- इस "प्लान देन एक्शन" विधि से प्रशिक्षित मॉडल लगातार मानक तरीकों से प्रशिक्षित मॉडलों से बेहतर प्रदर्शन करते हैं।
- यह विभिन्न आकार के AI मॉडलों (छोटे से बड़े तक) पर अच्छी तरह काम करता है।
- AI केवल अंतिम उत्तर में ही बेहतर नहीं हुआ; यह एक संरचित, व्यवस्थित तरीके से सोचने में भी बेहतर हो गया।
सारांश
संक्षेप में, यह पेपर AI को किसी समस्या को हल करना शुरू करने से पहले रुकने, सोचने और एक योजना बनाने की शिक्षा देता है। AI को न केवल अंतिम परिणाम के लिए, बल्कि उसकी योजना की गुणवत्ता के लिए भी पुरस्कृत करके, AI जटिल समस्याओं को अधिक विश्वसनीयता के साथ हल करना सीख जाता है, जिससे वह उन "दौड़ो और अंदाज़ा लगाओ" वाली गलतियों से बच जाता है जो वर्तमान सिस्टमों में आम हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।