← नवीनतम पेपर
💬 NLP

Process Reward Informed Tree Rollout for Effective Multi-Turn RL

यह शोध पत्र PATR को प्रस्तुत करता है, जो एक प्रोसेस-रिवॉर्ड-गाइडेड एडेप्टिव ट्री रोलआउट फ्रेमवर्क है जो आशाजनक मध्यवर्ती अवस्थाओं (intermediate states) से चुनिंदा रूप से शाखा बनाने और साझा प्रीफिक्स के पुन: उपयोग द्वारा LLM एजेंटों के लिए मल्टी-टर्न सुदृढीकरण शिक्षण (reinforcement learning) को अनुकूलित करता है, जिससे पारंपरिक यूनिफॉर्म ट्राजेक्टरी सैंपलिंग विधियों की तुलना में SWE-Bench और FrozenLake जैसे बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Xintong Li, Sha Li, Yuwei Zhang, Changlong Yu, Rongmei Lin, Hongye Jin, Shuyi Guan, Xin Liu, Linwei Li, Qingyu Yin, Jingbo Shang

प्रकाशित 2026-07-20
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xintong Li, Sha Li, Yuwei Zhang, Changlong Yu, Rongmei Lin, Hongye Jin, Shuyi Guan, Xin Liu, Linwei Li, Qingyu Yin, Jingbo Shang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रहस्य सुलझाना सिखा रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे रीइन्फोर्समेंट लर्निंग (RL) कहा जाता है। इसे एक कुत्ते को प्रशिक्षित करने जैसा समझें: रोबोट एक कार्य करने की कोशिश करता है, और यदि वह इसे सही ढंग से करता है, तो उसे एक इनाम (ट्रीट) मिलता है; यदि वह गलती करता है, तो उसे कुछ नहीं मिलता। समय के साथ, रोबोट सीख जाता है कि किन कार्यों से उसे इनाम मिलते हैं। लेकिन यहाँ एक पेचीदा बात है: कभी-कभी रोबोट को इनाम देखने से पहले कई चरणों वाले एक लंबे, घुमावदार रास्ते पर चलना पड़ता है। यदि रोबोट केवल बेतरतीब ढंग से अनुमान लगाता है, तो वह घंटों तक गोल-गोल घूमने या गड्ढों में गिरने में बर्बाद कर सकता है, और सही रास्ता कभी नहीं सीख पाएगा। यह "एजेंटों" के लिए विशेष रूप से कठिन है—जो AI प्रोग्राम हैं जो कंप्यूटर या वेबसाइट जैसे उपकरणों के साथ इंटरैक्ट करते हैं—क्योंकि उन्हें एक समस्या को हल करने के लिए एक के बाद एक, कई निर्णय लेने होते हैं। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: हम इन एजेंटों को बिना समय बर्बाद किए सही रास्तों की खोज करने के लिए कैसे सिखा सकते हैं?

यहीं पर एक नया विचार आता है जिसे PATR कहा जाता है। इस शोधपत्र के पीछे के शोधकर्ताओं ने, जो UC सैन डिएगो, अमेज़न और MIT से हैं, गौर किया कि इन AI एजेंटों को प्रशिक्षित करने के मौजूदा तरीके थोड़े 'स्कैटरगन अप्रोच' (बिखराव वाले दृष्टिकोण) की तरह हैं। वे AI को हर बार एक ही कार्य को शुरू से बार-बार करने के लिए कहते हैं। यदि AI किसी लूप में फंस जाता है या शुरुआत में कोई गलत कदम उठा लेता है, तो पूरे प्रयास को खारिज कर दिया जाता है, भले ही शुरुआती कुछ कदम वास्तव में काफी अच्छे रहे हों। यह बिल्कुल वैसा ही है जैसे पूरी पिज्जा को सिर्फ इसलिए फेंक देना क्योंकि उसका क्रस्ट जल गया है, जबकि बाकी चीज़ और सॉस एकदम सही था।

लेखक इन एजेंटों को प्रशिक्षित करने का एक स्मार्ट तरीका प्रस्तावित करते हैं, जिसे वे प्रोसेस-स्कोरर गाइडेड एडेप्टिव ट्री रोलआउट (PATR) कहते हैं। हर बार शुरू से शुरू करने के बजाय, PATR संभावनाओं का एक "पेड़" (ट्री) बनाता है। कल्पना कीजिए कि AI सड़क के मोड़ पर एक हाइकर (हाइकर) है। दस हाइकर्स को दस पूरी तरह से अलग, यादृच्छिक रास्ते आज़माने के लिए भेजने के बजाय, PATR सबसे आशाजनक रास्ते पर पहले हाइकर्स भेजता है। यदि उस रास्ते पर चलने वाले हाइकर्स को एक सुंदर दृश्य (एक "अच्छा" मध्यवर्ती चरण) मिलता है, तो सिस्टम विभिन्न शाखाओं की खोज करने के लिए उसी पथ पर अधिक हाइकर्स भेजता है। यदि कोई रास्ता ऐसा दिखता है जो किसी चट्टान की ओर ले जा रहा है (एक "बुरा" चरण), तो सिस्टम ऊर्जा बचाने के लिए उसे जल्दी ही बंद कर देता है। महत्वपूर्ण बात यह है कि यह उन हाइकर्स का भी रिकॉर्ड रखता है जो चट्टान से गिरे थे, क्योंकि यह जानना कि क्या नहीं करना है, उतना ही महत्वपूर्ण है जितना कि यह जानना कि क्या करना है।

शोधपत्र सुझाव देता है कि यह "पेड़" वाला तरीका बहुत अधिक कुशल है। एक "स्कोरर" (एक स्मार्ट जज जो हर कुछ चरणों के बाद हाइकर की प्रगति को देखता है) का उपयोग करके, सिस्टम यह तय कर सकता है कि किन रास्तों का विस्तार करना है और किन को हटाना (प्रून) है। उन्होंने दो बहुत अलग चुनौतियों पर इसका परीक्षण किया: फ्रोजनलेक (FrozenLake) नामक एक सरल ग्रिड-वर्ल्ड गेम (जहाँ एक एजेंट को गड्ढों में गिरने के बिना जमी हुई झील में रास्ता खोजना होता है) और एक बहुत कठिन वास्तविक दुनिया का कोडिंग कार्य जिसे SWE-Bench कहा जाता है (जहाँ एक एजेंट को सॉफ्टवेयर के बग्स ठीक करने होते हैं)।

परिणाम उत्साहजनक थे। कोडिंग कार्य पर, PATR ने मानक पद्धति की तुलना में एजेंट की सफलता दर को 5.0 अंक तक सुधार दिया। सरल गेम पर, इसने सफलता को 9.3 अंक तक बढ़ा दिया। लेखकों ने पाया कि इस पद्धति ने न केवल AI को स्मार्ट बनाया; बल्कि इसे तेज़ भी बनाया और इसे दोहराव वाले लूप में फंसने से रोका। वे इस बात पर जोर देते हैं कि यह कोई जादुई समाधान नहीं है जो सब कुछ तुरंत हल कर दे, लेकिन यह सुझाव देता है कि एक "प्रोसेस स्कोरर" के साथ खोज को निर्देशित करना AI एजेंटों को लंबे, जटिल कार्यों को बिना समय बर्बाद किए निपटाने के लिए सिखाने का एक शक्तिशाली तरीका है। मुख्य बात यह है कि अपने "एक्सप्लोरर्स" (खोजकर्ताओं) को कहाँ भेजना है, इसके बारे में चयनात्मक होकर, हम कम प्रयास के साथ अधिक सीख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →