← नवीनतम पेपर
🤖 AI

TCPO: Turn-Level Credit Policy Optimization

यह शोध पत्र TCPO का प्रस्ताव करता है, जो एक टर्न-लेवल क्रेडिट असाइनमेंट विधि है जो रिट्रोस्पेक्टिव (retrospective), हिंडसाइट (hindsight) और काउंटरफैक्चुअल (counterfactual) तुलनाओं के माध्यम से वेरीफायर स्कोर को डेंस क्रेडिट्स में परिवर्तित करती है ताकि रीजनिंग और एजेंट कार्यों में मल्टी-टर्न सुदृढीकरण लर्निंग (reinforcement learning) प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Sicong Liao, Zhi Chen, Yaohua Tang

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sicong Liao, Zhi Chen, Yaohua Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक कठिन पहेली सुलझाना सिखा रहे हैं। पुराने दिनों में, आप रोबोट को कोशिश करने देते, वह असफल होता, और फिर आप अंत में बस इतना कहते, "नहीं, यह काम नहीं किया," या "हाँ, तुमने कर दिखाया!" लेकिन क्या होगा अगर रोबोट को उसके हर एक कदम के बाद थोड़ा स्कोर मिल सके? यह वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग (Reinforcement Learning with Verifiable Rewards) की दुनिया है। यह एक वीडियो गेम खेलने जैसा है जहाँ आपको लेवल खत्म होने पर नहीं, बल्कि हर जंप के बाद स्कोर मिलता है। यह रोब를 को तेज़ी से सीखने में मदद करता है क्योंकि उसे पता चलता है कि कौन से कदम अच्छे थे और कौन से बुरे।

हालाँकि, यहाँ एक चालाकी भरी समस्या है। सिर्फ इसलिए कि किसी कदम ने उच्च स्कोर दिलाया, इसका मतलब यह नहीं है कि उसी ने सफलता का कारण बना। हो सकता है कि रोबोट पहले से ही जीतने वाले रास्ते पर था, और उस कदम ने बस उसे वहीं बनाए रखा। या शायद एक कदम उस समय बहुत बुरा लग रहा था, लेकिन वास्तव में उसने तीन कदम बाद एक शानदार समाधान का रास्ता तैयार कर दिया। यदि रोबोट को गलत कारणों से श्रेय मिलता है, तो वह एक ही गलती को बार-बार दोहराना सीख सकता है। बड़ा सवाल वैज्ञानिकों के लिए यह है: हम उन स्कोर्स को कैसे लें और यह पता लगाएं कि किस कदम को वास्तव में श्रेय मिलना चाहिए?

यहीं पर TCPO (टर्न-लेवल क्रेडिट पॉलिसी ऑप्टिमाइज़ेशन) नामक एक नई विधि आती है। TCPO को एक सुपर-स्मार्ट कोच के रूप में सोचें जो केवल स्कोरबोर्ड को नहीं देखता; बल्कि वह रीप्ले देखता है और पूछता है, "क्या इस चाल ने वास्तव में मदद की, या यह सिर्फ किस्मत थी?" TCPO के पीछे के शोधकर्ताओं ने महसूस किया कि रोबोट को हर टर्न के लिए स्कोर देना ही काफी नहीं है। आपको उस स्कोर को "क्रेडिट" में बदलना होगा जो बताता है कि उस विशिष्ट टर्न ने जीतने की उसकी संभावनाओं को कितना बदल दिया।

यहाँ बताया गया है कि TCPO कुछ चतुर तरीकों का उपयोग करके कैसे काम करता है:

  1. पीछे मुड़कर देखना (रेट्रोस्पेक्टिव क्रेडिट): कल्पना कीजिए कि आप एक पहाड़ चढ़ रहे हैं। यदि आप एक ऐसा कदम उठाते हैं जो आपको किसी भी ऐसे बिंदु से ऊपर ले जाता है जहाँ आप पहले पहुँचे थे, तो TCPO आपको एक बड़ा "अच्छा काम किया!" देता है। यदि आप एक ऐसा कदम उठाते हैं जो आपको उसी ऊँचाई पर बनाए रखता है (आपकी सफलता को सुरक्षित रखता है), तो TCPO कहता है, "इसे जारी रखो!" लेकिन यदि आप एक ऐसा कदम उठाते हैं जिससे आप नीचे फिसल जाते हैं जबकि आप पहले ही शीर्ष पर पहुँच चुके थे, तो TCPO कहता है, "हे, यह एक बुरा कदम था!" यह रोबोट को ऊँचा चढ़ने और वापस नीचे गिरने से बचने में मदद करता है।

  2. आगे की ओर देखना (हाइंडसाइट क्रेडिट): कभी-कभी, एक कदम उबाऊ या बुरा भी लग सकता है। शायद रोबोट एक अजीब सी आवाज़ करता है जिससे ऐसा लगता है कि कोई मदद नहीं मिल रही। लेकिन बाद में, वह आवाज़ एक दरवाज़ा खोलने की कुंजी बन जाती है। TCPO भविष्य को देखता है। यदि एक "उबाऊ" कदम अंततः जीत की ओर ले जाता है, तो TCPO उसे क्रेडिट देता है, यह कहते हुए, "मुझे पता है कि उस समय तुम बेकार लग रहे थे, लेकिन वास्तव में तुम नायक थे।" यह रोबोट को उन कदमों को छोड़ने से रोकता है जिनमें परिणाम मिलने में समय लगता है।

  3. "क्या होगा अगर" परीक्षण (काउंटरफैक्टुअल क्रेडिट): यह सबसे जादुई हिस्सा है। कभी-कभी, रोबोट एक ऐसा कदम उठाता है जो बहुत भ्रमित करने वाला होता है। क्या इसने मदद की? क्या इसने नुकसान पहुँचाया? TCPO एक त्वरित "क्या होगा अगर?" सिमुलेशन चलाता है। यह पूछता है, "यदि रोबोट ने ठीक इसी जगह कुछ बिल्कुल अलग किया होता, तो क्या वह बेहतर कर पाता?" यदि रोबोट का वास्तविक कदम अन्य यादृच्छिक विकल्पों की तुलना में बेहतर था, तो उसे अतिरिक्त क्रेडिट मिलता है। यदि यह बदतर था, तो उसे दंड मिलता है। यह रोबोट को सबसे भ्रमित करने वाले क्षणों से सीखने में मदद करता है बिना आसान वाले समय को बर्बाद किए।

शोधकर्ताओं ने इस नए कोच का परीक्षण तीन बहुत अलग चुनौतियों पर किया: गणित की समस्याओं को हल करना, कंप्यूटर कोड लिखना, और AppWorld नामक एक जटिल एजेंट गेम खेलना। उन्होंने विभिन्न आकारों के अलग-अलग रोबोट दिमागों (मॉडल्स) का उपयोग किया यह देखने के लिए कि क्या TCPO हर जगह काम करता है।

परिणाम प्रभावशाली थे। गणित और कोडिंग कार्यों पर, TCPO ने रोबोटों को सही उत्तर अधिक बार प्राप्त करने में मदद की और, महत्वपूर्ण रूप से, उन्हें कम चरणों में खोजने में भी मदद की। उदाहरण के लिए, MATH-500 नामक एक कठिन गणित परीक्षण पर, TCPO-प्रशिक्षित रोबोट ने 86.8% बार सही उत्तर दिया, जो पिछले सर्वोत्तम तरीकों को पछाड़ गया। कोड जनरेशन में भी इसमें महत्वपूर्ण सुधार हुआ। AppWorld गेम में, जहाँ रोबोट को टूल्स का उपयोग करना होता है और अवस्थाओं (states) को याद रखना होता है, TCPO ने अन्य तरीकों की तुलना में कार्यों को अधिक विश्वसनीयता से पूरा करने में मदद की।

यह पेपर सुझाव देता है कि असली सफलता मंत्र केवल अधिक डेटा या एक बड़ा रोबोट होना नहीं है; यह इस बारे में है कि आप फीडबैक की व्याख्या कैसे करते हैं। टर्न-दर-टर्न क्रेडिट में अपने स्कोर्स को सावधानीपूर्वक बदलकर, TCPO रोबोट को अपनी गलतियों को सुधारने, अपनी सफलताओं को बनाए रखने और यह पहचानने में मदद करता है कि कब एक मामूली सा बुरा कदम वास्तव में जीत के लिए एक जीनियस सेटअप है। यह एक साधारण स्कोरकार्ड को एक विस्तृत पाठ योजना में बदल देता है, जिससे सीखने की प्रक्रिया अधिक कुशल और प्रभावी हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →