← नवीनतम पेपर
🤖 AI

Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning

यह शोध पत्र HyGAE का प्रस्ताव करता है, जो एक एक्टर-क्रिटिक फ्रेमवर्क है जो VLM एजेंटिक सुदृढीकरण शिक्षण (reinforcement learning) के लिए टोकन- और टर्न-स्तरीय उद्देश्यों को संयुक्त रूप से अनुकूलित करने हेतु एक सैद्धांतिक रूप से आधारित हाइब्रिड एडवांटेज और एक एकीकृत क्रिटिक पेश करता है, जिससे मल्टी-टर्न निर्णय लेने वाले वातावरणों में 91% सफलता दर और मौजूदा विधियों की तुलना में 10% सुधार प्राप्त होता है।

मूल लेखक: Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny

प्रकाशित 2026-07-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को एक जटिल वीडियो गेम खेलना सिखा रहे हैं। इस रोबोट के पास एक ऐसा मस्तिष्क है जो चित्रों को देख सकता है और भाषा को समझ सकता है, लेकिन यह थोड़ा अदूरदर्शी है। यह वर्तमान स्क्रीन को देखने और अगले कदम का अनुमान लगाने में बहुत अच्छा है, लेकिन यह अक्सर भूल जाता है कि पांच टर्न पहले क्या हुआ था। यदि यह कोई चाल चलता है और विफल हो जाता है, तो यह शायद बार-बार वही चीज़ करने की कोशिश करता रहेगा, क्योंकि यह बड़े परिदृश्य में अपनी गलतियों से सीखना नहीं जानता। यही "मल्टी-टर्न डिसीजन-मेकिंग" (बहु-चरण निर्णय लेने) की चुनौती है: हम एक मॉडल को केवल 'अभी' पर प्रतिक्रिया देना ही नहीं, बल्कि समय के साथ एक पूरी रणनीति बनाना कैसे सिखाएं?

इस समस्या को हल करने के लिए, वैज्ञानिक 'रीइन्फोर्समेंट लर्निंग' (RL) नामक विधि का उपयोग करते हैं। RL को एक कुत्ते को ट्रीट (इनाम) देकर प्रशिक्षित करने जैसा समझें। कुत्ता एक क्रिया करता है, और यदि वह कुछ अच्छा करता है, तो उसे एक ट्रीट मिलता है। यदि वह कुछ बुरा करता है, तो उसे कोई ट्रीट नहीं मिलता या एक हल्का सा "ना" मिलता है। लक्ष्य AI को अपने 'ट्रीट्स' को अधिकतम करने के लिए सिखाना है। लेकिन एक पेचीदा हिस्सा है: आप यह कैसे तय करेंगे कि AI द्वारा की गई किस विशिष्ट सोच या शब्द ने "अच्छा" काम किया था? क्या पूरे वाक्य ने ट्रीट कमाया, या केवल अंतिम शब्द ने? यह शोध पत्र ठीक इसी पहेली को सुलझाने की कोशिश करता है, यह पता लगाने के लिए कि AI के कार्यों को श्रेय (या दोष) देने का सबसे अच्छा तरीका क्या है, चाहे वे क्रियाएं एक एकल अक्षर टाइप करने जैसे छोटे कदम हों या एक पूरे गेम का दौर पूरा करने जैसे बड़े कदम।

इस अध्ययन के पीछे के शोधकर्ताओं ने, जिनका नेतृत्व वेनक्सुआन झांग और सहयोगियों ने किया, देखा कि वर्तमान विधियां बीच में फंसी हुई हैं। कुछ विधियां AI द्वारा उत्पन्न प्रत्येक शब्द को एक अलग क्रिया मानती हैं, जो एक कुत्ते को हर बार पैर उठाने पर ट्रीट देने जैसा है, भले ही वह केवल कान खुजला रहा हो। अन्य विधियां पूरे संवाद टर्न को एक बड़ी क्रिया मानती हैं, जो एक पूरे करतब के अंत में ही ट्रीट देने जैसा है, जिससे यह जानना कठिन हो जाता है कि कौन सी विशिष्ट चाल असली हीरो थी। टीम को एहसास हुआ कि दोनों दृष्टिकोणों में खामियां हैं और सबसे अच्छा समाधान एक हाइब्रिड (मिश्रित) हो सकता है।

उन्होंने HyGAE (हाइब्रिड जनरलाइज्ड एडवांटेज एस्टीमेशन) नामक एक नया ढांचा विकसित किया। कल्पना कीजिए कि आप एक सॉकर टीम को कोचिंग दे रहे हैं। "टोकन-वाइज" दृष्टिकोण वैसा ही है जैसे खिलाड़ियों द्वारा किए गए हर एक पास की प्रशंसा करना, भले ही गेंद आगे न बढ़ रही हो। "टर्न-वाइज" दृष्टिकोण वैसा है जैसे केवल गोल होने पर ही जश्न मनाना, उन सभी पासों को अनदेखा करना जो गोल तक ले गए। HyGAE दोनों का काम करने वाला कोच है: यह खिलाड़ियों को तेज रखने के लिए व्यक्तिगत पास (टोकन) के लिए थोड़ा सा प्रशंसा देता है, लेकिन यह सुनिश्चित करने के लिए कि टीम वास्तव में जीत रही है, अंतिम गोल (टर्न) को भारी महत्व भी देता है।

यह शोध पत्र गणितीय रूप से सिद्ध करता है कि आप दो अलग-अलग कोचों की आवश्यकता के बिना इन दोनों तरीकों को मिला सकते हैं। उन्होंने एक "यूनिफाइड क्रिटिक" (एकीकृत आलोचक) बनाया—एक एकल न्यायाधीश जो सूक्ष्म कदमों और बड़ी तस्वीर दोनों का एक साथ मूल्यांकन कर सकता है। यह न्यायाधीश पुरस्कारों को मिलाने के लिए एक विशेष सूत्र का उपयोग करता है, जिससे यह सुनिश्चित होता है कि AI अपनी भाषा में सटीक होने और अपनी योजना बनाने में रणनीतिक होने, दोनों के लिए सीखता है। उन्होंने इसका परीक्षण पांच अलग-अलग वीडियो-गेम जैसे वातावरणों पर किया, ग्रिड में बक्से धकेलने (सोकोबान) से लेकर ब्लॉक को स्टैक करने के लिए एक रोबोटिक आर्म को निर्देशित करने तक।

परिणाम प्रभावशाली थे। इन परीक्षणों में, HyGAE-प्रशिक्षित AI ने 91% की औसत सफलता दर हासिल की, जो अन्य शीर्ष विधियों से लगभग 10% बेहतर थी। शोधकर्ताओं ने पाया कि पुरस्कारों को मिलाने का यह विशिष्ट तरीका महत्वपूर्ण था; यदि उन्होंने खोजे गए सटीक गणितीय सूत्र के बिना केवल स्कोर का औसत निकालने की कोशिश की होती, तो प्रशिक्षण अक्सर विफल हो जाता या अस्थिर हो जाता। उन्होंने यह भी दिखाया कि यह विधि AI को "नियर्साइटेड" (अदूरदर्शी) जाल से बचने में मदद करती है, जहाँ वह बार-बार एक ही असफल क्रिया को दोहराता है। HyGAE के साथ, AI अपने इतिहास को देखना सीखता है, यह महसूस करता है कि एक चाल काम नहीं आई, और तुरंत अपने लक्ष्य तक पहुँचने के लिए एक अलग रणनीति आज़माता है।

संक्षेप में, यह शोध पत्र केवल एक नया तरीका सुझाता ही नहीं है; यह AI एजेंटों को प्रशिक्षित करने के एक बेहतर तरीके के लिए एक ठोस गणितीय आधार प्रदान करता है। यह सिद्ध करके कि आप सूक्ष्म विवरणों और बड़ी रणनीतियों दोनों के लिए एक साथ अनुकूलित कर सकते हैं, उन्होंने AI को एक वास्तविक, दीर्घकालिक योजनाकार बनने की दिशा में एक स्पष्ट मार्ग दिया है, न कि केवल एक प्रतिक्रियाशील अनुमान लगाने वाला।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →