← नवीनतम पेपर
🤖 machine learning

Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning

यह शोध पत्र एनवायर्नमेंटल फीडबैक-आधारित क्रेडिट असाइनमेंट (EFCA) का प्रस्ताव करता है, जो एक मल्टी-टाइमस्केल सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) दृष्टिकोण है जो स्पार्स रिवॉर्ड्स को विघटित करने और लॉन्ग-होरिज़न एजेंटिक कार्यों में प्रदर्शन सुधारने के लिए पर्यावरण इंटरैक्शन से निकाले गए शॉर्ट-टर्म एक्शन इफेक्ट्स और मीडियम-टर्म स्टेट-हिस्ट्री पैटर्न का लाभ उठाता है।

मूल लेखक: Yifu Huo, Shunjie Xing, Chenglong Wang, Peinan Feng, Qiaozhi He, Yan Ding, Anxiang Ma, Yuxin Gao, Tongran Liu, Tong Xiao, Jingbo Zhu

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yifu Huo, Shunjie Xing, Chenglong Wang, Peinan Feng, Qiaozhi He, Yan Ding, Anxiang Ma, Yuxin Gao, Tongran Liu, Tong Xiao, Jingbo Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल केक बनाना सिखा रहे हैं। पुराने दिनों में, रोबोट को पूरा केक बनाने दिया जाता था, और बिल्कुल अंत में ही आप कहते थे, "बहुत अच्छा काम किया!" या "बहुत बुरा हाल कर दिया!" यदि केक अच्छा था, तो उसे हर उस कदम के लिए उच्च स्कोर मिलता था जो उसने उठाया था, यहाँ तक कि उन कदमों के लिए भी जहाँ वह बस ओवन को घूर रहा था या उसने चम्मच गिरा दिया था। यदि केक खराब था, तो उसे हर कदम के लिए कम स्कोर मिलता था, यहाँ तक कि उस कदम के लिए भी जब उसने सही ढंग से अंडा फोड़ा था। यह एक अभ्यास समस्या (प्रैक्टिस प्रॉब्लम) पर किए गए काम को अनदेखा करके केवल अंतिम ग्रेड देखने जैसा है। यह सीखने की प्रक्रिया को धीमा और भ्रमित करने वाला बना देता है क्योंकि रोबोट को यह पता नहीं चलता कि कौन सी विशिष्ट चालों ने मदद की और किनसे नुकसान हुआ।

यह "एजेंटिक रीइन्फोर्समेंट लर्निंग" (Agentic Reinforcement Learning) के क्षेत्र में आ रही समस्या है, जहाँ हम शक्तिशाली AI मॉडल (जैसे वे जो आपसे चैट करते हैं) को वास्तविक दुनिया में एजेंट के रूप में कार्य करना सिखाते हैं। इन एजेंटों को किसी समस्या को हल करने के लिए कई कदम उठाने होते हैं, जैसे कि एक आभासी घर में घूमना या किसी वेबसाइट पर खरीदारी करना। आमतौर पर, उन्हें यात्रा के बिल्कुल अंत में इनाम का संकेत मिलता है। इससे यह समझना कठिन हो जाता है कि कौन से विशिष्ट कार्य नायक थे और कौन से खलनायक। वैज्ञानिक इसे ठीक करने के लिए अंतिम स्कोर को छोटे टुकड़ों में तोड़ने की कोशिश कर रहे थे, लेकिन अक्सर वे अभी भी अनुमान लगाने या अतिरिक्त, जटिल "जज" (न्यायाधीश) प्रणालियाँ बनाने पर निर्भर रहते हैं जिन्हें शुरू से प्रशिक्षित करना पड़ता है।

यहाँ एक नया विचार आता है जिसे EFCA (एनवायर्नमेंटल फीडबैक-बेस्ड क्रेडिट असाइनमेंट) कहा जाता है। एक नया जज बनाने या यह अनुमान लगाने के बजाय कि क्या हुआ, लेखक सुझाव देते हैं कि हमें बस पर्यावरण (environment) को सुनना चाहिए। पर्यावरण को एक चिड़चिड़े लेकिन ईमानदार शिक्षक के रूप में सोचें जो हर चाल के बाद तत्काल प्रतिक्रिया देता है। यदि आप गलत सामग्री उठाते हैं, तो शिक्षक कह सकता है, "कुछ नहीं हुआ।" यदि आप सही कैबिनेट खोलते हैं, तो वे कहते हैं, "आपने आटा उठा लिया।" शोध पत्र प्रस्तावित करता है कि हमें इन सूक्ष्म, तत्काल प्रतिक्रियाओं का उपयोग करना चाहिए—पिछले कुछ कदमों में क्या हुआ इस पर नज़र डालने के साथ मिलकर—ताकि हम AI को उसके हर एक कदम के लिए एक बहुत स्पष्ट स्कोर दे सकें।

शोधकर्ताओं ने इस विचार का परीक्षण दो चुनौतीपूर्ण दुनियाओं में किया: ALFWorld, जहाँ एक एजेंट को सफाई करने या भोजन गर्म करने जैसे घरेलू काम करने होते हैं, और WebShop, जहाँ एक एजेंट को बिल्कुल सही वस्तु खरीदने के लिए एक नकली ऑनलाइन स्टोर में नेविगेट करना होता है। उन्होंने पाया कि इस "पर्यावरण को सुनने" वाले दृष्टिकोण का उपयोग करके, AI तेजी से सीखता है और बेहतर काम करता है। विशेष रूप से, इस पद्धति ने AI को एक ही गलती दोहराने (जैसे कि उस दरवाजे को खोलने की कोशिश करना जो पहले से ही खुला है) से बचने में मदद की और उसे प्रगति जारी रखने के लिए प्रोत्साहित किया, भले ही अंतिम लक्ष्य अभी भी दूर हो।

शोध पत्र सुझाव देता है कि यह विधि पिछले उन तरीकों की तुलना में बेहतर काम करती है जो हर कदम के मूल्य का अनुमान लगाने की कोशिश करते थे या केवल अंतिम परिणाम पर निर्भर करते थे। अपने प्रयोगों में, नई विधि ने लगातार AI की सफलता दर और उसके द्वारा पूरे किए गए कार्यों की गुणवत्ता में सुधार किया। उदाहरण के लिए, ALFWorld बेंचमार्क पर, इस पद्धति ने 1.5-बिलियन-पैरामीटर वाले मॉडल को 95.31 का स्कोर प्राप्त करने में मदद की, जो कई अन्य मजबूत तरीकों को पीछे छोड़ देता है। WebShop पर, इसने न केवल एजेंट को कुछ खरीदने में मदद की; बल्कि इसने एजेंट को उपयोगकर्ता की विशिष्ट आवश्यकताओं जैसे कीमत, रंग और प्रकार के अनुसार बिल्कुल सही चीज़ खरीदने में मदद की, जो पहले की तुलना में बहुत अधिक सटीक था।

मुख्य बात यह है कि हमें AI को उसकी गलतियों से सीखने के लिए सिखाने हेतु जटिल नई प्रणालियों के आविष्कार करने की आवश्यकता नहीं है। पर्यावरण पहले से ही एजेंट से बात कर रहा है, उसे कदम-दर-कदम बता रहा है कि क्या काम आया और क्या नहीं। इन बातचीत पर ध्यान देकर, हम AI को सफल होने के लिए एक बहुत बेहतर मानचित्र दे सकते हैं, जिससे एक लंबी, भ्रमित करने वाली यात्रा स्पष्ट, निर्देशित कदमों की एक श्रृंखला में बदल जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →