Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning
यह शोध पत्र एनवायर्नमेंटल फीडबैक-आधारित क्रेडिट असाइनमेंट (EFCA) का प्रस्ताव करता है, जो एक मल्टी-टाइमस्केल सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) दृष्टिकोण है जो स्पार्स रिवॉर्ड्स को विघटित करने और लॉन्ग-होरिज़न एजेंटिक कार्यों में प्रदर्शन सुधारने के लिए पर्यावरण इंटरैक्शन से निकाले गए शॉर्ट-टर्म एक्शन इफेक्ट्स और मीडियम-टर्म स्टेट-हिस्ट्री पैटर्न का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल केक बनाना सिखा रहे हैं। पुराने दिनों में, रोबोट को पूरा केक बनाने दिया जाता था, और बिल्कुल अंत में ही आप कहते थे, "बहुत अच्छा काम किया!" या "बहुत बुरा हाल कर दिया!" यदि केक अच्छा था, तो उसे हर उस कदम के लिए उच्च स्कोर मिलता था जो उसने उठाया था, यहाँ तक कि उन कदमों के लिए भी जहाँ वह बस ओवन को घूर रहा था या उसने चम्मच गिरा दिया था। यदि केक खराब था, तो उसे हर कदम के लिए कम स्कोर मिलता था, यहाँ तक कि उस कदम के लिए भी जब उसने सही ढंग से अंडा फोड़ा था। यह एक अभ्यास समस्या (प्रैक्टिस प्रॉब्लम) पर किए गए काम को अनदेखा करके केवल अंतिम ग्रेड देखने जैसा है। यह सीखने की प्रक्रिया को धीमा और भ्रमित करने वाला बना देता है क्योंकि रोबोट को यह पता नहीं चलता कि कौन सी विशिष्ट चालों ने मदद की और किनसे नुकसान हुआ।
यह "एजेंटिक रीइन्फोर्समेंट लर्निंग" (Agentic Reinforcement Learning) के क्षेत्र में आ रही समस्या है, जहाँ हम शक्तिशाली AI मॉडल (जैसे वे जो आपसे चैट करते हैं) को वास्तविक दुनिया में एजेंट के रूप में कार्य करना सिखाते हैं। इन एजेंटों को किसी समस्या को हल करने के लिए कई कदम उठाने होते हैं, जैसे कि एक आभासी घर में घूमना या किसी वेबसाइट पर खरीदारी करना। आमतौर पर, उन्हें यात्रा के बिल्कुल अंत में इनाम का संकेत मिलता है। इससे यह समझना कठिन हो जाता है कि कौन से विशिष्ट कार्य नायक थे और कौन से खलनायक। वैज्ञानिक इसे ठीक करने के लिए अंतिम स्कोर को छोटे टुकड़ों में तोड़ने की कोशिश कर रहे थे, लेकिन अक्सर वे अभी भी अनुमान लगाने या अतिरिक्त, जटिल "जज" (न्यायाधीश) प्रणालियाँ बनाने पर निर्भर रहते हैं जिन्हें शुरू से प्रशिक्षित करना पड़ता है।
यहाँ एक नया विचार आता है जिसे EFCA (एनवायर्नमेंटल फीडबैक-बेस्ड क्रेडिट असाइनमेंट) कहा जाता है। एक नया जज बनाने या यह अनुमान लगाने के बजाय कि क्या हुआ, लेखक सुझाव देते हैं कि हमें बस पर्यावरण (environment) को सुनना चाहिए। पर्यावरण को एक चिड़चिड़े लेकिन ईमानदार शिक्षक के रूप में सोचें जो हर चाल के बाद तत्काल प्रतिक्रिया देता है। यदि आप गलत सामग्री उठाते हैं, तो शिक्षक कह सकता है, "कुछ नहीं हुआ।" यदि आप सही कैबिनेट खोलते हैं, तो वे कहते हैं, "आपने आटा उठा लिया।" शोध पत्र प्रस्तावित करता है कि हमें इन सूक्ष्म, तत्काल प्रतिक्रियाओं का उपयोग करना चाहिए—पिछले कुछ कदमों में क्या हुआ इस पर नज़र डालने के साथ मिलकर—ताकि हम AI को उसके हर एक कदम के लिए एक बहुत स्पष्ट स्कोर दे सकें।
शोधकर्ताओं ने इस विचार का परीक्षण दो चुनौतीपूर्ण दुनियाओं में किया: ALFWorld, जहाँ एक एजेंट को सफाई करने या भोजन गर्म करने जैसे घरेलू काम करने होते हैं, और WebShop, जहाँ एक एजेंट को बिल्कुल सही वस्तु खरीदने के लिए एक नकली ऑनलाइन स्टोर में नेविगेट करना होता है। उन्होंने पाया कि इस "पर्यावरण को सुनने" वाले दृष्टिकोण का उपयोग करके, AI तेजी से सीखता है और बेहतर काम करता है। विशेष रूप से, इस पद्धति ने AI को एक ही गलती दोहराने (जैसे कि उस दरवाजे को खोलने की कोशिश करना जो पहले से ही खुला है) से बचने में मदद की और उसे प्रगति जारी रखने के लिए प्रोत्साहित किया, भले ही अंतिम लक्ष्य अभी भी दूर हो।
शोध पत्र सुझाव देता है कि यह विधि पिछले उन तरीकों की तुलना में बेहतर काम करती है जो हर कदम के मूल्य का अनुमान लगाने की कोशिश करते थे या केवल अंतिम परिणाम पर निर्भर करते थे। अपने प्रयोगों में, नई विधि ने लगातार AI की सफलता दर और उसके द्वारा पूरे किए गए कार्यों की गुणवत्ता में सुधार किया। उदाहरण के लिए, ALFWorld बेंचमार्क पर, इस पद्धति ने 1.5-बिलियन-पैरामीटर वाले मॉडल को 95.31 का स्कोर प्राप्त करने में मदद की, जो कई अन्य मजबूत तरीकों को पीछे छोड़ देता है। WebShop पर, इसने न केवल एजेंट को कुछ खरीदने में मदद की; बल्कि इसने एजेंट को उपयोगकर्ता की विशिष्ट आवश्यकताओं जैसे कीमत, रंग और प्रकार के अनुसार बिल्कुल सही चीज़ खरीदने में मदद की, जो पहले की तुलना में बहुत अधिक सटीक था।
मुख्य बात यह है कि हमें AI को उसकी गलतियों से सीखने के लिए सिखाने हेतु जटिल नई प्रणालियों के आविष्कार करने की आवश्यकता नहीं है। पर्यावरण पहले से ही एजेंट से बात कर रहा है, उसे कदम-दर-कदम बता रहा है कि क्या काम आया और क्या नहीं। इन बातचीत पर ध्यान देकर, हम AI को सफल होने के लिए एक बहुत बेहतर मानचित्र दे सकते हैं, जिससे एक लंबी, भ्रमित करने वाली यात्रा स्पष्ट, निर्देशित कदमों की एक श्रृंखला में बदल जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।