Noisy-Space Policy Gradient for Diffusion Policies in Offline Reinforcement Learning
यह शोध पत्र नोइज़ी-स्पेस पॉलिसी ग्रेडिएंट (NSPG) प्रस्तुत करता है, जो एक नवीन ढांचा है जो डिफ्यूजन लैटेंट्स (diffusion latents) पर एक KL-रेगुलराइज्ड ऑब्जेक्टिव को व्युत्पन्न करके डिफ्यूजन पॉलिसियों के साथ प्रभावी ऑफलाइन सुदृढीकरण शिक्षण (offline reinforcement learning) को सक्षम बनाता है, जो बिना डिनोइजिंग प्रक्रिया (denoising process) के माध्यम से बैकप्रोपैगेशन की आवश्यकता के, क्लीन एक्शन-स्पेस वैल्यू अनुमानों का उपयोग करके अनुकूलित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक निरंतर चुनौती है जिसे 'ऑफलाइन रिइन्फोर्समेंट लर्निंग' (offline reinforcement learning) के रूप में जाना जाता है। कल्पना कीजिए कि एक छात्र एक जटिल वीडियो गेम खेलना सीखने की कोशिश कर रहा है, लेकिन उसे कंट्रोलर छूने से मना किया गया है। वह केवल अन्य खिलाड़ियों के रिकॉर्ड किए गए घंटों के फुटेज को देख सकता है, जिनमें से कुछ विशेषज्ञ थे और कुछ अक्सर गलतियाँ करते थे। लक्ष्य एक ऐसी रणनीति सीखना है जो उन लोगों की तुलना में अधिक बार जीत सके जिन्होंने वीडियो में प्रदर्शन किया था, बिना किसी नए कदम का जोखिम उठाए जिससे दुर्घटना हो सकती हो। यह कठिन है क्योंकि एआई को बिना 'ट्रायल एंड एरर' (परीक्षण और त्रुटि) के सुरक्षा जाल के, डेटा के एक निश्चित सेट से सीखना होगा। यदि एआई एक ऐसा कदम उठाने का अनुमान लगाता है जो रिकॉर्डिंग में कभी नहीं देखा गया था, तो वह विनाशकारी रूप से विफल हो सकता है, क्योंकि उसके पास यह जानने का कोई तरीका नहीं है कि वह कदम वास्तव में अच्छा है या केवल एक खतरनाक भ्रम (hallucination) है।
इस समस्या को हल करने के लिए, शोधकर्ताओं ने 'डिफ्यूजन पॉलिसी' (diffusion policy) नामक एक प्रकार के एआई मॉडल की ओर रुख किया है। ये मॉडल जटिल पैटर्न को समझने में असाधारण रूप से कुशल होते हैं, जैसे कि एक मानव हाथ द्वारा उपकरण को पकड़ने के कई अलग-अलग तरीके या एक रोबोट द्वारा भूलभुलैया में नेविगेट करने के तरीके। वे एक अराजक, शोर वाले अनुमान (noisy guess) से शुरू करके और धीरे-धीरे उसे परिष्कृत करके काम करते हैं, जब तक कि वह एक स्पष्ट, उपयोगी क्रिया न बन जाए। हालाँकि, एक मौलिक समस्या तब उत्पन्न होती है जब इन मॉडलों को जीतना सिखाने की कोशिश की जाती है: मॉडल अपने निर्णय एक छिपे हुए, शोर वाले स्थान (hidden, noisy space) में लेता है, लेकिन उसे मिलने वाला पुरस्कार उन अंतिम, साफ क्रियाओं पर आधारित होता है जो वह वास्तव में लेता है। यह एक छात्र के निबंध को उसके अंतिम पॉलिश किए गए पृष्ठ के बजाय उसके बिखरे हुए, काट-छाँट वाले ड्राफ्ट को देखकर ग्रेड देने जैसा है। फीडबैक लूप टूट जाता है, और एआई यह सीखने में संघर्ष करता है कि उसके छिपे हुए कदमों में से किस कदम ने सफलता दिलाई।
शोधकर्ताओं ने अब 'नॉइजी-स्पेस पॉलिसी ग्रेडिएंट' (Noisy-Space Policy Gradient) नामक एक नई विधि के साथ इस अंतर को पाट दिया है। शोर वाले, छिपे हुए कदमों को सीधे पुरस्कारों के साथ मिलाने की कोशिश करने के बजाय, उन्होंने उन छिपे हुए कदमों को मूल्य प्रदान करने का एक नया तरीका बनाया। उन्होंने महसूस किया कि एक एकल शोर वाला अनुमान केवल एक अंतिम क्रिया के अनुरूप नहीं होता, बल्कि उससे उत्पन्न होने वाली संभावित क्रियाओं के एक पूरे बादल (cloud) के अनुरूप होता है। एक विशिष्ट शोर वाले अनुमान से आने वाली सभी संभावित साफ क्रियाओं के औसत पुरस्कार की गणना करके, उन्होंने उस अनुमान के लिए एक निष्पक्ष और सटीक स्कोर बनाया। यह स्कोर एआई को बताता है कि एक विशेष छिपा हुआ कदम वास्तव में कितना अच्छा है, जो कि एक एकल, संभवतः गलत, अंतिम उत्तर के प्रति प्रतिबद्ध होने के बजाय, उन संभावित परिणामों पर आधारित है जो वह उत्पन्न कर सकता है।
शोधकर्ताओं ने सरल रोबोटिक गतिविधियों से लेकर जटिल दृश्य पहेलियों तक, विभिन्न प्रकार के कार्यों पर इस दृष्टिकोण का परीक्षण किया। इन प्रयोगों में, नया तरीका पिछले तकनीकों की तुलना में लगातार बेहतर प्रदर्शन करता रहा, विशेष रूप से उन कठिन परिदृश्यों में जहाँ डेटा कम था या जहाँ कार्यों के लिए लंबी और सटीक श्रृंखलाओं की आवश्यकता थी। उदाहरण के लिए, बड़ी भूलभुलैया में नेविगेट करने या नाजुक वस्तुओं को संचालित करने वाले कार्यों में, नया तरीका पुराने मॉडलों की तुलना में काफी उच्च सफलता दर प्राप्त करता है। यह विशेष रूप से उन स्थितियों में प्रभावी साबित हुआ जहाँ एआई को एक सामान्य, सुरक्षित क्रिया और एक दुर्लभ, उच्च-पुरस्कार वाली क्रिया के बीच चयन करना था, एक ऐसा चुनाव जिसने पुराने मॉडलों को भ्रमित कर दिया था। एक एकल पथ के बजाय संभावनाओं की पूरी श्रृंखला को देखकर, एआई अधिक विश्वसनीय रूप से उच्च-पुरस्कार वाले परिणामों की ओर लक्ष्य बनाना सीख गया।
इस कार्य के सबसे महत्वपूर्ण पहलुओं में से एक यह है कि यह एआई की आंतरिक विचार प्रक्रिया और वास्तविक दुनिया के बीच के संबंध को कैसे संभालता है। पिछले तरीकों ने अक्सर एआई के छिपे हुए कदमों का सीधे मूल्यांकन करने की कोशिश की, जिससे भ्रम और अस्थिरता पैदा हुई। अन्य तरीकों ने एआई की विचार प्रक्रिया को सरल बनाने की कोशिश की ताकि उसका मूल्यांकन करना आसान हो सके, लेकिन इससे अक्सर वही जटिलता छिन गई जो एआई को शक्तिशाली बनाती थी। नया दृष्टिकोण इन खामियों से बचता है क्योंकि यह मूल्यांकन को वास्तविक क्रियाओं की दुनिया में सख्ती से रखते हुए एआई को उसके जटिल, शोर वाले तरीके से सोचने की अनुमति देता है। यह एक अनुवादक के रूप में कार्य करता है, यह सुनिश्चित करता है कि एआई को मिलने वाला फीडबैक हमेशा वास्तविकता में निहित हो, भले ही एआई एक छिपे हुए स्थान में सीख रहा हो।
परिणाम बताते हैं कि यह विधि ऐतिहासिक डेटा पर उन्नत एआई सिस्टम को प्रशिक्षित करने के लिए एक ठोस आधार प्रदान करती है। शोधकर्ताओं ने पाया कि यह विधि स्थिर और कुशल बनी रही, जिसे प्रत्येक चरण का अनुमान लगाने के लिए केवल कुछ ही गणनाओं की आवश्यकता थी। यह दक्षता महत्वपूर्ण है, क्योंकि इसका अर्थ है कि इस विधि को बड़े, जटिल समस्याओं पर लागू किया जा सकता है बिना बहुत धीमा हुए। टीम ने यह भी पता लगाया कि सिस्टम विभिन्न सेटिंग्स के प्रति कितना संवेदनशील था, और पाया कि यह निरंतर, सूक्ष्म ट्यूनिंग की आवश्यकता के बिना व्यापक श्रेणी की स्थितियों में अच्छी तरह से काम करता है। यह मजबूती इसे रोबिक्स और ऑटोमेशन में भविष्य के अनुप्रयोगों के लिए एक आशाजनक उपकरण बनाती है, जहाँ पिछले डेटा से सीखना अक्सर एकमात्र विकल्प होता है।
अंततः, यह कार्य इस बात का समाधान करता है कि एआई अपने अनुभव से कैसे सीखता है। यह प्रदर्शित करता है कि छिपे हुए विचारों और दृश्य क्रियाओं के बीच के संबंध को ठीक से समझकर, हम जटिल प्रणालियों को उनके प्रशिक्षण डेटा की सीमाओं से बाहर निकले बिना सुधार करना सिखा सकते हैं। यह विधि जादू या अनुमान पर निर्भर नहीं है; यह इस बात पर निर्भर है कि शोर क्रिया में कैसे परिवर्तित होता है, इसकी स्पष्ट, गणितीय समझ पर। जैसे-जैसे आर्टिफिशियल इंटेलिजेंस का क्षेत्र विकसित हो रहा है, ऐसे दृष्टिकोण जो अतीत से सुरक्षित और प्रभावी ढंग से सीख सकते हैं, सक्षम और विश्वसनीय सिस्टम बनाने के लिए आवश्यक होंगे। यह नई तकनीक एक व्यवस्थित मार्ग प्रदान करती है, जो स्थिर डेटा से सीखने की अव्यवस्थित प्रक्रिया को बेहतर निर्णय लेने की एक स्पष्ट राह में बदल देती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।