DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions
यह शोध पत्र DAWM का प्रस्ताव करता है, जो एक मॉड्यूलर डिफ्यूजन-आधारित वर्ल्ड मॉडल है जो वर्तमान अवस्थाओं और क्रियाओं पर आधारित भविष्य की स्टेट-रिवॉर्ड ट्राजेक्टरीज को उत्पन्न करता है, जिसे क्रियाओं का अनुमान लगाने के लिए एक इनवर्स डायनेमिक्स मॉडल के साथ जोड़ा गया है, जिससे ऑफलाइन रिइन्फोर्समेंट लर्निंग के लिए कुशल वन-स्टेप टेम्पोरल डिफरेंस ट्रेनिंग सक्षम होती है और D4RL बेंचमार्क पर मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को चलना, दौड़ना या कूदना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आपको रोबोट के इन गतिविधियों को करने के हजारों घंटों की आवश्यकता होगी, जिसमें उसके हर कदम, हर डगमगाहट और मिलने वाले हर इनाम को रिकॉर्ड किया जाता है। यह "ऑफलाइन" वाला हिस्सा है: पिछले प्रयासों के एक विशाल, पूर्व-रिकॉर्ड किए गए पुस्तकालय से सीखना, बिना रोबोट के वास्तविक दुनिया में दोबारा इंटरैक्ट किए।
समस्या यह है कि यह लाइब्रेरी अक्सर अधूरी होती है। इसमें रोबोट के गिरने का वीडियो तो हो सकता है, लेकिन इसमें वह विशिष्ट कमांड (वह "एक्शन") गायब हो सकता है जिसके कारण वह गिरा, या इसमें रिवॉर्ड स्कोर (इनाम का अंक) गायब हो सकता है। बिना पूरी कहानी के—स्टेट (वह कहाँ था), एक्शन (उसने क्या किया), रिवॉर्ड (उसने कैसा प्रदर्शन किया), और नेक्स्ट स्टेट (वह कहाँ पहुँचा)—रोबोट का मस्तिष्क कुशलतापूर्वक सीखने में संघर्ष करता है।
पुराना तरीका: वह "सपना देखने वाला" जो विवरण भूल जाता है
शोधकर्ताओं ने खाली जगहों को भरने के लिए डिफ्यूजन मॉडल्स (एक प्रकार का AI जो यथार्थवादी चित्र बनाने के लिए प्रसिद्ध है) का उपयोग करके नए परिदृश्य "सपनों में देखने" (dream up) की कोशिश की है। इन मॉडल्स को एक रचनात्मक लेखक के रूप में सोचें जो रोबोट के सुचारू रूप से दौड़ने का एक आदर्श 10-सेकंड का वीडियो कल्पना कर सकता है।
हालाँकि, इस "सपना देखने वाले" के पिछले संस्करणों में एक दोष था: वे दृश्य (रोबोट की स्थिति और प्राप्त स्कोर) की कल्पना करने में तो बेहतरीन थे, लेकिन वे यह याद रखने में बहुत खराब थे कि रोबोट वहां तक पहुँचने के लिए वास्तव में क्या कर रहा था। उन्होंने फिल्म तो बना दी लेकिन स्क्रिप्ट भूल गए। क्योंकि उनके पास विशिष्ट क्रियाएं (actions) नहीं थीं, इसलिए वे रोबotong को मानक, कुशल शिक्षण विधियों (जिन्हें "वन-स्टेप लर्निंग" कहा जाता है) का उपयोग करके नहीं सिखा सके। उन्हें धीमे, अधिक जटिल वर्कअराउंड्स का उपयोग करना पड़ा।
नया समाधान: DAWM (निर्देशक और पटकथा लेखक)
इस शोध पत्र के लेखकों ने DAWM (डिफ्यूजन एक्शन वर्ल्ड मॉडल) नामक एक नया सिस्टम प्रस्तावित किया है। उन्होंने "गायब स्क्रिप्ट" की समस्या को हल करने के लिए काम को दो विशिष्ट भूमिकाओं में विभाजित किया, जैसे कि एक फिल्म निर्माण टीम:
- निर्देशक (डिफ्यूजन मॉडल): यह AI एक रचनात्मक दूरदर्शी है। यह देखता है कि रोबोट अभी कहाँ है और एक लक्षित स्कोर क्या है जिसे रोबोट को हासिल करने का लक्ष्य रखना चाहिए। फिर यह एक भविष्य की अनुक्रमिक कल्पना करता है कि रोबोट कहाँ होगा और उसे क्या रिवॉर्ड मिलेगा। यह परिणाम की भविष्यवाणी करने में उत्कृष्ट है लेकिन यह नहीं जानता कि वह कैसे हुआ।
- पटकथा लेखक (इनवर्स डायनेमिक्स मॉडल): यह एक अलग, हल्का AI है जिसे विशेष रूप से घटनाओं के एक अनुक्रम (वह कहाँ था, वह कहाँ पहुँचा) को देखने और यह पता लगाने के लिए प्रशिक्षित किया गया है कि, "वह कौन सी चाल रही होगी जिससे यह हुआ?" यह गायब क्रियाओं को पुनर्गठित करने वाले एक जासूस की तरह कार्य करता है।
जादुई ट्रिक:
DAWM निर्देशक के सपने (भविष्य के स्टेट्स और रिवॉर्ड्स) को लेता है और उसे पटकथा लेखक को सौंप देता है। पटकथा लेखक गायब "एक्शन्स" को भर देता है। अचानक, आपके पास एक पूर्ण, सटीक कहानी होती है: यहाँ हम शुरू हुए थे, यहाँ हमने वह मूव किया, यहाँ हमारा रिवॉर्ड था, और यहाँ हम पहुँचे।
यह क्यों महत्वपूर्ण है
क्योंकि अब सिस्टम के पास पूरी कहानी (स्टेट + एक्शन + रिवॉर्ड + नेक्स्ट स्टेट) है, यह रोबोट को मानक, तेज़ शिक्षण तकनीकों का उपयोग करके सिखा सकता है।
- गति: पुराने तरीके जो पूरी कहानी (एक्शन्स सहित) को एक साथ उत्पन्न करने की कोशिश करते थे, वे धीमे और अस्थिर थे, जैसे कि एक उपन्यास लिखना, फिल्म को एडिट करना और संगीत देना एक साथ करने की कोशिश करना। DAWM इन कार्यों को अलग करता है, जिससे यह बहुत तेज़ और अधिक स्थिर हो जाता है।
- प्रदर्शन: शोधकर्ताओं ने इसका परीक्षण 9 अलग-अलग रोबोट मूवमेंट टास्क पर किया (जैसे कि एक हॉपर का कूदना या एक चीता का दौड़ना)। DAWM के "सपनों वाले" डेटा पर प्रशिक्षित रोबोट, पुराने डिफ्यूजन तरीकों पर प्रशिक्षित रोबोट की तुलना में बेहतर प्रदर्शन करते हैं।
- यथार्थवाद: कई मामलों में, इन सिंथेटिक, AI-जनरेटेड कहानियों पर प्रशिक्षित रोबोट, वास्तविक, अव्यवस्थित मानव-संग्रहित डेटा पर प्रशिक्षित रोबोट के समान ही प्रदर्शन करते हैं।
निचोड़ (The Bottom Line)
DAWM एक स्मार्ट असिस्टेंट की तरह है जो एक रोबोट के लिए आदर्श प्रशिक्षण परिदृश्य की कल्पना कर सकता है और फिर तुरंत विवरणों को भर सकता है ताकि रोबोट उनसे कुशलतापूर्वक सीख सके। यह "रचनात्मक कल्पना" (नया डेटा उत्पन्न करना) और "व्यावहारिक शिक्षण" (उस डेटा का उपयोग सुधार के लिए करना) के बीच के अंतर को पाटता है, जिससे रोबोट वास्तविक दुनिया में हर एक मूव का भौतिक अभ्यास किए बिना तेज़ी से और बेहतर तरीके से सीख सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।