DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization
यह शोध पत्र डिनाइजिंग इंटरमीडिएट एडवांटेज (DIA) को प्रस्तुत करता है, जो एक पॉलिसी-ग्रेडिएंट विधि है जो मध्यवर्ती डिनोइजिंग चरणों को अवस्था-निर्भर क्रेडिट (state-dependent credit) प्रदान करके डिफ्यूजन-आधारित रोबोट नीतियों को बेहतर बनाती है, जिससे मौजूदा फाइन-ट्यूनिंग दृष्टिकोणों की तुलना में अधिक कुशल अन्वेषण और श्रेष्ठ कार्य प्रदर्शन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट जो मानवीय निपुणता के साथ वस्तुओं का हेरफेर कर सकें, लंबे समय से आर्टिफिशियल इंटेलिजेंस का एक लक्ष्य रहे हैं, लेकिन उन्हें ऐसा करने के लिए सिखाना एक नाजुक संतुलन का काम है। वर्षों से, सबसे प्रभावी तरीका "बिहेवियर क्लोनिंग" रहा है, जहाँ एक रोबोट मनुष्यों को कार्य करते हुए वीडियो देखकर और फिर उन गतिविधियों की नकल करके सीखता है। इस दृष्टिकोण ने डिफ्यूजन नामक तकनीक पर आधारित रोबोट कंट्रोलर्स का एक शक्तिशाली नया वर्ग तैयार किया है। ठीक वैसे ही जैसे एक मूर्तिकार पत्थर के एक खुरदरे ब्लॉक से शुरुआत कर सकता है और एक मूर्ति को प्रकट करने के लिए धीरे-धीरे सामग्री को तराश सकता है, ये डिफ्यूजन मॉडल रैंडम नॉइज़ (यादृच्छिक शोर) से शुरू होते हैं और इसे धीरे-धीरे क्रियाओं के एक सटीक क्रम में परिष्कृत करते हैं। हालाँकि यह विधि मानवीय प्रदर्शनों की विविधता और बारीकियों को पकड़ने में उत्कृष्ट है, लेकिन इसकी एक मौलिक सीमा है: रोबमाट पूरी तरह से उस डेटा की गुणवत्ता और विविधता से बंधा होता है जो उसे दिखाया गया था। यदि प्रशिक्षण वीडियो में कभी भी रोबोट को किसी नए तरीके से समस्या हल करते हुए नहीं दिखाया गया, तो वास्तविक दुनिया में उस समस्या का सामना करने पर रोबोट के विफल होने की संभावना अधिक होती है। इसे दूर करने के लिए, शोधकर्ताओं ने इन डिफ्यूजन मॉडल्स को 'रीइन्फोर्समेंट लर्निंग' के साथ जोड़ना शुरू कर दिया है, जो एक ऐसी तकनीक है जहाँ एक एजेंट प्रयास और त्रुटि (ट्रायल एंड एरर) के माध्यम से सीखता है, जिसमें अच्छे परिणामों के लिए पुरस्कार और गलतियों के लिए दंड मिलता है। हालाँकि, चुनौती यह है कि डिफ्यूजन मॉडल एक बार में एक एकल निर्णय नहीं लेते; वे परिष्करण की एक लंबी, चरण-दर-चरण प्रक्रिया के माध्यम से एक क्रिया उत्पन्न करते हैं। यह निर्धारित करना कि उस लंबी श्रृंखला में कौन सा चरण सफलता या विफलता के लिए जिम्मेदार था, मौजूदा तरीकों के लिए एक कठिन पहेली साबित हुआ है।
टोरंटो विश्वविद्यालय और वेक्टर इंस्टीट्यूट के शोधकर्ताओं की एक टीम ने इस समस्या के समाधान के रूप में 'डिनोइजिंग इंटरमीडिएट एडवांटेज' (Denoising Intermediate Advantage) या DIA नामक एक नया समाधान प्रस्तावित किया है। उनका कार्य वर्तमान प्रणालियों के उस दोष को संबोधित करता है कि वे रोबोट की सीखने की प्रक्रिया को श्रेय कैसे देती हैं। मानक दृष्टिकोणों में, जब एक रोबട്ട് परिष्करण चरणों के एक लंबे अनुक्रम के बाद सफलतापूर्वक कार्य पूरा करता है, तो सिस्टम उस अनुक्रम के प्रत्येक चरण को समान मात्रा में श्रेय देता है। यह वैसा ही है जैसे चित्रकारों की एक टीम एक भित्ति चित्र (म्यूरल) को पूरा करने के लिए मिलकर काम कर रही हो, और प्रबंधक हर ब्रशस्ट्रोक को समान रूप से प्रशंसा दे, चाहे वह विशेष स्ट्रोक एक मामूली विवरण हो या वह महत्वपूर्ण रेखा जिसने पूरी छवि को परिभाषित किया हो। शोधकर्ताओं का तर्क है कि यह अक्षम है क्योंकि पीढ़ी (जेनरेशन) की प्रक्रिया के मध्यवर्ती चरणों में यह मूल्यवान जानकारी होती है कि रोबोट किस दिशा में जा रहा है। पूरी परिष्करण श्रृंखला को एक एकल ब्लॉक के रूप में मानकर, पिछले तरीकों ने प्रक्रिया के प्रत्येक चरण में लिए गए विशिष्ट निर्णयों से सीखने के अवसर को खो दिया।
इसे ठीक करने के लिए, DIA विधि केवल अंत में ही नहीं, बल्कि परिष्करण प्रक्रिया के प्रत्येक चरण में रोबोट की प्रगति का मूल्यांकन करने का एक तरीका पेश करती है। सिस्टम बनने जा रही क्रिया के मूल्य का अनुमान लगाने के लिए सीखता है, जैसे-जैसे वह आकार लेती है। यह रोबोट को यह समझने की अनुमति देता है कि कुछ मध्यवर्ती निर्णय अंतिम परिणाम के लिए अन्य निर्णयों की तुलना में अधिक महत्वपूर्ण हैं। कार्य पूरा हुआ या नहीं, यह देखने के लिए बिल्कुल अंत तक प्रतीक्षा करने के बजाय, सिस्टम पीढ़ी प्रक्रिया के दौरान फीडबैक प्रदान करता है, जिससे रोबोट को जल्दी बेहतर विकल्प चुनने के लिए मार्गदर्शन मिलता है। यह एक अधिक सूक्ष्म शिक्षण संकेत बनाता है जो रोबोट को एक भाग्यशाली सफलता और एक अच्छी तरह से निष्पादित रणनीति के बीच अंतर करने में मदद करता है। शोधकर्ताओं ने चार अलग-अलग रोबोटिक कार्यों के सेट पर इस दृष्टिकोण का परीक्षण किया, जो सरल वस्तु हेरफेर से लेकर जटिल, बहु-चरणीय असेंबली कार्यों तक विस्तृत है, जिनमें रोबोट को लंबे समय तक समन्वय के साथ अपने हाथों को चलाने की आवश्यकता होती है।
इन परीक्षणों के परिणाम सुसंगत और महत्वपूर्ण थे। रोबोमिमिक (Robomimic) के एक मानक बेंचमार्क पर, जिसमें वस्तुओं को उठाना, डिब्बे हिलाना और वर्ग बनाना जैसे कार्य शामिल हैं, DIA विधि ने मौजूदा तकनीकों को लगातार पछाड़ दिया। सबसे कठिन कार्य में, एक द्विपक्षीय परिवहन चुनौती (bimanual transport challenge) जहाँ एक रोबोट को दो हाथों का उपयोग करके एक वस्तु को स्थानांतरित करना होता है, नए तरीके ने पिछले सर्वोत्तम दृष्टिकोण की तुलना में 23 प्रतिशत अधिक रिवॉर्ड स्कोर प्राप्त किया, जबकि सफलता की समान उच्च दर बनाए रखी। यह सुधार केवल काम को अधिक बार करने के बारे में नहीं था; यह इसे बेहतर तरीके से करने के बारे में था। DIA के साथ प्रशिक्षित रोबोट सफल अवस्था तक अधिक तेज़ी से पहुँचे, जिससे कार्य पूरा करने में कम चरण लगे। एक विशिष्ट परीक्षण में, रोबोट के सफल होने में लगने वाला समय 21 प्रतिशत कम हो गया। यह सुझाव देता है कि रोबोट केवल लक्ष्य तक पहुँचने के लिए संघर्ष नहीं कर रहा था, बल्कि वह लक्ष्य तक पहुँचने का एक अधिक कुशल मार्ग सीख रहा था।
इस पद्धति की शक्ति तब और भी स्पष्ट हो गई जब शोधकर्ताओं ने इसे उन कार्यों पर परखा जहाँ प्रशिक्षण डेटा अधूरा था या जिसमें पूर्ण समाधान गायब था। एक किचन सिमुलेशन में जहाँ एक रोबोट को स्टोव चालू करने या कैबिनेट खोलने जैसे उप-कार्यों के क्रम को पूरा करना था, मानक प्रशिक्षण डेटा अक्सर पूर्ण अनुक्रम के केवल हिस्सों को ही दिखाता था। पिछले तरीके यहाँ संघर्ष करते थे, अक्सर लूप में फंस जाते थे या अप्रासंगिक कार्यों को दोहराते थे क्योंकि वे प्रशिक्षण वीडियो में देखे गए सटीक पैटर्न पर बहुत अधिक निर्भर थे। हालाँकि, DIA विधि ने देखे गए आंशिक प्रदर्शनों को पुनर्संयोजित करके क्रियाओं के पूरी तरह से नए, सफल अनुक्रम बनाने में सफलता प्राप्त की। सबसे चुनौतीपूर्ण संस्करण में, जहाँ किसी भी एकल प्रदर्शन में पूर्ण कार्य नहीं दिखाया गया था, आधारभूत (baseline) तरीके पूरी तरह से विफल रहे, और शून्य प्रतिशत सफलता प्राप्त की। इसके विपरीत, DIA विधि 69 प्रतिशत समय सफल रही। इसने कार्य को पूरा करने के लिए आवश्यक चरणों को जोड़ने में सफलता प्राप्त की, प्रभावी रूप से एक ऐसी रणनीति सीखी जो मूल प्रशिक्षण उदाहरणों में से किसी में भी स्पष्ट रूप से मौजूद नहीं थी।
ये निष्कर्ष बताते हैं कि निर्णय लेने के मध्यवर्ती चरणों पर ध्यान देकर, रोबोट अपने प्रशिक्षण डेटा की सीमाओं से मुक्त हो सकते हैं। यह विधि उन्हें केवल वही कॉपी करने के बजाय, नई रणनीतियों का पता लगाने और समस्याओं को हल करने के अधिक कुशल तरीके खोजने की अनुमति देती है। हालाँकि प्रयोग सिमुलेशन में किए गए थे, परिणाम एक ऐसे भविष्य की ओर इशारा करते हैं जहाँ रोबोट जटिल, वास्तविक दुनिया के वातावरण के अनुकूल अधिक लचीले ढंग से ढल सकेंगे। शोधकर्ता कहते हैं कि अगला कदम इन विचारों को भौतिक रोबोटों पर परीक्षण करना होगा, जिसके लिए वास्तविक दुनिया में डेटा एकत्र करने की व्यावहारिक चुनौतियों को पार करना आवश्यक होगा। फिलहाल के लिए, यह कार्य प्रदर्शित करता है कि रोबोट की विचार प्रक्रिया के सही क्षणों को श्रेय देने से काफी स्मार्ट और अधिक सक्षम मशीनें बनाई जा सकती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।