Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections
यह शोध पत्र सेट-सुपरवाइज्ड डिफ्यूजन पॉलिसी (SDP) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो डिफ्यूजन पॉलिसियों को प्रशिक्षित करने के लिए युग्मित मानव सुधारात्मक और रोबोट अवांछित एक्शन-चंक्स पर कंट्रास्टिव लर्निंग का लाभ उठाता है ताकि वे वितरण संबंधी बदलाव (डिस्ट्रीब्यूशनल शिफ्ट) और शोर वाले डेटा के प्रति अधिक सुदृढ़ हो सकें।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक नाजुक काम करना सिखा रहे हैं, जैसे फर्नीचर का कोई हिस्सा जोड़ना या किसी ब्लॉक को एक विशिष्ट स्थान पर धकेलना। आप शिक्षक के रूप में कार्य करते हैं और रोबोट छात्र के रूप में।
समस्या: "परफेक्ट कॉपीकैट" (पूर्ण नकलची) का जाल
पारंपरिक रूप से, जब हम रोबोट को सिखाते हैं, तो हम बिहेवियर क्लोनिंग (Behavior Cloning) नामक एक विधि का उपयोग करते हैं। इसे ऐसे समझें जैसे एक छात्र आपके हाथ की लिखावट की हुबहू नकल करने की कोशिश कर रहा है। यदि शिक्षक ने "5" थोड़ा ऐसा लिखा जो हाथ हिलने के कारण "6" जैसा दिख रहा है, तो रोबोट उस कांपते हुए "6" की सटीक नकल करने की कोशिश करता है।
रोबोटिक्स की दुनिया में, यह एक बड़ी समस्या है।
- रास्ते से भटक जाना (Drifting Off Course): यदि रोबोट एक छोटी सी गलती करता है, तो वह एक ऐसी स्थिति में पहुँच जाता है जिसे शिक्षक ने कभी नहीं देखा था। रोबोट घबरा जाता है और एक बड़ी गलती कर देता है।
- "ना" को अनदेखा करना: जब रोबोट गलती करता है, तो आप (मानव) बीच में आकर उसे ठीक करते हैं। आप रोबोट को दिखाते हैं कि सही तरीका क्या है। लेकिन मानक प्रशिक्षण विधियाँ केवल आपकी सही चाल को देखती हैं। वे इस बात को पूरी तरह से अनदेखा कर देती हैं कि रोबोट ने अभी जो गलत चाल चली थी, वह क्या थी। यह वैसा ही है जैसे एक शिक्षक कहे, "इसे ठीक करने के लिए शाबाश," लेकिन कभी यह न समझाए कि मूल प्रयास क्यों खराब था। रोबोट केवल "परफेक्ट" चालों की नकल करने की कोशिश करता रहता है, लेकिन वह यह नहीं सीख पाता कि किन चीजों से बचना है।
समाधान: "सेफ्टी ज़ोन" (सेट-सुपरवाइज्ड डिफ्यूजन पॉलिसी - SDP)
इस पेपर के लेखक, झाओटिंग ली और उनके सहयोगियों ने सिखाने का एक नया तरीका प्रस्तावित किया है जिसे सेट-सुपरवाइज्ड डिफ्यूजन पॉलिसी (SDP) कहा जाता है।
रोबोट को यह बताने के बजाय कि, "बिल्कुल यही एक विशिष्ट गति करो," वे उसे कहते हैं, "इस सुरक्षित क्षेत्र (Safe Zone) के भीतर कुछ भी करो।"
यह इस प्रकार काम करता है, एक सरल उदाहरण के साथ:
1. "रेड ज़ोन" और "ग्रीन ज़ोन"
कल्पना कीजिए कि रोबोट कार पार्क करने की कोशिश कर रहा है।
- रोबोट की गलती (Negative Action): रोबोट बाईं ओर बहुत दूर पार्क करने की कोशिश करता है। वह फुटपाथ (curb) से टकरा जाता है।
- आपका सुधार (Positive Action): आप स्टीयरिंग संभालते हैं और उसे केंद्र में ले आते हैं।
पुराने तरीकों में, रोबोट केवल "केंद्र में स्टीयर करें" याद करता है।
SDP में, रोबोट एक सेफ्टी ज़ोन सीखता है। वह समझता है: "ठीक है, फुटपाथ से टकराना (बाईं ओर) बुरा है। केंद्र अच्छा है। इसलिए, मैं बीच के क्षेत्र में कहीं भी पार्क कर सकता हूँ, जब तक कि मैं फुटपाथ से न टकरा जाऊँ।"
इस "सेफ्टी ज़ोन" को डेज़ायर्ड एक्शन सेट (Desired Action Set) कहा जाता है। यह रोबोट को लचीलापन देता है। उसे एक परफेक्ट नकलची होने की ज़रूरत नहीं है; उसे बस नियमों के दायरे में रहना है।
2. "डिफ्यूजन" का जादू
रोबोट इस ज़ोन में कैसे बना रहता है? वे डिफ्यूजन (Diffusion) नामक तकनीक का उपयोग करते हैं।
डिफ्यूजन को एक मूर्तिकार के रूप में सोचें जो मिट्टी के साथ काम कर रहा है।
- प्रारंभिक बिंदु: रोबोट रैंडम, बिखरी हुई मिट्टी (रैंडम नॉइज़) के एक ढेर से शुरू करता है।
- प्रक्रिया: चरण-दर-चरण, रोबोट उस मिट्टी को "डीनॉइज़" (शोर हटाना) करता है, खराब हिस्सों को काटता है और उसे आकार देता है।
- ट्विस्ट: SDP में, जैसे-जैसे रोबोट मिट्टी को आकार देता है, उसके पास एक नियम होता है: "यदि आप मिट्टी को ऐसे आकार में ढालने लगें जो फुटपाथ से टकरा जाए (नेगेटिव एक्शन), तो रुकें और उसे वापस सुरक्षित क्षेत्र में धकेल दें।"
इस प्रक्रिया को रिफ्लेक्टेड डिफ्यूजन (Reflected Diffusion) कहा जाता है। यह एक कमरे के अंदर उछलती हुई गेंद की तरह है। यदि गेंद दीवार (बुरे क्षेत्र की सीमा) से टकराती है, तो वह कमरे के अंदर वापस उछल आती है (अच्छे क्षेत्र में)। यह सुनिश्चित करता है कि रोबित हमेशा एक ऐसी गति उत्पन्न करे जो सुरक्षित और स्वीकार्य हो, भले ही वह बिल्कुल वही गति न हो जो आपने की थी।
3. गलतियों से सीखना (कॉन्ट्रास्टिव डेटा)
SDP की मुख्य विशेषता यह है कि यह रोबोट की गलती और आपके सुधार दोनों का एक साथ उपयोग करता है।
- पुराना तरीका: "यहाँ सही चाल है। इसकी नकल करो।"
- SDP का तरीका: "यहाँ गलत चाल है (यह मत करो) और यहाँ सही चाल है (यह करो)। तुम्हारा लक्ष्य कोई भी ऐसी चाल खोजना है जो गलत वाली से बेहतर हो और सही वाली के करीब हो।"
यह सीखकर कि क्या नहीं करना है, रोबोट बहुत अधिक मजबूत (robust) बन जाता है। यदि आपका सुधार थोड़ा डगमगाया हुआ या शोर वाला (noisy) था, तो रोबोट घबराता नहीं है। वह बस जानता है, "ठीक है, मुझे इसी सामान्य क्षेत्र में रहना है," बजाय इसके कि वह एक कांपते हुए हाथ की सटीक नकल करने की कोशिश करे।
उन्होंने क्या पाया?
शोधकर्ताओं ने रोबोट द्वारा वस्तुओं को धकेलने और फर्नीचर जोड़ने जैसे कार्यों पर इसका परीक्षण किया।
- शोर (Noise) को संभालने में बेहतर: जब मानव शिक्षक ने गलतियाँ कीं या डेटा "नॉइज़ी" (कांपता हुआ) था, तो SDP रोबोट बेहतर प्रदर्शन करते रहे। पुराने "कॉपीकैट" रोबोट विफल हो गए क्योंकि उन्होंने गलतियों की नकल करने की कोशिश की।
- बेहतर डेटा संग्रह: क्योंकि SDP रोबोट को केवल शिक्षक की नकल करने के बजाय "सेफ्टी ज़ोन" के भीतर अन्वेषण करने की अनुमति है, इसलिए यह विविध प्रकार के अनुभव एकत्र करता है। यह भविष्य के प्रशिक्षण के लिए एक बेहतर "पाठ्यपुस्तक" बनाता है।
- वास्तविक दुनिया में सफलता: उन्होंने वास्तविक रोबोट पर भी परीक्षण किया (केवल सिमुलेशन में नहीं) जिसमें एक छेद में T-आकार की वस्तु डालने जैसे कार्य शामिल थे। SDP रोबोट अक्सर मानक रोबोट की तुलना में अधिक बार सफल रहा, विशेष रूप से कार्य के सबसे कठिन संस्करणों में।
सारांश
संक्षेप में, SDP रोबोट को सिखाने के तरीके को "मेरे हाथों की सटीक गति की नकल करो" से बदलकर "इस सुरक्षित क्षेत्र के भीतर रहो और बुरी चीजों से बचो" में बदल देता है। रोबोट की गलतियों को एक सीमा रेखा के रूप में और आपके सुधारों को एक मार्गदर्शक के रूप में उपयोग करके, रोबोट अधिक लचीला, अधिक मजबूत और चीजें अस्त-व्यस्त होने पर कम विफल होने वाला बन जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।