Learning to See While Learning to Act: Diffusion Models for Active Perception in Robot Imitation
यह शोध पत्र See2Act प्रस्तुत करता है, जो एक इमिटेशन लर्निंग फ्रेमवर्क है जो एक्शन डिनोइजिंग (action denoising) को व्यूपॉइंट रिफाइनमेंट (viewpoint refinement) के साथ जोड़ता है ताकि रोबोट्स को गंभीर अवरोधों (occlusions) के तहत सुदृढ़ हेरफेर (robust manipulation) के लिए सूचनात्मक कैमरा कोणों को सक्रिय रूप से अनुमान लगाने में सक्षम बनाया जा सके, जिससे सिमुलेशन और वास्तविक दुनिया के कार्यों में ज़ीरो-शॉट ट्रांसफर (zero-shot transfer) के दौरान महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शेल्फ से एक विशिष्ट खिलौना उठाने की कोशिश कर रहे हैं, लेकिन एक बड़ा डिब्बा आपके दृश्य को रोक रहा है। यदि आप बस स्थिर खड़े होकर शेल्फ को देखते रहेंगे, तो शायद आप उस खिलौने को कभी नहीं ढूंढ पाएंगे। आपको डिब्बे के चारों ओर घूमना होगा, डिब्बे के ऊपर से झांकना होगा, और बेहतर कोण प्राप्त करने के लिए अपनी स्थिति बदलनी होगी।
यह पेपर एक रोबोटिक मस्तिष्क पेश करता है जिसे See2Act कहा जाता है, जो ठीक यही करना सीखता है: यह सीखता है कि अपने हाथ (बांह) को चलाने के साथ-साथ अपनी आँखों (कैमरा) को कैसे घुमाया जाए।
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ विभाजित किया गया है:
समस्या: "अंधा" रोबोट
अधिकांश रोबोट लर्निंग विधियाँ ऐसी हैं जैसे कोई व्यक्ति एक ऐसी पट्टी पहनकर पहेली सुलझाने की कोशिश कर रहा हो जो उन्हें मेज के केवल एक छोटे से हिस्से को देखने देती है। वे मान लेते हैं कि जो कुछ भी उन्हें देखने की आवश्यकता है, वह पहले से ही उनके ठीक सामने है। लेकिन वास्तविक दुनिया में, वस्तुएं एक-दूसरे के पीछे छिपी होती हैं (occlusion)। यदि रोबोट वस्तु को देख नहीं सकता, तो वह उसे पकड़ नहीं सकता।
समाधान: एक "डिनोइजिंग" (शोर हटाना) नृत्य
लेखक एक प्रकार के AI का उपयोग करते हैं जिसे डिफ्यूजन मॉडल (Diffusion Model) कहा जाता है। इसे एक मूर्तिकार की तरह समझें जो शोर से भरे, धुंधले मिट्टी के ब्लॉक से शुरुआत करता है और धीरे-धीरे शोर को हटाकर एक आदर्श मूर्ति को प्रकट करता है।
- पुराना तरीका: रोबोट एक निश्चित, धुंधली तस्वीर को देखते हुए शोर को हटाने की कोशिश करता है ताकि एक्शन (हाथ कहाँ ले जाना है) को खोज सके।
- See2Act का तरीका: रोबोट शोर को हटाते समय हाथ की हरकत को भी समझता है और साथ ही साथ अपने सिर (कैमरा) को भी घुमाता है।
जैसे-जैसे रोबोट यह समझने के करीब पहुँचता है कि क्या करना है, वह यह भी समझ जाता है कि कहाँ देखना है।
- शुरुआत: रोबोट पूरी मेज का एक विस्तृत, धुंधला दृश्य देखता है। उसे ठीक से नहीं पता कि वस्तु कहाँ है क्योंकि वह छिपी हुई है।
- नृत्य: जैसे ही AI हाथ की गति के बारे में अपने अनुमान को "साफ" (clean up) करता है, वह साथ ही साथ कैमरे को पास लाता है और बाधा के चारों ओर झांकने के लिए उसे कोण देता है।
- परिणाम: जब तक रोबोट के पास अपने हाथ के लिए एक स्पष्ट योजना होती है, तब तक उसने अपने कैमरे को एक आदर्श क्लोज-अप दृश्य पर भी सेट कर लिया होता है, जिससे छिपी हुई वस्तु प्रकट हो जाती है।
प्रशिक्षण: एक "डिजिटल ट्विन" से सीखना
रोबोट ने यह वास्तविक दुनिया में प्रयास और त्रुटि (trial and error) के माध्यम से नहीं सीखा (जो धीमा और खतरनाक होता)। इसके बजाय, शोधकर्ताओं ने एक डिजिटल ट्विन (Digital Twin) बनाया—रोबोट और कमरे का एक सटीक वीडियो गेम संस्करण।
उन्होंने रोबोट को किसी वस्तु को उठाने के 50 प्रदर्शन दिखाए। महत्वपूर्ण बात यह है कि उन्होंने केवल रोबोट को यह नहीं सिखाया कि हाथ कैसे हिलाना है; उन्होंने यह भी सिखाया कि हर कदम पर कैमरा कहाँ होना चाहिए। रोबोट ने सीखा कि छिपी हुई वस्तु को पकड़ने के लिए, उसे पहले उसे देखने के लिए अपना कैमरा हिलाना ही होगा।
परिणाम: देखना ही विश्वास करना है
शोधकर्ताओं ने इसे दो तरीकों से परखा:
वीडियो गेम में (सिमुलेशन):
- जब वस्तुएं बक्सों के पीछे या बिन के अंदर छिपी थीं, तो अन्य रोबोट पूरी तरह विफल रहे (0% सफलता)।
- See2Act लगभग 96% बार सफल रहा। इसने बॉक्स के चारों ओर जाने और बिन के अंदर झांकने का तरीका ढूंढ लिया।
- इसने मानक कार्यों पर अन्य उन्नत रोबोटों को भी हराया, भले ही वहां कोई बाधा नहीं थी, जिससे यह सिद्ध हुआ कि कैमरा हिलाना सटीकता में मदद करता है।
वास्तविक दुनिया में:
- वे वीडियो गेम में प्रशिक्षित रोबोट को एक वास्तविक धातु की बांह और एक वास्तविक लैब में ले गए। उन्होंने वास्तविक दुनिया के लिए इसे दोबारा प्रशिक्षित नहीं किया या इसमें कोई बदलाव नहीं किया (इसे "जीरो-शॉट ट्रांसफर" कहा जाता है)।
- रोबोट ने छिपी हुई वस्तुओं को सफलतापूर्वक उठाया और उच्च सटीकता के साथ 95% बार रखा।
- इसने एक बेस को एक तंग शेल्फ स्लॉट में रखने जैसे कार्यों को संभाला (जहाँ एक मिलीमीटर की त्रुटि भी मायने रखती है) वस्तु को डालने से पहले उसका क्लोज-अप देखने के लिए अपने कैमरे को घुमाकर।
मुख्य निष्कर्ष
See2Act एक ऐसा रोबोट है जिसने एक बहुत ही मानवीय कौशल सीखा है: यदि आप इसे देख नहीं सकते, तो अपना सिर तब तक हिलाएं जब तक कि आप देख न सकें। "देखने" और "करने" की क्रिया को एक एकल, निरंतर प्रक्रिया में जोड़कर, रोबोट उन समस्याओं को हल कर सकता है जिन्हें अन्य रोबोट, जो एक निश्चित बिंदु को देखते रहते हैं, हल नहीं कर पाते।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।