← नवीनतम पेपर
💻 computer science

Learning to See While Learning to Act: Diffusion Models for Active Perception in Robot Imitation

यह शोध पत्र See2Act प्रस्तुत करता है, जो एक इमिटेशन लर्निंग फ्रेमवर्क है जो एक्शन डिनोइजिंग (action denoising) को व्यूपॉइंट रिफाइनमेंट (viewpoint refinement) के साथ जोड़ता है ताकि रोबोट्स को गंभीर अवरोधों (occlusions) के तहत सुदृढ़ हेरफेर (robust manipulation) के लिए सूचनात्मक कैमरा कोणों को सक्रिय रूप से अनुमान लगाने में सक्षम बनाया जा सके, जिससे सिमुलेशन और वास्तविक दुनिया के कार्यों में ज़ीरो-शॉट ट्रांसफर (zero-shot transfer) के दौरान महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं।

मूल लेखक: Kuancheng Wang, Vaibhav Saxena, Shuo Cheng, Yotto Koga, Danfei Xu

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kuancheng Wang, Vaibhav Saxena, Shuo Cheng, Yotto Koga, Danfei Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेल्फ से एक विशिष्ट खिलौना उठाने की कोशिश कर रहे हैं, लेकिन एक बड़ा डिब्बा आपके दृश्य को रोक रहा है। यदि आप बस स्थिर खड़े होकर शेल्फ को देखते रहेंगे, तो शायद आप उस खिलौने को कभी नहीं ढूंढ पाएंगे। आपको डिब्बे के चारों ओर घूमना होगा, डिब्बे के ऊपर से झांकना होगा, और बेहतर कोण प्राप्त करने के लिए अपनी स्थिति बदलनी होगी।

यह पेपर एक रोबोटिक मस्तिष्क पेश करता है जिसे See2Act कहा जाता है, जो ठीक यही करना सीखता है: यह सीखता है कि अपने हाथ (बांह) को चलाने के साथ-साथ अपनी आँखों (कैमरा) को कैसे घुमाया जाए।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ विभाजित किया गया है:

समस्या: "अंधा" रोबोट

अधिकांश रोबोट लर्निंग विधियाँ ऐसी हैं जैसे कोई व्यक्ति एक ऐसी पट्टी पहनकर पहेली सुलझाने की कोशिश कर रहा हो जो उन्हें मेज के केवल एक छोटे से हिस्से को देखने देती है। वे मान लेते हैं कि जो कुछ भी उन्हें देखने की आवश्यकता है, वह पहले से ही उनके ठीक सामने है। लेकिन वास्तविक दुनिया में, वस्तुएं एक-दूसरे के पीछे छिपी होती हैं (occlusion)। यदि रोबोट वस्तु को देख नहीं सकता, तो वह उसे पकड़ नहीं सकता।

समाधान: एक "डिनोइजिंग" (शोर हटाना) नृत्य

लेखक एक प्रकार के AI का उपयोग करते हैं जिसे डिफ्यूजन मॉडल (Diffusion Model) कहा जाता है। इसे एक मूर्तिकार की तरह समझें जो शोर से भरे, धुंधले मिट्टी के ब्लॉक से शुरुआत करता है और धीरे-धीरे शोर को हटाकर एक आदर्श मूर्ति को प्रकट करता है।

  • पुराना तरीका: रोबोट एक निश्चित, धुंधली तस्वीर को देखते हुए शोर को हटाने की कोशिश करता है ताकि एक्शन (हाथ कहाँ ले जाना है) को खोज सके।
  • See2Act का तरीका: रोबोट शोर को हटाते समय हाथ की हरकत को भी समझता है और साथ ही साथ अपने सिर (कैमरा) को भी घुमाता है।

जैसे-जैसे रोबोट यह समझने के करीब पहुँचता है कि क्या करना है, वह यह भी समझ जाता है कि कहाँ देखना है।

  1. शुरुआत: रोबोट पूरी मेज का एक विस्तृत, धुंधला दृश्य देखता है। उसे ठीक से नहीं पता कि वस्तु कहाँ है क्योंकि वह छिपी हुई है।
  2. नृत्य: जैसे ही AI हाथ की गति के बारे में अपने अनुमान को "साफ" (clean up) करता है, वह साथ ही साथ कैमरे को पास लाता है और बाधा के चारों ओर झांकने के लिए उसे कोण देता है।
  3. परिणाम: जब तक रोबोट के पास अपने हाथ के लिए एक स्पष्ट योजना होती है, तब तक उसने अपने कैमरे को एक आदर्श क्लोज-अप दृश्य पर भी सेट कर लिया होता है, जिससे छिपी हुई वस्तु प्रकट हो जाती है।

प्रशिक्षण: एक "डिजिटल ट्विन" से सीखना

रोबोट ने यह वास्तविक दुनिया में प्रयास और त्रुटि (trial and error) के माध्यम से नहीं सीखा (जो धीमा और खतरनाक होता)। इसके बजाय, शोधकर्ताओं ने एक डिजिटल ट्विन (Digital Twin) बनाया—रोबोट और कमरे का एक सटीक वीडियो गेम संस्करण।

उन्होंने रोबोट को किसी वस्तु को उठाने के 50 प्रदर्शन दिखाए। महत्वपूर्ण बात यह है कि उन्होंने केवल रोबोट को यह नहीं सिखाया कि हाथ कैसे हिलाना है; उन्होंने यह भी सिखाया कि हर कदम पर कैमरा कहाँ होना चाहिए। रोबोट ने सीखा कि छिपी हुई वस्तु को पकड़ने के लिए, उसे पहले उसे देखने के लिए अपना कैमरा हिलाना ही होगा।

परिणाम: देखना ही विश्वास करना है

शोधकर्ताओं ने इसे दो तरीकों से परखा:

  1. वीडियो गेम में (सिमुलेशन):

    • जब वस्तुएं बक्सों के पीछे या बिन के अंदर छिपी थीं, तो अन्य रोबोट पूरी तरह विफल रहे (0% सफलता)।
    • See2Act लगभग 96% बार सफल रहा। इसने बॉक्स के चारों ओर जाने और बिन के अंदर झांकने का तरीका ढूंढ लिया।
    • इसने मानक कार्यों पर अन्य उन्नत रोबोटों को भी हराया, भले ही वहां कोई बाधा नहीं थी, जिससे यह सिद्ध हुआ कि कैमरा हिलाना सटीकता में मदद करता है।
  2. वास्तविक दुनिया में:

    • वे वीडियो गेम में प्रशिक्षित रोबोट को एक वास्तविक धातु की बांह और एक वास्तविक लैब में ले गए। उन्होंने वास्तविक दुनिया के लिए इसे दोबारा प्रशिक्षित नहीं किया या इसमें कोई बदलाव नहीं किया (इसे "जीरो-शॉट ट्रांसफर" कहा जाता है)।
    • रोबोट ने छिपी हुई वस्तुओं को सफलतापूर्वक उठाया और उच्च सटीकता के साथ 95% बार रखा।
    • इसने एक बेस को एक तंग शेल्फ स्लॉट में रखने जैसे कार्यों को संभाला (जहाँ एक मिलीमीटर की त्रुटि भी मायने रखती है) वस्तु को डालने से पहले उसका क्लोज-अप देखने के लिए अपने कैमरे को घुमाकर।

मुख्य निष्कर्ष

See2Act एक ऐसा रोबोट है जिसने एक बहुत ही मानवीय कौशल सीखा है: यदि आप इसे देख नहीं सकते, तो अपना सिर तब तक हिलाएं जब तक कि आप देख न सकें। "देखने" और "करने" की क्रिया को एक एकल, निरंतर प्रक्रिया में जोड़कर, रोबोट उन समस्याओं को हल कर सकता है जिन्हें अन्य रोबोट, जो एक निश्चित बिंदु को देखते रहते हैं, हल नहीं कर पाते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →