← नवीनतम पेपर
💻 computer science

EgoAVFlow: Robot Policy Learning with Active Vision from Human Egocentric Videos via 3D Flow

EgoAVFlow एक रोबोट पॉलिसी लर्निंग फ्रेमवर्क है जो मानव एग्ोसेंट्रिक वीडियो से एक साझा 3D फ्लो रिप्रजेंटेशन का लाभ उठाता है ताकि मैनिपुलेशन और एक्टिव व्यूपॉइंट कंट्रोल को एक साथ सीखा जा सके, जिससे रोबोटिक प्रदर्शनों की आवश्यकता के बिना सुदृढ़ कार्य निष्पादन सक्षम होता है।

मूल लेखक: Daesol Cho, Youngseok Jang, Danfei Xu, Sehoon Ha

प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daesol Cho, Youngseok Jang, Danfei Xu, Sehoon Ha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई काम करना सिखाने की कोशिश कर रहे हैं, जैसे तौलिया मोड़ना या बोतल पर स्प्रे करना, लेकिन आपके पास केवल एक इंसान द्वारा यह काम करते हुए बनाए गए वीडियो हैं।

समस्या यह है कि इंसान और रोबोट अलग-अलग तरह से बने होते हैं। एक इंसान अपने सिर पर कैमरा (अपनी आँखें) पहनता है और स्वाभाविक रूप से अपना सिर घुमाता है। एक रोबोट के पास एक फिक्स्ड आर्म (स्थिर हाथ) पर लगा हुआ कैमरा होता है। यदि आप बस रोबोट को कहते हैं, "बिल्कुल वैसे ही नकल करो जैसा इंसान ने अपने सिर के साथ किया," तो रोबोट शायद छत की ओर देखने लगेगा, अपने ही हाथ से बाधित हो जाएगा, या वस्तु को पूरी तरह से देखने से चूक जाएगा।

EgoAVFlow रोबोट्स के लिए एक नया "दिमाग" है जो इस समस्या को हल करता है। यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. समस्या: "खराब नकलची" (The "Bad Copycat")

एक जादूगर की तरह एक इंसान को काम करते हुए सोचें। वे ट्रिक को देखने के लिए सबसे अच्छा एंगल पाने के लिए अपनी आँखों और सिर को तेज़ी से घुमाते हैं। यदि आप एक रोबोट को जादूगर के सिर की गतिविधियों की हुबहू नकल करने के लिए सिखाने की कोशिश करते हैं, तो रोबोट अजीब लग सकता है या मुख्य बिंदु को मिस कर सकता है क्योंकि रोबोट का "शरीर" अलग है। उसे इंसान की तरह अपना सिर हिलाने की ज़रूरत नहीं है; उसे बस काम करने के लिए वस्तु को स्पष्ट रूप से देखने की आवश्यकता है।

2. समाधान: "3D फ्लो मैप" (The "3D Flow Map")

इंसान के सिर की गतिविधियों की नकल करने के बजाय, EgoAVFlow गति के भौतिक विज्ञान (physics of the movement) को सीखता है।

कल्पना कीजिए कि इंसान का वीडियो एक 2D मूवी है। EgoAVFlow उस मूवी को एक 3D होलोग्राम में बदल देता है (यही "3D फ्लो" है)।

  • यह इस बात को नज़रअंदाज़ कर देता है कि वस्तु कैसी दिखती है (रंग, बनावट)।
  • यह पूरी तरह से इस पर ध्यान केंद्रित करता है कि वस्तु 3D स्पेस में कहाँ जा रही है।
  • यह एक डांस को देखने जैसा है जहाँ आप केवल डांसर्स के पैरों और उनके द्वारा लिए गए रास्ते को ट्रैक करते हैं, उनकी वेशभूषा को नज़रअंदाज़ करते हैं। यह रोबोट को इंसान के विशिष्ट शरीर के आकार से भ्रमित हुए बिना गति को समझने में सक्षम बनाता है।

3. सीक्रेट सॉस: "स्मार्ट कैमरा" (The "Smart Camera")

यह सबसे शानदार हिस्सा है। रोबोट केवल देखता नहीं है; वह वस्तु को अपनी दृष्टि में रखने के लिए अपने कैमरे को सक्रिय रूप से घुमाता है।

  • पुराना तरीका: रोबोट अंधे होकर इंसान के सिर के पथ का अनुसरण करता है।
  • EgoAVFlow का तरीका: रोबोट के पास एक "क्रिस्टल बॉल" (भविष्य बताने वाला गोला) है। हिलने से पहले, वह भविष्यवाणी करता है:
    1. अगले कुछ सेकंड में वस्तु कहाँ होगी।
    2. उसका अपना हाथ कहाँ होगा।
    3. क्या मेरा हाथ मेरे दृश्य को रोक देगा?

यदि रोबोट भविष्यवाणी करता है, "ओह नहीं, अगर मैं अपने हाथ को इस तरह से हिलाता हूँ, तो मैं अपने ही हाथ से वस्तु को छिपा दूँगा," तो वह तुरंत अपने हाथ के चारों ओर से झाँकने के लिए अपने कैमरे का एंगल बदल देता है। यह एक सुरक्षा गार्ड की तरह है जो लगातार अपनी स्थिति बदलता रहता है ताकि वह कभी भी वीआईपी (VIP) को अपनी नज़रों से ओझल न होने दे, भले ही वह वीआईपी किसी खंभे के पीछे जा रहा हो।

4. यह कैसे सीखता है: "अभ्यास सत्र" (The "Practice Run")

रोबोट इस कौशल को डिफ्यूजन मॉडल्स (Diffusion Models) नामक तकनीक का उपयोग करके सीखता है (इसे "डिनोइजिंग" प्रक्रिया के रूप में सोचें)।

  • कल्पना कीजिए कि रोबोट कैमरे के सबसे सटीक एंगल का चित्र बनाने की कोशिश कर रहा है। शुरू में, चित्र केवल स्टैटिक नॉइज़ (रैंडम अनुमान) है।
  • उसके पास एक "शिक्षक" (इंसान का वीडियो) है जो उसे एक सामान्य विचार देता है।
  • लेकिन, चित्र को अंतिम रूप देने से पहले, वह एक सिमुलेशन चलाता है: "यदि मैं यह एंगल चुनता हूँ, तो क्या मैं वस्तु को देख पाऊँगा?"
  • यदि उत्तर "नहीं" है, तो वह चित्र में सुधार करता है। यदि उत्तर "हाँ" है, तो वह उसे रखता है।
  • वह दृश्यता को अधिकतम करने वाले परफेक्ट एंगल को खोजने के लिए एक सेकंड के हजारवें हिस्से में इसे हजारों बार करता है।

यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, रोबोट अक्सर इसलिए विफल हो जाते हैं क्योंकि वे उस वस्तु को देखने की दृष्टि खो देते हैं जिसे वे उठाने की कोशिश कर रहे होते हैं।

  • पिछले तरीकों ने मानव सिर की गतिविधियों की नकल करने की कोशिश की, जो अक्सर विफल रहे क्योंकि मानव सिर की गति रोबोट के हाथों से भिन्न होती है।
  • EgoAVFlow लक्ष्य (वस्तु को दृश्यमान रखना) को सीखता है, न कि तरीके (इंसान की तरह सिर हिलाना) को।

परिणाम: रोबोट वस्तुओं को उठा सकता है, तौलिए मोड़ सकता है और बोतलों पर स्प्रे कर सकता है, भले ही कैमरा एंगल लगातार बदल रहा हो, और यह सब बिना किसी इंसान द्वारा रोबोट कंट्रोलर पकड़कर सिखाए। इसने वीडियो देखकर और खुद ही सबसे अच्छा तरीका खोजकर सीखा कि कैसे "देखना" है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →