← नवीनतम पेपर
💻 computer science

EgoAERO: Learning Dexterous Manipulation from a Single Egocentric Video without Object Assets

EgoAERO एक नवीन फ्रेमवर्क है जो रोबोट्स को बिना किसी प्री-स्कैन किए गए ऑब्जेक्ट एसेट्स की आवश्यकता के, एक एकल एर्गोसेंट्रिक (egocentric) RGB-D वीडियो से दक्ष हेरफेर (dexterous manipulation) सीखने में सक्षम बनाता है, जो संपर्क-संगत प्रक्षेप पथों (contact-consistent trajectories) का पुनर्निर्माण करता है और बड़े पैमाने पर EgoDex-R डेटासेट को प्रस्तुत करता है।

मूल लेखक: Yichen Niu, Haoran Lv, Xinrui Zhang, Xueyao Wan, Shiyu Gao, Ying Ai, Hui Xu, Yongqi Hu, Hengyi Zhang, Yang Xie, Zhaxizhuoma, Yue Zhao, Zhenshan Bing, Yan Ding, Jianxing Liu

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yichen Niu, Haoran Lv, Xinrui Zhang, Xueyao Wan, Shiyu Gao, Ying Ai, Hui Xu, Yongqi Hu, Hengyi Zhang, Yang Xie, Zhaxizhuoma, Yue Zhao, Zhenshan Bing, Yan Ding, Jianxing Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यधिक कुशल रोबोटिक हाथ को कोई नाजुक कार्य करना सिखाना चाहते हैं, जैसे कि संतरा छीलना या किसी विशिष्ट उपकरण को उठाना। आमतौर पर, इसके लिए आपको पहले से ही उस वस्तु का एक सटीक 3D ब्लूप्रिंट (एक CAD मॉडल) चाहिए होता है, या आपको लैब में पहले उस वस्तु को स्कैन करना पड़ता है। यह वैसा ही है जैसे किसी को कार चलाना सिखाने के लिए केवल एक वीडियो दिखाना, लेकिन बिना कभी यह बताए कि स्टीयरिंग व्हील या पेडल कैसे दिखते हैं।

EgoAERO एक नया सिस्टम है जो नियमों को बदल देता है। यह रोबोट को केवल एक एकल वीडियो (जो किसी व्यक्ति के दृष्टिकोण से रिकॉर्ड किया गया हो, जैसे कि सिर पर लगा GoPro) को देखकर जटिल, कुशल कार्य सीखने की अनुमति देता है, भले ही सिस्टम ने पहले उस विशिष्ट वस्तु को कभी न देखा हो और उसके पास उसका कोई 3D मॉडल न हो।

यहाँ बताया गया है कि EgoAERO कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. "स्मार्ट डिटेक्टिव" (सिमेंटिक प्रीप्रोसेसिंग)

सबसे पहले, सिस्टम वीडियो को देखता है और एक "स्मार्ट डिटेक्टिव" (एक AI जिसे MLLM कहा जाता है) से कहानी समझने को कहता है।

  • समस्या: वीडियो में, एक व्यक्ति कप पकड़ सकता है, लेकिन वीडियो स्पष्ट रूप से यह नहीं कहता कि "मैं एक लाल मग पकड़े हुए हूँ।"
  • समाधान: AI वीडियो को देखता है और कार्य के विवरण को पहचानकर यह पता लगाता है कि किस वस्तु का उपयोग किया जा रहा है और लक्ष्य क्या है। फिर यह वीडियो में उस वस्तु को हाइलाइट करता है, जिससे अगले चरण के लिए तैयारी हो सके।

2. "3D स्कल्प्टर" (एसेट-फ्री रिकंस्ट्रक्शन)

यही वह जादुई हिस्सा है। आमतौर पर, रोबोट को सिखाने के लिए, आपको वस्तु का एक बना-बनाया 3D मॉडल चाहिए होता है। EgoAERO के पास वह नहीं है। इसके बजाय, यह वीडियो देखते समय चलते-फिरते (on the fly) 3D मॉडल बनाता है।

  • चुनौती: व्यक्ति का हाथ अक्सर वस्तु के दृश्य को बाधित करता है (occlusion), और वस्तु की सतह बहुत साधारण हो सकती है जिसे ट्रैक करना कठिन हो।
  • समाधान: सिस्टम एक मूर्तिकार की तरह काम करता है जो मूर्ति के छिपे हुए हिस्सों को देखकर भी उसके पूर्ण आकार का अनुमान लगा सकता है। यह वीडियो के हजारों स्नैपशॉट को जोड़ता है, डेप्थ (गहराई) की जानकारी का उपयोग करता है, और एक चिकना 3D मेश बनाने के लिए गणितीय रूप से "खाली जगहों को भरता" है। यह यह भी पता लगाता है कि वस्तु 3D स्पेस में बिल्कुल कैसे घूम रही है और हिल रही है।

3. "स्टेडी कैम" (एगो मोशन कंपनसेशन)

चूंकि कैमरा व्यक्ति के सिर पर है, इसलिए जब भी वे अपना सिर घुमाते हैं, वीडियो में पूरी दुनिया हिलती हुई दिखाई देती है।

  • समस्या: यदि व्यक्ति अपना सिर घुमाता है, तो वस्तु ऐसी लगेगी जैसे वह मेज पर फिसल रही है, भले ही वह स्थिर हो।
  • समाधान: EgoAERO एक "स्टेडी कैम" ऑपरेटर की तरह काम करता है। यह गणना करता है कि व्यक्ति का सिर कैसे हिला और वीडियो से उस गति को हटा देता है। यह सुनिश्चित करता है कि रोबोट वस्तु को केवल इसलिए हिलते हुए देखे क्योंकि व्यक्ति ने उसे हिलाया है, न कि इसलिए क्योंकि कैमरा हिला है।

4. "फिजिक्स फिक्सर" (एडेप्टिव कॉन्टैक्ट ऑप्टिमाइजेशन)

कभी-कभी, वीडियो रिकंस्ट्रक्शन भौतिक रूप से थोड़ा "गलत" लग सकता है। उदाहरण के लिए, रोबोट को लग सकता है कि व्यक्ति की उंगली वस्तु के ऊपर थोड़ी तैर रही है, या वस्तु उंगली के अंदर है, जो वास्तविक जीवन में असंभव है।

  • समाधान: सिस्टम एक त्वरित "फिजिक्स चेक" चलाता है। यह हाथ और वस्तु की स्थितियों को धीरे से इस तरह व्यवस्थित करता है कि वे वास्तविक रूप से एक-दूसरे को स्पर्श करें, जैसा कि एक इंसान करता है। यह "तैरती उंगलियों" या "घोस्ट पेनिट्रेशन" जैसी छोटी त्रुटियों को ठीक करता है ताकि डेटा भौतिक रूप से संभव दिखे।

5. "दो-चरणीय नृत्य" (पॉलिसी लर्निंग)

एक बार जब सिस्टम के पास हाथ और वस्तु का एक साफ, 3D, और भौतिक रूप से सुधारा गया वीडियो आ जाता है, तो यह रोबोट को यह कार्य करना सिखाता है। यह दो चरणों में किया जाता है:

  • चरण 1: डांस पार्टनर: रोबोट पहले मानव के हाथ की गतिविधियों की नकल करना सीखता है। वह अभी वस्तु की चिंता नहीं करता; वह बस अपने हाथों और कलाई को वैसे ही चलाने का सीखता है जैसे इंसान ने किया था।
  • चरण 2: फाइन-ट्यूनिंग: अब जब रोबोट को पता है कि कैसे हिलना है, तो वह एक "रेसिडुअल" (एक छोटा सुधार) सीखता है। वह पहले से बनाए गए 3D ऑब्जेक्ट डेटा का उपयोग करके सूक्ष्म समायोजन करता है। यदि मानव का हाथ थोड़ा फिसला, या यदि वस्तु को अधिक मजबूती से पकड़ने की आवश्यकता है, तो रोबोट इन छोटे, सटीक बदलावों को करना सीखता है ताकि कार्य सफलतापूर्वक पूरा हो सके।

परिणाम: EgoDex-R

शोधकर्ताओं ने न केवल यह सिस्टम बनाया; उन्होंने इन "सुधार योग्य" वीडियो का एक विशाल पुस्तकालय बनाया जिसे EgoDex-R कहा जाता है। इसमें 4 मिलियन से अधिक फ्रेम शामिल हैं जिनमें लोग रोजमर्रा की वस्तुओं के साथ जटिल कार्य कर रहे हैं, और यह सब बिना किसी पूर्व-स्कैन किए गए 3D मॉडल के किया गया है।

यह क्यों महत्वपूर्ण है

सरल शब्दों में, EgoAERO एक अव्यवस्थित, वास्तविक दुनिया के वीडियो को एक पूर्ण, भौतिक रूप से सुसंगत निर्देश पुस्तिका में बदल देता है।

  • पहले: आपको हर उस वस्तु का एक सटीक 3D ब्लूप्रिंट चाहिए था जिसे आप चाहते थे कि रोबोट छुए।
  • अब: आपको बस एक इंसान द्वारा इसे करने का एक वीडियो चाहिए। सिस्टम बाकी सब खुद समझ लेता है।

पेपर दिखाता है कि इस तरह प्रशिक्षित रोबोट उन रोबोटों के लगभग समान प्रदर्शन कर सकते हैं जिन्हें सटीक 3D ब्लूप्रिंट के साथ प्रशिक्षित किया गया था, जो यह साबित करता है कि जटिल हाथ के कौशल सिखाने के लिए आपको महंगे प्री-स्कैनिंग की आवश्यकता नहीं है। उन्होंने सिमुलेशन और एक वास्तविक रोबोट (Unitree G1 और Inspire Hand के साथ) पर इसका परीक्षण किया, और यह सफल रहा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →