MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware
यह शोधपत्र MobileEgo Anywhere को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो निरंतर अवस्था ट्रैकिंग (persistent state tracking) के साथ बड़े पैमाने पर, एक घंटे लंबे ईगोसेंट्रिक डेटासेट के संग्रह को लोकतांत्रिक बनाने के लिए सामान्य स्मार्टफोन का लाभ उठाता है, जिससे विजन लैंग्वेज एक्शन मॉडल्स को आगे बढ़ाने के लिए आवश्यक दीर्घ-क्षितिज (long-horizon) डेटा की कमी को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखाना चाहते हैं, जैसे कि पूरा थैंक्सगिविंग डिनर बनाना। आप उसे केवल प्याज काटने का 10 सेकंड का क्लिप नहीं दिखा सकते; आपको उसे पूरी प्रक्रिया दिखानी होगी, रसोई में जाने से लेकर बर्तन धोने तक, ताकि वह एक लंबे कार्य के प्रवाह और समय को समझ सके।
यह वही समस्या है जिसे "MobileEgo Anywhere" नामक पेपर हल करने की कोशिश करता है।
यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: "शॉर्ट-क्लिप" का जाल (The "Short-Clip" Trap)
लंबे समय से, रोबोट को ऐसे डेटा पर प्रशिक्षित किया जा रहा है जो छोटी, असंबद्ध मूवी ट्रेलरों की तरह है। मौजूदा डेटासेट रोबोट को कुछ मिनटों के छोटे कार्यों को करते हुए दिखाते हैं, लेकिन वे चरणों के बीच के संबंध को तोड़ देते हैं।
- उपमा: कल्पना कीजिए कि आप किसी को एक ईंट रखने के 30 सेकंड के वीडियो को देखकर, फिर एक अलग घर पर कट करके, और फिर एक अलग व्यक्ति पर कट करके, एक घर बनाना सीखने की कोशिश कर रहे हैं। आप कभी भी पूरे घर को बनाने का तरीका नहीं समझ पाएंगे।
- हार्डवेयर की बाधा: आमतौर पर, इस तरह का लंबा, उच्च-गुणवत्ता वाला वीडियो प्राप्त करने के लिए महंगे, भारी रोबोटिक सूट या विशेष कैमरों की आवश्यकता होती है जो केवल वैज्ञानिकों के पास होते हैं।
2. समाधान: अपने iPhone को रोबोट ट्रेनर में बदलना
लेखकों ने MobileEgo Anywhere नामक एक सिस्टम बनाया है। उन्होंने महसूस किया कि लगभग हर किसी की जेब में पहले से ही एक सुपर-कंप्यूटर है: एक आधुनिक स्मार्टफोन (विशेष रूप से एक iPhone Pro)।
- उपमा: एक $50,000 का कैमरा सेटअप बनाने के बजाय, उन्होंने फोन को एक "स्मार्ट हेलमेट" में बदल दिया। आप अपने फोन को अपने सिर पर बांधते हैं (जैसे कि GoPro), और यह रोबोट की आँखें बन जाता है।
- "Anywhere" का जादू: क्योंकि फोन हर जगह उपलब्ध है, इसलिए कोई भी अपनी रसोई, लिविंग रूम या गैरेज में डेटा रिकॉर्ड कर सकता है। यह "हार्डवेयर बाधा" को हटा देता है, जिससे रोबोट डेटा एकत्र करना उतना ही आसान हो जाता है जितना कि सेल्फी लेना।
3. गुप्त सूत्र: "बिना पलक झपकाए देखने वाली आँख" (The "Unblinking Eye")
रोबोट को यह जानने की आवश्यकता होती है कि वे स्थान में ठीक कहाँ हैं (6 degrees of freedom) ताकि वे अपने हाथों को सही ढंग से चला सकें। आमतौर पर, यदि आप एक घंटे तक कमरे में घूमते हैं, तो कैमरा भ्रमित हो जाता है और यह ट्रैक खो देता है कि वह कहाँ से शुरू हुआ था (इसे "ड्रिफ्ट" कहा जाता है)।
- उपमा: ARKit (iPhone के अंदर का सॉफ्टवेयर) को एक अत्यधिक सटीक आंतरिक कंपास और मानचित्र के रूप में सोचें। भले ही आप एक घंटे तक अपने पूरे घर में घूमें, फोन जानता है कि वह शुरुआत के सापेक्ष कहाँ है, जिसमें त्रुटि एक नाखून की चौड़ाई से भी कम (1 सेमी से कम) है।
- परिणाम: उन्होंने 200 घंटों का निरंतर वीडियो एकत्र किया जहाँ रोबोट की "आँखें" ने कभी अपना स्थान नहीं खोया।
4. अनुवादक: वीडियो को "रोबोट निर्देशों" में बदलना
केवल कच्चा वीडियो पर्याप्त नहीं है; रोबोट को शब्दों और 3D स्थान में यह समझने की आवश्यकता है कि क्या हो रहा है। लेखकों ने एक पाइपलाइन बनाई है जो एक सुपर-इंटेलिजेंट ट्रांसलेटर की तरह कार्य करती है।
- 3D हैंड ट्रैकिंग: सिस्टम आपके हाथों को देखता है और यह पता लगाता है कि आपके हाथ (fingers) 3D स्पेस में कैसे मुड़ रहे हैं, भले ही आपने चम्मच या कप पकड़ा हो।
- "वर्णनात्मक कथावाचक" (The Descriptive Narrator): केवल "कप उठाओ" कहने के बजाय, AI क्रिया का विस्तृत विवरण देता है: "धातु के कटोरे से आटे को बड़े प्लेट में स्थानांतरित करें।" यह रंग, सामग्री और गति को भी कैप्चर करता है।
- "स्टोरी एडिटर": चूंकि वीडियो लंबे (108 मिनट तक!) होते हैं, इसलिए सिस्टम उन्हें एक पदानुक्रम (hierarchy) में विभाजित करता है:
- एटॉमिक स्पैन (Atomic Spans): बहुत छोटे कदम (जैसे, "आटा डालना")।
- एपिसोड्स (Episodes): छोटे चरणों के समूह (जैसे, "आटा गूंथना")।
- सब-गोल्स (Sub-goals): बड़े हिस्से (जैसे, "आटा तैयार करना")।
- सेशन गोल (Session Goal): पूरा मिशन (जैसे, "ब्रेड बनाना")।
5. परिणाम: एक विशाल, ओपन लाइब्रेरी
टीम ने दुनिया को तीन चीजें जारी कीं:
- डेटासेट: घरेलू कार्यों को करते हुए लोगों के विविध, लंबे वीडियो के 200 घंटे।
- ऐप: एक फ्री ऐप जो किसी को भी अपना डेटा रिकॉर्ड करने की अनुमति देता है।
- पाइपलाइन: वह कोड जो कच्चे फोन वीडियो को उस प्रारूप में बदल देता है जिससे रोबोट सीख सकते हैं।
संक्षेप में:
यह पेपर कहता है कि उन्होंने साधारण iPhone को पेशेवर-ग्रेड रोबोट प्रशिक्षण उपकरणों में बदलने का तरीका खोज लिया है। लोगों द्वारा दैनिक कार्यों को करने के लंबे, निरंतर वीडियो रिकॉर्ड करके और उन वीडियो को सटीक 3D गतिविधियों और विस्तृत निर्देशों में अनुवाद करने के लिए स्मार्ट सॉफ्टवेयर का उपयोग करके, उन्होंने एक विशाल लाइब्रेरी बनाई है। यह रोबोट डेवलपर्स को केवल "छोटे वाक्यों" के बजाय "लंबी कहानियों" पर अपने मॉडल को प्रशिक्षित करने की अनुमति देता है, जिससे रोबोट को वास्तविक दुनिया में जटिल, दीर्घकालिक कार्यों को संभालने में मदद मिलती है।
नोट: पेपर विशेष रूप से इस डेटा को एकत्र करने और संसाधित करने पर केंद्रित है ताकि Vision Language Action (VLA) मॉडल को प्रशिक्षित किया जा सके। यह दावा नहीं करता है कि इसने कोई विशिष्ट रोबोट बनाया है जो पहले से ही इन कार्यों को करने में सक्षम है, और न ही यह चिकित्सा या नैदानिक अनुप्रयोगों के बारे में चर्चा करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।