← नवीनतम पेपर
💬 NLP

MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware

यह शोधपत्र MobileEgo Anywhere को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो निरंतर अवस्था ट्रैकिंग (persistent state tracking) के साथ बड़े पैमाने पर, एक घंटे लंबे ईगोसेंट्रिक डेटासेट के संग्रह को लोकतांत्रिक बनाने के लिए सामान्य स्मार्टफोन का लाभ उठाता है, जिससे विजन लैंग्वेज एक्शन मॉडल्स को आगे बढ़ाने के लिए आवश्यक दीर्घ-क्षितिज (long-horizon) डेटा की कमी को दूर किया जा सके।

मूल लेखक: Senthil Palanisamy, Abhishek Anand, Satpal Singh Rathor, Pratyush Patnaik, Shubhanshu Khatana

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Senthil Palanisamy, Abhishek Anand, Satpal Singh Rathor, Pratyush Patnaik, Shubhanshu Khatana

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखाना चाहते हैं, जैसे कि पूरा थैंक्सगिविंग डिनर बनाना। आप उसे केवल प्याज काटने का 10 सेकंड का क्लिप नहीं दिखा सकते; आपको उसे पूरी प्रक्रिया दिखानी होगी, रसोई में जाने से लेकर बर्तन धोने तक, ताकि वह एक लंबे कार्य के प्रवाह और समय को समझ सके।

यह वही समस्या है जिसे "MobileEgo Anywhere" नामक पेपर हल करने की कोशिश करता है।

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "शॉर्ट-क्लिप" का जाल (The "Short-Clip" Trap)

लंबे समय से, रोबोट को ऐसे डेटा पर प्रशिक्षित किया जा रहा है जो छोटी, असंबद्ध मूवी ट्रेलरों की तरह है। मौजूदा डेटासेट रोबोट को कुछ मिनटों के छोटे कार्यों को करते हुए दिखाते हैं, लेकिन वे चरणों के बीच के संबंध को तोड़ देते हैं।

  • उपमा: कल्पना कीजिए कि आप किसी को एक ईंट रखने के 30 सेकंड के वीडियो को देखकर, फिर एक अलग घर पर कट करके, और फिर एक अलग व्यक्ति पर कट करके, एक घर बनाना सीखने की कोशिश कर रहे हैं। आप कभी भी पूरे घर को बनाने का तरीका नहीं समझ पाएंगे।
  • हार्डवेयर की बाधा: आमतौर पर, इस तरह का लंबा, उच्च-गुणवत्ता वाला वीडियो प्राप्त करने के लिए महंगे, भारी रोबोटिक सूट या विशेष कैमरों की आवश्यकता होती है जो केवल वैज्ञानिकों के पास होते हैं।

2. समाधान: अपने iPhone को रोबोट ट्रेनर में बदलना

लेखकों ने MobileEgo Anywhere नामक एक सिस्टम बनाया है। उन्होंने महसूस किया कि लगभग हर किसी की जेब में पहले से ही एक सुपर-कंप्यूटर है: एक आधुनिक स्मार्टफोन (विशेष रूप से एक iPhone Pro)।

  • उपमा: एक $50,000 का कैमरा सेटअप बनाने के बजाय, उन्होंने फोन को एक "स्मार्ट हेलमेट" में बदल दिया। आप अपने फोन को अपने सिर पर बांधते हैं (जैसे कि GoPro), और यह रोबोट की आँखें बन जाता है।
  • "Anywhere" का जादू: क्योंकि फोन हर जगह उपलब्ध है, इसलिए कोई भी अपनी रसोई, लिविंग रूम या गैरेज में डेटा रिकॉर्ड कर सकता है। यह "हार्डवेयर बाधा" को हटा देता है, जिससे रोबोट डेटा एकत्र करना उतना ही आसान हो जाता है जितना कि सेल्फी लेना।

3. गुप्त सूत्र: "बिना पलक झपकाए देखने वाली आँख" (The "Unblinking Eye")

रोबोट को यह जानने की आवश्यकता होती है कि वे स्थान में ठीक कहाँ हैं (6 degrees of freedom) ताकि वे अपने हाथों को सही ढंग से चला सकें। आमतौर पर, यदि आप एक घंटे तक कमरे में घूमते हैं, तो कैमरा भ्रमित हो जाता है और यह ट्रैक खो देता है कि वह कहाँ से शुरू हुआ था (इसे "ड्रिफ्ट" कहा जाता है)।

  • उपमा: ARKit (iPhone के अंदर का सॉफ्टवेयर) को एक अत्यधिक सटीक आंतरिक कंपास और मानचित्र के रूप में सोचें। भले ही आप एक घंटे तक अपने पूरे घर में घूमें, फोन जानता है कि वह शुरुआत के सापेक्ष कहाँ है, जिसमें त्रुटि एक नाखून की चौड़ाई से भी कम (1 सेमी से कम) है।
  • परिणाम: उन्होंने 200 घंटों का निरंतर वीडियो एकत्र किया जहाँ रोबोट की "आँखें" ने कभी अपना स्थान नहीं खोया।

4. अनुवादक: वीडियो को "रोबोट निर्देशों" में बदलना

केवल कच्चा वीडियो पर्याप्त नहीं है; रोबोट को शब्दों और 3D स्थान में यह समझने की आवश्यकता है कि क्या हो रहा है। लेखकों ने एक पाइपलाइन बनाई है जो एक सुपर-इंटेलिजेंट ट्रांसलेटर की तरह कार्य करती है।

  • 3D हैंड ट्रैकिंग: सिस्टम आपके हाथों को देखता है और यह पता लगाता है कि आपके हाथ (fingers) 3D स्पेस में कैसे मुड़ रहे हैं, भले ही आपने चम्मच या कप पकड़ा हो।
  • "वर्णनात्मक कथावाचक" (The Descriptive Narrator): केवल "कप उठाओ" कहने के बजाय, AI क्रिया का विस्तृत विवरण देता है: "धातु के कटोरे से आटे को बड़े प्लेट में स्थानांतरित करें।" यह रंग, सामग्री और गति को भी कैप्चर करता है।
  • "स्टोरी एडिटर": चूंकि वीडियो लंबे (108 मिनट तक!) होते हैं, इसलिए सिस्टम उन्हें एक पदानुक्रम (hierarchy) में विभाजित करता है:
    • एटॉमिक स्पैन (Atomic Spans): बहुत छोटे कदम (जैसे, "आटा डालना")।
    • एपिसोड्स (Episodes): छोटे चरणों के समूह (जैसे, "आटा गूंथना")।
    • सब-गोल्स (Sub-goals): बड़े हिस्से (जैसे, "आटा तैयार करना")।
    • सेशन गोल (Session Goal): पूरा मिशन (जैसे, "ब्रेड बनाना")।

5. परिणाम: एक विशाल, ओपन लाइब्रेरी

टीम ने दुनिया को तीन चीजें जारी कीं:

  1. डेटासेट: घरेलू कार्यों को करते हुए लोगों के विविध, लंबे वीडियो के 200 घंटे।
  2. ऐप: एक फ्री ऐप जो किसी को भी अपना डेटा रिकॉर्ड करने की अनुमति देता है।
  3. पाइपलाइन: वह कोड जो कच्चे फोन वीडियो को उस प्रारूप में बदल देता है जिससे रोबोट सीख सकते हैं।

संक्षेप में:
यह पेपर कहता है कि उन्होंने साधारण iPhone को पेशेवर-ग्रेड रोबोट प्रशिक्षण उपकरणों में बदलने का तरीका खोज लिया है। लोगों द्वारा दैनिक कार्यों को करने के लंबे, निरंतर वीडियो रिकॉर्ड करके और उन वीडियो को सटीक 3D गतिविधियों और विस्तृत निर्देशों में अनुवाद करने के लिए स्मार्ट सॉफ्टवेयर का उपयोग करके, उन्होंने एक विशाल लाइब्रेरी बनाई है। यह रोबोट डेवलपर्स को केवल "छोटे वाक्यों" के बजाय "लंबी कहानियों" पर अपने मॉडल को प्रशिक्षित करने की अनुमति देता है, जिससे रोबोट को वास्तविक दुनिया में जटिल, दीर्घकालिक कार्यों को संभालने में मदद मिलती है।

नोट: पेपर विशेष रूप से इस डेटा को एकत्र करने और संसाधित करने पर केंद्रित है ताकि Vision Language Action (VLA) मॉडल को प्रशिक्षित किया जा सके। यह दावा नहीं करता है कि इसने कोई विशिष्ट रोबोट बनाया है जो पहले से ही इन कार्यों को करने में सक्षम है, और न ही यह चिकित्सा या नैदानिक अनुप्रयोगों के बारे में चर्चा करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →