← नवीनतम पेपर
💻 computer science

EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning

EgoInfinity एक मॉड्यूलर, वेब-स्केल 4D डेटा इंजन है जो मनमाने इंटरनेट वीडियो को मेट्रिक हैंड-ऑब्जेक्ट इंटरेक्शन रिप्रजेंटेशन और निष्पादन योग्य रोबोट ट्रेजेक्टरीज में बदल देता है, जो विविध मोरफोलॉजी और व्यू पॉइंट्स में स्केलेबल, ह्यूमन-इन-द-लूप-फ्री रोबोट लर्निंग और रिटारगेटिंग को सक्षम बनाता है।

मूल लेखक: Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

प्रकाशित 2026-06-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास यूट्यूब वीडियो का एक विशाल पुस्तकालय है जिसमें लोग रोज़मर्रा के काम करते हुए दिखाए गए हैं—जैसे डिब्बे खोलना, सूप डालना, फल काटना, या मेज पोंछना। अभी, रोबोट इन वीडियो से वास्तव में "सीख" नहीं सकते क्योंकि फुटेज केवल सपाट तस्वीरें (2D) हैं। रोबोट को यह नहीं पता कि डिब्बा कितना भारी है, सूप कितनी दूर है, या इंसान की उंगलियों ने हैंडल को ठीक से कैसे छुआ। यह वैसा ही है जैसे ब्लैक-एंड-व्हाइट फिल्म देखकर कार चलाना सीखने की कोशिश करना; आप हलचल तो देख सकते हैं, लेकिन आप स्टीयरिंग व्हील या सड़क को महसूस नहीं कर सकते।

EgoInfinity एक नया "जादुई इंजन" है जो उन सपाट, अव्यवस्थित इंटरनेट वीडियो को रोबोट के लिए एक 3D, भौतिकी-तैयार (physics-ready) निर्देश नियमावली में बदल देता है। यह इस प्रकार काम करता है, जिसे सरल चरणों में नीचे समझाया गया है:

1. "डिटेक्टिव" चरण (सुराग ढूंढना)

सबसे पहले, इंजन लाखों वीडियो क्लिप्स (विशेष रूप से Action100M नामक एक विशाल डेटासेट) को स्कैन करता है। यह एक जासूस की तरह काम करता है जो अच्छे हिस्सों की तलाश करता है। यह उबाऊ हिस्सों को अनदेखा करता है और केवल उन्हीं क्षणों पर ध्यान केंद्रित करता है जहाँ हाथ वास्तव में कुछ कर रहे होते हैं।

  • रूपक (Metaphor): इसे एक फिल्म संपादक की तरह समझें जो 100 घंटे की कच्ची फुटेज को जल्दी से स्कैन करता है ताकि उन 5 मिनटों को खोज सके जहाँ अभिनेता वास्तव में बोल रहा है, और बाकी चुप्पी को अनदेखा कर देता है।

2. "3D ट्रांसलेटर" (चित्रों को ज्यामिति में बदलना)

एक बार जब इसे एक अच्छा क्लिप मिल जाता है, तो इंजन 2D वीडियो को 3D डेटा में अनुवादित करना शुरू कर देता है। यह अनुमान लगाने के लिए स्मार्ट AI टूल्स का उपयोग करता है:

  • आकार (Shape): उस वस्तु का 3D आकार कैसा है? (क्या वह एक गोल सेब है या एक सपाट डिब्बा?)
  • स्थिति (Position): स्थान में वस्तु कहाँ है?
  • हाथ (Hands): मानव उंगलियां कैसे हिल रही हैं?
  • पैमाना (Scale): सब कुछ कितना बड़ा है? (क्या वह कप 2 इंच ऊँचा है या 2 फीट ऊँचा?)

पेपर में इसे "मेट्रिक कैलिब्रेशन" (metric calibration) कहा गया है।

  • रूपक: कल्पना कीजिए कि आप कॉफी कप पकड़े हुए एक व्यक्ति की फोटो देख रहे हैं। एक सामान्य व्यक्ति आकार का अनुमान लगा सकता है। EgoInfinity एक सुपर-सटीक 3D स्कैनर की तरह है जो तुरंत जानता है कि कप ठीक 4 इंच ऊँचा है और हाथ 12 इंच दूर है, जो सपाट फोटो को एक वर्चुअल 3D मॉडल में बदल देता है जिसके चारों ओर आप घूम सकते हैं।

3. "रियलिटी चेक" (गलतियों को सुधारना)

AI कभी-कभी भ्रमित हो जाता है। यदि कोई हाथ किसी वस्तु को ढक लेता है, तो AI अपना रास्ता भटक सकता है कि वस्तु कहाँ है। EgoInfinity में एक विशेष "इंटरैक्शन-अवेयर रिफाइनमेंट" (Interaction-Aware Refinement) चरण होता है। यह हाथ और वस्तु के बीच के संबंध को देखता है।

  • तर्क: यदि हाथ वस्तु को पकड़े हुए है, तो वस्तु को हाथ के साथ हिलना ही चाहिए। यदि हाथ स्थिर है, तो वस्तु तैरते हुए दूर नहीं जानी चाहिए।
  • रूपक: यह एक डांस इंस्ट्रक्टर की तरह है जो वीडियो देख रहा है। यदि वीडियो में गड़बड़ी होती है और डांसर का पार्टनर अचानक हवा में तैरने लगता है, तो इंस्ट्रक्टर कहता है, "नहीं, यह गलत है। यदि वे हाथ पकड़े हुए हैं, तो उन्हें एक साथ हिलना चाहिए।" इंजन इन गड़बड़ियों को ठीक करता है ताकि भौतिकी (physics) वास्तविक दिखे।

4. "यूनिवर्सल अडैप्टर" (विभिन्न रोबोटों को सिखाना)

यह सबसे चतुर हिस्सा है। इंजन केवल मानव शरीर की गतिविधियों की नकल नहीं करता है। मनुष्यों के लंबे हाथ और दो हाथ होते हैं; रोबोट के छोटे हाथ, पहिए, या ग्रिपर्स हो सकते हैं जो हाथों जैसा बिल्कुल नहीं दिखता।

  • समाधान: EgoInfinity हलचल के लक्ष्य (goal) को समझता है (जैसे, "कप उठाना") और फिर उस लक्ष्य को रोबोट की अपनी भाषा में अनुवादित करता है। यह पूछता है, "यह विशिष्ट रोबोट उसी परिणाम को कैसे प्राप्त कर सकता है?"
  • रूपक: कल्पना कीजिए कि आप एक कुत्ते को गेंद लाना (fetch) सिखा रहे हैं। आप कुत्ते को "इंसान की तरह दौड़ो" नहीं कहते। आप कुत्ते से कहते हैं, "जाओ और गेंद ले आओ," और कुत्ता खुद समझ जाता है कि उसे अपने पंजों और पैरों का उपयोग कैसे करना है। EgoInfinity रोबोट के लिए यही करता है: यह मानव के "फेच" (fetch) को लेता है और एक रोबोटिक हाथ को बताता है कि अपने जोड़ों का उपयोग करके "फेच" कैसे किया जाए।

उन्होंने वास्तव में क्या बनाया?

लेखकों ने केवल एक सिद्धांत नहीं लिखा; उन्होंने एक कामकाजी प्रणाली बनाई और उसका परीक्षण किया:

  • एक वेब इंजन: उन्होंने एक ऐसा टूल बनाया जो इन वीडियो को स्वचालित रूप से प्रोसेस कर सकता है बिना किसी मानवीय हस्तक्षेप के हर फ्रेम को लेबल किए।
  • एक डेटासेट: उन्होंने Action100M संग्रह से 106 वीडियो को प्रोसेस किया, जिससे 3D हैंड-एंड-ऑब्जेक्ट डेटा की एक लाइब्रेरी तैयार हुई।
  • वास्तविक रोबोट परीक्षण: उन्होंने सफलतापूर्वक वास्तविक रोबोटों (जैसे Unitree G1 रोबोट और डुअल-आर्म फ्रैंका रोबोट) को इन प्रोसेस्ड वीडियो को देखकर काटने, डालने और पोंछने जैसे कार्य करना सिखाया। उन्होंने एक रोबोटिक हाथ को विभिन्न वस्तुओं (सेब, केला, सूप के डिब्बे) को पकड़ने के लिए भी प्रशिक्षित किया।

इसकी सीमाएँ क्या हैं?

पेपर इस बारे में ईमानदार है कि यह अभी क्या नहीं कर सकता:

  • कैमरा मूवमेंट: यह तब सबसे अच्छा काम करता है जब कैमरा ज्यादातर स्थिर रहता है (जैसे ट्राइपॉड पर)। यदि कैमरा बहुत अधिक हिल रहा हो या चलते हाथ में पकड़ा हो, तो इसे कठिनाई होती है।
  • स्पर्श (Touch): यह महसूस नहीं कर सकता। इसे पता है कि हाथ कहाँ है, लेकिन यह नहीं जानता कि रोबोट कितनी जोर से दबा रहा है या वस्तु कितनी फिसलन भरी है।
  • पूर्ण सटीकता: यह सामान्य कार्यों के लिए बहुत अच्छा है, लेकिन यह सर्जरी जैसे नाजुक कार्यों या सटीक फिंगरटिप प्लेसमेंट वाले कार्यों के लिए पर्याप्त सटीक नहीं हो सकता है।

संक्षेप में: EgoInfinity एक सेतु (bridge) है। यह मानव यूट्यूब वीडियो की अव्यवस्थित, असंरचित दुनिया को साफ, 3D, भौतिकी-सटीक निर्देशों में बदल देता है जिन्हें रोबोट वास्तव में पढ़ और पालन कर सकते हैं, जिससे उन्हें महंगे सेंसर या हर हरकत को रिकॉर्ड करने वाले मानव शिक्षकों के बिना नए कौशल सीखने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →