← नवीनतम पेपर
💻 computer science

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM यह प्रदर्शित करता है कि इन-द-वाइल्ड (in-the-wild) एगोसेंट्रिक मानव डेटा का उपयोग करके वर्ल्ड एक्शन मॉडल्स (World Action Models) के साथ रोबोट नीतियों को प्रशिक्षित करना पारंपरिक बिहेवियर क्लोनिंग (behavior cloning) की तुलना में काफी बेहतर प्रदर्शन करता है, क्योंकि यह हस्तांतरणीय भौतिक प्रभावों को गैर-हस्तांतरणीय मानव-विशिष्ट कारकों से बेहतर तरीके से अलग करने के लिए DINO फीचर्स और 3D मोशन फ्लो जैसे अमूर्त विश्व निरूपणों (abstract world representations) का लाभ उठाता है।

मूल लेखक: Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अनाड़ी रोबोट को घर के काम करना सिखाना चाहते हैं, जैसे शर्ट मोड़ना या कप उठाना। आपके पास इंसानों द्वारा ये काम पूरी सटीकता से करने वाले वीडियो डेटा का एक पहाड़ है। यह एक सुनहरे अवसर जैसा लगता है: बस इंसानों की नकल कर लो, है ना?

पर इतना भी जल्दी नहीं। पेपर EGOWAM तर्क देता है कि यदि आप केवल मानव मूवमेंट्स (हिलने-डुलने के तरीके) की नकल करने की कोशिश करते हैं (जिसे "बिहेवियर क्लोनिंग" कहा जाता है), तो आप वास्तव में चीजों को और खराब कर सकते हैं।

समस्या यह है: इंसान और रोबोट अलग तरह से बने होते हैं। एक इंसान की रीढ़ लचीली होती है, दो हाथ बेतरतीब ढंग से हिलते हैं, और सिर ऊपर-नीचे होता रहता है। एक रोबोट सख्त होता है, जिसके सिर पर एक फिक्स्ड कैमरा होता है, और वह यांत्रिक सटीकता के साथ चलता है। यदि आप रोबोट को इंसान के हाथ के झूलने के सटीक तरीके की नकल करने के लिए मजबूर करते हैं, तो रोबोट अपने शरीर को उन तरीकों से मोड़ने की कोशिश करेगा जो वह शारीरिक रूप से नहीं कर सकता। यह एक पेंगुइन को ईगल के वीडियो दिखाकर उसे उड़ना सिखाने जैसा है; पेंगुइन बस अपने पंख फड़फड़ाएगा और गिर जाएगा।

लेखकों ने पाया कि यह "मूवमेंट कॉपी करने" वाला दृष्टिकोण अक्सर विफल हो जाता है क्योंकि यह रोबोट को उन मानव-विशिष्ट चीजों (जैसे सिर का हिलना या शरीर की शैली) से भ्रमित कर देता है जो स्वयं कार्य के लिए महत्वपूर्ण नहीं हैं।

जादुई स्विच: केवल मूव नहीं, बल्कि भविष्य की भविष्यवाणी करना

रोबोट को सिर्फ यह बताने के बजाय कि "अपना हाथ यहाँ लाओ," शोधकर्ताओं ने एक अलग तरीका आजमाया। उन्होंने रोबोट को एक वर्ल्ड एक्शन मॉडल (World Action Model) सिखाया।

इसे इस तरह समझें:

  • पुराना तरीका (बिहेवियर क्लोनिंग): आप रोबोट को कहते हैं, "मेरे हाथ की गति की ठीक वैसे ही नकल करो।" रोबोट भ्रमित हो जाता है क्योंकि आपके हाथ की गति उसके ग्रिपर (पकड़ने वाले यंत्र) से अलग होती है।
  • नया तरीका (EGOWAM): आप रोबोट को बताते हैं, "देखो कि मेरे हाथ हिलाने पर कप के साथ क्या होता है।"

रोबोट यह सीखता है कि दुनिया कैसे बदलती है (कप हिलता है, शर्ट मुड़ती है) न कि केवल मानव के शरीर की भाषा की नकल करता है। यह एक छात्र को गेंद के लुढ़कने के पीछे के भौतिक विज्ञान (physics) को समझने के लिए सिखाने जैसा है, बजाय इसके कि वह उस व्यक्ति की सटीक मांसपेशियों की गतिविधियों को रट ले जिसने गेंद को किक मारी थी। क्योंकि लुढ़कते हुए कप का भौतिक विज्ञान वही रहता है चाहे उसे इंसान हिलाए या रोबोट, इसलिए रोबोट मानव शरीर के आकार से भ्रमित हुए बिना मानव वीडियो से सीख सकता है।

"दुनिया" मायने रखती है: रोबोट को क्या भविष्यवाणी करनी चाहिए?

शोधकर्ताओं ने रोबोट द्वारा भविष्य की दुनिया को "देखने" के तीन अलग-अलग तरीकों का परीक्षण किया। उन्होंने रोबोट के मस्तिष्क को एक छात्र की तरह माना जो परीक्षा दे रहा है, जहाँ "परीक्षा का प्रश्न" यह है कि रोबोट को आगे क्या भविष्यवाणी करनी चाहिए।

  1. "पिक्सेल" टेस्ट (रिकंस्ट्रक्शन): रोबोट अगले चित्र की पिक्सेल-दर-पिक्सेल भविष्यवाणी करने की कोशिश करता है।
    • परिणाम: यह असफल रहा। रोबोट शर्ट के सटीक रंग या कमरे की लाइटिंग को याद करने में फंस गया। वह यह अंतर नहीं कर सका कि "कप हिल रहा है" और "कैमरा हिल रहा है" में क्या फर्क है। यह सड़क पर रेत के हर एक कण को याद करके गाड़ी चलाना सीखने जैसा है; आप मुख्य तस्वीर को भूल जाते हैं।
  2. "DINO" टेस्ट (सिमेंटिक्स/अर्थ): रोबोट दृश्य के अर्थ की भविष्यवाणी करता है। वह नीले रंग के सटीक शेड या लाइटिंग की चिंता किए बिना यह पहचानना सीख जाता है कि "यह एक कप है" या "यह एक बैग है।"
    • परिणाम: नई चीजों को देखने के मामले में यह एक बड़ी जीत थी। जब रोबोट के सामने ऐसा कप आया जिसे उसने पहले कभी नहीं देखा था, या एक अलग बैकग्राउंड वाला कमरा आया, तो उसने पुराने तरीके की तुलना में 4 गुना बेहतर प्रदर्शन किया। उसने वस्तु की फोटो नहीं, बल्कि उसके विचार (concept) को सीखा।
  3. "3D फ्लो" टेस्ट (मोशन/गति): रोबोट यह भविष्यवाणी करता है कि चीजें 3D स्पेस में बिल्कुल कैसे चलती हैं, कैमरे के हिलने को नजरअंदाज करते हुए। यह मानव के सिर की गतिविधियों को फ़िल्टर कर देता है और केवल वस्तु की गति पर ध्यान केंद्रित करता है।
    • परिणाम: सटीकता के लिए यह चैंपियन था। जब रोबोट को एक परिचित कमरे में कप को एक विशिष्ट स्थान पर रखना था, तो इसकी सफलता दर में 20-20% की वृद्धि हुई। इसने गति की सटीक ज्यामिति (geometry) को सीखा।

मुख्य निष्कर्ष

यह पेपर दिखाता है कि आप बस मानव वीडियो को रोबोट में डाल नहीं सकते और उम्मीद नहीं कर सकते कि वह काम करेगा। आपको इस बात पर ध्यान देना होगा कि रोबोट उन वीडियो से क्या सीख रहा है।

  • उन्होंने क्या खारिज किया: केवल मानव मूवमेंट की नकल करना (बिहेवियर क्लोनिंग) या सटीक पिक्सेल इमेज की भविष्यवाणी करने की कोशिश करना (पिक्सेल VAE) कमजोर तरीके हैं। वे अक्सर रोबोट को केवल रोबोट डेटा से सीखने की तुलना में भी खराब प्रदर्शन करने पर मजबूर कर देते हैं।
  • उन्होंने क्या पाया: एक "वर्ल्ड एक्शन मॉडल" का उपयोग करके जो अर्थ (DINO) या 3D मोशन (3D Flow) पर ध्यान केंद्रित करता है, रोबोट भारी मात्रा में बिखरे हुए, वास्तविक दुनिया के मानव डेटा से सफलतापूर्वक सीख सकता है।

लेखक वास्तविक दुनिया के परीक्षणों के आधार पर इन आंकड़ों के प्रति बहुत आश्वस्त हैं, जिसमें एक दो-हाथों वाले रोबोट द्वारा कप को तश्तरी पर रखने, कपड़े मोड़ने और किराने का थैला भरने जैसे कार्य किए गए। उन्होंने पाया कि परिचित सेटिंग्स में काम करने के लिए "3D फ्लो" विधि सबसे अच्छी थी, जबकि "DINO" विधि पूरी तरह से नई वस्तुओं और कमरों को संभालने के लिए सबसे अच्छी थी।

संक्षेप में: रोबोट को इंसान की तरह नाचना न सिखाएं; उसे यह समझाएं कि दुनिया कैसे चलती है, और उसे अपना खुद का डांस स्टेप खोजने दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →