← नवीनतम पेपर
💻 computer science

Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation

डेमो-जेपा (Demo-JEPA) एक नवीन क्रॉस-एम्बॉडमेंट इमिटेशन लर्निंग फ्रेमवर्क है जो साझा एक्शन स्पेस की आवश्यकता को दरकिनार करते हुए प्रदर्शनों (demonstrations) को एक जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर के भीतर निहित भविष्य के लक्ष्यों के रूप में व्याख्यायित करता है, जिससे लक्षित एजेंट केवल विजुअल ऑब्जर्वेशन और अपने स्वयं के इंटरेक्शन अनुभव का उपयोग करके वांछित अवस्थाओं का अनुमान लगाने और योजना बनाने में सक्षम होते हैं।

मूल लेखक: Jingyang He, Guangrun Li, Jieyu Zhang, Chengkai Hou, Zhengping Che, Shanghang Zhang

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jingyang He, Guangrun Li, Jieyu Zhang, Chengkai Hou, Zhengping Che, Shanghang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ Demo-JEPA पेपर का सरल, रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "बॉडी लैंग्वेज" की बाधा

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखाने की कोशिश कर रहे हैं। आप उसे एक इंसान को यह करते हुए देखते हुए एक वीडियो दिखाते हैं।

  • इंसान अपनी उंगलियों, मुड़ने वाली कलाई और पकड़ने के तरीके का उपयोग करता है।
  • रोबोट के पास एक कठोर धातु का हाथ, अलग संख्या में जोड़ (joints), और एक पंजा (claw) है जो खुलता और बंद होता है।

यदि आप रोबोट को यह कहकर सिखाने की कोशिश करते हैं कि, "ठीक वैसे ही अपने हाथ को हिलाओ जैसे इंसान ने हिलाया," तो रोबोट असफल हो जाएगा। यह एक पेंगुइन को बंदर के नाच की नकल करने के लिए कहने जैसा है; बंदर के मूव्स पेंगुइन के शरीर के लिए समझ में नहीं आएंगे।

वर्तमान में अधिकांश रोबोट इस समस्या को मानव गतिविधियों को एक "अनुवाद शब्दकोश" (मानव जोड़ों को रोबोट के जोड़ों से मैप करने के गणितीय नियम) में जबरदस्ती फिट करके हल करने की कोशिश करते हैं। यह नाजुक है, महंगा है, और अक्सर तब टूट जाता है जब रोबोट या कार्य थोड़ा सा बदल जाता है।

समाधान: Demo-JEPA (द "ड्रीमर" या सपने देखने वाला)

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे Demo-JEPA कहा जाता है। रोबोट को यह सिखाने के बजाय कि कैसे हिलना है, वे उसे यह सिखाते हैं कि क्या हासिल करना है।

इसे इस तरह सोचें:

  • पुराना तरीका: "अपना हाथ 5 इंच बाईं ओर ले जाओ, फिर 30 डिग्री घुमाओ।" (इंसानी शरीर के लिए बहुत विशिष्ट)।
  • Demo-JEPA तरीका: "लक्ष्य यह है कि सैंडविच प्लेट पर होना चाहिए।" (लक्ष्य वही रहता है, चाहे कोई भी इसे कर रहा हो)।

यह सिस्टम वीडियो प्रदर्शन को निर्देशों के सेट के रूप में नहीं, बल्कि भविष्य के बारे में एक संकेत के रूप में देखता है। यह पूछता है: "अगर मैं इस इंसान को देखूँ, तो कुछ सेकंड बाद दुनिया कैसी दिखेगी?"

यह कैसे काम करता है: तीन-चरणीय "सपना" प्रक्रिया

पेपर एक फ्रेमवर्क का वर्णन करता है जो तीन चरणों में काम करता है, जिसे हम एक सपना देखने वाले (Dreamer), एक अनुवादक (Translator), और एक योजनाकार (Planner) के रूप में कल्पना कर सकते हैं।

1. अनुवादक (The "Dreamer Predictor")

यह ऑपरेशन का मस्तिष्क है। यह मानव का वीडियो (स्रोत) और रोबोट का वर्तमान दृश्य (लक्ष्य) देखता है।

  • उपमा: कल्पना कीजिए कि एक अनुवादक है जो न तो मानव की भाषा जानता है और न ही रोबोट की। शब्दों का अनुवाद करने के बजाय, वह इरादे (intent) का अनुवाद करता है।
  • यह क्या करता है: यह विवरणों (जैसे इंसान के शर्ट का रंग, रोशनी, या उसकी उंगलियों का विशिष्ट आकार) को अनदेखा कर देता है। यह उन्हें हटा देता है और क्रिया के "सार" (soul) को खोज लेता है। फिर यह एक भविष्य का लक्ष्य प्रोजेक्ट करता है जो रोबोट के शरीर के लिए समझ में आए।
  • जादू: यह एक "लेटेंट गोल" (latent goal) बनाता है। इसे भविष्य की मानसिक स्थिति के रूप में सोचें (जैसे, "कप हवा में है") जिसे रोबोट समझ सकता है, भले ही रोबोट ने इंसान को ऐसा करते हुए कभी नहीं देखा हो।

2. योजनाकार (The "Action-Conditioned World Model")

एक बार जब रोबोट के पास लक्ष्य की यह मानसिक तस्वीर आ जाती है, तो उसे यह समझना होता है कि वहां तक कैसे पहुँचना है।

  • उपमा: कल्पना कीजिए कि एक शतरंज का खिलाड़ी बोर्ड को देख रहा है। वे केवल चालें नहीं चलते; वे अपने दिमाग में भविष्य का अनुकरण (simulate) करते हैं। "अगर मैं यहाँ चलता हूँ, तो क्या होगा? अगर मैं वहाँ जाता हूँ, तो क्या होगा?"
  • यह क्या करता है: रोबोट भौतिकी (physics) के अपने आंतरिक मॉडल (कि उसका अपना हाथ कैसे हिलता है) का उपयोग करके विभिन्न क्रियाओं का अनुकरण करता है। वह उस "मानसिक चित्र" (लक्ष्य) को बदलने के लिए कई हज़ार मानसिक सिमुलेशन चलाता है, जो उसे अनुवादक से मिला था।

3. एडेप्टिव लूप (The "Pacing" या तालमेल)

कभी-कभी रोबोट अटक जाता है या वीडियो में इंसान की तुलना में धीमा चलता है।

  • उपमा: एक टूर गाइड का पीछा करने की कल्पना करें। यदि आप पीछे रह जाते हैं, तो आप सीधे गाइड के अगले स्थान पर नहीं कूदते; आप वहीं रहते हैं जब तक कि आप बराबरी न कर लें, फिर अगले स्थान पर बढ़ते हैं।
  • यह क्या करता है: सिस्टम जाँच करता है: "क्या मैंने उस लक्ष्य को प्राप्त कर लिया जो ड्रीमर ने मेरे लिए निर्धारित किया था?" यदि हाँ, तो यह वीडियो से अगला लक्ष्य लेता है। यदि नहीं, तो यह वर्तमान लक्ष्य को प्राप्त करने की कोशिश जारी रखता है। यह रोबोट को भ्रमित होने से रोकता है यदि वह प्रदर्शन में पीछे रह जाता है।

यह क्यों एक बड़ी बात है (परिणाम)

पेपर ने इसका परीक्षण दो तरीकों से किया:

  1. सिमुलेशन: एक कंप्यूटर की दुनिया जिसमें अलग-अलग रोबोटिक हाथ हैं।
  2. वास्तविक दुनिया: एक भौतिक लैब जिसमें एक UR5 रोबोट आर्म (स्रोत) और एक फ्रैंका (Franka) रोबोट आर्म (लक्ष्य) है।

निष्कर्ष:

  • "वन-शॉट" लर्निंग में बेहतर: रोबोट को सीखने के लिए कार्य को केवल एक बार देखने की आवश्यकता थी।
  • "अजीब" रोबोट्स को संभालना: यह तब भी काम कर गया जब स्रोत और लक्ष्य रोबोट एक-दूसरे से बिल्कुल अलग थे (अलग आकार, अलग बनावट)।
  • ज़ीरो-शॉट जनरलाइजेशन (Zero-Shot Generalization): यह सबसे शानदार हिस्सा है। रोबोट उन कार्यों को भी कर सका जो उसने पहले कभी नहीं देखे थे (जैसे कोई नई वस्तु उठाना या किसी नई जगह पर जाना) सिर्फ एक समान कार्य को करते हुए इंसान को देखकर।
  • तुलना: पिछले तरीके (जैसे सटीक गतिविधियों की नकल करने की कोशिश करना) पूरी तरह विफल रहे जब रोबोट अलग थे या कार्य बदल गया था। Demo-JEPA काम करता रहा।

सीमाएँ (जो पेपर स्वीकार करता है)

लेखक इसके नुकसानों के बारे में ईमानदार हैं:

  • जटिलता: इन मानसिक सिमुलेशन को चलाने के लिए बहुत अधिक कंप्यूटिंग शक्ति की आवश्यकता होती है।
  • सटीकता: हालांकि यह सामान्य कार्यों के लिए बहुत अच्छा है, लेकिन यह अत्यंत उच्च-परिशुद्धता (high-precision), नाजुक कार्यों (जैसे सुई में धागा डालना) के लिए संघर्ष कर सकता है क्योंकि "मानसिक मॉडल" अभी भी पूर्ण नहीं है।
  • प्रशिक्षण: इसे यह सीखने के लिए कि उसका अपना शरीर कैसे हिलता है, अभी भी कुछ प्रशिक्षण डेटा की आवश्यकता होती है, हालांकि इसे मानव की गतिविधियों को रोबोट की गतिविधियों से जोड़ने वाले डेटा की आवश्यकता नहीं है।

सारांश

Demo-JEPA एक रोबोट सीखने की प्रणाली है जो गति (movements) की नकल करने के बजाय इरादे (intent) को समझने पर ध्यान केंद्रित करती है। यह एक ऐसे सपने देखने वाले की तरह काम करता है जो एक इंसान को देखता है, भविष्य के परिणाम की कल्पना करता है, और फिर यह पता लगाता है कि उसका अपना अनूठा शरीर उस परिणाम को कैसे प्राप्त कर सकता है। यह रोबोट को इंसानों (या अन्य रोबोटों) से पहले की तुलना में बहुत तेज़ी से और अधिक लचीले ढंग से सीखने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →