← नवीनतम पेपर
💻 computer science

Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing

यह शोध पत्र एक ऐसे जनरेटिव फ्रेमवर्क का प्रस्ताव करता है जो एकल मानव प्रदर्शनों से सुसंगत रोबोट निष्पादन वीडियो को संश्लेषित करने के लिए एक दोहरे कंट्रास्टिव उद्देश्य के माध्यम से कार्य और एम्बॉडिमेंट (embodiment) निरूपणों को अलग करता है, जो युग्मित क्रॉस-एम्बॉडिमेंट डेटा की आवश्यकता के बिना प्रभावी रूप से वितरण अंतराल को पाटता है।

मूल लेखक: Zhiyuan Li, Wenyan Yang, Wenshuai Zhao, Yue Ma, Yuanpeng Tu, Pekka Marttinen, Joni Pajarinen

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiyuan Li, Wenyan Yang, Wenshuai Zhao, Yue Ma, Yuanpeng Tu, Pekka Marttinen, Joni Pajarinen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को गिलास में पानी डालना सिखाना चाहते हैं। सबसे आसान तरीका यह होगा कि किसी इंसान को ऐसा करते हुए देखते हुए एक वीडियो देखें और कहें, "रोबोट, बिल्कुल वैसा ही करो जैसा उस व्यक्ति ने किया।"

लेकिन इसमें एक बहुत बड़ी समस्या है: इंसान और रोबोट दिखने और चलने-फिरने में बहुत अलग होते हैं। एक इंसान की उंगलियां कोमल और लचीली होती हैं और उनकी कलाई कई दिशाओं में मुड़ सकती है। एक रोबोट के पास एक सख्त धातु का पंजा या अलग तरह के जोड़ हो सकते हैं। यदि आप केवल रोबोट को इंसान की गतिविधियों की हुबहू नकल करने के लिए कहते हैं, तो वह कप तोड़ देगा या पानी गिरा देगा क्योंकि उसका "शरीर" (या एम्बॉडमेंट/Embodiment) अलग तरह से बना है।

यह शोध पत्र एक नए प्रकार के वीडियो एडिटिंग टूल का उपयोग करके इस "बॉडी गैप" (शरीर के अंतर) के लिए एक चतुर समाधान प्रस्तावित करता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है:

1. समस्या: "एंटैंगल्ड" (उलझा हुआ) रेसिपी

एक मानव द्वारा पानी डालने के वीडियो को एक स्मूदी के रूप में सोचें जहाँ सामग्री इतनी अच्छी तरह से मिली हुई है कि आप उन्हें अलग नहीं कर सकते।

  • सामग्री A: कार्य (लक्ष्य: "पानी डालना," पानी का मार्ग, पकड़ी गई वस्तु)।
  • सामग्री B: शरीर (मानव हाथ का विशिष्ट आकार, मानव त्वचा के हिलने का तरीका, इंसान की अनूठी शैली)।

पुराने तरीकों ने इस स्मूदी से सीखने की कोशिश की, लेकिन क्योंकि सामग्रियां आपस में मिली हुई थीं, रोबोट ने कार्य के साथ-साथ मानव हाथ का विशिष्ट आकार भी सीख लिया। जब रोबोट ने इसे करने की कोशिश की, तो वह भ्रमित हो गया क्योंकि उसके पास मानव हाथ नहीं थे।

2. समाधान: "डिसेंटैंगल्ड" (अलग किया हुआ) शेफ

लेखकों ने एक ऐसा सिस्टम बनाया है जो एक जादुई किचन छलनी की तरह काम करता है। यह उस मिश्रित स्मूदी (मानव वीडियो) को लेता है और उसे वापस दो अलग-अलग कटोरे में विभाजित कर देता है:

  • कटोरा 1 (कार्य): इसमें केवल क्रिया का तर्क होता है। "कप उठाओ, उसे झुकाओ, भरने तक पानी डालो।" इसे इस बात से कोई फर्क नहीं पड़ता कि हाथ मानव है या रोबिक।
  • कटोरा 2 (शरीर): इसमें केवल विशिष्ट अभिनेता (मानव हाथ) की दृश्य शैली होती है।

सिस्टम एक विशेष गणितीय ट्रिक (जिसे डुअल कॉन्ट्रास्टिव लर्निंग कहा जाता है) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि ये दो कटोरे फिर कभी आपस में न मिलें। यह एक शेफ को यह सिखाने जैसा है कि "क्या किया जाना है" और "इसे कौन कर रहा है" को सख्ती से अलग रखा जाए।

3. जादुई संयोजन: "एडैप्टर"

एक बार जब सिस्टम ने "कार्य" को "मानव शरीर" से अलग कर दिया, तो यह एक रोबोट के लिए एक नया वीडियो बना सकता है।

  • यह कार्य वाले कटोरे (पानी डालने की योजना) को लेता है।
  • यह एक रोबोट के पंजे (नया शरीर) की तस्वीर लेता है।
  • यह दोनों को एक प्री-ट्रेंड वीडियो जनरेटर (एक शक्तिशाली AI जो पहले से ही यथार्थवादी वीडियो बनाना जानता है) में फीड करता है।

परिणाम क्या है? AI एक बिल्कुल नया वीडियो बनाता है जिसमें रोबोट मानव के ठीक वही कार्य कर रहा है, लेकिन रोबोट के धातु के पंजे के लिए स्वाभाविक लगने वाले तरीके से चल रहा है।

4. यह क्यों महत्वपूर्ण है

  • जोड़ी (Pairing) की आवश्यकता नहीं: आमतौर पर, एक रोबोट को सिखाने के लिए, आपको एक मानव द्वारा कार्य करने का वीडियो और उसी कार्य को करते हुए एक रोबोट का वीडियो अगल-बगल में चाहिए होता है। यह इकट्ठा करना बेहद कठिन है। यह तरीका केवल एक मानव वीडियो और एक रोबोट की तस्वीर की आवश्यकता रखता है। यह बाकी चीजें खुद ही समझ लेता है।
  • यथार्थवाद: शोध पत्र दिखाता है कि उनका तरीका ऐसे वीडियो बनाता है जहाँ रोबोट ऐसा लगता है जैसे वह वास्तव में उस दृश्य का हिस्सा हो, जिसमें सही रोशनी और गति हो, न कि केवल मानव वीडियो के ऊपर एक रोबोट मॉडल को चिपका दिया गया हो (जो नकली और सख्त दिखता है)।
  • बेहतर सीखना: जब उन्होंने इन जेनरेट किए गए रोबोट वीडियो का उपयोग वास्तव में एक रोबोट कंट्रोलर को प्रशिक्षित करने के लिए किया, तो रोबोट ने मानव वीडियो से सीधे सीखने की तुलना में तेजी से सीखा और कम गलतियाँ कीं।

सारांश में

यह शोध पत्र एक ऐसे उपकरण को पेश करता है जो गति के लिए एक सार्वभौमिक अनुवादक (Universal Translator) के रूप में कार्य करता है। यह एक मानव की क्रिया को लेता है, मानव शरीर के अंगों को हटा देता है, कार्य के लिए "निर्देश पुस्तिका" को सुरक्षित रखता है, और उस निर्देश पुस्तिका को एक विशिष्ट रोबोट के शरीर के लिए फिर से लिखता है। यह रोबोटों को इंटरनेट पर उपलब्ध अरबों मानव वीडियो से सीखने की अनुमति देता है, बिना किसी मानव प्रशिक्षक के भौतिक रूप से जोड़े जाने की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →