← नवीनतम पेपर
⚡ electrical engineering

OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction

OmniRetarget एक इंटरैक्शन-प्रिजर्विंग डेटा जनरेशन इंजन है जो एम्बॉडीमेंट गैप्स को दूर करने और महत्वपूर्ण मानव-वस्तु/पर्यावरण संबंधों को बनाए रखने के लिए एक इंटरैक्शन मेश का लाभ उठाता है, जिससे जटिल लर्निंग करिकुलम के बिना रोबस्ट, लॉन्ग-होराइजन ह्यूमनॉइड लोको-मैनिपुलेशन और पार्कोर स्किल्स के लिए उच्च गुणवत्ता वाले ट्रेनिंग डेटा का कुशल निर्माण संभव होता है।

मूल लेखक: Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पार्कौर (parkour) करना, एक भारी कुर्सी को पहाड़ी पर ले जाना, या दीवार पर चढ़ना सिखाना चाहते हैं। आप हर एक मांसपेशी की हरकत को हाथ से प्रोग्राम करने की कोशिश कर सकते हैं, लेकिन यह वैसा ही है जैसे किसी को पानी के प्रतिरोध (water resistance) पर एक भौतिक विज्ञान (physics) की किताब लिखकर तैरना सिखाना। यह बहुत कठिन और बहुत धीमा है।

इसके बजाय, OmniRetarget के पीछे के शोधकर्ताओं ने तय किया कि रोबोट को इंसान को वे हरकतें करते हुए देखकर सीखने दिया जाए। लेकिन यहाँ एक पेंच है: इंसान और रोबोट बहुत अलग दिखते हैं। यदि आप केवल इंसान की गतिविधियों को रोबोट पर कॉपी करते हैं, तो रोबोट के पैर फर्श पर फिसल सकते हैं (जैसे आइस स्केटिंग), उसके पैर कुर्सी के आर-पार जा सकते हैं, या उसके जोड़ असंभव तरीके से मुड़ सकते हैं।

OmniRetarget एक नया "जादुई अनुवादक" (magic translator) है जो इस समस्या को ठीक करता है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग करके बताया गया है:

1. "इंटरैक्शन मेश" (अदृश्य मकड़ी का जाल)

कल्पना कीजिए कि इंसान, रोबोट, कुर्सी और ज़मीन एक अदृश्य, खिंचने वाले मकड़ी के जाल (spiderweb) से जुड़े हुए हैं।

  • समस्या: जब कोई इंसान हिलता है, तो जाल स्वाभाविक रूप से खिंचता है। यदि आप केवल इंसान की मुद्रा (pose) को रोबोट पर कॉपी करते हैं, तो जाल टूट या फट जाता है क्योंकि रोबोट के शरीर के अंग अलग जगहों पर होते हैं।
  • समाधान: OmniRetarget एक डिजिटल "इंटरैक्शन मेश" (एक 3D वेब) बनाता है जो इंसान के जोड़ों को उन वस्तुओं से जोड़ता है जिन्हें वे छूते हैं। रोबोट की गति को इंसान की गति में बदलते समय, सिस्टम इस वेब को रोबोट के शरीर के अनुकूल ढालने के लिए इसे खींचता और सिकोड़ता है, लेकिन यह वेब को बरकरार रखता है
  • परिणाम: यदि इंसान का हाथ कुर्सी को छू रहा है, तो रोबोट का हाथ नए संस्करण में भी कुर्सी को छूना चाहिए। यदि इंसान का पैर ज़मीन पर मजबूती से टिका है, तो रोबोट का पैर भी वहीं टिका रहेगा। यह रोबोट को वस्तुओं के आर-पार जाने या फिसलने से रोकता है।

2. "सख्त कोच" (कठोर बाधाएं/Hard Constraints)

अतीत में, ये ट्रांसलेशन सिस्टम एक ऐसे कोच की तरह थे जो कहते थे, "इंसान जैसा दिखने की कोशिश करो, लेकिन अगर तुम थोड़ा फर्श के नीचे चले जाओ तो भी ठीक है।"
OmniRetigate एक सख्त कोच है। यह नियमों (mathematical constraints) का एक सेट उपयोग करता है जो कहते हैं:

  • "तुम्हारे पैर नहीं फिसल सकते।"
  • "तुम्हारा शरीर कुर्सी के आर-पार नहीं जा सकता।"
  • "तुम्हारे जोड़ पीछे की ओर नहीं मुड़ सकते।"
    यह एक जटिल पहेली को हल करता है ताकि रोबोट के हिलने का ऐसा तरीका मिल सके जो इंसान जैसा दिखे लेकिन भौतिकी के सभी नियमों का पालन करे।

3. "वन-टू-मेनी" फोटोकॉपी मशीन (डेटा ऑग्मेंटेशन)

आमतौर पर, रोबोट को लाल बॉक्स उठाने के लिए सिखाने के लिए, आपको एक इंसान को लाल बॉक्स उठाते हुए दिखाना होगा। नीले बॉक्स उठाने के लिए, आपको एक नया प्रदर्शन दिखाना होगा।
OmniRetarget एक स्मार्ट फोटोकॉपी मशीन की तरह है।

  • आप इसे एक मानव प्रदर्शन दिखाते हैं (जैसे, एक बॉक्स उठाना)।
  • सिस्टम स्वचालित रूप से सैकड़ों नए बदलाव उत्पन्न करता है: एक ऊँचा बॉक्स उठाना, एक छोटा बॉक्स, एक अलग जगह पर बॉक्स, या यहाँ तक कि एक ऊँचे प्लेटफॉर्म पर चढ़ना।
  • यह ऐसा इसलिए करता है क्योंकि यह मूल मूवमेंट लॉजिक को बरकरार रखते हुए इन नए परिदृश्यों में "मकड़ी के जाल" को गणितीय रूप से नया आकार देता है। यह केवल कुछ मानव वीडियो से प्रशिक्षण डेटा का एक विशाल पुस्तकालय बनाता है।

बड़ी जीत: सिमुलेशन से वास्तविकता तक

शोधकर्ताओं ने इन अनुवादित गतियों का उपयोग करके एक रोबोट (Unititzer G1 humanoid) को प्रशिक्षित करने के लिए इस प्रणाली का उपयोग किया।

  • प्रशिक्षण: क्योंकि डेटा बहुत साफ और भौतिक रूप से सही था, रोबोट को सीखने के लिए केवल 5 सरल नियमों (रिवॉर्ड्स) की आवश्यकता थी। इसे गलतियों को सुधारने के लिए जटिल, अव्यवद्य निर्देशों की आवश्यकता नहीं थी।
  • परिणाम: रोबोट ने 30 सेकंड का पार्कौर कोर्स करना सीख लिया जिसमें एक कुर्सी उठाना, उस पर कदम रखना, उससे कूदना और लुढ़कना शामिल था।
  • ज़ीरो-शॉट ट्रांसफर (Zero-Shot Transfer): यह सबसे प्रभावशाली हिस्सा है। रोबोट ने पूरी तरह से कंप्यूटर सिमुलेशन का उपयोग करके सीखा। जब उन्होंने इसे वास्तविक दुनिया में चालू किया, तो यह बिना किसी अतिरिक्त ट्यूनिंग के तुरंत काम करने लगा। इसे असली कंक्रीट पर चलने के लिए "दोबारा सीखने" की आवश्यकता नहीं थी; इसे बस पता था कि क्या करना है।

सारांश

संक्षेप में, OmniRetarget इंसान और रोबोट के बीच के "एम्बोडिमेंट गैप" (embodiment gap) को हल करता है। यह मानव गतिविधियों को लेता है, उन्हें एक सुरक्षात्मक, भौतिकी-अनुपालक "वेब" में लपेटता है जो यह सुनिश्चित करता है कि वे रोबोट के लिए समझ में आने योग्य हों, और फिर इसका उपयोग अनंत अभ्यास परिदृश्यों को उत्पन्न करने के लिए करता है। यह रोबोट को पार्कौर और ऑब्जेक्ट मैनिपुलेशन जैसे जटिल, फुर्तीले कौशल तेजी से और सफलतापूर्वक कंप्यूटर से वास्तविक दुनिया में स्थानांतरित करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →