← नवीनतम पेपर
💻 computer science

LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models

LD4WAM एक नवीन ढांचा है जो मानव वीडियो पूर्वग्रहों (human video priors) और क्रियाशील रोबोटिक नियंत्रण के बीच के अंतर को पाटता है, जो एम्बॉडमेंट-अग्नोस्टिक मोशन-अलाइन्ड लेटेंट डायनेमिक्स (embodiment-agnostic motion-aligned latent dynamics) सीखकर सक्षम बनाता है, जिससे एक मिक्सचर-ऑफ-ट्रांसफॉर्मर्स वर्ल्ड मॉडल विविध वस्तुओं, पृष्ठभूमि और रोबोटिक एम्बॉडमेंट्स में प्रभावी ढंग से सामान्यीकरण करने में सक्षम होता है।

मूल लेखक: Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

प्रकाशित 2026-08-25
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से मनुष्यों को देखकर सीखने के लिए संघर्ष कर रहे हैं। जबकि एक मशीन को किसी एकल कार्य के लिए सटीक निर्देशों के साथ प्रोग्राम किया जा सकता है, उसे मानव गति की तरल और अव्यवस्थित वास्तविकता को समझने के लिए सिखाना एक कठिन चुनौती रही है। वर्षों से, शोधकर्ताओं ने रोबोट को हजारों घंटों के वीडियो खिलाकर इस अंतर को पाटने की कोशिश की है, इस उम्मीद में कि मशीन केवल अवलोकन करके भौतिकी के नियमों और कार्य-कारण संबंध (cause-and-effect) को सीख लेगी। हालाँकि, एक मौलिक समस्या बनी हुई है: जब एक रोबोट एक मानव हाथ को कप उठाते हुए देखता है, तो वह स्क्रीन पर पिक्सेल बदलते हुए देखता है। वह स्वाभाविक रूप से यह नहीं जानता कि हाथ किसी लक्ष्य को प्राप्त करने के लिए एक विशिष्ट तरीके से हिल रहा है, और न ही वह यह जानता है कि उस दृश्य अवलोकन को अपने स्वयं के यांत्रिक शरीर को चलाने के लिए आवश्यक विशिष्ट मोटर कमांड में कैसे परिवर्तित किया जाए। दृश्य दुनिया विवरणों से समृद्ध है, लेकिन उस विवरण का बहुत सा हिस्सा—जैसे शर्ट का रंग या मेज की बनावट—स्वयं क्रिया के यांत्रिकी के लिए अप्रासंगिक है। रोबोट को प्रभावी ढंग से सिखाने के लिए, वैज्ञानिकों को दृश्य शोर (visual noise) को हटाने और शुद्ध, अंतर्निहित गति को निकालने का एक तरीका चाहिए, जिससे एक सार्वभौमिक भाषा बन सके जिसे मानव वीडियो और रोबोटिक यांत्रिकी दोनों समझ सकें।

शोधकर्ताओं की एक टीम ने LD4WAM नामक एक नई प्रणाली विकसित की है जो इस समस्या को हल करती है। यह प्रणाली जो एक रोबोट देखता है और जो वह करता है, उसके बीच समझ की एक मध्य परत बनाकर काम करती है। वीडियो के अगले फ्रेम की पिक्सेल दर पिक्सेल भविष्यवाणी करने के बजाय, जो अक्सर ऐसे मॉडल की ओर ले जाता है जो चित्र अनुमान लगाने में तो अच्छे होते हैं लेकिन चलने में खराब होते हैं, शोधकर्ताओं ने अपने सिस्टम को "मोशन-अलाइन्ड लेटेंट डायनेमिक्स" (motion-aligned latent dynamics) पर ध्यान केंद्रित करने के लिए प्रशिक्षित किया। सरल शब्दों में, सिस्टम वस्तुओं की उपस्थिति और वातावरण के विशिष्ट स्वरूप को अनदेखा करना सीखता है, और इसके बजाय एक क्षण से दूसरे क्षण के बीच गति में होने वाले आवश्यक परिवर्तनों पर ध्यान केंद्रित करता है। यह एक अनुवादक के रूप में कार्य करता है, जो किसी वस्तु की ओर हाथ बढ़ाने के जटिल दृश्य डेटा को उस गति के एक संक्षिप्त, अमूर्त प्रतिनिधित्व (abstract representation) में बदल देता है। इस प्रतिनिधित्व का उपयोग फिर रोबोट के अपने कार्यों को निर्देशित करने के लिए किया जाता है, जिससे वह मानव शरीर और रोबोटिक हाथ के बीच के अंतर से भ्रमित हुए बिना मानव वीडियो से सीख पाता है।

इस सिस्टम को बनाने के लिए, शोधकर्ताओं ने पहले डेटा का एक विशाल संग्रह एकत्र किया, जिसमें मनुष्यों और रोबोटों दोनों के 5,000 घंटों से अधिक के वीडियो शामिल थे। इस डेटासेट में सरल कार्यों जैसे वस्तुओं को छाँटने से लेकर नाजुक उपकरणों के जटिल हेरफेर तक विविध परिदृश्य शामिल थे। उन्होंने इस डेटा को कड़ाई से साफ किया, उन क्लिप्स को हटा दिया जहाँ कैमरा बहुत अधिक हिल रहा था या जहाँ हाथ दिखाई नहीं दे रहे थे, यह सुनिश्चित करते हुए कि सिस्टम केवल स्पष्ट और प्रासंगिक उदाहरणों से सीखे। उनके नवाचार का मूल तत्व यह है कि उन्होंने इस डेटा को कैसे संसाधित किया। उन्होंने एक मॉडल को वीडियो फ्रेम के एक अनुक्रम को देखने और स्थिति में होने वाले विशिष्ट "डेल्टा" या परिवर्तन की पहचान करने के लिए प्रशिक्षित किया, प्रभावी रूप से एक स्थिर छवि और एक चलती हुई छवि के बीच के अंतर को सीखना। इन सीखे गए परिवर्तनों को रोबोटों से रिकॉर्ड किए गए वास्तविक भौतिक आंदोलनों के साथ संरेखित करके, उन्होंने एक सेतु बनाया जो दृश्य दुनिया को भौतिक दुनिया से जोड़ता है। यह सेतु रोबोट को यह समझने में सक्षम बनाता है कि एक विशिष्ट दृश्य पैटर्न एक विशिष्ट यांत्रिक क्रिया के अनुरूप है, चाहे मूल वीडियो में मानव दिखाया गया हो या मशीन।

यह सिस्टम दो मुख्य चरणों में कार्य करता है। पहला, एक विशेष मॉडल इन गति पैटर्न को निकालने के लिए वीडियो का विश्लेषण करता है, जिससे पृष्ठभूमि के शोर या प्रकाश परिवर्तन जैसे अप्रासंगिक विवरण हट जाते हैं। दूसरा, एक बड़ा "वर्ल्ड एक्शन मॉडल" इन निकाले गए पैटर्न का उपयोग यह अनुमान लगाने के लिए करता है कि आगे क्या होगा और यह तय करने के लिए कि क्या क्रिया की जानी चाहिए। यह दूसरा मॉडल लचीला होने के लिए डिज़ाइन किया गया है; यह यह सुनिश्चित करने के लिए भविष्य के वीडियो का पूर्वानुमान उत्पन्न कर सकता है कि भौतिकी सही है, और साथ ही लक्ष्य प्राप्त करने के लिए आवश्यक सटीक गतिविधियों को निर्धारित करने के लिए निकाले गए गति पैटर्न का उपयोग कर सकता है। शोधकर्ताओं ने दो तरीकों से इस दृष्टिकोण का परीक्षण किया: 50 अलग-अलग कार्यों वाले एक अत्यधिक यथार्थवादी कंप्यूटर सिमुलेशन में, और वास्तविक भौतिक रोबोटों पर जो साधारण दो-फिंगर ग्रिपर और जटिल, मानव जैसे हाथों से लैस थे। सिमुलेशन में, सिस्टम ने 93.4 प्रतिशत की सफलता दर हासिल की, जो पिछले अत्याधुनिक तरीकों से बेहतर थी। जब इसे वास्तविक रोबोटों पर तैनात किया गया, तो इसने डेस्क व्यवस्थित करने या शर्ट मोड़ने जैसे लंबे, बहु-चरणीय कार्यों को संभालने की क्षमता प्रदर्शित की, और यहाँ तक कि रूबिक क्यूब जैसी वस्तुओं के हेरफेर के लिए दक्ष हाथों के साथ भी अच्छा प्रदर्शन किया।

सबसे महत्वपूर्ण निष्कर्षों में से एक उन स्थितियों में सिस्टम की सामान्यीकरण (generalization) करने की क्षमता थी जिन्हें उसने पहले कभी नहीं देखा था। जब उन वस्तुओं के साथ परीक्षण किया गया जिनका सामना प्रशिक्षण के दौरान नहीं हुआ था, या अलग-अलग पृष्ठभूमि और प्रकाश व्यवस्था वाले कमरों में, रोबोट ने उच्च स्तर का प्रदर्शन बनाए रखा। यह सुझाव देता है कि सिस्टम ने वास्तव में कार्यों के अंतर्निहित यांत्रिकी को सीखा है, न कि केवल विशिष्ट दृश्य दृश्यों को याद किया है। उदाहरण के लिए, एक मग को नई जगह पर ले जाने के लिए कहे जाने पर, रोबोट ऐसा कर सकता था भले ही मग का आकार अलग हो या मेज की बनावट अलग हो। शोधकर्ताओं ने पाया कि उनकी सफलता की कुंजी प्रशिक्षण का "मोशन-अलाइन्ड" स्वभाव था; वास्तविक भौतिक गति में सीखने को आधार बनाकर, सिस्टम ने उन दृश्य विवरणों के प्रति ओवर-फिटिंग के जाल से बचने में सफलता पाई जो कार्य के लिए महत्वपूर्ण नहीं हैं। परिणाम संकेत देते हैं कि यह दृष्टिकोण रोबोटों को मानव वीडियो डेटा के विशाल, अप्रयुक्त संसाधन से सीखने की अनुमति देता है, जिससे इसे रोबोटिक नियंत्रण के लिए एक व्यावहारिक मार्गदर्शक में बदल दिया जाता है।

अध्ययन ने यह भी रेखांकित किया कि क्या काम नहीं करता है। पिछले दृष्टिकोण जिन्होंने वास्तविक गति के साथ संरेखित किए बिना सीधे पिक्सेल परिवर्तनों से सीखने की कोशिश की, वे अक्सर कार्रवाई योग्य परिणाम देने में विफल रहे, जिससे रोबोट जो देख रहा था उसे यह करने में असमर्थ रहा कि उसे क्या करना चाहिए। इसी तरह, वे विधियाँ जो मानव शरीर के अंगों को सीधे रोबोट के जोड़ों से मिलाने पर बहुत अधिक निर्भर थीं, वे संघर्ष करती थीं जब रोबोट की शारीरिक संरचना भिन्न होती थी, जैसे कि हाथ के बजाय ग्रिपर होना। नया सिस्टम अभिनेता की विशिष्ट शारीरिक रचना के बजाय गति के अमूर्त गतिकी (abstract dynamics) पर ध्यान केंद्रित करके इन खामियों से बचता है। हालांकि सिस्टम ने तब कुछ सीमाएं दिखाईं जब पृष्ठभूमि की बनावट नाटकीय रूप से बदल गई, फिर भी इसने इन चुनौतीपूर्ण स्थितियों में अन्य मॉडलों से काफी बेहतर प्रदर्शन किया, जिससे सिद्ध हुआ कि मोशन-अलाइन्ड दृष्टिकोण रोबोट लर्निंग के लिए एक मजबूत आधार प्रदान करता है।

अंत में, यह कार्य अवलोकन से सीखने के तरीके में एक बदलाव का प्रतिनिधित्व करता है। एक ऐसा प्रतिनिधित्व बनाकर जो क्रिया करने वाले के विशिष्ट शरीर के प्रति तटस्थ (agnostic) है, शोधकर्ताओं ने दिखाया है कि एक रोबोट मानव वीडियो से सीख सकता है और उस ज्ञान को अपने अद्वितीय यांत्रिक रूप पर लागू कर सकता है। सिस्टम को मानव प्रदर्शनों से लाभ उठाने के लिए मानव जैसा शरीर रखने की आवश्यकता नहीं है; इसे केवल क्रिया के पीछे के इरादे और गति को समझने की आवश्यकता है। 270 मिलियन फ्रेम के विशाल डेटासेट और वास्तविक हार्डवेयर पर सफल परीक्षणों के साथ, शोधकर्ताओं ने प्रदर्शित किया है कि यह विधि केवल एक सैद्धांतिक संभावना नहीं है बल्कि अधिक सक्षम और अनुकूलन योग्य रोबोट बनाने के लिए एक व्यावहारिक उपकरण है। मानव डेटा के इतने बड़े हिस्से से सीखने की क्षमता रोबोट को हर नए काम के लिए महंगे, समय लेने वाले प्रदर्शनों की आवश्यकता के बिना विभिन्न प्रकार के कार्यों के लिए प्रशिक्षित करने के द्वार खोलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →