OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation
OmniMotion-X एक अत्याधुनिक, बहुमुखी मल्टीमॉडल फ्रेमवर्क है जो एक ऑटोरेग्रेसिव डिफ्यूजन ट्रांसफॉर्मर और एक नवीन संदर्भ मोशन कंडीशनिंग रणनीति का लाभ उठाता है, जिसे सबसे बड़े एकीकृत मोशन डेटासेट (OmniMoCap-X) पर प्रशिक्षित किया गया है, ताकि टेक्स्ट-टू-मोशन, म्यूजिक-टू-डांस और स्पीच-टू-जेस्चर जैसे विविध कार्यों में यथार्थवादी, सुसंगत और नियंत्रणीय पूर्ण-शरीर मानव गतियां उत्पन्न की जा सकें।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को नृत्य करना सिखाने की कोशिश कर रहे हैं। आप उसे कह सकते हैं, "अपना बायां हाथ हिलाओ," या कोई गाना बजाकर कह सकते हैं, "इस ताल पर नाचो।" लेकिन क्या होगा अगर आप चाहते हैं कि रोबोट एक साथ सब कुछ करे? क्या होगा अगर आप चाहते हैं कि वह एक गाना सुने, एक बोले गए किस्से का पालन करे, फर्श पर बने एक विशिष्ट पथ पर प्रतिक्रिया दे, और फिर भी एक वास्तविक व्यक्ति की तरह स्वाभाविक रूप से चलता हुआ दिखाई दे? यह "मोशन जनरेशन" (गति उत्पादन) का 'होली ग्रेल' है, एक ऐसा क्षेत्र जहाँ कंप्यूटर वैज्ञानिक मशीनों को शून्य से मानव गति बनाना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, ये रोबोट अनाड़ी नौसिखियों जैसे थे: वे संगीत पर नाच सकते थे, या किसी टेक्स्ट प्रॉम्प्ट (पाठ निर्देश) पर अभिनय कर सकते थे, लेकिन वे इन कौशलों को मिला नहीं सकते थे। उन्हें अक्सर अव्यवढ़ डेटा पर प्रशिक्षित किया जाता था, जैसे कि किसी वास्तविक तैराक के स्पष्ट वीडियो देखने के बजाय, पूल में पानी उछालते लोगों के धुंधले वीडियो देखकर तैरना सीखने की कोशिश करना। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम एक एकल "मस्तिष्क" बना सकते हैं जो एक साथ इन सभी विभिन्न निर्देशों को समझ सके, उच्च गुणवत्ता वाले डेटा से सीख सके, और बिना अपने पैरों में उलझे सुचारू, यथार्थवादी और लंबे समय तक चलने वाली मानव गति बना सके?
यहाँ OmniMotion-X आता है, जो एक डिजिटल ऑर्केस्ट्रा के कंडक्टर की तरह एक सुपर-पावर्ड कंडक्टर के रूप में कार्य करता है। पिछले मोशन-जनरेटिंग AI मॉडल्स को ऐसे एकल कलाकारों (सोलोइस्ट) के रूप में सोचें जो केवल एक ही वाद्य यंत्र को पूरी तरह से बजा सकते थे। यदि आपको वायलिन सोलो चाहिए था, तो आप एक मॉडल को बुलाते थे; ड्रम सोलो के लिए, आप दूसरे को बुलाते थे। वे एक साथ मिलकर नहीं बजा सकते थे। हालाँकि, OmniMotion-X एक एकीकृत "सीक्वेंस-टू-सीक्वेंस" मॉडल है। कल्पना कीजिए कि यह एक मास्टर स्टोरीटेलर (कथावाचक) है जो न केवल एक स्क्रिप्ट (टेक्स्ट) पढ़ता है या एक ताल (संगीत) सुनता है, बल्कि पिछले दृश्य (रेफरेंस मोशन) को भी देख सकता है और कह सकता है, "ठीक है, वे अभी कैसे हिले, उसके आधार पर, उन्हें आगे ठीक इस तरह से हिलना चाहिए।" यह एक चतुर तकनीक का उपयोग करता है जिसे "डिफ्यूजन ट्रांसफॉर्मर" कहा जाता है, जो एक मूर्तिकार की तरह है जो शोर (नॉइज़) से भरे मिट्टी के ब्लॉक से शुरू करता है और धीरे-धीरे उस शोर को तराश कर निकालता है जब तक कि एक पूर्ण, तरल नृत्य उभर न आए।
यहाँ असली जादू यह है कि शोधकर्ताओं ने मॉडल को कैसे सिखाया। इसके बजाय कि वे रोबोट पर एक ही समय में हर संभव निर्देश डाल दें—जो कि एक कुत्ते को एक ही सेकंड में बैठना, रुकना, लाना और लुढ़कना सिखाने की कोशिश करने जैसा होगा—उन्होंने एक "वीक-टू-स्ट्रॉन्ग" (कमजोर-से-मजबूत) प्रशिक्षण रणनीति का उपयोग किया। पहले, उन्होंने मॉडल को सरल अवधारणाएं सिखाईं, जैसे "इस कहानी के आधार पर अपने शरीर को हिलाओ।" एक बार जब रोबोट बुनियादी बातें सीख गया, तो उन्होंने धीरे-धीरे कठिन बाधाएं जोड़ीं, जैसे "अब इस विशिष्ट लय (रिदम) से मेल खाओ" या "अब इस सटीक पथ का अनुसरण करो।" इस चरण-दर-चरण दृष्टिकोण ने रोबote को भ्रमित या अभिभूत होने से बचाया।
लेकिन एक स्मार्ट मस्तिष्क को अच्छे डेटा की आवश्यकता होती है, और यहीं इस पेपर का दूसरा हिस्सा चमकता है। टीम ने महसूस किया कि अधिकांश मौजूदा मोशन डेटासेट्स पहेली के अलग-अलग बक्सों से निकले हुए टुकड़ों के ढेर की तरह थे: कुछ निम्न-गुणवत्ता वाले अनुमान थे, कुछ में असंगत विवरण थे, और उनमें से कोई भी आपस में फिट नहीं बैठता था। इसे ठीक करने के लिए, उन्होंने OmniMoCap-X बनाया, जो अब तक का सबसे बड़ा एकीकृत मोशन डेटासेट है। उन्होंने 28 अलग-अलग उच्च-गुणवत्ता वाले मोशन कैप्चर स्रोत एकत्र किए—इसे ऐसे समझें कि 28 अलग-अलग पेशेवर डांस ग्रुप और अभिनेता जिन्हें हाई-टेक सूट के साथ रिकॉर्ड किया गया था—और उन सभी को एक विशाल, पूरी तरह से व्यवस्थित लाइब्रेरी में मिला दिया। उन्होंने सब कुछ मानकीकृत (स्टैंडर्डाइज) किया ताकि रोबोट हर हरकत के लिए एक ही "भाषा" (जिसे SMPL-X कहा जाता है) बोल सके। उन्होंने यहाँ तक कि इन गतिविधियों के वीडियो देखने और उनके बारे में विस्तृत, संरचित कहानियाँ लिखने के लिए उन्नत AI का उपयोग किया, जिससे यह सुनिश्चित हुआ कि रोबोट न केवल यह समझे कि एक व्यक्ति हिला, बल्कि यह भी कि उसने क्यों और कैसे गति की।
परिणाम प्रभावशाली हैं। टेक्स्ट को डांस में बदलने, स्पीच को जेस्चर (हाव-भाव) में बदलने, या यह अनुमान लगाने जैसे कार्यों पर परीक्षण करने पर, OmniMotion-X ने सभी पिछले तरीकों को पछाड़ दिया। इसने केवल बेतरतीब ढंग से हाथ-पैर नहीं हिलाए; इसने सुसंगत, यथार्थवादी गति बनाई और लंबे समय तक बिना बिगड़े चल सकती थी। उदाहरण के लिए, यदि आपने इसे एक गाने के आधार पर नृत्य उत्पन्न करने के लिए कहा, तो इसने केवल बेतरतीब ढंग से हलचल नहीं की; इसने अपनी चाल को ताल (बीट) के साथ सिंक किया। यदि आपने इसे एक "रेफरेंस मोशन" (जैसे चलते हुए व्यक्ति का क्लिप) दिया, तो यह उस चाल को सहजता से जारी रख सकता था या नए निर्देशों के आधार पर उसे बदल सकता था, जिससे शैली और प्रवाह बरकरार रहे।
हालाँकि, निर्माता इस बारे में ईमानदार हैं कि उनका रोबोट अभी क्या नहीं कर सकता। जबकि यह एक अकेले व्यक्ति के चलने-फिरने के लिए बेहतरीन है, यह तब संघर्ष करता है जब उस व्यक्ति को जटिल वस्तुओं या अन्य लोगों के साथ यथार्थवादी तरीके से बातचीत करनी होती है (जैसे कप उठाने के लिए उसे बिना गिराए, या किसी मित्र को हाई-फाइव देने के लिए)। यह थोड़ा धीमा भी है, एक सिंगल सैंपल जेनरेट करने में लगभग 2.14 सेकंड का समय लेता है, जो कि कुछ सरल मॉडल्स की तुलना में धीमा है। लेकिन यह पेपर साबित करता है कि विभिन्न प्रकार के डेटा को एकीकृत करके और मॉडल को एक स्मार्ट, चरण-दर-चरण तरीके से सिखाकर, हम डिजिटल मनुष्यों को बनाने के बहुत करीब पहुँच सकते हैं जो वास्तविक चीज़ों की तरह गरिमा और जटिलता के साथ चलते हैं। यह अभी तक कोई हल हो चुकी समस्या नहीं है, लेकिन यह मशीनों को हमारे साथ नाचने, संकेत करने और चलने के तरीके सिखाने की दिशा में एक बड़ी छलांग है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।