The Quest for Generalizable Motion Generation: Data, Model, and Evaluation
यह शोध पत्र एक व्यापक ढांचे के माध्यम से वीडियो जनरेशन से ज्ञान स्थानांतरित करके 3D मानव गति उत्पादन में सामान्यीकरण की बाधा को संबोधित करता है, जिसमें एक बड़े पैमाने के हाइब्रिड डेटासेट (ViMoGen-228K), एक एकीकृत फ्लो-मैचिंग डिफ्यूजन ट्रांसफार्मर (ViMoGen), और एक पदानुक्रमित मूल्यांकन बेंचमार्क (MBench) का उपयोग किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को डांस करना सिखाने की कोशिश कर रहे हैं।
लंबे समय तक, इस रोबोट को सिखाने का एकमात्र तरीका इसे एक स्टूडियो में पेशेवर डांसरों को दिखाना था, जो अपने जोड़ों पर चमकते हुए डॉट्स वाले विशेष सूट पहने हुए थे। यह डेटा एकदम सटीक और उत्तम है, लेकिन यह उबाऊ है। रोबोट केवल साधारण चीजें करना सीखता है जैसे "आगे बढ़ना," "नमस्ते करना," या "कूदना।" यदि आप उससे कहें कि "एक समुद्री डाकू की तरह लड़ो जो क्रैकेन से युद्ध कर रहा है" या "सैंडविच खाते हुए बैकफ्लिप करो," तो रोबोट जम जाता है। उसने कभी ये मूव्स नहीं देखे हैं, इसलिए वह उन्हें करना नहीं जानता।
यही वह समस्या है जिसे पेपर "The Quest for Generalizable Motion Generation" हल करने की कोशिश करता है। लेखकों ने महसूस किया कि जबकि मोशन डेटा दुर्लभ है, वीडियो डेटा हर जगह मौजूद है। लोग इंटरनेट पर हर दिन करोड़ों वीडियो पोस्ट करते हैं जिनमें लोग अजीब, जटिल और अनोखी चीजें कर रहे होते हैं।
यहाँ उनका समाधान है, जिसे तीन सरल भागों में बांटा गया है:
1. लाइब्रेरी (डेटा: ViMoGen-228K)
पुराने रोबोट ट्रेनिंग डेटा को एक छोटी, धूल भरी लाइब्रेरी के रूप में सोचें जिसमें बुनियादी चलने के बारे में केवल 10,000 किताबें हैं। लेखकों ने एक विशाल नई लाइब्रेरी बनाई जिसमें 228,000 "किताबें" (मोशन सीक्वेंस) हैं।
उन्होंने केवल कॉपी-पेस्ट नहीं किया; उन्होंने तीन प्रकार के स्रोतों का मिश्रण किया:
- द गोल्ड स्टैंडर्ड (The Gold Standard): उच्च गुणवत्ता वाली स्टूडियो रिकॉर्डिंग (वही "धूल भरी लाइब्रेरी" वाला हिस्सा) ताकि यह सुनिश्चित हो सके कि रोबोट गिरे नहीं या अपने पैर न तोड़ ले।
- द वाइल्ड इंटरनेट (The Wild Internet): उन्होंने इंटरनेट से लाखों वीडियो लिए (लोग स्केटबोर्डिंग कर रहे हैं, शादियों में नाच रहे हैं, साइकिल से गिर रहे हैं) और AI का उपयोग करके उनसे 3D मूवमेंट निकाले। यह ऐसा है जैसे रोबोट को TikTok और YouTube देखकर सिखाना।
- द इमेजिनेशन इंजन (The Imagination Engine): उन्होंने उन चीजों के नकली वीडियो बनाने के लिए एक सुपर-स्मार्ट वीडियो जनरेटर का उपयोग किया जिन्हें फिल्माना कठिन है (जैसे एक योद्धा जो ड्रैगन के साथ मुकाबला कर रहा हो)। फिर उन्होंने इन नकली वीडियो को 3D मोशन डेटा में बदल दिया।
परिणाम: रोबोट के पास अब एक ऐसी लाइब्रेरी है जो "फ्रिज तक चलने" से लेकर "तूफान में मार्शल आर्ट्स रूटीन करने" तक सब कुछ कवर करती है।
2. दिमाग (मॉडल: ViMoGen)
रोबोट को एक ऐसे दिमाग की आवश्यकता है जो इस सभी नए डेटा का उपयोग बिना भ्रमित हुए कर सके। लेखकों ने ViMoGen नामक एक विशेष दिमाग बनाया।
कल्पना कीजिए कि इस दिमाग में दो अलग-अलग शिक्षक मिलकर काम कर रहे हैं:
- शिक्षक A (द प्रिसिजन कोच): यह शिक्षक केवल स्टूडियो डेटा को जानता है। वे यह सुनिश्चित करने में माहिर हैं कि आपके पैर फर्श पर न फिसलें और आपके जोड़ सही ढंग से चलें। वे सख्त हैं लेकिन सुरक्षित हैं।
- शिक्षक B (द क्रिएटिव डायरेक्टर): इस शिक्षक ने इंटरनेट पर मौजूद हर वीडियो देखा है। वे "समुद्री डाकू का डांस" और "ज़ोंबी वॉक" करना जानते हैं, लेकिन कभी-कभी उनके निर्देश थोड़े डगमगाते या गलत हो सकते हैं।
जादुई ट्रिक: दिमाग में एक स्मार्ट स्विच (जिसे "Adaptive Gating" कहा जाता है) है।
- यदि आप किसी साधारण मूव जैसे "चलना" के लिए कहते हैं, तो दिमाग शिक्षक A की बात सुनता है ताकि यह एकदम सटीक रहे।
- यदि आप किसी अजीब मूव जैसे "जगलिंग करते हुए बैकफ्लिप करना" के लिए कहते हैं, तो दिमाग मूव का विचार लेने के लिए शिक्षक B पर स्विच हो जाता है, और फिर विवरणों को ठीक करने के लिए शिक्षक A से मदद मांगता है ताकि रोबोट टूटे नहीं।
उन्होंने एक लाइटवेट वर्जन (ViMoGen-light) भी बनाया जिसने शिक्षक B के पाठों को याद कर लिया ताकि उसे अब वास्तविक समय में वीडियो देखने की आवश्यकता न पड़े। यह एक ऐसे छात्र की तरह है जिसने कड़ी मेहनत से पढ़ाई की है और अब बिना किसी ट्यूटर के प्रदर्शन कर सकता है।
3. रिपोर्ट कार्ड (मूल्यांकन: MBench)
अतीत में, शिक्षक इन रोबोटों को एक एकल संख्या के साथ ग्रेड देते थे। यदि रोबोट औसतन "ठीक" दिखता था, तो उसे 'A' मिल जाता था। लेकिन यह आपको यह नहीं बताता था कि क्या रोबलेट वास्तव में नई चीजें कर सकता है।
लेखकों ने एक नया, सुपर-विस्तृत रिपोर्ट कार्ड बनाया जिसे MBench कहा जाता है। एक ग्रेड के बजाय, वे रोबोट को नौ अलग-अलग श्रेणियों में स्कोर देते हैं, जैसे:
- क्या इसने निर्देशों का पालन किया? (यदि आपने "कूदने" को कहा, तो क्या इसने कूदा?)
- क्या यह शारीरिक रूप से संभव है? (क्या रोबोट का पैर उसके अपने सिर के अंदर से गुजरा?)
- क्या यह रचनात्मक है? (क्या यह वे चीजें कर सकता है जो इसे स्पष्ट रूप से नहीं सिखाई गई थीं?)
उन्होंने यह सुनिश्चित करने के लिए मानव न्यायाधीशों का भी उपयोग किया कि कंप्यूटर द्वारा दी गई ग्रेडिंग इंसानों की सोच से मेल खाती है या नहीं।
बड़ी तस्वीर
इस पेपर से पहले, AI मोशन जनरेशन एक ऐसे रोबोट की तरह था जो केवल शब्दकोश पढ़ सकता था। वह शब्दों को जानता था, लेकिन कविता नहीं लिख सकता था।
यह पेपर रोबोट को पूरी दुनिया को पढ़ना सिखाता है। स्टूडियो डेटा की सटीकता को इंटरनेट वीडियो की रचनात्मकता के साथ जोड़कर, उन्होंने एक ऐसी प्रणाली बनाई है जो मानव गति (human motion) उत्पन्न कर सकती है जो न केवल शारीरिक रूप से यथार्थवादी है बल्कि जटिल, अजीब और नई निर्देशों को भी समझती है।
संक्षेप में: उन्होंने रोबोट को दुनिया के सर्वश्रेष्ठ डांसरों और इंटरनेट के सबसे जंगली वीडियो दिखाकर डांस करना सिखाया, फिर उन्हें एक स्मार्ट दिमाग दिया ताकि वे दोनों को मिला सकें ताकि वह आपकी हर बात मान सके, चाहे वह "पेंगुइन की तरह चलना" हो या "ड्रैगन से लड़ना"।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।