← नवीनतम पेपर
💻 computer science

Next-Scale Autoregressive Models for Text-to-Motion Generation

यह शोध पत्र MoScale को प्रस्तुत करता है, जो एक नेक्स्ट-स्केल ऑटोरेग्रेसिव फ्रेमवर्क है जो क्रॉस-स्केल और इन-स्केल रिफाइनमेंट मैकेनिज्म के साथ मोटे से सूक्ष्म रिज़ॉल्यूशन (coarse to fine resolutions) तक पदानुक्रमित रूप से टेक्स्ट-टू-मोशन जेनरेट करता है, जो स्टेट-ऑफ-द-आर्ट प्रदर्शन, उच्च प्रशिक्षण दक्षता और मजबूत ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त करता है।

मूल लेखक: Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लिखित विवरण के आधार पर एक रोबोट को नृत्य करना सिखाने की कोशिश कर रहे हैं। यदि आप रोबोट को कहते हैं, "दो जंपिंग जैक करें, फिर मुड़ें, कुछ उठाएं, और वापस मुड़ें," तो एक मानक AI व्यक्तिगत चरणों को सही कर सकता है लेकिन क्रम में गड़बड़ी कर सकता है या गिनती भूल सकता है। वह तीन जंपिंग जैक कर सकता है, या अंत में मुड़ना भूल सकता है।

यह शोध पत्र MoScale नामक एक नया AI मॉडल पेश करता है जो इस समस्या को हल करता है। यह कैसे काम करता है, सरल उपमाओं के माध्यम से यहाँ समझाया गया है:

समस्या: "एक-समय-में-एक-चरण" का जाल

मोशन जनरेशन (गति निर्माण) के लिए अधिकांश वर्तमान AI मॉडल एक व्यक्ति की तरह काम करते हैं जो एक बार में एक शब्द पढ़ता है। वे केवल उस एक गति के आधार पर अगले मूवमेंट की भविष्यवाणी करते हैं जो ठीक उससे पहले आई थी।

  • उपमा: कल्पना कीजिए कि आप केवल उस छोटे से ब्रशस्ट्रोक को देखते हुए एक विशाल परिदृश्य (लैंडस्केप) बनाने की कोशिश कर रहे हैं जिसे आपने अभी बनाया है। आप उस एक बिंदु के रंगों को सही कर सकते हैं, लेकिन आप बड़ी तस्वीर खो देंगे। आप भूल सकते हैं कि पहाड़ बाईं ओर होना चाहिए या नदी को एक विशिष्ट दिशा में बहना चाहिए।
  • परिणाम: रोबोट की गतिविधियाँ स्थानीय रूप से सहज दिखती हैं (घुटना सही ढंग से मुड़ता है), लेकिन पूरी कहानी गलत होती है (वह आपके द्वारा मांगे गए दो जंपिंग जैक नहीं करता है)।

समाधान: "आर्किटेक्ट से इंटीरियर डिजाइनर" वाला दृष्टिकोण

MoScale रणनीति बदल देता है। एक समय में एक छोटा मूवमेंट अनुमान लगाने के बजाय, यह मोशन को परतों (layers) में बनाता है, कोर्स (बड़ी तस्वीर) से फाइन (बारीक विवरण) की ओर।

  1. कोर्स स्केल (आर्किटेक्ट): पहले, मॉडल एक आर्किटेक्ट की तरह ब्लूप्रिंट स्केच करने का काम करता है। यह कम रिज़ॉल्यूशन पर पूरे नृत्य की पूरी संरचना तय करता है। यह कहता है, "ठीक है, पूरा क्रम है: कूदना, कूदना, मुड़ना, उठाना, मुड़ना।" यह उंगलियों के हिलने की चिंता करने से पहले ही वैश्विक कहानी को लॉक कर देता है।
  2. फाइन स्केल्स (इंटीरियर डिजाइनर): एक बार ब्लूप्रिंट सेट हो जाने के बाद, मॉडल ज़ूम इन करता है। यह उस रफ स्केच को लेता है और उसमें विवरण जोड़ता है, जैसे कि कूद कितनी ऊँची है या मोड़ कितनी तेज़ है। यह मोशन को स्टेप-दर-स्टेप रिफाइन करता है, लेकिन यह मुख्य कहानी को कभी नहीं बदलता जो आर्किटेक्ट ने पहले ही तय कर दी थी।

गुप्त नुस्खा: दो "रिफाइनमेंट" ट्रिक्स

लेखकों ने इस प्रक्रिया को और भी बेहतर बनाने के लिए दो विशेष विशेषताएं जोड़ी हैं, खासकर इसलिए क्योंकि प्रशिक्षण के लिए नृत्य का बहुत अधिक डेटा उपलब्ध नहीं है।

1. "गलतियों के साथ अभ्यास" वाली ट्रिक (क्रॉस-स्केल हाइरार्किल रिफाइनमेंट)

  • समस्या: यदि आप केवल पूर्ण निर्देशों के साथ ही अभ्यास करते हैं, तो गलती होने पर आप घबरा जाते हैं।
  • उपमा: कल्पना कीजिए कि एक छात्र ड्राइविंग सीख रहा है। यदि प्रशिक्षक उसे केवल आदर्श, खाली सड़कों पर चलाने देता है, तो वह गड्ढा आते ही दुर्घटनाग्रस्त हो जाएगा।
  • MoScale का समाधान: प्रशिक्षण के दौरान, मॉडल को जानबूझकर "भ्रष्ट" या अपूर्ण ब्लूप्रिंट दिए जाते हैं। इसे "आर्किटेक्ट" द्वारा की गई गलतियों को ठीक करना सीखना होता है और फिर भी एक अच्छा डांस बनाना होता है। यह मॉडल को मजबूत और त्रुटियों से उबरने के लिए प्रशिक्षित करता है, जिससे यह सुनिश्चित होता है कि अंतिम मोशन टेक्स्ट के प्रति सच्चा रहे, भले ही शुरुआती चरण थोड़े गलत क्यों न हों।

2. "दूसरी नज़र" वाली ट्रिक (इन-स्केल टेम्पोरल रिफाइनमेंट)

  • समस्या: बड़ी तस्वीर तय करने के बाद भी, मॉडल एक विशिष्ट विवरण गलत कर सकता है, जैसे हाथ का गलत दिशा में झटका लेना।
  • उपमा: कल्पना कीजिए कि आप एक निबंध लिख रहे हैं। आप एक ड्राफ्ट लिखते हैं, फिर आप वापस जाकर उसे पढ़ते हैं। आप एक टाइपो या एक अटपटी पंक्ति देखते हैं और उसे ठीक करते हैं।
  • MoScale का समाधान: एक विशिष्ट परत के लिए भविष्यवाणी करने के बाद, मॉडल जो उसने अभी लिखा है उस पर "वापस नज़र" डाल सकता है। यह उन हिस्सों की पहचान करता है जिनके बारे में वह अनिश्चित है और उन्हें फिर से प्रेडिक्ट करता है। यह एक दूसरे ड्राफ्ट की तरह है जो मोशन को अधिक सहज और यथार्थवादी बनाने के लिए उसे पॉलिश करता है, बिना समग्र कहानी को बिगाड़े।

यह क्यों महत्वपूर्ण है

शोध पत्र का दावा है कि MoScale "नेक्स्ट-टोकन" मॉडल्स की गति और लंबी, जटिल कहानियों को समझने की क्षमता को सफलतापूर्वक संयोजित करने वाला पहला मॉडल है।

  • बेहतर कहानी सुनाना: यह पिछले मॉडलों की तुलना में "दो जंपिंग जैक" या "मुड़ें, उठाएं, मुड़ें" जैसे निर्देशों का बहुत बेहतर पालन करता है।
  • दक्षता: यह लोकप्रिय "डिफ्यूजन" मॉडल्स (जो शोर के एक ब्लॉक को धीरे-धीरे शोर मिटाकर एक चित्र में बदलने की तरह हैं) की तुलना में तेज़ी से प्रशिक्षित होता है।
  • बहुमुखी प्रतिभा: क्योंकि यह संरचना को इतनी अच्छी तरह समझता है, यह मौजूदा डांस को एडिट भी कर सकता है (जैसे कि चलने को दौड़ने में बदलना) बिना उन हिस्सों को बिगाड़े जिन्हें आप नहीं बदलना चाहते थे।

संक्षेप में, MoScale AI को विवरणों में खो जाने से रोकता है और उसे पहले पूरे डांस की योजना बनाने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि रोबोट वास्तव में वही करे जो आपने उससे कहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →