← नवीनतम पेपर
🤖 machine learning

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

यह शोध पत्र ARDY को प्रस्तुत करता है, जो एक स्ट्रीमिंग जनरेशन फ्रेमवर्क है जो ऑनलाइन टेक्स्ट प्रॉम्प्ट्स पर सटीक नियंत्रण और लचीले लॉन्ग-होरिज़न काइनेमैटिक कंस्ट्रेंट्स के साथ रियल-टाइम, हाई-फिडेलिटी 3D ह्यूमन मोशन जनरेशन प्राप्त करने के लिए एक हाइब्रिड रिप्रेजेंटेशन और टू-स्टेज ऑटोरेग्रेसिव ट्रांसफॉर्मर डिनोइज़र का उपयोग करता है।

मूल लेखक: Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आप चाहते हैं कि आपका पात्र कुछ शानदार करे, जैसे कि "तेजी से बाईं ओर एक घेरे में दौड़ना, फिर रुक जाना," या "चुपके से बगल की ओर चलना।" अतीत में, किसी पात्र को वास्तविक समय (real-time) में ऐसा करने के लिए बनाना वैसा ही था जैसे किसी को लगातार आपके कान में निर्देश बदलते रहने के दौरान एक उत्कृष्ट कृति (masterpiece) बनाने की कोशिश करना। या तो आपको पूरी चीज़ पहले से ही योजनाबद्ध करनी पड़ती थी (जो धीमा और उबाऊ था) या फिर आपको पात्र को सुधार (improvise) करने के लिए छोड़ देना पड़ता था (जिससे अक्सर वह अजीब दिखता था और आपके विशिष्ट निर्देशों की अनदेखी करता था)।

यहाँ ARDY आता है, एक नया डिजिटल कठपुतली मास्टर जो खेल बदल देता है। ARDY को एक सुपर-फास्ट, सुपर-स्मार्ट इम्प्रोवाइजेशन आर्टिस्ट के रूप में समझें जो आपकी आवाज़ के आदेशों को सुन सकता है और आपके द्वारा फर्श पर खींचे गए नक्शे का पालन भी कर सकता है, और वह भी पलक झपकने की गति से।

जादू का खेल: दो दिमाग, एक शरीर

ARDY का असली राज यह है कि वह मानव शरीर को कैसे देखता है। हर एक उंगली और पैर की गणना एक साथ करने के बजाय (जो एक अव्यवस्थित और भारी काम है), यह कार्य को दो अलग-अलग भागों में विभाजित करता है, जैसे एक निर्देशक और एक नर्तक।

  1. निर्देशक (द रूट): यह भाग "बड़ी तस्वीर" वाली गति को संभालता है—पात्र कहाँ जा रहा है, वह कितनी तेजी से चल रहा है, और उसका मुख किस दिशा में है। पेपर इसे "एक्सप्लिसिट रूट" (explicit root) कहता है। यह एक निर्देशक की तरह है जो चिल्ला रहा है, "बाएं जाओ! वहाँ रुक जाओ!"
  2. नर्तक (द बॉडी): यह भाग वास्तव में अंगों, शरीर के डोलने, हाथों के हिलने और पैरों के संचालन को संभालता है। पेपर इसे "लेटेंट बॉडी एम्बेडिंग" (latent body embedding) कहता है। यह एक नर्तक की तरह है जो निर्देशक को सुनकर मूड के अनुसार अपने शानदार कदम तय करता है।

इन दोनों को अलग करके, ARDY पात्र के बारे में बहुत सटीक हो सकता है (कि वह कहाँ जाएगा) बिना हर जोड़ (joint) की गणित में उलझे (कि वह कैसे हिलेगा)। यह इसे मात्र 33 मिलीसेकंड में उच्च गुणवत्ता वाली गति उत्पन्न करने की अनुमति देता है—यह आपकी पलक झपकने से भी तेज़ है!

"हाइब्रिड" सुपरपावर

पेपर का तर्क है कि पुराने तरीकों ने या तो सब कुछ एक साथ करने की कोशिश की या धीमी, चरण-दर-चरण अनुमान लगाने की प्रक्रिया पर भरोसा किया जो वास्तविक समय के गेम के लिए बहुत लंबी थी। ARDY इस विचार को खारिज करता है कि आपको "तेज़" और "नियंत्रणीय" में से किसी एक को चुनना होगा।

इसके बजाय, यह एक हाइब्रिड रिप्रजेंटेशन का उपयोग करता है। कल्पना कीजिए कि आप अपने किसी मित्र को निर्देश दे रहे हैं। आप यह नहीं कहते, "अपना बायां पैर 3 इंच हिलाओ, फिर अपना दायां पैर 2 इंच हिलाओ।" आप कहते हैं, "लाल कुर्सी तक चलो।" ARDY भी ऐसा ही करता है। यह "कहाँ जाना है" (रूट) को एक स्पष्ट, आसानी से पढ़े जाने वाले प्रारूप में रखता है, जबकि "कैसे हिलना है" (बॉडी) को एक छोटे, कुशल कोड में संकुचित कर देता है। यह कंप्यूटर को निर्देशों को तुरंत संसाधित करने की अनुमति देता है।

दो चरणों वाला नृत्य

यह सुनिश्चित करने के लिए कि निर्देशक और नर्तक एक-दूसरे से न टकरा जाएं, ARDY एक दो-चरणीय प्रक्रिया का उपयोग करता है।

  • चरण 1: यह पहले यह पता लगाता है कि जमीन पर पात्र के पैर बिल्कुल कहाँ होने चाहिए (रूट ट्रजेक्टरी)।
  • चरण 2: केवल इसके बाद कि पैर कहाँ जा रहे हैं, यह शरीर के बाकी आंदोलनों को समझता है।

लेखकों ने पाया कि यदि आप पैर और हाथों का अनुमान एक ही समय में लगाने की कोशिश करते हैं, तो परिणाम अक्सर लड़खड़ाता हुआ और अस्त-व्यस्त होता है। इस विशिष्ट क्रम में काम करने से, पात्र संतुलित रहता है और आपके निर्देशों का पूरी तरह से पालन करता है।

यह क्या कर सकता है (और क्या नहीं)

पेपर दिखाता है कि ARDY इसमें अविश्वसनीय रूप से अच्छा है:

  • आपकी बात सुनना: आप टाइप कर सकते हैं "एक व्यक्ति दरवाजा खोलता है और बाहर निकलता है," और यह हो जाता है।
  • रास्तों का पालन करना: आप अपने माउस से फर्श पर एक बिंदु पर क्लिक कर सकते हैं, और पात्र वहां तक जाएगा।
  • विशिष्ट मुद्राओं (poses) को प्राप्त करना: आप इसे कह सकते, "इस सटीक मुद्रा में स्थिर हो जाओ," और यह उस पर आ जाएगा।
  • दीर्घकालिक योजना बनाना: यह एक दूर के लक्ष्य (जैसे 10 सेकंड भविष्य का गंतव्य) को याद रख सकता है और वहां तक पहुँचने के लिए कदमों की योजना बना सकता है, जो पुराने "ऑनलाइन" तरीकों के लिए कठिन था।

हालाँकि, पेपर इस बारे में बहुत स्पष्ट है कि ARDY क्या नहीं है। यह विशुद्ध रूप से एक काइनेमैटिक (kinematic) मॉडल है। इसका मतलब है कि यह जोड़ों की स्थिति की गणना करता है, लेकिन यह गुरुत्वाकर्षण, मांसपेशियों की ताकत या संवेग (momentum) जैसे भौतिकी (physics) को वास्तव में नहीं समझता है।

  • "फुट स्केटिंग" की समस्या: क्योंकि यह भौतिकी का अनुकरण नहीं करता है, इसलिए कभी-कभी पात्र के पैर फर्श पर बर्फ पर फिसलने की तरह फिसल सकते हैं (जिसे "फुट स्केटिंग" कहा जाता है)। पेपर स्वीकार करता है कि ऐसा हो सकता है, खासकर यदि पात्र को स्थिर खड़ा होना चाहिए लेकिन गणित थोड़ा गड़बड़ा जाता है। उन्होंने इसे रोकने के लिए प्रशिक्षण के दौरान एक विशेष दंड (penalty) जोड़ा, लेकिन यह कोई पूर्ण भौतिकी इंजन नहीं है।
  • कोई "वास्तविक" वजन नहीं: इसे यह नहीं पता कि एक भारी वस्तु के कारण पात्र लड़खड़ा सकता है। यह बस इतना जानता है कि जोड़ों को कैसा दिखना चाहिए।

प्रमाण परिणाम में है

टीम ने वास्तविक मानव गतिविधियों (जिसे Bones Rigplay कहा जाता है, जिसमें लगभग 700 घंटे का डेटा है) और मानक HumanML3D बेंचमार्क पर ARDY का परीक्षण किया।

  • उन्होंने पाया कि ARDY निर्देशों का पालन करने और पथ पर बने रहने में अन्य शीर्ष विधियों से बेहतर है।
  • DiP नामक एक समान विधि के विरुद्ध एक आमने-सामने के परीक्षण में, मानव परीक्षकों ने गुणवत्ता के लिए 65.8% बार और टेक्स्ट विवरण का पालन करने के लिए 67.5% बार ARDY को पसंद किया।
  • जब बात किसी विशिष्ट लक्ष्य (जैसे जोड़ की स्थिति) को प्राप्त करने की आती है, तो ARDY बहुत सटीक था, जिसमें अन्य विधि के 9.20 सेमी के मुकाबले लगभग 2.48 सेमी की त्रुटि थी।

निचोड़

ARDY यह सुझाव देता है कि "कहाँ" को "कैसे" से अलग करके, और एक स्मार्ट दो-चरणीय अनुमान खेल का उपयोग करके, हम अंततः ऐसे वीडियो गेम पात्र प्राप्त कर सकते हैं जो तेज़ और आज्ञाकारी दोनों हों। यह एक पूर्ण भौतिकी सिम्युलेटर नहीं है (यह अभी भी बर्फ पर थोड़ा फिसल सकता है), लेकिन पात्रों को नचाने, दौड़ने और आपके आदेशों पर प्रतिक्रिया करने के लिए, यह एक बड़ी छलांग है। लेखक आश्वस्त हैं कि यह दृष्टिकोण काम करता है, लेकिन वे यह भी स्वीकार करते हैं कि भविष्य के संस्करणों को फिसलते हुए पैरों को रोकने के लिए वास्तविक भौतिकी सीखने की आवश्यकता हो सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →