← नवीनतम पेपर
💻 computer science

Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

यह शोध पत्र "Superman" को प्रस्तुत करता है, जो एक विजन-गाइडेड मोशन टोकेनाइज़र (Vision-Guided Motion Tokenizer) और एक एकल MLLM आर्किटेक्चर के माध्यम से दृश्य धारणा (visual perception) और टेम्पोरल स्केलेटन-आधारित गति उत्पादन (temporal skeleton-based motion generation) को जोड़ने वाला एक एकीकृत ढांचा है, जो विविध मानव गति विश्लेषण कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रोबोट है जो दो चीजों में अविश्वसनीय रूप से कुशल है, लेकिन वह एक ही समय में दोनों काम नहीं कर सकता।

  • रोबोट A (पर्यवेक्षक - The Observer): यह किसी व्यक्ति के नाचने का वीडियो देख सकता है और विस्तार से बता सकता है कि वह क्या कर रहा है। लेकिन यदि आप इसे एक नया डांस बनाने के लिए कहें, तो यह जम जाता है। यह एक फिल्म समीक्षक की तरह है जो एक बेहतरीन समीक्षा तो लिख सकता है लेकिन अभिनय नहीं कर सकता।
  • रोबोट B (निर्माता - The Creator): यह "एक व्यक्ति कूद रहा है" जैसे टेक्स्ट विवरण को लेकर एक सटीक 3D एनिमेशन बना सकता है। लेकिन यदि आप इसे एक वास्तविक व्यक्ति का वीडियो दिखाएं, तो यह समझ नहीं पाता कि वह क्या देख रहा है। यह एक निर्देशक की तरह है जो स्क्रिप्ट तो लिख सकता है लेकिन फिल्म देख नहीं सकता।

वर्षों तक, कंप्यूटर विज़न की दुनिया इन दो अलग-अलग रोबोटों के साथ अटकी रही। यह नया पेपर "सुपरमैन" (Superman) पेश करता है, जो एक एकल, एकीकृत प्रणाली है जो एक साथ 'पर्यवेक्षक' और 'निर्माता' दोनों के रूप में कार्य करती है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: एक टूटी हुई भाषा

वर्तमान में, कंप्यूटर गति (motion) के लिए दो अलग-अलग भाषाएँ "बोलते" हैं:

  • दृश्य भाषा (Visual Language): जो कैमरा देखता है (पिक्सेल, रंग, आकार)।
  • कंकाल भाषा (Skeleton Language): जोड़ों (कूल्हे, कोहनी, घुटने) के गणितीय निर्देशांक (coordinates)।

मौजूदा मॉडल आमतौर पर केवल एक ही भाषा बोलते हैं। यदि कोई मॉडल वीडियो से सीखता है, तो वह कंकाल के गणित को भूल जाता है। यदि वह कंकाल के गणित से सीखता है, तो वह दृश्य वास्तविकता को भूल जाता है। यह एक "विच्छेद" (disconnect) पैदा करता है।

2. समाधान: "द्विभाषी शब्दकोश" (Vision-Guided Motion Tokenizer)

इसे ठीक करने के लिए, लेखकों ने एक विशेष अनुवादक बनाया जिसे विज़न-गाइडेड मोशन टोकनाइज़र (Vision-Guided Motion Tokenizer) कहा जाता है।

इसे एक द्विभाषी शब्दकोश के रूप में सोचें जहाँ प्रत्येक शब्द के दो अर्थ एक साथ होते हैं:

  • परिभाषा A: एक वीडियो में वह गति कैसी दिखती है (दृश्य स्वरूप)।
  • परिभाषा B: गणितीय रूप से वह गति क्या है (3D कंकाल का आकार)।

केवल संख्याओं के आधार पर "पोज़" की सूची सीखने के बजाय, सुपरमैन "मोशन टोकन" की एक सूची सीखता है जो वीडियो फुटेज और कंकाल की ज्यामिति (geometry) दोनों पर आधारित होती है। यह एक "सार्वभौमिक मोशन शब्दावली" बनाता है जो समझता है कि एक "कूदना" (jump) देखने में एक निश्चित तरीके का होता है और गणितीय रूप से भी एक निश्चित तरीके का महसूस होता है।

3. मस्तिष्क: एक ही मॉडल जो सब पर राज करे

एक बार जब यह शब्दकोश बन जाता है, तो वे इसे एक विशाल AI मस्तिष्क (एक मल्टी-मोडल लार्ज लैंग्वेज मॉडल, या MLLM) में प्लग करते हैं। क्योंकि यह मस्तिष्क इस नई "द्विभाषी" भाषा को बोलता है, इसलिए यह एक ही इंजन का उपयोग करके तीन बहुत अलग कार्यों को संभाल सकता है:

  • कार्य 1: जासूस (Pose Estimation)

    • इनपुट: एक व्यक्ति का वीडियो।
    • क्रिया: मॉडल वीडियो को देखता है और उसे कंकाल के टोकन के एक अनुक्रम (sequence) में अनुवादित करता है।
    • परिणाम: यह फ्रेम-दर-फ्रेम सटीक 3D कंकाल की गति आउटपुट करता है।
  • कार्य 2: भविष्यवक्ता (Motion Prediction)

    • इनपुट: कंकाल की गति के पहले कुछ सेकंड।
    • क्रिया: मॉडल पैटर्न को देखता है और अनुक्रम में अगले टोकन की भविष्यवाणी करता है।
    • परिणाम: यह होने से पहले ही भविष्य की गति को उत्पन्न करता है।
  • कार्य 3: सेतु निर्माता (Motion In-betweening)

    • इनपुट: एक शुरुआती पोज़ और एक अंतिम पोज़ (जैसे, "खड़े होना" और "बैठना")।
    • क्रिया: मॉडल बीच के छूटे हुए चरणों को भर देता है।
    • परिणाम: यह व्यक्ति के बैठने की सुचारू एनिमेशन उत्पन्न करता है।

4. यह बेहतर क्यों है (परिणाम)

पेपर ने सुपरमैन का परीक्षण सर्वश्रेष्ठ मौजूदा "पर्यवेक्षक" मॉडलों और सर्वश्रेष्ठ "निर्माता" मॉडलों के विरुद्ध किया।

  • यह विशेषज्ञों से बेहतर है: भले ही यह एक ही मॉडल है जो तीन काम कर रहा है, फिर भी इसने उन मॉडलों से बेहतर प्रदर्शन किया जो केवल एक काम करने के लिए बनाए गए थे।
  • यह एक बेहतरीन अनुमान लगाने वाला है: जब उन्होंने इसे एक डेटासेट (Human3.6M) पर प्रशिक्षित किया और एक पूरी तरह से अलग, अनदेखे डेटासेट (3DPW) पर इसका परीक्षण किया, तो इसने बहुत अच्छी तरह से सामान्यीकरण (generalize) किया। इसने केवल प्रशिक्षण डेटा को रटा नहीं; इसने मानव गति के "नियमों" को सीखा।
  • यह कुशल है: उन्होंने एक छोटा सा "सहायक मॉड्यूल" (जिसे MAFT कहा जाता है) जोड़ा है जो मस्तिष्क को वीडियो और कंकाल डेटा को और भी बेहतर तरीके से जोड़ने में मदद करता है, लेकिन यह अतिरिक्त कंप्यूटिंग पावर का केवल एक बहुत छोटा हिस्सा ही जोड़ता है।

निष्कर्ष

सुपरमैन मानव गति को "देखने" और "बनाने" को एकीकृत करने वाली पहली प्रणाली है। एक ऐसा शब्दकोश बनाकर जो यह जोड़ता है कि कोई गति कैसी दिखती है और वह क्या है, यह एक एकल AI को वीडियो देखने, भविष्य की भविष्यवाणी करने और बीच के अंतराल को भरने की अनुमति देता है, और वह भी अत्याधुनिक सटीकता के साथ। यह गति विश्लेषण की खंडित दुनिया को एक एकल, सुसंगत भाषा में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →