Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers
यह शोध पत्र InPose प्रस्तुत करता है, जो एक ज़ीरो-शॉट मानव मुद्रा अनुमान (human pose estimation) विधि है जो इस कार्य को एक व्युत्क्रम समस्या (inverse problem) के रूप में तैयार करती है, जिसमें रोटेशनल माप (rotational measurements) पर आधारित एक प्री-ट्रेंड डिफ्यूजन मॉडल का उपयोग किया गया है और विभिन्न शरीर के आकार वाले उपयोगकर्ताओं में मजबूत सामान्यीकरण प्राप्त करने के लिए स्पार्स लोकेशन डेटा से प्राप्त लाइक्लीहुड टर्म (likelihood term) द्वारा निर्देशित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप केवल अपने सिर और कलाइयों पर लगे तीन छोटे सेंसरों को देखकर यह अनुमान लगाने की कोशिश कर रहे हैं कि एक व्यक्ति अपने पूरे शरीर के साथ क्या कर रहा है (जैसे नृत्य करना, दौड़ना, हाथ हिलाना)। यह ह्यूमन पोज एस्टीमेशन (Human Pose Estimation) की समस्या है।
यह शोध पत्र एक नई विधि पेश करता है जिसे InPose कहा जाता है, जो इस क्षेत्र की एक बड़ी समस्या को हल करती है: शरीर की बनावट में अंतर (Body Shape Differences)।
समस्या: "एक ही आकार सबके लिए नहीं" वाला जाल (The "One-Size-Fits-None" Trap)
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट है जिसने एक विशिष्ट व्यक्ति को देखकर शरीर की गतिविधियों का अनुमान लगाना सीखा है, मान लीजिए उसका नाम "टॉल बॉब" है। रोबोट ने सीखा कि जब बॉब का रिस्ट (कलाई) सेंसर इस तरह से हिलता है, तो उसकी कोहनी वहाँ होती है।
अब, कल्पना कीजिए कि आप उसी रोबोट का उपयोग "शॉर्ट सैली" की गतिविधियों का अनुमान लगाने के लिए करते हैं। भले ही सैली अपनी कलाई बिल्कुल वैसे ही हिलाए जैसे बॉब ने किया था, लेकिन उसकी कोहनी एक पूरी तरह से अलग जगह पर होगी क्योंकि उसकी भुजाएं छोटी हैं। रोबोट, जो केवल बॉब पर प्रशिक्षित था, भ्रमित हो जाता है और गलत अनुमान लगाता है। यह एक विशालकाय व्यक्ति के लिए बने सूट को एक बच्चे को पहनाने जैसा है; आस्तीन बहुत लंबी हैं, और पैंट बहुत छोटी है।
पिछले तरीकों ने रोबोट को कई अलग-अलग शारीरिक आकृतियों पर प्रशिक्षित करके इसे ठीक करने की कोशिश की, लेकिन इससे रोबोट अविश्वसनीय रूप से जटिल हो गया और फिर भी यह हर संभव मानव आकृति (जैसे असामान्य रूप से लंबी टांगों या बहुत छोटी धड़ वाले व्यक्ति) को कवर नहीं कर सका।
समाधान: InPose (द "स्केल-फ्री" डिटेक्टिव)
इस शोध पत्र के लेखक, साहिल भंडारी कार्नूर और रोमित रॉय चौधरी ने एक चतुर तरकीब निकाली। उन्होंने महसूस किया कि एक मानव मुद्रा (pose) को दो भागों में विभाजित किया जा सकता है:
- "स्केल-फ्री" पोज़ (The "Scale-Free" Pose): यह गति का आकार है (जैसे, "हाथ 90 डिग्री पर मुड़े हुए हैं")। यह चाहे आप विशालकाय हों या बौने, एक जैसा ही रहता है।
- "स्केल-डिपेंडेंट" पोज़ (The "Scale-Dependent" Pose): यह अंतरिक्ष में जोड़ों का वास्तविक स्थान है, जो पूरी तरह से इस बात पर निर्भर करता है कि आपकी हड्डियाँ कितनी लंबी हैं।
InPose एक दो-चरणीय जासूस की तरह काम करता है:
चरण 1: "कल्पना" (The "Imagination" - The Diffusion Prior)
सबसे पहले, सिस्टम एक पूर्व-प्रशिक्षित AI (एक "डिफ्यूजन मॉडल") का उपयोग करता है जिसने मानव गति के नियमों को सीखा है। यह AI एक कलाकार की तरह है जो जानता है कि मनुष्य सामान्य रूप से कैसे चलते हैं। यह तीन सेंसरों से प्राप्त रोटेशन (घूर्णन) डेटा (सिर और कलाइयां कैसे घूम रही हैं) को देखता है और एक "परफेक्ट" मानव की कल्पना करता है जो वह गति कर रहा है।
- महत्वपूर्ण बिंदु: क्योंकि यह केवल रोटेशन (कोणों) को देखता है, इसे इस बात से कोई फर्क नहीं पड़ता कि व्यक्ति लंबा है या छोटा। यह केवल "डांस मूव्स" को देखता है।
चरण 2: "रियलिटी चेक" (The "Reality Check" - The Inverse Solver)
अब, सिस्टम लोकेशन (स्थान) डेटा को देखता है (कि सेंसर वास्तव में अंतरिक्ष में कहाँ हैं)। यह पूछता है: "ठीक है, मेरे पास एक काल्पनिक डांस मूव है। क्या यह इस विशिष्ट व्यक्ति के लिए वास्तविक सेंसर स्थानों के अनुकूल है?"
यही जादू है: हर नए व्यक्ति के लिए AI को फिर से प्रशिक्षित करने के बजाय, InPose उस काल्पनिक "परफेक्ट" डांस को इस विशिष्ट व्यक्ति की हड्डियों की लंबाई के अनुसार खींचने या सिकोड़ने (stretch or shrink) के लिए गणित का उपयोग करता है। यह समस्या को एक पहेली की तरह देखता है: "यदि सेंसर यहाँ हैं, और हड्डियाँ इतनी लंबी हैं, तो मेरे शरीर के बाकी हिस्सों को क्या करना चाहिए?"
इसे इनवर्स सॉल्वर (Inverse Solver) कहा जाता है। यह पूछने के बजाय कि "यदि मैं अपना हाथ हिलाता हूँ, तो सेंसर कहाँ जाएगा?" (फॉरवर्ड), यह पूछता है "सेंसर यहाँ है, तो मेरी भुजा कहाँ होनी चाहिए?" (इनवर्स)।
"जीरो-शॉट" सुपरपावर (The "Zero-Shot" Superpower)
शीर्षक में "जीरो-Shot" शब्द का अर्थ है कि सिस्टम एक बिल्कुल नए व्यक्ति का अनुमान लगा सकता है जिसे इसने पहले कभी नहीं देखा है, बिना उसे फिर से प्रशिक्षित या फाइन-ट्यून किए।
- पुराना तरीका: बॉब पर प्रशिक्षित करें, सैली पर प्रशिक्षित करें, बास्केटबॉल खिलाड़ी पर प्रशिक्षित करें, जिम्नास्ट पर प्रशिक्षित करें। यदि कोई नया व्यक्ति अजीब अनुपात के साथ आता है, तो सिस्टम विफल हो जाता है।
- InPose का तरीका: गति के नियमों (रोटेशन का उपयोग करके) पर प्रशिक्षित करें। जब कोई नया व्यक्ति आता है, तो बस उनकी हड्डियों की लंबाई और सेंसर डेटा फीड करें। गणित बाकी काम कर देता है। यह एक सार्वभौमिक अनुवादक की तरह है जो बिना हर विशिष्ट बोली के लिए शब्दकोश के, किसी भी भाषा में काम कर सकता है।
यह शोर (Noise) को कैसे संभालता है
शोध पत्र यह भी दिखाता है कि InPose सेंसरों की "स्थिरता" या त्रुटियों को अनदेखा करने में बहुत अच्छा है।
- उपमा: कल्पना कीजिए कि आप रेडियो पर स्टैटिक (शोर) के साथ गाना सुनने की कोशिश कर रहे हैं।
- पुराने तरीके सिग्नल को बढ़ाने की कोशिश करते हैं, लेकिन स्टैटिक (सेंसर शोर) संगीत को अस्पष्ट बना देता है।
- InPose "मेलोडी" (रोटेशन/प्रायर) को सुनता है जो स्पष्ट है, और केवल "लिरिक्स" (लोकेशन डेटा) का उपयोग यह जांचने के लिए करता है कि क्या मेलोडी समझ में आती है। यदि लोकेशन डेटा शोर भरा है, तो मेलोडी (मानव गति का AI ज्ञान) अनुमान को सटीक बनाए रखती है।
कमी (सीमाएं)
पेपर ईमानदारी से बताता है कि InPose कहाँ संघर्ष करता है:
- "लेग्स" (पैरों) की समस्या: चूंकि सेंसर केवल सिर और कलाइयों पर हैं, इसलिए सिस्टम को यह अनुमान लगाने के लिए कि पैर क्या कर रहे हैं, ऊपरी शरीर के आधार पर अनुमान लगाना पड़ता है। यदि व्यक्ति कूद रहा है या जमीन असमान है, तो सिस्टम कभी-कभी पैरों का गलत अनुमान लगाता है। यह केवल हाथों को देखकर किसी के फुटवर्क (पैरों की चाल) का अनुमान लगाने जैसा है; आप लय का अनुमान लगा सकते हैं, लेकिन आप एक विशिष्ट कदम को मिस कर सकते हैं।
- डिफ़ॉल्ट प्रदर्शन: यदि आप InPose का परीक्षण ऐसे व्यक्ति पर करते हैं जो उस "औसत" व्यक्ति के समान है जिस पर AI को प्रशिक्षित किया गया था, तो यह वास्तव में पुराने तरीकों की तुलना में थोड़ा खराब है। पुराने तरीके एक ऐसे दर्जी की तरह हैं जो आपके सटीक माप जानता है; InPose एक मास्टर दर्जी की तरह है जो सिलाई के सिद्धांतों को जानता है और आपके आकार का सटीक अनुमान लगा सकता है, लेकिन यदि आप बिल्कुल औसत हैं, तो वह एक सूक्ष्म विवरण को मिस कर सकता है।
सारांश
InPose केवल तीन सेंसरों का उपयोग करके मानव गति को ट्रैक करने का एक नया तरीका है। यह "आप कैसे चलते हैं" को "आप कितने बड़े हैं" से अलग करता है। एक स्मार्ट AI का उपयोग करके गति की शैली का अनुमान लगाने और शरीर के आकार के लिए समायोजन करने के लिए एक गणितीय तरकीब का उपयोग करके, यह बिना किसी विशिष्ट शरीर के आकार को पहले से सीखे, तुरंत किसी को भी, कहीं भी, ट्रैक कर सकता है। यह मोशन ट्रैकिंग के लिए एक "यूनिवर्सल फिट" समाधान है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।