AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild
AnyMo एक ज्यामिति-जागरूक (geometry-aware), सेटअप-अज्ञेय (setup-agnostic) फ्रेमवर्क है जो विविध पहनने योग्य उपकरणों और अनदेखे डेटासेटों में सुदृढ़, सामान्यीकरण योग्य मानव गति समझ को सक्षम करने के लिए भौतिकी-आधारित IMU सिमुलेशन और LLM संरेखण का लाभ उठाता है, जो ज़ीरो-शॉट गतिविधि पहचान, क्रॉस-मोडल रिट्रीवल और मोशन कैप्शनिंग में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक स्मार्टवॉच, एक फिटनेस ट्रैकर, या यहाँ तक कि आपके जूते में एक सेंसर है। ये उपकरण आपके शरीर की गति को महसूस करने में बहुत कुशल हैं। लेकिन समस्या यह है: एक ही हलचल पूरी तरह से अलग दिखती है, यह इस पर निर्भर करता है कि सेंसर कहाँ लगा है।
यदि आप अपना हाथ हिलाते हैं, तो कलाई पर लगा सेंसर एक बड़ा, तेज़ झोंका देखता है। कूल्हे पर लगा सेंसर एक बहुत ही सूक्ष्म, मामूली कंपन देखता है। सिर पर लगा सेंसर लगभग कुछ भी नहीं देखता। वर्तमान AI मॉडल उन छात्रों की तरह हैं जिन्होंने केवल एक विशिष्ट परीक्षा के लिए पढ़ाई की है; यदि आप सेंसर को किसी अलग जगह पर ले जाते हैं या डिवाइस का ब्रांड बदल देते हैं, तो AI भ्रमित हो जाता है और विफल हो जाता है।
यह शोध पत्र AnyMo पेश करता है, जो एक नया AI फ्रेमवर्क है जिसे मानव गति के लिए एक "यूनिवर्सल ट्रांसलेटर" (सार्वीय अनुवादक) के रूप में डिज़ाइन किया गया है, चाहे सेंसर कहीं भी रखा गया हो।
यहाँ बताया गया है कि AnyMo कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. "वर्चुअल जिम" (ज्यामिति-जागरूक सिमुलेशन)
वास्तविक दुनिया के हर संभव स्थान से लाखों वास्तविक सेंसर एकत्र करने के बजाय (जो असंभव है), AnyMo एक वर्चुअल जिम बनाता है।
- उपमा: एक 3D डिजिटल पुतले की कल्पना करें। शोधकर्ताओं ने केवल पुतले की कलाई पर सेंसर नहीं लगाया। उन्होंने आभासी रूप से पुतले की त्वचा पर हजारों छोटे सेंसर "पेंट" किए—कोहनी पर, घुटने पर, पीठ पर, माथे पर।
- भौतिकी: उन्होंने भौतिकी का उपयोग यह सिम्युलेट करने के लिए किया कि जब वह पुतला चलता, दौड़ता या नाचता है, तो वे सेंसर ठीक कैसे कंपन और घूमेंगे। इसने "क्या होगा अगर" वाले परिदृश्यों का एक विशाल पुस्तकालय बनाया, जिससे AI ने सीखा कि एक "चलना" घुटने पर एक कंधे की तुलना में अलग दिखता है, लेकिन वह मूल रूप से एक ही क्रिया है।
2. "आंखों पर पट्टी बंधी पहेली" (सेटअप-अज्ञेय प्री-ट्रेनिंग)
एक बार जब AI ने वर्चुअल जिम से सीख लिया, तो उन्हें इसे वास्तविक दुनिया की स्थितियों को संभालने के लिए प्रशिक्षित करने की आवश्यकता थी जहाँ सेंसर गायब हैं या बेतरतीब ढंग से रखे गए हैं।
- उपमा: कल्पना करें कि आप AI को किसी व्यक्ति के चलने की एक पूरी पहेली दिखा रहे हैं, लेकिन फिर आप उसे आंखों पर पट्टी बांध देते हैं ताकि वह केवल 2 या 3 पहेली के टुकड़ों को देख सके (एक वास्तविक व्यक्ति पर लगे वास्तविक सेंसर)।
- चालaki: AI को पूरे चित्र का अनुमान लगाना होता है कि वह क्या है, केवल उन कुछ टुकड़ों के आधार पर जो उसे दिख रहे हैं। विभिन्न "आंखों पर पट्टी" (विभिन्न सेंसर सेटअप) के साथ बार-बार अभ्यास करके, AI गति की मूल संरचना को सीख जाता है, न कि केवल विशिष्ट सेंसर स्थानों को रट लेता है। यह सेंसर डेटा की "त्वचा" के बजाय गति की "आत्मा" को सीखता है।
3. "अनुवादक" (टोकेनाइजेशन और LLM)
रॉ सेंसर डेटा केवल संख्याओं की एक धारा (त्वरण, गति, आदि) है। लार्ज लैंग्वेज मॉडल्स (LLMs) जैसे कि इस पेपर में उपयोग किया गया मॉडल, शब्दों को समझने में बहुत अच्छे हैं, लेकिन वे कच्चे नंबरों पर अटक जाते हैं।
- उपमा: AnyMo एक अनुवादक के रूप में कार्य करता है। यह सेंसर नंबरों की अव्यवस्थित, निरंतर धारा को संक्षिप्त "मोशन टोकन" (जैसे वाक्य में शब्द) में संकुचित करता है।
- परिणाम: लाखों नंबरों को फीड करने के बजाय, यह इसे "गति के शब्दों" का एक छोटा वाक्य फीड करता है। यह AI को गति को सीधे भाषा से जोड़ने की अनुमति देता है।
AnyMo क्या कर सकता है?
पेपर में AnyMo का परीक्षण तीन कार्यों पर किया गया था, और इसने पिछले सभी तरीकों को पछाड़ दिया:
जीरो-शॉट रिकग्निशन (गतिविधि पहचानने का खेल):
- उन्होंने AnyMo को 14 अलग-अलग डेटासेट्स दिखाए जिन्हें उसने पहले कभी नहीं देखा था (अलग सेंसर, अलग लोग, अलग गतिविधियाँ)।
- परिणाम: AnyMo सही ढंग से अनुमान लगा सका कि व्यक्ति क्या कर रहा था (जैसे, "खाना बनाना," "चलना," "नाचना") बिना उन विशिष्ट डेटासेट्स पर विशेष रूप से प्रशिक्षित हुए। इसने अगले सबसे अच्छे तरीके की तुलना में सटीकता में लगभग 12% सुधार किया।
क्रॉस-मोडल रिट्रीवल (सर्च इंजन):
- टेक्स्ट-टू-मोशन: आप टाइप करते हैं "एक व्यक्ति फ्रिज खोल रहा है," और AI उस सटीक वीडियो क्लिप या सेंसर डेटा को खोज लेता है जो उससे मेल खाता है।
- मोशन-टू-टेक्स्ट: आप एक सेंसर रिकॉर्डिंग अपलोड करते हैं, और AI उस टेक्स्ट विवरण को खोज लेता है जो उससे मेल खाता है।
- परिणाम: AnyMo अन्य मॉडलों की तुलना में सही मिलान खोजने में काफी बेहतर था, भले ही डेटा पूरी तरह से अलग उपकरणों से आया हो।
मोशन कैप्शनिंग (कहानीकार):
- आप AI को एक सेंसर रिकॉर्डिंग देते हैं, और वह एक वाक्य लिखता है जो बताता है कि क्या हुआ।
- परिणाम: केवल "हाथ हिल रहा है" जैसी सामान्य बातें कहने के बजाय, AnyMo ने विशिष्ट विवरण लिखे जैसे, "एक व्यक्ति गलियारे में चल रहा है, दाएं मुड़ता है, और कैबिनेट खोलता है।" इसने केवल भौतिकी को नहीं, बल्कि गति की कहानी को पकड़ा।
निष्कर्ष
पेपर का दावा है कि सेंसर प्लेसमेंट को एक यादृच्छिक चर (random variable) के बजाय एक संरचित, ज्यामितीय समस्या (शरीर के आकार का उपयोग करके) के रूप में मानकर, और AI को गति को भाषा में अनुवादित करना सिखाकर, AnyMo पहनने योग्य मोशन (wearable motion) के लिए एक सामान्य-उद्देश्य वाला मॉडल बनाता है।
यह केवल एक विशिष्ट वॉच पर एक विशिष्ट गतिविधि को नहीं पहचानता; यह मानव गति की अवधारणा को समझता है, जिससे यह किसी भी डिवाइस, शरीर के किसी भी हिस्से पर, वास्तविक दुनिया में काम करने में सक्षम होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।