Learning Generalizable Action Representations via Pre-training AEMG
यह शोधपत्र AEMG प्रस्तुत करता है, जो पहला बड़े पैमाने का स्व-पर्यवेक्षित (self-supervised) ढांचा है जो एक नवीन न्यूरोमस्कुलर कॉन्ट्रैक्शन टोकेनाइज़र के माध्यम से EMG संकेतों को एक शारीरिक भाषा के रूप में मानता है ताकि न्यूनतम लक्ष्य डेटा के साथ विषयों, उपकरणों और कार्यों में अत्याधुनिक सामान्यीकरण प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपकी मांसपेशियां एक गायक मंडली (choir) की तरह हैं, और हर बार जब आप अपना हाथ हिलाते हैं, तो वे एक विशिष्ट गीत गाती हैं। लंबे समय तक, कंप्यूटर जो इन गीतों को समझने की कोशिश कर रहे थे (रोबोटिक हाथों या प्रोस्थेटिक्स को नियंत्रित करने के लिए), उन्हें एक बड़ी समस्या थी: हर व्यक्ति की आवाज़ अलग थी, हर माइक्रोफ़ोन (सेंसर) अलग तरह से रिकॉर्ड करता था, और हर गीत की संरचना अलग थी। इसे ठीक करने के लिए, शोधकर्ताओं को आमतौर पर हर एक व्यक्ति के लिए कंप्यूटर को एक नई "भाषा" सिखानी पड़ती थी, जो बहुत धीमी और अक्षम प्रक्रिया थी।
यह पेपर AEMG पेश करता है, एक नया सिस्टम जो कंप्यूटर को मांसपेशियों के संकेतों की "सार्वभौमिक व्याकरण" (universal grammar) समझने में सक्षम बनाता है, चाहे वह कोई भी गा रहा हो या कौन सा माइक्रोफ़ोन रिकॉर्ड कर रहा हो।
उन्होंने इसे कैसे किया, इसका विवरण सरल उपमाओं के माध्यम से यहाँ दिया गया है:
1. समस्या: बेबेल का टॉवर (A Tower of Babel)
वर्तमान में, यदि आप चाहते हैं कि कंप्यूटर आपके हाथ के इशारों को समझे, तो आपको केवल आपके लिए इसे घंटों तक कैलिब्रेट करना पड़ता है। यदि आप एक अलग डिवाइस या किसी अलग व्यक्ति पर स्विच करते हैं, तो कंप्यूटर भ्रमित हो जाता है। यह एक ऐसी किताब का अनुवाद करने जैसा है जहाँ हर पन्ना अलग बोली, अलग फ़ॉन्ट और अलग विराम चिह्नों के साथ लिखा गया हो। कंप्यूटर कोई पैटर्न नहीं खोज पाता।
2. समाधान: मांसपेशियों के संकेतों को "वाक्यों" में बदलना
शोधकर्ताओं ने, जिनका नेतृत्व झेंगहाओ हुआंग और लिन शू ने किया, मांसपेशियों के संकेतों को अव्यवस्थित विद्युत तरंगों के रूप में नहीं, बल्कि भाषा के रूप में देखने का निर्णय लिया।
- "टोकनाइज़र" (NCT): कल्पना कीजिए कि आप एक गायक मंडली को सुन रहे हैं। पूरे निरंतर शोर को रिकॉर्ड करने के बजाय, आप विशिष्ट "नोट्स" या "शब्दों" (व्यक्तिगत मांसपेशियों के संकुचन) को सुनते हैं। सिस्टम का न्यूरोमस्कुलर कॉन्ट्रैक्शन टोकनाइज़र (Neuromuscular Contraction Tokenizer) एक स्मार्ट संपादक की तरह काम करता है जो निरंतर संकेत को इन सार्थक "शब्दों" में काट देता है। यह नोट्स के बीच के सन्नाटे और शोर को अनदेखा कर देता है, और केवल उन वास्तविक "शब्दों" पर ध्यान केंद्रित करता है जो मांसपेशियां बोल रही हैं।
- "शब्दावली" (Codebook): भले ही हर व्यक्ति की आवाज़ अलग हो, लेकिन "कप पकड़ने" को कहने के लिए वे जो शब्द उपयोग करते हैं, वे मौलिक रूप से समान होते हैं। सिस्टम 8,192 मानक "मांसपेशी शब्दों" का एक विशाल शब्दकोश (कोडबुक) बनाता है। यह हर व्यक्ति के अद्वितीय संकेत को इन मानक शब्दों में मैप करने के लिए मजबूर करता है। यह एक फ्रांसीसी वक्ता और एक जापानी वक्ता को एक साझा, सार्वभौमिक "मांसपेशी भाषा" में अनुवाद करने जैसा है ताकि कंप्यूटर को केवल एक व्याकरण सीखना पड़े।
- "व्याकरण" (Transformer): जिस तरह शब्दों को अर्थपूर्ण बनाने के लिए वाक्यों में व्यवस्थित करने की आवश्यकता होती है, वैसे ही मांसपेशियां समूहों (synergies) में काम करती हैं। सिस्टम एक ट्रांसफॉर्मर (Transformer) का उपयोग करता है (वही AI तकनीक जो ChatGPT जैसे टूल्स के पीछे है) यह समझने के लिए कि इन मांसपेशी शब्दों का क्रम और संदर्भ क्या है। यह सीखता है कि एक विशिष्ट मांसपेशी "शब्द" का अर्थ "पिंच" (चुटकी लेना) हो सकता है यदि इसके बाद अंगूठे की हरकत हो, लेकिन "पकड़ना" (grab) हो सकता है यदि इसके बाद पूरी हथेली का बंद होना शामिल हो।
3. प्रशिक्षण: "खाली स्थान भरना" (Fill-in-the-Blanks)
हर एक जेस्चर (इशारे) को लेबल करने के लिए मानवीय मदद के बिना इस भाषा को सीखने के लिए, सिस्टम मैड लिब्स (Mad Libs) के खेल का उपयोग करता है।
- AI को मांसपेशियों के संकेतों का एक "वाक्य" दिखाया जाता है जिसमें कुछ शब्द छिपे (मास्क किए गए) होते हैं।
- इसे आसपास के शब्दों के संदर्भ के आधार पर गायब शब्दों का अनुमान लगाना होता है।
- 500 से अधिक लोगों और कई अलग-अलग उपकरणों के डेटा का उपयोग करके लाखों बार यह खेल खेलकर, AI यह सीख जाता है कि मांसपेशियां मिलकर कैसे काम करती हैं, न कि केवल विशिष्ट इशारों को रटता है।
4. परिणाम: "ज़ीरो-शॉट" (Zero-Shot) सुपरपावर
इस सिस्टम का परीक्षण सबसे कठिन परिदृश्य में किया गया: लीव-वन-सब्जेक्ट-आउट (Leave-One-Subject-Out)।
- परीक्षण: AI को 99 लोगों के डेटा पर प्रशिक्षित किया गया और फिर उसे 100वें व्यक्ति के इशारों को समझने के लिए कहा गया जिसे उसने पहले कभी नहीं देखा था, और उस विशिष्ट व्यक्ति पर बिना किसी पूर्व प्रशिक्षण के।
- परिणाम: AEMG ने सभी मौजूदा तरीकों को काफी पीछे छोड़ दिया। इसने मौजूदा सर्वोत्तम मॉडलों की तुलना में सटीकता में लगभग 10% का सुधार किया।
- "फ्यू-शॉट" (Few-Shot) चमत्कार: यदि वे सिस्टम को एक नए व्यक्ति के डेटा का केवल 5% हिस्सा फाइन-ट्यून करने के लिए देते, तो यह 90% से अधिक सटीकता प्राप्त कर सकता था। यह एक नए भाषा बोलने वाले को कुछ वाक्यांश सिखाने और फिर उसे तुरंत पूरी बातचीत समझने में सक्षम बनाने जैसा है।
5. यह क्यों महत्वपूर्ण है (पेपर के अनुसार)
पेपर का दावा है कि यह पहली बार है जब मांसपेशियों के संकेतों के लिए एक "फाउंडेशन मॉडल" (एक विशाल, प्री-ट्रेन्ड मस्तिष्क) बनाया गया है।
- पहले: हमें हर नए उपयोगकर्ता के लिए एक कस्टम, अलग घर बनाना पड़ता था।
- अब: हमने एक सार्वभौमिक अपार्टमेंट कॉम्प्लेक्स बनाया है। संरचना पहले से ही वहां है; हमें बस कुछ तस्वीरें (5% डेटा) लगाने की आवश्यकता है ताकि यह नए निवासी के अनुकूल हो सके।
लेखक इस बात पर जोर देते हैं कि यह दृष्टिकोण मांसपेशियों के संकेतों को एक "क्रॉस-डिवाइस फिजियोलॉजिकल भाषा" के रूप में मानता है, जिससे AI भारी मात्रा में कच्चे डेटा से गति के "व्याकरण" को सीख सकता है, जो इसे विभिन्न उपकरणों, विभिन्न लोगों और विभिन्न रिकॉर्डिंग स्थितियों के प्रति मजबूत बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।