← नवीनतम पेपर
💻 computer science

Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding

यह शोध पत्र mmMind को प्रस्तुत करता है, जो एक रडार-भाषा मॉडल है जो गोपनीयता-अनुकूल मानव व्यवहार बोध के लिए mmWave रडार डेटा को बड़े भाषा मॉडलों के साथ संरेखित करने हेतु पोज़-निर्देशित प्रीट्रेनिंग का लाभ उठाता है, जिसे एक नए वास्तविक-विश्व बेंचमार्क और कैप्शनिंग एवं प्रश्न-उत्तर कार्यों में बेहतर प्रदर्शन द्वारा प्रमाणित किया गया है।

मूल लेखक: Duo Zhang, Zhehui Yin, Zhiyun Yao, Haotong Qin, Xusheng Zhang, Hongliu Yang, Jianyu Sun, Junzhe Wang, Zizhou Fan, Michele Magno, Daqing Zhang

प्रकाशित 2026-08-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Duo Zhang, Zhehui Yin, Zhiyun Yao, Haotong Qin, Xusheng Zhang, Hongliu Yang, Jianyu Sun, Junzhe Wang, Zizhou Fan, Michele Magno, Daqing Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोटिक असिस्टेंट को यह समझाना चाह रहे हैं कि कमरे में लोग क्या कर रहे हैं, लेकिन इसमें एक पेंच है: आपको रोबोट को अपनी आँखों का उपयोग करने से रोकना होगा। कैमरे बेहतरीन होते हैं, लेकिन वे बेडरूम या बाथरूम जैसी जगहों पर गोपनीयता का उल्लंघन महसूस कराते हैं, और विशेष सेंसर पहनना कष्टप्रद होता है। इसलिए, वैज्ञानिक एक अलग प्रकार की "दृष्टि" की ओर मुड़ते हैं जिसे मिलीमीटर-वेव (mmWave) रडार कहा जाता है। इस रडार को चमगादड़ द्वारा इकोलोकेशन (echolocation) के उपयोग की तरह समझें; यह अदृश्य रेडियो तरंगें भेजता है जो लोगों से टकराकर वापस आती हैं, जिससे डॉट्स का एक बादल बनता है जो दिखाता है कि शरीर कहाँ है और वह कितनी तेज़ी से हिल रहा है। यह निजी है, बिना संपर्क वाला है, और कोई पहचान योग्य चित्र नहीं बनाता है।

हालाँकि, एक बड़ी समस्या है: ये रडार डॉट्स अव्यवस्थित, बिखरे हुए और कठिन हैं जिन्हें एक भाषा मॉडल (LLM) जैसे रोबोट के मस्तिष्क के लिए समझना मुश्किल है। एक LLM एक प्रतिभाशाली छात्र की तरह है जो किताबें पढ़ सकता है और कहानियाँ लिख सकता है, लेकिन यदि आप उसे बिखरे हुए डॉट्स का एक मुट्ठी भर हिस्सा थमा देते हैं, तो उसे समझ नहीं आता कि उनका क्या अर्थ है। यह किसी को नृत्य की दिनचर्या समझाने के लिए केवल यादृच्छिक निर्देशांकों (coordinates) की सूची देने जैसा है जिसमें कोई लय या प्रवाह नहीं है। बड़ा सवाल यह है कि इन भ्रमित करने वाले, अदृश्य रडार डॉट्स को एक स्पष्ट कहानी में कैसे बदला जाए जिसे एक भाषा-कुशल रोबोट पढ़ सके और समझ सके, ताकि वह बिना आपको देखे सटीक रूप से बता सके कि व्यक्ति क्या कर रहा है?

यहीं पर mmMind नामक एक नया प्रोजेक्ट आता है। बीजिंग यूनिवर्सिटी और ETH ज्यूरिख के शोधकर्ताओं ने एक चतुर प्रणाली बनाई है जो एक रडार-संवेदी रोबोट को एक गुप्त प्रशिक्षण तकनीक का उपयोग करके मानव गति को "पढ़ना" सिखाती है। कल्पना कीजिए कि आप एक छात्र को नृत्य का वर्णन करना सिखा रहे हैं। आमतौर पर, आप उन्हें केवल बिखरा हुआ वीडियो दिखाएंगे और उनसे अनुमान लगाने को कहेंगे। लेकिन mmMind के साथ, शिक्षक पहले छात्र को उस नृत्य के साथ एक पूर्ण, सिंक्रोनाइज़्ड कंकाल (skeleton) रेखाचित्र दिखाते हैं जो नर्तक के जोड़ों को दर्शाता है। छात्र इन "कंकाल" पाठों से बिखरे हुए रडार डॉट्स को एक स्पष्ट कंकाल संरचना से जोड़ना सीखता है। एक बार जब छात्र ने कंकाल के माध्यम से लय और शरीर के आकार को सीख लिया होता है, तो शिक्षक कंकाल के रेखाचित्रों को हटा लेते हैं। अब, जब छात्र केवल बिखरे हुए रडार डॉट्स देखता है, तो वह अपने मन में कंकाल को "देख" सकता है और नृत्य का सटीक वर्णन कर सकता है।

यह शोध पत्र mmMind का परिचय देता है, जो एक "पोज़-गाइडेड" (pose-guided) प्रशिक्षण पद्धति का उपयोग करता है। प्रशिक्षण चरण के दौरान, प्रणाली रडार डेटा और व्यक्ति की संबंधित 3D पोज़ (कंकाल) को देखती है। यह बिखरे हुए, शोर वाले रडार बिंदुओं को गति की एक सुचारू, निरंतर भाषा में अनुवाद करना सीखती है जो शरीर की संरचना और समय के साथ उसके परिवर्तन को सुरक्षित रखती है। एक बार जब यह सीखना पूरा हो जाता है, तो सिस्टम कंकाल डेटा को हटा देता है। इसके बाद, इसे केवल कच्चे रडार संकेतों की आवश्यकता होती है ताकि मानव व्यवहार को समझा जा सके। शोधकर्ताओं ने इस रडार-समर्थ मॉडल को एक बड़े भाषा मॉडल (LLM) से बात करने के लिए प्रशिक्षित किया, जिससे यह क्रियाओं का वर्णन करने, प्रश्न पूछने और आपके द्वारा की जा रही गतिविधियों के बारे में बातचीत करने में सक्षम हो गया।

यह साबित करने के लिए कि यह वास्तविक दुनिया में काम करता है, टीम ने केवल कंप्यूटर सिमुलेशन का उपयोग नहीं किया; उन्होंने mmMind-Bench नामक एक विशाल नया डेटासेट बनाया। उन्होंने सात अलग-अलग इनडोर वातावरणों, जैसे लिविंग रूम और ऑफिस में वास्तविक लोगों की गति के 17.9 घंटे रिकॉर्ड किए। उन्होंने 23 प्रतिभागियों को चलते, बैठते, जंपिंग जैक करते और गिरते हुए भी कैप्चर किया। महत्वपूर्ण बात यह है कि उन्होंने इन क्रियाओं को केवल "जंपिंग" जैसे सरल शब्दों के साथ लेबल नहीं किया; उन्होंने विस्तृत, द्विभाषी (अंग्रेजी और चीनी) विवरण, प्रश्न और बहु-चरणीय संवाद बनाए जो ठीक से बताते हैं कि शरीर कैसे हिला, गति की दिशा क्या थी, और घटनाओं का क्रम क्या था।

परिणाम बताते हैं कि यह दृष्टिकोण एक महत्वपूर्ण प्रगति है। जब क्रिया का वर्णन करने, गति के बारे में प्रश्न पूछने और उन नई क्रियाओं को पहचानने जैसे कार्यों पर परीक्षण किया गया जिन्हें मॉडल ने पहले कभी नहीं देखा था, तो mmMind ने लगातार पिछले तरीकों को पीछे छोड़ दिया। उदाहरण के लिए, क्रिया का वर्णन करने में, इसने 86.8 का स्कोर प्राप्त किया, जो अगले सबसे अच्छे तरीके से काफी आगे है। नई, अनदेखी क्रियाओं को पहचानने में, यह 91.2% बार सही था। शोधकर्ताओं ने पाया कि "कंकाल" प्रशिक्षण चरण को हटाने से मॉडल का प्रदर्शन नाटकीय रूप से गिर गया, जिससे पता चलता है कि गति को समझने के लिए शरीर की संरचना को सीखना आवश्यक है। उन्होंने यह भी पाया कि रडार डेटा को सरल, असतत कोड (जैसे गति को संख्याओं की सूची में बदलना) में संकुचित करने से मॉडल कम सटीक हो गया, जिससे पुष्टि होती है कि गति को एक सुचारू, निरंतर प्रवाह के रूप में रखना बेहतर है।

हालांकि यह प्रणाली प्रभावशाली है, लेखक इसकी सीमाओं के बारे में सावधान हैं। यह सटीक संख्या गिनने में पूर्ण नहीं है, जैसे कि कोई कितनी बार कूदा या घूमने की सटीक गति क्या थी, खासकर यदि रडार सिग्नल कमजोर है या व्यक्ति आंशिक रूप से दिखाई दे रहा है। वे यह भी बताते हैं कि वर्तमान में, सिस्टम को कमरे में कई लोगों को अलग करने के लिए मदद की आवश्यकता होती है; यह मिश्रित डॉट्स को व्यक्तिगत लोगों में वर्गीकृत करने के लिए एक बाहरी टूल पर निर्भर करता है ताकि mmMind विश्लेषण कर सके। फिर भी, यह कार्य सुझाव देता है कि AI को मानव शरीर के "काइनेमैटिक्स" (गति के भौतिक विज्ञान) को रडार के माध्यम से समझाकर, हम गोपनीयता-अनुकूल सहायक बना सकते हैं जो जानते हैं कि हम क्या कर रहे हैं बिना हमें तस्वीर लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →