Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar
यह शोध पत्र एक हल्का, फैक्टराइज्ड स्पैटियो-टेम्पोरल कनवल्शन नेटवर्क प्रस्तुत करता है जो केवल सर्वदिशीय प्लेनर LiDAR का उपयोग करके, कंप्यूटेशनल रूप से सीमित सर्विस रोबोट्स पर रीयल-टाइम मानव पहचान और 2D पोज़ एस्टीमेशन को सक्षम बनाता है, जो बिना किसी मैनुअल LiDAR लेबल के क्रॉस-मोडल सेल्फ-सुपरवाइज्ड ट्रेनिंग के माध्यम से बेहतर सटीकता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को दुनिया देखना सिखाने की कोशिश कर रहे हैं। आज के अधिकांश रोबोट चश्मे पहने हुए लोगों की तरह हैं: वे आकृतियों और रंगों को खोजने के लिए कैमरों का उपयोग करते हैं ताकि यह पता लगाया जा सके कि कोई व्यक्ति कहाँ खड़ा है और उसका मुख किस ओर है। यह एक धूप वाले कमरे में बहुत अच्छा काम करता है, लेकिन यदि लाइट चली जाए, या यदि रोबक किसी भीड़भाड़ वाले गलियारे में हो जहाँ कैमरा बाधित हो जाता है, तो रोबोट अंधा हो जाता है। इस समस्या को हल करने के लिए, कई रोबोट एक "लेजर स्कैनर" (जिसे LiDAR कहा जाता है) ले जाते हैं जो एक लाइटहाउस की तरह, पूरे घेरे में अदृश्य प्रकाश की किरणें छोड़ता है। यह रंग या चेहरे नहीं देखता; यह बस यह देखता है कि चीजें कितनी दूर हैं। समस्या यह है कि इस लेजर स्कैनर से लिया गया एक एकल स्नैपशॉट एक चाबी के छेद (keyhole) के माध्यम से किसी व्यक्ति को देखने जैसा है: आप एक पैर देख सकते हैं, लेकिन आप यह नहीं बता सकते कि वह आपकी ओर चल रहा है या आपसे दूर जा रहा है, या वह वास्तव में एक व्यक्ति है भी या नहीं।
इस धुंधले, एक-आयामी दृश्य को समझने के लिए, वैज्ञानिकों को "स्पैटियो-टेम्पोरल" (spatio-temporal) प्रोसेसिंग नामक एक ट्रिक का उपयोग करने की आवश्यकता होती है। "स्पेशियल" (spatial) को अभी किसी वस्तु के आकार को देखने के रूप में सोचें, और "टेम्पोरल" (temporal) को यह देखने के रूप में सोचें कि समय के साथ वह आकार कैसे बदलता है। यदि आप चाबी के छेद के पास से गुजरते हुए एक व्यक्ति को देखते हैं, तो आप केवल एक पैर नहीं देखते; आप एक पैर को प्रकट होते, चलते और गायब होते देखते हैं। इन क्षणों को एक साथ जोड़कर, रोबोट व्यक्ति की पूरी मुद्रा (pose) का अनुमान लगा सकता है। यह शोध पत्र रोबोट को ठीक यही करने के लिए प्रशिक्षित करने की चुनौती से निपटता है: इन लेजर स्कैन के एक स्ट्रीम से यह पता लगाना कि न केवल कहाँ एक इंसान है, बल्कि वह किस दिशा में देख रहा है, और वह सब कुछ एक रोबोट के छोटे, कमजोर कंप्यूटर दिमाग पर बिना किसी सुपरकंप्यूटर की आवश्यकता के करना।
लेजर लाइटहाउस और समय-यात्रा करने वाला जासूस
रोबोट से मिलिए। यह एक सर्विस बॉट है, उसी तरह का जिसे आप होटल या अस्पताल में पहियों पर घूमते हुए देख सकते हैं। इसके कमर के चारों ओर एक 360-डिग्री लेजर स्कैनर घूम रहा है, जो हर सेकंड 360 अदृश्य किरणें छोड़ रहा है। लेकिन एक पेच है: एक एकल किरण केवल दूरी का एक बिंदु है। यदि कोई व्यक्ति रोबोट के सामने खड़ा होता है, तो लेजर बिंदुओं का एक "ब्लब" (blob) देखता है। क्या यह एक व्यक्ति है? एक कुर्सी? या एक कूड़ेदान? और यदि यह एक व्यक्ति है, तो क्या वे रोबोट को नमस्ते कहने के लिए देख रहे हैं, या उन्हें अनदेखा करने के लिए दूसरी ओर देख रहे हैं?
शोधकर्ताओं ने महसूस किया कि केवल एक स्नैपशॉट को देखना एक स्थिर फ्रेम से फिल्म के कथानक का अनुमान लगाने जैसा है। आपको पूरा दृश्य चलने की आवश्यकता है। इसलिए, उन्होंने एक विशेष "टाइम-ट्रैवलिंग डिटेक्टिव" नेटवर्क बनाया। केवल वर्तमान लेजर स्कैन को देखने के बजाय, यह नेटवर्क पिछले कुछ सेकंड के स्कैन की एक छोटी फिल्म देखता है। यह देखता है कि समय के साथ "ब्लब्स" कैसे चलते हैं और अपना आकार बदलते हैं।
"फैक्टराइज्ड" (Factorized) सोच का जादू
यहाँ चालाकी भरा हिस्सा है। अधिकांश कंप्यूटर दिमाग एक साथ सब कुछ करने की कोशिश करते हैं: वे एक बड़े, अस्त-व्यस्त मस्तिष्क कोशिका में आकार और गति दोनों को देखते हैं। इस पेपर के लेखकों ने कहा, "आइए काम को विभाजित करें।" उन्होंने एक नए प्रकार की मस्तिष्क कोशिका बनाई जिसे स्पेस-टाइम ब्लॉक (Space-Time Block) कहा जाता है।
कल्पना कीजिए कि आप एक नृत्य का वर्णन करने की कोशिश कर रहे हैं।
- स्पेशियल स्टेप (Spatial Step): सबसे पहले, आप अभी डांसर की मुद्रा देखते हैं। क्या उनके हाथ ऊपर हैं? क्या उनके पैर चौड़े हैं? यह "स्पेशियल" हिस्सा है। रोबोट का नेटवर्क लेजर बीमों को एक घेरे में देखकर यह करता है, इस तथ्य का सम्मान करते हुए कि पहली बीम और अंतिम बीम वास्तव में एक-दूसरे के बगल में हैं (एक रिंग की तरह)।
- टेम्पोरल स्टेप (Temporal Step): इसके बाद, आप देखते हैं कि डांसर एक सेकंड से दूसरे सेकंड में कैसे मूव करता है। क्या वह घूमा? क्या उसने आगे कदम बढ़ाया? यह "टेम्पोरल" हिस्सा है।
इस पेपर की बड़ी खोज यह है कि यदि आप इन दो चरणों को अलग करते हैं—पहले आकार का विश्लेषण करना, फिर गति का विश्लेषण करना—तो रोबोट अनुमान लगाने में बहुत बेहतर हो जाता है। यह एक ऐसे विशेषज्ञ को रखने जैसा है जो "आकृतियों" के लिए है और एक ऐसा विशेषज्ञ जो "फिल्मों" के लिए है, जो एक साथ काम कर रहे हैं, बजाय एक सामान्य विशेषज्ञ के जो दोनों करने की कोशिश कर रहा है। यह विधि, जिसे फैक्टराइज्ड स्पैटियो-टेम्पोरल कन्वोल्यूशन (factorized spatio-temporal convolution) कहा जाता है, रोबोट को व्यक्ति को पहचानने और उनकी दिशा का अनुमान लगाने में उन पिछले तरीकों की तुलना में बहुत अधिक सटीक बनाती है जिन्होंने सब कुछ मिला दिया था।
"शैडो टीचर" (Shadow Teacher) ट्रिक
अब, यहाँ सबसे बड़ी बाधा है: यदि आपके पास लेजर स्कैन में लाखों घंटों के लेबल वाले मानव डेटा नहीं हैं, तो आप एक रोबोट को लेजर बीम से मनुष्यों को पहचानना कैसे सिखाएंगे? आमतौर पर, आपको हर लेजर स्कैन में हर व्यक्ति के चारों ओर बॉक्स खींचने के लिए एक इंसान को वहां बैठना होगा, जो उबाऊ और महंगा है।
लेखकों ने एक शानदार समाधान निकाला: सेल्फ-सुपरविज़न (Self-Supervision)। उन्होंने एक ऐसा रोबमान बनाया जिसके पास दोनों एक लेजर स्कैनर और एक नियमित कैमरा (डेप्थ सेंसिंग वाले वेबकैम की तरह) था। कैमरा लोगों को देखने में अच्छा है और जानता है कि वे कहाँ हैं और किस दिशा में देख रहे हैं। लेजर स्कैनर इसमें कमजोर है।
इसलिए, उन्होंने एक "शैडो टीचर" सिस्टम सेट किया। कैमरा व्यक्ति को देखता है और कहता है, "हे, 2 मीटर पर एक व्यक्ति है, उत्तर की ओर देख रहा है!" रोबोट फिर लेजर स्कैनर की जांच करता है। यदि लेजर बीम उसी स्थान से टकराती है, तो रोबोट कहता है, "ठीक है, मैं सीखूँगा कि लेजर डॉट्स का यह विशिष्ट पैटर्न 'उत्तर की ओर मुख किए हुए व्यक्ति' का अर्थ है।" लेकिन यहाँ ट्विस्ट यह है: रोबोट यह सबक केवल वहीं सीखता है जहाँ कैमरा देख सकता है। बाकी के 360-डिग्री घेरे के लिए (रोबोट के पीछे, जहाँ कैमरा नहीं देख सकता), रोबोट को यह अनुमान लगाने के लिए कि पीछे क्या हो रहा है, उस चीज़ का उपयोग करना होगा जो उसने सामने सीखा है। यह एक शांत कमरे में अपने दोस्त की आवाज़ पहचानने के सीखने जैसा है, और फिर उस कौशल का उपयोग भीड़ में उसे पहचानने के लिए करना जहाँ आप उसका चेहरा नहीं देख सकते।
परिणाम: तेज़, स्मार्ट और वास्तविक दुनिया के लिए तैयार
टीम ने अपने "स्पेस-टाइम ब्लॉक" रोबोट मस्तिष्क का पुराने, सरल मस्तिष्क के साथ परीक्षण किया। परिणाम प्रभावशाली थे।
- दूरी: नए रोबोट ने पुराने तरीके की तुलना में दूरी का अनुमान लगाने में 38% कम त्रुटि दिखाई।
- स्थिति: उसे पता था कि व्यक्ति कहाँ खड़ा है, जिसमें 28% कम त्रुटि थी।
- मुख की दिशा: उसने अनुमान लगाया कि व्यक्ति किस ओर देख रहा है, जिसमें 15% कम त्रुटि थी।
यहाँ तक कि अधिक रोमांचक बात यह है कि इस स्मार्ट मस्तिष्क को चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं थी। लेखकों ने एक मानक सर्विस रोबोट पर इसे एक सामान्य लैपटॉप प्रोसेसर (CPU) के साथ टेस्ट किया, और यह रियल-टाइम में काम करता है। यह लोगों को देख सकता था, अनुमान लगा सकता था कि वे कहाँ हैं, और यहाँ तक कि यह भी अनुमान लगा सकता था कि वे रोबोट की ओर देख रहे हैं या नहीं, जबकि रोबोट एक व्यस्त कार्यालय या गलियारे में घूम रहा था।
उन्होंने FROG नामक एक सार्वजनिक डेटासेट पर भी इसका परीक्षण किया (जो रोबोट विजन के लिए एक मानकीकृत परीक्षण की तरह है)। उनका मॉडल उन भारी-भरूक मॉडलों के समान प्रदर्शन करता है जिन्हें आमतौर पर शक्तिशाली ग्राफिक्स कार्ड (GPUs) की आवश्यकता होती है, लेकिन उनका मॉडल रोबोट के अपने छोटे कंप्यूटर पर सुचारू रूप से चलता है।
वास्तविक दुनिया का परीक्षण: वेटर रोबोट
यह साबित करने के लिए कि यह केवल लैब की ट्रिक नहीं है, उन्होंने रोबोट को एक वास्तविक दुनिया के परिदृश्य में रखा। उन्होंने इसे एक वेटर या रिसेप्शनिस्ट की तरह कार्य करने के लिए प्रोग्राम किया। रोबोट कमरे को स्कैन करेगा, एक व्यक्ति को ढूंढेगा, और यदि वह व्यक्ति रोबोट की ओर देख रहा है और पर्याप्त करीब है, तो रोबोट उसकी ओर बढ़ेगा, उसकी ओर मुड़ेगा, और एक "ऑफरिंग" (प्रस्तुत करने वाला) इशारा करते हुए अपना हाथ आगे बढ़ाएगा।
एक परीक्षण में, रोबोट ने सफलतापूर्वक एक व्यक्ति को पहचाना जो उसके सामने खड़ा था, भले ही वह व्यक्ति किसी अन्य वस्तु के पीछे आंशिक रूप से छिपा हुआ था। रोबोट ने सही ढंग से अनुमान लगाया कि व्यक्ति वहाँ था और उसकी ओर देख रहा था। हालाँकि, पेपर यह भी नोट करता है कि इसकी सीमाएँ हैं: यदि दो लोग रोबोट के दृष्टिकोण से बिल्कुल एक के ऊपर एक खड़े हैं (एक ही लेजर बीम पर), तो रोबोट भ्रमित हो जाता है और केवल एक को ही देख पाता है। साथ ही, यदि कमरा बहुत अधिक अव्यवस्थित है, तो अनुमान लगाना कठिन होता है। लेकिन कुल मिलाकर, प्रयोग ने दिखाया कि यह हल्का, समय-जागरूक दृष्टिकोण, एक ठोस कदम है जिससे रोबोट बिना महंगे, भारी उपकरणों की आवश्यकता के हमारे संसार में सुरक्षित रूप से और सामाजिक रूप से नेविगेट कर सकते हैं।
संक्षेप में, रोबोट को केवल लेजर स्कैन के "स्थिर फ्रेम" के बजाय उनके "मूवी" को देखना सिखाकर, और एक कैमरे को लेजर को देखना सिखाने देकर, लेखकों ने एक रोबोट विजन सिस्टम बनाया जो स्मार्ट, तेज़ और वास्तविक दुनिया के लिए तैयार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।