Gesture Matters: Pedestrian Gesture Recognition for AVs Through Skeleton Pose Evaluation
यह अध्ययन स्वायत्त वाहनों के लिए एक जेस्चर वर्गीकरण ढांचे को प्रस्तुत करता है जो पैदल यात्रियों के जेस्चर को चार वर्गों में वर्गीकृत करने के लिए WIVW डेटासेट से निकाले गए 2D पोज़ एस्टीमेशन और 76 विशेषताओं का उपयोग करता है, जो हाथ की स्थिति और गति के वेग की विभेदक शक्ति को उजागर करते हुए 87% सटीकता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक व्यस्त शहर की सड़क की कल्पना एक विशाल, अराजक डांस फ्लोर के रूप में करें। दशकों से, मनुष्य एक साथ सुरक्षित रूप से नाच रहे हैं क्योंकि हम उनके स्टेप्स (कदमों) को जानते हैं: आंखों का संपर्क, एक सिर हिलाना, या एक त्वरित हाथ हिलाना यह कहने के लिए कि "पहले आप जाएं" या "मैं रुक रहा हूं।" लेकिन अब, हम इस डांस फ्लोर पर एक नया डांसर पेश कर रहे हैं: स्वायत्त वाहन (Autonomous Vehicle - AV)। समस्या क्या है? AV एक रोबोट है जो "मानवीय शारीरिक भाषा" (human body language) नहीं बोलता। वह वहां खड़े एक व्यक्ति को देखता है, लेकिन उसे यह नहीं पता कि वह व्यक्ति सड़क पार करने वाला है, नमस्ते कर रहा है, या बस स्थिर खड़ा है।
यह शोध पत्र एक अनुवादक की तरह है जो रोबोट को पैदल यात्रियों के डांस मूव्स (नृत्य की मुद्राओं) को समझने के लिए सिखाने की कोशिश कर रहा है।
समस्या: रोबोट का "सामाजिक अंधापन" (Social Blindness)
वास्तविक दुनिया में, यातायात के नियम खेल के लिखित नियमों की तरह हैं, लेकिन वे पर्याप्त नहीं हैं। कभी-कभी, आपको बातचीत (negotiate) करने की आवश्यकता होती है। यदि कोई ड्राइवर और पैदल यात्री गतिरोध (deadlock) में फंस जाते हैं, तो वे गैर-मौखिक संकेतों (non-verbal cues) का उपयोग करते हैं—जैसे हाथ हिलाना या सिर हिलाना—यह कहने के लिए कि "आगे बढ़ें।" मनुष्य इसमें माहिर हैं; हम एक छोटे से सिर के झुकाव या हाथ के उठने को तुरंत पढ़ सकते हैं।
हालाँकि, स्वायत्त वाहन वर्तमान में "सामाजिक रूप से अंधे" हैं। वे सख्त नियमों और सेंसरों पर निर्भर करते हैं। यदि वे इन सूक्ष्म सामाजिक संकेतों को नहीं पढ़ पाते हैं, तो वे या तो फंस सकते हैं, बहुत अधिक सतर्क हो सकते हैं, या इससे भी बुरा, वे उस संकेत को मिस कर सकते हैं कि कोई व्यक्ति सड़क पार करने वाला है।
समाधान: रोबोट को "कंकाल" (Skeleton) देखना सिखाना
शोधकर्ताओं ने एक ऐसा सिस्टम बनाने का निर्णय लिया जो AV को किसी व्यक्ति के कंकाल (skeleton) को "देखने" और उनकी गतिविधियों की व्याख्या करने में मदद करे। उन्होंने केवल व्यक्ति के कपड़ों या चेहरे को नहीं देखा; उन्होंने व्यक्ति के अंदर के "स्टिक फिगर" (कंकाल) को देखा ताकि गति की ज्यामिति (geometry) को समझा जा सके।
डेटासेट: वास्तविक दुनिया के मूव्स का एक पुस्तकालय
अपने सिस्टम को प्रशिक्षित करने के लिए, उन्होंने WIVW डेटासेट नामक वीडियो का एक विशेष संग्रह उपयोग किया। इसे वास्तविक जीवन में विशिष्ट इशारों को करने वाले लोगों के वीडियो संग्रह के रूप में समझें। शोधकर्ताओं ने सैकड़ों वीडियो में से उन्हें छांटा जो चार विशिष्ट "डांस मूव्स" से मेल खाते थे जिन्हें वे रोबोट द्वारा पहचाने जाने के लिए चाहते थे:
- रुकें (Stop): "रुको, मैं पार कर रहा हूँ।"
- जाएं (Go): "आप आगे बढ़ सकते हैं।"
- धन्यवाद और अभिवादन (Thank & Greet): धन्यवाद कहने या नमस्ते कहने के लिए हाथ हिलाना या "थम्स अप" देना।
- कोई इशारा नहीं (No Gesture): बस वहां बिना कुछ किए खड़ा होना।
सिस्टम कैसे काम करता है: "पोज़" और "पल्स" (The "Pose" and the "Pulse")
शोधकर्ताओं ने समस्या को दो भागों में विभाजित किया, जैसे किसी गाने का विश्लेषण उसके बोल (lyrics) और उसकी लय (rhythm) के आधार पर किया जाता है।
1. स्टेटिक पोज़ (बोल - The "Lyrics")
यह इस बारे में है कि एक विशिष्ट क्षण में शरीर के अंग कहाँ हैं।
- रूपक (Metaphor): एक वीडियो फ्रेम को फ्रीज करने की कल्पना करें। हाथ कहाँ हैं? क्या वे सिर के ऊपर हैं? क्या वे छाती के स्तर पर हैं?
- ट्रिक: शोधकर्ताओं ने महसूस किया कि केवल हाथों को देखना पर्याप्त नहीं है क्योंकि एक "स्टॉप" साइन (हाथ ऊपर) "हेलो" (हाथ ऊपर) जैसा दिख सकता है। इसे ठीक करने के लिए, उन्होंने हर व्यक्ति के लिए एक "रूलर" (पैमाना) बनाने के लिए कंधों और कूल्हों के बीच की दूरी को मापा। इस तरह, एक लंबे व्यक्ति और एक छोटे व्यक्ति की तुलना निष्पक्ष रूप से की जा सकती है। उन्होंने पाया कि हाथों की स्थिति एक बहुत बड़ा सुराग है।
2. डायनेमिक मोशन (लय - The "Rhythm")
यह इस बारे में है कि समय के साथ शरीर के अंग कैसे चलते हैं।
- रूपक: यदि आप "स्टॉप" जेस्चर को फ्रीज करते हैं, तो यह एक मूर्ति जैसा दिखता है। यदि आप "हेलो" जेस्टर को फ्रीज करते हैं, तो यह भी वैसा ही दिख सकता है, लेकिन "हेलो" में आमतौर पर एक वेव (आगे-पीछे हिलना) शामिल होता है।
- ट्रिक: सिस्टम ने हाथों की गति (speed) और त्वरण (acceleration) की गणना की। एक "स्टॉप" जेस्चर अक्सर स्थिर रहता है, जबकि एक "थैंक एंड ग्रीट" में एक तेज़, लयबद्ध लहर (wave) शामिल होती है। हाथ की गति का वेग एक प्रमुख अंतर पैदा करने वाला कारक बन गया।
परिणाम: डांस को सही ढंग से करना
शोधकर्ताओं ने अपने सिस्टम का परीक्षण एक "रैंडम फॉरेस्ट" एल्गोरिदम (इसे एक निर्णय लेने वाली टीम के रूप में समझें जो वोटिंग के माध्यम से तय करती है कि जेस्चर क्या है) का उपयोग करके किया।
- स्कोर: जब उन्होंने "लिरिक्स" (स्थिर स्थिति) और "रिदम" (गति/मूवमेंट) को मिलाया, तो सिस्टम ने 87% जेस्चर्स को सही ढंग से पहचाना।
- ब्रेकथ्रू (बड़ी उपलब्धि): सिस्टम को "स्टॉप" और "थैंक एंड ग्रीट" के बीच अंतर करने में सबसे अधिक कठिनाई हुई जब उसने केवल स्थिति (position) को देखा। लेकिन एक बार जब इसने हाथ की गति को सुनना शुरू किया, तो यह उन्हें पहचानने में बहुत बेहतर हो गया।
- मुख्य अंतर्दृष्टि: सबसे महत्वपूर्ण सुराग यह थे कि हाथ कहाँ था और वह कितनी तेजी से चल रहा था। विशेष रूप से, बाएं हाथ की गति सबसे बड़ा संकेत थी, क्योंकि संभवतः सड़क के किनारे खड़े पैदल यात्री कारों को संकेत देने के लिए अपने बाएं हाथ का उपयोग करते हैं।
निष्कर्ष
यह शोध पत्र यह दावा नहीं करता है कि इसने अभी तक हर ट्रैफिक समस्या को हल कर दिया है। इसके बजाय, इसने एक ठोस नींव बनाई है। इसने दिखाया कि यदि आप एक AV को कंकाल के पोज़ (pose) को देखने और हाथों की गति को मापने के लिए प्रशिक्षित करते हैं, तो वह उच्च सटीकता के साथ पैदल यात्रियों के इशारों को समझ सकता है।
यह सुनिश्चित करने की दिशा में एक कदम है कि जब शहर के डांस फ्लोर पर एक रोबोट और एक इंसान मिलते हैं, तो वे अंततः एक-दूसरे के कदमों पर पैर रखे बिना एक-दूसरे के मूव्स को समझ सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।