InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring
यह शोध पत्र InCarEmo को प्रस्तुत करता है, जो ड्राइवर भावना पहचान, थकान का पता लगाने और व्याकुलता की निगरानी को उन्नत करने के लिए स्क्रिप्टेड इन-कैबिन परिदृश्यों से RGB, इन्फ्रारेड, ऑडियो और संवाद टेक्स्ट को एकीकृत करने वाला एक व्यापक मल्टीमॉडल डेटासेट है, जो मौजूदा विजुअल-ओनली (केवल दृश्य) डेटासेट्स की सीमाओं को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कार चला रहे हैं, लेकिन केवल स्टीयरिंग व्हील और पेडल के बजाय, आपके वाहन का अपना एक व्यक्तित्व विकसित होने लगा है। वह जानना चाहता है कि क्या आप खुश हैं, थके हुए हैं, या विचलित हैं ताकि वह आपको सुरक्षित रखने में मदद कर सके। यह "अफेक्टिव कंप्यूटिंग" (affective computing) की दुनिया है—एक फैंसी शब्द जो कंप्यूटर को मानवीय भावनाओं को समझना सिखाने के लिए उपयोग किया जाता है। इसे एक सुपर-स्मार्ट सह-पायलट की तरह समझें जो न केवल सड़क को पढ़ता है, बल्कि आपको भी पढ़ता है। लंबे समय से, वैज्ञानिक आपके चेहरे को देखकर या आपकी आवाज़ सुनकर इस सह-पायलट को बनाने की कोशिश कर रहे हैं। लेकिन एक समस्या है: उन्होंने जिस प्रशिक्षण डेटा (training data) का उपयोग किया है, वह एक ब्लैक-एंड-व्हाइट फिल्म की तरह है। यह केवल चेहरा दिखाता है या केवल आवाज़ सुनता है, और यह अक्सर इस तथ्य को अनदेखा कर देता है कि जब हम गाड़ी चलाते हैं, तो हम आमतौर पर किसी और व्यक्ति या चीज़ से बात कर रहे होते हैं। यह किसी चुटकुले को समझने की कोशिश करने जैसा है जिसमें केवल व्यक्ति के मुँह को देखा जा रहा हो, बिना पंचलाइन सुने। एक वास्तव में सुरक्षित और सहानुभूतिपूर्ण कार बनाने के लिए, हमें पूरी तस्वीर को समझने की आवश्यकता है: चेहरा, आवाज़, शब्द और यहाँ तक कि बातचीत का मिजाज भी।
यहाँ InCarEmo आता है, जो हारबिन इंस्टीट्यूट ऑफ टेक्नोलॉजी और SERES के शोधकर्ताओं द्वारा एक नया प्रोजेक्ट है, जो कार के कंप्यूटर को वास्तविक ड्राइविंग जीवन की एक फुल-कलर, सराउंड-साउंड मूवी देने जैसा है। टीम ने महसूस किया कि मौजूदा डेटासेट में पहेली का एक महत्वपूर्ण हिस्सा गायब था: कार के अंदर चल रही वास्तविक बातचीत। उन्होंने InCarEmo नामक एक विशाल नया डेटा लाइब्रेरी बनाया, जो ड्राइवरों को न केवल सड़क की ओर देखते हुए, बल्कि ट्रैफ़िक के बारे में चर्चा करते हुए, यात्रा की योजना बनाते हुए, या स्वयं कार के बारे में बात करते हुए कैप्चर करता है। उन्होंने इन क्षणों को हाई-डेफिनिशन कैमरों (नियमित और इन्फ्रारेड दोनों, जो अंधेरे में देख सकते हैं), उच्च गुणवत्ता वाले माइक्रोफ़ोन का उपयोग करके रिकॉर्ड किया, और बोले गए सटीक शब्दों को भी ट्रांसक्राइब (लिखा) किया।
यह पेपर इस डेटासेट को तीन मुख्य कार्यों के लिए एक टूलकिट के रूप में पेश करता है: यह पता लगाना कि ड्राइवर क्या भावना महसूस कर रहा है (जैसे क्रोध या चिंता), यह पहचानना कि क्या वे गाड़ी चलाने के लिए बहुत थक गए हैं, और यह नोटिस करना कि क्या वे अपने फोन या ड्रिंक से विचलित हो रहे हैं। यह परीक्षण करने के लिए कि क्या यह नया डेटा काम करता है, शोधकर्ताओं ने CAMEL नामक एक हल्का AI मॉडल बनाया। उन्होंने पाया कि जब AI ने सभी जानकारी का एक साथ उपयोग किया—दृष्टि, ध्वनि और शब्द—तो वह केवल एक इंद्रिय के उपयोग की तुलना में ड्राइवर की स्थिति का अनुमान लगाने में बहुत बेहतर था। उदाहरण के लिए, कम रोशनी वाली स्थितियों में जहाँ कैमरा संघर्ष कर सकता है, ऑडियो और टेक्स्ट के संकेतों ने AI को सटीक रहने में मदद की। अध्ययन ने शोधकर्ताओं को एक साथ मिलकर काम करने में मदद करने के लिए इस डेटा का एक विशेष अंग्रेजी संस्करण भी बनाया, हालांकि उन्होंने उल्लेख किया कि भाषाओं के माध्यम से भावनाओं का अनुवाद करना कठिन है। अंततः, यह पेपर सुझाव देता है कि ड्राइवर की दुनिया को AI को एक समृद्ध, अधिक यथार्थवादी दृश्य देकर, हम ऐसी कारें बना सकते हैं जो न केवल स्मार्ट हैं, बल्कि वास्तव में समझदार और सड़क पर सभी के लिए अधिक सुरक्षित हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।