← नवीनतम पेपर
🤖 AI

Spatiotemporal Facial Action Unit Detection using Twin Cycle Autoencoders for Driver Monitoring

यह शोध पत्र ट्विन साइकिल ऑटोएनकोडर (TCA) का प्रस्ताव करता है, जो एक नवीन स्थानिक-कालिक (spatiotemporal) आर्किटेक्चर है जो चुनौतीपूर्ण इन-कैबिन स्थितियों के तहत ड्राइवर मॉनिटरिंग के लिए फेशियल एक्शन यूनिट्स को मजबूती से पहचानने हेतु स्थानिक उपस्थिति पृथक्करण (spatial appearance disentanglement) और कालिक प्रक्षेपवक्र निरंतरता (temporal trajectory consistency) को एकीकृत करता है, जो एम्बेडेड हार्डवेयर पर रीयल-टाइम थ्रूपुट बनाए रखते हुए बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Sai Sidharth D

प्रकाशित 2026-07-21✓ Author reviewed
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sai Sidharth D

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन आपका एकमात्र सुराग एक झिलमिलाता, दानेदार सुरक्षा कैमरा फीड है। आप किसी चोर की तलाश नहीं कर रहे हैं; आप एक ऐसे ड्राइवर की तलाश कर रहे हैं जो गाड़ी चलाते समय झपकी लेने वाला है। यह ड्राइवर मॉनिटरिंग सिस्टम्स (DMS) की दुनिया है, कंप्यूटर विज्ञान का एक ऐसा क्षेत्र जो हमें यह देखते हुए सुरक्षित रखने के लिए समर्पित है कि हम गाड़ी चलाते समय कैसे दिखते हैं। वर्षों से, ये सिस्टम सरल तरकीबों पर निर्भर रहे हैं, जैसे कि आपकी आँखें कितनी देर तक बंद रहती हैं यह गिनना या यह देखना कि आप गाड़ी को कितना लहरा रहे हैं। लेकिन असली कहानी हमारे चेहरे की मांसपेशियों के सूक्ष्म, अनैच्छिक संकुचन में लिखी होती है। वैज्ञानिक इन सूक्ष्म गतिविधियों को "एक्शन यूनिट्स" (AUs) कहते हैं। एक AU को एक एकल, परमाणु मांसपेशी कमांड के रूप में समझें—जैसे कि वह विशिष्ट संकुचन जो जम्हाई लेते समय होता है, या नींद से लड़ने के दौरान आपकी पलकों का हल्का सा खिंचाव। चुनौती यह है कि कार के अंदर, रोशनी चकाचौंध करने वाली धूप से लेकर घने अंधेरे तक बदलती रहती है, आपका सिर इधर-उधर हिलता रहता है, और कभी-कभी आप धूप का चश्मा भी पहनते हैं। यह एक अराजक वातावरण है जहाँ एक कंप्यूटर को एक सेकंड से भी कम समय में होने वाले मांसपेशी संकुचन को पहचानना होता है, जो अक्सर छाया या कांच के पीछे छिपा होता है।

यह शोध पत्र एक नए प्रकार के डिजिटल जासूस को पेश करता है जिसे "ट्विन साइकिल ऑटोएनकोडर" (TCA) कहा जाता है। केवल यह अनुमान लगाने के लिए कि ड्राइवर क्या महसूस कर रहा है, एक सिंगल स्नैपशॉट देखने के बजाय, यह सिस्टम चेहरे की कहानी को समय के साथ समझने के लिए दो चतुर "लूप्स" का उपयोग करता है। पहला लूप, "स्पेशियल" (स्थानिक) शाखा, यह सीखना सीखती है कि व्यक्ति कौन है या उसने क्या पहना है, इसे नजरअंदाज करते हुए मांसपेशियों की गतिविधियों को कैसे पहचाना जाए। दूसरा लूप, "टेम्पोरल" (सामयिक) शाखा, एक 'टाइम-ट्रैवलिंग एडिटर' की तरह कार्य करती है, जो वीडियो को आगे और फिर पीछे चलाकर यह सुनिश्चित करती है कि गति की कहानी दोनों दिशाओं में सही हो। इन दोनों लूप्स को एक-दूसरे के साथ सहमत होने के लिए मजबूर करके, सिस्टम थकान के सबसे सूक्ष्म संकेतों, जैसे कि धीमी पलक झपकना या आधा खुला मुंह, को पकड़ने में सक्षम होता है, भले ही कैमरा संघर्ष कर रहा हो। शोधकर्ताओं ने इसे मानक डेटासेट्स और एक वास्तविक-दुनिया के ड्राइविंग सिम्युलेटर पर परखा, जिसमें पाया गया कि उनका "ट्विन" सिस्टम थकान के इन सूक्ष्म और क्षणिक संकेतों को पकड़ने में पुराने तरीकों की तुलना में बहुत बेहतर है, और यह आज के वास्तविक कार में उपयोग किए जाने के लिए पर्याप्त तेज़ है।

समस्या: अराजक कार केबिन

कार के भीतर उनींदेपन का पता लगाना बेहद कठिन है। एक शांत लैब में, कैमरा आसानी से जम्हाई को पहचान सकता है। लेकिन एक चलती हुई गाड़ी के अंदर, दुनिया चुनौतियों का एक ढेर है। सूरज लेंस पर सीधी चमक डाल सकता है, और फिर अचानक कार एक अंधेरी सुरंग में प्रवेश कर सकती है। ड्राइवर ब्लाइंड स्पॉट देखने के लिए अपना सिर घुमा सकता है, या धूप का चश्मा पहन सकता है जो उसकी आँखों को छिपा देता है। इसके अलावा, थकान के संकेत अविश्वसनीय रूप से सूक्ष्म होते हैं। ड्राइवर अभी सोया नहीं है; वह केवल थकान के एक 'माइक्रो-एक्सप्रेशन' से गुजर रहा हो सकता है—भौं का एक छोटा सा संकुचन या लगभग अदृश्य पलक झपकना। ये संकेत इतने हल्के और अल्पकालिक होते हैं कि पुराने कंप्यूटर मॉडल, जो आमतौर पर एक समय में एक फ्रेम देखते हैं, उन्हें अक्सर पूरी तरह से मिस कर देते हैं। वे इसलिए भी संघर्ष करते हैं क्योंकि लेबल किया गया डेटा कम है; विशेषज्ञों द्वारा हर एक मांसपेशी संकुचन को मैन्युअल रूप से मार्क करने वाला हजारों घंटों का ड्राइविंग वीडियो प्राप्त करना महंगा और कठिन है।

समाधान: ट्विन साइकिल ऑटोएनकोडर

लेखक एक समाधान प्रस्तावित करते हैं जिसे ट्विन साइकिल ऑटोएनकोडर (TCA) कहा जाता है। यह समझने के लिए कि यह कैसे काम करता है, कल्पना करें कि आप एक रोबोट को एक विशिष्ट नृत्य मुद्रा पहचानने के लिए सिखाने की कोशिश कर रहे हैं, लेकिन आपके पास उस नृत्य का वीडियो नहीं है, बल्कि केवल यादृच्छिक फोटो का एक ढेर है।

1. दो शाखाएं (जुड़वां)
TCA दो जुड़वा भाइयों की तरह बना है जो अलग-अलग कौशल में विशेषज्ञ हैं लेकिन मिलकर काम करते हैं:

  • स्पेशियल ट्विन ("लाइक-अ-लाइक" डिटेक्टर): यह शाखा वीडियो के एक सिंगल फ्रेम को देखती है। इसका काम उन सभी चीजों को हटाना है जो मांसपेशी की गति नहीं है। यह ड्राइवर की पहचान, उसके बालों की शैली, या टोपी पहनने को नजरअंदाज करता है। यह पूरी तरह से "एक्शन यूनिट" यानी विशिष्ट मांसपेशी के आकार पर ध्यान केंद्रित करता है। यह एक "साइकिल" ट्रिक का उपयोग करता है: यह मांसपेशी डेटा से चेहरे को फिर से बनाने (rebuild) की कोशिश करता है। यदि यह चेहरे को सही ढंग से फिर से बना सकता है, तो यह जानता है कि इसने सही मांसपेशी जानकारी को कैप्चर कर लिया है।
  • टेम्पोरल ट्विन ("टाइम-ट्रैवल" एडिटर): यह शाखा वीडियो के एक छोटे क्लिप (लगभग 1.6 सेकंड लंबा) को देखती है। यह देखता है कि चेहरा समय के साथ आगे बढ़ रहा है, और फिर यह वीडियो को पीछे चलाने की कोशिश करता है। यह यहाँ भी एक "साइकिल" ट्रिक का उपयोग करता है: यदि गति आगे की ओर सही लगती है, तो उसे पीछे की ओर भी सही लगना चाहिए। यह सिस्टम को केवल एक स्थिर चित्र के बजाय जम्हाई या पलक झपकने की लय (rhythm) को समझने में मदद करता है।

2. हैंडशेक (लेटेंट अलाइनमेंट)
ये दोनों जुड़वां अकेले काम नहीं करते हैं। वे एक "हैंडशेक" तंत्र द्वारा जुड़े हुए हैं। सिस्टम यह सुनिश्चित करने के लिए मजबूर करता है कि स्पेशियल ट्विन की किसी विशिष्ट क्षण की चेहरे की समझ, टेम्पोरल ट्विन की उसी क्षण की गति की समझ से मेल खाती हो। यह सुनिश्चित करता है कि "दिखावट" और "गति" एक ही कहानी कह रहे हैं। यदि टेम्पोरल ट्विन देखता है कि जम्हाई शुरू हो रही है, तो स्पेशियल ट्विन को सहमत होना चाहिए कि मुंह खुल रहा है, भले ही रोशनी खराब हो।

3. बिना शिक्षक के सीखना (सेल्फ-सुपरवाइज्ड लर्निंग)
इस सिस्टम का सबसे शक्तिशाली पहलू यह है कि यह कैसे सीखता है। आमतौर पर, AI को प्रशिक्षित करने के लिए आपको एक विशाल डेटासेट की आवश्यकता होती है जहाँ मनुष्यों ने हर एक मांसपेशी संकुचन को लेबल किया हो। लेकिन ड्राइविंग के मामले में, ऐसा डेटा दुर्लभ है। TCA अपने "साइकिल" ट्रिक्स का उपयोग करके इस कमी को दूर करता है और खुद से सीखने के लिए अनलेबल ड्राइविंग वीडियो का उपयोग करता है। यह सीखता है कि एक "सामान्य" चेहरा कैसा दिखता है और कैसे हिलता है, बस वीडियो को आगे और पीछे देखकर। बाद में, यह थकान के विशिष्ट संकेतों को पहचानने की अपनी क्षमता को बेहतर बनाने के लिए लेबल किए गए डेटा के एक छोटे से हिस्से का उपयोग करता है।

उन्होंने क्या पाया

शोधकर्ताओं ने अपने "ट्विन" सिस्टम का परीक्षण कई अन्य लोकप्रिय तरीकों के विरुद्ध किया, जिनमें वे सिस्टम शामिल हैं जो केवल सिंगल फ्रेम देखते हैं, वे जो 3D वीडियो फिल्टर का उपयोग करते हैं, और वे जो ग्राफ नेटवर्क का उपयोग करते हैं। उन्होंने इसे मानक बेंचमार्क (DISFA और BP4D) और एक सिम्युलेटर में वास्तविक ड्राइवरों के साथ रिकॉर्ड किए गए प्राकृतिक ड्राइविंग डेटासेट पर परखा।

  • सूक्ष्मता को पकड़ने में बेहतर: TCA ने अन्य सभी तरीकों को लगातार पछाड़ दिया। यह कम तीव्रता वाले या बहुत तेज़ AUs, जैसे कि AU45 (आंखें बंद होना) और AU43 (आंखें धीरे-धीरे बंद होना), को पहचानने में विशेष रूप से अच्छा था, जो उनींदेपन के प्रमुख संकेत हैं। यह AU26 (जबड़ा गिरना) के साथ भी अच्छा प्रदर्शन करता है, जो जम्हाई का संकेत है।
  • समय की शक्ति: जब उन्होंने "टेम्पोरल" शाखा (टाइम-ट्रैवल एडिटर) को हटा दिया, तो सिस्टम का प्रदर्शन काफी गिर गया। इससे यह साबित हुआ कि थकान को पहचानने के लिए समय के साथ गति को देखना महत्वपूर्ण है।
  • स्व-शिक्षण की शक्ति: जब उन्होंने बिना प्री-ट्रेनिंग वाले TCA की तुलना सेल्फ-सुपरवाइज्ड प्री-ट्रेनिंग वाले संस्करण से की, तो प्री-ट्रेन किया गया संस्करण बहुत बेहतर था। यह सुझाव देता है कि सिस्टम ने अनलेबल ड्राइविंग फुटेज से उपयोगी पैटर्न सफलतापूर्वक सीख लिए हैं, जिससे लेबल किए गए डेटा की कमी के कारण पैदा हुआ अंतर भर गया है।
  • वास्तविक दुनिया की गति: सिस्टम न केवल सटीक था, बल्कि तेज़ भी था। एक एम्बेडेड कंप्यूटर (NVIDIA Jetson Xavier NX) पर परीक्षण करने पर, जो कार के अंदर फिट हो सकता है, सिस्टम 28.4 फ्रेम प्रति सेकंड की गति से चला। यह वास्तविक समय में ड्राइवर को अलर्ट देने के लिए पर्याप्त तेज़ है, जो सुरक्षा प्रणालियों के लिए आवश्यक 10-15 fps से भी अधिक है।

सीमाएं और भविष्य के कदम

यह सिस्टम पूर्ण नहीं है। शोधकर्ताओं ने पाया कि जब ड्राइवर धूप का चश्मा पहनते थे, तो सिस्टम ऊपरी चेहरे (जैसे भौंहों या पलकों) से संबंधित AUs के साथ संघर्ष करता था। चश्मा दृश्य को बाधित कर देता था, और सिस्टम केवल निचले चेहरे की गति से "अनुमान" नहीं लगा पाता था। हालांकि, यह निचले चेहरे की क्रियाओं जैसे जम्हाई के लिए मजबूत बना रहा, क्योंकि मुंह दिखाई दे रहा था।

यह शोध पत्र निष्कर्ष निकालता है कि यह "ट्विन साइकिल" दृष्टिकोण अगले पीढ़ी के ड्राइवर मॉनिटरिंग के लिए एक व्यवहार्य मार्ग है। यह सुझाव देता है कि स्थानिक और सामयिक चक्रों को जोड़कर, और अनलेबल डेटा का अधिकतम लाभ उठाने के लिए सेल्फ-सुपरवाइज्ड लर्निंग का उपयोग करके, हम ऐसे सिस्टम बना सकते हैं जो सटीक और व्यावहारिक दोनों हों। भविष्य का कार्य सिस्टम को बाधाओं (जैसे धूप का चश्मा) को बेहतर ढंग से संभालने के लिए सिखाने और चेहरे के संकेतों को अन्य डेटा (जैसे स्टीयरिंग व्हील की गतिविधियों) के साथ जोड़ने पर केंद्रित होगा, ताकि थकान की एक स्पष्ट तस्वीर मिल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →