CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition
यह शोध पत्र CALM-AH प्रस्तुत करता है, जो एक मल्टीमॉडल एन्सेम्बल सिस्टम है जिसे रिलायबिलिटी-गेटेड मल्टी-एक्सपर्ट कंसेंसस (RG-MEC) तंत्र द्वारा उन्नत किया गया है, जो वीडियो-स्तर की अनिश्चितता (ambivalence) और हिचकिचाहट (hesitancy) को पहचानने के लिए विविध फीचर शाखाओं को यूनैनिमिटी-गेटेड करेक्शन रणनीति के साथ जोड़कर ABAW11 चुनौती पर 0.7771 का मैक्रो-F1 स्कोर प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कमरे में बैठे हैं, और यह समझने की कोशिश कर रहे हैं कि क्या कोई व्यक्ति वास्तव में एक बड़े निर्णय को लेकर अनिश्चित है। वे शायद कह सकते हैं, "मुझे लगता है कि मैं जाऊँगा," लेकिन उनकी आवाज़ डगमगाती है, वे लंबे समय तक रुकते हैं, और वे बार-बार फर्श की ओर देखते रहते हैं। या शायद वे कहते हैं, "मैं निश्चित रूप से आश्वस्त हूँ," जबकि वे घबराहट में बेचैन हो रहे होते हैं। शब्दों, ध्वनियों और शारीरिक भाषा का यह जटिल मिश्रण एम्बीवैलेंस (ambivalence) (मिश्रित भावनाएं) या हेसिटेंसी (hesitancy) (अनिश्चितता) कहलाता है। यह एक सूक्ष्म मानवीय अवस्था है जो नौकरी के साक्षात्कार से लेकर थेरेपी सत्रों तक हर समय होती रहती है, लेकिन कंप्यूटर के लिए इसे पहचानना अविश्वसनीय रूप से कठिन है। एक साधारण मुस्कान या उदासी के विपरीत, एम्बीवैलेंस शब्दों के बीच के अंतराल, आवाज़ की लय और मांसपेशियों की हल्की सी हरकत में छिपे एक गुप्त कोड की तरह है। यदि हम मशीनों को इन संकेतों को पढ़ना सिखा सकें, तो हम लोगों को कठिन निर्णय लेने में मदद करने या एक-दूसरे को बेहतर ढंग से समझने के लिए बेहतर उपकरण बना सकते हैं। यही वह चुनौती है जिसे मोनाश यूनिवर्सिटी के शोधकर्ताओं के एक समूह ने हल करने का बीड़ा उठाया है।
यहाँ आता है CALM-AH, एक नया डिजिटल जासूसी दल जिसे मानवीय अनिश्चितता के मामले को सुलझाने के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने महसूस किया कि केवल एक सुराग देखना—जैसे केवल ट्रांसक्रिप्ट को पढ़ना या केवल चेहरे को देखना—एक धुंधली तस्वीर के साथ रहस्य सुलझाने जैसा है। आपको पूरी तस्वीर की आवश्यकता है। इसलिए, उन्होंने एक ऐसा सिस्टम बनाया है जो एक बहुत ही व्यवस्थित जूरी (पंचायत) की तरह काम करता है। एक जज के बजाय, उनके पास 15 अलग-अलग "जूरी सदस्य" हैं, जिनमें से प्रत्येक सुरागों के एक अलग संयोजन को देखता है: कुछ आवाज़ सुनते हैं, कुछ शब्दों को पढ़ते हैं, कुछ चेहरे को देखते हैं, और कुछ यहाँ तक कि व्यक्ति के व्यवहार के अजीब सांख्यिकीय पैटर्न को भी ट्रैक करते हैं।
यह टीम इस प्रकार काम करती है: सबसे पहले, वे सभी सबूत इकट्ठा करते हैं। वे बोले गए शब्दों को टेक्स्ट में बदलने, आवाज़ की लय और ठहराव का विश्लेषण करने और चेहरे के भावों को स्कैन करने के लिए स्मार्ट AI टूल्स का उपयोग करते हैं। फिर, वे इन सुरागों को 15 अलग-अलग तरीकों से मिलाते और जोड़ते हैं। प्रत्येक मिश्रण के लिए, वे सबसे अच्छे "डिटेक्टिव" (एक प्रकार का कंप्यूटर एल्गोरिदम) को चुनते हैं और उसे ठीक से सिखाते हैं कि कब "दोषी!" (एम्बीवैलेंट) या "निर्दोष!" (नॉट एम्बीवैलेंट) चिल्लाना है। ये 15 डिटेक्टिव फिर अंतिम निर्णय के लिए वोट करते हैं। यदि अधिकांश लोग सहमत होते हैं, तो वही फैसला होता है। सिस्टम का यह हिस्सा, जिसे CALM-AH कहा जाता है, पहले से ही काफी अच्छा था, जिसने उन लोगों पर परीक्षण किया जिनसे वह कभी नहीं मिला था, और 0.7525 का स्कोर प्राप्त किया।
लेकिन शोधकर्ता वहीं नहीं रुके। वे जानते थे कि बुद्धिमान जासूस भी गलतियाँ कर सकते हैं। कभी-कभी एक जासूस किसी तेज़ शोर या किसी पेचीदा वाक्य से भ्रमित हो सकता है। इसलिए, उन्होंने एक विशेष "सेफ्टी नेट" जोड़ा जिसे RG-MEC (रिलायबिलिटी-गेटेड मल्टी-एक्सपर्ट कंसेंसस) कहा जाता है। इसे निर्णय बदलने के लिए एक बहुत ही सख्त नियम के रूप में समझें। सिस्टम एक "डिफ़ॉल्ट जज" के साथ शुरू होता है जो पहला फैसला करता है। उस जज का मन बदलने के लिए, आपको केवल एक अन्य विशेषज्ञ के असहमत होने की आवश्यकता नहीं है; आपको तीन विशिष्ट विशेषज्ञों की आवश्यकता है जो एक ही समय में ठीक उसी नए उत्तर पर सहमत हों।
ये तीन विशेषज्ञ हैं:
- CALM-AH (वह 15-डिटेक्टिव टीम जिससे हम अभी मिले)।
- AffectGPT (एक AI जो भावनाओं और संवेदनाओं को समझने में बहुत कुशल है)।
- एक GPT-आधारित वेरीफायर (एक AI जो बोले गए शब्दों के अर्थ और तर्क को समझने में माहिर है)।
यदि डिफ़ॉल्ट जज कहता है "नॉट एम्बीवैलेंट," लेकिन CALM-AH, AffectGPT और वेरीफायर तीनों एक साथ "एम्बीवैलेंट!" चिल्लाते हैं, तभी सिस्टम अपना निर्णय बदलता है। यदि उनमें से एक भी अनिश्चित है या असहमत है, तो सिस्टम मूल जज के निर्णय पर टिका रहता है। यह सुनिश्चित करता है कि सिस्टम किसी एक शोर वाले विशेषज्ञ से भ्रमित न हो। यह एक क्लब की तरह है जहाँ आप नियमों को तभी बदल सकते हैं जब तीन विशिष्ट सदस्य मिलकर याचिका पर हस्ताक्षर करें; केवल एक व्यक्ति की शिकायत स्विच बदलने के लिए पर्याप्त नहीं है।
परिणाम क्या रहा? इस "सेफ्टी नेट" ने सिस्टम को और भी सटीक बना दिया। इस सख्त, सर्वसम्मति वाले वोटिंग नियम का उपयोग करके, अंतिम स्कोर बढ़कर 0.7771 हो गया। पेपर दिखाता है कि यह विधि बिना किसी रैंडम ठहराव या आकस्मिक शोर से धोखा खाए, वास्तविक अनिश्चितता को पहचानने में बहुत बेहतर है। शोधकर्ताओं ने पाया कि केवल अधिक विशेषज्ञ जोड़ने से मदद नहीं मिलती; यह इस बारे में है कि आप उन्हें कैसे व्यवस्थित करते हैं। "डिफ़ॉल्ट जज" को एक स्थिर आधार देने और केवल तभी "सेफ्टी नेट" को ओवरराइड करने की अनुमति देने से, जब सभी सहमत हों, सिस्टम अधिक विश्वसनीय हो जाता है।
टीम ने वास्तविक साक्षात्कार वीडियो के एक डेटासेट पर इसका परीक्षण किया जहाँ परीक्षण वीडियो में मौजूद लोग उन लोगों से पूरी तरह से अलग थे जिनसे सिस्टम को प्रशिक्षित किया गया था। यह महत्वपूर्ण है क्योंकि यह साबित करता है कि सिस्टम केवल चेहरों को याद नहीं कर रहा है; यह वास्तव में अनिश्चितता की भावना को पहचानने के लिए सीख रहा है। पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि आप बस सभी विशेषज्ञों की राय का औसत निकाल सकते हैं या किसी एक मजबूत विशेषज्ञ को बाकी लोगों पर हावी होने दे सकते हैं। इसके बजाय, उन्होंने पाया कि एक सख्त "यूनैनिटी गेट" (सर्वसम्मति द्वार) सबसे अच्छा काम करता है। हालाँकि यह सिस्टम एक बड़ी प्रगति है, लेखक सावधानी बरतते हुए कहते हैं कि यह इस विशेष चुनौती के लिए एक विशिष्ट समाधान है, न कि हर मानवीय भावना के लिए एक जादुई समाधान। लेकिन यह पता लगाने के लिए कि क्या कोई वास्तव में दुविधा में है, CALM-AH अपने RG-MEC सेफ्टी नेट के साथ, एक बहुत ही स्मार्ट नया टूल है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।