Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition
Zero-MELO एक नवीन टेस्ट-टाइम एविडेंस कैलिब्रेशन फ्रेमवर्क है जो सूक्ष्म-साक्ष्य प्राप्ति के लिए ट्री सर्च मैकेनिज्म और स्कोर बायस को कम करने के लिए एक कैलिब्रेशन मॉड्यूल का उपयोग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में ज़ीरो-शॉट माइक्रो-जेस्चर रिकग्निशन को बढ़ाता है, जिससे बेंचमार्क डेटासेट्स पर मौजूदा बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मानव गति स्वयं में एक भाषा है, जो न केवल हाथ हिलाने या अंगूठा दिखाने जैसे बड़े इशारों में, बल्कि शरीर के क्षणिक, लगभग अदृश्य बदलावों में भी व्यक्त होती है। ये सूक्ष्म-इशारे (micro-gestures) हैं: जबड़े का हल्का सा खुजलाना, उंगलियों का संक्षिप्त रूप से आपस में जुड़ना, या होंठों का हल्का सा खिंचना। दशकों से, शोधकर्ताओं ने इन छोटी गतियों का अध्ययन किया है क्योंकि वे अक्सर बोलने से पहले ही यह प्रकट कर देते हैं कि कोई व्यक्ति क्या महसूस कर रहा है या क्या सोच रहा है। हालाँकि, कंप्यूटर को इन क्षणिक संकेतों को पहचानने के लिए सिखाना एक कठिन चुनौती रही है। ये गतियां बहुत तेज़, बहुत छोटी और व्यक्ति दर व्यक्ति बहुत भिन्न होती हैं, जिससे मानक वीडियो विश्लेषण उपकरण उन्हें विश्वसनीय रूप से पकड़ नहीं पाते।
हाल के वर्षों में, मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के रूप में कृत्रिम बुद्धिमत्ता की एक नई पीढ़ी उभरी है। ये प्रणालियाँ सामान्य अर्थ में छवियों और वीडियो को समझने में उल्लेखनीय रूप से सक्षम हैं; वे एक दृश्य का वर्णन कर सकती हैं, एक कुत्ते की पहचान कर सकती हैं, या किसी जटिल घटना की व्याख्या कर सकती हैं। फिर भी, जब शोधकर्ताओं ने इन शक्तिशाली मॉडलों का उपयोग सूक्ष्म-इशारों की विशिष्ट गतिविधियों को पहचानने के लिए किया, तो परिणाम निराशाजनक रहे। मॉडल अक्सर सूक्ष्म क्रिया को पूरी तरह से मिस कर देते थे, और वास्तविक वीडियो में जो हो रहा था उसके बजाय इस आधार पर अनुमान लगाते थे कि व्यक्ति कैसा दिख रहा था या मॉडल क्या देखने की अपेक्षा करता था। यह ऐसा था मानो मॉडल पूरी तस्वीर को तो देख रहे थे लेकिन उस छोटे, महत्वपूर्ण विवरण को पहचानने में विफल रहे जिसमें उत्तर छिपा था।
शोधकर्ताओं की एक टीम ने यह समझने के लिए प्रयास किया कि ये उन्नत मॉडल इतने विशिष्ट कार्य में क्यों विफल हो रहे हैं और बिना मॉडलों को शुरू से फिर से प्रशिक्षित किए इसे ठीक करने का तरीका खोजने के लिए काम किया। उन्होंने पाया कि समस्या यह नहीं थी कि मॉडलों में गति को देखने की क्षमता की कमी थी, बल्कि यह थी कि वे सही जगह नहीं देख रहे थे और अपने स्वयं के आंतरिक अनुमानों द्वारा गुमराह हो रहे थे। मॉडल उन भाषा पैटर्न पर बहुत अधिक निर्भर करते थे जो उन्होंने टेक्स्ट से सीखे थे, यानी वे वीडियो के बजाय प्रश्न के आधार पर उत्तर का अनुमान लगाने लगते थे। वे अक्सर शरीर के गलत हिस्सों पर ध्यान केंद्रित करते थे, जिससे वह विशिष्ट हाथ या चेहरे की गति छूट जाती थी जो उस इशारे को परिभाषित करती थी।
इसे हल करने के लिए, शोधकर्ताओं ने 'जीरो-मेलो' (Zero-MELO) नामक एक नई विधि विकसित की। मॉडल को तुरंत एक एकल उत्तर देने के लिए कहने के बजाय, उन्होंने एक ऐसी प्रक्रिया तैयार की जो मॉडल को एक सतर्क पर्यवेक्षक की तरह कार्य करने के लिए मजबूर करती है। सबसे पहले, सिस्टम मॉडल से वीडियो को देखने और यह पहचानने के लिए कहता है कि शरीर के कौन से हिस्से प्रासंगिक हो सकते हैं, जैसे कि हाथ, चेहरा, या गर्दन। फिर, यह मॉडल को उन विशिष्ट क्षेत्रों पर ज़ूम करने के लिए निर्देशित करता है, जिससे बेहतर साक्ष्य जुटाने के लिए क्लोज-अप दृश्यों की एक श्रृंखला बनाई जा सके। यह बिल्कुल वैसा ही है जैसे कोई व्यक्ति किसी छोटे विवरण को देखने के लिए स्क्रीन की ओर झुककर अपनी आँखें सिकोड़ सकता है, लेकिन कंप्यूटर यह काम पूरे वीडियो में व्यवस्थित रूप से करता है।
एक बार जब मॉडल इन विस्तृत, स्थानीयकृत दृश्यों को एकत्र कर लेता है, तो सिस्टम अपने स्वयं के पूर्वाग्रहों को सुधारने के लिए एक दूसरा चरण लागू करता है। शोधकर्ता मिले थे कि मॉडलों में वीडियो की सामग्री की परवाह किए बिना कुछ सामान्य उत्तर देने की प्रबल प्रवृत्ति होती है। इसका मुकाबला करने के लिए, सिस्टम मॉडल से वीडियो को बिना किसी गति या दृश्य विवरण के कल्पना करने के लिए कहता है, और फिर केवल व्यक्ति की स्थिर उपस्थिति के साथ भी। इन "क्या-होता-यदि" (what-if) परिदृश्यों की वास्तविक वीडियो के साथ तुलना करके, सिस्टम मॉडल के गलत अनुमानों को हटा सकता है और वास्तविक दृश्य साक्ष्य पर ध्यान केंद्रित कर सकता है। अंत में, सिस्टम विभिन्न ज़ूम-इन दृश्यों और सुधारे गए स्कोर से प्राप्त सभी जानकारी को जोड़कर एक अंतिम निर्णय लेता है।
इस दृष्टिकोण के परिणाम महत्वपूर्ण थे। जब हजारों सूक्ष्म-इशारों के उदाहरणों वाले मानक डेटासेट्स पर परीक्षण किया गया, तो इस नई विधि ने मॉडलों की सटीकता में नाटकीय रूप से सुधार किया। एक डेटासेट पर, सफलता दर लगभग सोलह प्रतिशत से बढ़कर लगभग सत्ताईस प्रतिशत हो गई, और दूसरे पर, यह दस प्रतिशत से बढ़कर बाईस प्रतिशत से अधिक हो गई। ये संख्याएँ एक बड़ी छलांग का प्रतिनिधित्व करती हैं, जो दिखाती हैं कि मॉडल इन सूक्ष्म गतियों को समझने में सक्षम थे, बशर्ते उन्हें बारीकी से देखने और सावधानी से सोचने के लिए निर्देशित किया जाए।
यह अध्ययन सुझाव देता है कि सूक्ष्म-स्तर की मानवीय गति को समझने में वर्तमान कृत्रिम बुद्धिमत्ता की सीमाएं अनिवार्य रूप से बुद्धि की कमी नहीं हैं, बल्कि ध्यान केंद्रित करने के सही उपकरणों की कमी है। मॉडलों को विशिष्ट साक्ष्य खोजने और अपने स्वयं के अनुमानों पर सवाल उठाने के लिए सिखाकर, शोधकर्ताओं ने प्रदर्शित किया कि इन प्रणालियों को उन कार्यों के लिए बहुत अधिक विश्वसनीय बनाया जा सकता है जिनमें बारीक दृष्टि की आवश्यकता होती है। यह कार्य केवल एक एकल कार्य में सुधार नहीं करता है; यह इस बारे में सोचने का एक नया तरीका प्रदान करता है कि कैसे कृत्रिम बुद्धिमत्ता को दुनिया को उसी सटीकता और विवरण के प्रति ध्यान के साथ देखने में मदद की जा सकती है जैसा कि मनुष्य शरीर की सूक्ष्म भाषा का अवलोकन करते समय करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।