← नवीनतम पेपर
🤖 AI

TAG: Thinking with Action Unit Grounding for Facial Expression Recognition

यह शोध पत्र TAG का प्रस्ताव करता है, जो एक विजन-लैंग्वेज फ्रेमवर्क है जो मल्टीमॉडल रीजनिंग को चेहरे के एक्शन यूनिट्स (Facial Action Units) में स्पष्ट रूप से ग्राउंडेड बनाकर फेशियल एक्सप्रेशन रिकग्निशन को बेहतर बनाता है, जिससे कई डेटासेट्स में भविष्यवाणी की सटीकता, दृश्य निष्ठा (visual faithfulness) और मतिभ्रम (hallucination) के विरुद्ध मजबूती में सुधार होता है।

मूल लेखक: Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "TAG: Thinking with Action Unit Grounding" का सरल भाषा, उपमाओं और रूपकों के साथ विवरण दिया गया है।

बड़ी समस्या: "बातूनी लेकिन अनभिज्ञ" AI

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, अच्छी तरह से पढ़ा-लिखा AI सहायक है जो चित्रों का वर्णन करने में बहुत माहिर है। आप उसे एक उदास व्यक्ति की फोटो दिखाते हैं और वह कहता है, "यह व्यक्ति उदास दिख रहा है क्योंकि उसका दिल भारी है और उसकी आत्मा थकी हुई है।"

यह सुनने में काव्यात्मक और विश्वसनीय लगता है, है ना? लेकिन यहाँ एक पेंच है: AI को इस बारे में कुछ पता ही नहीं है कि वह क्या कह रहा है। उसने वास्तव में व्यक्ति के चेहरे को नहीं देखा। उसने केवल उन पैटर्न के आधार पर अनुमान लगाया जो उसने अपने प्रशिक्षण डेटा में देखे थे। यदि आप उसे एक उदास जोकर की तस्वीर दिखाते, तो शायद वह कहता, "यह व्यक्ति खुश है क्योंकि जोकर मजेदार होते हैं," क्योंकि वह वास्तविक साक्ष्य देखने के बजाय एक शॉर्टकट पर निर्भर था।

फेशियल एक्सप्रेशन रिकग्निशन (FER) की दुनिया में, वर्तमान AI मॉडल इसी तरह के "बातूनी लेकिन अनभिज्ञ" सहायक की तरह हैं। वे भावना का अनुमान तो लगा सकते हैं, लेकिन वे यह साबित नहीं कर सकते कि उन्होंने वह अनुमान क्यों लगाया। वे अक्सर "भ्रमित" (hallucinate) होते हैं (चीजें बना लेते हैं) और जब तस्वीरें उनके द्वारा देखी गई तस्वीरों से अलग होती हैं, तो वे विफल हो जाते हैं।

समाधान: TAG (द "फोरेंसिक डिटेक्टिव")

लेखक TAG (Thinking with Action Unit Grounding) नामक एक नया सिस्टम प्रस्तावित करते हैं। TAG को एक कवि के रूप में नहीं, बल्कि एक फोरेंसिक डिटेक्टिव या एक चिकित्सक के रूप में सोचें।

केवल भावना का अनुमान लगाने के बजाय, TAG को एक सख्त नियम का पालन करने के लिए मजबूर किया जाता है: "आप तब तक निदान (diagnosis) नहीं दे सकते जब तक कि आप उस विशिष्ट मांसपेशी की गति की ओर इशारा न करें जो इसे सिद्ध करती हो।"

गुप्त हथियार: एक्शन यूनिट्स (AUs)

इसे काम करने के योग्य बनाने के लिए, शोधकर्ता एक्शन यूनिट्स (AUs) नामक चीज़ का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि मानव चेहरा एक कठपुतली है। कठपुतली को नियंत्रित करने वाली डोरियाँ चेहरे की मांसपेशियां हैं।
  • वास्तविकता: विज्ञान में, इन विशिष्ट मांसपेशी गतिविधियों को 'एक्शन यूनिट्स' कहा जाता है। उदाहरण के लिए, "AU12" वह विशिष्ट मांसपेशी है जो आपके होंठों के कोनों को ऊपर खींचती है (एक मुस्कान), और "AU4" वह मांसपेशी है जो आपकी भौंहों को आपस में सिकोड़ती है (चिंता)।
  • पुराना तरीका: AI बस पूरे चेहरे को देखता है और "खुश" कहता है।
  • TAG का तरीका: AI को कहना होगा, "मैं देख रहा हूँ कि होंठों के कोने ऊपर की ओर खिंचे हुए हैं (AU12) और आँखें सिकुड़ी हुई हैं (AU6)। इसलिए, यह एक मुस्कान है।"

TAG कैसे सीखता है: दो-चरणीय प्रशिक्षण

शोध पत्र एक चतुर दो-चरणीय प्रशिक्षण प्रक्रिया का वर्णन करता है जो एक सामान्य AI को इस "फोरेंसिक डिटेक्टिव" में बदल देती है।

चरण 1: क्लासरूम (सुपरवाइज्ड फाइन-ट्यूनिंग)

सबसे पहले, वे AI को TAG-310k नामक एक विशाल पाठ्यपुस्तक का उपयोग करके सिखाते हैं।

  • रूपक: कल्पना कीजिए कि एक शिक्षक एक छात्र को हजारों तस्वीरें दिखा रहा है। हर फोटो के लिए, शिक्षक केवल यह नहीं कहता "वह क्रोध है।" वे कहते हैं, "यहाँ देखो, सिकुड़ी हुई भौंहों को (छवि पर एक बॉक्स की ओर इशारा करते हुए), और वहाँ देखो, कसी हुई होंठों को। वे सुराग हैं।"
  • परिणाम: AI अनुमान लगाना बंद करना और इशारा करना सीख जाता है। वह चेहरे के उन विशिष्ट हिस्सों के चारों ओर बॉक्स बनाना सीख जाता है जो महत्वपूर्ण हैं।

चरण 2: परीक्षा (रीइन्फोर्समेंट लर्निंग)

इसके बाद, वे AI को एक कठोर परीक्षा से गुजारते हैं ताकि यह सुनिश्चित हो सके कि वह नकल न करे।

  • रूपक: कल्पना कीजिए कि AI एक टेस्ट दे रहा है। यदि वह कहता है "उदासी" लेकिन व्यक्ति के जूते के चारों ओर एक बॉक्स बनाता है बजाय उसके आँसू भरी आँखों के, तो उसे दंडित किया जाता है।
  • "AU-अवेयर रिवॉर्ड": सिस्टम AI के बॉक्सों की तुलना एक भरोसेमंद "गोल्ड स्टैंडर्ड" डिटेक्टर (एक अलग, अत्यधिक सटीक टूल जो जानता है कि मांसपेशियां कहाँ चलती हैं) से करता है।
    • यदि AI का बॉक्स वास्तविक मांसपेशी की गति से मेल खाता है? अच्छा काम! (पुरस्कार/रिवॉर्ड)।
    • यदि AI का बॉक्स गलत जगह पर है या उसने कोई काल्पनिक मांसपेशी मूवमेंट दिखाया है? फिर से कोशिश करो। (दंड/पेनल्टी)।
  • लक्ष्य: यह AI को "शॉर्टकट" (जैसे पृष्ठभूमि के आधार पर अनुमान लगाना) का उपयोग करने से रोकता है और उसे दृश्य साक्ष्य पर निर्भर रहने के लिए मजबूर करता है।

यह क्यों मायने रखता है: विश्वास और विश्वसनीयता

शोध पत्र दिखाता है कि TAG दो तरीकों से अन्य मॉडलों से बेहतर है:

  1. यह स्मार्ट है: यह कठिन और नए प्रकार की तस्वीरों पर भी उत्तर सही देता है।
  2. यह ईमानदार है: जब यह "उदासी" कहता है, तो यह उदास भौंहों को दिखाकर इसे सिद्ध कर सकता है। आप फोटो को देख सकते हैं, बॉक्स को देख सकते हैं, और कह सकते हैं, "हाँ, मैं भी इसे देख पा रहा हूँ। मैं इस उत्तर पर भरोसा करता हूँ।"

निष्कर्ष

वर्तमान AI उस छात्र की तरह है जो उत्तर रट लेता है लेकिन गणित को समझता नहीं है। TAG उस छात्र की तरह है जो वास्तव में गणित करता है, अपना काम दिखाता है, और उन संख्याओं की ओर इशारा करता है जो उत्तर को सिद्ध करती हैं।

AI को "एक्शन यूनिट ग्राउंडिंग के साथ सोचने" के लिए मजबूर करके, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो केवल भावनाओं का अनुमान नहीं लगाता—बल्कि यह मानव चेहरे पर वास्तविक भौतिक साक्ष्यों को देखकर उन्हें समझता है। यह AI को अधिक विश्वसनीय बनाता है, विशेष रूप से मानसिक स्वास्थ्य विश्लेषण या मानव-कंप्यूटर इंटरेक्शन जैसे महत्वपूर्ण मामलों में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →