← नवीनतम पेपर
💬 NLP

FEA-SLT: A Gloss-Free End-to-End Framework for Facial-Expression-Aware Sign Language Translation

यह शोध पत्र FEA-SLT का प्रस्ताव करता है, जो एक ग्लॉस-मुक्त एंड-टू-एंड फ्रेमवर्क है जो मैनुअल अस्पष्टता को दूर करने और अनुवाद सटीकता में सुधार करने के लिए चेहरे की गतिशीलता (facial dynamics) को सिमेंटिक एंकर्स के रूप में उपयोग करता है, जिससे PHOENIX14T और CSL-Daily डेटासेट पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त होता है।

मूल लेखक: Guobin Tu, Di Weng

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guobin Tu, Di Weng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सांकेतिक बातचीत को बोले गए शब्दों में अनुवाद करने की कोशिश कर रहे हैं। सांकेतिक भाषा में, कहानी केवल हाथों से नहीं सुनाई जाती; यह चेहरे से भी बताई जाती है। एक उठी हुई भौंह एक कथन को प्रश्न में बदल सकती है और एक सिकुड़ी हुई भौंह एक शब्द का अर्थ पूरी तरह से बदल सकती है।

लंबे समय तक, सांकालीन भाषा अनुवाद (Sign Language Translation, या SLT) करने वाले कंप्यूटर प्रोग्राम उन अनुवादकों की तरह रहे हैं जो केवल हाथों को सुनते हैं और चेहरे को अनदेखा कर देते हैं। वे यह देखने में बहुत अच्छे हैं कि हाथ क्या कर रहे हैं, लेकिन वे अक्सर यह चूक जाते हैं कि साइन करने वाला व्यक्ति कैसा महसूस कर रहा है या चेहरा किन व्याकरण नियमों का संकेत दे रहा है। इससे गलतियाँ होती हैं, जैसे कि "मैं खुश हूँ" का अनुवाद करना जब साइन करने वाले का मतलब वास्तव में "मैं गुस्से में हूँ" था, क्योंकि हाथ की हरकतें समान दिख रही थीं, लेकिन चेहरे के भाव अलग थे।

यह शोध पत्र FEA-SLT (Facial-Expression-Aware Sign Language Translation) नामक एक नई प्रणाली पेश करता है ताकि इसे ठीक किया जा सके। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "केवल हाथ वाला" अनुवादक

सांकेतिक भाषा को पियानो पर बजाए जाने वाले एक गीत (हाथ) और गायक की आवाज़ (चेहरा) की तरह समझें।

  • पुराने तरीके उन लोगों की तरह थे जो केवल पियानो की कुंजियों (keys) को देखकर गीत को समझने की कोशिश करते थे। वे देख सकते थे कि कौन से नोट्स दबाए जा रहे हैं, लेकिन वे गायन के इमोशन, वॉल्यूम और स्टाइल को मिस कर देते थे।
  • परिणाम: यदि दो अलग-अलग गाने एक ही पियानो नोट्स का उपयोग करते हैं लेकिन अलग-अलग गायन शैलियों का उपयोग करते हैं, तो पुराना अनुवादक भ्रमित हो जाएगा और गलत गाना चुन लेगा।

2. समाधान: "चेहरे-प्रथम" जासूस

लेखकों ने FEA-SLT को एक ऐसे जासूस की तरह बनाया है जो पियानो और गायक दोनों पर ध्यान देता है।

  • एक विशेष फेस लेंस: एक सामान्य कैमरे के बजाय जो सिर्फ "एक चेहरा" देखता है, यह सिस्टम एक विशेष लेंस का उपयोग करता है जिसे विशेष रूप से सूक्ष्म मांसपेशियों की गतिविधियों (जैसे उठी हुई भौंह या कसा हुआ जबड़ा) को पहचानने के लिए प्रशिक्षित किया गया है। उन्होंने एक ऐसे टूल को उधार लिया जो आमतौर पर भावनाओं (जैसे "खुश" या "हैरान") को पहचानने के लिए उपयोग किया जाता है और इसे व्याकरण समझने के लिए पुन: उपयोग किया।

    • उपमा: कल्पना कीजिए कि एक अनुवादक जो बॉडी लैंग्वेज पढ़ने में विशेषज्ञ है। भले ही हाथ तेज़ी से चल रहे हों, यह विशेषज्ञ जानता है कि एक विशिष्ट भौंह का उठना "यह एक प्रश्न है" का संकेत है, न कि केवल एक रैंडम मूवमेंट।
  • दो-तरफा बातचीत (फ्यूजन): यह सिस्टम हाथों और चेहरे को अलग-अलग नहीं देखता है। यह उन्हें एक-दूसरे से बात करने के लिए मजबूर करता है।

    • उपमा: एक डांस जोड़ी की कल्पना करें। हाथ मुख्य डांसर (lead dancer) हैं, और चेहरा उनका पार्टनर है। FEA-SLT में, पार्टनर (चेहरा) लीड (हाथों) को बताता है, "हे, धीरे हो जाओ, यह एक दुख भरी कहानी है," और लीड पार्टनर को बताता है, "मैं तेज़ी से चल रहा हूँ क्योंकि यह एक रोमांचक हिस्सा है।" वे सही कहानी बताने के लिए लगातार एक-दूसरे के साथ तालमेल बिठाते हैं। इसे "बाइडायरेक्शनल मॉड्यूलेशन" (bidirectional modulation) कहा जाता है।

3. यह व्यवहार में कैसे काम करता है

सिस्टम एक वीडियो को तीन चरणों में प्रोसेस करता है:

  1. व्यू को विभाजित करना: यह वीडियो को तीन स्ट्रीम में अलग करता है: हाथों का आकार (spatial), हाथों की गति (motion), और चेहरे के भाव।
  2. "फेस-चेक": यह उस विशेष इमोशन-ट्रेन्ड लेंस का उपयोग करके चेहरे के विवरण निकालता है।
  3. मिश्रण (The Mix): यह एक "फ्यूजन मॉड्यूल" का उपयोग करके इन तीनों स्ट्रीम को जोड़ता है। यह मॉड्यूल सुनिश्चित करता है कि यदि हाथ "जाओ" कह रहे हैं लेकिन चेहरा चिंतित दिख रहा है, तो सिस्टम चिंता को समझेगा और उसका सही अनुवाद करेगा, बजाय इसके कि वह केवल "जाओ" कहे।

4. परिणाम

लेखकों ने दो प्रमुख सांकेतिक भाषा डेटासेट्स पर इसका परीक्षण किया (एक जर्मन और एक चीनी)।

  • स्कोर: FEA-SLT ने "ग्लॉस-फ्री" (gloss-free) अनुवाद के लिए अब तक के उच्चतम स्कोर प्राप्त किए (इसका अर्थ है कि यह सीधे वीडियो से टेक्स्ट में अनुवाद करता है बिना किसी इंसान द्वारा हर एक साइन को लेबल किए)।
  • प्रमाण: जब उन्होंने उन वाक्यों पर परीक्षण किया जहाँ अर्थ काफी हद तक चेहरे के भावों पर निर्भर करता है (जैसे प्रश्न या भावनात्मक बयान), तो FEA-SLT पिछले मॉडल्स की तुलना में बहुत बेहतर था।
    • उदाहरण: एक परीक्षण में, एक साइन करने वाले ने डरे हुए चेहरे के साथ "मैं डरा हुआ हूँ" कहा। पुराने मॉडल्स ने इसे "यह शांत है" या "यह अंधेरा है" के रूप में अनुवादित किया क्योंकि उन्होंने केवल हाथों को देखा। FEA-SLT ने "मैं डरा हुआ हूँ" का सही अनुवाद किया क्योंकि उसने आँखों में डर को देखा।

सारांश

FEA-SLT कंप्यूटर को सांकेतिक भाषा सिखाने का एक नया तरीका है, जो अंततः उन्हें चेहरा पढ़ना सिखाता है। चेहरे के भावों को केवल बैकग्राउंड डेकोरेशन के रूप में नहीं, बल्कि आवश्यक व्याकरण और अर्थ के रूप में मानकर, यह सिस्टम सांकेतिक भाषा को बहुत अधिक सटीकता से समझ सकता है, विशेष रूप से तब जब केवल हाथ की हरकतें अस्पष्ट हों।

पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह अभी दुनिया की सभी सांकेतिक भाषाओं के लिए काम करता है (इसका परीक्षण जर्मन और चीनी पर किया गया था)।
  • यह दावा नहीं करता कि यह चिकित्सा या कानूनी सेटिंग्स के लिए मानव व्याख्याकारों (human interpreters) की जगह ले लेगा।
  • यह दावा नहीं करता कि यह खराब रोशनी में या यदि साइन करने वाला अपना चेहरा ढक लेता है, तो पूरी तरह से काम करेगा (पेपर स्वीकार करता है कि ये वर्तमान सीमाएँ हैं)।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →