← नवीनतम पेपर
💻 computer science

CMTD: Cascaded Multi-Token Disambiguation Model for Lip Reading

यह शोध पत्र कैस्केडेड मल्टी-टोकन डिसएम्बिग्यूएशन मॉडल (CMTD) का प्रस्ताव करता है, जो एक कैस्केडेड मल्टी-टोकन प्रेडिक्शन संरचना और एक पदानुक्रमित प्रशिक्षण उद्देश्य के माध्यम से भविष्य-संदर्भ मॉडलिंग को सीधे डिकोडिंग प्रक्रिया में एकीकृत करके लिप रीडिंग प्रदर्शन को बढ़ाता है, जिससे दृश्य अस्पष्टताओं को प्रभावी ढंग से हल किया जाता है और बेंचमार्क डेटासेट पर त्रुटि दर को कम किया जाता है।

मूल लेखक: Yuting Fang, Feng Xue, Zhe Chen, Shujie Li

प्रकाशित 2026-09-02
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuting Fang, Feng Xue, Zhe Chen, Shujie Li

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

साइलेंट स्पीच रिकग्निशन (मूक भाषण पहचान) कंप्यूटर विज्ञान का एक ऐसा क्षेत्र है जो केवल उनके होठों को देखकर यह समझने के लिए समर्पित है कि लोग क्या कह रहे हैं, बिना एक भी ध्वनि सुने। यह क्षमता उन स्थितियों में अत्यंत महत्वपूर्ण है जहाँ ऑडियो अनुपलब्ध या अविश्वसनीय होता है, जैसे कि शोर वाले कारखानों में, पानी के नीचे के वातावरण में, या उन व्यक्तियों के लिए जो बधिर हैं और दृश्य संकेतों पर निर्भर करते हैं। हालाँकि, कंप्यूटर को होंठ पढ़ना सिखाना बेहद कठिन है क्योंकि मानव मुख स्वयं ध्वनि का एक खराब संचारक है। कई अलग-अलग ध्वनियाँ, जैसे कि अक्षर "b" और "p", लगभग समान मुख आकृतियाँ बनाती हैं, जबकि एक ही ध्वनि आसपास के शब्दों के आधार पर थोड़ी अलग दिख सकती है। यह दृश्य भ्रम का अर्थ है कि एक वीडियो को देख रहा कंप्यूटर एक ऐसी मुख आकृति देख सकता है जो कई अलग-अलग शब्दों से संबंधित हो सकती है, जिससे मशीन अनुमान लगाने की स्थिति में छोड़ दी जाती है। इसे हल करने के लिए, शोधकर्ताओं ने पारंपरिक रूप से कंप्यूटर की "आंखों" को सूक्ष्म अंतर देखने के लिए अधिक तीक्ष्ण बनाने का प्रयास किया है, या उन्होंने सामान्य वाक्यांशों का एक शब्दकोश जोड़ा है ताकि छूटे हुए शब्दों का अनुमान लगाया जा सके। फिर भी, ये विधियाँ तब संघर्ष करती हैं जब दृश्य साक्ष्य दो समान दिखने वाले विकल्पों के बीच निर्णय लेने के लिए बहुत अधिक संदिग्ध होते हैं।

हेफेई यूनिवर्सिटी ऑफ टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने एक नया दृष्टिकोण प्रस्तावित किया है जो इस बात को बदल देता है कि कंप्यूटर वर्तमान को पढ़ते समय भविष्य के बारे में कैसे सोचता है। वे अपने सिस्टम को CMTD कहते हैं, जो एक मॉडल है जिसे भविष्य की ओर देखकर दृश्य भ्रम को दूर करने के लिए डिज़ाइन किया गया है। केवल अगले शब्द का अलग से अनुमान लगाने के बजाय, सिस्टम वर्तमान शब्द को डिकोड करते समय ही आगामी शब्दों के एक संक्षिप्त अनुक्रम का एक साथ पूर्वानुमान लगाता है। कल्पना कीजिए कि एक पाठक जो पृष्ठ पर एक एकल शब्द को देखते समय, पूरे वाक्य को समझने के लिए अगले कुछ शब्दों पर भी नज़र डालता है; यह संदर्भ उन्हें यह तय करने में मदद करता है कि धुंधला शब्द "बैंक" (जैसे पैसा) है या "बैंक" (जैसे नदी का किनारा)। शोधकर्ताओं ने एक मॉडल बनाया है जो लिप रीडिंग के लिए बिल्कुल यही करता है। यह वर्तमान क्षण के लिए एक प्राथमिक अनुमान उत्पन्न करता है और साथ ही, उस अनुमान का उपयोग भविष्य के तत्काल शब्दों की एक श्रृंखला बनाने के लिए करता है। यह जाँचकर कि क्या वर्तमान अनुमान भविष्य के अनुमानित शब्दों के साथ तार्किक रूप से फिट बैठता है, सिस्टम उन विकल्पों को हटा सकता है जो दिखने में तो सही लगते हैं लेकिन वाक्य के संदर्भ में कोई अर्थ नहीं रखते।

इस नई विधि का मूल एक कैस्केडेड (क्रमबद्ध) संरचना है जहाँ एक क्षण का पूर्वानुमान सीधे अगले क्षण के पूर्वानुमान में फीड होता है, जिससे तर्क की एक निरंतर श्रृंखला बनती है। सिस्टम केवल वीडियो फ्रेमों को नहीं देखता है; यह अपने द्वारा अभी-अभी अनुमानित किए गए शब्दों की एक आंतरिक स्मृति भी बनाए रखता है और उस स्मृति का उपयोग यह पूर्वानुमान लगाने के लिए करता है कि आगे क्या होगा। यदि वीडियो एक ऐसी मुख आकृति दिखाता है जो "bao" या "biao" (दो चीनी अक्षर जो बहुत समान दिखते हैं) में से कोई भी हो सकती है, तो सिस्टम देखता है कि आगे क्या अनुमानित है। यदि भविष्य का पूर्वानुमान एक ऐसे शब्द का सुझाव देता है जो केवल "biao" के साथ ही अर्थपूर्ण है, तो सिस्टम आत्मविश्वास के साथ उस विकल्प को चुन लेता है, भले ही वर्तमान शब्द के लिए दृश्य साक्ष्य कमजोर हो। यह प्रक्रिया परतों में होती है: मॉडल एक मुख्य अनुमान लगाता है, फिर अगले कदम के लिए दूसरा अनुमान, और फिर उसके बाद के कदम के लिए तीसरा। ये अनुमान स्वतंत्र अनुमान नहीं हैं; वे एक साथ जुड़े हुए हैं ताकि एक में होने वाली त्रुटि दूसरों को प्रभावित न करे। शोधकर्ताओं ने मॉडल को तत्काल अगले शब्द को सही प्राथमिकता देने के लिए प्रशिक्षित किया और साथ ही भविष्य के लंबे क्रम से सीखते रहना सुनिश्चित किया, जिससे यह सुनिश्चित हुआ कि सिस्टम स्थिर बना रहे और अपने ही दूर के अनुमानों से भ्रमित न हो।

जब सिस्टम वास्तव में एक वीडियो पढ़ रहा होता है, तो वह यह तय करने के लिए कि अपनी आँखों पर कब भरोसा करना है और कब मदद मांगनी है, 'फ्यूचर-टोकन-अवेयर इन्फरेंस' नामक रणनीति का उपयोग करता है। यह अपने दृश्य अवलोकनों और भविष्य के पूर्वानुमानों के आधार पर शब्दों के कई संभावित पथ उत्पन्न करता है। फिर यह जाँचता है कि अपने विजुअल रीडिंग में यह कितना आश्वस्त है। यदि दृश्य साक्ष्य मजबूत और स्पष्ट है, तो सिस्टम सबसे अच्छा विकल्प चुन लेता है और आगे बढ़ जाता है। हालाँकि, यदि दृश्य साक्ष्य कमजोर है और सिस्टम अनिश्चित है, तो यह एक लैंग्वेज मॉडल लाता है—जो विशाल पाठ पर प्रशिक्षित एक अलग उपकरण है—ताဖြင့် विकल्पों को इस आधार पर पुन: रैंक किया जा सके कि वे वास्तविक वाक्य में कितनी संभावना के साथ दिखाई देंगे। यह सुनिश्चित करता है कि कंप्यूटर केवल भाषाई अनुमानों का उपयोग तभी करे जब विजुअल डेटा वास्तव में संदिग्ध हो, जिससे यह सांख्यिकीय अनुमानों के पक्ष में स्पष्ट दृश्य संकेतों को अनदेखा करने से बचता है। यह संतुलन इसे अपने देखे गए दृश्यों के प्रति वफादार रहने में मदद करता है जबकि पहेलियों को सुलझाने के लिए संदर्भ का उपयोग करता है।

शोधकर्ताओं ने इस नए मॉडल का परीक्षण दो प्रमुख डेटासेट्स पर किया: एक जिसमें समाचार प्रसारणों से हजारों चीनी वाक्य शामिल थे और दूसरा जिसमें कुछ निश्चित लोगों द्वारा बोले गए अंग्रेजी वाक्य शामिल थे। चीनी डेटासेट पर, नए मॉडल ने पिछले तरीकों की तुलना में काफी बेहतर प्रदर्शन किया, जिससे त्रुटि दर में पर्याप्त कमी आई, जो उन सिस्टमों की तुलना में बेहतर थी जो केवल बेहतर विजुअल फीचर्स या निश्चित भाषistic नियमों पर निर्भर थे। यह पिछले मॉडलों की तुलना में बहुत अधिक सटीकता से दृष्टिगत रूप से समान दिखने वाले पात्रों के बीच अंतर करने में सक्षम रहा। अंग्रेजी डेटासेट पर, मॉडल ने मौजूदा सर्वोत्तम सिस्टमों के साथ प्रतिस्पर्धी परिणाम प्राप्त किए, हालांकि सुधार कम नाटकीय था क्योंकि परीक्षण में उपयोग किए गए अंग्रेजी वाक्य बहुत सरल थे और उनमें सीमित शब्दावली थी, जिससे इसके उन्नत संदर्भ कौशल को चमकने के लिए कम जगह मिली। प्रयोगों ने दिखाया कि भविष्य की ओर देखने और भविष्यवाणियों को एक साथ जोड़ने की मॉडल की क्षमता ही इसकी सफलता का प्रमुख कारक थी, जिससे यह सिद्ध हुआ कि वाक्य के प्रवाह को समझना स्पष्ट रूप से मुख की गतिविधियों को देखने जितना ही महत्वपूर्ण है।

अध्ययन ने यह भी पता लगाया कि टेक्स्ट जनरेशन (पाठ निर्माण) के तरीकों को लिप रीडिंग के लिए सीधे कॉपी करना क्यों काम नहीं आया। जब शोधकर्ताओं ने उन समानांतर भविष्यवाणी शाखाओं का उपयोग किया जो आपस में बात नहीं करती थीं, या उन तरीकों का उपयोग किया जो प्रशिक्षण के दौरान सही भविष्य के उत्तरों को जानने पर निर्भर थे, तो सिस्टम भविष्य में देखते समय सटीकता बनाए रखने में विफल रहा। त्रुटियां बढ़ती गईं और भविष्यवाणियां अविश्वसनीय हो गईं। कैस्केडेड दृष्टिकोण, जहाँ सिस्टम अपने पिछले अनुमानों से चरण-दर-चरण भविष्य के अनुमान बनाता है, भविष्य की भविष्यवाणियों को स्थिर बनाए रखने का एकमात्र तरीका साबित हुआ। इसके अलावा, शोधकर्ताओं ने पाया कि एक साथ बहुत अधिक भविष्य के शब्दों की भविष्यवाणी करना वास्तव में प्रदर्शन को नुकसान पहुँचाता है, जो यह सुझाव देता है कि इस प्रकार के विजुअल कार्य के लिए मध्यम मात्रा का संदर्भ ही 'स्वीट स्पॉट' है। भविष्य के पूर्वानुमानों की संख्या को सीमित करके और प्रत्येक चरण के महत्व को सावधानीपूर्वक तौलकर, सिस्टम ने तत्काल विजुअल सटीकता और दीर्घकालिक संदर्भ के बीच संतुलन बनाना सीखा।

अंततः, यह कार्य प्रदर्शित करता है कि लिप रीडिंग की अस्पष्टता को हल करने के लिए केवल तेज कैमरों या बड़े शब्दकोशों की आवश्यकता नहीं है; इसके लिए एक ऐसे मॉडल की आवश्यकता है जो भाषण के कथा प्रवाह (नैरेटिव फ्लो) को समझता हो। भविष्य के संदर्भ को डिकोडिंग प्रक्रिया में सीधे एकीकृत करके, CMTD मॉडल उन शब्दों के बीच अंतर कर सकता है जो होंठों पर एक जैसे दिखते हैं लेकिन अलग-अलग वाक्यों से संबंधित होते हैं। परिणाम बताते हैं कि यह दृष्टिकोण विजुअल स्पीच की अंतर्निहित अनिश्चितता को संभालने का एक मजबूत तरीका प्रदान करता है, जो मूक संचार पर निर्भर तकनीक के लिए एक महत्वपूर्ण कदम है। जबकि वर्तमान परीक्षण नियंत्रित, उच्च-गुणवत्ता वाले वीडियो डेटा पर किए गए थे, इस पद्धति की सफलता एक ऐसी नींव रखती है जो भविष्य के सिस्टम बना सकती है जो वास्तविक दुनिया की बातचीत की अधिक जटिल और अप्रत्याशित स्थितियों को संभाल सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →