← नवीनतम पेपर
💬 NLP

Goodness-of-pronunciation without phoneme time alignment

यह शोध पत्र एएसआर (ASR) परिकल्पनाओं को फोनम कन्फ्यूजन नेटवर्क में मैप करके और क्रॉस-अटेंशन के माध्यम से शब्द-स्तरीय और फ्रेम-स्तरीय विशेषताओं को संयोजित करके, बिना फोनम टाइम अलाइनमेंट की आवश्यकता के उच्चारण की शुद्धता (goodness-of-pronunciation) स्कोर की गणना करने की एक विधि प्रस्तावित करता है, जिससे कमजोर रूप से पर्यवेक्षित (weakly-supervised) मॉडलों का उपयोग करके कम-संसाधन वाली भाषाओं के लिए प्रभावी भाषण मूल्यांकन सक्षम होता है।

मूल लेखक: Jeremy H. M. Wong, Nancy F. Chen

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jeremy H. M. Wong, Nancy F. Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भाषा शिक्षक हैं जो किसी छात्र के उच्चारण (pronunciation) को ग्रेड करने की कोशिश कर रहे हैं। अतीत में, इसे स्वचालित रूप से करने के लिए, आपको एक बहुत ही विशिष्ट, महंगे टूल की आवश्यकता होती थी: एक फ्रेम-सिंक्रोनस एएसआर (ASR) मॉडल।

इस पुराने टूल को एक अत्यधिक विशिष्ट, द्विभाषी समय-यात्री (time-traveler) की तरह समझें। काम करने के लिए, इसे हजारों घंटों की सटीक रिकॉर्डिंग पर प्रशिक्षित करने की आवश्यकता थी जहाँ किसी ने एक वाक्य बोला हो और किसी इंसान ने ठीक वही लिखा हो जो उन्होंने कहा था, शब्द-दर-शब्द और ध्वनि-दर-ध्वनि। फिर यह एक सटीक मानचित्र बनाता था, जो यह दिखाता था कि ऑडियो का कौन सा विशिष्ट मिलीसेकंड किस विशेष ध्वनि (फोनीम) के अनुरूप है।

समस्या:
यह "समय-यात्री" अंग्रेजी या चीनी के लिए तो बेहतरीन है, लेकिन कम-संसाधन वाली भाषाओं (जैसे तमिल, या कई स्वदेशी भाषाओं) के लिए यह असंभव है। ऐसे "भाषण-और-पाठ" (speech-and-text) के सटीक जोड़े खोजने के लिए पर्याप्त लोग उपलब्ध नहीं हैं। इस मानचित्र के बिना, सिस्टम ग्रेड नहीं कर सकता।

नया समाधान:
इस शोध पत्र के लेखकों ने एक तरीका खोजा जिससे वे एक आधुनिक, ओपन-सोर्स एआई (जैसे Whisper) का उपयोग कर सकते हैं जिसे उस सटीक मानचित्र की आवश्यकता नहीं है। व्हिस्पर (Whisper) को एक सुपर-स्मार्ट, बहुभाषी जासूस के रूप में सोचें जिसने इंटरनेट पर लगभग हर किताब पढ़ ली है। वह क्या कहा गया है इसका अनुमान लगाने में अद्भुत है, लेकिन वह थोड़ा अव्यवस्थित है। वह सटीक मिनट-दर-मिनट ध्वनि का नक्शा नहीं देता; वह बस संभावित वाक्यों की एक सूची देता है।

यह शोध पत्र पूछता है: हम इस अव्यवस्थित जासूस का उपयोग बिना उस सटीक मानचित्र के उच्चारण ग्रेड करने के लिए कैसे कर सकते हैं?

उन्होंने इसे तीन चतुर तरीकों का उपयोग करके हल किया है:

1. "कन्फ्यूजन नेटवर्क" (समूह का वोट)

जासूस से केवल एक उत्तर मांगने के बजाय, वे उससे शीर्ष 200 अनुमानों (एक N-best लिस्ट) की मांग करते हैं।

  • उपमा: कल्पना करें कि जासूस एक जूरी (पंचायत) है। केवल एक फैसले के बजाय, आपको 200 अलग-अलग जूरी सदस्यों की राय मिलती है।
  • चमत्कार: सिस्टम उन सभी 200 अनुमानों को लेता है और उन्हें एक कन्फ्यूजन नेटवर्क में मिला देता है। यह एक फ्लोचार्ट की तरह है जो कहता है, "90% जूरी को लगता है कि शब्द 'Cat' था, लेकिन 10% को लगा कि यह 'Bat' था।"
  • परिणाम: सटीक समय मानचित्र के बिना भी, सिस्टम अब यह गणना कर सकता है कि एआई विशिष्ट ध्वनियों के बारे में कितना आश्वस्त है। यदि एआई अनिश्चित है, तो संभवतः छात्र ने गलत उच्चारण किया है।

2. "वर्ड-लेवल" स्पीडोमीटर

आमतौर पर, प्रवाह (fluency) को मापने के लिए आपको यह जानने की आवश्यकता होती है कि छात्र ने एक विशिष्ट ध्वनि (जैसे "snake" में "s") को कितनी देर तक खींचा। लेकिन अव्यवस्थित जासूस ध्वनि-स्तर का समय नहीं देता।

  • उपमा: आप यह तो नहीं माप सकते कि एक धावक का बायां पैर कितनी तेजी से जमीन से टकराया, लेकिन आप यह तो माप सकते हैं कि उसने पूरा चक्कर कितनी तेजी से लगाया।
  • चमत्कार: व्यक्तिगत ध्वनियों के समय को मापने के बजाय, सिस्टम पूरे शब्दों की गति को मापता है। यह जासूस के आंतरिक "अटेंशन" (कि उसने ऑडियो के किन हिस्सों पर ध्यान केंद्रित किया) का उपयोग करता है ताकि यह पता लगाया जा सके कि एक शब्द कब शुरू हुआ और कब समाप्त हुआ। बिना सूक्ष्म ध्वनि मानचित्र के प्रवाह को आंकने के लिए यह "पर्याप्त अच्छा" है।

3. "क्रॉस-अटेंशन" ब्रिज

सबसे बड़ी बाधा यह थी कि पुराने सिस्टम को "ध्वनि A" को "ऑडियो क्षण A" के साथ संरेखित करने की आवश्यकता थी। नए सिस्टम के पास "ध्वनि A" (टेक्स्ट से) और "ऑडियो क्षण A" (एआई के अनुमान से) दोनों हैं, लेकिन वे पूरी तरह से मेल नहीं खाते।

  • उपमा: कल्पना करें कि आप सामग्रियों की एक सूची (टेक्स्ट) को कटी हुई सब्जियों के ढेर (ऑडियो) के साथ मिलाने की कोशिश कर रहे हैं। पुराने दिनों में, आपको एक शेफ की आवश्यकता होती जो आपको बताता कि गाजर का कौन सा टुकड़ा "गाजर" के साथ जाता है। अब, आपके पास कटे हुए सब्जियों का ढेर और एक सूची है, लेकिन कोई शेफ नहीं है।
  • चमत्कार: उन्होंने एक स्मार्ट ब्रिज (एक क्रॉस-अटेंशन लेयर) बनाया। सटीक 1-से-1 मिलान करने के बजाय, यह ब्रिज सिस्टम को "आस-पास देखने" की अनुमति देता है। यह पूछता है, "टेक्स्ट कहता है 'Cat'। ऑडियो के ढेर का कौन सा हिस्सा 'Cat' जैसा दिखता है?" यह बिना किसी पूर्व-निर्धारित मानचित्र के टेक्स्ट को ऑडियो से गतिशील रूप से जोड़ना सीख जाता है।

परिणाम

टीम ने इसका परीक्षण अंग्रेजी (जहाँ हमारे पास सटीक मानचित्र हैं) और तमिल (एक कम-संसाधन वाली भाषा जहाँ हमारे पास वे नहीं हैं) पर किया।

  • अंग्रेजी में: नया "अव्यवस्थित जासूस" तरीका पुराने, महंगे "समय-यात्री" तरीके के समान प्रदर्शन करता है।
  • तमिल में: नया तरीका वास्तव में पुराने तरीके को पछाड़ देता! क्यों? क्योंकि पुराने तरीके को एक छोटे, सीमित डेटासेट पर प्रशिक्षित किया जाना था, जबकि नए तरीके ने ओपन-सोर्स एआई के विशाल, विविध ज्ञान का उपयोग किया।

मुख्य निष्कर्ष

यह शोध पत्र यह सिद्ध करता है कि हमें हर भाषा में कंप्यूटर को उच्चारण ग्रेड करना सिखाने के लिए महंगे, कस्टम-मेड टूल्स की आवश्यकता नहीं है। एक सामान्य-उद्देश्य वाले एआई के "अनुमानों" की व्याख्या करने के लिए चतुर गणित का उपयोग करके, हम मुफ्त में कम-संसाधन वाली भाषाओं में भाषण को ग्रेड कर सकते हैं, जिससे भाषा सीखने वाले ऐप्स के लिए दुनिया में कहीं भी काम करने का रास्ता खुल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →