CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
मूल लेखक: Shijun Luo
मूल लेखक: Shijun Luo
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: CN-NEWSTTS बेंच
समस्या विवरण
चीनी समाचार टेक्स्ट में अक्सर सघन, गैर-मानक लिखित रूप होते हैं—जैसे कि खेल स्कोर (उदाहरण के लिए, 96-91), हाइफ़न वाले मॉडल नाम (उदाहरण के लिए, 苏 -27), रेंज, यूनिट सिंबल, प्रतिशत, और मिश्रित चीनी-लैटिन-डिजिट नाम। हालांकि ये मानव संपादकों के लिए स्पष्ट हैं, लेकिन ये टेक्स्ट-टू-स्पीच (TTS) सिस्टम के लिए महत्वपूर्ण चुनौतियां पेश करते हैं। एक TTS मॉडल लिखित स्ट्रिंग को सुरक्षित रख सकता है लेकिन बोले गए अर्थ को बदल सकता है (जैसे, एक स्कोर को रेंज के रूप में पढ़ना, या एक सैन्य मॉडल को ऋणात्मक संख्या के रूप में पढ़ना)। मौजूदा मूल्यांकन विधियाँ, जैसे कि व्यक्तिपरक मीन ओपिनियन स्कोर (MOS) परीक्षण या सामान्य ASR राउंड-ट्रिप तुलनाएं, इन विशिष्ट, उच्च-प्रभाव वाले पठन निर्णयों को ट्रैक करने के लिए बहुत अधिक सामान्य (coarse) हैं। इसके अलावा, वर्तमान बेंचमार्क अक्सर उपयोगकर्ता-पक्ष नॉर्मलाइजेशन, लार्ज लैंग्वेज मॉडल (LLM) रीराइटिंग, या SSML संकेतों पर निर्भर करते हैं, जो तैनात किए गए TTS API के "रॉ-इनपुट" व्यवहार का मूल्यांकन करने में विफल रहते हैं।
कार्यप्रणाली
यह शोध पत्र CN-NewsTTS Bench v0.1 प्रस्तुत करता है, जो एक ओपन, टार्गेट-लेवल ऑटोमैटिक बेंचमार्क है जिसे बाहरी नियमों या मैनुअल संपादन के बिना कच्चे टेक्स्ट से चीनी समाचार TTS के उच्चारण का मूल्यांकन करने के लिए डिज़ाइन किया गया है।
डेटा निर्माण: डेटासेट में 1,000 नियत (deterministic), सिंथेटिक समाचार-शैली के वाक्य शामिल हैं जो श्रेणी-विशिष्ट टेम्पलेट्स और लेक्सिकॉन (खेल, सैन्य मॉडल, तकनीकी इकाइयाँ आदि को कवर करते हुए) से उत्पन्न किए गए हैं। इसमें 200 रिकॉर्ड का एक डेवलपमेंट सेट और 800 रिकॉर्ड का एक पब्लिक टेस्ट सेट शामिल है, जिसमें 992 ऑटो-इवैलुएबल लक्ष्य (targets) हैं।
मूल्यांकन प्रोटोकॉल (रॉ इनपुट प्रोडक्ट ट्रैक): सिस्टम का मूल्यांकन सीधे मूल चीनी समाचार टेक्स्ट को प्रोसेस करने की उनकी क्षमता पर किया जाता है। प्रोवाइडर-इंटरनल नॉर्मलाइजेशन की अनुमति है, लेकिन बाहरी नियम फ्रंटएंड, LLM रीराइट्स, SSML संकेत, और मैनुअल टेक्स्ट संपादन को सख्ती से वर्जित किया गया है। सभी नमूनों के लिए एक फिक्स्ड वॉयस का उपयोग किया जाता है ताकि उच्चारण प्रदर्शन को अलग किया जा सके।
थ्री-ASR स्कोरिंग प्रोटोकॉल: मानवीय श्रवण की व्यक्तिपरकता और एकल ASR मॉडल की सीमाओं से बचने के लिए, बेंचमार्क तीन ASR रूटों के एक हेट्रोजेनियस एन्सेम्बल का उपयोग करता है:
- MiMo API ASR (API-आधारित)
- SenseVoiceSmall (ओपन-सोर्स लोकल)
- Paraformer-zh (ओपन-सोर्स लोकल)
स्कोरर ट्रांसक्रिप्ट को नॉर्मलाइज़ करता है (यूनिकोड, केस, विराम चिह्न) और उन्हें पूर्व-निर्धारित "पॉजिटिव" (सही) और "नेगेटिव" (गलत) रीडिंग पैटर्न के साथ मैच करता है। एक लक्ष्य को तब सही (correct) के रूप में चिह्नित किया जाता है यदि एक पॉजिटिव पैटर्न मिलता है, गलत (wrong) के रूप में यदि एक नेगेटिव पैटर्न मिलता है, और अन्यथा अज्ञात (unknown) के रूप में। अंतिम परिणाम बहुमत मतदान (कम से कम दो रूटों को सहमत होना चाहिए) का उपयोग करते हैं।
मेट्रिक्स: प्राथमिक मेट्रिक स्ट्रिक्ट ऑटो एक्यूरेसी (कुल ऑटो-इवैलुएबल लक्ष्यों में विभाजित सही लक्ष्य) है। लेखक कवरेज (सही या गलत के रूप में हल किए गए लक्ष्य) और रिजॉल्व्ड एक्यूरेसी (हल किए गए लक्ष्यों में विभाजित सही लक्ष्य) भी रिपोर्ट करते हैं ताकि सिस्टम को कठिन लक्ष्यों को हल करने में विफल होकर सटीक दिखने से रोका जा सके।
प्रमुख योगदान
- ओपन डिटरमिनिस्टिक स्प्लिट: चीनी समाचार उच्चारण लक्ष्यों के लिए एक निश्चित डेव/पब्लिक स्प्लिट, जो पुनरुत्पादकता (reproducibility) सुनिश्चित करता है।
- रॉ इनपुट प्रोडक्ट ट्रैक: एक विशिष्ट मूल्यांकन ट्रैक जो उपयोगकर्ता-पक्ष नॉर्मलाइजेशन को बाहर करता है, जिससे तैनात किए गए TTS API के एंड-टू-एंड व्यवहार का परीक्षण होता है।
- टार्गेट-लेवल स्कीमा: विशिष्ट लक्ष्यों के लिए पॉजिटिव और नेगेटिव रीडिंग के बीच अंतर करने वाला एक ग्रैनुलर मूल्यांकन स्कीमा।
- थ्री-ASR ऑटोमैटिक स्कोरिंग: अस्पष्टता को संभालने के लिए रूट डायग्नोस्टिक्स और एब्लेशन स्टडीज के साथ ASR मॉडल के एक एन्सेम्बल का उपयोग करने वाला एक मजबूत प्रोटोकॉल।
- पुनरुत्पादक लीडरबोर्ड: सात प्रोडक्ट TTS सिस्टम के शुरुआती परिणाम, जो भविष्य के तुलनाओं के लिए एक बेसलाइन प्रदान करते हैं।
परिणाम
बेंचमार्क ने सात प्रमुख TTS सिस्टम का मूल्यांकन किया: Volcano/Doubao, Azure, Google, MiniMax, Aliyun, MiMo, और AWS Polly।
- प्रदर्शन भिन्नता: प्रदर्शन में काफी भिन्नता है। सर्वश्रेष्ठ सिस्टम (Volcano) ने 0.879 की स्ट्रिक्ट एक्यूरेसी हासिल की, जबकि कई व्यापक रूप से उपयोग किए जाने वाले सिस्टम 0.60 से नीचे रहे।
- श्रेणी की कठिनाई: प्रदर्शन श्रेणियों के अनुसार काफी भिन्न होता है। सिस्टम ने मुख्य रूप से प्रतिशत, वाहन मॉडल और संक्षिप्त रूपों को हल किया। हालांकि, स्पोर्ट्स स्कोर सबसे कठिन श्रेणी थी (कुछ सिस्टम के लिए स्ट्रिक्ट एक्यूरेसी 0.000 जितनी कम थी), जिन्हें अक्सर रेंज या घटाव के रूप में गलत पढ़ा जाता है। यूनिट सिंबल में ASR सीमाओं के कारण उच्चतम "अननोन" दर देखी गई क्योंकि वे सिंबल-लेवल रीडिंग को प्रदर्शित करने में अक्षम थे।
- ASR डायग्नोस्टिक्स: तीन-रूट एन्सेम्बल ने दिखाया कि जबकि व्यक्तिगत रूटों की स्ट्रिक्ट एक्यूरेसी समान थी, उनकी कवरेज अलग-अलग थी। MiMo API ASR रूढ़िवादी था (उच्च रिजॉल्व्ड एक्यूरेसी लेकिन कई अननोन), जबकि स्थानीय मॉडलों ने अधिक लक्ष्यों को हल किया। बहुमत मतदान ने व्यक्तिगत रूट त्रुटियों के प्रभाव को कम कर दिया।
- विफलता मोड (Failure Modes): स्पोर्ट्स स्कोर पर शून्य स्कोर करने वाले सिस्टम के लिए, प्रमुख विफलता स्कोर हाइफन को रेंज के रूप में पढ़ना था (उदाहरण के लिए, "96-91" को "96 बनाम 91" के बजाय "96 से 91" के रूप में व्याख्या करना)।
महत्व और दावे
यह पेपर दावा करता है कि CN-NewsTTS Bench v0.1 एक सामान्य प्रोडक्शन विफलता मोड—कॉम्पैक्ट चीनी समाचार रूपों के गलत उच्चारण—को मापने योग्य और पुनरुत्पादक बनाता है। डेटा स्प्लिट, ASR ट्रांसक्रिप्ट, स्कोरर और श्रेणी डायग्नोस्टिक्स को फिक्स करके, बेंचमार्क कच्चे-इनपुट वाले TTS व्यवहार का मूल्यांकन करने का एक मानकीकृत तरीका प्रदान करता है। परिणाम संकेत देते हैं कि TTS में प्रगति के बावजूद, इन विशिष्ट गैर-मानक रूपों को सही ढंग से पढ़ना वर्तमान वाणिज्यिक उत्पादों के लिए एक व्यावहारिक चुनौती बनी हुई है। लेखक इस बात पर जोर देते हैं कि यह बेंचमार्क एक स्वचालित उपकरण है जिसका उद्देश्य मानव श्रवण परीक्षणों का पूरक बनना है, न कि उन्हें बदलना, विशेष रूप से उन टोनल त्रुटियों का पता लगाने के लिए जिन्हें ASR टेक्स्ट छिपा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।
हर हफ़्ते electrical engineering के बेहतरीन पेपर पाएँ।
Stanford, Cambridge और French Academy of Sciences के रिसर्चर हम पर भरोसा करते हैं।
अपना सब्सक्रिप्शन पक्का करने के लिए इनबॉक्स देखें।
कुछ गड़बड़ हो गई। फिर से कोशिश करें?
कोई स्पैम नहीं, कभी भी अनसब्सक्राइब करें।