PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech
यह शोध पत्र कम-संसाधन वाले गैर-लैटिन लिपि टेक्स्ट-टू-स्पीच मूल्यांकन के लिए एक स्वचालित स्क्रीनिंग फ्रेमवर्क, INSV-A को प्रस्तुत करता है, और इसे PashtoTTS-Bench के रूप में स्थापित करता है ताकि ASR वर्ड एरर रेट, स्क्रिप्ट फिडेलिटी और लैंग्वेज आइडेंटिफिकेशन जैसे मेट्रिक्स का उपयोग करके पश्तो पर कई TTS सिस्टम का व्यवस्थित रूप से आकलन किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक टैलेंट शो के जज हैं जहाँ बोलने वाले रोबोटों का मुकाबला होता है। आपका काम यह परीक्षण करना है कि क्या वे पश्तो बोल सकते हैं, जो अफगानिस्तान और पाकिस्तान में बोली जाने वाली एक भाषा है और जिसमें एक अनूठा लिपि (पर्सो-अरेबिक) का उपयोग होता है और इसमें कुछ बहुत ही कठिन ध्वनियाँ हैं जो अंग्रेजी या यहाँ तक कि उर्दू में भी नहीं मिलतीं।
लंबे समय तक, जज केवल एक ही तरीके से रोबोटों को ग्रेड दे सकते थे: वे रोबोट को सुनते थे, जो उन्होंने सुना उसे लिखते थे, और फिर गलत शब्दों की गिनती करते थे। इसे "वर्ड एरर रेट" (WER) कहा जाता है।
समस्या:
यह पुराना तरीका एक ऐसे शेफ को जज करने जैसा है जो एक मसालेदार करी बनाने की कोशिश कर रहा है लेकिन गलती से आपको सादे चावल परोस देता है। अगर जज केवल शब्दों को गिनता है, तो वह कह सकता है, "खैर, चावल का स्पेलिंग बिल्कुल सही है, इसलिए शेफ को अच्छा स्कोर मिलना चाहिए!" लेकिन जज इस तथ्य को भूल गया कि शेफ ने पूरी तरह से गलत व्यंजन परोस दिया है।
पश्तो TTS (टेक्स्ट-टू-स्पीच) की दुनिया में, रोबोट अक्सर तीन चालाकी भरी गलतियाँ करते हैं जिन्हें साधारण शब्द-गणना (word-count) पकड़ नहीं पाती:
- गलत भाषा: वे पश्तो टेक्स्ट पढ़ते हैं लेकिन उर्दू या दारी (पड़ोसी भाषाएँ) बोलते हैं।
- गलत लिपि: वे शब्दों को बोलते तो हैं लेकिन ट्रांसक्रिप्ट में गलत अक्षरों का उपयोग करते हैं (जैसे पश्तो अक्षरों के बजाय अंग्रेजी अक्षरों का उपयोग करना)।
- रोबोट की आवाज़: वे सही शब्दों को पूरी तरह से बोलते हैं, लेकिन आवाज़ सपाट, यांत्रिक और मानवीय कान के लिए अस्वाभाविक लगती है।
नया समाधान: INSV-A
इस पेपर के लेखक, हनीफ रहमान ने एक नया "स्कोरकार्ड" बनाया है जिसे INSV-A कहा जाता है। केवल एक नंबर के बजाय, यह चार भागों वाली एक चेकलिस्ट है जो हवाई अड्डे के सुरक्षा स्कैनर की तरह काम करती है।
यहाँ बताया गया है कि ये चार भाग एनालॉजी (उपमाओं) का उपयोग करके कैसे काम करते हैं:
इंटेलिजिबिलिटी (Intelligibility - "क्या आप मुझे सुन सकते हैं?" चेक):
- परीक्षण: क्या रोबोट वास्तव में आवाज़ निकाल रहा है? क्या एक कंप्यूटर शब्दों को ट्रांसक्राइब कर सकता है?
- एनालॉजी: यह यह जाँचने जैसा है कि रेडियो चालू है या नहीं और क्या सिग्नल शब्दों को समझने के लिए पर्याप्त स्पष्ट है।
स्क्रिप्ट फिडेलिटी (Script Fidelity - "पेन और पेपर" चेक):
- परीक्षण: जब कंप्यूटर रोबोट द्वारा बोली गई बात को लिखता है, तो क्या वह सही पश्तो अक्षरों का उपयोग करता है?
- एनालॉजी: यदि आप किसी से पश्तो में कविता लिखने के लिए कहते हैं, और वे आपको अंग्रेजी अक्षरों वाला कागज थमा देते हैं, तो वे परीक्षण में विफल रहे, भले ही उन्होंने कविता सही ढंग से बोली हो। यह चेक सुनिश्चित करता है कि "लेखन" "भाषा" से मेल खाता है।
वेरिफिकेशन (Verification - "पासपोर्ट" चेक):
- परीक्षण: क्या रोबोट वास्तव में पश्तो बोल रहा है, या उसने उर्दू में स्विच कर लिया है?
- एनालॉजी: यह सीमा पर पासपोर्ट चेक करने जैसा है। रोबोट शायद पश्तो बोलता हुआ दिखाई दे, लेकिन यह चेक पूछता है, "क्या आप वास्तव में पश्तो वक्ता हैं, या आप एक पड़ोसी भाषा बोलने वाले ढोंगी हैं?"
नेचुरलनेस (Naturalness - "मानवीय कान" चेक):
- परीक्षण: क्या यह एक असली इंसान जैसा लगता है, या एक रोबोट जैसा?
- एनालॉजी: यह "वाइब" (vibe) चेक है। भले ही शब्द एकदम सही हों, क्या यह एक मिलनसार पड़ोसी जैसा लगता है या एक ठंडी मशीन जैसा?
- नोट: पेपर कहता है कि यह हिस्सा योजनाबद्ध है लेकिन इस विशिष्ट रिलीज़ में पूरी तरह से नहीं किया गया है। उन्होंने टेस्ट सेटअप कर दिया है, लेकिन उन्होंने अभी तक "वाइब" स्कोर को ग्रेड करना पूरा नहीं किया है।
परिणाम: "PashtoTTS-Bench"
लेखक ने अप्रैल और मई 2026 में कई रोबोटों पर इस नए स्कोरकार्ड का परीक्षण किया। उन्हें क्या पता चला:
- "ऑटोमैटिक" रोबोट (OmniVoice auto): यह रोबोट आश्चर्यजनक विजेता रहा। इसने शब्द त्रुटियों की सबसे कम संख्या प्राप्त की।
- पकड़: इसने वास्तविक मानव वक्ताओं से बेहतर स्कोर किया। क्यों? क्योंकि कंप्यूटर जिसका उपयोग इसे ग्रेड करने के लिए किया जा रहा था, वह अव्यवस्थित, वास्तविक मानवीय भाषण (लहजे और बैकग्राउंड शोर के साथ) को समझने में खराब है, लेकिन यह रोबोट की साफ, सटीक आवाज़ को पसंद करता है। इसलिए, यहाँ कम त्रुटि स्कोर का मतलब यह नहीं है कि यह "इंसान से बेहतर" है, बल्कि इसका मतलब है कि रोबोट "साफ" सुनाई देता है।
- "कमर्शियल" रोबोट (Edge GulNawaz & Latifa): ये माइक्रोसॉफ्ट की आधिकारिक आवाजें हैं। उन्होंने स्पष्ट पश्तो बोलते हुए और सही अक्षरों का उपयोग करते हुए एक ठोस काम किया। वे एक "सुरक्षित" बेसलाइन हैं।
- "क्लोन्ड" रोबोट (OmniVoice clone): इस रोबोट ने आवाज़ की नकल करने की कोशिश की लेकिन थोड़ा लड़खड़ा गया, कुछ वाक्यों को बोलने में पूरी तरह विफल रहा।
- "उर्दू" रोबोट (कंट्रोल ग्रुप): लेखक ने एक ऐसे रोबोट का परीक्षण किया जो उर्दू बोलना चाहिए। इसने पश्तो टेस्ट में सही ढंग से फेल होने का प्रदर्शन किया, जिससे यह सिद्ध हुआ कि नया स्कोरकार्ड पश्तो और उसके पड़ोसी उर्दू के बीच अंतर कर सकता है।
बड़ी खोज: "विस्पर" (Whisper) का जाल
एक सबसे महत्वपूर्ण खोज लोकप्रिय टूल Whisper (एक प्रसिद्ध AI स्पीच टूल) के बारे में है।
- पेपर ने पाया कि Whisper पश्तो के प्रति अंधा है। भले ही पश्तो उसकी डिक्शनरी में शामिल है, लेकिन यह लगभग कभी भी इसे पहचान नहीं पाता है। यह सोचता है कि पश्तो कुछ और है।
- सबक: आप इन भाषाओं को जज करने के लिए केवल एक टूल पर भरोसा नहीं कर सकते। आपको अलग-अलग टूल्स की एक टीम (जैसे MMS और SpeechBrain) की आवश्यकता है जो एक-दूसरे को दोबारा चेक करें, अन्यथा आप विफलता को पूरी तरह से मिस कर सकते हैं।
सारांश
यह पेपर केवल एक स्कोर नहीं देता; यह एक नया नियम पुस्तिका देता है। यह हमें बताता है कि पश्तो जैसी भाषाओं के लिए, आप केवल शब्दों को नहीं गिन सकते। आपको यह जांचना होगा:
- क्या इसने सही भाषा बोली?
- क्या इसने सही अक्षरों का उपयोग किया?
- क्या इसने वास्तव में आवाज़ निकाली?
- (अंततः) क्या यह मानवीय लगा?
लेखक ने सभी उपकरण, परीक्षण प्रश्न और स्कोरिंग स्क्रिप्ट जारी कर दी है ताकि कोई भी भविष्य में इस परीक्षण को फिर से चला सके और देख सके कि क्या नए रोबोट बेहतर हो रहे हैं। यह एक "चेकपॉइंट" है ताकि हम यह सुनिश्चित कर सकें कि हम केवल ऐसे रोबोट नहीं बना रहे हैं जो दिखते हैं कि वे पश्तो बोलते हैं, बल्कि वे वास्तव में बोलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।