UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations
यह शोध पत्र उर्दूस्पीच (UrduSpeech) को प्रस्तुत करता है, जो एक बड़े पैमाने का, उच्च-निष्ठा वाला उर्दू भाषण संग्रह है जिसमें 12-आयामी पैरालिंग्विस्टिक एनोटेशन के साथ 156 घंटे का ऑडियो शामिल है और जिसे स्पीच टेक्नोलॉजी में इस भाषा की कम-संसाधन वाली स्थिति को संबोधित करने के लिए एक एलएलएम-संचालित (LLM-driven) पाइपलाइन के माध्यम से विकसित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया एक विशाल पुस्तकालय है। वर्षों से, इस पुस्तकालय में अंग्रेजी, मंदारिन और स्पेनिश में किताबें भरी गई हैं, लेकिन उर्दू—जो 23 करोड़ से अधिक लोगों द्वारा बोली जाने वाली भाषा है—के लिए समर्पित खंड लगभग खाली रहा है। यह एक रोबोट को केवल कुछ बिखरे हुए, धूल भरे पर्चों का उपयोग करके एक भाषा बोलना सिखाने जैसा है।
यह शोध पत्र UrduSpeech पेश करता है, जो एक नया विशाल "बुकशेल्फ़" है जिसे इस असंतुलन को ठीक करने के लिए डिज़ाइन किया गया है। यहाँ एक सरल विवरण दिया गया है कि शोधकर्ताओं ने क्या बनाया और उन्होंने इसे कैसे किया।
1. समस्या: एक भाषा जिसे पीछे छोड़ दिया गया
उर्दू अद्वितीय है क्योंकि यह दाएं-से-बाएं (अरबी की तरह) लिखी जाती है और अक्सर वाक्यों में अंग्रेजी शब्दों को मिला देती है (थोड़ा वैसा ही जैसे कोई व्यक्ति कहानी सुनाते समय दो बोलियों के बीच स्विच करता है)। इन विशेषताओं के कारण, मानक AI उपकरण अक्सर भ्रमित हो जाते हैं, उर्दू को हिंदी समझ लेते हैं या यह समझने में विफल रहते हैं कि वक्ता कब भाषा बदल रहा है। शोधकर्ता एक ऐसा संसाधन बनाना चाहते थे जो इन विशिष्ट चुनौतियों का सम्मान करे।
2. समाधान: एक 156-घंटे का "ध्वनि पुस्तकालय"
टीम ने UrduSpeech बनाया, जो 156 घंटों के उच्च गुणवत्ता वाले ऑडियो का एक संग्रह है। इसे समझने के लिए, यदि आप इसे बिना रुके सुनते, तो इसे पूरा करने में आपको छह दिन से अधिक का समय लगता।
उन्होंने इस लाइब्रेरी को केवल यादृच्छिक शोर (random noise) के रूप में नहीं डाला। उन्होंने इस लाइब्रेरी को तीन विशिष्ट "कमरों" (उपसमुच्चयों) में व्यवस्थित किया:
- US-Std: मानक पाकिस्तानी उर्दू (औपचारिक, "पाठ्यपुस्तक" संस्करण)।
- US-CS: कोड-स्विच्ड उर्दू (जहाँ वक्ता स्वाभाविक रूप से उर्दू और अंग्रेजी को मिलाते हैं, जैसे कि कहना "I need a chai and a coffee")।
- US-EngPk: पाकिस्तानी लहजे के साथ बोली जाने वाली अंग्रेजी।
3. उन्होंने इसे कैसे बनाया: एक "स्मार्ट फ़िल्टर" पाइपलाइन
इस डेटा को इकट्ठा करना पत्थरों के ढेर में विशिष्ट रत्न खोजने जैसा था। उन्होंने इंटरनेट (YouTube) और पुराने अभिलेखागारों (जैसे 1980 के दशक के टीवी शो) से 200 घंटे का ऑडियो एकत्र किया। इसे साफ करने के लिए, उन्होंने तीन-चरणीय प्रक्रिया का उपयोग किया:
- चरण 1: नॉइज़ कैंसलर (शोर कम करने वाला): उन्होंने बैकग्राउंड शोर (जैसे ट्रैफिक या हवा) को हटाने और बातचीत में अलग-अलग आवाजों को अलग करने के लिए AI टूल्स का उपयोग किया, जिससे यह सुनिश्चित हुआ कि केवल मुख्य वक्ता ही रिकॉर्ड किया गया है।
- चरण 2: "स्ट्रिक्ट एडिटर" (कठोर संपादक - LLM): उन्होंने एक शक्तिशाली AI (Gemini 2.5 Pro) का उपयोग एक सख्त संपादक के रूप में किया। इस AI को विशेष निर्देश दिए गए थे: "अंग्रेजी शब्दों को उर्दू लिपि में अनुवाद न करें; उन्हें उनके उच्चारण के अनुसार ही रखें," और "उर्दू को हिंदी समझने की गलती न करें।" इसने 12 विभिन्न "वाइब" टैग्स (पैरालिंग्विस्टिक्स) के लिए भी ऑडियो की जांच की, जैसे कि वक्ता की आयु, भावना, आवाज की बनावट (क्या वह कर्कश है या सुरीली?), और लहजा।
- चरण 3: मानवीय सुरक्षा जाल (Human Safety Net): डेटा को अंतिम रूप देने से पहले, मूल उर्दू बोलने वालों ने नमूनों को सुना ताकि यह सुनिश्चित हो सके कि AI ने कोई गलती नहीं की है। वे अंतिम गुणवत्ता नियंत्रण निरीक्षक के रूप में कार्य करते थे।
4. "गोल्ड स्टैंडर्ड" बेंचमार्क
यह सिद्ध करने के लिए कि उनकी लाइब्रेरी अच्छी थी, उन्होंने एक 9-घंटे का "गोल्ड स्टैंडर्ड" सेट बनाया। यह एक छोटा, पूरी तरह से क्यूरेटेड संग्रह है जिसे मनुष्यों द्वारा मैन्युअल रूप से जांचा और सुधारा गया है। उन्होंने इसका उपयोग विभिन्न AI ट्रांसक्रिप्शन मॉडल का परीक्षण करने के लिए किया।
परिणाम: उन्होंने पाया कि मौजूदा AI मॉडल उर्दू के साथ संघर्ष करते हैं, अक्सर शब्दों को गलत समझते हैं या लिपियों को मिला देते हैं। हालांकि, उनके द्वारा चुने गए मॉडल (Gemini 2.5 Pro) ने काफी बेहतर प्रदर्शन किया, जो एक मूल वक्ता की तरह व्यवहार करता है जो भाषा की बारीकियों को समझता है।
5. लाइब्रेरी के अंदर क्या है?
अंतिम संग्रह में 71,792 अलग-अलग ऑडियो क्लिप हैं। यह अविश्वसनीय रूप से विविध है:
- सामग्री: इसमें समाचार और नाटकों से लेकर कविता, व्लॉग और यहाँ तक कि बेत-बाज़ी नामक दुर्लभ मौखिक कविता भी शामिल है।
- लोग: इसमें पुरुषों और महिलाओं का संतुलित मिश्रण है, और बच्चों से लेकर बुजुर्गों तक सभी उम्र के वक्ताओं की भागीदारी है।
- गुणवत्ता: जब मनुष्यों ने ऑडियो सुना, तो उन्होंने इसे उच्च स्कोर (5 में से 4.6) दिया, जिससे पुष्टि हुई कि आवाजें स्पष्ट हैं और ट्रांसक्रिप्शन सटीक है।
6. यह क्यों महत्वपूर्ण है
पिछले उर्दू डेटासेट्स को एक छोटे, बंद कमरे के रूप में सोचें जिसमें कुछ कुर्सियाँ हैं। UrduSpeech एक विशाल, खुला हॉल है जिसमें हजारों सीटें हैं, जो सभी पृष्ठभूमियों के लोगों से भरा है जो वास्तव में अपनी वास्तविक शैली में बोल रहे हैं।
शोधकर्ताओं ने इस लाइब्रेरी को मुफ्त और खुला बनाया है ताकि कोई भी इसका उपयोग कर सके। इस उच्च-गुणवत्ता वाले, सुव्यवस्थित डेटा को प्रदान करके, वे AI डेवलपर्स को बेहतर उर्दू टूल बनाने में मदद करने की आशा करते हैं, जिससे यह सुनिश्चित हो सके कि यह प्रमुख भाषा डिजिटल भविष्य में पीछे न छूट जाए।
संक्षेप में: उन्होंने उर्दू के लिए एक विशाल, सूक्ष्मता से व्यवस्थित ध्वनि पुस्तकालय बनाया, अन्य AI टूल्स द्वारा की जाने वाली गलतियों को सुधारा, और यह सिद्ध किया कि सही मानवीय और मशीन टीम वर्क के साथ, जटिल, मिश्रित-भाषा भाषण को भी पूरी तरह से समझा जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।