Tagarela - A Portuguese speech dataset from podcasts
यह शोध पत्र TAGARELA को प्रस्तुत करता है, जो कि 8,972 घंटों से अधिक के पॉडकास्ट ऑडियो वाला एक सार्वजनिक रूप से जारी किया गया, बड़े पैमाने का पुर्तगाली भाषण डेटासेट है, जिसे संसाधनों की कमी को दूर करने और इस भाषा के लिए अत्याधुनिक स्वचालित भाषण पहचान (automatic speech recognition) और टेक्स्ट-टू-स्पीच मॉडल को सक्षम करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कंप्यूटर की आवाज़ों (जैसे सिरी या एलेक्सा) की दुनिया की कल्पना एक विशाल पुस्तकालय के रूप में करें। अंग्रेजी जैसी भाषाओं के लिए, यह पुस्तकालय लाखों बेहतरीन किताबों, रिकॉर्डिंग और स्क्रिप्टों से भरी एक गगनचुंबी इमारत की तरह है। कंप्यूटर अंग्रेजी को बहुत अच्छी तरह से सीखने और समझने में सक्षम हैं क्योंकि उनके पास अध्ययन करने के लिए बहुत सारी उच्च-गुणवत्ता वाली सामग्री है।
लेकिन पुर्तगाली के लिए, वह पुस्तकालय एक धूल भरे, आधे खाली शेड जैसा था। कुछ किताबें तो थीं, लेकिन वे छोटी थीं, अव्यवस्थित थीं, या इस तरह लिखी गई थीं जिन्हें कंप्यूटर आसानी से पढ़ नहीं सकता था। इसका मतलब था कि पुर्तगाली आवाजें अक्सर रोबोटिक लगती थीं, या कंप्यूटर लोगों की बातों को समझने में संघर्ष करते थे।
पेश है "TAGARELA"।
इस शोध पत्र के लेखकों ने विशेष रूप से पुर्तगाली के लिए एक नया, विशाल पुस्तकालय बनाने का निर्णय लिया। वे इसे TAGARELA कहते हैं (जो पुर्तगाली में "चैटर" या "बड़बड़ाने" जैसा सुनाई देता है)। उन्होंने इसे कैसे बनाया, इसकी कहानी यहाँ सरल रूप में दी गई है:
1. कच्चा माल: पॉडकास्ट का एक पहाड़
उन्होंने "Cem Mil Podcasts" (एक लाख पॉडकास्ट) नामक एक विशाल संग्रह से शुरुआत की। इसे अनियंत्रित पॉडकास्ट रिकॉर्डिंग के एक विशाल ढेर के रूप में समझें।
- समस्या: ये रिकॉर्डिंग अस्त-व्यस्त थीं। कई लोग एक-दूसरे के ऊपर बोल रहे थे, बैकग्राउंड में शोर (जैसे कॉफी कप टकराने की आवाज़ या ट्रैफिक) था, और टेक्स्ट ट्रांसक्रिप्ट (लिखित शब्द) अक्सर गलत या गायब थे। यह ऐसा था जैसे किसी ऐसी भीड़भाड़ वाली पार्टी को सुनकर भाषा सीखने की कोशिश करना जहाँ हर कोई एक साथ चिल्ला रहा हो।
- लक्षव: वे इस बिखरे हुए ढेर को स्पष्ट भाषण की एक निर्मल, व्यवस्थित लाइब्रेरी में बदलना चाहते थे। यह 8,972 घंटों का ऑडियो है—इतना बहुत सारा ऑडियो—जो अंग्रेजी के सबसे बड़े डेटासेटों का मुकाबला करने के लिए पर्याप्त है।
2. निर्माण दल: "क्लीनिंग पाइपलाइन"
इस गड़बड़ी को ठीक करने के लिए, टीम ने पाँच विशिष्ट श्रमिकों के साथ एक डिजिटल असेंबली लाइन (पाइपलाइन) बनाई:
- व्यवस्थित करने वाला (Standardization): सबसे पहले, उन्होंने सुनिश्चित किया कि प्रत्येक ऑडियो फ़ाइल एक जैसी दिखे, जैसे कि सभी किताबों को एक ही फ़ॉन्ट आकार और कागज़ की गुणवत्ता में बदलना।
- बॉडीगार्ड (Speaker Separation): पॉडकास्ट में लोग एक-दूसरे के ऊपर बोलते हैं। यह कार्यकर्ता एक बाउंसर की तरह काम करता है, जो आवाज़ों को अलग करता है ताकि प्रत्येक रिकॉर्डिंग में केवल एक ही व्यक्ति बोल रहा हो। यह कंप्यूटर को एक स्पष्ट, एकल आवाज़ की नकल करने के लिए सिखाने के लिए महत्वपूर्ण है।
- शोर फिल्टर (Overlap Detection): वक्ताओं को अलग करने के बाद भी, कभी-कभी दो लोग बिल्कुल एक ही समय पर बात करते हैं। टीम ने इन "डुएट" (दोहरी आवाज़ों) को पहचानने और उन्हें हटाने के लिए एक स्मार्ट AI को प्रशिक्षित किया, जिससे केवल एकल प्रदर्शन ही बचे।
- अनुवादक (Transcription): उन्हें ऑडियो को टेक्स्ट में बदलने की आवश्यकता थी। उन्होंने केवल एक अनुवादक को काम पर नहीं रखा; उन्होंने एक "स्मार्ट टीम" दृष्टिकोण का उपयोग किया। उन्होंने उच्च-गुणवत्ता वाले डेटा पर प्रशिक्षित एक सुपर-स्मार्ट AI (Whisper) का उपयोग किया ताकि शब्दों को लिखा जा सके। यह सुनिश्चित करने के लिए कि AI "भ्रमित" न हो (यानी मनगढ़ंत बातें न बनाए), उन्होंने दूसरे AI के साथ इसके काम की जांच की। यदि दोनों सहमत थे, तभी टेक्स्ट को रखा गया।
- पॉलिश करने वाला (Denoising): अंत में, उन्होंने बैकग्राउंड की सरसराहट, स्टेटिक और गूँज को साफ करने के लिए एक विशेष टूल का उपयोग किया, जिससे पीछे केवल क्रिस्टल-क्लियर ऑडियो बचा।
3. परिणाम: दो विशेष लाइब्रेरी
सफाई पूरी होने के बाद, उन्होंने संग्रह को दो विशेष वर्गों में विभाजित किया:
- "रियल टॉक" सेक्शन (8,972 घंटे): इसमें वे सभी स्वाभाविक ठहराव, "अम्म" और "आह" शामिल हैं जो लोग बोलते समय करते हैं। यह कंप्यूटर को मानव भाषण को समझने (Automatic Speech Recognition) के लिए सिखाने हेतु एकदम सही है।
- "स्टूडियो" सेक्शन (2,800 घंटे): यह अत्यंत स्वच्छ, एकल-वक्ता वाला ऑडियो है। यह कंप्यूटर को हमारे सामने स्वाभाविक रूप से बोलने (Text-to-Speech) के लिए सिखाने हेतु आदर्श है।
4. टेस्ट ड्राइव
यह साबित करने के लिए कि उनकी नई लाइब्रेरी काम करती है, उन्होंने केवल इसी डेटा का उपयोग करके दो नए कंप्यूटर मॉडल बनाए:
- सुनने वाला (The Listener): उन्होंने एक मॉडल को पुर्तगाली समझने के लिए प्रशिक्षित किया। यह इतना अच्छा हो गया कि इसने मौजूदा दिग्गजों को भी पीछे छोड़ दिया, और बहुत कम गलतियों के साथ भाषण को समझने लगा।
- बोलने वाला (The Speaker): उन्होंने एक मॉडल को भाषण उत्पन्न करने के लिए प्रशिक्षित किया। परिणाम एक ऐसी आवाज़ थी जो बहुत मानवीय लग रही थी, जिसमें एक स्वाभाविक लय और प्रवाह था, और जिसने मानव श्रोताओं से उच्च अंक प्राप्त किए।
यह क्यों महत्वपूर्ण है
इससे पहले, पुर्तगाली स्पीच टेक्नोलॉजी "छोटे शेड" वाले चरण में फंसी हुई थी। TAGARELA एक गगनचुंबी इमारत के दरवाजे खोलने जैसा है। यह शोधकर्ताओं और डेवलपरों को दुनिया भर के लाखों पुर्तगाली बोलने वालों के लिए बेहतर, अधिक प्राकृतिक और अधिक सटीक वॉयस टेक्नोलॉजी बनाने के लिए एक विशाल, उच्च-गुणवत्ता वाला आधार प्रदान करता है।
संक्षेप में: उन्होंने पॉडकास्ट के एक बिखरे हुए, शोर भरे ढेर को लिया, एक हाई-टेक असेंबली लाइन के साथ उसे साफ किया, और उसे पुर्तगाली वॉयस AI के लिए स्वर्ण मानक (Gold Standard) में बदल दिया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।