← नवीनतम पेपर
💬 NLP

Tagarela - A Portuguese speech dataset from podcasts

यह शोध पत्र TAGARELA को प्रस्तुत करता है, जो कि 8,972 घंटों से अधिक के पॉडकास्ट ऑडियो वाला एक सार्वजनिक रूप से जारी किया गया, बड़े पैमाने का पुर्तगाली भाषण डेटासेट है, जिसे संसाधनों की कमी को दूर करने और इस भाषा के लिए अत्याधुनिक स्वचालित भाषण पहचान (automatic speech recognition) और टेक्स्ट-टू-स्पीच मॉडल को सक्षम करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Frederico Santos de Oliveira, Lucas Rafael Stefanel Gris, Alef Iury Siqueira Ferreira, Augusto Seben da Rosa, Alexandre Costa Ferro Filho, Edresson Casanova, Christopher Dane Shulby, Rafael Teixeira S
प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Frederico Santos de Oliveira, Lucas Rafael Stefanel Gris, Alef Iury Siqueira Ferreira, Augusto Seben da Rosa, Alexandre Costa Ferro Filho, Edresson Casanova, Christopher Dane Shulby, Rafael Teixeira Sousa, Diogo Fernandes Costa Silva, Anderson da Silva Soares, Arlindo Rodrigues Galvão Filho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कंप्यूटर की आवाज़ों (जैसे सिरी या एलेक्सा) की दुनिया की कल्पना एक विशाल पुस्तकालय के रूप में करें। अंग्रेजी जैसी भाषाओं के लिए, यह पुस्तकालय लाखों बेहतरीन किताबों, रिकॉर्डिंग और स्क्रिप्टों से भरी एक गगनचुंबी इमारत की तरह है। कंप्यूटर अंग्रेजी को बहुत अच्छी तरह से सीखने और समझने में सक्षम हैं क्योंकि उनके पास अध्ययन करने के लिए बहुत सारी उच्च-गुणवत्ता वाली सामग्री है।

लेकिन पुर्तगाली के लिए, वह पुस्तकालय एक धूल भरे, आधे खाली शेड जैसा था। कुछ किताबें तो थीं, लेकिन वे छोटी थीं, अव्यवस्थित थीं, या इस तरह लिखी गई थीं जिन्हें कंप्यूटर आसानी से पढ़ नहीं सकता था। इसका मतलब था कि पुर्तगाली आवाजें अक्सर रोबोटिक लगती थीं, या कंप्यूटर लोगों की बातों को समझने में संघर्ष करते थे।

पेश है "TAGARELA"।

इस शोध पत्र के लेखकों ने विशेष रूप से पुर्तगाली के लिए एक नया, विशाल पुस्तकालय बनाने का निर्णय लिया। वे इसे TAGARELA कहते हैं (जो पुर्तगाली में "चैटर" या "बड़बड़ाने" जैसा सुनाई देता है)। उन्होंने इसे कैसे बनाया, इसकी कहानी यहाँ सरल रूप में दी गई है:

1. कच्चा माल: पॉडकास्ट का एक पहाड़

उन्होंने "Cem Mil Podcasts" (एक लाख पॉडकास्ट) नामक एक विशाल संग्रह से शुरुआत की। इसे अनियंत्रित पॉडकास्ट रिकॉर्डिंग के एक विशाल ढेर के रूप में समझें।

  • समस्या: ये रिकॉर्डिंग अस्त-व्यस्त थीं। कई लोग एक-दूसरे के ऊपर बोल रहे थे, बैकग्राउंड में शोर (जैसे कॉफी कप टकराने की आवाज़ या ट्रैफिक) था, और टेक्स्ट ट्रांसक्रिप्ट (लिखित शब्द) अक्सर गलत या गायब थे। यह ऐसा था जैसे किसी ऐसी भीड़भाड़ वाली पार्टी को सुनकर भाषा सीखने की कोशिश करना जहाँ हर कोई एक साथ चिल्ला रहा हो।
  • लक्षव: वे इस बिखरे हुए ढेर को स्पष्ट भाषण की एक निर्मल, व्यवस्थित लाइब्रेरी में बदलना चाहते थे। यह 8,972 घंटों का ऑडियो है—इतना बहुत सारा ऑडियो—जो अंग्रेजी के सबसे बड़े डेटासेटों का मुकाबला करने के लिए पर्याप्त है।

2. निर्माण दल: "क्लीनिंग पाइपलाइन"

इस गड़बड़ी को ठीक करने के लिए, टीम ने पाँच विशिष्ट श्रमिकों के साथ एक डिजिटल असेंबली लाइन (पाइपलाइन) बनाई:

  • व्यवस्थित करने वाला (Standardization): सबसे पहले, उन्होंने सुनिश्चित किया कि प्रत्येक ऑडियो फ़ाइल एक जैसी दिखे, जैसे कि सभी किताबों को एक ही फ़ॉन्ट आकार और कागज़ की गुणवत्ता में बदलना।
  • बॉडीगार्ड (Speaker Separation): पॉडकास्ट में लोग एक-दूसरे के ऊपर बोलते हैं। यह कार्यकर्ता एक बाउंसर की तरह काम करता है, जो आवाज़ों को अलग करता है ताकि प्रत्येक रिकॉर्डिंग में केवल एक ही व्यक्ति बोल रहा हो। यह कंप्यूटर को एक स्पष्ट, एकल आवाज़ की नकल करने के लिए सिखाने के लिए महत्वपूर्ण है।
  • शोर फिल्टर (Overlap Detection): वक्ताओं को अलग करने के बाद भी, कभी-कभी दो लोग बिल्कुल एक ही समय पर बात करते हैं। टीम ने इन "डुएट" (दोहरी आवाज़ों) को पहचानने और उन्हें हटाने के लिए एक स्मार्ट AI को प्रशिक्षित किया, जिससे केवल एकल प्रदर्शन ही बचे।
  • अनुवादक (Transcription): उन्हें ऑडियो को टेक्स्ट में बदलने की आवश्यकता थी। उन्होंने केवल एक अनुवादक को काम पर नहीं रखा; उन्होंने एक "स्मार्ट टीम" दृष्टिकोण का उपयोग किया। उन्होंने उच्च-गुणवत्ता वाले डेटा पर प्रशिक्षित एक सुपर-स्मार्ट AI (Whisper) का उपयोग किया ताकि शब्दों को लिखा जा सके। यह सुनिश्चित करने के लिए कि AI "भ्रमित" न हो (यानी मनगढ़ंत बातें न बनाए), उन्होंने दूसरे AI के साथ इसके काम की जांच की। यदि दोनों सहमत थे, तभी टेक्स्ट को रखा गया।
  • पॉलिश करने वाला (Denoising): अंत में, उन्होंने बैकग्राउंड की सरसराहट, स्टेटिक और गूँज को साफ करने के लिए एक विशेष टूल का उपयोग किया, जिससे पीछे केवल क्रिस्टल-क्लियर ऑडियो बचा।

3. परिणाम: दो विशेष लाइब्रेरी

सफाई पूरी होने के बाद, उन्होंने संग्रह को दो विशेष वर्गों में विभाजित किया:

  1. "रियल टॉक" सेक्शन (8,972 घंटे): इसमें वे सभी स्वाभाविक ठहराव, "अम्म" और "आह" शामिल हैं जो लोग बोलते समय करते हैं। यह कंप्यूटर को मानव भाषण को समझने (Automatic Speech Recognition) के लिए सिखाने हेतु एकदम सही है।
  2. "स्टूडियो" सेक्शन (2,800 घंटे): यह अत्यंत स्वच्छ, एकल-वक्ता वाला ऑडियो है। यह कंप्यूटर को हमारे सामने स्वाभाविक रूप से बोलने (Text-to-Speech) के लिए सिखाने हेतु आदर्श है।

4. टेस्ट ड्राइव

यह साबित करने के लिए कि उनकी नई लाइब्रेरी काम करती है, उन्होंने केवल इसी डेटा का उपयोग करके दो नए कंप्यूटर मॉडल बनाए:

  • सुनने वाला (The Listener): उन्होंने एक मॉडल को पुर्तगाली समझने के लिए प्रशिक्षित किया। यह इतना अच्छा हो गया कि इसने मौजूदा दिग्गजों को भी पीछे छोड़ दिया, और बहुत कम गलतियों के साथ भाषण को समझने लगा।
  • बोलने वाला (The Speaker): उन्होंने एक मॉडल को भाषण उत्पन्न करने के लिए प्रशिक्षित किया। परिणाम एक ऐसी आवाज़ थी जो बहुत मानवीय लग रही थी, जिसमें एक स्वाभाविक लय और प्रवाह था, और जिसने मानव श्रोताओं से उच्च अंक प्राप्त किए।

यह क्यों महत्वपूर्ण है

इससे पहले, पुर्तगाली स्पीच टेक्नोलॉजी "छोटे शेड" वाले चरण में फंसी हुई थी। TAGARELA एक गगनचुंबी इमारत के दरवाजे खोलने जैसा है। यह शोधकर्ताओं और डेवलपरों को दुनिया भर के लाखों पुर्तगाली बोलने वालों के लिए बेहतर, अधिक प्राकृतिक और अधिक सटीक वॉयस टेक्नोलॉजी बनाने के लिए एक विशाल, उच्च-गुणवत्ता वाला आधार प्रदान करता है।

संक्षेप में: उन्होंने पॉडकास्ट के एक बिखरे हुए, शोर भरे ढेर को लिया, एक हाई-टेक असेंबली लाइन के साथ उसे साफ किया, और उसे पुर्तगाली वॉयस AI के लिए स्वर्ण मानक (Gold Standard) में बदल दिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →