← नवीनतम पेपर
⚡ electrical engineering

Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization

यह शोध पत्र Bangla-WhisperDiar प्रस्तुत करता है, जो एक सुदृढ़ प्रणाली है जो बांग्ला लंबी अवधि के स्पीच रिकग्निशन और स्पीकर डायराइजेशन में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए व्यापक डेटा ऑग्मेंटेशन और एक कस्टम पाइपलाइन के साथ Whisper और PyAnnote मॉडलों को फाइन-ट्यून करती है, जिससे 0.2441 का वर्ड एरर रेट (WER) और 0.2392 का डायराइजेशन एरर रेट (DER) प्राप्त होता है।

मूल लेखक: Mohammed Aman Bhuiyan, Md Sazzad Hossain Adib, Samiul Basir Bhuiyan, Amit Chakraborty, Aritra Islam Saswato, Ahmed Faizul Haque Dhrubo, Mohammad Ashrafuzzaman Khan

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohammed Aman Bhuiyan, Md Sazzad Hossain Adib, Samiul Basir Bhuiyan, Amit Chakraborty, Aritra Islam Saswato, Ahmed Faizul Haque Dhrubo, Mohammad Ashrafuzzaman Khan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत लंबी, अव्यवस्थित रिकॉर्डिंग है जिसमें बांग्ला बातचीत हो रही है—शायद कोई रेडियो नाटक, समाचार बहस, या पारिवारिक सभा। यह बैकग्राउंड शोर, एक-दूसरे के ऊपर बोलने वाले लोग और विभिन्न लहजों से भरी हुई है। आपका लक्ष्य दो काम करने का है:

  1. इसे ट्रांसक्राइब करना: बोले गए शब्दों को लिखित पाठ में बदलना।
  2. वक्ताओं की पहचान करना: यह पता लगाना कि किसने, क्या और कब कहा।

यह शोध पत्र, जिसका शीर्षक "Bangla-WhisperDiar" है, बांग्लादेश के नॉर्थ साउथ यूनिवर्सिटी के शोधकर्ताओं की एक टीम की रिपोर्ट है। उन्होंने इन दो समस्याओं को विशेष रूप से बांग्ला भाषा के लिए हल करने के लिए एक सिस्टम बनाया है, जिसे अक्सर बड़े एआई (AI) टूल्स द्वारा अनदेखा कर दिया जाता है जो अंग्रेजी के लिए डिज़ाइन किए गए हैं।

उन्होंने इसे कैसे किया, इसका विवरण रोजमर्रा के उपमाओं (analogies) के साथ यहाँ दिया गया है:

दो मुख्य समस्याएँ

रिकॉर्डिंग को ऊन के एक विशाल, उलझे हुए गोले के रूप में सोचें।

  • समस्या 1 (ASR): आपको ऊन को सुलझाना है और हर शब्द को स्पष्ट रूप से लिखना है।
  • समस्या 2 (Diarization): आपको ऊन को रंग के आधार पर छाँटना है, ताकि आप जान सकें कि कौन सा धागा "वक्ता A" का है और कौन सा "वक्ता B" का।

समाधान: दो-भागों वाली एक मशीन

भाग 1: ट्रांसक्राइबर (ASR)

टीम ने एक पहले से बने हुए एआई मस्तिष्क Whisper (विशेष रूप से एक संस्करण जो पहले से ही बांग्ला के लिए अनुकूलित है) से शुरुआत की। हालांकि, मानक संस्करण उनकी विशिष्ट, शोर भरी, लंबी रिकॉर्डिंग के लिए एकदम सही नहीं था।

  • "ट्रेनिंग कैंप" (Fine-Tuning): कल्पना कीजिए कि एक ऐसे छात्र को, जो पहले से वर्णमाला जानता है, एक कठोर प्रशिक्षण शिविर में ले जाया जाता है। शोधकर्ताओं ने एआई को हजारों घंटों की बांग्ला ऑडियो खिलाई।
  • "तनाव परीक्षण" (Data Augmentation): एआई को सख्त बनाने के लिए, उन्होंने इसे केवल साफ ऑडियो नहीं दिया। उन्होंने कृत्रिम रूप से इसमें शोर, गूँज (echoes) और रिवर्ब (reverb) (जैसे बाथरूम में या व्यस्त सड़क पर बात करना) जोड़ दिया। यह एक मैराथन धावक को बारिश और कीचड़ में दौड़ने के लिए प्रशिक्षित करने जैसा है ताकि वह रेस के दिन किसी भी मौसम को संभाल सके।
  • "संपादक" (Text Normalization): एआई कभी-कभी संख्याओं से भ्रमित हो जाता है (जैसे, "उन्नीस सौ नब्बे" के बजाय "1990" लिखना)। टीम ने एआई में एक नियम पुस्तिका जोड़ी जो उसे शब्दों में संख्याओं को बदलने और बिखरी हुई विराम चिह्नों को ठीक करने के लिए मजबूर करती है, जिससे यह सुनिश्चित होता है कि अंतिम टेक्स्ट एक उचित पुस्तक की तरह दिखे।
  • परिणाम: उनके सिस्टम ने मानक संस्करण की तुलना में बहुत कम गलतियाँ कीं। उन्होंने त्रुटि दर को काफी कम कर दिया, जिसका अर्थ है कि लिखित पाठ बहुत अधिक सटीक है।

भाग 2: वक्ता जासूस (Diarization)

अब, टीम को यह पता लगाने की आवश्यकता थी कि कौन बोल रहा है। उन्होंने PyAnnote नामक एक टूल का उपयोग किया, जो एक स्मार्ट कैमरे की तरह है जो पहचानता है कि लोग कब बोलना शुरू करते हैं और कब रुकते हैं।

  • "विशेषज्ञ" दृष्टिकोण: पूरे कैमरा सिस्टम को फिर से प्रशिक्षित करने के बजाय, उन्हें एहसास हुआ कि उन्हें केवल कैमरे को बांग्ला बोलने के पैटर्न को पहचानने के लिए सिखाने की आवश्यकता है।
  • "बदलने" की रणनीति (The "Swap" Strategy): उन्होंने PyAnnote सिस्टम के उस "मस्तिष्क" को लिया जो स्पीच सेगमेंट का पता लगाता है और उसे अपने स्वयं के संस्करण से बदल दिया, जिसे उन्होंने विशेष रूप से बांग्ला बातचीत के लिए प्रशिक्षित किया था। उन्होंने शेष सिस्टम (जो आवाजों को समूहों में बांटता है) को बिल्कुल वैसा ही रखा।
  • "सफाई दल" (Post-Processing): कभी-कभी एआई अस्थिर हो जाता है और सोचता है कि एक सेकंड के छोटे से हिस्से की चुप्पी एक नया वक्ता है। टीम ने किसी भी ऐसे "वक्ता" को अनदेखा करने के लिए एक फ़िल्टर जोड़ा जो 0.3 सेकंड से कम समय के लिए बोलता है, जिससे गलत चेतावनियों को हटाया जा सके।
  • परिणाम: उनका सिस्टम आवाजों को अलग करने में मानक टूल्स की तुलना में बहुत बेहतर था, जिसने लगभग 76% मामलों में सही ढंग से पहचाना कि कौन कब बोला (एक 23.92% त्रुटि दर, जो कि बेसलाइन की तुलना में एक बड़ा सुधार है)।

"सीक्रेट सॉस" (Secret Sauce)

ऑफ-द-शेल्फ टूल्स का उपयोग करने के बजाय यह बेहतर क्यों काम कर गया?

  1. कस्टम ट्रेनिंग: उन्होंने केवल डिफॉल्ट सेटिंग्स का उपयोग नहीं किया; उन्होंने एआई को विशिष्ट बांग्ला डेटा खिलाया।
  2. सिम्युलेटेड अराजकता (Simulated Chaos): शोर भरे, गूँजते और विकृत ऑडियो पर एआई को प्रशिक्षित करके, इसने वास्तविक दुनिया की अव्यवस्था को अनदेखा करना सीख लिया।
  3. स्मार्ट एडिटिंग: उन्होंने केवल एआई को कच्चा टेक्स्ट आउटपुट करने के लिए नहीं छोड़ा; उन्होंने दोहराव वाली 'हैलुसिनेशन' (जहाँ एआई वाक्यांशों को दोहराता है) को ठीक करने और संख्याओं को मानकीकृत करने के लिए एक "स्पेल-चेकर" चरण जोड़ा।

निचोड़ (The Bottom Line)

टीम ने सफलतापूर्वक एक पाइपलाइन बनाई है जो एक लंबी, अव्यवस्थित बांग्ला रिकॉर्डिंग को ले सकती है और उसे सटीक वक्ता लेबल के साथ साफ टेक्स्ट में बदल सकती है।

  • ट्रांसक्रिप्शन के लिए: उन्होंने मानक मॉडल की तुलना में त्रुटि दर को लगभग 30% कम कर दिया।
  • स्पीकर आईडी के लिए: उन्होंने मानक मॉडल की तुलना में त्रुटि दर को 40% से अधिक कम कर दिया।

उन्होंने अपना कोड सार्वजनिक कर दिया है ताकि अन्य लोग इसका उपयोग कर सकें, यह साबित करते हुए कि सही प्रशिक्षण और थोड़े से "तनाव परीक्षण" के साथ, एआई बांग्ला भाषा की जटिलताओं को उतनी ही अच्छी तरह से संभाल सकता है जितना कि वह अंग्रेजी को संभालता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →