← नवीनतम पेपर
💬 NLP

Building an ASR Solution for Training and Assessing Children's Reading

यह शोध पत्र बम्बारा में बच्चों के पठन का आकलन करने के लिए एक ओपन-सोर्स, एंड-टू-एंड सिस्टम प्रस्तुत करता है, जिसमें एक नया सार्वजनिक बेंचमार्क और एक फाइन-ट्यून्ड सोलोनी (Soloni) एएसआर (ASR) मॉडल शामिल है जो क्वार्ट्ज़नेट (QuartzNet) की तुलना में वर्ड एरर रेट (WER) और कैरेक्टर एरर रेट (CER) को काफी कम करता है, साथ ही फील्ड डेटा संग्रह और कक्षा परीक्षणों के माध्यम से समाधान को प्रमाणित करता है।

मूल लेखक: Yacouba Diarra, Nouhoum Souleymane Coulibaly, Mamadou Dembele, Aymane Dembele, Michael Leventhal

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yacouba Diarra, Nouhoum Souleymane Coulibaly, Mamadou Dembele, Aymane Dembele, Michael Leventhal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बच्चे को बम्बारा (Bambara) में पढ़ना सिखाने की कोशिश कर रहे हैं, जो माली की एक प्रमुख भाषा है। एक आदर्श दुनिया में, एक शिक्षक हर बच्चे को ज़ोर से पढ़ते हुए सुन सकता है, तुरंत गलतियाँ पकड़ सकता है और उपयोगी फीडबैक दे सकता है। लेकिन वास्तविकता में, हर छात्र के लिए ऐसा करने के लिए पर्याप्त शिक्षक नहीं हैं, और उपलब्ध उपकरण या तो बहुत सरल हैं या वे यह नहीं समझ पाते कि बच्चों की आवाज़ वयस्कों से अलग क्यों होती है।

यह शोध पत्र "An bɛ kalan" (जिसका अर्थ लगभग "चलो पढ़ते हैं" होता है) नामक एक समाधान पेश करता है। यह एक मुफ्त, ओपन-सोर्स सिस्टम है जिसे माली के बच्चों के लिए एक डिजिटल रीडिंग ट्यूटर के रूप में डिज़ाइन किया गया है। यहाँ बताया गया है कि शोधकर्ताओं ने इसे कैसे बनाया और उन्हें क्या पता चला, जिसे सरल उपमाओं के माध्यम से समझाया गया है।

1. कच्चा माल इकट्ठा करना: "रीडिंग कैंप"

कंप्यूटर को बच्चों के पढ़ने को समझने के लिए सिखाने के लिए, आपको पहले रिकॉर्डिंग का एक विशाल पुस्तकालय चाहिए। टीम ने बमाको, माली में एक "रीडिंग कैंप" आयोजित किया।

  • सेटअप: उन्होंने एक मोबाइल ऐप का उपयोग करके 60 बच्चों (मुख्य रूप से 13-17 वर्ष की आयु के) से 22 अलग-अलग पाठ्यपुस्तकों को ज़ोर से पढ़वाया।
  • परिणाम: उन्होंने 55 घंटे की कच्ची ऑडियो सामग्री एकत्र की। खराब रिकॉर्डिंग (जैसे बच्चों का आपस में बात करना या बीच में ही रुक जाना) को हटाने के बाद, उनके पास 47 घंटे का उच्च-गुणवत्ता वाला डेटा बचा।
  • ट्विस्ट: उन्होंने केवल प्रत्येक पुस्तक को एक बार रिकॉर्ड नहीं किया। उन्होंने कई अलग-अलग बच्चों से वही पुस्तकें बार-बार पढ़वाईं। इससे एक "डुप्लिकेट" डेटासेट बना जहाँ शब्द वही थे, लेकिन आवाज़ें अलग थीं।

2. दावेदार: दो अलग-अलग "दिमाग"

शोधकर्ता यह देखना चाहते थे कि बच्चों को सुनने में कौन सा कंप्यूटर "दिमाग" (AI मॉडल) सबसे अच्छा है। उन्होंने दो अलग-अलग आर्किटेक्चरों के बीच मुकाबला कराया:

  • QuartzNet: इसे एक कॉम्पैक्ट, हल्के वजन वाली साइकिल के रूप में सोचें। यह छोटी, तेज़ है और बिना इंटरनेट के सस्ते, पुराने स्मार्टफोन पर चलने के लिए डिज़ाइन की गई है। इसमें सीखने के लिए कम "गियर" (पैरामीटर्स) हैं।
  • Soloni: इसे एक हाई-परफॉर्मेंस स्पोर्ट्स कार के रूप में सोचें। यह बड़ी, अधिक जटिल है, और बच्चों के लिए विशिष्ट होने से पहले इसे बहुत सारी सामान्य बम्बारा स्पीच पर प्री-ट्रेन किया गया है। इसमें जटिल ध्वनियों को संभालने के लिए बहुत अधिक "गियर" हैं।

3. प्रशिक्षण: "ड्रिल्स" और "बाधाएं"

शोधकर्ताओं ने यह देखने के लिए कि क्या सबसे अच्छा काम करता है, चार अलग-अलग प्रशिक्षण रणनीतियों का उपयोग करके इन मॉडलों का परीक्षण किया:

  1. बुनियादी बातें: केवल अद्वितीय पुस्तकों (1.6 घंटे का अद्वितीय टेक्स्ट) पर प्रशिक्षण देना।
  2. बाधा दौड़ (SpecAugment): उन्होंने प्रशिक्षण के दौरान ऑडियो में कृत्रिम रूप से "शोर" जोड़ा (जैसे कि डिजिटल आंखों की पट्टी लगाकर आवाज़ के कुछ हिस्सों को ढक देना) ताकि AI को कठिन रूप से सीखने के लिए मजबूर किया जा सके।
  3. दोहराव ड्रिल: उन्होंने "डुप्लिकेट" डेटा (वही किताबें अलग-अलग बच्चों द्वारा पढ़ी गईं) को जोड़ा ताकि यह देखा जा सके कि कई आवाजों से एक ही शब्दों को सुनने से मदद मिलती है या नहीं।
  4. कॉम्बो: दोहराव ड्रिल + बाधा दौड़।

4. दौड़ के परिणाम

जब उन्होंने मॉडल्स का परीक्षण नए बच्चों के एक सेट पर किया जिन्हें उन्होंने पहले कभी नहीं देखा था, तो यह हुआ:

  • विजेता: Soloni मॉडल (स्पोर्ट्स कार) ने स्पष्ट रूप से जीत हासिल की।
    • प्रशिक्षण से पहले, इसने लगभग 42% शब्दों पर गलतियाँ कीं।
    • प्रशिक्षण के बाद, इसने अपनी गलतियों को घटाकर केवल 22% कर दिया।
    • यह QuartzNet की तुलना में काफी बेहतर था, जो प्रशिक्षण के बाद भी 40% की त्रुटि दर के साथ संघर्ष कर रहा था।
  • दोहराव पर आश्चर्यजनक सबक:
    • QuartzNet (साइकिल) को अधिक डेटा देना जहाँ एक ही टेक्स्ट को विभिन्न आवाजों द्वारा पढ़ा गया था, इसे एक 'टर्बो बूस्ट' देने जैसा था। इसमें जबरदस्त सुधार हुआ क्योंकि इसे पैटर्न समझने के लिए उस अतिरिक्त दोहराव की आवश्यकता थी।
    • Soloni (स्पोर्ट्स कार) को वही अतिरिक्त दोहराव देने से बहुत अधिक मदद नहीं मिली। यह पहले से ही पैटर्न समझने में इतनी अच्छी थी कि एक ही शब्दों को दोबारा सुनने से इसे कुछ नया नहीं सीखने को मिला।
  • "बाधाओं" (SpecAugment) पर सबक:
    • कृत्रिम शोर (आंखों की पट्टी) जोड़ने से प्रशिक्षण अधिक सुचारू रूप से चला और इसने मॉडल्स को भ्रमित होने से रोका, लेकिन इसने वास्तव में उन्हें बिना शोर वाले मॉडल्स की तुलना में अधिक स्मार्ट नहीं बनाया।

5. कमजोर कड़ी: छोटे बच्चे

शोधकर्ताओं ने आयु के आधार पर परिणामों का विश्लेषण किया और एक विशिष्ट समस्या क्षेत्र पाया।

  • 10+ वर्ष के बच्चे: सिस्टम उनके लिए बहुत अच्छा काम करता है।
  • 10 वर्ष से कम उम्र के बच्चे: सिस्टम अभी भी 10 वर्ष से कम उम्र के बच्चों के साथ काफी संघर्ष करता है।
  • क्यों? छोटे बच्चों की आवाज़ की पिच ऊँची होती है, उच्चारण कम स्थिर होता है, और वे अनियमित गति से बोलते हैं। AI के लिए, वे ऐसा लगता है जैसे वे बड़े बच्चों की तुलना में एक अलग भाषा बोल रहे हों। सिस्टम ने उनके साथ बहुत अधिक गलतियाँ कीं, जिससे पता चलता है कि हमें विशेष रूप से छोटे बच्चों को रिकॉर्ड करने की आवश्यकता है ताकि इसे ठीक किया जा सके।

6. वास्तविक दुनिया का परीक्षण: कक्षा

अंत में, वे इस ऐप को बमाको की 10 वास्तविक कक्षाओं में ले गए।

  • फैसला: शिक्षकों और छात्रों को यह पसंद आया। ऐप ने तत्काल फीडबैक दिया (बच्चे को बताना कि उसने शब्द सही पढ़ा या नहीं), जिससे वे इसमें व्यस्त रहे।
  • परिणाम: 10 में से 9 परीक्षणों में, शिक्षकों ने कहा, "हाँ, हम इसका उपयोग करना जारी रखना चाहते हैं।" इसने साबित कर दिया कि यह तकनीक बुनियादी फोन पर भी, वास्तविक स्कूल सेटिंग में काम करती है।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि बम्बारा बच्चों के लिए एक महान रीडिंग असिस्टेंट बनाने के लिए, आपको केवल रिकॉर्डिंग के अधिक घंटों की आवश्यकता नहीं है; आपको बेहतर विविधता की आवश्यकता है।

  • केवल एक ही किताब को 100 बार रिकॉर्ड न करें (जब तक कि आप QuartzNet जैसे बहुत सरल मॉडल का उपयोग नहीं कर रहे हों)।
  • इसके बजाय अधिक विविध आवाजों और विशेष रूप से 10 वर्ष से कम उम्र के अधिक बच्चों को रिकॉर्ड करें, क्योंकि यहीं पर सिस्टम वर्तमान में विफल हो रहा है।

"An bɛ kalan" सिस्टम अब किसी के भी उपयोग के लिए उपलब्ध है, जो माली में पढ़ने के कौशल का आकलन करने और सुधारने में मदद करने के लिए एक शक्तिशाली, ऑफलाइन-सक्षम उपकरण प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →