Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation
यह शोध पत्र पश्तो पर बहुभाषी स्वचालित वाक् पहचान (ऑटोमैटिक स्पीच रिकग्निशन) के लिए पहले पुनरुत्पादक बेंचमार्क को प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ ज़ीरो-शॉट मॉडल अत्यधिक त्रुटि दरों और पश्तो लिपि उत्पन्न करने में गंभीर विफलता से ग्रस्त हैं, वहीं फाइन-ट्यून्ड मॉडल अभी भी महत्वपूर्ण क्रॉस-डोमेन गिरावट का सामना करते हैं, जिसमें विशिष्ट ध्वनियाँ (फोनीम) असमान रूप से त्रुटियों को प्रेरित करती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास हजारों भाषाओं में लिखी गई किताबों का एक विशाल, सुपर-स्मार्ट पुस्तकालय है। आप एक ऐसी मशीन बनाना चाहते हैं जो किसी को पश्तो (एक भाषा जो अफगानिस्तान और पाकिस्तान में 6-8 करोड़ लोग बोलते हैं) बोलते हुए सुन सके और उसे पूरी तरह से लिख सके।
यह पेपर दुनिया के बेहतरीन "सुनने वाले मशीनों" (AI मॉडल्स) के लिए एक रिपोर्ट कार्ड की तरह है कि वे पश्तो को कितनी अच्छी तरह संभाल पाते हैं। लेखक, हनीफ रहमान ने पाया कि जबकि ये मशीनें अंग्रेजी, स्पेनिश या फ्रेंच के लिए अद्भुत हैं, वे पश्तो के मामले में पूरी तरह से खो जाती हैं।
यहाँ क्या हुआ, इसका विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. "घोस्ट राइटर" की समस्या (लिपि की विफलता)
सबसे बड़ा झटका यह है कि सबसे प्रसिद्ध AI मॉडल, Whisper (OpenAI द्वारा बनाया गया), वास्तव में पश्तो को "सुनता" नहीं है।
- उपमा: कल्पना कीजिए कि आप एक अनुवादक से पश्तो से पश्तो में एक कहानी का अनुवाद करने के लिए कहते हैं। पश्तो में लिखने के बजाय, अनुवादक भ्रमित हो जाता है और कहानी को अरबी, उर्दू, या यहाँ तक कि लैटिन (अंग्रेजी वर्णमाला) के अक्षरों में लिख देता है।
- वास्तविकता: जब शोधकर्ताओं ने Whisper AI का परीक्षण किया, तो इसने लगभग कभी भी सही पश्तो लिपि में नहीं लिखा। यह ऐसे अरबी अक्षर आउटपुट करता था जो दिखने में तो पश्तो जैसे थे लेकिन वास्तव में गलत शब्द थे।
- स्कोर: यदि आप केवल "वर्ड एरर रेट" (एक मानक गणितीय स्कोर) को देखते हैं, तो Whisper ठीक दिखता है। लेकिन यदि आप यह जांचते हैं कि इसने किस लिपि में लिखा है, तो यह एक पूर्ण विफलता है। यह एक छात्र की तरह है जिसे गणित के टेस्ट में उच्च ग्रेड तो मिल जाता है, लेकिन वह उन उत्तरों को लिखता है जो उसकी अपनी भाषा नहीं है।
- विजेता: अन्य मॉडल्स जैसे MMS-1B, SeamlessM4T, और OmniASR ने वास्तव में 93% से अधिक बार सही पश्तो लिपि में लिखा। वे ही हैं जिन्होंने वास्तव में "सुना" था।
2. "आकार मायने नहीं रखता" वाला आश्चर्य
आमतौर पर, AI में, बड़े मॉडल (जिनमें अधिक "दिमागी शक्ति" होती है) बेहतर काम करते हैं। यहाँ ऐसा नहीं है।
- उपमा: Whisper मॉडल्स को कारों के रूप में सोचें। आप उम्मीद करेंगे कि "लार्ज" ट्रक, "मीडियम" सेडान से बेहतर चलेगा।
- वास्तविकता: "मीडियम" Whisper कार पूरी तरह से खराब हो गई। यह गोल-गोल घूमने लगी (एक तकनीकी गड़बड़ी जिसे "डिकोडर लूपिंग" कहा जाता है, जहाँ यह बार-बार बकवास दोहराती है)। यह वास्तव में सबसे खराब प्रदर्शन करने वाला मॉडल था, भले ही यह "स्मॉल" वर्जन से बड़ा था।
- सबक: दुर्लभ भाषाओं के लिए, केवल AI को बड़ा बनाने से समस्या हल नहीं होती। कभी-कभी, एक विशेष, छोटा इंजन बेहतर काम करता है।
3. "स्टूडियो बनाम सड़क" परीक्षण (क्रॉस-डोमेन मूल्यांकन)
शोधकर्ताओं ने उन मॉडल्स का भी परीक्षण किया जिन्हें विशेष रूप से पश्तो डेटा पर "प्रशिक्षित" (सिखाया) किया गया था।
- उपमा: कल्पना कीजिए कि एक छात्र जिसने केवल पाठ्यपुस्तक के उदाहरणों (साफ, स्टूडियो-गुणवत्ता वाली रिकॉर्डिंग) का उपयोग करके टेस्ट के लिए कड़ी मेहनत की है। जब आप उसे सड़क के शोर, खराब माइक्रोफोन, और अलग-अलग लहजों के साथ वास्तविक दुनिया का टेस्ट देते हैं, तो वह बुरी तरह विफल हो जाता है।
- वास्तविकता: एक मॉडल जिसने "14% एरर रेट" (जो बहुत अच्छा लगता है) का दावा किया था, वह दूसरे डेटासेट पर परीक्षण किए जाने पर अचानक "59% एरर रेट" पर पहुँच गया। यह उस छात्र की तरह था जिसने अभ्यास टेस्ट में तो टॉप किया, लेकिन वास्तविक परीक्षा में फेल हो गया क्योंकि स्थितियाँ बदल गईं।
- नायक: एक मॉडल, w2v-b2-aug, जिसे डेटा में "शोर" (noise) जोड़कर प्रशिक्षित किया गया था (जैसे शोर वाले कैफे में अभ्यास करना)। यह मॉडल शोर वाले स्ट्रीट टेस्ट और साफ स्टूडियो टेस्ट दोनों पर लगातार अच्छा प्रदर्शन करता रहा। वातावरण बदलने पर यह क्रैश नहीं हुआ।
4. "लुप्त पहेली के टुकड़े" (अद्वितीय ध्वनियाँ)
पश्तो में कुछ बहुत ही विशिष्ट ध्वनियाँ हैं जो अरबी, अंग्रेजी या पड़ोसी भाषाओं जैसे उर्दू में मौजूद नहीं हैं।
- उपमा: कल्पना कीजिए कि एक पियानो है जिसमें सभी मानक कुंजियाँ (keys) हैं, लेकिन पश्तो के लिए आपको एक विशेष "रेट्रोफ्लेक्स" कुंजी दबानी पड़ती है जिसका उपयोग कोई अन्य भाषा नहीं करती। AI मॉडल बार-बार उस निकटतम मानक कुंजी (जैसे एक सामान्य "T" या "S") को दबाने की कोशिश करते हैं, बजाय उस विशेष कुंजी के।
- वास्तविकता: AI ने इन अद्वितीय ध्वनियों (जैसे "रेट्रोफ्लेक्स" स्टॉप्स और "लेटरल फ्रिकेटिव्स") पर सबसे अधिक गलतियाँ कीं। क्योंकि प्रशिक्षण डेटा में इन विशिष्ट ध्वनियों के पर्याप्त उदाहरण नहीं थे, इसलिए AI ने केवल गलत अनुमान लगाया।
5. यह पेपर क्यों महत्वपूर्ण है
इस पेपर से पहले, यह मापने का कोई मानक तरीका नहीं था कि AI पश्तो को कितनी अच्छी तरह समझता है। यह एक रेसिंग कार की गति को बिना स्टॉपवॉच या ट्रैक के मापने की कोशिश करने जैसा था।
- अंतराल (Gap): कोई नहीं जानता था कि AI बेहतर हो रहा है या बदतर, क्योंकि हर कोई अलग-अलग, निजी डेटा पर परीक्षण कर रहा था।
- समाधान: इस पेपर ने एक मानकीकृत टेस्ट ट्रैक (FLEURS और Common Voice जैसे सार्वजनिक डेटासेट का उपयोग करके) बनाया। अब, कोई भी अपने पश्तो AI को इसी ट्रैक पर टेस्ट कर सकता है और वास्तविक स्कोर देख सकता है।
- भविष्य: लेखक का तर्क है कि हमें यह दिखावा करना बंद करना चाहिए कि ये मॉडल पूरी तरह से काम करते हैं। हमें ऐसे उपकरण बनाने की आवश्यकता है जो वास्तव में पश्तो में बात करें, न कि केवल अरबी में अनुमान लगाएं।
सारांश
यह पेपर एक चेतावनी है। यह हमें बताता है कि समाचारों में दिखने वाला "जादुई" AI सबके लिए जादुई नहीं है। पश्तो बोलने वालों के लिए, वर्तमान शीर्ष AI मॉडल अक्सर भ्रमित, गलत वर्णमाला में लिखने वाले और शोर वाले वातावरण में विफल होने वाले होते हैं।
हालाँकि, यह पेपर आशा भी जगाता है: सही मॉडल्स (जैसे SeamlessM4T) का उपयोग करके और उन्हें सही प्रकार के डेटा (शोर और अद्वितीय ध्वनियों सहित) के साथ प्रशिक्षित करके, हम ऐसे सिस्टम बना सकते हैं जो वास्तव में उन 6-8 करोड़ पश्तो भाषियों के लिए काम करें जिन्हें पीछे छोड़ दिया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।