← नवीनतम पेपर
💬 NLP

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

यह शोध पत्र अरबी, फारसी और जर्मन भाषा युग्मों के कोड-स्विचिंग भाषण पर पांच वाणिज्यिक एएसआर (ASR) प्रणालियों के लिए एक नया बेंचमार्क डेटासेट और मूल्यांकन ढांचा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इलेवनलैब्स स्क्राइब v2 (ElevenLabs Scribe v2) सर्वश्रेष्ठ प्रदर्शन प्राप्त करता है, जबकि लिप्यंतरण भिन्नता को संभालने के लिए पारंपरिक वर्ड एरर रेट (Word Error Rate) पर BERTScore की श्रेष्ठता को उजागर करता है और कठिनाई-स्तरीकृत विश्लेषण के माध्यम से प्रदर्शन अंतराल को प्रकट करता है।

मूल लेखक: Sajjad Abdoli (MAD), Ghassan Al-Sumaidaee (MAD), Clayton W. Taylor (MAD), Ahmad (MAD), ElShiekh, Ahmed Rashad

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sajjad Abdoli (MAD), Ghassan Al-Sumaidaee (MAD), Clayton W. Taylor (MAD), Ahmad (MAD), ElShiekh, Ahmed Rashad

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अनुवादकों के एक समूह को एक बहुत ही विशिष्ट, कठिन स्थिति को संभालने के लिए सिखाने की कोशिश कर रहे हैं: वे लोग जो एक ही वाक्य में दो भाषाओं का उपयोग करते हैं। वास्तविक दुनिया में ऐसा अक्सर होता है। काहिरा का एक सॉफ्टवेयर इंजीनियर कह सकता है, "The deadline is tomorrow, we need to ship the update," यानी अंग्रेजी के तकनीकी शब्दों को अरबी व्याकरण के साथ मिला रहा है। तेहरान का एक डेवलपर कह सकता है, "This new feature has a lot of bugs," जिसमें फारसी और अंग्रेजी का मिश्रण है।

यह पेपर पाँच अलग-अलग व्यावसायिक "स्पीच-टू-टेक्स्ट" सिस्टम (वे जिन्हें आप अपने फोन या मीटिंग ऐप में उपयोग कर सकते हैं) के लिए एक रिपोर्ट कार्ड की तरह है, यह देखने के लिए कि वे इस विशिष्ट "कोड-स्विचिंग" चुनौती को कितनी अच्छी तरह से संभालते हैं।

यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "साफ कमरा" बनाम "व्यस्त बाजार"

अधिकांश कंपनियाँ अपने स्पीच सिस्टम का परीक्षण एक "साफ कमरे" में करती हैं। वे उन्हें स्पष्ट, एकल-भाषा वाला ऑडियो सुनाती हैं (जैसे कोई समाचार एंकर स्क्रिप्ट पढ़ रहा हो) और उन्हें इस आधार पर स्कोर देती हैं कि उन्होंने कितने शब्द सही पकड़े।

  • पेपर का तर्क: यह एक कार का परीक्षण करने जैसा है जो केवल एक चिकने, खाली ट्रैक पर चलती है। यह आपको कुछ नहीं बताता कि कार एक ऊबड़-खाबड़, भीड़भाड़ वाले बाजार की सड़क पर कैसे व्यवहार करती है जहाँ लोग एक साथ विभिन्न भाषाओं में चिल्ला रहे हों।
  • वास्तविकता: वास्तविक दुनिया की बातचीत अव्यवस्थित होती है। लोग वाक्य के बीच में भाषा बदलते हैं, अक्सर बिना सोचे-समझे। पेपर का तर्क है कि पुराने "साफ कमरे" वाले परीक्षण इन वास्तविक दुनिया के परिदृश्यों के लिए भ्रामक हैं।

2. टेस्ट बनाना: "टैलेंट स्काउट" पाइपलाइन

एक निष्पक्ष परीक्षण बनाने के लिए, शोधकर्ताओं ने केवल यादृच्छिक (random) ऑडियो नहीं लिया। उन्होंने हजारों उम्मीदवारों में से सबसे कठिन और दिलचस्प उदाहरण खोजने के लिए दो-चरणीय "टैलेंट स्काउट" सिस्टम बनाया:

  • चरण 1 (त्वरित फिल्टर): उन्होंने एक सरल कंप्यूटर नियम का उपयोग किया जो उन वाक्यों को पहचान सके जिनमें दो लिपियों (जैसे अरबी अक्षर और अंग्रेजी अक्षर) का मिश्रण था। यह दरवाजे पर आईडी चेक करने वाले बाउंसर की तरह है।
  • चरण 2 (विशेषज्ञ पैनल): शेष उम्मीदवारों को दो सुपर-स्मार्ट AI "जजों" (GPT-4o और Gemini 1.5 Pro) के पास भेजा गया। इन जजों ने वाक्यों को पढ़ा और उन्हें छह अलग-अलग "कठिनाई" कारकों पर रेट किया, जैसे कि भाषाएँ कितनी बार बदलती हैं, स्लैंग कितना जटिल है, और ध्वनियाँ कितनी भ्रमित करने वाली हैं।
  • परिणाम: उनके पास 1,200 कठिन वाक्य बचे (प्रत्येक भाषा जोड़ी के लिए 300: अरबी-अंग्रेजी, फारसी-अंग्रेजी, और जर्मन-अंग्रेजी)। इस प्रक्रिया ने उनका बहुत सारा पैसा बचाया (लगभग 91%) जो AI जजों को हर एक वाक्य पढ़ने के लिए कहने में खर्च होता।

3. स्कोरिंग: "रूलर" बनाम "अनुवादक"

यह पेपर की सबसे महत्वपूर्ण खोज है। उन्होंने सिस्टम को ग्रेड देने के लिए दो अलग-अलग तरीकों का उपयोग किया:

  • द रूलर (WER - वर्ड एरर रेट): यह पारंपरिक तरीका है। यह हर एक अक्षर और शब्द के अंतर को गिनता है। यदि वक्ता ने "feature" कहा और कंप्यूटर ने फारसी का वह शब्द लिखा जिसका अर्थ "feature" है (जो समान अर्थ रखता है लेकिन दिखता अलग है), तो "रूलर" कहता है, "गलत! यह एक गलती है।"
  • द ट्रांसलेटर (BERTScore): यह एक स्मार्ट तरीका है। यह अर्थ को समझता है। यदि वक्ता ने "feature" कहा और कंप्यूटर ने "feature" के लिए फारसी शब्द लिखा, तो "ट्रांसलेटर" कहता है, "बहुत बढ़िया! आपने अर्थ सही पकड़ा, भले ही स्पेलिंग अलग हो।"
  • निष्कर्ष: अरबी और फारसी जैसी भाषाओं के लिए, जहाँ शब्दों को अलग-अलग तरीकों से लिखा जा सकता है लेकिन उनका अर्थ एक ही होता है, "रूलर" बहुत कठोर है। यह सिस्टम को उनकी रचनात्मक स्पेलिंग के लिए दंडित करता है। "ट्रांसलेटर" (BERTScore) बहुत अधिक निष्पक्ष ग्रेड देता है।

4. दौड़ के परिणाम

उन्होंने पाँच बड़े व्यावसायिक सिस्टम का परीक्षण किया। यहाँ बताया गया है कि वे कैसे समाप्त हुए:

  • विजेता: ElevenLabs Scribe v2 स्पष्ट विजेता रहा। इसे सभी चार भाषा जोड़ियों में सबसे कम त्रुटि दर और उच्चतम अर्थ स्कोर मिला। यह विशेष रूप से कठिन अरबी और फारसी मिश्रणों को संभालने में अच्छा था।
  • मध्यम श्रेणी: OpenAI और Google ने ठीक प्रदर्शन किया, लेकिन उन्होंने विजेता की तुलना में काफी अधिक गलतियाँ कीं, विशेष रूप से सबसे कठिन वाक्यों पर।
  • संघर्ष करने वाला: Azure (Microsoft) की त्रुटि दर सबसे अधिक थी। हालांकि, पेपर नोट करता है कि यदि आप Azure को लगातार भाषा की जांच करने के लिए कहते हैं (केवल शुरुआत में एक बार जांच करने के बजाय), तो यह थोड़ा बेहतर हो जाता है, लेकिन फिर भी यह पीछे है।
  • विशेष मामला: Deepgram का परीक्षण केवल जर्मन-अंग्रेजी पर किया गया क्योंकि यह आधिकारिक तौर पर अरबी या फारसी का समर्थन नहीं करता है। जर्मन पर, इसने बहुत अच्छा प्रदर्शन किया, लेकिन आप इसकी तुलना दूसरों से नहीं कर सकते क्योंकि यह टेस्ट आसान था (दोनों भाषाएँ एक ही वर्णमाला का उपयोग करती हैं)।

5. "हार्ड मोड" की खोज

शोधकर्ताओं ने कठिनाई (आसान, मध्यम, कठिन, विशेषज्ञ) के आधार पर टेस्ट को विभाजित किया।

  • आश्चर्य: "आसान" वाक्यों पर, सभी सिस्टम काफी समान दिखते थे। लेकिन "एक्सपर्ट" (सबसे कठिन) वाक्यों पर, अंतर बहुत बड़ा हो गया।
  • उपमा: कल्पना करें कि एक दौड़ है जहाँ सभी एक सपाट ट्रैक पर एक ही गति से दौड़ रहे हैं। लेकिन जब ट्रैक एक खड़ी, पथरीली पहाड़ी में बदल जाता है, तो एक धावक (ElevenLabs) लगातार ऊपर चढ़ता रहता है, जबकि अन्य फिसलने और गिरने लगते हैं। औसत स्कोर इस बड़े अंतर को छिपा देता; आप वास्तविक अंतर तभी देखते हैं जब आप सबसे कठिन चुनौतियों को देखते हैं।

6. दृश्य प्रमाण (Visual Proof)

यह साबित करने के लिए कि इन भाषाओं के लिए "स्पेलिंग" से अधिक "अर्थ" मायने रखता है, उन्होंने एक विजुअल मैप (शब्दों के लिए GPS की तरह) का उपयोग किया।

  • उन्होंने "सही" वाक्यों और "कंप्यूटर के अनुमान" वाले वाक्यों को एक मानचित्र पर प्लॉट किया।
  • परिणाम: भले ही कंप्यूटर ने एक अलग लिपि का उपयोग किया हो (जैसे अंग्रेजी शब्द को फारसी अक्षरों में लिखना), मानचित्र पर बिंदु एक-दूसरे के ठीक बगल में थे। यह साबित करता है कि कंप्यूटर ने अर्थ समझ लिया था, भले ही "रूलर" (WER) ने इसे गलत कहा हो।

मुख्य निष्कर्ष (The Bottom Line)

यदि आप ऐसा उत्पाद बना रहे हैं जो उन लोगों के लिए है जो एक ही सांस में कई भाषाएँ बोलते हैं, तो केवल मानक "वर्ड एरर रेट" स्कोर को न देखें। यह एक शेफ को केवल इस आधार पर आंकने जैसा है कि उसने प्याज कितनी सटीकता से काटा है, यह नजरअंदाज करते हुए कि सूप का स्वाद कैसा है।

  • अरबी और फारसी के लिए "मीनिंग स्कोर" (BERTScore) का उपयोग करें।
  • केवल आसान वाक्यों के बजाय, "सबसे कठिन" वाक्यों पर परीक्षण करें।
  • ElevenLabs Scribe v2 वर्तमान में इस विशिष्ट कार्य के लिए सर्वश्रेष्ठ है, लेकिन पेपर चेतावनी देता है कि व्यवसाय के लिए सिस्टम चुनते समय गति (latency) और लागत जैसे वास्तविक कारक भी मायने रखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →