← नवीनतम पेपर
💬 NLP

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

यह शोध पत्र OpenWER का परिचय देता है, जो एक ओपन-सोर्स टूल है जो भाषा-विशिष्ट सामान्यीकरण (normalization) और टोकन-आधारित संरेखण (alignment) को लागू करके क्रॉस-लिंगुअल ऑटोमैटिक स्पीच रिकग्निशन मूल्यांकन की निष्पक्षता और विश्वसनीयता को बढ़ाता है, जिसके परिणामस्वरूप मौजूदा लाइब्रेरी की तुलना में 52 विविध भाषाओं में वर्ड एरर रेट (Word Error Rates) में महत्वपूर्ण कमी आती है।

मूल लेखक: Korbinian Kuhn, Gottfried Zimmermann

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Korbinian Kuhn, Gottfried Zimmermann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक स्पेलिंग बी (spelling bee) के जज हैं, लेकिन आप केवल एक व्यक्ति का नहीं, बल्कि दुनिया भर के स्पीच-रिकग्निशन कंप्यूटरों का न्याय कर रहे हैं। आपका काम यह तय करना है कि वे कंप्यूटर लोगों की कही बातों को कितनी अच्छी तरह से टेक्स्ट में बदलते हैं।

लंबे समय तक, जजों के पास केवल एक उपकरण था जिसे एक रूलर (ruler) कहा जाता था: WER (वर्ड एरर रेट)। यह रूलर बहुत सख्त है: यदि कंप्यूटर "game-changer" कहता है और इंसान ने "game changer" (एक स्पेस के साथ) लिखा है, तो यह रूलर इसे एक गलती मानता है। यदि कंप्यूटर एक कॉमा भूल जाता है, तो यह एक गलती है। यदि यह किसी शब्द को गलत तरीके से कैपिटलाइज़ करता है, तो यह भी एक गलती है।

समस्या यह है कि यह रूलर थोड़ा अनाड़ी है। यह वर्तनी (spelling) के एक छोटे से अंतर को पूरी तरह से गलत शब्द के समान मानता है। और यह उन भाषाओं के साथ संघर्ष करता है जो अंग्रेजी नहीं हैं, क्योंकि यह उन्हें उनके शब्दों के निर्माण के अलग नियमों के कारण अनुचित रूप से दंडित करता है।

OpenWER: "स्मार्ट रूलर"

लेखकों ने एक नया, ओपन-सोर्स टूल बनाया है जिसे OpenWER कहा जाता है। OpenWER को केवल एक रूलर के रूप में नहीं, बल्कि एक स्मार्ट, लचीले टेप मेजर (फीते) के रूप में सोचें जो विभिन्न भाषाओं की बारीकियों को समझता है।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "कंपाउंड वर्ड" डिटेक्टिव (Compound Word Detective)

अंग्रेजी और जर्मन में, हम अक्सर शब्दों को हाइफ़न (जैसे "game-changer") या स्पेस ("game changer") के साथ जोड़ देते हैं। पुराने टूल्स इन्हें दो अलग-अलग शब्द मान लेते थे और इन्हें गलत चिह्नित कर देते थे।

  • पुराना तरीका: एक सख्त शिक्षक की तरह जो कहता है, "तुमने 'game-changer' लिखा है लेकिन किताब में 'game changer' है। यह फेल है!"
  • OpenWER का तरीका: यह एक जासूस की तरह काम करता है जो यह पहचान लेता है कि, "अरे, ये एक ही चीज़ हैं!" यह इन कंपाउंड वर्ड्स (संयुक्त शब्दों) का पता लगाता है और उन्हें जोड़ने के तरीके में छोटे-सा-छोटा अंतर होने पर भी उन्हें अनदेखा कर देता है। अकेले इसने कुछ भाषाओं के लिए एरर रेट को 20% तक कम कर दिया।

2. "ट्रांसलेशन" ट्रांसलेटर (The "Translation" Translator)

अलग-अलग भाषाओं के लिखने के अलग-अलग तरीके होते हैं। कभी-कभी एक कॉन्ट्रैक्शन (जैसे "it's") को पूरी तरह से लिखा जाता है ("it is")।

  • पुराना तरीका: यह "it's" बनाम "it is" को एक गलती के रूप में गिनता है।
  • OpenWER का तरीका: इसमें इन अंतरों को गिनने से पहले सामान्य करने (normalize) के लिए एक इन-बिल्ट ट्रांसलेटर है। यह कहता है, "ठीक है, इनका अर्थ एक ही है, इसलिए मैं इसे गलती नहीं मानूँगा।" यह तुलना को अधिक निष्पक्ष बनाता है, विशेष रूप से उन भाषाओं के लिए जिनके पास कम संसाधन (low-resource languages) हैं जहाँ पिछले टूल्स संघर्ष करते थे।

3. "मेटाडेटा" बैकपैक (The "Metadata" Backpack)

पुराने टूल्स केवल टेक्स्ट देखते थे। यदि कंप्यूटर ने गलती की, तो वह बस कहता था "Error"।

  • OpenWER का तरीका: कल्पना कीजिए कि कंप्यूटर द्वारा बोला गया हर शब्द एक बैकपैक के साथ जुड़ा हुआ है। यह बैकपैक अतिरिक्त जानकारी रखता है: "मैं एक संज्ञा (noun) हूँ," "मैं एक व्यक्ति का नाम हूँ," या "मैं 90% आश्वस्त हूँ कि मैंने यह कहा है।"
  • OpenWER इन बैकपैक्स को सुरक्षित रखता है। यह शोधकर्ताओं को गहरे प्रश्न पूछने की अनुमति देता है, जैसे: "क्या कंप्यूटर संज्ञाओं के अनुमान में क्रियाओं (verbs) की तुलना में बेहतर है?" या "क्या कंप्यूटर वास्तव में गलत होने पर भी आश्वस्त है?"

उन्होंने क्या पाया?

लेखकों ने इस नए टूल का 52 अलग-अलग भाषाओं पर हजारों स्पीच सैंपल्स का उपयोग करके परीक्षण किया।

  • यह अधिक सटीक है: वर्तमान में उपयोग किए जाने वाले मानक टूल्स की तुलना में, OpenWER ने एरर रेट को 25% तक कम कर दिया। कुछ मामलों में, इसने परिणामों को बहुत बेहतर बना दिया क्योंकि इसने "नकली त्रुटियों" (जैसे गायब कॉमा या हाइफ़न के अंतर) को गिनना बंद कर दिया।
  • यह अधिक निष्पक्ष है: कंपाउंड वर्ड्स और भाषा-विशिष्ट नियमों को बेहतर ढंग से संभालने के कारण, यह उन भाषाओं के लिए अधिक ईमानदार स्कोर देता है जो अंग्रेजी नहीं हैं।
  • यह विस्तृत है: क्योंकि यह "बैकपैक्स" (मेटाडेटा) को बनाए रखता है, यह बता सकता है कि स्कोर क्यों है, न कि केवल यह कि स्कोर क्या है।

एक कमी: गति (Speed)

यहाँ एक ट्रेड-ऑफ (समझौता) है। पुराने टूल्स एक फॉर्मूला 1 कार की तरह हैं—वे अविश्वसनीय रूप से तेज़ हैं क्योंकि वे एक विशिष्ट, उच्च-गति वाले इंजन (C कोड) के साथ बने हैं। OpenWER एक भरोसेमंद, फीचर-रिच SUV की तरह है जो पायथन (Python) में बनी है। यह अधिक चीजें करती है और उन्हें अधिक समझदारी से करती है, लेकिन यह थोड़ा धीरे चलती है।

  • लेखक स्वीकार करते हैं कि बड़े पैमाने पर, रियल-टाइम स्पीड की जरूरतों के लिए, पुराने टूल्स अभी भी तेज़ हैं। हालाँकि, रिसर्च और सही उत्तर प्राप्त करने के लिए, OpenWER बेहतर वाहन है।

निचोड़ (The Bottom Line)

OpenWER स्पीच को मापने का नया तरीका नहीं खोजता; यह केवल मापने वाले फीते को साफ करता है। यह फीते को हाइफ़न और कैपिटलाइजेशन जैसे छोटे विवरणों में उलझने से रोकता है, जिससे शोधकर्ता दुनिया भर में स्पीच कंप्यूटरों के वास्तविक प्रदर्शन को देख पाते हैं। यह सुनिश्चित करने की दिशा में एक कदम है कि स्पीच कंप्यूटर का न्याय निष्पक्ष रूप से किया जाए, चाहे वह अंग्रेजी बोल रहा हो, जर्मन या बहुत कम बोलने वालों की भाषा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →