← नवीनतम पेपर
💬 NLP

When Multiple Scripts Matter: Evaluating ASR in Clinical Settings

यह शोध पत्र MultiClin प्रस्तुत करता है, जो एक क्लिनिकल ASR बेंचमार्क है जो मल्टीस्क्रिप्ट परिवर्तनशीलता के कारण गैर-अंग्रेजी परिवेश में प्रदर्शन के कम आकलन को संबोधित करता है, यह प्रदर्शित करते हुए कि मल्टीस्क्रिप्ट-जागरूक मूल्यांकन निष्पक्ष मूल्यांकन प्रदान करता है और प्रशिक्षण के दौरान लिपियों को एकीकृत करना मॉडल अभिसरण (convergence) और पहचान सटीकता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Jean Seo, Minkyu Kim, Jeonguk Lee, Jisoo Jung, Wooseok Han, Eunho Yang

प्रकाशित 2026-06-17✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jean Seo, Minkyu Kim, Jeonguk Lee, Jisoo Jung, Wooseok Han, Eunho Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डॉक्टर को मरीज से बात करते हुए सुनने के लिए सिखाने की कोशिश कर रहे हैं। एक अंग्रेजी बोलने वाले अस्पताल में, यह काफी सरल है: डॉक्टर कहता है "brace," और रोबोट इसे "brace" के रूप में लिख लेता है।

लेकिन कई गैर-अंग्रेजी देशों में, जैसे कि दक्षिण कोरिया में, स्थिति एक ऐसी द्विभाषी पार्टी (bilingual party) जैसी है जहाँ हर कोई एक ही भाषा बोल रहा है, बस उनके लहजे या वर्तनी (spelling) अलग हैं।

यहाँ इस शोध पत्र की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "एक सही उत्तर" का जाल

वास्तविक दुनिया में, एक कोरियाई डॉक्टर घुटने के सपोर्ट के लिए अंग्रेजी शब्द "brace" कह सकता है। लेकिन इसे लिखते समय, वे इसे दो वैध तरीकों से लिख सकते हैं:

  • तरीका A: अंग्रेजी वर्तनी: "brace"
  • तरीका B: कोरियाई ध्वन्यात्मक ध्वनि (phonetic sound): "bureseu" (브레이스)

दोनों का अर्थ बिल्कुल एक ही है और ध्वनि भी एक ही है। हालाँकि, स्पीच रिकग्निशन (speech recognition) के लिए मानक कंप्यूटर टेस्ट एक सख्त शिक्षक की तरह होते हैं जो केवल एक विशिष्ट उत्तर स्वीकार करते हैं। यदि रोबोट "bureseu" लिखता है लेकिन टेस्ट की कुंजी (key) में "brace" लिखा है, तो कंप्यूटर इसे गलत मान लेता है, भले ही रोबोट ने डॉक्टर की बात को पूरी तरह समझ लिया हो।

लेखक इसे "Multiscript Variability" कहते हैं। यह ऐसा ही है जैसे आपने अपने दोस्त से "Hello" लिखने को कहा, और उसने "Hullo" या "Salut" (यदि वह फ्रांसीसी होता) लिख दिया, और आपने उसे सिर्फ इसलिए फेल कर दिया क्योंकि उसकी स्पेलिंग ठीक वैसी नहीं थी जैसी आपके मन में थी।

2. समाधान: "MultiClin" बेंचमार्क

शोधकर्ताओं ने MultiClin नामक एक नया परीक्षण मैदान बनाया है। इसे स्पीच रोबोट्स के लिए एक विशेष परीक्षा के रूप में समझें जो "द्विभाषी पार्टी" के नियम को समझती है।

  • डेटासेट: उन्होंने नकली (लेकिन वास्तविक लगने वाली) डॉक्टर-मरीज की बातचीत का एक पुस्तकालय बनाया। क्योंकि वास्तविक मेडिकल रिकॉर्ड निजी होते हैं (जैसे एक गुप्त डायरी), उन्होंने इन बातचीत को उत्पन्न करने के लिए AI का उपयोग किया, जिसमें सावधानीपूर्वक ऐसे मेडिकल शब्द जोड़े गए जिन्हें अंग्रेजी या कोरियाई में लिखा जा सकता था।
  • नया नियम: केवल यह जाँचने के बजाय कि क्या रोबट का उत्तर एक विशिष्ट स्क्रिप्ट से मेल खाता है, नया टेस्ट यह जाँचता है कि क्या रोबट का उत्तर अंग्रेजी संस्करण या कोरियाई संस्करण से मेल खाता है। यह एक शिक्षक की तरह है जो कहता है, "यदि आपने 'brace' या 'bureseu' लिखा है, तो आपको पूरे अंक मिलेंगे।"

3. परिणाम: रोबोट बहुत स्मार्ट दिखते हैं

जब शोधकर्ताओं ने लोकप्रिय स्पीच रोबोट्स (जैसे Whisper, Qwen, और Gemini) का पुराने "सख्त शिक्षक" वाले नियमों का उपयोग करके परीक्षण किया, तो वे बहुत खराब प्रदर्शन करते दिखे। उनकी त्रुटि दर (error rates) अधिक थी क्योंकि रोबोट को स्थानीय वर्तनी का उपयोग करने के लिए दंडित किया जा रहा था।

लेकिन जब उन्होंने नए MultiClin नियमों का उपयोग किया:

  • त्रुटि दर काफी कम हो गई
  • रोबोट वास्तव में कम बुद्धिमान नहीं थे; टेस्ट बस बहुत कठोर था।
  • सबसे अच्छा रोबोट (Gemini 2.5 Pro) ने दिखाया कि वह इन पेचीदा मेडिकल बातचीत को हमारी सोच से कहीं बेहतर तरीके से संभाल सकता है, एक बार जब हमने उसे स्थानीय स्क्रिप्ट का उपयोग करने के लिए दंडित करना बंद कर दिया।

4. प्रशिक्षण का सबक: एक रास्ता चुनें!

शोधकर्ताओं ने इस नए डेटा का उपयोग करके रोबोट को खुद प्रशिक्षित करने की भी कोशिश की। उन्होंने एक बहुत ही महत्वपूर्ण सबक सीखा कि उन्हें कैसे प्रशिक्षित किया जाए: निरंतरता (Consistency) ही कुंजी है।

कल्पना कीजिए कि आप एक बच्चे को "cat" शब्द लिखना सिखा रहे हैं।

  • परिदृश्य A: आप उसे 100% समय "cat" दिखाते हैं। वह इसे पूरी तरह सीख जाता है।
  • परिदृश्य B: आप उसे 50% समय "cat" और अन्य 50% समय "kæt" (ध्वन्यात्मक) दिखाते हैं। बच्चा भ्रमित हो जाता है। उसे समझ नहीं आता कि कौन सा "असली" शब्द है, और वह गलतियाँ करने लगता है।

शोध पत्र में पाया गया कि यदि प्रशिक्षण डेटा में अंग्रेजी और कोरियाई वर्तनी को बेतरतीब ढंग से मिला दिया गया (50/50 का विभाजन), तो रोबोट बहुत भ्रमित हो गया और उसका प्रदर्शन खराब रहा। यह ऐसा था जैसे रोबोट का दिमाग यह तय करने में गोल-गोल घूम रहा था कि कौन सी स्पेलिंग सही है।

विजेता: रोबोटों ने तब सबसे अच्छा प्रदर्शन किया जब प्रशिक्षण डेटा 100% एकीकृत (unified) था। यदि लक्ष्य कोरियाई में लिखना था, तो सब कुछ कोरियाई में लिखा गया था। यदि लक्ष्य अंग्रेजी था, तो सब कुछ अंग्रेजी में था। इसने भ्रम को दूर कर दिया और रोबोट को मेडिकल शब्दों को तेजी से और सटीक रूप से सीखने में मदद की।

सारांश

  • मुद्दा: वर्तमान टेस्ट स्पीच रोबोट्स को मेडिकल शब्दों की स्थानीय वर्तनी का उपयोग करने के लिए अनुचित रूप से दंडित करते हैं, भले ही वे सही हों।
  • समाधान: लेखकों ने MultiClin बनाया है, एक नया टेस्ट जो कई वैध स्पेलिंग (अंग्रेजी या स्थानीय स्क्रिप्ट) को सही उत्तर के रूप में स्वीकार करता है।
  • खोज: रोबोट मेडिकल स्पीच को समझने में हमारी सोच से कहीं अधिक बेहतर हैं, लेकिन हमें उन्हें "एक ही आकार के पैमाने" (one-size-fits-all) से मापना बंद करना होगा।
  • प्रशिक्षण टिप: इन रोबोटों को अच्छी तरह से सिखाने के लिए, स्पेलिंग शैलियों को बेतरतीब ढंग से न मिलाएं। एक शैली चुनें और उसी पर टिके रहें, अन्यथा रोबोट भ्रमित हो जाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →