← नवीनतम पेपर
💻 computer science

Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy

यह शोध पत्र EndoASR को प्रस्तुत करता है, जो एक डोमेन-अनुकूलित स्वचालित भाषण पहचान प्रणाली है जो गैस्ट्रोइंटेस्टाइनल एंडोस्कोपी में वास्तविक समय में मानव-AI सहयोग के लिए ट्रांसक्रिप्शन सटीकता और चिकित्सा शब्दावली की पहचान में महत्वपूर्ण सुधार करती है, जो मल्टी-सेंटर नैदानिक सेटिंग्स में मजबूत सामान्यीकरण और कुशल एज परिनियोजन का प्रदर्शन करती है।

मूल लेखक: Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang

प्रकाशित 2026-04-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सर्जन हैं जो मरीज के शरीर के अंदर एक बहुत ही सूक्ष्म प्रक्रिया कर रहे हैं, जिसके लिए आप एक लंबे, लचीले कैमरे (एंडोस्कोप) का उपयोग कर रहे हैं। आपके हाथ कैमरा और उपकरण पकड़ने में व्यस्त हैं, इसलिए आप टाइप या नोट्स नहीं लिख सकते। इसके बजाय, आप जोर से बोलकर वर्णन करते हैं कि आप क्या देख रहे हैं: "मुझे कोलन के बाईं ओर एक छोटा लाल उभार दिख रहा है, यह एक पॉलिप (polyp) जैसा लग रहा है, चलिए इसे हटाते हैं।"

एक आदर्श दुनिया में, एक कंप्यूटर आपकी बात सुनता है और तुरंत एक सटीक मेडिकल रिपोर्ट लिख देता है। लेकिन वास्तविक दुनिया में, यह एक ऐसे दोस्त के साथ गंभीर बातचीत करने जैसा है जो केवल एक अलग भाषा बोलता है, जबकि आपके बगल में एक निर्माण दल (construction crew) शोर मचा रहा है।

यह शोध पत्र EndoASR को पेश करता है, जो एक नया "स्मार्ट श्रोता" है जिसे विशेष रूप से गैस्ट्रोएंटेरोलॉजिस्टों की इस समस्या को हल करने के लिए डिज़ाइन किया गया है। यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया, जिसे सरल शब्दों में समझाया गया है:

1. समस्या: "जनरलिस्ट" बनाम "स्पेशलिस्ट"

सामान्य वॉयस असिस्टेंट (जैसे सिरी, एलेक्सा, या वे बड़े AI मॉडल जिनका हर कोई उपयोग करता है) को जनरलिस्ट लाइब्रेरियन (सामान्य पुस्तकालयाध्यक्ष) के रूप में सोचें। वे इतिहास, खाना पकाने या पॉप संस्कृति के बारे में किताबें पढ़ने में बहुत अच्छे हैं। लेकिन यदि आप उनसे एक जटिल मेडिकल टेक्स्टबुक पढ़ने के लिए कहें, तो वे लड़खड़ा जाते हैं।

  • शब्दावली का अंतर (The Vocabulary Gap): डॉक्टर बहुत विशिष्ट शब्दों का उपयोग करते हैं जैसे "पेरिस क्लासिफिकेशन IIa" या "बोस्टन बाउल प्रिपरेशन स्केल"। एक जनरलिस्ट लाइब्रेरियन ने ये शब्द कभी नहीं सुने होते और वे गलत अनुमान लगाते हैं।
  • शोर का अंतर (The Noise Gap): एंडोस्कोपी रूम में बहुत शोर होता है। मशीनों की बीप, सक्शन होज़ और कई लोग आपस में बात कर रहे होते हैं। एक जनरलिस्ट लाइब्रेरियन बैकग्राउंड के शोर से भ्रमित हो जाता है।

शोधकर्ताओं ने इन "जनरलिस्ट" लाइब्रेरियन का वास्तविक एंडोस्कोपी रूम में परीक्षण किया, और वे बुरी तरह विफल रहे, जिससे इतनी गलतियाँ हुईं कि वे उपयोगी नहीं रह गए।

2. समाधान: एक "स्पेशलिस्ट इंटर्न" को प्रशिक्षित करना

चूंकि उन्हें डॉक्टरों की वास्तविक रिकॉर्डिंग (मरीज की गोपनीयता नियमों के कारण) पर्याप्त मात्रा में नहीं मिल सकी, इसलिए शोधकर्ताओं को रचनात्मक होना पड़ा। उन्होंने एक सिंथेटिक ट्रेनिंग कैंप बनाया।

  • चरण 1: स्क्रिप्ट (भाषा अनुकूलन): उन्होंने हजारों वास्तविक, लिखित मेडिकल रिपोर्ट लीं और एक 'टेक्स्ट-टू-स्पीच' रोबोट का उपयोग करके उन्हें जोर से पढ़वाया। इससे "नकली" डॉक्टर की आवाजों का एक विशाल पुस्तकालय तैयार हुआ जो सटीक मेडिकल शब्दों का उच्चारण कर रहे थे। उन्होंने अपने AI मॉडल को इसे सुनने के लिए प्रशिक्षित किया, जिससे वह एक मेडिकल शब्दावली विशेषज्ञ बन गया।
  • चरण 2: नॉइज़ जिम (मजबूती): केवल शब्दों को जानना ही काफी नहीं है; AI को उन्हें शोर के बीच भी सुनना आना चाहिए। उन्होंने उस "नकली" स्पीच को वास्तविक एंडोस्कोपी रूम के शोर (बीपिंग, सक्शन आदि) के साथ मिला दिया। उन्होंने AI को उस अराजकता को अनदेखा करने और डॉक्टर की आवाज पर ध्यान केंद्रित करने के लिए प्रशिक्षित किया।

इस दो-चरणीय प्रक्रिया ने EndoASR को बनाया, जो एक साथ एक मेडिकल डिक्शनरी और एक नॉइज़-कैंसलिंग हेडफ़ोन दोनों है।

3. टेस्ट ड्राइव: लैब से वास्तविक दुनिया तक

शोधकर्ताओं ने इसका परीक्षण केवल एक शांत लैब में नहीं किया। वे इसे पांच अलग-अलग अस्पतालों के रोड ट्रिप पर ले गए।

  • परिणाम: इन वास्तविक दुनिया के परीक्षणों में, EndoASR एक अनुभवी स्थानीय गाइड की तरह था, जबकि पुराने मॉडल एक भ्रमित पर्यटक की तरह थे। इसने त्रुटियों को लगभग 30% कम कर दिया और मेडिकल शब्दों को लगभग 85% बार सही पहचाना (पुराने मॉडलों के लगभग 60% से ऊपर)।
  • गति: यह अविश्वसनीय रूप से तेज़ था। जहाँ अन्य मॉडल "सोचने" के लिए कुछ समय लेते थे (जैसे एक धीमा अनुवादक), वहीं EndoASR लगभग तात्कालिक था, जिससे डॉक्टर बिना किसी प्रतीक्षा के बोलते ही स्क्रीन पर टेक्स्ट को रियल-टाइम में दिखाई दे सकता था।

4. यह क्यों महत्वपूर्ण है: "टीमवर्क" का प्रभाव

सबसे महत्वपूर्ण बात केवल यह नहीं है कि कंप्यूटर शब्दों को सही ढंग से सुनता है; बल्कि यह है कि इसके बाद क्या होता है।
कल्पना कीजिए कि AI एक टीम सदस्य है जो डॉक्टर की मदद कर रहा है।

  • यदि AI "पॉलिप" (polyp) को सही ढंग से सुनता है, तो यह तुरंत सही उपचार मार्गदर्शिका (treatment guide) या बीमा फॉर्म निकाल सकता है।
  • यदि AI "पॉलिप" को "पपी" (puppy) समझ लेता है, तो पूरी टीम भ्रमित हो जाती है, रिपोर्ट गलत हो जाती है, और मरीज की सुरक्षा खतरे में पड़ जाती है।

सुनने की क्षमता (ASR) को ठीक करके, पूरी टीम (डॉक्टर + AI) बेहतर तरीके से काम करती है। डॉक्टर अपने हाथ औजारों पर और अपनी आँखें स्क्रीन पर रख सकता है, और कागजी कार्रवाई को संभालने के लिए AI पर भरोसा कर सकता है।

निष्कर्ष

यह शोध पत्र दिखाता है कि चिकित्सा की इस अव्यवस्थित, शोर भरी और उच्च-जोखिम वाली दुनिया में AI को उपयोगी बनाने के लिए, आप केवल एक "एक ही आकार के सभी के लिए उपयुक्त" (one-size-fits-all) टूल का उपयोग नहीं कर सकते। आपको एक स्पेशलिस्ट बनाना होगा जो डॉक्टर की भाषा बोलता हो और जिसने नॉइज़-कैंसलिंग हेडफ़ोन पहने हों। EndoASR वही स्पेशलिस्ट है, जो मानव-AI मेडिकल टीम के लिए विश्वसनीय कान बनने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →