VozConsultAI: A Provider-Agnostic Architecture and a Clinically Grounded Evaluation of Open-Weight Large Language Models for SOAP Note Extraction in Brazilian Portuguese Telehealth
यह शोध पत्र ब्राज़ीलियाई पुर्तगाली टेलीहेल्थ में स्वचालित SOAP नोट जनरेशन के लिए एक प्रदाता-अज्ञेय (provider-agnostic) माइक्रोसर्विस आर्किटेक्चर, VozConsultAI को प्रस्तुत करता है, और एक नवीन, नैदानिक रूप से आधारित मूल्यांकन मीट्रिक का उपयोग करते हुए ओपन-वेट लार्ज लैंग्वेज मॉडल्स का पहला तुलनात्मक बेंचमार्क प्रस्तुत करता है जो सुरक्षा को प्राथमिकता देता है और मतिभ्रम (hallucinations) को दंडित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि ब्राजील के एक व्यस्त डॉक्टर को वीडियो कॉल पर एक मरीज की मदद करने की कोशिश करनी पड़ रही है। जब वे सुन और बोल रहे होते हैं, तो वे साथ ही साथ बड़ी तेजी से एक मेडिकल रिपोर्ट भी टाइप करने की कोशिश कर रहे होते हैं। यह रिपोर्ट, जिसे SOAP नोट कहा जाता है, मेडिकल रिकॉर्ड के लिए एक मानकीकृत रेसिपी की तरह है: इसे यह सूचीबद्ध करना चाहिए कि मरीज ने क्या कहा (Subjective - व्यक्तिपरक), डॉक्टर ने क्या देखा (Objective - वस्तुनिष्ठ), डॉक्टर को क्या लगता है कि समस्या क्या है (Assessment - मूल्यांकन), और योजना क्या है (Plan - योजना)।
ब्राजील की विशाल सार्वजनिक स्वास्थ्य प्रणाली में, यह कागजी कार्रवाई एक बहुत बड़ा बोझ है, जिससे डॉक्टरों में बर्नआउट (मानसिक थकान) हो रहा है। इसे ऑटोमेट करने वाले अधिकांश मौजूदा उपकरण अमेरिकी "ब्लैक बॉक्स" की तरह हैं: वे केवल अंग्रेजी बोलते हैं, प्रति विज़िट बहुत अधिक लागत लेते हैं, और संवेदनशील रोगी डेटा को विदेशी क्लाउड पर भेज देते हैं, जो ब्राजील के गोपनीयता कानूनों का उल्लंघन करता है।
VozConsultAI एक नया प्रोजेक्ट है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। इसे एक स्मार्ट, लचीले और स्थानीय "डिजिटल स्केबिन" (डिजिटल लेखक) के रूप में समझें जो विशेष रूप से ब्राजील के लिए बनाया गया है। यह कैसे काम करता है, इसके सरल भाग यहाँ दिए गए:
1. "यूनिवर्सल ट्रांसलेटर" आर्किटेक्चर
एक व्यस्त रेस्टोरेंट किचन की कल्पना करें। आमतौर पर, आपको एक विशिष्ट शेफ (एक विशिष्ट AI कंपनी) से ऑर्डर करना होता है। यदि वह शेफ व्यस्त है या मेनू बदल जाता है, तो आप फंस जाते हैं।
VozConsultAI एक स्मार्ट ऑर्डरिंग सिस्टम (जिसे "ब्रोकर" कहा जाता है) बनाता है जो डॉक्टर और किचन के बीच में बैठता है।
- प्रदाता-स्वतंत्र (Provider-Agnostic): डॉक्टर को यह जानने की ज़रूरत नहीं है कि कौन सा शेफ खाना बना रहा है। सिस्टम ऑर्डर को क्लाउड शेफ, एक स्थानीय किचन शेफ, या एक मुफ्त ओपन-सोर्स शेफ के पास भेज सकता है, जो भी उपलब्ध हो और जो नियम कहते हों।
- विश्वसनीयता: यदि कोई शेफ प्लेट गिरा देता है (क्रैश हो जाता है), तो सिस्टम इसे नोटिस करता है, ऑर्डर को संभालता है, और दूसरे शेफ को दे देता है बिना ग्राहक (डॉक्टर) को यह पता चले कि कोई समस्या हुई थी।
- गोपनीयता सर्वोपरि: क्योंकि ब्राजील का कानून (LGPD) कहता है कि रोगी का डेटा देश के नियंत्रण के भीतर रहना चाहिए, इसलिए यह सिस्टम "ओपन-वेट" मॉडल (AI दिमाग जिनका कोड फ्री में डाउनलोड और स्थानीय रूप से चलाया जा सकता है) का उपयोग करके अस्पताल के अपने सर्वर पर पूरी तरह से चल सकता है, जिससे यह सुनिश्चित होता है कि कोई भी डेटा इमारत से बाहर न जाए।
2. "सख्त जज" (मूल्यांकन)
AI डॉक्टरों के साथ सबसे बड़ा खतरा हैलुसिनेशन (Hallucination)—जहाँ AI ऐसे तथ्य बना लेता है जो सुनने में तो सही लगते हैं लेकिन कभी हुए ही नहीं (जैसे, किसी ऐसी बीमारी का उल्लेख करना जिसका मरीज ने कभी जिक्र नहीं किया था)।
लेखकों ने केवल यह नहीं पूछा कि "क्या AI ने एक अच्छा वाक्य लिखा?" बल्कि उन्होंने एक तीन-स्तरीय सुरक्षा परीक्षण बनाया:
- सटीकता (Correctness): क्या इसने सही तथ्यों को सही सेक्शन में रखा? (जैसे, क्या इसने डायग्नोसिस को "असेसमेंट" सेक्शन में रखा और न कि "प्लान" में?)
- कवरेज (Coverage): क्या इसने कुछ महत्वपूर्ण छोड़ दिया? (जैसे, क्या यह मरीज की एलर्जी का उल्लेख करना भूल गया?)
- ग्राउंडिंग (Grounding - सुरक्षा जाल): यह सबसे महत्वपूर्ण हिस्सा है। हर उस तथ्य के लिए जो AI लिखता है, उसे बातचीत के उस सटीक स्थान की ओर इशारा करना चाहिए जहाँ डॉक्टर या मरीज ने वह बात कही थी। यदि AI कोई तथ्य मनगढ़ंत बनाता है, तो उसे फेल कर दिया जाता है।
उन्होंने इन सबको मिलाकर एक एकल स्कोर बनाया जिसे क्लिनिकल डॉक्यूमेंटेशन क्वालिटी इंडेक्स (CDQI) कहा जाता है, जो मनगढ़ंत बातें बनाने के लिए भारी दंड देता है।
3. "टेस्ट ऑफ टेस्ट" (परिणाम)
टीम ने पांच अलग-अलग ओपन-सोर्स AI मॉडल (द "शेफ") का परीक्षण 30 नकली लेकिन यथार्थवादी ब्राजीलियाई चिकित्सा संवादों का उपयोग करके किया। वे देखना चाहते थे कि कौन सा मॉडल बिना गलत तथ्य बनाए (hallucinate किए बिना) सबसे अच्छा SOAP नोट लिख सकता है।
- विजेता: DeepSeek V3.2 शीर्ष पर आया। इसने उच्चतम समग्र सुरक्षा स्कोर (0.87) प्राप्त किया और तथ्यों पर टिके रहने में सबसे अच्छा (0.96 ग्राउंडिंग स्कोर) रहा।
- उपविजेता: Llama 3.3 गुणवत्ता में बहुत करीब था लेकिन इसे कम कंप्यूटिंग पावर की आवश्यकता थी।
- आश्चर्य: बड़ा हमेशा बेहतर नहीं होता। जबकि सबसे बड़े मॉडल ने जीत हासिल की, एक थोड़ा छोटा मॉडल (Llama) लगभग उतना ही अच्छा प्रदर्शन कर रहा था, जो साबित करता है कि मॉडल को कैसे प्रशिक्षित किया जाता है यह उसके आकार से अधिक महत्वपूर्ण है।
- कमजोरी: सभी मॉडल असेसमेंट (Assessment) और प्लान (Plan) सेक्शन में सबसे अधिक संघर्ष करते हैं। यह समझ में आता है क्योंकि इन हिस्सों के लिए AI को अगले चरणों का अनुमान लगाने या तर्क लगाने की आवश्यकता होती है, जहाँ इसके मनगढ़ंत बातें बनाने की सबसे अधिक संभावना होती है। पेपर में उल्लेख किया गया है कि इन सेक्शनों के लिए हमेशा एक मानव डॉक्टर द्वारा दोबारा जांच की आवश्यकता होगी।
निचोड़
VozConsultAI साबित करता है कि ब्राजील को मेडिकल कागजी कार्रवाई को ऑटोमेट करने के लिए महंगे, विदेशी, अंग्रेजी-मात्र AI टूल्स पर निर्भर होने की आवश्यकता नहीं है। वे अपना खुद का सिस्टम बना सकते हैं जो:
- स्थानीय सर्वर पर चलाकर स्थानीय गोपनीयता कानूनों का सम्मान करता है।
- विभिन्न AI इंजन के बीच आसानी से स्विच करता है।
- यह सुनिश्चित करने के लिए एक सख्त "सुरक्षा-प्रथम" स्कोरिंग सिस्टम का उपयोग करता है कि AI चिकित्सा तथ्य न बनाए।
पेपर निष्कर्ष निकालता है कि हालांकि ये ओपन AI मॉडल अब उपयोगी होने के लिए पर्याप्त अच्छे हैं, फिर भी नोट्स के "असेसमेंट" और "प्लान" वाले हिस्से को अंतिम रूप देने से पहले एक मानव डॉक्टर द्वारा समीक्षा की जानी चाहिए। लक्ष्य डॉक्टर के टाइपिंग के बोझ को कम करना है, उनके निर्णय को बदलना नहीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।