Understanding Clinician Edits to Ambient AI Draft Notes: A Feasibility Analysis Using Large Language Models
यह अध्ययन प्रदर्शित करता है कि फ्यू-शॉट प्रॉम्टेड लार्ज लैंग्वेज मॉडल्स एम्बिएंट एआई ड्राफ्ट नोट्स में क्लिनिशियन द्वारा किए गए विशिष्ट प्रकार के संशोधनों को प्रभावी ढंग से वर्गीकृत कर सकते हैं, जो दवा और लक्षण संबंधी संशोधनों के लिए मजबूत प्रदर्शन प्राप्त करते हैं जबकि जटिल, संदर्भ-निर्भर संशोधनों को मानव समीक्षा ट्राइएज के लिए बेहतर रूप से उपयुक्त पहचानते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक डॉक्टर के क्लिनिक में एक सुपर-स्मार्ट, अथक रोबोटिक सहायक बैठा है जो हर मरीज के दौरे के दौरान मौजूद रहता है। यह रोबोट बातचीत को सुनता है और तुरंत मेडिकल नोट्स का एक ड्राफ्ट तैयार कर देता है। यह तेज़ है और डॉक्टर का समय बचाता है, लेकिन यह पूरी तरह से सटीक नहीं है। कभी-कभी रोबोट कोई विवरण छोड़ देता है, खुराक (dosage) गलत लिख देता है, या किसी लक्षण को इस तरह से लिख देता है जो सुनने में सही नहीं लगता।
इसलिए, डॉक्टर को रोबोट के ड्राफ्ट को पढ़ना होता है, गलतियों को ठीक करना होता है, और "साइन" बटन दबाना होता है।
समस्या:
शोधकर्ता यह जानना चाहते थे: डॉक्टर वास्तव में क्या ठीक कर रहा है? क्या वे मुख्य रूप से दवाओं की सूची बदल रहे हैं? क्या वे निदान (diagnosis) में बदलाव कर रहे हैं? क्या वे सामाजिक विवरण जोड़ रहे हैं जैसे कि "मरीज अकेला रहता है"?
अतीत में, यह पता लगाने के लिए, विशेषज्ञों की एक टीम को हजारों इन ड्राफ्ट्स को पढ़ना पड़ता था और मैन्युअल रूप से हर एक बदलाव को टैग करना पड़ता था। यह एक उपन्यास के हर वाक्य को हाथ से चेक करने के लिए संपादकों की एक टीम को काम पर रखने जैसा था—जो धीमा, महंगा और थका देने वाला था।
प्रयोग:
टीम ने पूछा: "क्या हम एक अलग, छोटे AI (एक लार्ज लैंग्वेज मॉडल) को एक 'जासूस' के रूप में काम करने के लिए सिखा सकते हैं ताकि वह हमारे लिए इन बदलावों को स्वचालित रूप से वर्गीकृत कर सके?"
उन्होंने AI को हजारों उदाहरणों के साथ प्रशिक्षित नहीं किया (जिसमें बहुत अधिक डेटा लगता है)। इसके बजाय, उन्होंने "फ्यू-शॉट प्रॉम्प्टिंग" (few-shot prompting) नामक तकनीक का उपयोग किया। इसे ऐसे समझें जैसे आप AI को एक 'चीट शीट' दे रहे हों जिसमें केवल कुछ उदाहरण हों कि उसे क्या देखना है, जैसे, "यह एक दवा का बदलाव है। यह एक लक्षण का बदलाव है। अब, इस नए टेक्स्ट को देखो और बताओ कि यह किस तरह का बदलाव है।"
परिणाम: "आसान" बनाम "कठिन" मामले
अध्ययन से पता चला कि AI जासूस कुछ कामों में उस्ताद था लेकिन दूसरों में संघर्ष करता था।
"आसान" मामले (दवाएं और लक्षण):
- उपमा: कल्पना कीजिए कि एक फलों के कटोरे में लाल सेब को ढूंढना। यह चमकीला, विशिष्ट और पहचानने में आसान है।
- परिणाम: जब डॉक्टर किसी दवा का नाम या लक्षण का विवरण बदलता था (जैसे, "सीने में दर्द" को "सीने में जकड़न" में बदलना), तो AI इसे पहचानने में बहुत अच्छा था। इसने लगभग 78% बार सही काम किया।
- क्यों? इन बदलावों में अक्सर "एंकर" होते हैं—विशिष्ट शब्द जैसे दवा के नाम या लक्षणों के शब्द जो स्पष्ट रूप से उभर कर आते हैं।
"कठिन" मामले (निदान, टेस्ट और सामाजिक इतिहास):
- उपमा: अब कल्पना कीजिए कि पत्तियों के बीच पूरी तरह से घुल-मिल जाने वाले गिरगिट को ढूंढना। या केवल एक अस्पष्ट यात्रा लॉग को पढ़कर यह अंतर करने की कोशिश करना कि यह एक "योजनाबद्ध यात्रा" है या "पूरी हो चुकी यात्रा"।
- परिणाम: जब बदलाव जटिल निदान (diagnoses), टेस्ट के आदेश देने, या सामाजिक विवरणों (जैसे आवास या पारिवारिक सहायता) के बारे में थे, तो AI भ्रमित हो गया। वह अक्सर बिना किसी बदलाव के भी चिल्ला उठता था कि "मुझे बदलाव मिला!" (फॉल्स अलार्म), या वह सूक्ष्म अर्थों को समझने में विफल रहा।
- क्यों? ये बदलाव अक्सर संदर्भ (context) और निहितार्थ (implication) पर निर्भर करते हैं। एक डॉक्टर बिना "निदान" शब्द का उपयोग किए, वाक्य को "संभावित वायरस" से "पुष्ट फ्लू" में बदल सकता है। AI, जिसमें मानवीय नैदानिक अंतर्ज्ञान की कमी होती है, उस बदलाव के महत्व को समझने में संघर्ष करता है।
"सेफ्टी गेट" रणनीति
AI को अधिक विश्वसनीय बनाने के लिए, शोधकर्ताओं ने एक "वेरिफिकेशन गेट" जोड़ा। उन्होंने AI को निर्देश दिया: "सिर्फ अनुमान न लगाएं। यदि आप कहते हैं, 'हाँ, यह एक दवा का बदलाव है,' तो आपको टेक्स्ट में उस सटीक शब्द की ओर इशारा करना होगा जो इसे साबित करता है।"
यह एक सुरक्षा गार्ड से पूछने जैसा था: "सिर्फ यह मत कहो कि 'वह व्यक्ति वीआईपी है।' मुझे उनका बैज दिखाओ।" इस नियम ने AI को मनगढ़ंत अनुमान लगाने से रोकने में मदद की, हालांकि यह "गिरगिट" वाले बदलावों की उलझन को ठीक नहीं कर सका।
निष्कर्ष: एक नया वर्कफ़्लो
पेपर यह निष्कर्ष निकालता है कि हमें इस AI को सब कुछ स्वचालित रूप से करने के लिए इस्तेमाल नहीं करना चाहिए। इसके बजाय, हमें इसे एक स्मार्ट फिल्टर के रूप में उपयोग करना चाहिए:
- "लाल सेबों" के लिए (दवाएं/लक्षण): AI को काम करने दें। यह इतना तेज़ और सटीक है कि रुझानों को स्वचालित रूप से ट्रैक कर सके (जैसे, "हे, डॉक्टर नोट्स में 20% मामलों में दवा X की खुराक बदल रहे हैं")।
- "गिरगिटों" के लिए (निदान/सामाजिक): AI को एक ट्राइएज टूल (triage tool) के रूप में उपयोग करें। इसे संभावित बदलावों को फ्लैग करने दें और कहें, "इंसान, कृपया इन विशिष्ट नोट्स पर एक नज़र डालें।" यह इंसान की जगह नहीं लेता; यह बस इंसान को बताता है कि कहाँ देखना है, जिससे उन्हें हर एक पन्ना पढ़ने से मुक्ति मिलती है।
संक्षेप में: AI स्पष्ट और ठोस बदलावों को पहचानने के लिए एक बेहतरीन सहायक है, लेकिन सूक्ष्म और जटिल चिकित्सा तर्क के लिए, इसे अपने काम की दोबारा जांच करने के लिए अभी भी एक मानव साथी की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।