← नवीनतम पेपर
💬 NLP

Decomposing Error and Style in Automated Clinical Coding

यह शोध पत्र तर्क देता है कि ऑटोमेटेड क्लिनिकल कोडिंग में मॉडल त्रुटि के कारण होने वाला अधिकांश प्रदर्शन अंतराल वास्तव में अनमॉडल (unmodeled), व्यवस्थित कोडिंग शैलियों से उत्पन्न होता है, जो यह प्रदर्शित करता है कि मॉडल को स्पष्ट रूप से कोडर-विशिष्ट शैली नियमावली (coder-specific style rubric) पर अनुकूलित करना सटीकता में उल्लेखनीय सुधार करता है और विभिन्न मूल्यांकन विधियों के बीच विसंगतियों को हल करता है।

मूल लेखक: Han-Chin Shing, Jack Moriarty, Ryan Ware, Afton Marchbanks, Carlyn Canvasser, Stefanie Higgins, Harsh Gupta, Fang Wang, Joseph Paul Cohen

प्रकाशित 2026-09-22✓ Author reviewed ⓘ
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Han-Chin Shing, Jack Moriarty, Ryan Ware, Afton Marchbanks, Carlyn Canvasser, Stefanie Higgins, Harsh Gupta, Fang Wang, Joseph Paul Cohen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

जब भी कोई मरीज डॉक्टर के क्लिनिक या अस्पताल से निकलता है, तो एक महत्वपूर्ण प्रशासनिक कार्य शुरू हो जाता है। एक मेडिकल कोडर को चिकित्सक द्वारा लिखे गए नैदानिक नोट्स (clinical notes) को पढ़ना होता है और उन्हें अल्फ़ान्यूमेरिक कोड के एक मानकीकृत सेट में बदलना होता है। ये कोड बीमा कंपनियों और सरकारी कार्यक्रमों को ठीक-ठीक बताते हैं कि मरीज के साथ क्या समस्या थी और उसका उपचार करने के लिए क्या किया गया, जिससे यह निर्धारित होता है कि प्रदाता को कितना भुगतान किया जाएगा। दशकों से, स्वचालित कोडिंग (automated coding) के क्षेत्र ने इस कार्य को मिलान के एक सरल खेल के रूप में माना है: एक कंप्यूटर प्रोग्राम नोट को पढ़ता है, और यदि इसकी कोड की सूची किसी मानव विशेषज्ञ द्वारा बनाई गई एकल "गोल्ड स्टैंडर्ड" सूची से पूरी तरह मेल नहीं खाती है, तो कंप्यूटर को गलत माना जाता है। यह दृष्टिकोण यह मानता है कि यदि दो विशेषज्ञ एक ही नोट को पढ़ें और एक ही नियमों का पालन करें, तो वे कोड की बिल्कुल समान सूची बनाएंगे।

हालाँकि, चिकित्सा की वास्तविक दुनिया में, यह धारणा लागू नहीं होती है। अत्यधिक प्रशिक्षित मानव विशेषज्ञ भी, एक ही मरीज के नोट्स को देख रहे हों और एक ही आधिकारिक दिशानिर्देशों का उपयोग कर रहे हों, तो भी अक्सर अलग-अलग कोड सूचियाँ बना सकते हैं। वे इस बात पर असहमत हो सकते हैं कि किसी मामूली स्थिति को शामिल करना है या नहीं, निदान (diagnosis) के बारे में कितना विशिष्ट होना है, या उन सेवाओं के लिए प्रशासनिक कोड जोड़ने के बारे में चर्चा तो की गई लेकिन वे निष्पादित नहीं हुईं। लंबे समय तक, शोधकर्ताओं का मानना था कि यह असहमति केवल मानवीय त्रुटि थी—एक विशाल प्रणाली के साथ होने वाली एक अव्यवधर, अपरिहार्य लागत जिसमें हजारों संभावित कोड होते हैं। लेकिन एक नया अध्ययन बताता है कि जिसे त्रुटि समझा जा रहा है, वह वास्तव में कुछ और है: एक व्यवस्थित शैलीगत अंतर। जिस तरह दो लेखक एक ही घटना का वर्णन विवरण या फोकस के विभिन्न स्तरों के साथ कर सकते हैं, उसी तरह दो कोडर इस बारे में अलग-अलग आंतरिक नीतियां लागू करते हैं कि किस चीज़ को रिकॉर्ड किया जाना चाहिए और उसे न्यायसंगत ठहराने के लिए कितने प्रमाण की आवश्यकता है।

Amazon के शोधकर्ताओं की एक टीम ने इस अंतर की जांच करने के लिए यह पता लगाने का प्रयास किया कि क्या कोडर्स के बीच की असहमति यादृच्छिक शोर (random noise) थी या एक मापने योग्य और उपयोग योग्य अनुमानित पैटर्न। उन्होंने 110 रोगी मुठभेड़ों (patient encounters) के एक सार्वजनिक डेटासेट को देखना शुरू किया जिसे दो स्वतंत्र टीमों द्वारा कोड किया गया था। समान नोट्स पर काम करने के बावजूद, ये दोनों टीमें कोड के केवल 73 प्रतिशत पर सहमत थीं। जब शोधकर्ताओं ने नोट्स की समीक्षा करने और स्पष्ट रूप से अनुचित किसी भी कोड को हटाने के लिए नैदानिक ऑडिटरों के तीसरे, स्वतंत्र समूह को शामिल किया, तो सहमति केवल थोड़ी बढ़कर 77 प्रतिशत हुई। इसका अर्थ था कि स्पष्ट गलतियों को हटाने के बाद भी, विशेषज्ञों के बीच एक चौथाई कोड अभी भी भिन्न थे। शोधकर्ताओं ने परिकल्पना की कि शेष अंतर ज्ञान की विफलता नहीं था, बल्कि "कोडिंग शैली" का अंतर था—प्रत्येक कोडर या चिकित्सा स्थल की एक विशिष्ट प्राथमिकताएं, जैसे कि वे कितनी आक्रामकता से कोडिंग करते हैं, कितने विशिष्ट होते हैं, और किसी कोड को न्यायसंगत ठहराने के लिए दस्तावेजीकरण की कितनी आवश्यकता होती है।

इस विचार का परीक्षण करने के लिए, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई जो इस शैली को माप सके। उन्होंने एक सरल रूब्रिक (rubric), या चेकलिस्ट बनाई, जिसमें दस अलग-अलग आयाम (dimensions) थे। कुछ आयामों में ऐसे प्रश्न थे जैसे, "क्या कोडर केवल मुख्य शिकायत सूचीबद्ध करता है, या वे उल्लेखित प्रत्येक समस्या को सूचीबद्ध करते हैं?" अन्य में पूछा गया, "क्या कोडर उल्लेखित दवा से किसी स्थिति का अनुमान लगाता है, या वे डॉक्टर द्वारा निदान को स्पष्ट रूप से घोषित करने की प्रतीक्षा करते हैं?" एक लार्ज लैंग्वेज मॉडल का उपयोग करते हुए, उन्होंने सैकड़ों रोगी नोट्स और उनके संबंधित कोड सूचियों का विश्लेषण किया और प्रत्येक डेटासेट को इन दस आयामों पर स्कोर किया। इस प्रक्रिया ने प्रत्येक कोडर समूह के लिए एक "स्टाइल प्रोफाइल" बनाया, जो अनिवार्य रूप से उनके सामूहिक व्यवहार को संख्याओं के एक सेट के रूप में सारांशित करता था जो उनके दृष्टिकोण का वर्णन करता था।

महत्वपूर्ण सफलता तब मिली जब शोधकर्ताओं ने इन स्टाइल प्रोफाइल्स का उपयोग कंप्यूटर मॉडल को निर्देशित करने के लिए किया। केवल कंप्यूटर को "यह नोट कोड करें" कहने के बजाय, उन्होंने एक विशिष्ट निर्देश ब्लॉक जोड़ा जो उस कोडर की शैली का वर्णन करता था जिसकी वे नकल करने की कोशिश कर रहे थे। उदाहरण के लिए, यदि लक्षित शैली "आक्रामक" (aggressive) थी, तो कंप्यूटर को पाठ में उल्लेखित प्रत्येक संभावित स्थिति को सूचीबद्ध करने के लिए कहा गया। यदि शैली "रूढ़िवादी" (conservative) थी, तो इसे केवल वही सूचीबद्ध करने के लिए कहा गया जो स्पष्ट रूप से पुष्ट था। परिणाम आश्चर्यजनक थे। जब कंप्यूटर को उस डेटा को कोड करने के लिए दिया गया स्टाइल प्रोफाइल मिला जो उसके मिलान में था, तो इसकी सटीकता नाटकीय रूप रूप से बढ़ गई। कई डेटासेट्स पर, एक मानक स्कोरिंग स्केल पर कंप्यूटर का प्रदर्शन 26 अंकों तक सुधरा। इसके विपरीत, जब कंप्यूटर को ऐसा स्टाइल प्रोफाइल दिया गया जो डेटा के साथ मेल नहीं खाता था—जैसे कि एक रूढ़िवादी को आक्रामक होने के लिए कहना, या इसके विपरीत—तो इसका प्रदर्शन 21 अंकों तक गिर गया।

यह निष्कर्ष बताता है कि जिसे पहले कंप्यूटर की चिकित्सा समझने में अक्षमता के रूप में दोषी ठहराया जाता था, वह वास्तव में कंप्यूटर का कोडर की आदतों को समझने में विफल होना था। शोधकर्ताओं ने पांच अलग-अलग डेटासेट्स, जिनमें आउटपेशेंट विजिट और इनपेशेंट अस्पताल रिकॉर्ड शामिल थे, में इसका परीक्षण किया और पाया कि यह प्रभाव लगभग हर पद्धति के लिए सत्य था। चाहे उन्होंने एक बुनियादी प्रॉम्प्ट का उपयोग किया हो या एक जटिल, बहु-चरणीय पाइपलाइन का, सही स्टाइल निर्देशों द्वारा निर्देशित करने पर परिणामों में लगातार सुधार हुआ। वास्तव में, एक सरल, बिना प्रशिक्षित कंप्यूटर मॉडल जो सही स्टाइल निर्देशों द्वारा निर्देशित था, एक अत्यधिक परिष्कृत, पूर्व-प्रशिक्षित मॉडल के समान ही अच्छा प्रदर्शन करता था जिसके पास ऐसा कोई मार्गदर्शन नहीं था। यह दर्शाता है कि कंप्यूटर पहले से ही चिकित्सा नियमों को जानता है; उसे बस यह जानने की आवश्यकता है कि एक विशिष्ट संदर्भ में नियमों के किस संस्करण को लागू करना है।

अध्ययन ने यह भी प्रकट किया कि यह "शैली" केवल यादृच्छिक शोर नहीं, बल्कि डेटा स्रोत का एक गुण है। जब शोधकर्ताओं ने विभिन्न अस्पतालों और कोडिंग टीमों के स्टाइल प्रोफाइल्स को विज़ुअलाइज़ किया, तो उन्होंने देखा कि प्रोफाइल स्रोत के आधार पर एक साथ क्लस्टर (समूहित) होते हैं। एक अस्पताल जो निदान के बारे में बहुत विशिष्ट होने की प्रवृत्ति रखता था, उसका एक विशिष्ट प्रोफाइल था जो दूसरे अस्पताल से भिन्न था जो व्यापक, कम विशिष्ट कोड पसंद करता था। इस क्लस्टरिंग ने पुष्टि की कि शैली एक वास्तविक, मापने योग्य विशेषता है कि एक चिकित्सा समूह कैसे कार्य करता है। हालाँकि, शोधकर्ताओं ने यह भी नोट किया कि उनका दस-बिंदु वाला चेकलिस्ट पूरे परिदृश्य का पूर्ण मानचित्र नहीं था। एक विशिष्ट मामले में, जिसमें दो टीमों के बीच उनके 27 प्रतिशत कोड पर असहमति थी, चेकलिस्ट इस अंतर को पूरी तरह से स्पष्ट नहीं कर सका, जिससे पता चलता है कि अभी भी छिपे हुए शैलीगत आयाम हैं जिन्हें उनके वर्तमान उपकरण नहीं देख सकते। इसके अलावा, इनपेशेंट अस्पताल रिकॉर्ड के लिए यह दृष्टिकोण कम प्रभावी रहा, जहाँ प्रति रोगी कोड की भारी मात्रा ने उनके द्वारा डिजाइन किए गए सरल पैमाने को प्रभावित किया।

अंततः, यह कार्य चिकित्सा को स्वचालित रूप से कोडिंग करने के तरीके के बारे में हमारी सोच को फिर से परिभाषित करता है। यह सुझाव देता है कि लक्ष्य हर कंप्यूटर को एक एकल, कठोर "गोल्ड स्टैंडर्ड" सूची से मेल खाने के लिए मजबूर करना नहीं होना चाहिए, बल्कि यह पहचानना होना चाहिए कि विभिन्न चिकित्सा परिवेशों में देखभाल के दस्तावेजीकरण में वैध, व्यवस्थित अंतर होते हैं। इन शैलियों को मापकर और उनके अनुकूल होकर, कंप्यूटर बहुत अधिक सटीक हो सकते हैं। शोधकर्ता निष्कर्ष निकालते हैं कि मानव और मशीन के प्रदर्शन के बीच का अंतर केवल बुद्धिमत्ता या प्रशिक्षण का मामला नहीं है, बल्कि संरेखण (alignment) का मामला है। यदि हम मशीन को दस्तावेजीकरण की वही "भाषा" बोलने में सक्षम बना सकते हैं जो मानव कोडर बोलता है, तो हम उस महत्वपूर्ण सटीकता को पुनः प्राप्त कर सकते हैं जिसे पहले त्रुटि माना जाता था। इसका अर्थ यह नहीं है कि कंप्यूटर अनुमान लगा रहा है; इसका अर्थ यह है कि कंप्यूटर अंततः सही निर्देशों को सुन रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →