← नवीनतम पेपर
🤖 AI

End-to-End Evaluation and Governance of an EHR-Embedded AI Agent for Clinicians

यह शोध पत्र हाइपरस्क्राइब (Hyperscribe), जो एक EHR-एम्बेडेड एआई एजेंट है, के निरंतर मूल्यांकन और सुधार के लिए एक एंड-टू-एंड गवर्नेंस फ्रेमवर्क प्रस्तुत करता है, जो नियंत्रित प्रयोगों और लाइव फीडबैक के माध्यम से यह प्रदर्शित करता है कि पुनरावृत्ति निगरानी और इंजीनियरिंग हस्तक्षेपों ने उच्च विश्वसनीयता बनाए रखते हुए नैदानिक प्रदर्शन स्कोर को 84% से बढ़ाकर 95% करने में सफलतापूर्वक वृद्धि की।

मूल लेखक: Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बहुत ही स्मार्ट रोबोटिक असिस्टेंट बनाया है जो डॉक्टर के कंप्यूटर सिस्टम के अंदर बैठा है। इसका काम डॉक्टर और मरीज के बीच होने वाली बातचीत को सुनना और फिर मरीज की फाइल के लिए आधिकारिक मेडिकल नोट्स अपने आप लिखना है। यह वह हाइपरस्क्राइब (Hyperscribe) एजेंट है जिसका वर्णन इस शोध पत्र (paper) में किया गया है।

लेकिन यहाँ एक समस्या है: यदि आप इस रोबोट को बस चालू कर देते हैं और उम्मीद करते हैं कि यह काम करेगा, तो यह ऐसी गलतियाँ कर सकता है जो खतरनाक हो सकती हैं। यह शोध पत्र तर्क देता है कि आप इसे सिर्फ "सेट करके भूल नहीं सकते" (set it and forget it)। इसके बजाय, आपको इसे देखने, परीक्षण करने, सुधारने और यह सुनिश्चित करने के लिए कि यह हर दिन बेहतर होता रहे, एक निरंतर प्रबंधन प्रणाली (जिसे "गवर्नेंस" या शासन कहा जाता है) की आवश्यकता है।

लेखकों ने इसे कैसे किया, इसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. "गवर्नेंस लूप": एक निरंतर गुणवत्ता नियंत्रण मशीन

इस प्रणाली को एक उच्च श्रेणी के रेस्तरां की रसोई की तरह समझें जो कभी बंद नहीं होती।

  • शेफ (AI): रोबोट नोट्स लिखता है।
  • टेस्टर्स (रूब्रिक्स/मानदंड): ग्राहक तक खाना पहुँचने से पहले, विशेषज्ञ शेफ (डॉक्टर) हर एक व्यंजन के लिए एक विशिष्ट चेकलिस्ट बनाते हैं। वे परिभाषित करते हैं कि उस विशिष्ट भोजन के लिए "परफेक्ट" क्या दिखता है।
  • डाइनर्स (लाइव फीडबैक): अस्पताल में इस सिस्टम का उपयोग करने वाले वास्तविक डॉक्टर नोट्स वापस भेजते हैं कि, "सूप बहुत नमकीन था" या "स्टेक एकदम सही था।"
  • मैनेजर (फ्रेमवर्क): सिस्टम टेस्टर्स की चेकलिस्ट और डाइनर्स की शिकायतों को लेता है, एक नियंत्रित प्रयोग चलाता है ताकि यह देखा जा सके कि क्या नया नुस्खा (recipe) बेहतर काम करता है, और उसके बाद ही मेनू को अपडेट करता है।

शोध पत्र का दावा है कि उन्होंने इस पूरे लूप को एक मेडिकल AI के लिए बनाया। उन्होंने इसे केवल एक बार टेस्ट नहीं किया; उन्होंने इस लूप को महीनों तक चलाया, लगातार नए डेटा को सिस्टम में डाला ताकि इसमें सुधार किया जा सके।

2. सिस्टम के चार स्तंभ

लेखक कहते हैं कि आपको इस रोबोट को प्रबंधित करने के लिए चार विशिष्ट उपकरणों की आवश्यकता है, ठीक वैसे ही जैसे एक पायलट को विमान उड़ाने के लिए चार उपकरणों की आवश्यकता होती है:

  • नियम पुस्तिका (रूब्रिक वैलिडेशन): "क्या यह नोट अच्छा है?" पूछने के बजाय, उन्होंने पूछा, "क्या यह नोट इस मरीज के लिए विशिष्ट नियमों को पूरा करता है?" उन्होंने 20 डॉक्टरों से 1,600 से अधिक नियम पुस्तिकाएं लिखवाईं। यह एक सख्त ग्रेडिंग सिस्टम के रूप में कार्य करता है।
  • शिकायत पेटी (लाइव फीडबैक): उन्होंने देखा कि वास्तविक डॉक्टरों ने टूल का उपयोग कैसे किया। उन्होंने पाया कि शुरुआत में, डॉक्टर मुख्य रूप से त्रुटियों (जैसे, रोबोट द्वारा यह भ्रमित करना कि किसने क्या कहा) के बारे में शिकायत करते थे। लेकिन जैसे-जैसे इंजीनियरों ने चीजों को ठीक किया, शिकायतें प्रशंसा और नए फीचर्स के अनुरोधों में बदल गईं।
  • स्पीडोमीटर (तकनीकी निगरानी): उन्होंने ट्रैक किया कि रोबोट कितनी तेजी से काम करता है और वह कितनी बार क्रैश होता है। उन्होंने पाया कि भले ही रोबोट लड़खड़ाया हो, एक "सेफ्टी नेट" (रीट्राई मैकेनिज्म) ने त्रुटि को पकड़ लिया और उसे 9% बार ठीक कर दिया, जिससे डॉक्टर को मुश्किल से पता भी चला।
  • वॉलेट (लागत ट्रैकिंग): उन्होंने एक सख्त बहीखाता रखा कि सब कुछ कितना पैसा और समय खर्च कर रहा है। उन्होंने पाया कि मानव डॉक्टरों से नियम पुस्तिकाएं लिखवाना महंगा था, लेकिन वे समान परिणामों के साथ 1/1000वें हिस्से की लागत पर एक सस्ते AI का उपयोग करके नियम पुस्तिकाएं लिख सकते थे।

3. परिणाम: "टूटे हुए" से "शानदार" तक

शोध पत्र तेजी से सुधार की कहानी प्रस्तुत करता है:

  • शुरुआत: जब उन्होंने पहली बार रोबोट का परीक्षण किया, तो उसे "B" ग्रेड (उनके परीक्षणों पर लगभग 84%) मिला।
  • सुधार: उन्होंने फीडबैक लूप का उपयोग किया। जब डॉक्टरों ने कहा, "प्लान सेक्शन बहुत छोटा है," तो इंजीनियरों ने रोबोट के निर्देशों को फिर से लिखा। जब डॉक्टरों ने कहा, "इसने मरीज के पिता को मरीज के साथ भ्रमित कर दिया," तो उन्होंने रोबोट के सुनने वाले सॉफ्टवेयर को अपग्रेड किया।
  • अंत: सात राउंड के परीक्षण और सुधार के बाद, रोबोट का स्कोर बढ़कर "A" (95%) हो गया।
  • बदलाव: शुरुआत में, डॉक्टरों की 79% प्रतिक्रिया नकारात्मक (त्रुटियां) थी। अंत तक, केवल 30% नकारात्मक थी, और 45% सकारात्मक प्रशंसा थी। इसने साबित किया कि सिस्टम वास्तव में काम कर रहा था।

4. सीक्रेट सॉस: "व्याख्यात्मक" (Explainable) चरण

यह रोबोट अन्य AI टूल्स की तुलना में सुधारने में आसान क्यों था? लेखक कहते हैं क्योंकि रोबोट केवल अंतिम नोट नहीं थमाता है। यह काम को चार स्पष्ट चरणों में विभाजित करता है, जैसे एक असेंबली लाइन:

  1. सुनना: ऑडियो को टेक्स्ट में बदलना।
  2. समझना: डॉक्टर का इरादा क्या था (जैसे, "दवा निर्धारित करना")।
  3. विवरण: विशिष्ट नंबर और कोड भरना।
  4. कार्य करना: कंप्यूटर को अंतिम कमांड लिखना।

क्योंकि रोबोट यह काम चरण-दर-चरण करता है, इसलिए यदि वह कोई गलती करता है, तो इंजीनियरों को पता होता है कि कौन सा चरण टूट गया है। यह बिल्कुल वैसा ही है जैसे यदि एक कार खराब हो जाती है, तो आप जानते हैं कि यह इंजन, टायर या ब्रेक की समस्या है, बजाय इसके कि केवल यह कहें कि "कार खराब है।" यह इसे तेज़ और सुरक्षित बनाता है।

5. निचोड़ (The Bottom Line)

शोध पत्र निष्कर्ष निकालता है कि मेडिकल AI बनाना केवल एक स्मार्ट मॉडल बनाना नहीं है; यह उस मॉडल को प्रबंधित करने के लिए एक सिस्टम बनाना है।

उन्होंने साबित किया कि यदि आप सख्त नियम पुस्तिकाओं, वास्तविक समय के फीडबैक, तकनीकी निगरानी और लागत जांच को मिलाते हैं, तो आप एक मेडिकल AI को "ठीक-ठाक" से "उत्कृष्ट" बना सकते हैं और उसे वहीं बनाए रख सकते हैं। उन्होंने दिखाया कि यह केवल एक सिद्धांत नहीं है; उन्होंने वास्तव में इसे किया, वास्तविक समस्याओं को ठीक किया, और इसे उपयोग करने वाले डॉक्टरों के लिए टूल को बेहतर बनाया।

उन्होंने क्या दावा नहीं किया:

  • उन्होंने यह दावा नहीं किया कि यह रोबोट डॉक्टरों की जगह लेता है।
  • उन्होंने यह दावा नहीं किया कि यह चिकित्सा की हर एक विशेषता (specialty) के लिए काम करता है (उन्होंने विशिष्ट मामलों पर परीक्षण किया)।
  • उन्होंने यह दावा नहीं किया कि यह सिस्टम हमेशा के लिए पूर्ण है; उन्होंने इस बात पर जोर दिया कि गुणवत्ता बनाए रखने के लिए यह "गवर्नेंस लूप" हमेशा चलता रहना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →