← नवीनतम पेपर
📄 medicine

Prospective Deployment of Multimodal AI Grading for Medical Student OSCEs

यह शोध पत्र MAPLES के पहले भावी परिनियोजन (prospective deployment) की रिपोर्ट करता है, जो एक मल्टीमॉडल एआई प्रणाली है जिसने मेडिकल छात्रों के OSCEs को ग्रेड करने के लिए नोट्स, ऑडियो और वीडियो को सफलतापूर्वक एकीकृत किया, जो मानव समीक्षकों के साथ उच्च सहमति और स्वचालित स्कोरिंग तथा लक्षित मानव समीक्षा के एक हाइब्रिड मॉडल के माध्यम से मैनुअल स्कोरिंग कार्यभार में 92.3% की कमी प्रदर्शित करता है।

मूल लेखक: Huong-Tra Ngo, Ameer Hamza Shakur, Michael Holcomb, Shinyoung Kang, David Hein, Judah Gruen, Hunter Schuler, Philip Jarrett, Thomas Dalton, Krystle Campbell, Daniel Scott, Andrew R. Jamieson

प्रकाशित 2026-08-04
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Huong-Tra Ngo, Ameer Hamza Shakur, Michael Holcomb, Shinyoung Kang, David Hein, Judah Gruen, Hunter Schuler, Philip Jarrett, Thomas Dalton, Krystle Campbell, Daniel Scott, Andrew R. Jamieson

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: चिकित्सा छात्रों के OSCE के लिए मल्टीमॉडल AI ग्रेडिंग का संभावित परिनियोजन

समस्या विवरण

ऑब्जेक्टिव स्ट्रक्चर्ड क्लिनिकल एग्जामिनेशन (OSCE) चिकित्सा शिक्षा में नैदानिक सक्षमता के मूल्यांकन के लिए स्वर्ण मानक है, जो इतिहास लेने (history-taking), शारीरिक परीक्षण, संचार और तर्क करने की क्षमता का मूल्यांकन करता है। हालाँकि, पारंपरिक OSCE प्रशासन संसाधन-गहन है, जिसमें प्रशिक्षित मूल्यांकनकर्ताओं, मैनुअल रूब्रिक स्कोरिंग और पर्याप्त मानव समय की आवश्यकता होती है। लेखकों के संस्थान (UT Southwestern) में, केवल पोस्ट-एनकाउंटर दस्तावेज़ीकरण के मैनुअल ग्रेडिंग के लिए सालाना लगभग 1,120 घंटे और $56,000 की आवश्यकता थी। ये बाधाएं मूल्यांकन की आवृत्ति को सीमित करती हैं, शिक्षार्थियों तक फीडबैक मिलने में देरी करती हैं (अक्सर महीनों तक), और रचनात्मक मूल्यांकन के विस्तार में बाधा डालती हैं। जबकि लार्ज लैंग्वेज मॉडल्स (LLMs) ने लिखित प्रतिक्रियाओं को ग्रेड करने में आशाजनक प्रदर्शन दिखाया है, व्यापक OSCE मूल्यांकन के लिए टेक्स्ट, ऑडियो और वीडियो का एक साथ मूल्यांकन करना आवश्यक है। मौजूदा ऑफ-द-शेल्फ मल्टीमॉडल मॉडल्स ने सूक्ष्म नैदानिक मूल्यांकन में सीमाएं दिखाई हैं, और बड़े पैमाने पर, भावी शैक्षिक परिनियोजन से साक्ष्य दुर्लभ हैं।

कार्यप्रणाली

लेखक MAPLES (मल्टीमॉडल असेसमेंट पाइपलाइन फॉर लर्निंग एनकाउंटर स्कोरिंग) के पहले भावी परिनियोजन की रिपोर्ट करते हैं, जो एक रूब्रिक-संचालित, ज़ीरो-शॉट AI सिस्टम है, जिसे UT Southwestern मेडिकल सेंटर में फॉल 2025 OSCE प्रशासन के दौरान उपयोग किया गया।

सिस्टम आर्किटेक्चर और वर्कफ़्लो

  • डेटा अंतर्ग्रहण (Data Ingestion): सिस्टम ने 222 द्वितीय वर्ष के मेडिकल छात्रों के पांच स्टेशनों से तीन सिंक्रोनाइज़्ड डेटा स्ट्रीम को ग्रहण किया: लिखित क्लिनिकल नोट्स, एनकाउंटर ऑडियो, और सिंक्रोनाइज़्ड थ्री-कैमरा वीडियो (पेशेंट-फेसिंग, फिजिशियन-फेसिंग, और ओवरहेड)।
  • ग्रेडिंग लॉजिक: MAPLES ने एक ज़ीरो-शॉट दृष्टिकोण का उपयोग किया। फैकल्टी द्वारा तैयार किए गए रूब्रिक्स (स्ट्रक्चर्ड एक्सेल फाइलें) अपलोड किए गए, और सिस्टम ने प्रत्येक आइटम के लिए प्रॉम्प्ट्स को गतिशील रूप से बनाया। कोई भी टास्क-विशिष्ट फाइन-ट्यूनिंग या फ्यू-शॉट उदाहरण प्रदान नहीं किए गए।
    • टेक्स्ट: नोट्स को प्लेन टेक्स्ट के रूप में प्रोसेस किया गया।
    • ऑडियो: मौखिक सामग्री, टोन और तालमेल (rapport) का मूल्यांकन करने के लिए ऑडियो को मध्यवर्ती ट्रांसक्रिप्शन के बिना सीधे प्रोसेस किया गया।
    • वीडियो: एक स्वचालित प्रीप्रोसेसिंग स्टेप (ज़ीरो-शॉट सेगमेंटेशन का उपयोग करके) ने फिजिकल एग्जामिनेशन सेगमेंट को ग्रेडिंग से पहले अलग किया।
  • मॉडल कॉन्फ़िगरेशन: सिस्टम ने इंफरेंस के लिए Gemini 2.5 Pro (Google DeepMind) का उपयोग किया, जिसमें टेम्परेचर 0 और टॉप-p 1 था, और यह सुनिश्चित करने के लिए स्ट्रक्चर्ड-आउटपुट कंस्ट्रेंट्स का उपयोग किया गया कि स्कोर रूब्रिक स्कीमा का पालन करें। वीडियो सेगमेंटेशन के लिए Gemini 2.5 Flash का उपयोग किया गया।
  • ह्यूमन-इन-द-लूप वर्कफ़्लो:
    1. प्रथम-पास AI स्कोरिंग: AI ने सभी 72,907 रिटेन्ड आइटम-लेवल स्कोर किए।
    2. रूटिंग: निचले 5% (नोट्स) या निचले 10% (ऑडियो/वीडियो) वाले शिक्षार्थियों को स्वतंत्र मानव समीक्षा के लिए रूट किया गया।
    3. ब्लाइंडेड SPE समीक्षा: स्टैंडर्डाइज्ड पेशेंट इवैल्यूएटर्स (SPEs) ने रूट किए गए आइटम्स को AI स्कोर से अनभिज्ञ रहते हुए स्वतंत्र रूप से दोबारा स्कोर किया।
    4. एडजुडिकेशन (Adjudication): वे आइटम्स जहाँ AI और SPE के स्कोर एक पूर्व-निर्धारित टॉलरेंस (बाइनरी के लिए सटीक मिलान; ऑर्डिनल के लिए \le1 श्रेणी का अंतर) से अधिक भिन्न थे, उन्हें अंतिम निर्णय के लिए फिजिशियन विशेषज्ञों के पास भेजा गया। चिकित्सकों ने दोनों स्कोर और स्रोत साक्ष्य की समीक्षा की।

अध्ययन डिजाइन

  • कोहोर्ट: 222 छात्र, 10 स्टेशन फॉर्म, प्रति छात्र 330–333 असेसमेंट आइटम।
  • रिव्यू सेट: 28 अद्वितीय शिक्षार्थी समीक्षा के लिए रूट किए गए (12 नोट्स के लिए, 23 ऑडियो/वीडियो के लिए, 7 दोनों के लिए)।
  • एडजुडिकेशन सेट: 616 वास्तविक मतभेदों (डेटा/रूब्रिक त्रुटियों को छोड़कर) की समीक्षा चिकित्सकों द्वारा की गई।
  • गवर्नेंस: एक बहुविषयक पर्यवेक्षी समिति ने मॉडल चयन, थ्रेशोल्ड और परिनियोजन चक्रों की निगरानी की, जिससे निरंतर सुधार सुनिश्चित हुआ।

मुख्य परिणाम

सहमति और एडजुडिकेशन

  • AI–SPE सहमति: रूट किए गए लो-स्कोरिंग रिव्यू सेट में, टॉलरेंट एग्रीमेंट (ऑर्डिनल आइटम्स के लिए एक-श्रेणी के अंतर की अनुमति देते हुए) उच्च था: नोट्स के लिए 85.7%, ऑडियो के लिए 89.2%, और वीडियो के लिए 92.4%। सटीक सहमति (Exact agreement) कम थी (कुल मिलाकर 72.0%), जो ऑडियो/वीडियो स्कोरिंग की जटिलता के कारण थी।
  • फिजिशियन एडजुडिकेशन: 616 एस्केलेटेड मतभेदों में से, फिजिशियन विशेषज्ञों ने AI स्कोर के साथ 76.0% बार, SPE स्कोर के साथ 19.0% बार, और किसी के साथ नहीं (5.0%) मेल खाया। AI के प्रति यह प्राथमिकता सभी मोडैलिटीज में बनी रही, हालांकि यह नोट्स के लिए सबसे अधिक (81.6%) और वीडियो के लिए सबसे कम (51.5%) थी।
  • असहमति की दिशा: चिकित्सक AI के पक्ष में होने की अधिक संभावना रखते थे, चाहे AI का स्कोर SPE से अधिक हो या कम, जो यह दर्शाता है कि AI केवल स्कोर को बढ़ा-चढ़ाकर नहीं दिखा रहा था।

त्रुटि विश्लेषण (Error Analysis)

  • SPE त्रुटियां: SPE त्रुटियों के प्राथमिक कारक "साक्ष्य की अनदेखी" (35.1%) और "नैदानिक ज्ञान" (24.4%) थे, जो अक्सर शब्दावली में सिमेंटिक समानता को पहचानने में विफल रहे।
  • AI त्रुटियां: AI त्रुटियों के प्राथमिक कारक "ओवर परमिसिव स्कोरिंग" (37.8%) और "गलत डॉक्यूमेंटेशन प्लेसमेंट" (25.2%) थे, जहाँ AI ने गलत नोट सेक्शन में लिखे गए सही उत्तरों को क्रेडिट दिया। एक छोटा हिस्सा (9.4%) "निर्मित साक्ष्य" (Hallucinations) से संबंधित था।
  • रूब्रिक की गुणवत्ता: दोनों (मानव और AI) के लिए त्रुटियों में "रूब्रिक की विशिष्टता की कमी" एक बार-बार आने वाला योगदानकर्ता था, जो सटीक रूब्रिक डिजाइन की आवश्यकता को रेखांकित करता है।

परिचालन दक्षता (Operational Efficiency)

  • कार्यभार में कमी: AI-सहायता प्राप्त वर्कफ़्लो में 5,616 मानव स्कोरिंग पास की आवश्यकता हुई, जबकि एक काउंटरफैक्चुअल सिंगल-पास मैनुअल वर्कफ़्लो में 72,907 की आवश्यकता होती। यह मानव स्कोरिंग प्रयास में 92.3% की कमी को दर्शाता है।
  • टर्नअराउंड टाइम: परीक्षा से ग्रेड रिपोर्ट मिलने का समय कई महीनों से घटकर दो सप्ताह से कम हो गया।
  • लागत: अनुमानित मार्जिनल इंफरेंस लागत **1.73प्रतिएनकाउंटर(1.73 प्रति एनकाउंटर** (0.12 नोट्स, 0.28ऑडियो,0.28 ऑडियो, 1.31 वीडियो) थी, जिसमें फिक्स्ड डेवलपमेंट कॉस्ट शामिल नहीं है।

महत्व और दावे

यह पेपर दावा करता है कि यह अंडरग्रेजुएट मेडिकल एजुकेशन में OSCE ग्रेडिंग के लिए एक एकीकृत मल्टीमॉडल AI सिस्टम का पहला भावी परिनियोजन प्रस्तुत करता है। लेखक इस बात पर जोर देते हैं कि प्राथमिक योगदान मानव निर्णय को हटाना नहीं है, बल्कि मानव प्रयास का पुनर्वितरण है।

  • परिचालन व्यवहार्यता: अध्ययन प्रदर्शित करता है कि मल्टीमॉडल AI को नियमित OSCE संचालन में शामिल किया जा सकता है, जो पूरे कोहोर्ट के लिए प्रथम-पास स्कोरिंग को संभाल सकता है और मानव समीक्षा को उस "लो-स्कोरिंग टेल" पर केंद्रित कर सकता है जहाँ सुधार (remediation) सबसे महत्वपूर्ण है।
  • विशेषज्ञ संरेखण (Expert Alignment): यह निष्कर्ष कि चिकित्सक एडजुडिकेटेड मतभेदों में SPE स्कोर की तुलना में AI स्कोर को प्राथमिकता देते हैं, यह सुझाव देता है कि AI सिस्टम नैदानिक बारीकियों को पकड़ता है जो विशेषज्ञ नैदानिक निर्णय के साथ निकटता से संरेखित है, जो पारंपरिक SPE मूल्यांकन की तुलना में बेहतर निरंतरता प्रदान कर सकता है।
  • प्रणालीगत सुधार: परिनियोजन ने यथास्थिति के प्रणालीगत मुद्दों को उजागर किया, जिसमें मानव ग्रेडर की विश्वसनीयता, रूब्रिक की गुणवत्ता और प्रक्रियात्मक अक्षमताएं शामिल हैं। लेखक तर्क देते हैं कि AI शिक्षकों को "कैसे ग्रेड करें" (रूब्रिक और केस डिजाइन) के बजाय "किन कौशलों का मूल्यांकन करें" पर ध्यान केंद्रित करने के लिए मुक्त करता है।
  • स्केलेबिलिटी: ज़ीरो-शॉट, रूब्रिक-संचालित डिज़ाइन नए स्टेशनों या रूब्रिक संशोधनों के लिए ग्रेडिंग कौशल को मॉडल को फिर से प्रशिक्षित किए बिना स्थानांतरित करने की अनुमति देता है, जो मूल्यांकन की आवृत्ति और दायरे के विस्तार का समर्थन करता है।

लेखक सामान्यीकरण (generalizability) के संबंध में एक विनम्र लहजा बनाए रखते हैं, यह नोट करते हुए कि परिणाम एक विशिष्ट संस्थान के बुनियादी ढांचे और रूब्रिक्स के विशिष्ट हैं। वे सीमाओं को स्वीकार करते हैं, जिसमें पूर्ण कोहोर्ट के लिए ब्लाइंडेड एडजुडिकेशन की कमी, लो-स्कोरिंग टेल में विश्लेषण का संकेंद्रण, और जनसांख्यिकीय निष्पक्षता एवं हॉलुसिनेशन दरों के संबंध में और अधिक सत्यापन की आवश्यकता शामिल है। इस कार्य को एक शिक्षक-प्रबंधित, AI-संवर्धित मूल्यांकन प्रणालियों की ओर एक आधारभूत कदम के रूप में प्रस्तुत किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →