← नवीनतम पेपर
💻 computer science

CareLoop: Measuring the Gap Between Knowing Medicine and Practicing It in the Context of Patients' Lives

यह शोध पत्र CareLoop को प्रस्तुत करता है, जो एक क्लिनिकल-वर्ल्ड सैंडबॉक्स है जो एआई मॉडल्स की मरीजों के जीवन के जटिल संदर्भ के भीतर चिकित्सा अभ्यास करने की क्षमता का मूल्यांकन करता है, जो सिम्युलेटेड ट्रेजेक्टरीज (simulated trajectories) के माध्यम से छिपी हुई अवस्थाओं (hidden states) की खोज करने, बाधाओं के अनुकूल होने और परिणामों के प्रबंधन में उनके प्रदर्शन को मापकर यह प्रकट करता है कि निष्पादन-आधारित (execution-grounded) क्षमताएं केवल चिकित्सा तथ्यों को जानने की तुलना में विशिष्ट और अधिक चुनौतीपूर्ण हैं।

मूल लेखक: Zhenhong Yang, Jintao Fei, Jun Zhao

प्रकाशित 2026-09-25
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenhong Yang, Jintao Fei, Jun Zhao

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

चिकित्सा को अक्सर तथ्यों के एक संग्रह के रूप में पढ़ाया जाता है: लक्षणों की एक सूची, उपचारों का एक विवरण, और निदान के लिए नियमों का एक समूह। इस दृष्टिकोण में, एक डॉक्टर का काम स्मृति से सही उत्तर प्राप्त करना और उसे लागू करना है। लेकिन वास्तविक दुनिया में, चिकित्सा कोई पहेली नहीं है जिसका एक समाधान खोजा जाना बाकी है; यह एक व्यक्ति के साथ संवाद है जिसका जीवन, विश्वास और परिस्थितियाँ निरंतर आगे के मार्ग को नया आकार देती हैं। एक रोगी डॉक्टर के निर्देशों को गलत समझ सकता है, शर्म के कारण किसी दर्दनाक विवरण को छिपा सकता है, या बस निर्धारित परीक्षण कराने के लिए धन या परिवहन की कमी महसूस कर सकता है। एक चिकित्सा योजना जो कागज़ पर आदर्श दिखती है, वह विफल हो सकती है यदि वह इन मानवीय वास्तविकताओं को ध्यान में नहीं रखती है। आर्टिफिशियल इंटेलिजेंस (AI) के लिए चुनौती केवल सही चिकित्सा तथ्यों को जानना नहीं है, बल्कि उन तथ्यों को जानने और वास्तव में किसी व्यक्ति की मदद करने के बीच के जटिल, अप्रत्याशित स्थान को नेविगेट करना है।

शोधकर्ताओं ने लंबे समय से यह परीक्षण करने का प्रयास किया है कि क्या कंप्यूटर प्रोग्राम चिकित्सा संबंधी प्रश्नों के सही उत्तर दे सकते हैं। ये परीक्षण आमतौर पर एक सरल प्रश्न पूछते हैं: क्या AI सही निदान जानता है? हालाँकि, एक नया अध्ययन एक अलग प्रकार का परीक्षण पेश करता है, जो यह पूछता है कि क्या एक AI रोगी के जीवन के संदर्भ में चिकित्सा का अभ्यास कर सकता है। शोधकर्ताओं ने 'केयरलूप' (CareLoop) नामक एक सिम्युलेटेड वातावरण बनाया, जिसे यह मापने के लिए डिज़ाइन किया गया था कि चिकित्सा को जानने और चिकित्सा का अभ्यास करने के बीच क्या अंतर है। उन्हें AI को केवल लक्षणों की एक स्थिर सूची देने के बजाय, उन्होंने एक गतिशील दुनिया बनाई जहाँ रोगियों की अपनी यादें, विश्वास और सीमाएँ हैं। इस दुनिया में, जानकारी छिपी हुई है, साक्ष्य विलंबित हो सकते हैं, और AI द्वारा किए गए कार्यों के अपेक्षित परिणाम हमेशा नहीं मिलते। लक्ष्य यह देखना था कि क्या एक AI गुम जानकारी की खोज कर सकता है, गलतफहमियों को सुधार सकता है, वास्तविक दुनिया की बाधाओं के अनुकूल हो सकता है, और केवल बातचीत की शुरुआत में एक सही उत्तर देने के बजाय समय के साथ रोगी की देखभाल की जिम्मेदारी ले सकता है।

इस अध्ययन में वास्तविक, गुमनाम चिकित्सा रिकॉर्ड पर आधारित 120 विस्तृत परिदृश्य बनाए गए। प्रत्येक परिदृश्य एक अनुबंध की तरह था जिसने रोगी के स्वास्थ्य की छिपी हुई स्थिति, रोगी और उनके परिवार के विश्वासों और संभावित बाधाओं को परिभाषित किया। इन बाधाओं में रोगी द्वारा अपनी दवा को गलत याद रखना, लैब रिपोर्ट का देर से आना, परिवार के सदस्य द्वारा उपचार से इनकार करना, या रोगी का डॉक्टर से मिलने में असमर्थ होना जैसी चीजें शामिल थीं। शोधकर्ताओं ने फिर दस अलग-अलग AI मॉडलों को इन सिमुलेशन में डॉक्टर के रूप में कार्य करने के लिए कहा। मॉडलों को सिम्युलेटेड रोगियों और परिवारों के साथ बातचीत करनी थी, जिन्हें त्रुटिपूर्ण प्रोग्राम किया गया था: वे निर्देश भूल सकते थे, लक्षणों के बारे में झूठ बोल सकते थे, या भ्रमित हो सकते थे। AI को यह समझना था कि वास्तव में क्या हो रहा है, जानकारी को सत्यापित करना था, और रोगी को सुरक्षित परिणाम की ओर ले जाना था।

परिणामों ने उन मॉडलों के बीच एक स्पष्ट अंतर दिखाया जो केवल चिकित्सा तथ्यों को जानते थे और उन मॉडलों के बीच जो एक रोगी के जीवन की जटिलताओं को संभाल सकते थे। सबसे अच्छा प्रदर्शन करने वाले मॉडल, GPT-5.6 Sol ने वास्तविक दुनिया की बाधाओं को संभालने में उच्चतम स्कोर प्राप्त किया, हालांकि अगले स्तर के मॉडलों (GPT-5.4, DeepSeek-V4-Pro, और Qwen3.8-Max सहित) पर इसकी बढ़त सांख्यिकीय रूप से स्पष्ट नहीं थी क्योंकि उनके कॉन्फिडेंस इंटरवल ओवरलैप हो रहे थे। अध्ययन से पता चला कि शीर्ष मॉडल भी विशिष्ट कार्यों में संघर्ष करते हैं। सभी मॉडलों के लिए सबसे बड़ी चुनौती 'हिडन स्टेट्स' (छिपी हुई स्थितियों) की खोज करना था—उन तथ्यों का पता लगाना जो रोगी ने स्वयं साझा नहीं किए थे या जो पृष्ठभूमि में दबे हुए थे, जिसे पेपर में सबसे बड़ा साझा 'बॉटलनेक' (अवरोध) बताया गया है। एक अन्य सामान्य विफलता "एक्शन-टू-इम्पैक्ट" (कार्य-से-प्रभाव) अंतराल थी: मॉडल अक्सर एक कार्य करते थे, जैसे कि परीक्षण का सुझाव देना, लेकिन यह सुनिश्चित करने में विफल रहते थे कि परीक्षण वास्तव में किया गया है या परिणामों का पालन किया गया है। कई मामलों में, AI ने बातचीत को समाप्त घोषित कर दिया जबकि रोगी की समस्या वास्तव में हल नहीं हुई थी, जिसे 'प्रिमैच्योर क्लोजर' (असमय समापन) के रूप में जाना जाता है।

अध्ययन ने यह भी तुलना की कि AI मॉडल मानव डॉक्टरों के मुकाबले कितने बेहतर प्रदर्शन करते हैं। 139 चिकित्सकों के एक पैनल ने समान सिम्युलेटेड मामलों की समीक्षा की और AI मॉडलों को रैंक किया। जबकि व्यक्तिगत डॉक्टर कभी-कभी आपस में असहमत थे, और कभी-कभी AI मूल्यांकनकर्ताओं से भी असहमत थे, मॉडलों की समग्र रैंकिंग उल्लेखनीय रूप से स्थिर थी। जब शोधकर्ताओं ने समग्र परिणामों को देखा, तो मानव डॉक्टरों और AI न्यायाधीशों के बीच इस बात पर सहमति थी कि कौन से मॉडल सर्वश्रेष्ठ और कौन से सबसे खराब थे। यह सुझाव देता है कि नया परीक्षण तरीका विभिन्न स्तर की क्षमताओं के बीच अंतर करने के लिए पर्याप्त विश्वसनीय है, भले ही कार्य जटिल हो और मूल्यांकन व्यक्तिपरक हो।

सबसे महत्वपूर्ण निष्कर्षों में से एक यह था कि बातचीत को जल्दी समाप्त करना अच्छी देखभाल प्रदान करने के समान नहीं है। कई AI मॉडलों ने अपनी बातचीत को जल्दी समाप्त कर दिया, कार्य को पूर्ण घोषित कर दिया, भले ही रोगी के पास अभी भी अनसुलझे जोखिम या unverified (असत्यापित) जानकारी शेष थी। सर्वश्रेष्ठ मॉडल वे थे जो जानते थे कि कब एक प्रकरण (एपिसोड) को खुला रखना है, और जब तक स्थिति वास्तव में सुरक्षित न हो जाए तब तक जिम्मेदारी बनाए रखनी है। यह अंतर इस बात पर प्रकाश डालता है कि हमें चिकित्सा AI का मूल्यांकन कैसे करना चाहिए। केवल एक सिस्टम का प्रवाहपूर्ण होना या अलग से सही निदान देना पर्याप्त नहीं है। चिकित्सा सेटिंग में वास्तविक सक्षमता के लिए अनिश्चितता को प्रबंधित करने, यह सत्यापित करने कि योजनाएं कार्यान्वित की गई हैं, और जब मार्ग स्पष्ट न हो तब भी रोगी के कल्याण के लिए जवाबदेह रहने की क्षमता की आवश्यकता होती है।

शोधकर्ता इस बात पर जोर देते हैं कि ये परिणाम एक सिमुलेशन से आए हैं, न कि किसी वास्तविक अस्पताल से। यह अध्ययन यह सिद्ध नहीं करता है कि ये AI मॉडल मरीजों का इलाज करने के लिए तैयार हैं या वे नैदानिक उपयोग के लिए सुरक्षित हैं। इसके बजाय, यह इस बात को मापने का एक तरीका प्रदान करता है कि वे उस लक्ष्य के कितने करीब हैं। यह उजागर करके कि AI किन विशिष्ट तरीकों से विफल होता है, यह अध्ययन सुधार के लिए एक रोडमैप प्रदान करता है। यह दर्शाता है कि अगली पीढ़ी के चिकित्सा AI को सुनने, सत्यापित करने और यह समझने में बेहतर होना चाहिए कि एक रोगी का जीवन ऐसी बाधाओं से भरा है जिन्हें कोई भी पाठ्यपुस्तक ज्ञान स्वतः ही दूर नहीं कर सकता। आगे का रास्ता केवल AI को स्मार्ट बनाने के बारे में नहीं है, बल्कि इसे किसी व्यक्ति के स्वास्थ्य यात्रा की जटिलताओं के माध्यम से उसके साथ चलने में अधिक सक्षम बनाने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →