← नवीनतम पेपर
🤖 machine learning

Learning from Disagreement: Clinician Overrides as Implicit Preference Signals for Clinical AI in Value-Based Care

यह शोध पत्र एक औपचारिक ढांचे का प्रस्ताव करता है जो नैदानिक ओवरराइड (clinician overrides) को एआई अनुशंसाओं के प्रति निहित प्राथमिकता संकेतों के रूप में पुनर्गठित करता है, जिसमें एक दोहरी-शिक्षण वास्तुकला और ओवरराइड वर्गीकरण पेश किया गया है ताकि विविध नैदानिक क्षमताओं के कारण होने वाले दमन पूर्वाग्रह (suppression bias) को कम करते हुए वैल्यू-बेस्ड केयर में रोगी परिणामों के अनुरूप रिवॉर्ड मॉडल को प्रशिक्षित किया जा सके।

मूल लेखक: Prabhjot Singh, Abhishek Gupta, Chris Betz, Abe Flansburg, Brett Ives, Sudeep Lama, Jung Hoon Son

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Prabhjot Singh, Abhishek Gupta, Chris Betz, Abe Flansburg, Brett Ives, Sudeep Lama, Jung Hoon Son

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को एक आदर्श भोजन बनाना सिखाने की कोशिश कर रहे हैं। अतीत में, यदि रोबोट नमक डालने का सुझाव देता और शेफ कहता, "नहीं, यह बहुत अधिक है," तो रोबोट सोचता, "ओह, मैं गलत था। मुझे नमक का सुझाव देना बंद कर देना चाहिए।"

यह पेपर तर्क देता है कि इस तरह से सीखना गलत तरीका है। सुझाव देने के बजाय कि डॉक्टर ने "नहीं" क्यों कहा, हमें इसे एक गुप्त संदेश के रूप में देखना चाहिए।

यहाँ पेपर के विचारों का सरल विवरण दिया गया है:

1. "नहीं" वास्तव में एक खजाने का नक्शा है

अस्पतालों में, डॉक्टर अक्सर कंप्यूटर सिस्टम द्वारा दिए गए सुझावों को अनदेखा करते हैं या बदल देते हैं। आमतौर पर, टेक कंपनियाँ इसे एक विफलता मानती हैं—एक संकेत कि कंप्यूटर परेशान कर रहा है या गलत है।

यह पेपर कहता है: इसे विफलता मानना बंद करें। इसे एक समृद्ध डेटा सिग्नल के रूप में देखें।

  • पुराना तरीका: "डॉक्टर ने AI की सलाह को खारिज कर दिया। AI खराब है।"
  • नया तरीका: "डॉक्टर ने सलाह को खारिज कर दिया। क्यों? क्या सलाह वास्तव में गलत थी? या डॉक्टर केवल इसे करने में पर्याप्त आश्वस्त नहीं था? या अस्पताल के नियम अलग थे?"

हर बार जब एक डॉक्टर किसी सिफारिश को बदलता है, तो वह AI को एक लेबल वाला सबक दे रहा होता है: "इस विशिष्ट स्थिति में, इस विशिष्ट डॉक्टर के साथ, मैं उस क्रिया के बजाय इस क्रिया को पसंद करता हूँ।"

2. तीन प्रकार के शेफ ("क्षमता" की समस्या)

यह पेपर यह समझाने के लिए तीन अलग-अलग डॉक्टरों (या शेफ) की कहानी का उपयोग करता है कि हम "हाँ" और "नहीं" के वोटों को समान रूप से क्यों नहीं गिन सकते। कल्पना कीजिए कि एक नया हृदय रोग की दवा शुरू करने का सुझाव दिया गया है:

  • शेफ A (मास्टर): रेसिपी को पूरी तरह से जानता है। वह सामग्री की जाँच करता है, देखता है कि यह सुरक्षित है, और कहता है, "हाँ, चलो इसे करते हैं।" यह एक विश्वसनीय "हाँ" है।
  • शेफ B (अपेंटिस/शिक्षु): जानता है कि रेसिपी अच्छी है लेकिन उसने इसे अकेले कभी नहीं बनाया है। वे डरते हैं कि वे इसे बिगाड़ देंगे, इसलिए वे कहते, "नहीं, चलो हेड शेफ (विशेषज्ञ) को बुलाते हैं।" यह एक अस्वीकृति है, लेकिन यह इसलिए नहीं है क्योंकि रेसिपी खराब है। यह इसलिए है क्योंकि शेफ के पास इसे करने का कौशल नहीं है।
  • शेफ C (रोबोट): बिना सोचे-समझे हर चीज़ को "हाँ" कहता है। यह सहमति जैसा दिखता है, लेकिन वास्तव में यह खाली डेटा है।

जाल: यदि आप केवल वोटों को गिनते हैं, तो आप 2 "हाँ" और 1 "नहीं" देखते हैं। आप सोच सकते हैं कि रेसिपी बेहतरीन है। लेकिन यदि आप करीब से देखते हैं, तो "नहीं" एक ऐसे शेफ से आया जो डरा हुआ था, और "हाँ" एक रोबोट से आया जिसका कोई अर्थ नहीं था। यदि आप इन्हें अलग नहीं करते हैं, तो AI उस रेसिपी का सुझाव देना बंद कर सकता है क्योंकि "बहुत से लोगों ने ना कह दिया," भले ही रेसिपी वास्तव में एकदम सही हो।

यह पेपर इसे "सप्रेशन बायस" (Suppression Bias) कहता है। यह तब होता है जब AI अच्छी लेकिन कठिन चीजों का सुझाव देना बंद कर देता है क्योंकि जो लोग उन्हें करने में कुशल नहीं हैं, वे बार-बार "नहीं" कहते रहते हैं।

3. दो-मस्तिष्क समाधान

इसे ठीक करने के लिए, पेपर सुझाव देता है कि AI को एक ही समय में दो दिमागों के साथ सीखना चाहिए, न कि केवल एक के साथ:

  1. ब्रेन 1 (रिवॉर्ड मॉडल): सीखता है कि सर्वश्रेष्ठ चिकित्सा संबंधी कार्रवाई क्या है।
  2. ब्रेन 2 (कैपेबिलिटी मॉडल): प्रत्येक विशिष्ट डॉक्टर की उस कार्य को करने की कौशल स्तर को सीखता है।

AI एक लूप चलाता है:

  • "क्या डॉ. स्मिथ ने 'नहीं' कहा? क्या यह इसलिए था क्योंकि विचार बुरा था (ब्रेन 1), या इसलिए क्योंकि डॉ. स्मिथ अभी इसके लिए तैयार नहीं हैं (ब्रेन 2)?"
  • यदि यह कौशल का मुद्दा है, तो AI अपना विचार नहीं बदलता है; इसके बजाय, वह डॉ. स्मिथ को एक चीट शीट (चेकलिस्ट या चरण-दर-चरण मार्गदर्शिका) देता है ताकि वे आत्मविश्वास महसूस कर सकें।
  • जैसे-जैसे डॉ. स्मिथ बेहतर होते जाते हैं, AI उन्हें चीट शीट देना बंद कर देता है और उनके साथ एक मास्टर शेफ की तरह व्यवहार करता है।

4. यह केवल "वैल्यू-बेस्ड" केयर में ही क्यों काम करता है

पेपर का तर्क है कि यह प्रणाली अस्पताल के एक विशिष्ट भुगतान मॉडल में सबसे अच्छा काम करती है जिसे वैल्यू-बेस्ड केयर (Value-Based Care) कहा जाता है।

  • पुराना तरीका (फी-फॉर-सर्विस): डॉक्टरों को हर विज़िट के लिए भुगतान किया जाता है। यदि वे मरीज को विशेषज्ञ के पास भेजते हैं, तो उन्हें अधिक भुगतान मिलता है। इसलिए, वे मरीजों को रेफर कर सकते हैं भले ही वे खुद इलाज कर सकते हों। यहाँ AI गलत सबक सीखता है।
  • नया तरीका (वैल्यू-बेस्ड): डॉक्टरों को परिणामों के आधार पर भुगतान किया जाता है (जैसे, "क्या 3 महीने में मरीज ठीक हुआ?)।
    • इस दुनिया में, यदि डॉक्टर अनावश्यक रूप से मरीज को रेफर करता है, तो मरीज की स्थिति बिगड़ सकती है या वह लंबा इंतजार कर सकता है, और अस्पताल को नुकसान होता है।
    • यह एक स्पष्ट "स्कोरकार्ड" बनाता है। AI पीछे मुड़कर देख सकता है: "जिस डॉक्टर ने 'नहीं' कहा और मरीज को रेफर किया, उसका परिणाम खराब रहा। जिस डॉक्टर ने 'हाँ' कहा और इलाज किया, उसका परिणाम शानदार रहा।"
    • क्योंकि परिणाम दृश्यमान हैं और पैसे से जुड़े हैं, AI अंततः सच सीख सकता है: "ठीक है, डरे हुए डॉक्टर का 'नहीं' एक गलती थी। 'हाँ' कहना सही कदम था।"

5. "फ्लाईव्हील" प्रभाव

पेपर एक जादुई चक्र का वर्णन करता है जो तब होता है जब आप इसे सही ढंग से करते हैं:

  1. AI एक उपचार का सुझाव देता है।
  2. डॉक्टर फीडबैक (ओवरराइड्स) देते हैं।
  3. AI सीखता है कि कौन कुशल है और किसे मदद की ज़रूरत है, और वह अपने सुझावों को समायोजित करता है।
  4. डॉक्टर उन उपचारों को करने में बेहतर होते जाते हैं क्योंकि AI उनकी मदद करता है।
  5. क्योंकि डॉक्टर बेहतर होते हैं, वे अधिक बार "हाँ" कहते हैं, और AI और भी तेज़ी से सीखता है।

यह एक ढलान पर लुढ़कते हुए बर्फ के गोले (snowball) की तरह है: जितना अधिक आप सिस्टम का उपयोग करेंगे, यह उतना ही स्मार्ट होता जाएगा, और डॉक्टर भी उतने ही बेहतर होते जाएंगे।

सारांश

यह पेपर कहता है: "नहीं" को अनदेखा न करें।
जब एक डॉक्टर AI का निर्णय बदलता है, तो यह सिस्टम की विफलता नहीं है। यह AI, डॉक्टर के कौशल स्तर और अस्पताल के नियमों के बीच एक जटिल बातचीत है। यदि हम ऐसा AI बनाते हैं जो समझ सके कि डॉक्टर ने "नहीं" क्यों कहा (क्या यह कौशल की कमी है? नियम में बदलाव है? या वास्तव में एक चिकित्सा संबंधी असहमति है?), तो हम ऐसे सिस्टम बना सकते हैं जो केवल सलाह ही नहीं देते, बल्कि डॉक्टरों को उनके काम में बेहतर होने में भी मदद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →