← नवीनतम पेपर
🤖 AI

A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks

यह शोध पत्र पांच कठिन नैदानिक परिदृश्यों के एक छोटे, विशेषज्ञ-लिखित डेटासेट को प्रस्तुत करता है जिसका परमाणु, भारित रूब्रिक्स (atomic, weighted rubrics) के माध्यम से मूल्यांकन किया गया है, जो यह प्रकट करता है कि फ्रंटियर लैंग्वेज मॉडल्स (GPT-5.4, Claude Opus 4.7, और Gemini 3.1 Pro) कम जोखिम वाले मदों पर मजबूत प्रदर्शन के बावजूद उच्च-जोखिम वाले नैदानिक मानदंडों के साथ महत्वपूर्ण रूप से संघर्ष करते हैं, जबकि ऐसे मूल्यांकनों के लिए विश्वसनीय स्वचालित ग्रेडर के रूप में LLMs के उपयोग की व्यवहार्यता को प्रदर्शित करते हैं।

मूल लेखक: Samiha A. Ismail, Fan X. Chen, Ali Merali

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Samiha A. Ismail, Fan X. Chen, Ali Merali

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि विशेषज्ञ शेफ (AI मॉडल) का एक समूह खाना पकाने की परीक्षा दे रहा है। अतीत में, ये परीक्षण बहुविकल्पीय क्विज़ (multiple-choice quizzes) की तरह थे: "चिकन के साथ कौन सा मसाला जाता है? A) नमक, B) चीनी, C) काली मिर्च।" इन क्विज़ में शेफ का स्कोर लगभग एकदम सही रहता था। वे तथ्यों को जानते थे।

लेकिन असली खाना बनाना कोई क्विज़ नहीं है। यह एक व्यस्त डिनर सर्विस की तरह है जहाँ ऑर्डर बदलते हैं, सामग्रियां खत्म हो जाती हैं, और किसी अतिथि को गंभीर एलर्जी होती है। यह परीक्षण करने के लिए कि क्या शेफ वास्तविक स्थिति को संभाल सकते हैं, शोधकर्ताओं ने एक नया प्रकार का परीक्षण बनाया। केवल एक क्विज़ पूछने के बजाय, उन्होंने शेफ को पांच जटिल, अव्यवस्थित रसोई की आपदाएं दीं और उन्हें उन्हें ठीक करने के लिए एक योजना लिखने को कहा।

यहाँ यह पेपर सरल शब्दों में इस प्रयोग को कैसे समझाता है:

1. परीक्षण: एक "हार्ड मोड" किचन

शोधकर्ताओं ने केवल शेफ को रेसिपी का पालन करने के लिए नहीं कहा। उन्होंने वास्तविक डॉक्टरों (जैसे कि एक एनेस्थिसियोलॉजिस्ट या आपातकालीन चिकित्सक) द्वारा लिखे गए पांच विशिष्ट, कठिन परिदृश्य बनाए।

  • परिदृश्य: चीजें जैसे सर्जरी के दौरान हार्ट अटैक आना, एक मरीज जिसके पास बहुत अधिक विरोधाभासी दवाएं हैं, या अस्थमा वाली एक गर्भवती महिला जिसे रक्तचाप की दवा की आवश्यकता है।
  • ग्रेडिंग सिस्टम: केवल यह कहने के बजाय कि "अच्छा काम किया" या "बुरा काम किया," डॉक्टरों ने एक विशाल चेकलिस्ट ("रूब्रिक") बनाई जिसमें 184 विशिष्ट आइटम थे।
    • कुछ आइटम तुच्छ (trivial) थे (जैसे "क्या आपने टेबल फॉर्मेट का उपयोग किया?")।
    • कुछ आइटम महत्वपूर्ण (critical) थे (जैसे "क्या आपने ध्यान दिया कि यह दवा मरीज को मार सकती है?")।
    • प्रत्येक आइटम का एक "भार" (weight) था। यदि आपने एक तुच्छ आइटम छोड़ा, तो आपके बहुत कम अंक कटते। यदि आपने एक महत्वपूर्ण सुरक्षा आइटम छोड़ा, तो आपके बहुत अधिक अंक कट जाते।

2. खिलाड़ी

तीन शीर्ष-स्तरीय AI शेफ का परीक्षण किया गया:

  • GPT 5.4 (OpenAI)
  • Claude Opus 4.7 (Anthropic)
  • Gemini 3.1 Pro (Google)

उन सभी को बिल्कुल समान निर्देश दिए गए थे, बिना किसी अतिरिक्त उपकरण या मदद के, ठीक वैसे ही जैसे एक शेफ एक बंद रसोई में खाना बनाता है।

3. बड़ा आश्चर्य: "इनवर्जन" (उल्टा होना)

परिणामों ने एक अजीब और चिंताजनक पैटर्न दिखाया, जिसे लेखक "क्लिनिकल प्रायोरिटी का इनवर्जन" (clinical priority का उलटा होना) कहते हैं।

  • अच्छी खबर: शेफ "तुच्छ" चीजों में माहिर थे। उन्होंने फॉर्मेटिंग नियमों का पालन किया, सही लहजा अपनाया, और उत्तर देने से मना नहीं किया। वे आसान, कम जोखिम वाले चेकलिस्ट आइटम्स पर 80-90% अंक प्राप्त कर रहे थे।
  • बुरी खबर: वे "महत्वपूर्ण" चीजों में बुरी तरह विफल रहे। जब सबसे महत्वपूर्ण सुरक्षा निर्णयों (वेट-5 वाले आइटम्स) की बात आई, तो वे केवल 32% से 41% ही सही थे।

रूपक (Metaphor): एक पायलट की कल्पना करें जो सुंदर लिखावट और सही व्याकरण के साथ एक बेहतरीन उड़ान योजना लिखता है, लेकिन पूरी तरह से इस तथ्य को अनदेखा कर देता है कि विमान में ईंधन खत्म है। AI डॉक्टर दिखने में तो बहुत अच्छा है, लेकिन यह अक्सर उस एक चीज़ को मिस कर देता है जो वास्तव में मरीज को जीवित रखती है।

4. "यूनिवर्सल मिसिस" (सार्वभौमिक चूक)

शोधकर्ताओं ने 56 विशिष्ट महत्वपूर्ण गलतियाँ पाईं जिन्हें तीनों AI मॉडलों में से किसी ने भी सही नहीं किया। ये उनकी दृष्टि के अंधे धब्बे (blind spots) की तरह हैं।

  • उदाहरण 1: एक मरीज की ब्लड टेस्ट रिपोर्ट बेहतर हो रही थी, लेकिन AI ने इसे अनदेखा कर दिया और इसे ऐसे ही मानता रहा जैसे कि स्थिति खराब हो रही हो।
  • उदाहरण 2: एक मरीज तीन विशिष्ट दवाएं ले रहा था, जिनके मिश्रण से किडनी फेलियर हो सकता था। AI दवा सूची और किडनी की समस्या के बीच के संबंध को जोड़ने में विफल रहा।
  • उदाहरण 3: अस्थमा वाली एक गर्भवती महिला को रक्तचाप की दवा की आवश्यकता थी। AI ने कहा "इस दवा का उपयोग न करें" क्योंकि उसे अस्थमा है, लेकिन वह यह समझाने में विफल रहा कि इस विशिष्ट आपात स्थिति में लाभ वास्तव में जोखिमों से अधिक हो सकते हैं।
  • उदाहरण 4: एक मरीज की धमनी फट गई थी। AI ने उन्हें दूसरे अस्पताल स्थानांतरित करने का सुझाव दिया, जबकि नियम कहते हैं: "यदि वे स्थानांतरण के दौरान दिल की धड़कन रोक देते हैं, तो वे मर जाएंगे।" AI उस नियम को मिस कर गया कि "उन्हें हिलाएं नहीं।"

5. "रोबोट ग्रेडर्स"

यह सुनिश्चित करने के लिए कि मानव डॉक्टर निष्पक्षता से ग्रेडिंग कर रहे हैं, शोधकर्ताओं ने अन्य AI मॉडल का उपयोग "रोबोट ग्रेडर" के रूप में किया।

  • ये रोबोट ग्रेडर मानव विशेषज्ञों के साथ 93-95% बार सहमत हुए।
  • इससे पता चलता है कि हालांकि AI अभी तक चिकित्सा कार्य करने में पूर्ण नहीं है, लेकिन यह काम की जांच करने में बहुत अच्छा हो रहा है।

6. निष्कर्ष (The Bottom Line)

यह पेपर यह नहीं कह रहा है कि AI बेकार है। यह कह रहा है कि AI वर्तमान में डॉक्टर दिखने में बहुत अच्छा है, लेकिन अभी तक डॉक्टर की तरह सोचने में नहीं।

  • सीख: यदि आप AI से मेडिकल रिपोर्ट लिखने के लिए कहते हैं, तो यह पेशेवर दिखेगा और सभी नियमों का पालन करेगा। लेकिन यदि आप इसे एक जटिल, जीवन-मरण के पहेली को सुलझाने के लिए कहते जहाँ सुराग एक-दूसरे के विपरीत हों, तो इसकी संभावना है कि यह सबसे महत्वपूर्ण सुरक्षा चरणों को मिस कर देगा।
  • लक्ष्य: शोधकर्ताओं ने यह परीक्षण यह साबित करने के लिए बनाया है कि हमें AI को मापने के लिए एक बेहतर तरीके की आवश्यकता है। हम केवल यह नहीं देख सकते कि AI कितना "प्रवाहपूर्ण" (fluent) लगता है; हमें यह जांचना होगा कि क्या वह महत्वपूर्ण सुरक्षा जाल को पकड़ पाता है। वे इस छोटे परीक्षण को एक बड़े बेंचमार्क में बदलने की उम्मीद करते हैं ताकि अगली पीढ़ी के AI को वास्तव में अस्पताल में सुरक्षित होने के लिए प्रशिक्षित किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →