← नवीनतम पेपर
🤖 machine learning

Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents

यह शोध पत्र कॉज़ल सेंसिटिविटी स्कोर (CSS) को प्रस्तुत करता है, जो एक हस्तक्षेप संबंधी मीट्रिक (interventional metric) है जो मानक कवरेज-आधारित बेंचमार्क पर नैदानिक एआई मॉडलों के प्रदर्शन और रोगी डेटा में महत्वपूर्ण परिवर्तनों के प्रति उनकी वास्तविक प्रतिक्रियाशीलता के बीच महत्वपूर्ण विसंगतियों को प्रकट करता है, जिससे छिपी हुई क्षमता प्रोफाइल और वे सार्वभौमिक सुरक्षा ब्लाइंड स्पॉट सामने आते हैं जिन्हें पारंपरिक मूल्यांकन विधियाँ नहीं देख पाती हैं।

मूल लेखक: Matt Turk

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matt Turk

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कैंसर के रोगियों के लिए सर्वोत्तम उपचार तय करने में मदद करने के लिए चिकित्सा सलाहकारों (AI मॉडल्स) की एक टीम को काम पर रख रहे हैं। पारंपरिक रूप से, हमने इन सलाहकारों का परीक्षण एक रोगी की फाइल देकर और यह जांचकर किया है कि क्या उनकी अंतिम सिफारिश विशेषज्ञों के एक पैनल के समान है। यदि सलाह सही दिखती है, तो उन्हें अच्छा ग्रेड मिलता है।

यह शोध पत्र तर्क देता है कि यह पारंपरिक ग्रेडिंग प्रणाली एक शेफ (रसोइया) का न्याय करने के समान है, जो केवल अंतिम व्यंजन के स्वाद को देखकर किया जाता है, बिना कभी यह पूछे कि: "क्या आपने वास्तव में सामग्रियों का स्वाद लिया, या आपने बस रेसिपी को रट लिया और हर बार वही व्यंजन परोस दिया?"

यहाँ सरल उपमाओं का उपयोग करके शोध के निष्कर्षों का विवरण दिया गया है:

1. समस्या: "दिखावटी समानता" का जाल (The "Look-Alike" Trap)

लेखकों ने पाया कि दो AI सिस्टम मानक परीक्षणों पर लगभग समान स्कोर प्राप्त कर सकते हैं, फिर भी तथ्यों के बदलने पर पूरी तरह से अलग व्यवहार करते हैं।

  • परिदृश्य: मान लीजिए कि एक रोगी के कैंसर कोशिकाओं में एक विशिष्ट मार्कर है। AI एक दवा का सुझाव देता है।
  • मोड़: अब, कल्पना कीजिए कि हमने चुपके से फाइल बदल दी और कहा कि रोगी में अब वह मार्कर नहीं है।
  • परिणाम: एक "स्मार्ट" AI को अपनी दवा की सिफारिश बदल देनी चाहिए। एक "मूर्ख" (लेकिन भाग्यशाली) AI शायद उसी बदलाव को अनदेखा कर देगा और फिर भी वही दवा सुझाएगा।
  • दोष: मानक परीक्षण (जिसे पेपर में CMS कहा गया है) केवल यह देखते हैं कि अंतिम उत्तर विशेषज्ञों से मेल खाता है या नहीं। वे उस AI को नहीं पकड़ पाते जो बस एक ही उत्तर पर "अटक" गया है। यह उस छात्र की तरह है जिसने उत्तर कुंजी (answer key) रट ली है; वह परीक्षा में 'A' ग्रेड तो पा लेता है, लेकिन यदि प्रश्न थोड़ा सा बदल दिया जाए, तो वह विफल हो जाता है क्योंकि उसे तर्क समझ नहीं आता।

2. समाधान: "कॉज़ल सेंसिटिविटी स्कोर" (CSS)

इसे ठीक करने के लिए, लेखकों ने एक नया परीक्षण बनाया जिसे Causal Sensitivity Score (CSS) कहा जाता है।

  • उपमा: इसे मेडिकल फाइलों के लिए "अंतर पहचानो" (spot the difference) खेल के रूप में समझें। शोधकर्ता एक रोगी की फाइल लेते हैं और उसमें छोटे, पूर्व-नियोजित बदलाव करते हैं (जैसे "सर्जरी हुई" से "सर्जरी नहीं हुई" का स्विच बदलना, या किसी विशिष्ट दवा के इतिहास को हटा देना)।
  • परीक्षण: वे AI से पूछते हैं: "अब जब मैंने यह तथ्य बदल दिया है, तो क्या आपने अपनी सिफारिश बदल दी?"
  • स्कोर:
    • 1.0: आपने अपना निर्णय सही ढंग से बदला (बहुत बढ़िया!)।
    • 0.5: आपने बदलाव को देखा लेकिन अपना निर्णय नहीं बदला (ठीक है)।
    • 0.0: आपने बदलाव को पूरी तरह से अनदेखा कर दिया (बुरा)।

3. बड़ा आश्चर्य: रैंकिंग उलट गई

लेखकों ने उपलब्ध छह सबसे स्मार्ट AI मॉडल्स का परीक्षण किया। जब उन्होंने पुराने परीक्षण (CMS) का उपयोग किया, तो मॉडल्स को एक निश्चित क्रम में रैंक किया गया। जब उन्होंने नए परीक्षण (CSS) का उपयोग किया, तो रैंकिंग पूरी तरह से उलट गई।

  • वह मॉडल जिसे पुराने परीक्षण द्वारा सबसे अंत में रखा गया था, नए परीक्षण द्वारा विजेता बन गया।
  • वह मॉडल जो पुराने परीक्षण के अनुसार पहले स्थान पर था, चौथे स्थान पर आ गया।
  • सीख: पुराने मानकों के अनुसार "सर्वश्रेष्ठ" AI वास्तव में नई जानकारी पर प्रतिक्रिया देने में सबसे खराब था।

4. सार्वभौमिक अंध बिंदु (Universal Blind Spot): "सर्जरी" की त्रुटि

शोधकर्ताओं ने एक विशिष्ट प्रकार का बदलाव खोजा जिसमें प्रत्येक AI मॉडल विफल रहा, चाहे वे कितने भी स्मार्ट क्यों न हों।

  • परिदृश्य: यह बदलना कि रोगी की सर्जरी हुई थी या नहीं।
  • विफलता: जब फाइल में लिखा था "रोगी की सर्जरी हुई," तो AI ने एक उपचार का सुझाव दिया। जब फाइल को बदलकर यह कर दिया गया कि "रोगी की सर्जरी नहीं हुई थी," तो AI अक्सर वही सटीक उपचार सुझाता रहा।
  • महत्व: वास्तविक चिकित्सा में, यह बात बहुत मायने रखती है कि रोगी की सर्जरी हुई है या नहीं। यदि AI इसे अनदेखा करता है, तो यह सुरक्षा के लिए जोखिम है। पुराने परीक्षण (CMS) ने इसे कभी नहीं पकड़ा क्योंकि AI का उत्तर अभी भी एक वैध चिकित्सा राय की तरह "दिख" रहा था, भले ही वह एक महत्वपूर्ण तथ्य को अनदेखा कर रहा था।

5. "टूल-उपयोग" प्रयोग (The "Tool-Using" Experiment)

शोधकर्ताओं ने इन AIs का परीक्षण तब भी किया जब उन्हें स्थिर फाइल पढ़ने के बजाय टूल्स (जैसे रोगी रिकॉर्ड खोजने के लिए सर्च इंजन) का उपयोग करने की अनुमति दी गई।

  • परिणाम: अधिकांश मॉडल्स के लिए, टूल्स का उपयोग करने से उन्हें बेहतर स्कोर मिला। वे नई जानकारी ढूंढ सके और अपनी सलाह अपडेट कर सके।
  • अलग दिखने वाला मॉडल: एक विशिष्ट मॉडल (gpt-5.4) ने अन्य मॉडल्स की तरह ही टूल्स का उपयोग किया—उसने सही जानकारी भी खोजी—लेकिन फिर भी उसने अपनी सिफारिश नहीं बदली।
  • रूपक: यह एक जासूस की तरह है जो सबूत (smoking gun) तो ढूंढ लेता है लेकिन फिर भी दावा करता है कि संदिग्ध निर्दोष है। यह बताता है कि समस्या यह नहीं है कि AI जानकारी ढूंढ नहीं सकता; बल्कि समस्या यह है कि उसका मस्तिष्क संरचनात्मक रूप से उस जानकारी के आधार पर अपने निष्कर्ष को अपडेट करने में असमर्थ है।

सारांश

यह शोध पत्र चिकित्सा AIs को परखने का एक नया तरीका पेश करता है जो यह जाँचता है कि वे वास्तव में सोच रहे हैं या केवल दोहरा रहे हैं।

  • पुराना तरीका: क्या आपने सही उत्तर दिया? (हाँ/नहीं)
  • नया तरीका (CSS): यदि मैं तथ्यों को बदल दूँ, तो क्या आप अपना उत्तर बदल देंगे? (हाँ/नहीं)

अध्ययन दर्शाता है कि जिन मॉडल्स को हम सर्वश्रेष्ठ समझते थे, वे वास्तव में सबसे अधिक जड़ (rigid) हो सकते हैं, और वर्तमान के सभी शीर्ष-स्तरीय मॉडल्स में सर्जरी की स्थिति को लेकर एक खतरनाक अंध बिंदु है। लेखक सुझाव देते हैं कि हमें इस नए "प्रतिक्रियाशीलता" (responsiveness) परीक्षण की आवश्यकता है ताकि यह सुनिश्चित किया जा सके कि AI एजेंट डॉक्टरों की मदद करने से पहले वास्तव में सुरक्षित और विश्वसनीय हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →