Capabilities of Claude Fable 5 on Biomedical Challenge Problems
यह शोध पत्र प्रकट करता है कि जबकि एंथ्रोपिक का क्लॉड फेबल 5 (Claude Fable 5) सक्रिय रूप से संलग्न होने पर बायोमेडिकल बेंचमार्क पर शीर्ष स्तर की सटीकता प्राप्त करता है, इसकी व्यावहारिक उपयोगिता प्रश्नों के एक महत्वपूर्ण हिस्से को अस्वीकार करने की एक अनूठी और व्यापक प्रवृत्ति द्वारा गंभीर रूप से बाधित होती है—एक ऐसा पैटर्न जो इसके पूर्ववर्तियों और GPT-5 दोनों में अनुपस्थित है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है जिसका नाम Fable 5 है। यह रोबोट एंथ्रोपिक (Anthropic) की नवीनतम और सबसे शक्तिशाली रचना है, जिसे मेडिकल टेक्स्टबुक पढ़ने, एक्स-रे देखने और जटिल जीव विज्ञान की पहेलियों को सुलझाने के लिए डिज़ाइन किया गया है। लेकिन इसमें एक ट्विस्ट है: जब आप इससे कोई सवाल पूछते हैं, तो यह कभी-कभी गलत जवाब देने के बजाय अपने कान हाथों से ढंक लेता है और कहता है, "मैं इसका उत्तर नहीं दे सकता।"
यह शोध पत्र एक जासूसी कहानी की तरह है जहाँ शोधकर्ताओं ने यह पता लगाने की कोशिश की: क्या यह रोबलेट वास्तव में कम बुद्धिमान हो रहा है, या यह सिर्फ इस बात को लेकर बहुत ज्यादा चयनात्मक (picky) हो रहा है कि वह किस बारे में बात करेगा?
महान "मैं नहीं कर सकता" का रहस्य
शोधकर्ताओं ने Fable 5 का परीक्षण तीन अन्य रोबोटों (उसके दो पुराने संस्करणों और एक प्रतिद्वंद्वी GPT-5) के विरुद्ध आठ अलग-अलग चिकित्सा चुनौतियों पर किया। ये चुनौतियाँ USMLE परीक्षाओं के बहुविकल्पीय प्रश्नों से लेकर ट्यूमर की तस्वीरों को देखने और दुर्लभ बीमारियों का निदान करने तक फैली हुई थीं।
बड़ा आश्चर्य:
पहली नज़र में, Fable 5 एक हारने वाले की तरह लग रहा था। कई परीक्षणों में, इसका कच्चा स्कोर (raw score) दूसरों से कम था। लेकिन शोधकर्ताओं को एहसास हुआ कि कुछ अजीब हो रहा था। उन्होंने पाया कि Fable 5 बड़ी संख्या में सवालों के जवाब देने से इनकार कर रहा था।
- RareBench (दुर्लभ बीमारियों के बारे में) नामक एक परीक्षण पर, Fable 5 ने 99.4% सवालों के लिए इनकार कर दिया। इसने लगभग हर चीज़ के लिए "ना" कह दिया।
- अन्य परीक्षणों में, इसने 8.0% से 42% के बीच समय पर जवाब देने से इनकार किया।
अन्य रोबोट? उन्होंने शायद ही कभी इनकार किया (0.4% से भी कम)। वे हर चीज़ का जवाब देने की कोशिश करते थे, भले ही वे गलत क्यों न हों।
"स्कोर किया गया" स्कोरबोर्ड
यहाँ वह जादू का तरीका है जो शोधकर्ताओं ने इस्तेमाल किया। उन्होंने "मैं नहीं कर सकता" वाले जवाबों को "गलत" जवाबों के रूप में गिनना बंद करने का निर्णय लिया। इसके बजाय, उन्होंने केवल उन सवालों को देखा जिनका जवाब देने की Fable 5 ने वास्तव में कोशिश की थी।
जब उन्होंने ऐसा किया, तो कहानी पूरी तरह पलट गई:
- MedQA (मेडिकल परीक्षा): Fable 5 की "वास्तविक" सटीकता बढ़कर 96.6% हो गई, जो सबको पीछे छोड़ते हुए सबसे आगे रही।
- PubMedQA: इसने 81.3% हासिल किया, फिर से दूसरों को हरा दिया।
- RareBench: यह सबसे विचित्र हिस्सा है। क्योंकि इसने 99.4% सवालों के लिए इनकार कर दिया, इसलिए इसने केवल 6 सवालों के जवाब दिए। लेकिन उन 6 पर, इसने 0.36% सही उत्तर दिया। रुकिए, यह बुरा लग सकता है, है ना? लेकिन शोधकर्ता बताते हैं कि यह छोटा सा नंबर इसकी दिमागी शक्ति का माप नहीं है; यह केवल इस बात का माप है कि कितनी बार इसने चुप रहना छोड़ दिया। जब उन्होंने सवालों को पूछने का एक अलग, कम "डॉक्टर जैसा" तरीका आजमाया, तो Fable ical Fable 5 ने अधिक उत्तर दिए, और उन नए उत्तरों पर, इसने 39.4% सही प्राप्त किए—जो अन्य रोबोटों द्वारा मूल प्रश्नों पर प्राप्त किए गए स्कोर से बेहतर था!
मुख्य निष्कर्ष: यह शोध पत्र निष्कर्ष निकालता है कि Fable 5 वास्तव में कम सक्षम नहीं है। वास्तव में, जहाँ भी यह बोलने का निर्णय लेता है, यह अक्सर कमरे में मौजूद सबसे स्मार्ट रोबोट होता है। समस्या इसके दिमाग में नहीं है; यह इसके जुड़ने की इच्छा (willingness to engage) में है। यह एक प्रतिभाशाली छात्र की तरह है जो तब तक परीक्षा देने से मना कर देता है जब तक कि प्रश्न एक बहुत ही विशिष्ट तरीके से न पूछा जाए।
दो "जवाब न देने" वाले पैटर्न
शोधकर्ताओं ने गहराई से जांच की कि Fable 5 "नहीं" क्यों कह रहा था। उन्होंने दो अलग-अलग पैटर्न पाए, जैसे दो अलग-अलग प्रकार के फिल्टर:
- "बेसिक साइंस" फिल्टर: मानक चिकित्सा परीक्षाओं (MedQA और MedXpertQA MM) पर, Fable 5 ने मुख्य रूप से बेसिक साइंस और मैकेनिज्म (जैसे कि एक दवा कैसे काम करती है या एक हृदय कैसे धड़कता है) के बारे में सवालों के लिए इनकार किया। यह रोगी का निदान करने के बारे में सवालों के जवाब देने में खुश था, लेकिन यदि प्रश्न अंतर्निहित जीव विज्ञान (underlying biology) के बारे में था, तो यह अक्सर रुक जाता था।
- "दुर्लभ बीमारी" फिल्टर: RareBench परीक्षण पर, इनकार का कारण विज्ञान का प्रकार नहीं था। यह बीमारी के बारे में था।
- इसने लगभग सभी इनबॉर्न मेटाबॉलिक रोगों (दुर्लभ स्थितियां जिनके साथ बच्चे पैदा होते हैं, जैसे PKU) के बारे में सवालों को खारिज कर दिया।
- यह एडल्ट ऑटोइम्यून बीमारियों (जैसे ल्यूपस) के बारे में सवालों का जवाब देने में बहुत अधिक इच्छुक था।
- शोधकर्ताओं ने प्रॉम्प्ट (निर्देश) को बदलकर इसे एक "क्लिनिकल निर्णय सहायता प्रणाली" के बजाय एक तटस्थ सूची की तरह दिखाने की कोशिश की, लेकिन इससे मदद नहीं मिली। यहाँ तक कि एक तटस्थ प्रॉम्प्ट के साथ भी, 9-0.7% दुर्लभ बीमारी के सवालों को अभी भी खारिज कर दिया गया था।
उन्होंने क्या खारिज किया (वह सूची जो "यह नहीं है")
यह शोध पत्र बहुत सावधानी से कहता है कि इनकार का कारण क्या नहीं है:
- यह इसलिए नहीं है कि सवाल बहुत कठिन हैं। शोधकर्ताओं ने जांचा, और Fable 5 ने उन सवालों के लिए भी इनकार किया जिन्हें अन्य रोबोटों ने सही उत्तर दिया था।
- यह इसलिए नहीं है कि सवाल खुले-अंत वाले (open-ended) हैं। इसने बहुविकल्पीय प्रश्नों के लिए भी उतनी ही बार इनकार किया जितने बार खुले-अंत वाले प्रश्नों के लिए।
- यह इसलिए नहीं है कि प्रॉम्प्ट बहुत "आधिकारिक" (authoritative) लग रहा था। प्रॉम्प्ट को "आप एक डॉक्टर हैं" से बदलकर "यहाँ एक रोगी है" करने से इनकार की दर केवल थोड़ी सी ही कम हुई (99.4% से 90.7% तक)।
- यह किसी पुराने मॉडल का "फालबैक" नहीं है। कभी-कभी कंपनियाँ एक पुराने, सुरक्षित मॉडल में गुप्त रूप से स्विच करके इनकार को छिपा देती हैं। शोधकर्ताओं ने लॉग्स की जांच की, और जब रोबोट ने "नहीं" कहा, तो वह निश्चित रूप से Fable 5 ही था।
फैसला
यह शोध पत्र यह दावा नहीं करता कि उसे पता है कि Fable 5 के ये विशिष्ट फिल्टर क्यों हैं। लेखक स्वीकार करते हैं कि वे रोबोट के दिमाग के अंदर नहीं देख सकते कि यह बहुत अधिक सुरक्षा फीचर है या कोई गड़बड़ी।
हालाँकि, वे एक बात के बारे में बहुत आश्वस्त हैं: यदि आप Fable 5 को उत्तर देने के लिए मना लेते हैं, तो यह अविश्वसनीय रूप से सटीक है। इसके कच्चे स्कोर और इसकी वास्तविक क्षमता के बीच का अंतर पूरी तरह से इसके खेलने से इनकार करने के कारण है, न कि इसकी कौशल की कमी के कारण।
इसलिए, यदि आप इस उपकरण का उपयोग करने वाले डॉक्टर या शोधकर्ता हैं, तो यह शोध पत्र सुझाव देता है: सिर्फ इसलिए कि यह "मैं नहीं कर सकता" कहता है, इसे मूर्ख न समझें। यह शायद बस सावधान हो रहा है। चुनौती इसे अधिक चिकित्सा सिखाने की नहीं है; चुनौती यह पता लगाने की है कि सवाल को इस तरह से कैसे पूछा जाए कि यह अपना मुँह खोले।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।