Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary
यह परिदृश्य टिप्पणी GPT-4o के विरुद्ध GPT-5 परिवार का मूल्यांकन करती है, जो मैमोग्राफी जैसे कार्यों में अत्याधुनिक प्रदर्शन के करीब पहुँचने वाले विशेषज्ञ-स्तरीय पाठ्य तर्क और मल्टीमॉडल संश्लेषण में पर्याप्त सुधारों को प्रकट करती है, जबकि यह भी रेखांकित करती है कि सामान्यज्ञ मॉडल न्यूरोरेडियोलॉजी जैसे धारणा-महत्वपूर्ण डोमेन में अभी भी विशिष्ट प्रणालियों से पीछे हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली, विद्वान छात्र को डॉक्टर बनना सिखाने की कोशिश कर रहे हैं। इस छात्र ने हर मेडिकल टेक्स्टबुक, हर जर्नल और हर केस स्टडी को पढ़ा है। लेकिन एक पेंच है: उसने वास्तव में कभी कोई वास्तविक एक्स-रे, माइक्रोस्कोप स्लाइड या मैमोग्राम नहीं देखा है। वह केवल वही जानता है जो ये चित्र शब्दों में कहते हैं।
यह पेपर उस छात्र के नवीनतम संस्करण का रिपोर्ट कार्ड है: GPT-5। शोधकर्ता यह देखना चाहते थे कि क्या यह "सुपर-स्टूडेंट" केवल तथ्यों को रटने से आगे बढ़कर, चित्रों और टेक्स्ट को एक साथ देखते हुए एक डॉक्टर की तरह सोचना सीख गया है।
यहाँ उनके निष्कर्षों का विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:
1. परीक्षण: एक मेडिकल "बाधा दौड़" (Obstacle Course)
शोधकर्ताओं ने GPT-5 से केवल सरल प्रश्न नहीं पूछे। उन्होंने इसे तीन अलग-अलग प्रकार की चुनौतियों के साथ एक कठिन बाधा दौड़ से गुजारा:
- टेक्स्टबुक परीक्षा: मानक मेडिकल प्रश्न (जैसे USMLE बोर्ड परीक्षा) यह देखने के लिए कि क्या यह तथ्यों को जानता है।
- जासूसी कार्य (Detective Work): जटिल मामले जहाँ छात्र को मरीज की कहानी पढ़नी होती है, लैब रिपोर्ट देखनी होती है, और फिर एक रहस्य सुलझाने के लिए एक छवि को देखना होता है।
- विजुअल आई-टेस्ट (Visual Eye-Test): विशिष्ट चिकित्सा छवियों (मस्तिष्क के MRI, कोशिकाओं की माइक्रोस्कोप स्लाइड और स्तन के एक्स-रे) को देखना और उनके बारे में उत्तर देना।
2. परिणाम: "स्मार्ट जनरल लिस्ट" बनाम "स्पेशलिस्ट"
🧠 टेक्स्टबुक जीनियस (केवल टेक्स्ट वाले कार्य)
फैसला: GPT-5 एक असाधारण विद्वान है।
जब परीक्षण केवल शब्दों को पढ़ने और तर्क करने के बारे में था, तो GPT-5 ने मेडिकल बोर्ड परीक्षाओं में 95% से अधिक स्कोर किया।
- उपमा: यदि पिछला मॉडल (GPT-4o) एक स्मार्ट कॉलेज स्नातक था, तो GPT-5 एक टेन्यूर्ड प्रोफेसर है जो बिना अटके जटिल चिकित्सा अवधारणाओं को समझा सकता है। इसने केवल उत्तर रटे नहीं; इसने उनके पीछे के तर्क को समझा।
🔍 जासूस (टेक्स्ट + इमेज को जोड़ना)
फैसला: GPT-5 कड़ियों को जोड़ने में बहुत बेहतर हो रहा है।
जब परीक्षण के लिए एक तस्वीर देखने और एक कहानी पढ़ने की आवश्यकता थी ताकि निदान (diagnosis) किया जा सके, तो GPT-5 ने एक बड़ी छलांग दिखाई।
- उपमा: कल्पना कीजिए कि एक जासूस जो पहले केवल पुलिस रिपोर्ट पढ़ता था। अब, GPT-5 अपराध स्थल की फोटो देख सकता है और अपराधी का पता लगाने के लिए गवाह का बयान भी पढ़ सकता है। एक परीक्षण में, इसने एक CT स्कैन इमेज और मरीज के उल्टी करने के इतिहास को जोड़कर एक दुर्लभ, जीवन के लिए घातक स्थिति (एक फटी हुई ग्रासनली/esophagus) की सही पहचान की। इसने एक सर्च इंजन के बजाय एक अनुभवी चिकित्सक की तरह काम किया।
👁️ विजुअल स्पेशलिस्ट (केवल छवियों को देखना)
फैसला: GPT-5 अच्छा है, लेकिन अभी विशेषज्ञ नहीं है।
यही वह जगह है जहाँ "सुपर-स्टूडेंट" की सीमा आ गई।
- ब्रेन स्कैन्स (न्यूरोरेडियोलॉजी): GPT-5 ने लगभग 44% उत्तर सही दिए। यह एक आम आदमी से बेहतर है, लेकिन एक वास्तविक ब्रेन सर्जन 90%+ स्कोर करेगा। यह एक सामान्य मैकेनिक की तरह है जो फॉर्मूला 1 इंजन को ठीक करने की कोशिश कर रहा है; वे जानते हैं कि इंजन कैसे काम करते हैं, लेकिन वे सूक्ष्म, विशिष्ट विवरणों को मिस कर देते हैं।
- माइक्रोस्कोप (पैथोलॉजी): इसने ठीक-ठाक प्रदर्शन किया, लेकिन कभी-कभी यह रक्त कोशिकाओं या ऊतकों के नमूनों के सूक्ष्म विवरणों में भ्रमित हो गया।
- मैमोग्राम (स्तन के एक्स-रे): यह सबसे कठिन परीक्षण था। GPT-5 ने लगभग 50-60% सही उत्तर दिए। स्तन कैंसर के लिए विशेष रूप से बनाए गए AI सिस्टम 80-90% से अधिक स्कोर करते हैं।
- उपमा: GPT-5 को एक जनरल प्रैक्टिशनर (एक फैमिली डॉक्टर) के रूप में सोचें। वे अधिकांश चीजों को संभालने में माहिर हैं और देख सकते हैं कि कुछ गलत है। लेकिन यदि आपको एक माइक्रो-सर्जन की आवश्यकता है जो एक छोटे ट्यूमर को निकाल सके या एक रेडियोलॉजिस्ट की आवश्यकता है जो स्तन में कैल्शियम के एक छोटे से कण को पहचान सके, तो आपको अभी भी एक मानव विशेषज्ञ या उस एक विशिष्ट कार्य के लिए बनी मशीन की आवश्यकता है। GPT-5 सबसे अधिक "विशिष्ट" दृश्य कार्यों के लिए बहुत अधिक "सामान्य" है।
3. "मिनी" सरप्राइज
दिलचस्प बात यह है कि GPT-5 के छोटे संस्करणों (जिन्हें "Mini" और "Nano" कहा जाता है) ने विशिष्ट इमेज टेस्ट पर बड़े "GPT-5" से बेहतर प्रदर्शन किया।
- उपमा: यह एक विशाल, सतर्क हाथी (GPT-5) बनाम एक फुर्तीले चूहे (GPT-5 Mini) जैसा है। हाथी अविश्वसनीय रूप से स्मार्ट और शक्तिशाली है, लेकिन कभी-कभी यह छोटे विवरणों को देखते समय बहुत अधिक सोचता है या बहुत सावधान रहता है। चूहा तेज़ है और कभी-कभी विशिष्ट छोटे कार्यों पर सही उत्तर का अधिक "अनुमान" लगा लेता है।
4. निचोड़: एक शक्तिशाली सहायक, न कि प्रतिस्थापन
पेपर निष्कर्ष निकालता है कि GPT-5 एक बड़ी प्रगति है। यह पहली बार है जब एक सामान्य AI ने वास्तव में टेक्स्ट और इमेज के माध्यम से इस तरह से "सोचने" की क्षमता दिखाई है जो एक डॉक्टर के मस्तिष्क की नकल करती है।
- यह क्या कर सकता है: यह एक अद्भुत सहायक है। यह मरीज का इतिहास पढ़ सकता है, एक स्कैन देख सकता है, और कह सकता है, "हे, यह संदिग्ध लग रहा है, ऐसा इसलिए है, और हमें आगे क्या जांचना चाहिए।" यह डॉक्टरों को तेजी से और समग्र रूप से सोचने में मदद करता है।
- यह अभी क्या नहीं कर सकता: यह विशेषज्ञों को बदलने के लिए तैयार नहीं है। यदि आपको एक मैमोग्राम देखने और 99% निश्चितता के साथ यह तय करने के लिए एक मशीन की आवश्यकता है कि यह कैंसर है या नहीं, तो आपको उसके लिए विशेष रूप से निर्मित उपकरण की आवश्यकता है, न कि एक सामान्य उद्देश्य वाले AI की।
संक्षेप में: GPT-5 एक प्रतिभाशाली मेडिकल छात्र की तरह है जो अपनी रेजिडेंसी शुरू करने के लिए तैयार है। वह स्मार्ट है, वह तर्क करता है, और वह तेजी से सुधार कर रहा है। लेकिन उसे सबसे महत्वपूर्ण, उच्च-जोखिम वाले दृश्य निर्णनों को संभालने के लिए अभी भी एक पर्यवेक्षी डॉक्टर (या एक विशिष्ट उपकरण) की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।