← नवीनतम पेपर
💬 NLP

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

यह शोध पत्र SurgiQ को प्रस्तुत करता है, जो एक बड़े पैमाने का, बहु-डोमेन बेंचमार्क है जिसमें 13,000 से अधिक विशेषज्ञ-सत्यापित प्रश्न शामिल हैं जिन्हें लार्ज लैंग्वेज मॉडल्स में सर्जिकल तर्क (surgical reasoning) का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जहाँ शीर्ष मॉडल 68.1% सटीकता प्राप्त करते हैं, वहीं प्रक्रियात्मक बारीकियों (procedural nuances) को संभालने में महत्वपूर्ण अंतराल बने हुए हैं और वर्तमान में सामान्य-उद्देश्य वाले मॉडल विशिष्ट बायोमेडिकल मॉडल्स से बेहतर प्रदर्शन कर रहे हैं।

मूल लेखक: Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अनुभवहीन छात्र को सर्जन बनना सिखाने की कोशिश कर रहे हैं। आप उन्हें सिर्फ यह नहीं कह सकते कि "चिकित्सा को जान लो"; आपको यह परीक्षण करने की आवश्यकता है कि क्या वे जटिल परिस्थितियों में वास्तव में एक सर्जन की तरह सोच सकते हैं।

SurgiQ पेपर बिल्कुल इसी बारे में है। यह एक विशाल, नया "फाइनल एग्जाम" पेश करता है जिसे विशेष रूप से यह जांचने के लिए डिज़ाइन किया गया है कि लार्ज लैंग्वेज मॉडल्स (AI) सर्जरी को कितनी अच्छी तरह समझते हैं।

यहाँ इसका विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "मेडिकल टेक्स्टबुक" का जाल

अभी, डॉक्टरों के लिए कई AI परीक्षाएं मौजूद हैं। लेकिन उनमें से अधिकांश सामान्य सामान्य ज्ञान (trivia) की तरह हैं: "फ्रांस की राजधानी क्या है?" या "जुकाम का सबसे सामान्य लक्षण क्या है?"

  • समस्या: सर्जरी केवल तथ्यों को जानने के बारे में नहीं है। यह प्रक्रियात्मक तर्क (procedural reasoning) के बारे में है। यह कठिन निर्णय लेने के बारे में है जब दो विकल्प दोनों अच्छे दिख रहे हों, "क्या होगा अगर" वाली स्थितियों को संभालना, और यह समझना कि कभी-कभी उत्तर यह होता है कि "यह न करें।"
  • कमी: मौजूदा परीक्षण वास्तव में यह जांच नहीं कर पाते थे कि क्या एक AI ऑपरेटिंग रूम की जटिल, निर्णय-प्रधान वास्तविकता को संभाल सकता है। वे बहुत अधिक विजुअल चीजों (जैसे एक्स-रे देखना) या सामान्य चिकित्सा ज्ञान पर केंद्रित थे, जिससे सर्जरी के विशिष्ट "कैसे करें" वाले तर्क छूट रहे थे।

2. समाधान: SurgiQ ("सर्जन की ट्रिविया नाइट")

लेखकों ने SurgiQ बनाया है, जो 13,055 बहुविकल्पीय प्रश्नों (multiple-choice questions) का एक विशाल डेटासेट है। इसे एक "सर्जन की ट्रिविया नाइट" के लिए एक विशाल प्रश्न बैंक के रूप में समझें।

  • सामग्री (Ingredients): उन्होंने इन्हें केवल मनगढ़ंत नहीं बनाया। उन्होंने एक स्मार्ट AI (Gemini) को वास्तविक सर्जिकल टेक्स्टबुक्स, ओपन रिसर्च पेपर्स और परीक्षा सामग्री के हजारों पन्ने दिए। फिर उस AI ने उस टेक्स्ट के आधार पर प्रश्न लिखे।
  • गुणवत्ता नियंत्रण (Quality Control): टेस्ट जारी करने से पहले, उन्होंने वास्तविक मानव डॉक्टरों से 300 रैंडम प्रश्नों की समीक्षा करवाई। लगभग 92% उत्तर चिकित्सकीय रूप से सही थे, और 90% स्पष्ट थे। यह ऐसा है जैसे प्रोफेसरों का एक पैनल छात्रों को परीक्षा देने देने से पहले टेस्ट को ग्रेड करता है।
  • विविधता: यह टेस्ट केवल एक प्रकार का प्रश्न नहीं है। इसमें चार फ्लेवर हैं:
    1. केस-आधारित (Case-based): "यहाँ एक मरीज है जिसके ये लक्षण हैं; आप क्या करेंगे?" (एक कहानी वाले सवाल की तरह)।
    2. तर्क (Reasoning): "यह प्रक्रिया दूसरे की तुलना में बेहतर क्यों है?" (इसके लिए तर्क की आवश्यकता है)।
    3. सर्वश्रेष्ठ-विकल्प (Best-option): "यहाँ तीन अच्छे विचार हैं; इस विशिष्ट स्थिति के लिए सबसे अच्छा कौन सा है?" (सबसे कठिन प्रकार)।
    4. नकारात्मक (Negative): "इनमें से कौन सा कथन सत्य नहीं है?" (ट्रिकी लॉजिक)।

3. प्रयोग: "AI ओलंपिक्स"

शोधकर्ताओं ने 35 अलग-अलग AI मॉडल्स (सामान्य और विशेष रूप से चिकित्सा के लिए प्रशिक्षित दोनों) को यह SurgiQ परीक्षा दी। उन्होंने AI को चैट करने या हिंट मांगने की अनुमति नहीं दी; उन्होंने बस प्रश्न दिया और उत्तर मांगा।

परिणाम आश्चर्यजनक थे:

  • द अंडरडॉग्स (The Underdogs): कई छोटे AI मॉडल्स का स्कोर लगभग 25% रहा। चूंकि चार विकल्प होते हैं, इसलिए यह मूल रूप से रैंडम अनुमान लगाने जैसा है। वे जटिलता को नहीं संभाल सके।
  • मेडिकल स्पेशलिस्ट्स: आप सोच सकते हैं कि चिकित्सा पुस्तकों पर विशेष रूप रूप से प्रशिक्षित AI जीत जाएगा। लेकिन अक्सर, वे नहीं जीते। वे शब्दावली तो जानते थे लेकिन जटिल निर्णय लेने में संघर्ष कर रहे थे।
  • विजेता: सबसे अच्छा प्रदर्शन करने वाले वास्तव में सामान्य-उद्देश्य वाले मॉडल्स (जैसे Qwen2.5) थे। ये वे AI हैं जो इंटरनेट पर मौजूद सब कुछ पर प्रशिक्षित हैं, न कि केवल चिकित्सा पर। इनका स्कोर लगभग 68% था।
    • सीख: "मेडिकल एक्सपर्ट" होना ही काफी नहीं है। एक अच्छे सर्जिकल AI के लिए, पहले व्यापक तर्क कौशल (broad reasoning skills) की आवश्यकता होती है। यह वैसा ही है जैसे एक महान शतरंज खिलाड़ी को केवल शुरुआती चालों को याद करने के बजाय रणनीति समझने की आवश्यकता होती है।

4. पकड़: आत्मविश्वास बनाम वास्तविकता

यहाँ एक बड़ी बात है:

  • "कॉन्फिडेंट गलत" (Confident Wrong) की समस्या: पेपर में पाया गया कि जब AI ने कोई प्रश्न गलत किया, तो वह अक्सर अपने गलत उत्तर के बारे में बहुत आत्मविश्वासी था।
  • उपमा: कल्पना कीजिए कि एक छात्र हाथ उठाकर कहता है, "मुझे 100% यकीन है कि उत्तर B है!" जबकि उत्तर वास्तव में C है। सर्जरी में, इस तरह का अति-आत्मविश्वास खतरनाक है। AI हमेशा एक "तर्कसंगत दिखने वाले" गलत उत्तर और सही उत्तर के बीच अंतर नहीं कर पाता है।

5. इसका क्या अर्थ है (और क्या नहीं)

लेखक बहुत स्पष्ट हैं कि SurgiQ क्या है और क्या नहीं है:

  • यह क्या है: यह मापने के लिए एक शोध उपकरण है कि AI का टेक्स्ट-आधारित सर्जिकल तर्क कितना अच्छा है। यह डेवलपर्स को यह देखने में मदद करता है कि उनके मॉडल्स कहाँ कमजोर हैं।
  • यह क्या नहीं है: यह कहने के लिए टेस्ट नहीं है कि "यह AI मानव पर ऑपरेशन करने के लिए तैयार है।"
    • पेपर स्पष्ट रूप से कहता है: इसका उपयोग वास्तविक रोगी देखभाल के लिए न करें। सर्जरी में मरीज को देखना, ऊतकों (tissue) को महसूस करना और अप्रत्याशित रक्तस्राव पर प्रतिक्रिया देना शामिल है—ऐसी चीजें जिन्हें टेक्स्ट-आधारित क्विज़ टेस्ट नहीं कर सकता।
    • AI अभी भी एक छात्र है, डॉक्टर नहीं।

सारांश

SurgiQ सर्जरी में AI के लिए एक विशाल, उच्च-गुणवत्ता वाला "फाइनल एग्जाम" है। इसने खुलासा किया है कि हालांकि AI बेहतर हो रहा है, फिर भी वह वास्तविक सर्जरी के जटिल, "सर्वश्रेष्ठ-विकल्प-चुनने" वाले तर्क के साथ संघर्ष करता है। वर्तमान में सबसे अच्छा AI एक सामान्य बुद्धिमान (general smart-aleck) है, न कि एक विशेष मेडिकल बॉट, लेकिन सबसे स्मार्ट AI भी आत्मविश्वासी गलतियाँ करता है। हमें उन्हें किसी भी मरीज के पास भेजने से पहले उन्हें और प्रशिक्षित करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →